新闻
证实
证实5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路
配图:证实5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路
新闻导读
证实5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路讲“模型不是现实本身”这种内容不多,却极有价值。配图标注清楚,动画示意服务理解,不靠夸张音效留人。广告若有也相对克制,注意力还能留给内容本身。科学叙述尽量接得住更多人的生活,而不是只写给同温层。真实路径走下来,优点大多能稳定复现。信息获取负担低,却不轻飘。
Parascandolo 认为,人类能够重新组合已有知识,识别关键不变量,建立抽象模型,并完成长时程规划。人工神经网络在这些方面仍有很大提升空间。
报告最后,他提出了三个未来研究方向:神经网络中的开放式推理、人工神经网络中尚未探索的自由度,以及在强化学习中将语言作为推理载体,以提高样本效率。
Parascandolo 将其定义为:模型可以投入更多时间和计算,持续修正答案。问题越难,模型就应该多想几步,并让额外计算转化为更好的结果。
当时的标准 Transformer 拥有固定的网络深度,每个 token 经历的前向计算量基本确定,问题难度却与输入长度没有稳定关系。一个问题可以很长,答案却很简单。另一个问题只有一句话,可能需要多轮拆解和验证。
RNN 看起来更加适合这种任务。它可以反复运行,理论上能够获得任意长度的思考时间。Parascandolo 在 PPT 中展示的曲线却表明,RNN 通常只在训练时见过的推理步数附近表现最好,继续增加循环次数,准确率反而可能下降。
当时效果最强的多步规划,大量依赖模型预测控制和蒙特卡洛树搜索。神经网络负责预测环境或评估价值,外部搜索算法负责展开未来路径。Parascandolo 希望进一步将长程推理能力融入神经网络。
Parascandolo 用经典游戏《蒙特祖玛的复仇》举例。一个从零开始训练的强化学习 Agent,需要尝试大量状态和动作组合,很多正确操作本身并不复杂,Agent 真正缺少的,是对「什么行为更合理」的判断。
GPT 已经从文本中吸收了大量世界知识,语言可以帮助模型描述环境、理解目标、拆解任务和生成高层计划,也能大幅缩小搜索范围。
Parascandolo 提出的第三个方向是,人工智能系统可以重置任务,回到记忆中的任意状态,构造反事实场景,还可以调整模拟器中的时间、重力和观察结果。系统甚至可以直接读取、复制和修改自身的激活值与神经网络权重。
这相当于把学习过程本身也纳入 Agent 的操作空间。它可以开展刻意练习,生成特殊训练场景,迁移已有知识,并针对失败轨迹重新学习。
Parascandolo 认为,人类只看几只狗就能学会识别,并不代表此前没有积累经验。漫长的进化已经把祖先接触世界的经验,沉淀为人类大脑的结构和归纳偏置。
按照这一视角,神经网络的大规模预训练可以类比生物进化,模型微调和上下文学习才更接近个体一生中的学习。GPT-3读过的文本远超任何个人,但其预训练承担了压缩海量经验、塑造高效学习能力的作用。因此,不能直接拿模型的全部预训练数据,与一个人出生后的少量学习样本进行比较。
这种理解也意味着,继续扩大数据和算力仍可能带来明显提升。他类比的是两者发挥的作用,并没有认为梯度下降与生物进化的具体机制相同。
博士期间,他在山景城的 Google X 和伦敦的 DeepMind 各做过一段实习,前者参与超大规模模拟器上的自动化设计研究,后者参与分治蒙特卡洛树搜索研究。
2021 年 9 月博士毕业,他直接加入 OpenAI,最初进入 John Schulman 领导的强化学习团队,随后转向 Mark Chen 所在的算法团队,又加入 Jerry Tworek 带领的(草莓)团队。草莓团队,正是 o1 项目的内部代号。
2023 年,他参与 GPT-4 研发,并组建了一支继续研究推理的新团队。后来又参与了 OpenAI o1 和 o3 的基础研究,推动奖励建模、环境构建和通用推理算法的扩展。其中一部分算法描述,至今仍被他用黑块遮住。
网友观点
我把常用主题打了标签,主页干净得像私人杂志。配图标注清楚,动画示意服务理解,不靠夸张音效留人。广告若有也相对克制,注意力还能留给内容本身。成熟的产品气质比花哨运营更让人心甘情愿留下。把核心求知需求解决得很扎实。细节体验也在线,长时间用不会觉得被敷衍。
免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://fshaofeng.com.cn/?m/post/20260806-655.scm

评论区
热门讨论 · 占位展示期待你的精彩发言。