图灵奖得主萨顿 WAIC 2026 演讲:大模型范式触顶,AI 需走向“自身经验学习”

萨顿的"苦涩教训":当强化学习之父对大模型泼冷水

摘要:2024 年图灵奖得主理查德·萨顿在 WAIC 2026 上提出,当前大语言模型的发展路径已接近极限,AI 需要像婴儿一样通过"自身经验"学习。本文深入分析其核心论点、技术可行性及行业影响。


一、核心论点拆解:萨顿到底在批评什么?

1.1 "知识搬运工"的本质

萨顿指出当前大模型的核心局限在于:

  • 预测而非理解:模型只是从海量人类文本中提取统计规律,预测下一个词的出现概率
  • 知识边界固化:训练数据耗尽后,模型无法生成新的知识
  • 缺乏自我验证:没有奖励信号机制,无法区分真假

关键洞察:这不是在否定大模型的价值,而是在指出其范式天花板。就像汽车跑得再快,如果只能沿着既定路线行驶,就无法探索新大陆。

1.2 与《苦涩的教训》的历史闭环

2019 年萨顿提出的"The Bitter Lesson"核心观点是:

时代 方法 结果
早期 AI 依赖人类知识设计规则 效果有限,难以扩展
深度学习时代 堆算力 + 大数据 突破性进展
当前瓶颈 继续堆数据 + 算力 边际效益递减

萨顿的逻辑一致性在于:凡是依赖人类知识的方案最终都会遇到瓶颈,真正突破来自让系统从经验中学习。


二、技术可行性分析:从 AlphaGo 到 Oak Lab

2.1 先例验证:强化学习的成功路径

萨顿提到的案例具有说服力:

AlphaGo (2016) → 自我对弈 3000 万局 → 击败人类冠军
AlphaProof (2024) → 自动生成证明 → 解决 IMO 级别难题

共同特征
- 明确的奖励信号(赢/输、证明正确性)
- 自我交互产生的海量经验
- 无需人类标注数据

2.2 Oak Lab 的技术挑战

目标 难度评估 关键问题
万亿参数智能体 ⭐⭐⭐⭐ 现有最大模型约 1-2 万亿,但那是静态的
实时学习与规划 ⭐⭐⭐⭐⭐ 推理时更新权重计算复杂度极高
20W 功耗 ⭐⭐⭐⭐⭐ 人脑 ~20W,但只有 860 亿神经元;当前 GPU 集群功耗以 MW 计

最核心的技术鸿沟
- 大模型的"学习"是离线训练,参数固定
- 萨顿设想的 AI 需要在线持续学习,同时保持稳定性
- 这涉及到灾难性遗忘元学习神经符号系统等多个未解难题


三、行业影响:范式转移的前夜?

3.1 对主流 AI 路线的挑战

如果萨顿的观点成立,意味着:

当前主流路线 (LLM + RAG + Fine-tuning)
        ↓
    边际效益递减
        ↓
    需要新范式
        ↓
经验学习 + 自主规划 + 实时适应

可能受影响的企业/领域
- 依赖数据标注的公司:如果 AI 能自主学习,标注成本将大幅降低
- 传统软件工程:自主智能体可能替代大量规则编码工作
- 教育行业:个性化自适应学习系统将成为可能

3.2 投资风向的可能变化

当前热点 潜在转向
更大模型 更高效的学习算法
更多数据 更好的奖励机制设计
应用层创新 基础架构重构

四、理性看待:乐观与审慎的平衡

4.1 萨顿论点的优势

逻辑自洽:与其历史工作高度一致
有成功案例:AlphaGo/AlphaProof 验证了路径可行性
指出真问题:幻觉、知识截止确实是 LLM 的痛点

4.2 需要警惕的方面

⚠️ 时间线过于乐观:20W 功耗的万亿参数实时学习系统,可能需要 10 年甚至更久
⚠️ 忽略混合路径:也许 LLM + RLHF + 工具调用 已经足够好,不需要完全替换
⚠️ 商业不确定性:Oak Lab 作为初创公司,资源远少于 OpenAI/Google

4.3 我的判断

短期(1-3 年):LLM 仍将是主流,但会加入更多自主交互能力
中期(3-7 年):出现 LLM + 强化学习的混合架构,在特定领域超越纯 LLM
长期(7-15 年):基于经验的 AI 可能在通用智能任务上取得突破


五、给从业者的建议

5.1 产品经理

  • 关注"智能体"方向:从"对话界面"转向"任务执行界面"
  • 设计反馈机制:为 AI 系统建立清晰的奖励/惩罚信号
  • 接受不完美:早期经验学习系统会有更多错误,需要容忍度

5.2 工程师

  • 学习强化学习基础:即使不做 RL,也要理解其思想
  • 关注效率优化:20W 功耗的目标倒逼绿色 AI 发展
  • 实验精神:在现有 LLM 基础上尝试在线微调和小规模 RL

5.3 投资者

  • 跟踪 Oak Lab 进展:作为风向标,但不押注单一公司
  • 多元化布局:既投 LLM 应用,也投 RL/Agent 基础设施
  • 关注人才流动:萨顿的动向可能带动一批强化学习人才创业

结语:AI 的"青春期"

萨顿的演讲让人联想到人类成长过程:

婴儿期 (感知 - 运动学习) → 儿童期 (模仿 - 游戏) → 青春期 (抽象思维 - 符号推理)
    ↑                                                        ↑
  AlphaGo/Oak Lab 方向                           当前 LLM 方向

当前的大模型更像是进入了"青春期"——能言善辩但偶尔胡言乱语,知识渊博但缺乏真正的理解。萨顿提醒我们,真正的智能不是记住多少知识,而是能从经验中持续成长。

这场辩论没有简单的对错,而是关于AI 应该往哪里走的根本性问题。无论答案是什么,SA 都正在加速到来。


延伸思考:如果你来设计一个"从经验学习"的 AI 系统,你会如何定义它的"奖励信号"?欢迎在评论区分享你的想法。