WAIC 2026具身智能华山论剑:行业共识与路线分歧辨析

WAIC 2026具身智能华山论剑:行业共识与路线分歧辨析

核心事件:2026年世界人工智能大会(WAIC)期间,「智启具身论坛」在上海召开,Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics等海外机构,与智元机器人、清华大学、腾讯Robotics X等学术与产业力量同台,围绕具身智能技术路线展开激烈讨论。

一、各家最新成果速览

机构 核心成果 关键数据
智元机器人 GO-2模型 LIBERO基准98.7%,刷新SOTA
GE-Sim 2.0世界模型 WorldArena全球排名第一
龙旗南昌产线 稳定运行3个月,成功率99.99%
清华大学 TUTOR方法 长程任务自主成功率从8.3%提升至35%
Physical Intelligence π0.7模型 开箱即通吃多任务,支持零样本迁移
Genesis 人手数据手套方案 仿真速度号称快1000倍
Dyna Robotics DYNA-1 折餐巾成功率99.4%,24小时完成85+张

信息来源:WAIC 2026智启具身论坛报道

二、行业隐秘共识:拼「经验」规模化

尽管各家技术路线各异,但论坛呈现一个隐秘共识:下一阶段不再拼Demo花哨,而是拼谁能将「经验」规模化。

智元合伙人姚卯青指出一个关键数字差距:当前物理AI的数据量仅为大语言模型的两万分之一。要达到物理世界的「ChatGPT时刻」——即机器人能够在真实世界中开箱即用、完成日常任务并理解开放式指令——至少需要1亿小时级别的真实交互数据。

三、物理智能的三道墙

姚卯青将物理智能Scaling面临的挑战概括为三道墙:

  1. 数据墙:真机遥操作数据采集成本极高
  2. 表征墙:物理世界缺乏如语言那样的通用表征体系
  3. 闭环墙:从感知到执行的完整闭环难以实现

他提出一个关键概念——「经验密度」:仅录制画面和关节角度只是「一小时录像」;同时记录任务目标、物体状态、动作质量、错误原因及结果,才叫「一小时经验」。数据规模回答「见过多少」,经验密度回答「学到多少」,两者之间存在一整条产业鸿沟。

四、三场核心争论

争论一:数据从哪来?

路线 代表机构 核心策略
全都要 智元机器人 开源AGIBOT WORLD百万真机数据集,累计下载120万余次
少而精 Dyna Robotics 20万小时打底,主打「1小时内后训练即可迁移到新任务」
轻巧采集 Genesis 用接近人手的机器手配数据手套,从日常家务中采集
部署数据 Sunday Robotics 短期无本体数据杠杆最高,长期部署数据成终极数据源

清华大学副研究员苏航提醒:人手不是夹爪。人类拥有全局视野、触觉和常识,机器人往往只能从腕部相机看到有限范围。多塞人类动作不等于机器人学会人类技能,数据多不等于数据能用

争论二:粗数据还是精数据?

  • PI路线:押注最脏场景,让机器人当咖啡师,要求90%以上可靠性。成功和翻车一起录制,逐段贴标签,从「噪声」变「错题集」。
  • Dyna路线:嫌贴标签不够,训练奖励模型让机器人自评表现,靠持续学习吸收失败经验。

争论三:仿真还是真机?

  • Genesis:以软件速度进化,号称快1000倍
  • 智元:GE-Sim 2.0不只生成视频,还加入本体状态预测和任务结果判断,在H100上25帧推演仅需2.3秒
  • Dyna & PI:更相信真机数据,Dyna将机器人搬进真餐厅,PI靠真实数据飞轮打磨

争议焦点在于:仿真中极小偏差可能在强化学习中被放大,机器人可能在虚拟世界「钻漏洞」,一落地就被现实教做人。

五、圆桌激辩:六大关键问题

Q1:ChatGPT时刻还有多远?

六位专家给出惊人一致的共识区间:不到5年

嘉宾 预测时间
姚卯青(智元机器人) 2年
赵子豪(Sunday Robotics) 少于3年
张正友(腾讯Robotics X) 3-5年
马也骋(Dyna Robotics) 4年
任至意(Physical Intelligence) 4年
徐丹飞 5年

平均来看,顶尖专家认为物理AI的「ChatGPT时刻」约在3-4年后到来。

Q2:VLA已死?

  • PI任至意:「目前还没看到哪家做出比π0.7更令人印象深刻的demo,VLA可能还没死。」他认为VLA与世界模型不冲突。
  • Dyna马也骋:确实从VLA切换到世界动作模型(WAM),在关注鲁棒性和数据效率的场景下更高效。
  • 腾讯张正友:整个行业还在起步阶段,远未收敛,不像大语言模型基本范式已确定。

Q3:通用大脑 vs 软硬件全栈?

  • Physical Intelligence:倾向先用简单稳定本体快速建立数据与模型基础设施,长期会考虑造更可靠硬件。
  • 智元机器人:选择更重的全栈路线,足式、双足、轮式、灵巧手都做,因商业化部署必须面对可靠性、成本、成功率和一致性等严格指标。
  • 腾讯张正友:两条路线都可能成立,类比手机行业苹果与Android、PC时代Mac与Windows长期共存。

Q4:大厂vs创业公司谁会赢?

  • 张正友建议:创业公司不要做容易被大模型「吞噬」的增量式创新,应聚焦数据和场景这些需要深入耕耘的领域。
  • 马也骋补充:机器人策略必须在本地运行,对延迟极其敏感,不像语言模型可云端调用API。即使没有开源模型,机器人公司也必须自研。
  • 腾讯选择:只做大脑,不做本体。「我们在硬件上还没成功过,有自知之明。」

六、创业者启示录

1. 数据是核心壁垒,但路径选择决定生死

  • 全栈玩家(智元)通过开源百万数据集构建生态
  • 垂直玩家(Dyna)靠精耕细作20万小时数据实现高效迁移
  • 创业者需根据自身资源选择数据策略,而非盲目堆量

2. 1亿小时门槛意味着什么?

姚卯青给出的1亿小时真实交互数据门槛,对应大语言模型约100万亿Tokens(约100亿小时语料)的差距。这意味着:

  • 具身智能数据缺口达1万倍以上
  • 当前处于「前Scaling Law」阶段
  • 谁先跨越经验密度门槛,谁就掌握下一个临界点

3. 路线选择:做「大脑」还是做「全栈」?

维度 通用大脑 全栈方案
代表 PI、腾讯 智元
优势 研发效率高,易于迭代 商业落地可控,可靠性高
风险 依赖硬件伙伴,利润空间被压缩 重资产,周期长
适用 研究导向型团队 商业化导向型团队

4. 创业公司的生存空间

张正友的警告值得所有创业者注意:如果做的事情很容易被纳入大厂基座模型,前景就不会太好。 机器人领域的差异化机会在于:

  • 特定场景的深度数据积累
  • 本地化策略的超低延迟优化
  • 软硬件协同的可靠性工程

七、结语

WAIC 2026具身智能论坛揭示了一个关键信号:物理AI正在以远超预期的速度逼近临界点。

共识在于:
- 「ChatGPT时刻」将在3-5年内到来
- 经验密度比数据规模更重要
- VLA与世界模型将走向融合

分歧在于:
- 数据获取路径(全量vs精选)
- 训练方式(仿真vs真机)
- 商业模式(通用大脑vs全栈方案)

正如张正友所言:「但要踏踏实实去做,这3到5年才有希望。」那道「Scaling Law的物理墙」终将被推倒,而赢家属于那些能在数据、表征、闭环三道墙上找到突破口的人。


本文所有事实、数据和观点均来自WAIC 2026智启具身论坛报道,未经材料外核实的内容均已排除。