WAIC 2026具身智能华山论剑:行业共识与路线分歧辨析
核心事件:2026年世界人工智能大会(WAIC)期间,「智启具身论坛」在上海召开,Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics等海外机构,与智元机器人、清华大学、腾讯Robotics X等学术与产业力量同台,围绕具身智能技术路线展开激烈讨论。
一、各家最新成果速览
| 机构 | 核心成果 | 关键数据 |
|---|---|---|
| 智元机器人 | GO-2模型 | LIBERO基准98.7%,刷新SOTA |
| GE-Sim 2.0世界模型 | WorldArena全球排名第一 | |
| 龙旗南昌产线 | 稳定运行3个月,成功率99.99% | |
| 清华大学 | TUTOR方法 | 长程任务自主成功率从8.3%提升至35% |
| Physical Intelligence | π0.7模型 | 开箱即通吃多任务,支持零样本迁移 |
| Genesis | 人手数据手套方案 | 仿真速度号称快1000倍 |
| Dyna Robotics | DYNA-1 | 折餐巾成功率99.4%,24小时完成85+张 |
信息来源:WAIC 2026智启具身论坛报道
二、行业隐秘共识:拼「经验」规模化
尽管各家技术路线各异,但论坛呈现一个隐秘共识:下一阶段不再拼Demo花哨,而是拼谁能将「经验」规模化。
智元合伙人姚卯青指出一个关键数字差距:当前物理AI的数据量仅为大语言模型的两万分之一。要达到物理世界的「ChatGPT时刻」——即机器人能够在真实世界中开箱即用、完成日常任务并理解开放式指令——至少需要1亿小时级别的真实交互数据。
三、物理智能的三道墙
姚卯青将物理智能Scaling面临的挑战概括为三道墙:
- 数据墙:真机遥操作数据采集成本极高
- 表征墙:物理世界缺乏如语言那样的通用表征体系
- 闭环墙:从感知到执行的完整闭环难以实现
他提出一个关键概念——「经验密度」:仅录制画面和关节角度只是「一小时录像」;同时记录任务目标、物体状态、动作质量、错误原因及结果,才叫「一小时经验」。数据规模回答「见过多少」,经验密度回答「学到多少」,两者之间存在一整条产业鸿沟。
四、三场核心争论
争论一:数据从哪来?
| 路线 | 代表机构 | 核心策略 |
|---|---|---|
| 全都要 | 智元机器人 | 开源AGIBOT WORLD百万真机数据集,累计下载120万余次 |
| 少而精 | Dyna Robotics | 20万小时打底,主打「1小时内后训练即可迁移到新任务」 |
| 轻巧采集 | Genesis | 用接近人手的机器手配数据手套,从日常家务中采集 |
| 部署数据 | Sunday Robotics | 短期无本体数据杠杆最高,长期部署数据成终极数据源 |
清华大学副研究员苏航提醒:人手不是夹爪。人类拥有全局视野、触觉和常识,机器人往往只能从腕部相机看到有限范围。多塞人类动作不等于机器人学会人类技能,数据多不等于数据能用。
争论二:粗数据还是精数据?
- PI路线:押注最脏场景,让机器人当咖啡师,要求90%以上可靠性。成功和翻车一起录制,逐段贴标签,从「噪声」变「错题集」。
- Dyna路线:嫌贴标签不够,训练奖励模型让机器人自评表现,靠持续学习吸收失败经验。
争论三:仿真还是真机?
- Genesis:以软件速度进化,号称快1000倍
- 智元:GE-Sim 2.0不只生成视频,还加入本体状态预测和任务结果判断,在H100上25帧推演仅需2.3秒
- Dyna & PI:更相信真机数据,Dyna将机器人搬进真餐厅,PI靠真实数据飞轮打磨
争议焦点在于:仿真中极小偏差可能在强化学习中被放大,机器人可能在虚拟世界「钻漏洞」,一落地就被现实教做人。
五、圆桌激辩:六大关键问题
Q1:ChatGPT时刻还有多远?
六位专家给出惊人一致的共识区间:不到5年
| 嘉宾 | 预测时间 |
|---|---|
| 姚卯青(智元机器人) | 2年 |
| 赵子豪(Sunday Robotics) | 少于3年 |
| 张正友(腾讯Robotics X) | 3-5年 |
| 马也骋(Dyna Robotics) | 4年 |
| 任至意(Physical Intelligence) | 4年 |
| 徐丹飞 | 5年 |
平均来看,顶尖专家认为物理AI的「ChatGPT时刻」约在3-4年后到来。
Q2:VLA已死?
- PI任至意:「目前还没看到哪家做出比π0.7更令人印象深刻的demo,VLA可能还没死。」他认为VLA与世界模型不冲突。
- Dyna马也骋:确实从VLA切换到世界动作模型(WAM),在关注鲁棒性和数据效率的场景下更高效。
- 腾讯张正友:整个行业还在起步阶段,远未收敛,不像大语言模型基本范式已确定。
Q3:通用大脑 vs 软硬件全栈?
- Physical Intelligence:倾向先用简单稳定本体快速建立数据与模型基础设施,长期会考虑造更可靠硬件。
- 智元机器人:选择更重的全栈路线,足式、双足、轮式、灵巧手都做,因商业化部署必须面对可靠性、成本、成功率和一致性等严格指标。
- 腾讯张正友:两条路线都可能成立,类比手机行业苹果与Android、PC时代Mac与Windows长期共存。
Q4:大厂vs创业公司谁会赢?
- 张正友建议:创业公司不要做容易被大模型「吞噬」的增量式创新,应聚焦数据和场景这些需要深入耕耘的领域。
- 马也骋补充:机器人策略必须在本地运行,对延迟极其敏感,不像语言模型可云端调用API。即使没有开源模型,机器人公司也必须自研。
- 腾讯选择:只做大脑,不做本体。「我们在硬件上还没成功过,有自知之明。」
六、创业者启示录
1. 数据是核心壁垒,但路径选择决定生死
- 全栈玩家(智元)通过开源百万数据集构建生态
- 垂直玩家(Dyna)靠精耕细作20万小时数据实现高效迁移
- 创业者需根据自身资源选择数据策略,而非盲目堆量
2. 1亿小时门槛意味着什么?
姚卯青给出的1亿小时真实交互数据门槛,对应大语言模型约100万亿Tokens(约100亿小时语料)的差距。这意味着:
- 具身智能数据缺口达1万倍以上
- 当前处于「前Scaling Law」阶段
- 谁先跨越经验密度门槛,谁就掌握下一个临界点
3. 路线选择:做「大脑」还是做「全栈」?
| 维度 | 通用大脑 | 全栈方案 |
|---|---|---|
| 代表 | PI、腾讯 | 智元 |
| 优势 | 研发效率高,易于迭代 | 商业落地可控,可靠性高 |
| 风险 | 依赖硬件伙伴,利润空间被压缩 | 重资产,周期长 |
| 适用 | 研究导向型团队 | 商业化导向型团队 |
4. 创业公司的生存空间
张正友的警告值得所有创业者注意:如果做的事情很容易被纳入大厂基座模型,前景就不会太好。 机器人领域的差异化机会在于:
- 特定场景的深度数据积累
- 本地化策略的超低延迟优化
- 软硬件协同的可靠性工程
七、结语
WAIC 2026具身智能论坛揭示了一个关键信号:物理AI正在以远超预期的速度逼近临界点。
共识在于:
- 「ChatGPT时刻」将在3-5年内到来
- 经验密度比数据规模更重要
- VLA与世界模型将走向融合
分歧在于:
- 数据获取路径(全量vs精选)
- 训练方式(仿真vs真机)
- 商业模式(通用大脑vs全栈方案)
正如张正友所言:「但要踏踏实实去做,这3到5年才有希望。」那道「Scaling Law的物理墙」终将被推倒,而赢家属于那些能在数据、表征、闭环三道墙上找到突破口的人。
本文所有事实、数据和观点均来自WAIC 2026智启具身论坛报道,未经材料外核实的内容均已排除。