WAIC 2026 世界模型全景盘点:技术共识、落地初探、元年开考

WAIC 2026 世界模型全景盘点:技术共识、落地初探、元年开考

2026世界人工智能大会(WAIC 2026)近日落下帷幕。展会总面积首破10万平方米,参展企业达1100余家,展出前沿展品3000余项,首发产品超300款,现场观众超过40万人次。在热闹的数据背后,一个核心变量无处不在——世界模型

主论坛为其单设圆桌,六家头部企业首次同台,创业公司将其置于展台C位,诺奖得主与学术大牛将其列入演讲核心。从机器人到工业制造,从影视生成到教育应用,世界模型已成为本届WAIC最火热的概念。

为什么是2026年?

世界模型的概念并非新生事物。早在上世纪90年代,Jürgen Schmidhuber 就设想过让智能体“在脑中构建一个世界”;2018年,他与 David Ha 发表同名论文《World Models》,提出让 AI 先在模拟环境里演练,再去现实世界执行任务。此后数年,这一概念更多停留在论文和自动驾驶仿真器中。

2026年世界模型的“复兴”,源于 AI 迈向物理世界的两道核心门槛:

  1. 数据缺口:大语言模型可以调用整个互联网文本,但机器人所需的物理交互数据获取成本极高,规模严重不足。
  2. 试错成本:AI 在数字世界犯错仅需重新生成,而在物理世界犯错则意味着摔碎的碗、撞坏的车或停掉的产线。

世界模型通过让 AI 在虚拟环境中推演和预判后果,将试错成本压缩至接近电费水平,从而“对症下药”。

论坛共识:从“生成”转向“行动前的理解”

主论坛:因果推理是核心

在主论坛圆桌“从虚拟到现实:世界模型如何驱动具身智能?”中,多位嘉宾对世界模型的本质进行了定义:

  • 它石智航创始人兼CEO陈亦伦认为,真正的世界模型应同时理解动作与环境之间的因果关系,不仅回答“世界会变成什么样”,更要回答“我做了这个动作之后,世界会怎样”。
  • 智元合伙人、觅蜂科技董事长兼CEO姚卯青指出,世界模型的本质是能够理解物理世界运行规律的AI系统,核心功能是预测下一个状态。他将其必备能力拆解为多模态融合理解、物理规律掌握(含动力学与时空理解)、因果推理。他判断,未来三年具身智能会先在“高频刚需、环境可控、确定性强”的场景跑通。
  • 亮源新创CEO姜旭进一步细化任务,指出当前技术短板在于“理解”与“生成”两种能力难以统一。

三位嘉宾的切入点不同,但指向同一结论:世界模型的关键不是“生成”,而是“行动前的理解”。

姚卯青提出了数字智能与物理智能的本质差异:“数字智能是‘知识系统’,物理智能是‘经验系统’。”语言模型靠“读”互联网长大,而物理智能需要一个可以反复演练、低成本犯错的“经验发生器”,世界模型正是该发生器。

“六小龙”与评测标准共建

7月19日举行的“世界模型驱动物理AI从理解到执行”论坛上,大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人六家企业首次同台。

针对行业缺乏统一评价标准的痛点,论坛发布了 Physical IQ 物智。该平台由上海人工智能行业协会、河套学院、中国信通院华东分院联合发起,20余家机构共建,提供了首个多场景、多本体、多任务的统一标尺。

六位技术掌舵人围绕评价指标达成三个层次的共识:
* 生成智能:物理合理性;
* 认知智能:泛化性、反事实预测、长期表示能力、预测精度;
* 物理智能:动作准确性、时效性、决策增益、真机验证。

此外,诺贝尔经济学奖得主 Thomas J. Sargent 从“理性预期”理论出发指出,理性预期均衡本质上就是所有主体共享的世界模型。这意味着好的世界模型应具备可共享性,引导多个AI主体的行为收敛到对物理环境的统一认知。

学术突破与产业预判

中国科学院院士、南京大学副校长周志华将世界模型划分为感知层、理解层与决策层,并指出决策层面临两大理论瓶颈:“多步推演复合误差平方级放大”与“样本复杂度过高”。其团队通过分布匹配技术,将推演误差从平方级压至线性级;通过逆向运用贝尔曼方程,将所需样本量降至原来的根号T分之一。

昆仑万维董事长兼CEO方汉正式宣布2026年为“世界模型元年”,并预判游戏行业将率先被改变,AI音乐与视频工具将成为大众创作工具。

展台观察:从Demo演示走向真实交互

今年WAIC展台的显著变化是:企业不再仅播放渲染视频,而是拿出了能跑、能动、可互动的原型系统。

  • 蚂蚁灵波:展示了支持小时级实时生成的世界模型 LingBot-World 2.0 及空间感知模型 LingBot-Depth 2.0。其智慧药房场景中,三台不同构型机器人共享一颗“通用大脑” LingBot-VLA,目前正于北京一家国大药房进行验证。
  • 它石智航:发布具身智能原生基座模型 AWE 3.5,首次面向公众开放人与具身模型的实时交互体验。
  • 极佳视界:展示了从 DriveDreamer(自动驾驶)到 GigaBrain(具身智能)的完整矩阵,还原了家庭场景(拾光 S1)与工业场景(Maker H01)的真机执行链路。
  • 大晓机器人:发布开悟世界模型 3.1,展示了机器人倾倒咖啡、分类收纳零食及处理柔性布料的实时演示。
  • X-Era 拓元智慧:展示了机器人穿鞋带和封快递盒的场景,强调跨场景迁移能力。据悉其世界模型已实现营收破千万。
  • 千寻智能:通过1:1复刻的居家客厅展示机器人 Moz1 整理客厅的能力,其模型基于高多样性“脏数据”训练,具备应对突发杂物变化的应变能力。
  • 生数科技 & 爱诗科技:分别展示了实时交互模型 Vidu S1 和全球首个实时视频游戏引擎 PixVerse Game,聚焦影视与游戏领域的创作自由。
  • 索辰科技:展示物理 AI 一体机,模拟气流、应力、电磁场等真实物理变化,走高精度物理仿真路线。

相比之下,大厂如腾讯仅设置小区域展示混元世界模型 Demo,态度相对克制。

三大观察:路线、数据与标准

1. 路线之争:殊途同归,终点叫“因果”

尽管此前业界对世界模型的讨论各执一词,但从本次大会的嘉宾定义、六小龙共识及周志华院士的理论框架来看,行业终点的共识出奇一致:都要抵达“因果理解”——即知道动作引发的后果以及世界变化的逻辑。

2. 数据成为核心变量

几乎所有企业在谈及世界模型时都将“数据”摆在首位,但在获取路径上存在分歧:
* 它石智航:陈亦伦指出自动驾驶做到工业级可用约需百万小时数据,复杂具身操作需千万小时级。
* 大晓机器人:提出“信息密度定律”,发布以人为中心的环境式数据采集方案。
* 昆仑万维:打造自动化数据生产管线,产出500万以上高质量视频切片及1万小时以上有效训练数据。
* 路线分歧:真实采集 vs 仿真合成?喂“脏数据” vs 喂干净数据?昂贵的遥操作 vs 经济的 UMI 数据?

3. 元年开考:评价标准切换

方汉提出的“元年”论断,其深层含义不在于技术已完全成熟,而在于评价标准发生了切换

过去,LIBERO 等仿真评测曾是具身模型的“高考”,但随着刷分现象出现,高分与真实能力的相关性变得可疑。随着 Physical IQ 物智等统一标尺的建立,行业开始自建考场。考场的规则正确了,世界模型才能沿着正确的方向做技术跃迁。

结语

WAIC 2026 展示了世界模型从“概念激辩”向“技术原型验证”的加速演进。但热度之外仍需冷静:物理因果一致性短板尚在,千万小时级数据缺口未填,统一评测体系刚刚动工,展台上的演示距离商业闭环仍有工程距离。

无论路线如何分化,有一点清晰:世界模型的终点绝非生成世界,而是进入世界。AI 进入真实世界的门票,只能靠理解真实的物理因果来换取。

(来源:AI科技评论)