WAIC 2026:它石智航首发AWE 3.5,具身Scaling全面释放
2026年世界人工智能大会(WAIC)的展馆里,具身智能展区的人潮明显比别处更拥挤。据量子位报道,今年参展的具身智能企业超过200家,而它石智航的展台前更是围满了人——原因是一条1:1还原的环形线束流水线直接搬进了会场。
在这里,多台机器人集群协同作业,流水线轮转线束板,每个工位同时装配不同的线型。它石智航也在这一背景下,正式发布了具身原生基座模型AWE 3.5。
从“演示”到“产线”:打通预训练到后训练的闭环
过去很长一段时间,具身智能的展示多停留在实验室Demo阶段。但这次,它石智航把一条完整的自动化产线搬到了观众面前。
据它石首席科学家丁文超透露,现场效率提升非常显著,甚至出现了“不敢让它一直干活,怕机器人干太快给料用完了”的情况。支撑这条全自动化产线的,正是新发布的AWE 3.5。
丁文超表示,这是具身智能领域第一个真正打通预训练到后训练完整范式的原生模型。
“One Model”架构:从第一性原理重构具身大脑
AWE 3.5采用了它石智航称为“One Model”的架构设计。
这个架构的核心思路很直接:从预训练阶段开始,就把视觉、语言、动作等多种模态一起喂给模型。同一套架构,既能输出动作,也能预测未来。
更妙的是,模型本身不变,只改变输入输出的组合方式,就能切换出完全不同的“人格”:
- Base Policy:视觉到动作,负责制定策略、发出指令
- Action Condition World Model:以动作为条件预测未来视觉,负责预测环境变化
两者交互在一起,形成一套完整的强化学习闭环。这意味着,模型成了自己的“仿真器”,无需再手工搭建仿真环境。预训练建立通用物理交互能力,后训练则在模型内部的世界里自我对弈、自我强化,形成自闭环。
百万小时数据与“小时级”新任务适配
AWE 3.5的训练基于超百万小时human-centric数据。
这一量级与目前市面上大多数视频生成模型的训练数据规模相当,也与自动驾驶所需数据量处于同一量级。但百万小时不是简单的堆量游戏。具身数据的价值分布极不均匀,如何从百万小时中筛出真正高质量的部分,已成为比采集本身更紧迫的问题。
好在预训练已经足够扎实。据丁文超表示,现在一个新任务只需要小时级别的数据采集就能跑通。这正是One Model架构的前瞻性体现:先建立通用基础能力,再向各个场景分发。
灵巧手进展:12-18个月内看到产业趋势
关于灵巧手技术,行业一直关注度极高。丁文超给出了一个相对乐观的预期:12到18个月内能看到明显的产业趋势。
它石从AWE 3.0之前就开始持续投入自研灵巧手,采用的是Top-Down路径:先梳理需要完成哪些人类动作、匹配哪些人类数据,再反向定义硬件设计。
行业判断:2027年上半年可能出现分水岭
在对话中,丁文超给出了一个大胆的判断:具身Scaling已全面释放。2027年上半年到年中,可能出现分水岭。
评判标准将变得非常直观:机器人到底完成了哪些事情?扩展新任务的速度有多快?成本有多低?
如果一家企业能用AI化的方法实现多场景的规模化落地,就会迅速与其他公司拉开差距。目前投资人和普通用户很难在线下直接接触机器人,大多只能通过视频了解。但在未来12个月内,机器人会真正进入更多大众可触达的场景。
VLA与世界模型:训模型的人不在乎路线之争
今年以来,行业里VLA和世界模型的争论从未停歇。但据量子位了解,真正训模型的人根本不在乎所谓路线之争,最终还是要看是否能优化Action。
- VLA架构:视觉和语言在预训练阶段就紧密耦合,动作模态却要到后训练才通过SFT接入。这相当于一个学生先学了全部理论课,临考试前才开始动手做实验。
- 世界模型:虽然可以利用大规模视频学习表征能力,但互联网视频模型的Attention结构已经在几十万到百万小时的猫狗视频上定型了。直接往具身基座模型里嵌,容易走向两个极端:视频模型原有的幻觉跑进动作策略,导致操作不到位或判断混乱;视觉理解、空间理解和动作永远无法同步。
因此,它石从第一天便毅然选择了另起炉灶——从头训一个原生的具身模型。
现场体验:没有物理引擎的平行世界
2026年被认为是世界模型百家争鸣的元年。这次,它石智航在WAIC给出了最直接的答案:你上手试一试。
现场观众戴上数据采集夹爪,就能和一个由AWE 3.5生成的平行世界展开互动:
- 捏起一块积木,松手,积木像受重力一样落向桌面
- 拖拽手机盒,盒子产生对应的位移和摩擦
- 蜡烛上微弱的火焰,也在模型中被忠实地呈现出来
这些交互没有一行牛顿定律代码,没有碰撞引擎,没有物理结算。所有重力、柔性、碰撞反馈、物体位移……全部由模型从真实数据中学到。
长时记忆与空间理解:被严重低估的能力
在世界模型涌现之外,有一项被严重低估的能力:长时记忆与空间理解。
视频模型有一个难以治愈的缺陷——预测未来的时间一长,物体就容易突然消失、变形,或者在一帧幻觉之后彻底蒸发。究其根本,像素监督本身不鼓励长程物理交互的连续性,无法用于具身训练。
为此,AWE 3.5依托human-centric数据专门强化了模型结构,让它显式学习长时记忆和长时序空间理解,在数分钟的连续、交互闭环推演中保持环境稳定。在此基础上,后训练可以从连续过程中切出多个动作片段,而不用担心环境在下一秒崩掉。
在世界模型中做强化学习,成为了可能。
结语:从"能动"到"能干"
2024年,大家看到机器人本体"能动"就觉得很厉害;后来开始关注Pick and Place(抓取与放置)以及稍复杂的操作;而现在最核心的拷问是:它有没有在真实场景中持续、稳定地工作。
行业已经从"机器人文娱舞蹈",进入"机器人真干活"的阶段。随着AWE 3.5的发布,它石智航正在推动具身智能从实验室Demo走向真实工厂的深水区。