清华教授李升波提出具身智能破局新路线:物理原生智能是实用化答案,世界模型成核心
在人工智能迈向“通用化”的进程中,具身智能(Embodied AI)被视为当前最具挑战性的前沿阵地。然而,随着自动驾驶与机器人技术逐渐触及性能瓶颈,传统的端到端大模型训练范式是否仍能支撑具身智能的通用化目标?
近日,在世界人工智能大会(WAIC)现场,清华大学车辆与运载学院、人工智能学院教授李升波发表了题为《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》的主题演讲。他正式提出了“物理原生智能”(Physics-native Intelligence,简称 Phi)的概念,并系统阐述了其核心特征与技术体系。这一全新范式的提出,为破解具身智能的根本性难题提供了极具参考价值的技术路径。
一、 传统范式的困境:从自动驾驶到机器人的跨越之难
李升波教授指出,无论是视觉智能、语言智能还是多模态智能,其终极追求都是让智能更加“通用化”。人类作为具身智能的典型代表,通过与物理世界的感知-决策-执行闭环,展现了极强的通用能力。具身智能体影响的物理实体越多,其通用化能力和智能性也就越强。
尽管具身智能的概念并不新鲜——汽车领域的工程师早已是开拓者与实践者,自动驾驶也是首个量产化的具身智能系统——但实现通用化具身智能体的难度远超预期。
目前,汽车与机器人的开发主要仍以端到端模型训练为核心技术路线。但从实践数据来看,挑战呈指数级上升:
* 自动驾驶汽车: 需要百亿级别的网络参数、亿级的驾驶片段。即便如此,目前的智能水平仍停留在 L2 级驾驶辅助阶段,距离 L4 级仍有巨大差距。
* 机器人: 考虑到更高的自由度、更复杂的场景结构以及更多样的交互对象,大概需要万亿级别的网络参数和千亿级别的交互片段。
李升波强调,机器人的训练难度至少是汽车的十倍以上。“若仍然沿用现有的视觉、语言、多模态大模型训练思路,我们能否达到通用化的目标呢?答案是显而易见的,不具有可行性。”
二、 破局之道:什么是“物理原生智能(Phi)”?
面对传统路线的局限,李升波教授结合过去六十年人工智能领域先驱的思想(如 McCarthy 的世界一般性表征、Pearl 的因果关系理论、Hopfield 的物理系统集体属性等),提出了“物理原生智能”。
物理原生智能是一类更依赖物理规律,且以与物理世界更好地交互为目的的具身智能。 它虽然仍以数据驱动的端到端模型训练为基本架构,但在世界模型、数据结构和训练算法三个维度上,深度考虑了物理实体对智能的客观要求。
李升波将其核心特征归纳为以下三点:
1. 利用“状态”而不是“观测”表征世界,且状态需解耦
传统的视觉或语言模型往往基于传感器的直接观测值。而在物理原生智能中,系统的状态由两部分构成:
* “显状态”:服从系统动力学与物理约束,保证状态转移的长期稳定。
* “隐状态”:服从物理规律驱动的受控转移,确保长期推演不漂移。
这种设计兼顾了模型的准确性与泛化性。
2. 模型结构满足时序性和因果性
该特征遵循“时序优先”原则,即原因先于结果。在动作规划时,状态预测不得依赖未来信息。同时,模型需要具备“干预敏感性”,即改变动作输入后,后续状态应产生可解释的差异;不仅要关注正样本,更要关注负样本的信息收益(反事实推理)。
3. 训练过程须嵌入底层物理规律的约束
训练过程必须纳入对称性、守恒性以及动力学系统的辛几何结构等物理规律。例如,由对称性决定的物理量应守恒或受控变化,且训练动力学应保持几何结构和能量收支规律。这能极大提升训练系统的稳定性。
三、 落地路径:世界模型、数据重构与阶梯训练
仅有理论特征不足以指导开发。李升波从世界模型、数据结构、训练算法三个层面给出了具体的开发方法。
1. 世界模型:从“观察”走向“干预”
世界模型是物理原生智能的核心。针对长程、精细化、高稳定的动作输出不理想,以及与强化学习匹配度不高的问题,物理原生世界模型的设计强化了因果律的满足。它通过显式、隐式两类状态作为转移动力学核心,将策略模块和评价模块直接与状态关联(而非观测),从而提升模型的动作准确性、功能安全性与可解释性。
2. 数据结构:物理原生数据的三要素
在数据层面,物理原生智能要求基础转移数据之外,还必须增加两个关键要素:
* 奖励信号 (r)
* 人类的经验知识 (K)
无论是互联网视频数据、Ego/UMI 数据、真机操作数据还是仿真合成数据,都可以通过重构、时空对齐和质量增强,转化为结构一致的物理原生数据。其中,转移特性用于支撑编码器与解码器的训练;奖励信号用于强化学习及评价模块;人类经验知识则通过大模型的评价能力嵌入模型,进一步提升性能。
3. 训练算法:阶梯式推进与绝对安全
针对具身智能数据稀缺、场景复杂的特点,李升波建议彻底采用阶梯训练技术,将训练过程分为三个阶段,步步为营:
1. 监督学习预训练
2. 强化学习后训练
3. 强化学习真机微调
此外,算法设计必须满足三项客观需求:
* 嵌入底层物理规律:如在优化器中融入辛结构守恒,抑制异常梯度引发的参数更新振荡。
* 绝对安全保障能力:具身智能的特殊要求在于,真机训练的每一代模型都必须满足安全硬约束(类似新手学车过程中也要保证安全)。这需要同时训练最优策略及其运行的可行区域,并通过博弈机制达到均衡。
* 抗遗忘机制:由于训练是多阶段分步实施的,关键在于构建抗遗忘条件及梯度正交机制,确保后面的训练不会忘记之前的性能。
四、 技术实践:清华大学 GOPS 训练平台
围绕物理原生智能的技术框架,清华大学研究组在过去十年开展了一系列核心算法的创新研究,并自主研发了面向具身智能的通用训练平台——GOPS(General Optimal Control Problem Solver)。
GOPS 以用户定义的任务和约束为输入,能够自主组织训练数据生成、对象与环境建模、任务转化、网络构建、优化求解、参数调优、代码部署和控制器集成,形成从模型研发到端侧应用迭代的全流程闭环。
该平台内嵌了一系列覆盖强化学习、模型优化、安全训练、状态估计与大模型微调的物理原生算法,包括:
* DSAC:通过连续值分布建模缓解策略高估问题,提升中小规模强化学习的稳定性。
* RAD:将辛结构守恒融入自适应优化器,抑制异常梯度引发的参数更新振荡。
* LipsNet:结合傅里叶滤波与李普希兹约束,缓解神经网络策略的动作震荡。
* RACS:构建安全强化学习的三元迭代框架,实现安全区域的单调扩展与策略收敛。
* DACER:将反向扩散模型嵌入在线策略迭代过程,支持多模态动作生成并缓解策略分叉难题。
* BOOM:采用规划自学习驱动的世界模型强化学习机制。
* NANO:依托自然梯度下降构造几何约束的非线性高斯滤波器。
* MVP:引入瞬时速度约束和复合生成与选择机制。
五、 结语:迈向泛在具身智能
人工智能的时代刚刚来临,方兴未艾。从自动驾驶走向机器人,再到走向更加广泛的物理实体,进而迈向泛在具身智能,是一条充满挑战但也极具前景的道路。
李升波教授提出的“物理原生智能(Phi)”及其配套的世界模型与训练体系,为行业提供了一条摆脱单纯堆砌参数、回归物理本质的技术路径。或许在不远的未来,我们能够在蛋白质、基因乃至量子领域,看到具备等量齐观能力的智能系统诞生。对于从业者而言,如何在这一新范式中抢占先机,将是下一阶段的核心命题。
(本文基于 WAIC 现场清华大学教授李升波的演讲内容整理)