腾讯开源三大具身基座模型,首席科学家张正友详解“三层脑”如何破解机器人反应慢

腾讯 WAIC 2026 重磅开源“三层脑”具身智能架构:让机器人学会“看世界”的速度思考

2026 年世界人工智能大会(WAIC)上,腾讯 Robotics X 实验室主任张正友携团队再次站在了聚光灯下。这一次,他们带来的不仅是三款开源的具身智能基座模型,更是一套旨在解决物理世界核心痛点——“响应延迟”的系统性方案。

在通用大模型席卷数字世界的当下,机器人如何适应物理法则?腾讯给出的答案是:通过“三层脑”架构,让不同层级的智能以不同的频率运行,从实验室走向真实的工业与养老场景。

为什么通用的“大脑”在机器人身上会“水土不服”?

在 OpenClaw 等通用智能体框架大行其道的背景下,腾讯 Robotics X 实验室曾做过一个有趣的尝试:将机器人的能力封装为 Skill,接入这些成熟的数字智能框架。

结果如何?张正友在采访中对 InfoQ 直言:“整个效果非常之差”,甚至不如去年给宇树科技做的导览系统。

这背后的逻辑其实很深刻。OpenClaw 这类框架服务的对象是数字系统中的智能体,它们的“身体”相当于浏览器。在数字世界里,浏览器可以等待,用户也可以忍受几十秒的加载时间。但在物理世界中,如果一个机器人接到任务后需要几十秒才能做出反应,那不仅“肯定受不了”,更可能引发严重的碰撞或失衡事故。

为了解决这一根本性的错位,腾讯专门设计了原生智能体框架 TairosAgent。它将上层任务理解与智能体交互的响应时间压缩到了惊人的 2—3 秒。但张正友强调,这仅仅是第一步。对于涉及碰撞、失衡和力觉变化的底层身体反应,速度必须更快,快到像人类的“条件反射”。

“三层脑”架构:顺应物理世界的“时间尺度”

物理世界并非按照同一种速度运行。触觉反馈可能需要约 1 毫秒的极速响应,底层运动控制频率高达 500Hz 至 1000Hz,而高层的任务规划则相对从容。

基于这种差异,腾讯将具身智能拆解为三个同时在线、但运行频率截然不同的层级,也就是所谓的“三层脑”架构:

  1. 视觉语言模型(Hy-Embodied-VLM-1.0):感知与行动的“中间层”
    它以约 15Hz 的频率持续接收多模态信息,负责空间与场景理解,并快速调整动作。它是机器人与环境交互的“眼睛”和“直觉”。

  2. 认知规划模型(Hy-Embodied-RxBrain-1.0):思考与想象的“大脑”
    这是此次升级的重点。它不仅仅生成任务步骤,更关键的是能预测每个子任务完成后物理世界应呈现的状态——即“做完以后应该是什么样”。通过引入视觉状态信息,拓宽了认知带宽,使“推理”和“想象”出现在同一条认知链路中。

  3. 视觉语言动作模型(Hy-Embodied-VLA-0.5):执行动作的“小脑”
    负责将高层目标转化为连续的动作。该模型拥有超过 1 万小时的示教数据,在 RoboDojo 评测中综合排名第一。它像神经末梢一样,以更高的频率处理突发情况,确保执行的精准与安全。

配合持续在线的具身智能体 Apexio 和原生框架 TairosAgent,这套系统实现了“分层运行、闭环训练”。张正友认为,这种分层架构并非过渡方案,而是对应了物理世界本身的时间尺度差异,“这个架构在很长的时间里面不太会变”。

落地验证:从日化工厂到养老场景的极限测试

腾讯在发布会上反复强调一个观点:“Demo 做到 80 分、90 分,真正没有落地,几乎就等于零。”

在工业场景中,挑战在于高频迭代。
腾讯披露,Hy-Embodied-VLA 已进入一家日化品工厂进行生产测试。在高混合、小批量、SKU 频繁迭代的产线上,该模型展现了极强的适应性:
* 作业成功率超过 95%
* 单件节拍快于 6 秒
* 面对新增 SKU,留给数据采集和模型后训练的时间不到 3 天

在平台化能力上,跨本体适配效率大幅提升。
最初部署一套 Tairos 平台需要三个月,后来缩短至五天,最近接入越疆机器狗仅用 一天。关键在于增加了硬件抽象层,统一转换传感器与控制接口。目前,腾讯主要与 宇树、智元、越疆 等头部本体企业合作,因为头部硬件相对稳定,有助于准确判断问题究竟出在模型、本体还是底层控制系统。

在养老场景中,挑战则是绝对的安全。
腾讯选择养老作为技术试验场,展示了可通过双臂完成按摩动作的“小六”机器人。该系统通过自研的视觉、力觉与触觉采集系统记录专业人员的手法轨迹和力度,再以强化学习复现。目前,“小六”仅学习了四种双臂协同手法。

张正友解释,腾讯不准备销售养老机器人本体,选择养老是因为与人发生物理接触集中了具身智能最困难的问题。“进入家庭这样的非结构性环境,安全性是 100% 一定要保障的。”养老场景是对分层架构的极限测试:高层理解意图,中层调整动作,底层必须在异常力道时立即停止。

算力与数据的“金字塔”

随着具身智能进入高强度数据处理和模型试错阶段,算力需求呈指数级上升。腾讯云异构计算研发总监陈煜东透露,过去部分客户使用数百张卡完成训练,如今具身智能客户开始提出千卡、万卡规模需求,相关需求呈现约 200% 至 300% 的增长,部分模型甚至两三天便迭代一个版本。

在数据方面,张正友将具身数据划为“金字塔”:底层是互联网视频,往上是第一人称视频、UMI(无本体)设备采集示教、遥操作数据,越往上越昂贵且依赖特定本体。腾讯的策略是让不同层级数据服务不同模型,且 UMI 数据可通过统一动作表征迁移到不同机械臂,以实现跨本体适配。

结语

语言模型可以等待用户说完再回答,但机器人不能等待世界停下来再思考。

腾讯通过“三层脑”架构和 Tairos 平台,试图在保持端到端学习能力的同时,将物理约束提前写入架构。这不仅是对技术路径的一次重要探索,更是具身智能从“炫技”走向“实用”的关键一步。在 WAIC 2026 的舞台上,腾讯交出了一份关于“如何让机器人在真实世界中安全、高效地工作”的详细答卷。