高德发布ABot全栈具身技术体系:5款模型、17项SOTA背后的“体系化”逻辑

高德 ABot 发布五款新模型:用“体系化作战”破局具身智能下半场

核心事件:
高德正式宣布其全栈具身技术体系 ABot 完成重大升级,一次性发布 N1、M0.5、ER、AgentOS、C0 五款新模型。这套组合拳不仅让 ABot 在 17 项权威基准测试中拿下 SOTA(State of the Art),更标志着具身智能行业从“单点突破”向“体系化闭环”的深刻转变。


一、行业分水岭:从“表演”到“干活”

过去一年,具身智能赛道呈现出一种微妙的两极分化。一级市场热钱涌入,IPO 进程加速,全球头部玩家如特斯拉、Figure AI 已将竞争推向 Physical AI 的核心层面。

特斯拉将自动驾驶 FSD 的底层架构复用至 Optimus 机器人,通过“端到端”神经网络实现从视觉输入到动作控制的直接映射,目前已能在工厂执行电池分拣等实际任务;Figure AI 则绑定 OpenAI,将顶尖视觉语言模型注入机器人,赋予 Figure 01/02 自主推理和语义理解能力,甚至进驻宝马生产线。

这些路径共同指向一个行业共识:机器人未来的核心竞争力,在于 AI 能否通过身体理解、适应并改变现实世界。

随着资本周期进入“3+2”模式的退出节点,行业面临一道残酷的分水岭——仅靠电机扭矩或后空翻等“表演性能力”的故事已走到尽头。企业必须讲出“机器能干活”的切实故事,走向 AGI,在开放、未知且充满长尾变数的真实世界中执行高度泛化的任务。

在这一背景下,高德 ABot 的升级显得尤为关键。它不再追求单一参数的领先,而是试图构建一个精密咬合的系统生态。


二、ABot 的三层架构:搭建机器人的“数字灵魂”

高德 ABot 体系于今年 4 月首次发布,彼时自研机器导盲犬“高德途途”凭借该体系在半马比赛中展示了开放环境下的全自主导航能力。相比单点的模型研究,ABot 搭建的是一个为机器人实现高阶智能的底层平台。

此次升级后的 ABot 体系呈现出一套清晰的三层精密咬合架构:

  1. 上层“具身大脑”:由通用具身大脑 ER 和机器人 Agent 操作系统 AgentOS 构成,负责环境感知、任务推理、高层决策调度与记忆沉淀。
  2. 中层“运动双核”:由 N1 和 M0.5 组成,分工明确,一个负责“脚怎么走”,一个负责“手怎么干”。
  3. 底层“训练与仿真环境”:以世界模型 ABot-World 和 3D 世界模型 ABot-Earth 持续提供仿真和训练支持。

这五大模型如同机器人的五个“仿生单元”,协同工作:
* 双脚 (ABot-N1):通用导航基座模型,负责空间感知与移动。
* 双手 (ABot-M0.5):通用操作基座模型,负责精细化物理交互。
* 大脑 (ABot-ER):具身大脑,负责统一的逻辑推理与环境认知。
* 中枢 (ABot-AgentOS):执行中枢,负责记忆调度与任务下发。
* 运动神经 (ABot-C0):运控系统,将决策传导至躯体动作。

这种架构使得仿真训练、物理交互与记忆调度能够彼此反哺,形成一个内循环飞轮,推动系统逐步向 AGI 靠近。


三、三大物理表征:体系化带来的能力跃迁

ABot 体系的协同运转,外化为传统机器人研发模式难以实现的三大物理表征。

1. “身随眼动”:开放环境全自主导航

常规导航地图精度有限,机器人无法直接使用,且缺乏人类的空间常识和安全意识。ABot-N1 为此设计了“快慢双系统”架构:慢思考负责长程路线规划,快思考负责实时控制。

其关键创新在于首创了“Think-and-Point”机制,消除了部署过程中的黑箱问题。若检测到定位误差,“慢系统”会通过视觉感知,利用像素-语言双思维链实时调整路径。这使得机器人在自主导航中能收集数据,并结合空间几何知识内化出一种“空间直觉”。
* 成果:在开放环境自主导航任务中创下 92.9% 的成功率,实现城市级长程自主导航。ABot-N1 在 R2R-CE 等 5 项权威基准取得 SOTA,相关工作已入选 CVPR 年度最佳论文候选。

2. “手脚并用”:移动操作与误差修正

传统机器人采用单线程结构,易因一步卡住而死机;且训练与推理环境的差异往往导致长程任务误差累积。

ABot-M0.5 将运动与操作拆分为互不干扰的双动作流,引入“帧级隐式动作”,实现了眼、手、脚的实时对齐。同时,激活了“数据回流”机制,通过独特的“梦境自愈(Dream-Forcing)”能力,强迫模型在预测的含噪画面中继续生成动作,避免因细小偏差导致整体失败。
* 成果:在 RoboCasa-365 复杂任务测试中大幅领先前代 SOTA 达 20.4%。在 LIBERO、Robo-Twin 等 4 项权威基准中均取得 SOTA。

3. “过目不忘”:跨任务终身记忆

为了让机器人具备举一反三的能力,高德推出了 ABot-ER 和 AgentOS。
* ABot-ER:作为面向真实环境的通用具身大脑,统一支撑从感知到决策的全流程,让机器人深刻理解物体、空间与任务之间的关系。
* AgentOS:将规划与执行解耦,通过插件式 Skill 适配异构机器人。它自带跨任务、跨时间的多模态记忆,能在失败中定向优化记忆存储。
* 成果:登顶数十家机构联合发布的 Embodied Arena 2D-EQA。在 Locomo 等五大权威基准上均取得 SOTA,实现了真正的跨本体和跨任务学习。


四、竞争优势:二十年时空数据的降维打击

高德切入具身智能并非从零开始,而是基于其在空间智能领域长达二十年的深厚积累。这种积累转化为了四大竞争优势:

  1. 数据端:拥有庞大的时空基座数据。对空间理解、环境拓扑结构及语义信息丰富维度的掌握,是其他厂商难以企及的天然养料。
  2. 架构端:ABot 是一套完整的、解耦的全栈架构。经验可从四足狗直接迁移至双足人形,无需推倒重来,极大地降低了迭代成本。
  3. 工程化:在 AI 工程化方面积累了极度深厚的经验,确保了算法从实验室到落地的稳定性。
  4. 场景端:体系是在真实泥泞的路上跑出来的,经过“高德途途”的场景验证和城市级长程任务导航的实际案例考验,而非仅停留在仿真阶段。

结语:中场战事,体系化作战破局

物理世界的复杂性决定了,用单点参数领先去击穿它存在巨大风险。高德 ABot 架构的发布证明,不必迷信孤立的“超级大脑”或单个“灵巧手”。

回归生命进化的本质,构建精密咬合的闭环生态,才是打破莫拉维克悖论的最佳解法。通往 AGI 的路上,比拼的是谁的系统能转得更稳、迭代得更快。谁能率先构建出靠“闭环飞轮”自我进化的生态体系,谁就真正拿到了具身智能下半场的入场券。