灵初智能开源EgoSteer:用9600小时人手数据训练全栈灵巧手大模型

灵初智能开源EgoSteer:用9600小时人手数据训练全栈灵巧手大模型

在具身智能这个充满想象的赛道上,从简单的机械臂流水线到能像人一样灵活操作的“灵巧手”,一直横亘着巨大的技术鸿沟。最近,灵初智能(Inception AI)联合北京大学-灵初共同实验室,扔出了一颗“重磅炸弹”——开源了名为 EgoSteer 的双灵巧手通用操作大模型及全栈系统。

这不仅仅是一次代码的公开,更标志着双灵巧手在精细操作、长程任务和泛化性上取得了里程碑式的突破。通过一套完整的“数据-模型-系统”闭环,灵初智能为行业提供了一套高质量、可复现的基线方案。

从“自动化流水线”到“自主灵巧手”的范式转移

回想2024年初,知名科技博主何同学展示过一个令人印象深刻的自动化流水线项目。通过复杂的机械臂组合,实现了纸盒的自动叠放和包装。虽然功能强大,但这种传统方案依赖繁琐的自动化编程,对位置偏移和物体变形的适应能力非常有限。

而EgoSteer展示的双灵巧手系统,则走向了另一个极端:类人的灵活性

它不仅能听懂开放式自然语言指令进行操作,还能在全新场景中泛化,甚至只需看几次示范,就能快速学会复杂的长程任务。这不仅是执行效率的提升,更是从“特定场景自动化”向“通用场景自主操作”的根本性跨越。

第一层拆解:EgoSmith——把噪声视频变成训练金矿

制约灵巧手发展的最大瓶颈是什么?是数据。

虽然全网存在着约11.6万小时的第一人称(Ego-centric)人类操作视频,但这些原始素材简直是“灾难现场”:镜头晃动剧烈、遮挡严重、缺乏精确的动作和语言标注。如果直接拿这些数据去训练模型,学到的只会是一堆矛盾的噪音。

为此,灵初智能开发了一套独立的数据处理系统——EgoSmith。这是一条四阶段的全自动流水线,专门负责将低质量视频转化为高质量的训练数据:

  1. 预过滤(粗筛): 利用光流法剔除人在走动而非操作的片段;使用YOLO检测手部数量、尺度和位置,通过几何规则剔除严重遮挡或有旁人入镜的帧。
  2. 4D运动估计: 结合DPVO(相机跟踪和关键帧深度)与Any4D(逐帧度量尺度深度预测),将手部运动从相机坐标系还原至统一的世界坐标系,彻底解决尺度对齐问题。
  3. 多层级语言标注: 使用Qwen3.5-VL-Plus过滤无实质交互片段,并生成五级语言指令,从原子动词到细粒度分步动作,层层递进。
  4. 后过滤(质量控制): 通过Episode级、Chunk级和Frame级的硬阈值筛选,系统性清除三维重建漂移或跳帧产生的不可靠数据。

最终,EgoSmith产出了一个惊人的标准化数据集:横跨12个开源数据集,包含 9.6K小时209万个片段10.4亿帧 视频,覆盖了8969个物体名词和623个动作动词。

第二层拆解:世界模型增强的VLA——让模型学会“想象”

有了干净的数据,接下来就是模型架构的设计。EgoSteer基于流匹配(Flow Matching)视觉语言动作模型(VLA),其核心创新在于引入了一个仅在训练时存在的世界模型专家

模型的“大脑”与“小脑”

  • 主干网络(大脑): 采用预训练的Qwen3-VL(2B参数),具备因果注意力机制,负责编码图像、语言和状态等多模态输入。
  • 动作专家(小脑): 基于DiT模块,约3亿参数,通过流匹配生成动作块(Action Chunk)。
  • 世界模型专家(想象力): 一个轻量级4层Transformer,约7000万参数。

“想象”机制的妙处

这个“世界模型专家”的作用是预测未来帧的语义特征。给定当前动作和相机运动,它回归未来帧经DINOv3编码后的特征。

为什么选择回归DINOv3特征而不是像素?因为语义特征能天然过滤光照变化和背景噪声,提供更稳定的梯度。

这一设计的精妙之处在于:推理时直接丢弃世界模型专家,不带来任何额外计算负担。但在训练阶段,它通过让主干网络学习“预测未来”,强化了对物理世界的理解,从而大幅提升了动作生成的精度。

统一动作空间与流畅控制

EgoSteer采用统一的48维动作空间表示:手腕位姿(3D位置+6D旋转)加上五根手指指尖在手腕坐标系下的位置。这种设计让人类操作数据和机器人数据能在同一表示格式下平滑流转,打破了本体差异。

此外,为解决真机推理时的卡顿问题,团队引入了Real-Time Chunking (RTC) 技术,通过训练时注入随机延迟的动作前缀,覆盖推理延迟,确保动作流畅丝滑。

第三层拆解:Robot-Stack——无缝接管的人机闭环

全栈系统的最后一块拼图是Robot-Stack,它将遥操作采集、模型推理部署和人在闭环纠偏融合在同一套底层控制中。

相对动作映射:告别抖动

在机器人执行任务失败需要人工干预时,传统的绝对姿态映射会导致机器人状态突变和剧烈抖动,体验极差。灵初智能设计了“相对动作映射”机制:

  1. 操作员踩下脚踏板发出接管信号。
  2. 系统记录机器人当前末端姿态和人手当前姿态作为基准。
  3. 后续仅将操作手部的相对运动量叠加到机器人当前状态上。

这种设计使得操作员只需顺着机器人当下的姿势比划即可平滑接管,全程无抖动。实验显示,该接管成功率超过 85%

低成本数据采集

依托这套控制栈,团队仅需收集“介入片段”作为纠偏数据。通过三轮DAgger迭代,在56个任务上仅采集了3.7K条轨迹(8.3小时纠正数据),便完成了覆盖193个桌面操作任务、187小时的高质量真机数据采集。

实验结果:Scaling Law与泛化能力验证

EgoSteer在多个维度进行了严格评测,证明了其有效性和泛化能力。

1. 整体性能与泛化

在涵盖简单抓放、非抓握推拨、物体重定向、双手协作等7大类、40个日常复杂任务的评测中,EgoSteer全程使用单一共享模型,无需针对单一任务微调,仅依靠自由语言指令驱动,实现了 75% 的整体平均成功率

针对不同难度的泛化测试:
* 训练内任务: 表现稳定。
* 组合泛化(已知技能重新拼装): 成功率65%。
* 语义泛化(完全未见过的任务): 成功率62%。

这表明模型学到的是可迁移的操作先验,而非死记硬背。

2. 数据规模的Scaling效应

团队对比了从零训练、3K小时、6K小时、9.6K小时预训练数据的模型表现。结果显示,随着数据量增加,真机成功率稳步爬升。在9.6K小时数据规模下,预训练模型成功率达到 60%,而完全从零训练的模型仅为 30%。这三十个百分点的差距,充分证明了大规模人手数据的价值。

3. 横向对比

在一组10个相对容易的任务上,EgoSteer平均成功率 74%,显著高于同期的Being-H0.5(39%)和π0.5(22%)。论文分析指出,对比模型在预训练/后训练动作表示一致性、输入分辨率及部署优化上的不足,限制了其指令跟随能力和泛化精度。

4. 长程任务的少样本学习

这是预训练价值的终极检验。在跨本体的复杂长程任务中:
* RealMan机器人: 仅用120条示范,在18步(耗时40秒)的折纸盒任务上达到 75% 成功率。
* AgiBot G1机器人: 仅用200条示范,在9步(耗时1分钟)的拆蛋糕盒任务上达到 83% 成功率。

作为对照,传统模仿学习方法(Diffusion Policy, IMLE)及未预训练的同架构模型在这些任务上的成功率均为 0%。这证明,近万小时人手视频攒下的操作先验,是让模型“少样本学会长程任务”的关键。

关于灵初智能

灵初智能成立于2024年9月,总部位于上海。公司由北大助理教授杨耀东担任首席科学家,领衔北大-灵初联合实验室。创始团队年龄跨度从70后至00后,成员包括来自黑莓、Sonos、达闼、京东等企业的前高管及技术专家。

今年,灵初智能宣布完成 20亿元人民币 的天使轮加Pre-A轮融资,投资方包括国开金融、上海徐汇资本等国资和产业资本。此前,灵初推出的Psi R系列是业内首个端到端强化学习具身模型,其技术路线区别于主流的“夹爪加仿真”路径,专注于“强化学习+人手数据+灵巧手”的高难度方向。

结语

EgoSteer的开源,不仅仅是发布了一个模型,而是打通了从海量非结构化数据清洗、世界模型增强训练到真机闭环纠偏的全链路。对于具身智能从业者而言,这套系统提供了一条经过验证的、可扩展的技术范式。

灵巧的手,终将接住琐碎而真实的人间事务。随着EgoSteer的开放,我们或许正站在通用灵巧操作智能体爆发的前夜。


参考资料:
* 论文链接:https://egosteer.github.io/EgoSteer.pdf
* 项目主页:https://egosteer.github.io/#/