李飞飞学生发起国际具身人类数据标准,光轮智能成唯一参与中国企业

从ImageNet到EgoVerse:李飞飞学生打造机器人“数据新基建”,光轮智能成唯一中国代表

2009年,李飞飞团队发布的ImageNet数据集彻底改变了计算机视觉领域的发展轨迹。它让全球不同研究机构能够围绕统一的数据集、类别体系和评测标准展开竞争与合作,直接催生了深度学习在视觉领域的爆发式增长。

时光流转17年后,一个相似的历史场景正在机器人学习领域重演。而这一次,站在舞台中央的,是李飞飞的博士生Danfei Xu。

师承名门,一脉相承的“基础设施”梦想

Danfei Xu目前担任佐治亚理工学院交互计算学院助理教授,同时也是机器人学习与推理实验室(RL2)的负责人。他的学术履历堪称星光熠熠——在斯坦福大学攻读博士期间,他由计算机视觉泰斗李飞飞和机器人学习专家Silvio Savarese共同指导。

过去几年,Danfei Xu的研究主线始终聚焦于一个核心问题:机器人如何从人类演示中学习,并将这些经验迁移到不同的任务、环境和机器人本体上?

这条研究线最终汇聚成了一个野心勃勃的项目——EgoVerse,即“第一视角人类操作数据生态”。如果说ImageNet为机器视觉提供了统一的“教科书”,那么EgoVerse正试图为机器人学习搭建类似的协作基础设施。

EgoVerse:机器人领域的“ImageNet时刻”?

EgoVerse不仅仅是一个数据集,而是一套持续增长的、标准化的第一视角人类操作数据生态与评测标准。它的目标很明确:让不同实验室和企业能够在共享协议下重复实验、公平比较,从而加速整个领域的进步。

这个“朋友圈”的阵容堪称豪华。最新的联盟伙伴中,既有佐治亚理工学院、斯坦福大学、苏黎世联邦理工(ETH Zurich)、UC San Diego等顶尖学术机构,也包括Meta、Scale AI、光轮智能、Mecka AI、MicroAGI、Trace Labs等行业巨头和创新企业。

值得注意的是,光轮智能是唯一一家入选的中国公司。这意味着,中国企业首次进入了这个由全球顶级大佬组成的具身智能基础设施标准牌桌。

六大共建方,各展所长

EgoVerse的成功,依赖于各方发挥独特优势,形成互补合力:

  • 佐治亚理工 Danfei Xu:作为组织中枢,搭建研究框架,确保不同实验室能在共享协议下开展可重复的实验。
  • 斯坦福 Shuran Song(REAL Lab):开创了UMI(Universal Manipulation Interface)方案,使用便携式手持夹爪在真实环境中采集人类操作数据,并将其转化为可部署的机器人策略。
  • Meta:提供Project Aria硬件——这是行业首个专为"大规模基础模型"设计的专用数据采集设备,能够记录第一视角视频、手部动作、相机位姿和空间信息。
  • Mecka AI:推动使用iPhone加轻量化头戴装置完成低成本的第一视角采集,再通过云端处理恢复头部轨迹与双手三维关键点,大幅降低了数据采集门槛。
  • Scale AI:自2016年起深耕AI数据基础设施建设,进入Physical AI阶段后,将能力扩展到机器人数据采集、标注、人工反馈和模型验证的全链条。
  • 光轮智能:构建贯穿端侧采集、云端处理和仿真验证的完整质量控制体系,确保数据管线兼容不同硬件,并通过物理仿真和模型评测验证数据价值。
  • MicroAGI:探索分布式众包采集模式,将人类数据生产从实验项目转化为可持续运营的规模化采集网络。

光轮智能的"三步走"质量哲学

在传统领域,数据质量控制通常只关注文件是否完整、格式是否正确等表层指标。但光轮智能对"高质量人类数据"的定义要深刻得多——他们将质量管控拆分为三个环环相扣的连续环节:

第一步:Agent驱动的智能采集

光轮智能用AI Agent实时监控数据采集的质量和数据分布。系统会围绕设备状态、任务流程、动作完整性和有效视角进行实时检查。更关键的是,它能根据已有数据的分布特征,动态调控下一轮需要采集的人群、场景、任务类型和动作类型,避免数据偏差,确保数据的多样性和代表性。

第二步:云端统一标准

无论原始数据来自智能眼镜、手机还是其他多模态采集设备,都必须经过光轮云端平台的统一处理和质量控制。这一流程包括:

  • VIO(视觉惯性里程计):恢复相机的精确运动轨迹
  • 三维标注:对双手和人体进行高精度的三维关键点标注
  • V7级动作语义标注:对操作动作进行细粒度的语义级别标注

这一步的核心价值在于:打破硬件壁垒,实现数据标准的统一

第三步:仿真与评测验证价值

采集和处理只是起点,数据是否真正有价值,需要通过仿真和评测来检验。光轮智能将自研的物理仿真平台SimFoundry与工业级评测平台RoboFinals接入人类数据质量闭环,回答一个根本性问题:这些数据是否真的值得用于机器人学习?

双重身份:唯一同时参与两大国际标准体系的中国企业

随着具身智能从单点技术验证走向规模化发展,行业竞争的焦点正在从模型能力本身,延伸到底层基础设施与标准体系

目前,全球具身智能领域正形成两条关键的基础设施标准线:

  1. 数据基础设施:以EgoVerse为代表
  2. 物理仿真基础设施:以Newton为代表

Newton是由NVIDIA、Google DeepMind和Disney Research联合发起的物理仿真标准体系,其技术指导委员会(TSC)由五家企业组成:NVIDIA、Google DeepMind、Disney Research、光轮智能和Toyota Research Institute(TRI)

至此,光轮智能成为目前唯一同时参与这两套全球具身智能基础设施标准体系的中国企业

从"使用者"到"定义者":中国企业的角色转变

这一里程碑式的进展背后,是一个更深层次的产业趋势:中国企业正在从全球技术标准的使用者,转变为物理AI基础设施规则的共同定义者。

过去十年,中国互联网和科技企业主要在全球标准框架内进行应用创新和技术追赶。但在具身智能这一新兴赛道上,以光轮智能为代表的中国企业开始展现出定义底层标准的能力——从数据采集、处理、标注到仿真验证的全链路质量控制体系,正在成为全球行业共识的一部分。

这不仅是企业层面的突破,更是中国科技产业在全球价值链中位置升级的一个缩影。当ImageNet奠定了计算机视觉的基础时,没人想到它后来会成为深度学习爆发的催化剂。今天,EgoVerse和Newton正在做的事情,或许也会迎来类似的历史时刻——而这一次,中国企业在其中扮演了不可或缺的角色。

17年前,李飞飞用ImageNet为世界提供了视觉理解的基石。17年后,她的学生Danfei Xu和包括光轮智能在内的全球合作伙伴,正在为机器人学习搭建同样的基础设施。这场接力赛,才刚刚开始。