Pegasus 把人类视频转成机器人训练数据,但它真正在改的是数据生产的成本结构
arXiv 今天挂了一篇论文,标题很长——「From Passive Video to Editable Experience」,但核心问题很直接:网上有几亿条人类操作视频,机器人看着等于白看。人手和机械臂的形态、关节、力矩全不一样。这个「具身鸿沟」是 Embodied AI 最硬的骨头之一。
论文提出了一个叫 Pegasus 的框架,作者 Jia Luo,7 月 29 日提交。它的思路不是让机器人直接学视频,而是先建一层中间表达——用图结构把人类演示翻译成机器人能执行的规划。
具体走三步:从人类视频里抽出一个 Task Graph(任务图),再通过 Affordance Graph(可供性图)和 Constraint Graph(约束图)做转换,最后生成一张 Robot Planning Graph(机器人规划图)。中间还有一个层次化的可供性隐空间,把物体状态、可供性和任务之间的关系建模,不依赖具体物体 ID,所以能泛化到没见过的物体上。最后接一个闭环物理验证器,用运动学可行性、碰撞约束和关节限位来过滤那些「看起来对但实际走不通」的生成。
这套东西在 GTEA Gaze+ 和 EPIC-KITCHENS-100 这两个第一人称操作数据集上做了评估,评测维度包括任务正确性、可执行性、状态一致性和可学习性——不是只看生成得像不像,而是看机械臂能不能真的把那个动作做出来。
如果你一直在跟机器人数据打交道,应该能 get 到这篇论文真正想表达的东西。它没有在模型架构上搞花活,而是直接捅了数据来源这个痛点。现在大部分机器人数据靠什么呢?要么让人戴着动捕手套一个个录,要么远程操机攒轨迹,要么在仿真里写脚本生成。每一条数据的边际成本都很高,而且换一个机器人形态就要重新来一遍。
Pegasus 做的其实是一次成本结构的替换。它想让你从「硬件采集」转到「知识迁移」——把人类已有的操作视频当作原料,通过图结构翻译成不同机器人本体可用的数据。如果这条路走得通,那数据供给的逻辑就变了:不再是少录一条就少一条,而是网上有多少视频就有多少潜在训练数据。
当然论文没有回避限制。图结构的构建质量依赖于视频理解的上限,物理验证器虽然能过滤明显无效的轨迹,但对更细微的操作精度问题可能覆盖不够。而且从任务图到机器人规划图的转换,仍然需要在每个目标机器人上进行一定程度的适配。
这不是那种「发了论文就落地了」的故事。但它选择了一个对的问题,而且给出的解法方向是对的——与其跟模型架构死磕,不如先把数据的生产问题解决。Embodied AI 的数据瓶颈有多痛,做过的人都知道。一个能让你少搭几次采集环境、少写几轮脚本的思路,本身就值得多看两眼。
论文地址:https://arxiv.org/abs/2607.26903,CC BY 4.0 许可。