让VLA真正跑上机器人:北大团队开源Jetson-PI,Jetson Orin控制频率提升8.66倍
在具身智能领域,一个长期存在的痛点是:为什么实验室里表现优异的AI模型,一到真实机器人身上就“反应迟钝”?
近日,北京大学、AIRS(人工智能与系统研究院)与PrimeBot Research Institute的研究团队联合提出了一套名为 Jetson-PI 的解决方案。这套方案专门针对低功耗端侧设备(如NVIDIA Jetson Orin)进行了优化,成功将视觉-语言-动作模型(VLA)的控制频率提升了8.66倍,且没有牺牲模型的准确率。
这项研究不仅开源了代码,更提供了一条从“实验室演示”走向“工业级应用”的可行路径。
端侧VLA的困境:快与省的博弈
目前,在搭载RTX 4090等高端GPU的工作站上运行VLA模型已经比较成熟。然而,对于移动机器人而言,依赖外接高性能显卡并不现实:高功耗会迅速耗尽电池,通信延迟也会限制机器人的活动范围。
相比之下,NVIDIA Jetson Orin等机载设备虽然功耗低、适合部署在机器人身上,但性能瓶颈明显。以目前先进的π0.5模型为例,直接部署在Jetson Orin上时,单次推理需要约1.4秒,对应的控制频率仅为0.7 Hz。
0.7 Hz是什么概念? 意味着机器人每秒只能执行不到一次动作。这种迟缓不仅会导致动作停顿,在物体滑动或环境突变时,过长的推理延迟甚至会让机器人做出错误的反应。
核心突破:不只是“快”,更是“准”
为了提升速度,研究团队并没有简单地采用量化或剪枝等可能损失精度的方法,而是从算法和系统两个层面进行了深度重构。
1. 算法创新:前瞻对齐异步修正
传统的同步推理模式下,机器人必须等待完整动作生成后才能执行。而简单的异步推理虽然能并行预测,却容易引发“感知与执行错位”——模型预测时用的是旧图像,执行时环境已发生变化。
Jetson-PI提出了一种前瞻对齐异步修正(Foresight-Aligned Asynchronous Correction)机制:
* 预测未来表征:团队训练了一个仅约40M参数(占原模型1%)的轻量级模块,用于预测动作执行完成后的未来环境状态。
* 动态调度:系统根据置信度决定何时调用庞大的VLM(视觉语言模型),何时直接使用轻量级的动作专家。在动作平稳期,跳过耗时的VLM推理,实现高频控制;在抓取、接触等关键步骤,则触发VLM重新观察环境,确保准确性。
2. 系统优化:基于llama.cpp的重构引擎
算法解决了“何时调用”的问题,但要达到实时控制要求,还需底层系统的极致优化。研究团队基于llama.cpp开发了Jetson-PI-Edge推理引擎,实现了三项关键优化:
* 计算图复用:避免每轮推理重复构建CUDA Graph。
* 常驻中间缓存:在GPU内存中直接复用视觉embedding和KV Cache,减少CPU-GPU数据传输开销。
* Flow matching展开:将多轮去噪过程展开到统一计算图中,降低调度开销。
性能跃升:从0.7 Hz到6.06 Hz
经过上述优化,π0.5模型在Jetson Orin上的表现发生了质的飞跃:
* 单次推理时间:从约1.4秒降至412.9毫秒。
* 控制频率:从0.70 Hz提升至6.06 Hz,提升了8.66倍。
* 系统反应时间:结合置信度调度后,整体反应时间进一步降至165.1毫秒。
值得注意的是,这些优化均未使用量化或剪枝,理论上还可与其他加速技术结合,潜力巨大。
真实场景验证:机器人折叠衣物
在LIBERO基准测试中,Jetson-PI在高延迟场景下表现出显著优势。当异步延迟增大时,传统方法性能明显下降,而Jetson-PI凭借对未来环境的预测能力,保持了稳定的成功率。
在PrimeBot Research Institute的X2-W机器人上,研究团队展示了其在真实衣物折叠任务中的应用。与同步推理和简单异步推理相比,Jetson-PI生成的动作轨迹更加连续,操作更加流畅,成功解决了因延迟导致的动作卡顿和错位问题。
结语:迈向长期自主工作的具身智能
Jetson-PI的意义在于,它证明了不需要昂贵的硬件堆砌,通过算法与系统的协同设计,就能让低功耗设备上的大模型实现接近实时的控制。
对于强调续航、离线运行能力和移动性的机器人而言,这标志着具身智能从“能够演示”向“能够长期工作”迈出了关键一步。
相关资源:
* 论文地址:https://arxiv.org/abs/2607.12659
* 异步推理代码:https://github.com/PKU-SEC-Lab/Jetson-PI
* 端侧推理引擎:https://github.com/PKU-SEC-Lab/Jetson-PI-Edge
作者介绍:
论文第一作者杨泽斌是北京大学人工智能研究院博士生,导师为李萌教授。其研究方向聚焦于高效具身智能算法与系统、边缘计算及算法-系统-硬件协同设计。