PhyAgent OS 重磅升级:具身智能的“操作系统”来了
PhyAgentOS 全面开源:为具身智能打造“统一操作系统”
在具身智能领域,竞争的焦点正在发生深刻变化——从单一的“模型能力”比拼,转向“系统可靠性与进化能力”的较量。近日,由中山大学 HCP 实验室、鹏城国家实验室具身智能研究所与 X-Era Lab(拓元智慧)联合发起的 PhyAgentOS 迎来重磅升级并全面开源。
作为一个专为物理智能模型(如 VLA、WAM)、仿真环境和异构机器人打造的开源运行底座,PhyAgentOS 试图解决一个关键痛点:如何让 AI 从“会思考”走向“可靠执行”。
从“能想”到“能做”:多机器人协作的真实演示
为了展示 PhyAgentOS 的实际调度能力,项目方演示了一个模拟零售商店场景中的多本体长程协作任务——智能购物助手。
在这个场景中,系统通过 PhyAgentOS 的 Session 机制统一调度,实现了不同形态机器人的无缝配合:
- XEra 移动导购机器人负责前端交互,主动迎接顾客,通过自然对话理解意图(如询问饮料位置),并引导顾客前往货架。
- Piper 双臂机器人接手精细操作,准确拾取衣物、饮料等商品,完成折叠衣服、打开塑料袋及有序装袋等动作。
- XEra 移动机器人最后拿起装满商品的红色塑料袋,将其送至收银台。
整个过程涉及人机自然交互、长时序任务分解、跨机器人协同以及语义验收(Session Verified)。系统实时显示当前 Target(如 XEra / Piper)和 SkillRuntime(如 navigate、Openvla、PI0.5 等),体现了系统在异构多机器人协同和高透明度可控性方面的核心价值。
痛点与架构:解耦“思考”与“执行”
尽管大模型在任务规划和语义理解上表现出色,但在进入物理世界时往往面临“用不起来”的困境:机械臂执行失误却返回成功、新环境需重新搭建链路、失败后难以定位问题等。单纯端到端策略虽在特定场景表现亮眼,但存在泛化能力差、调试困难、可解释性低等问题。
PhyAgentOS 采取以大模型为核心大脑、通过智能体(Agent)进行分层控制的架构,将“思考”和“执行”清晰解耦:
- 大模型专注于高级规划和推理;
- 底层系统负责可靠执行、状态监控、错误诊断和经验积累。
这种设计显著提升了系统的可调试性、可复用性和长期进化能力。
关键技术拆解:给机器人装上“统一操作系统”
PhyAgentOS 以 Session(会话) 为核心,构建了一套完整的任务管理系统,其关键设计包括:
1. Session 机制:全过程可管理、可追溯
Session 被设定为最小执行单元,不仅明确“要做什么”,还完整记录任务目标、Target 分配、Skill Runtime 选择、策略服务位置、执行限制以及安全条件。只有当目标、技能、传感器、动作格式及安全条件全部满足时,Session 才会启动。运行过程中,系统持续监控心跳、超时、取消请求及 SafetyGuard 状态。
2. Markdown 协议文件:系统状态透明可读
PhyAgentOS 采用结构化 Markdown 文件作为协议边界,使系统状态对研究者、工程师和 Agent 均透明可见。核心文件包括:
- TARGETS.md:设备名册,列出执行目标及其能力;
- SKILLRUNTIME.md:描述执行方式的输入输出;
- SESSIONS.md:记录任务工单及进度;
- ENVIRONMENT.md:描述场景关系和感知结果;
- LESSONS.md:沉淀预检、执行和验收中的经验教训。
此外,EMBODIED.md 描述本体能力,传感器配置和安全规则通过 YAML 定义。
3. Adapter 适配机制:跨平台兼容与安全
针对数据格式差异,PhyAgentOS 建立了三层适配关系:
- TargetAdapter:将原始数据转换为 Runtime 可理解形式;
- PolicyAdapter:转换策略模型的输入输出;
- ActionBridge:完成动作转换与约束处理。
执行前系统进行严格的兼容性检查(Preflight),不匹配则明确拒绝。安全方面涵盖认知侧 Critic、Runtime Preflight、Target 侧 SafetyGuard 及 Operator Override 人工干预权。
4. Session Verifier 与 Benchmarking
系统通过 Agent 侧的 SessionVerifier 进行最终结果判断,自动打包图像和环境快照等证据链。其 Benchmarking Skill 复用标准 Runtime,实现从任务生成、执行、记录到失败分析、Agent Retry 的闭环。在 LIBERO、CALVIN、RoboCasa365 等基准测试中,PhyAgentOS 显著提升了策略的最终完成率,并严格区分 First Attempt(策略原始能力) 和 Final Outcome(系统介入后能力)。
评估数据验证系统增益
PhyAgentOS 并不修改策略模型本身,而是通过统一 Session Runtime 组织完整闭环。根据材料提供的数据,其在多个基准测试中展现出明显的恢复和提升能力:
-
LIBERO 基准测试:
- Pi0.5:首次成功率 97.0%,经 Agent Retry 后提升至 97.8%;
- X-VLA:首次成功率 97.3%,最终提升至 98.6%(系统额外救回 26 个原本失败的 episode)。
-
CALVIN 长时序操作基准:
- PI0:五步完整成功率从 38.9% 提升至 45.6%;
- PI0.5:从 85.3% 提升至 89.4%;
- X-VLA:从 74.3% 提升至 75.7%。
-
RoboCasa365 家庭场景基准:
- PI0.5:总体成功率从 17.6% 提升至 26.8%;
- RLDX-1:从 35.6% 提升至 42.8%;
- WorldDreamer:从 34.0% 提升至 42.4%。
真实部署与游戏环境验证
除了实体机器人,PhyAgentOS 已在多种平台完成验证:
- Unitree Go2:无需编写底层驱动,十几分钟即可完成接入。
- 游戏环境:
- Minecraft:完成从自然语言指令到游戏内执行的完整链路。
- 星露谷物语:在 StarDojo Lite-100 多任务 benchmark 中,PhyAgentOS 基于 DeepSeek v4 Flash 取得总分 22.0%,超过 SPIKE (Qwen3.5-397B) 的 18.0% 与 SPIKE (GPT5.4) 的 20.3%。其中 Crafting 达到 50.0%(此前最高 baseline 为 19.0%),Combat 达到 16.7%(SPIKE 为 8.3%)。
- 饥荒:DeepSeek v4 Flash 的平均存活天数从 1.02 天提升至 2.10 天,Day 3 生存率从 0% 提升至 30%。
这些结果验证了物理智能体的瓶颈往往在于“系统能否确保动作在正确时机被可靠执行,并将反馈转化为长期经验”。
资源链接与展望
PhyAgentOS 旨在为研究者、开发者、高校师生及机器人自动化团队提供统一协议和可视化执行流程,加速真实部署。
- 项目官网:https://phy-agent-os.net/
- 技术报告:https://arxiv.org/abs/2607.16636
- GitHub:https://github.com/PhyAgentOS/PhyAgentOS
- 开发者社区:https://phy-agent-os.net/#/join-us
随着 AI 触碰真实世界,PhyAgentOS 试图通过提供清晰边界、可查证据及失败复盘机制,推动具身智能从“模型时代”迈向“系统可靠执行时代”。