PalmClaw:原生移动端 Agent 框架上线,任务成功率提升 11.5%
核心事件
2026 年 7 月 14 日,论文 PalmClaw: A Native On-Device Agent Framework for Mobile Phones(arXiv:2607.13027)正式提交至 arXiv。该研究由 Hongru Cai、Yongqi Li、Ran Wei 和 Wenjie Li 四位作者完成,提出了一种在移动设备上原生运行的开源 Agent 框架——PalmClaw。
背景:移动端 Agent 的困境
当前,大型语言模型(LLM)Agent 已从单纯的文本生成走向多步骤任务执行——通过调用工具、观察结果并迭代决策来完成任务。然而,绝大多数 Agent 系统运行在桌面或服务器上,这些环境天然支持工具调用和任务自动化。
与此同时,移动设备作为 Agent 的运行环境具有独特优势:它们广泛普及、包含用户数据、传感器以及日常使用的应用程序。但现有移动端 Agent 主要通过对图形用户界面(GUI)执行点击、滑动和输入等动作来操控智能手机。这种方式的局限性在于:
- 容易形成与界面强相关的长序列操作;
- 无法直接访问设备底层能力;
- 执行边界难以清晰定义。
PalmClaw 的设计思路
PalmClaw 的核心创新在于"原生"二字。它直接在手机端管理会话(sessions)、记忆(memory)、技能(skills)、工具(tools)以及 Agent 循环(agent loop),而非依赖 GUI 模拟操作。
具体而言,PalmClaw 将设备能力暴露为"设备工具"(device tools),具有以下特征:
- 明确的参数:每个工具调用带有显式参数;
- 结构化结果:输出格式统一且可解析;
- 清晰的执行边界:每项操作的起止点明确可控。
这种设计使 Agent 能够直接使用手机的能力,同时确保每一步操作都明确且受控。
实验结果
根据论文摘要披露的数据,PalmClaw 在与最强基线(strongest baseline)的对比中取得了以下成绩:
| 指标 | 结果 |
|---|---|
| 任务成功率相对提升 | +11.5% |
| 完成时间缩减 | 94.9% |
| 设置负担 | 更低 |
此外,框架还提供了执行轨迹(traces),可用于分析执行边界的具体应用方式。
资源链接
- 论文页面:https://arxiv.org/abs/2607.13027
- PDF 全文:https://arxiv.org/pdf/2607.13027
- 实验性 HTML 版本:https://arxiv.org/html/2607.13027v1
- 源代码:https://github.com/ModalityDance/PalmClaw
- DOI:https://doi.org/10.48550/arXiv.2607.13027
- 许可证:非独占分发许可
行业观察
从技术路线来看,PalmClaw 代表了一种从"界面模拟"向"原生集成"转变的趋势。对于 AI 从业者和开发者而言,这意味着移动端 Agent 的开发范式可能从基于 GUI 识别和模拟操作,转向利用设备原生 API 进行能力调用。
对于创业者来说,这一方向也暗示了新的机会窗口:原生设备能力与 LLM Agent 的结合,可能在个人助理、自动化工作流等领域催生更具实用价值的应用形态。
代码已开源,开发者可以前往 GitHub 仓库获取完整实现并进行复现验证。