PalmClaw:原生移动端 Agent 框架上线,任务成功率提升 11.5%

核心事件

2026 年 7 月 14 日,论文 PalmClaw: A Native On-Device Agent Framework for Mobile Phones(arXiv:2607.13027)正式提交至 arXiv。该研究由 Hongru Cai、Yongqi Li、Ran Wei 和 Wenjie Li 四位作者完成,提出了一种在移动设备上原生运行的开源 Agent 框架——PalmClaw。


背景:移动端 Agent 的困境

当前,大型语言模型(LLM)Agent 已从单纯的文本生成走向多步骤任务执行——通过调用工具、观察结果并迭代决策来完成任务。然而,绝大多数 Agent 系统运行在桌面或服务器上,这些环境天然支持工具调用和任务自动化。

与此同时,移动设备作为 Agent 的运行环境具有独特优势:它们广泛普及、包含用户数据、传感器以及日常使用的应用程序。但现有移动端 Agent 主要通过对图形用户界面(GUI)执行点击、滑动和输入等动作来操控智能手机。这种方式的局限性在于:

  • 容易形成与界面强相关的长序列操作;
  • 无法直接访问设备底层能力;
  • 执行边界难以清晰定义。

PalmClaw 的设计思路

PalmClaw 的核心创新在于"原生"二字。它直接在手机端管理会话(sessions)、记忆(memory)、技能(skills)、工具(tools)以及 Agent 循环(agent loop),而非依赖 GUI 模拟操作。

具体而言,PalmClaw 将设备能力暴露为"设备工具"(device tools),具有以下特征:

  • 明确的参数:每个工具调用带有显式参数;
  • 结构化结果:输出格式统一且可解析;
  • 清晰的执行边界:每项操作的起止点明确可控。

这种设计使 Agent 能够直接使用手机的能力,同时确保每一步操作都明确且受控。


实验结果

根据论文摘要披露的数据,PalmClaw 在与最强基线(strongest baseline)的对比中取得了以下成绩:

指标 结果
任务成功率相对提升 +11.5%
完成时间缩减 94.9%
设置负担 更低

此外,框架还提供了执行轨迹(traces),可用于分析执行边界的具体应用方式。


资源链接


行业观察

从技术路线来看,PalmClaw 代表了一种从"界面模拟"向"原生集成"转变的趋势。对于 AI 从业者和开发者而言,这意味着移动端 Agent 的开发范式可能从基于 GUI 识别和模拟操作,转向利用设备原生 API 进行能力调用。

对于创业者来说,这一方向也暗示了新的机会窗口:原生设备能力与 LLM Agent 的结合,可能在个人助理、自动化工作流等领域催生更具实用价值的应用形态。

代码已开源,开发者可以前往 GitHub 仓库获取完整实现并进行复现验证。