HiSkill 提出层级技能图,让 LLM Agent 不再「学完就忘」
写 LLM Agent 经常遇到一个落差:技能学了不少,真到用的时候还是抓瞎。
让 Agent 跑完一个长流程,把轨迹存下来,下次遇到类似任务翻出来参考——想法不错,实际存了一堆 flat list。Agent 记不住哪个技能对应哪个场景,也搞不清「做饭」和「开冰箱」有什么关系。高层次的意图和底层的可执行动作之间,始终隔着一层。
HiSkill 这篇论文想解决这个问题。作者是北京邮电大学的研究团队,7 月 28 号刚挂上 arXiv,代码和数据已开源。
思路是把技能组织成层级图。
HiSkill 把交互轨迹构建成一个有向图,包含两类节点——Skill 节点(高层技能)和 AtomicOp 节点(可执行原子操作),以及五种边:分解(大技能拆成小步骤)、时序(做完 A 该做 B)、兼容(哪些技能可以搭配用)、支持(技能依赖哪些底层操作)、恢复(出错能回退到哪)。一个技能嵌入在关系网络里,有明确的上下文和依赖关系。
推理时,HiSkill 先根据任务描述检索出一块相关的子图,然后带着它指导 Agent 执行。每一步看三个东西:当前的符号化状态、当前激活的技能、以及拿到的子图结构,据此决定下一步——切换技能、选原子操作、还是落地成具体动作。
论文在三个交互环境上做了实验,效果超过了已有的 SOTA 方案,同时推理阶段的 Token 消耗还降低了。
Token 消耗降了不是因为模型本身变强了——技能图帮 Agent 做了筛选,每次推理只需关注当前任务相关的局部子图,不必翻一遍所有历史轨迹。对做产品的团队来说,这意味着更低的延迟和成本。随着积累的技能变多,图结构反而能帮 Agent 定位更准。
这仍然只是一个研究框架,离产品级 Agent 还有距离。Agent 要能长周期工作,单靠 prompt 堆砌和 flat memory 撑不住,得有结构让技能可组织、可检索、可组合。HiSkill 给的是一套图结构的设计,代码和数据已开源,可以直接去 GitHub 翻。
相关链接
- 论文页面:https://arxiv.org/abs/2607.25853
- 代码和数据:https://github.com/BUPT-GAMMA/HiSkill