CodeRescue:预算校准的恢复路由机制,优化编码智能体的成本效率

CodeRescue:预算校准的编码智能体恢复路由机制

一句话总结

本文提出了一种名为 CodeRescue 的新方法,通过在编码智能体失败时动态选择"低成本恢复"还是"升级至强模型",在控制计算成本的同时提升任务解决率。


一、要解决的核心问题

当 AI 编码智能体在执行代码时遭遇失败,传统的处理方式是"重试或换更强的模型"。但作者指出:

编码场景中的失败 ≠ 普通错误——它会产生可操作的执行反馈(如编译错误、运行时异常),这些信息可以被利用来指导恢复策略。

于是,一个关键问题浮现:如何智能地分配有限的预算?

决策选项 优点 缺点
低成本恢复 节省资金 可能无法解决复杂错误
升级至强模型 解决能力强 成本高

二、CodeRescue 的三层架构

第一层:恢复路由建模

将失败后的决策定义为异构动作空间中的路由选择,而非简单的二元选择。这意味着系统可以从多种恢复策略中挑选最优解。

第二层:监督式路由器训练

从实际执行数据中学习,让路由器能够根据具体失败情境预测最佳动作。这类似于给系统装了一个"决策大脑"。

第三层:Conformal Risk Control(CRC)层

这是本文最精巧的设计——在不重新训练路由器的情况下,通过调整部署时的成本惩罚参数,即可在不同预算约束下运行。CRC 理论保证了对边际期望成本的严格控制


三、关键实验结果

  • ✅ 在所有对比基线(固定策略、纯提示词路由、二元级联)上均表现更优
  • 核心亮点:在 GPT-5.4-nano / GPT-5.4 设定下,存在一个 CRC 校准点,其解决率超过"始终升级"策略,而成本仅为后者的 35%

这意味着:用不到一半的成本,实现了更好的效果。


四、为什么这项工作值得关注?

对工程实践

传统做法是预设一条固定的"降级→升级"路径,而 CodeRescue 提供了动态自适应的能力。配合 CRC 层的部署灵活性,团队可以在不改动模型的情况下快速调整成本-性能权衡。

对学术研究

将 conformal prediction 引入智能体系统的成本管控是一个新颖的方向,其方法论可扩展到数据分析 Agent、自动化运维 Agent 等其他领域。

对产品设计

对于面向客户的 AI 编码产品而言,这种机制直接关联到服务等级协议(SLA)的量化设计定价策略优化


五、资源索引

资源 链接
arXiv 摘要 https://arxiv.org/abs/2607.19338
PDF 全文 https://arxiv.org/pdf/2607.19338
HTML 版本 https://arxiv.org/html/2607.19338v1
GitHub 代码 https://github.com/Qijia-He/agent-budget-control

原文摘要已完整呈现。如需深入讨论某一部分或提取特定信息,请告知。