CodeRescue:预算校准的恢复路由机制,优化编码智能体的成本效率
CodeRescue:预算校准的编码智能体恢复路由机制
一句话总结
本文提出了一种名为 CodeRescue 的新方法,通过在编码智能体失败时动态选择"低成本恢复"还是"升级至强模型",在控制计算成本的同时提升任务解决率。
一、要解决的核心问题
当 AI 编码智能体在执行代码时遭遇失败,传统的处理方式是"重试或换更强的模型"。但作者指出:
编码场景中的失败 ≠ 普通错误——它会产生可操作的执行反馈(如编译错误、运行时异常),这些信息可以被利用来指导恢复策略。
于是,一个关键问题浮现:如何智能地分配有限的预算?
| 决策选项 | 优点 | 缺点 |
|---|---|---|
| 低成本恢复 | 节省资金 | 可能无法解决复杂错误 |
| 升级至强模型 | 解决能力强 | 成本高 |
二、CodeRescue 的三层架构
第一层:恢复路由建模
将失败后的决策定义为异构动作空间中的路由选择,而非简单的二元选择。这意味着系统可以从多种恢复策略中挑选最优解。
第二层:监督式路由器训练
从实际执行数据中学习,让路由器能够根据具体失败情境预测最佳动作。这类似于给系统装了一个"决策大脑"。
第三层:Conformal Risk Control(CRC)层
这是本文最精巧的设计——在不重新训练路由器的情况下,通过调整部署时的成本惩罚参数,即可在不同预算约束下运行。CRC 理论保证了对边际期望成本的严格控制。
三、关键实验结果
- ✅ 在所有对比基线(固定策略、纯提示词路由、二元级联)上均表现更优
- ✅ 核心亮点:在 GPT-5.4-nano / GPT-5.4 设定下,存在一个 CRC 校准点,其解决率超过"始终升级"策略,而成本仅为后者的 35%
这意味着:用不到一半的成本,实现了更好的效果。
四、为什么这项工作值得关注?
对工程实践
传统做法是预设一条固定的"降级→升级"路径,而 CodeRescue 提供了动态自适应的能力。配合 CRC 层的部署灵活性,团队可以在不改动模型的情况下快速调整成本-性能权衡。
对学术研究
将 conformal prediction 引入智能体系统的成本管控是一个新颖的方向,其方法论可扩展到数据分析 Agent、自动化运维 Agent 等其他领域。
对产品设计
对于面向客户的 AI 编码产品而言,这种机制直接关联到服务等级协议(SLA)的量化设计和定价策略优化。
五、资源索引
| 资源 | 链接 |
|---|---|
| arXiv 摘要 | https://arxiv.org/abs/2607.19338 |
| PDF 全文 | https://arxiv.org/pdf/2607.19338 |
| HTML 版本 | https://arxiv.org/html/2607.19338v1 |
| GitHub 代码 | https://github.com/Qijia-He/agent-budget-control |
原文摘要已完整呈现。如需深入讨论某一部分或提取特定信息,请告知。