LLM 终于有了算数验算员:AMTFV 把「反思」从嘴上功夫变成真干活

做 AI 应用的应该不陌生:模型把一道数学题解得头头是道,步骤看起来也对,最后答案就是错的。让它重新检查一遍,它往往说「抱歉,之前计算有误」,然后给出另一个同样错误的答案。反思了一圈,错的还是错。

这个问题卡了很长时间。现有方案大致两条路,都不太走得通。让模型用自然语言「反思」——再想一遍——但语言本身就不擅长精确计算,想多了也未必算对。让模型直接写段代码来验证,等于把数学建模和底层实现绑在一起,建模还没想清楚呢,先得把 Python 调对。

这两天 arXiv 上挂出来一篇新论文,Zou、Zhu、Wei、Wen 几位的工作,提出了一个更务实的拆法:AMTFV(Agentic Mathematical Tool-Flow Verification)。名字有点绕,思路很简单——把「规划怎么验证」和「实际执行计算」切开。

模型先构建一个验证工作流,把需要精确计算的数学对象和计算意图写成结构化的 MTF 请求,发给一个专门的数学工具箱 Agent。后者负责解析请求、生成可执行调用、发往后端做精确计算,再把结果送回。拿到工具输出之后,模型再来判断候选答案对不对、要不要改、甚至要不要调整验证流程本身。这么一拆,验证的建模阶段不用被底层实现细节打断,执行阶段又能保证计算是精确的——工具箱后端做的是真运算,不是语言模型在那「猜一个数」。

论文在 DeepSeek、GPT、Gemini 三个系列共 7 个模型配置上做了评测,跑了 5 个有挑战的数学推理数据集。整体结果优于当前已有的代表性基线;单模型配置下,相比最强基线平均准确率提升了最多 8.3 个百分点。而且提升主要集中在中等和高验证复杂度的样本上——题越难、越需要精细验证,收益越明显。8.3 个百分点在数学推理这个领域不算小。尤其是对正在搭数学辅导 Agent、自动化科研流程、或者任何需要 LLM 输出可验证结果的开发者来说,这个方向比「让模型多反思几轮」靠谱。

当然,论文还是论文。AMTFV 引入的 MTF 接口设计能不能在更多场景里泛化、工具箱的维护成本和推理延迟怎么控制、论文里没展开的工程细节还有多少——这些问题都得等代码和更多实测出来后才能判断。但至少它指了一条路:别让模型既当运动员又当裁判,给它配个专门的验算员,效果比让它自己反思好。

对做 Agent 产品、尤其是涉及数值计算、公式推导、数据校验的场景来说,这篇值得花 20 分钟读一下 PDF。里面那个把验证工作流和计算执行解耦的设计,可能比单纯让模型再想一遍更接近生产可用的形态。