LLM 写的优化模型,别再只看“跑通了”——ModelEquivBench 给出了七层验尸报告
前两天刷 arXiv 看到一篇论文,标题挺长,但做的事让我停下来认真读了一遍。它叫 ModelEquivBench,核心问题很简单:让大模型帮忙写一个优化模型——排产方案、物流调度、资源分配——返回一段代码,跑起来没报错,输出也像模像样,但谁敢直接把它丢进生产?
论文作者显然也对这种场景不放心。他们指出,现有的评估要么给一个「等价/不等价」的二元判决,要么只看执行成功率,但这两样都有问题。等价判断不透明,没法独立复核它到底怎么得出的;执行成功率就更虚了——代码能跑不意味着逻辑对,更不意味着它和原本想解决的那个问题是同一个问题。
ModelEquivBench 换了一套思路。它用一个七层语义剖面替代了单一总分,标记为 E0 到 E6。每一层检查一个不同的等价关系:从最基本的模型能不能构建和读取(E0),到表示层面的对齐(E1),到可行域映射(E2、E3),再到目标函数排序等价(E4)、最优值相等(E5),最后是最优解集等价(E6)。每一层给出的结论都附带可独立复核的证据——能复现的 trace、显式的映射、精确有理数证书,或者明确的反例。它给出的是一组分层判断——在哪个层面上对、在哪个层面上不对——每个判断都能自己去查一遍。
论文用这套系统测了三个模型快照——GPT-5.4、Claude Sonnet 4.6 和 Qwen3.5-397B-A17B——在 173 个基础问题上做了无修复评估(每个模型 346 个单元格)。粗粒度评分看不出来的差异,在 E0-E6 剖面下暴露得很清楚:49、35、25 个 cell 包含可执行的候选解,但至少在某个关系上被认证为负面;25、8、18 个结构性拒绝发生在 E2 已经验证了可行集映射等价的 pair 上。三个模型在不同阶段失败,没法用一个准确率分数来概括。
这个结论本身不算意外——早就知道不同模型擅长不同的事——但 ModelEquivBench 的价值在于它提供了一种可追溯、可复核的评估框架。如果你正在把 LLM 塞进决策优化的工作流里,这个工具比一个大模型评测榜单更值得花时间看。
论文附了补充材料,代码和数据后续应该也会公开。我打算等资源放出来后跑一下自己常用的几个场景,看看模型到底在哪个层级上掉链子。毕竟,「跑通了」和「跑对了」之间,差的可能是一整条产线。
相关链接
- 论文:https://arxiv.org/abs/2607.29431