AI 干会计:最好的模型也只拿了 56 分,没一个及格
前阵子跟一个做代账的朋友聊天,他说他们公司已经开始用 AI 做初筛,但账目对不平的时候还是得人上。我当时想的是,这东西早晚能全自动吧?今天看到 Mercor 联合 Ramp 发的这个新基准 APEX-Accounting,答案比我想的残酷得多。
这俩公司整了一个会计能力测试,不是让 AI 回答会计准则选择题,是扔给它一个完整的虚拟公司——有账套、有电子表格、有 PDF 发票、有各种业务文件,让它干真正的会计活:对账、计提费用、录凭证、出报表。一共 160 个任务,分布在 10 个「世界」里,每个世界都是一个完整的企业会计环境。
然后他们测了 9 个前沿模型。猜猜最好的成绩是多少?
第一名 Claude Fable-5(Max 配置),Mean Criteria@3 得分 56.4%。第二 Muse Spark-1.1(xHigh 配置)52.6%。这俩算是「勉强过半」,但离能扔进真实财务流程差得远。更扎眼的是 Pass^8 这个指标——考核模型在 8 次尝试里至少有一次完全正确的比例——没有一个模型超过 2.6%。Pass@8 最高的是 Muse Spark-1.1 的 21.5%,也就是说顶级模型跑 8 次,只有五分之一左右的机会能完全做对一道会计题。
翻译成人话:现在最聪明的大模型,干会计还不如一个刚实习三个月的专科生。
有个实验细节很有意思。他们尝试把 token 预算从 1 美元提到 50 美元,结果观察到了一个辛普森悖论:总的来看,给的钱越多分数越高,但固定在一个预算档位内的时候,花 token 越多的任务反而得分越低。说明模型在复杂任务上拼命算,算得多错得也多,硬算解决不了会计这种需要精确判断的问题。
这个基准是闭卷的,公开 dev 集放在了 HuggingFace 上,但正式的 leaderboard 评估需要找他们申请跑分。也就是说不能自己偷偷刷题再上去考。
我对这个结果不算意外。会计工作的难点从来不是「知不知道规则」,而是文件乱、格式杂、信息散落在不同地方,需要大量 context 拼接和行业判断。模型在当前架构下,面对这种场景的容错率太低。56% 这个数字说明它在标准化、结构化任务上已经能帮上忙——比如初筛、对账辅助——但真到出报表、做调整分录这一步,人还得盯着。
所以别急着喊财务要被 AI 取代了。取代是迟早的事,但至少今天,会计这份工还稳稳攥在人类手里。
如果你想自己试试模型的会计能力,他们的公开 dev 集在这里:https://huggingface.co/datasets/mercor/apex-accounting