你让 AI 算信用卡罚息,它算对了数,但没看懂条款

你让 AI 算信用卡罚息,它算对了数,但没看懂条款

上个月我想确认一笔信用卡逾期会不会触发 penalty APR,顺手问了个模型。它把数字算得清清楚楚,连滞纳金都算对了。但我重读了一遍信用卡协议才发现——它漏了一行小字:只有在连续两期逾期的情况下,penalty APR 才会被激活。规则用了,但条件用错了。

最近被 CoLM 2026 接收的一篇论文,专门拿真实的信用卡协议去拷打大模型的推理能力。研究者搞了一个叫 CreditCardQA 的基准,从真实的信用卡协议里挖了 1800 道题,很多题还是第一人称问法——就是普通人会怎么问就怎么写,比如「我这个月账单 500 块,最低还款额是多少?如果晚还三天会怎样?」而不是学术数据集里那种规整的数学应用题。

他们把主流模型轮番测了一遍,两种推理方式都试了:Chain-of-Thought(让模型一步步想)和 Program-of-Thought(让模型写代码来算)。结果是 PoT 几乎全面占优,尤其对本身推理能力偏弱的模型,提升更明显,也能缩小开源和闭源模型之间的差距。让模型写几行 Python 去算,比让它自己推理更靠谱。

论文做了详细的错误分析。模型翻车的原因,绝大多数是金融规则理解错了,算错数的反而少。什么条件下触发滞纳金、哪些费用可以叠加、最低还款额的计算口径是什么——这些才是失分点。比较类、条件逻辑类、金额约束类的题目尤其难。

现在很多人在用 LLM 处理财务问题——算房贷、算利息、比价。但模型擅长的是计算本身,对理解条款并不在行。如果用户问的问题涉及嵌套条件或边缘情况,模型很可能给出一个数字完全正确、但规则完全用错的答案。

论文还发现,最容易出错的边缘场景,往往是那些对低收入群体影响更大的——比如小额账单的罚息处理、晚还几天的 penalty 触发条件。如果模型被用来辅助金融决策,最可能被它坑到的,恰好是最经不起坑的那批人。

CreditCardQA 本身不算大,1800 道题,但切入角度选得好——拿真实合同考察模型的规则阅读理解,不再在 GSM8K 或 MATH 上卷数学推理。这种能力在金融、法律、保险这些领域是刚需。

论文已经公开在 arXiv 上,数据集预期也会放出。PoT 比 CoT 好这个结论已经比较熟了。这篇工作更有价值的,是把问题从「会不会算」变成了「会不会读」。后者更难,也更接近真实世界里的坑。

下一步的问题是:如果连真实信用卡协议里的条件都读不全,放到保险条款、租赁合同、劳动协议里,又会漏掉什么?

相关链接

  • CreditCardQA 论文 (arXiv): https://arxiv.org/abs/2607.26952