CM-LRS:从“看似合理”到“银行可用”——资本市场的LLM可靠性评估

从“看起来合理”到“银行可用”:CM-LRS 重塑资本市场 LLM 评估标准

在资本市场的核心工作流中,衡量大型语言模型(LLM)能力的标尺正在发生根本性转变。过去,我们或许满足于模型生成流畅的草稿;但在面对交易对手或监管机构时,真正的门槛在于这份草稿是否具备“银行可用性”(Bankable)——即它能否基于现有文档进行有效辩护。

近日,Prerit Ahuja 提交至 arXiv 的论文《Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable》[1] 指出,现有的评估体系难以满足这一严苛要求,并由此提出了一套全新的评估框架——CM-LRS

现有评估体系的局限:为何“流畅”已不够用?

当前针对金融领域的评估主要集中在两类:

  1. 开放域问答基准测试:往往奖励表面的准确性,却忽略了金融场景对严谨性的极致追求。
  2. 专业金融基准测试:如 FinanceBench、FinQA 和 ConvFinQA 等。虽然这些基准推动了基于文档和数值问答的进步,但它们主要评估的是“问答层面”,而非从业者需要真正为其负责的“工作流输出层面”

论文作者强调,在受监管的环境中,仅仅“看起来合理(Plausible)”是廉价的。真正的价值在于模型能否在复杂的工作流中,提供经得起审查的输出。

CM-LRS:七维度构建“银行可用”标准

为填补这一空白,研究团队引入了 CM-LRS,这是一种在工作流输出层面进行评估的方法。该框架包含七个核心维度,每个维度均依据受监管环境中审查者使用的信号进行锚定,评分范围为 0-5 分

  1. 事实准确性 (Factual accuracy)
  2. 证据可追溯性 (Evidence traceability)
  3. 数值一致性 (Numerical consistency)
  4. 工作流完整性 (Workflow completeness)
  5. 来源纪律 (Source discipline)
  6. 决策有用性 (Decision usefulness)
  7. 可审查性/可审计性 (Reviewability/auditability)

该分数的聚合方式可根据具体的工作流需求进行调整,确保了评估的灵活性与针对性。

实验设计与结果:前沿模型的激烈角逐

研究团队在五个典型资本市场工作流上演示了 CM-LRS 的效果,包括:
* DCM(债务资本市场)交易条款提取
* 先例检索
* 发行人概况综合
* M&A(并购)交易可比推理
* ECM(股权资本市场)交易条款提取

实验数据来源于公开的 SEC EDGAR 文件、一份公开的英国收购公告以及虚构的合成补充材料。研究对四个模型进行了评分,并使用跨越三个模型家族的四个独立 LLM 法官作为评审。

主要发现

1. 前沿闭源模型表现接近,差距微乎其微
在四位评委的平均 CM-LRS 评分中,前沿闭源模型表现聚集,差距仅在 0.22 分以内。具体得分为:
* Sonnet 4.6: 4.31 分
* Opus 4.7: 4.30 分
* GPT-5.5: 4.09 分

2. 开源基线明显落后
所有四位评委都将开源权重基座模型 Llama 3.3 70B 排在最后,其得分为 3.15 分

3. 性能差距集中在特定环节
这种性能差距主要集中在“检索”(差距 2.23 分)和“综合”(差距 2.15 分)环节,而在“提取”环节的差距较小(0.84 分)。这表明,简单的信息抽取相对容易,而复杂的推理与整合仍是难点。

4. “决策有用性”差异最大
“决策有用性”这一维度上,不同模型间的离散度是所有维度中最大的(在发行人概况评估中达到 4.0 分的差距),且顶级评委间的一致性最高(平均相关系数 r = 0.52)。这凸显了模型输出对实际业务决策支持能力的重要性。

结语

随着大模型深入金融核心业务,评估标准必须从简单的文本生成质量转向更严谨的业务合规与逻辑辩护能力。CM-LRS 的提出,标志着资本市场 AI 应用正在从追求“表面流畅”向追求“实质可靠”迈进。


参考文献:
[1] Prerit Ahuja. Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable. arXiv: 2607.21340, 2026. https://arxiv.org/abs/2607.21340