大模型押注世界杯:104 场比赛预测完,开卷考只涨了 0.023

昨天刷 arXiv 看到一篇有点意思的论文,来自慕尼黑工业大学那帮人。他们搞了个叫 LLM-SoccerArena 的基准测试平台,专门测大模型在真实体育赛事上的预测能力——不是考模型记住了多少历史知识,而是让它预测还没发生的事。

这和实际用 LLM 的场景更接近:问模型「下赛季哪支球队能进欧冠四强」或者「明天美联储加息的概率多大」,它不是翻课本,是在做判断。而过去绝大多数 benchmark 都是静态的、回溯式的,考的是模型已经知道的东西。这个团队想换一种玩法:让模型预测 2026 年世界杯,结果出来之前就锁定预测,不准事后改。

他们拉来了 7 个模型,包括 GPT-5.5 和 Claude Opus 4.8,对 104 场比赛和 15 个赛事相关问题做预测。设计上控制了四个变量:模型版本、信息获取方式(能不能上网)、提示策略、预测时间窗口。

最值得说的发现是:给模型开卷考——开放 web 访问——确实提升了预测准确率,但幅度很小,Brier score 只降了 0.023。Brier 分数是概率预测领域常用的误差指标,越小越准。0.023 这个差异,放在体育预测的场景里,大致相当于一个稍微不那么差的状态。

直觉上,联网搜索能帮模型拿到最新赔率、伤病名单、赛前新闻,预测应该准不少。但数据来看并非如此。可能的解释是:模型核心的判断能力来自预训练阶段积累的足球知识——它已经看过足够多的比赛数据、战术分析和历史赔率,多给几条赛前新闻带来的边际收益其实有限。另一个可能是模型本身不擅长把搜索到的信息正确地整合进预测里,信息多了反而引入噪声。

这个平台的另一个特点是全程自动、时间戳锁定、schema 校验,并且开源。以后任何一届大赛——欧洲杯、美洲杯、五大联赛——都可以拿来跑一组预测,结果直接对比。

在现阶段的 AI 评估里,这种「面向未来的预测 benchmark」比大多数人意识到的更重要。大量的行业落地场景——供应链计划、库存管理、贷款审批、临床决策——本质上都是在不确定性下做预测。如果 LLM 在这类任务上表现得不够稳定,那光靠刷 MMLU 和 HumanEval 并不能说明什么。

体育预测只是切入点。足球比赛的变量相对可控,结果空间有限。把同样的方法搬到经济指标预测、选举预测、气候风险预测上,复杂度会高出几个量级。LLM-SoccerArena 的价值在于提供了一个范式:搭一个类似的开源平台,让模型在事件发生前锁定预测,然后等着看结果。

我比较期待看到的是更大规模的测试——比如不同联赛、不同运动类型,以及模型在长时间的连续预测中会不会出现策略退化。另外,0.023 这个差距到底是不是统计显著,论文里没有明确说,这个细节值得关注。

平台和代码都已经放了,项目主页是 https://llm-soccerarena.com,论文在 arXiv:2607.24573。下一个大赛季开始前,拿模型上去跑一轮,应该比看别人写综述有用。