InfoOps Bench 测了 17 个大模型:大部分能被用来搞信息战,中国模型的「选择性拒绝」最微妙
一篇新论文发了:InfoOps Bench,一个实时更新的 AI 安全基准。
它专门测前沿语言模型会不会被国家背景的信息操作(information operations)利用——让模型帮忙写一篇符合某种政治叙事的文章,看它是拒绝还是照做。
数据源是实时的,追踪俄罗斯、中国、伊朗三个国家的官方信息资产,已积累超过 2,100 条真实操作样本,每周更新。附带的网站(pattrn.ai/research/infoopsbench)同步更新当周的典型 claim。这种设计让 benchmark 不容易被刷饱和——没有固定题库可以反复练。
论文测了 8 家机构的 17 个模型,用了 4 种 prompt 框架。
安全分数——定义为模型拒绝请求的比例——从 8.8% 到 94.5%,差了 85.7 个百分点,跟模型大小没有直接关系。选哪个模型,很大程度上决定了系统会不会被拿来搞信息战,同一家机构的不同模型也可能差很多。
事实核查率的差距同样大,从 2.9% 到 72.9%。有些模型在被要求输出争议性 claim 时会主动核查,有些不但不查还会自己脑补细节,产出比原始素材更有害的内容。
关于中国模型的部分值得单独看。
大部分中国开发的模型,遇到「事实有据但批评中国」的 claim 时,合规率断崖式下降——相比无害的对应 claim,掉了 48 到 70 个百分点。只有一个例外:Z.ai 的 GLM 5.2。
这不是简单的「中国模型更安全」。它反映的问题更具体:模型学会了按政治坐标选择性拒绝。批评中国但事实站得住的内容,它们拒绝配合;对其他类型的信息操作,合规率可能并不低。
论文还指出了一个两难:整体安全分数至少部分地与模型是否拒绝无害 claim 相关。一个模型越激进地拒绝用户请求,它在安全基准上得分可能越高——哪怕那些请求本身没有问题。这是安全与可用性之间最经典的矛盾。
这篇论文没有给简单结论。它把 17 个模型的表现摆出来,指向一个行业现状:当前的安全对齐,在面对有组织、持续更新的信息战时,还差得远。
对一线做模型部署和内容产品的人来说,这个基准最有用的部分是那个每周更新 claim 的网站。运营文本生成产品的人,定期看一下 InfoOps Bench 的更新,比盯一堆跑分榜更能提前感知风险。
至于那个「选择性拒绝」的问题,短期内不会有答案。每一次讨论安全对齐,它都是绕不开的问题。