AI竞赛不是赌风险,是怕掉队——一篇实验论文找到了不安全开发的真正推手
AI圈聊了两年"竞赛导致不安全开发",从OpenAI到Anthropic到国内的几家,大家都在拼命抢速度,每次有同行发布新模型,办公室里就会有人问:我们是不是该把安全审查周期压缩一下?
这个纠结不是段子。一篇7月28日挂在arXiv上的论文,直接用行为实验把它量化了。
论文标题是 Falling Behind Drives Unsafe Development in an Idealised AI Race Experiment,作者是Elias Fernández Domingos和The Anh Han。他们设计了一个简化版的AI竞赛实验——两个参与者配对,反复在Safe和Unsafe两种开发策略之间做选择,不知道比赛什么时候结束。Unsafe选项的设定是进度更快、单轮收益更高,但会积累私人风险。实验设了三组风险上限:10%、60%、90%。
有人可能会猜"风险容忍度高的人更可能选Unsafe",但论文的第一个结论就是打脸的。数据没有支持这个直觉。实验前注册的关于风险偏好影响的主假设,没被验证。
真正驱动不安全行为的,是赛道上的相对位置。
当对手在前一轮选了Unsafe,参与者选Unsafe的概率显著上升;处于领先位置时,选Unsafe的概率下降;落后时,选Unsafe的概率飙升。第一轮的选择还有很强的惯性——开局选了Unsafe的人,后面更难回头。
不是"这个人本来就爱冒险",而是"我不能让对面跑太快"。
这在AI行业里有一个很真实的对应——安全承诺往往是在领先的时候喊的,对手先发了激进版本之后,安全审查就成了可以压缩的成本。驱动因素是相对位置的变化。
论文还搞了一个进化博弈模型,定义了四种策略:Always Safe、Always Unsafe、Conditionally Safe(你安全我就安全)、Conditionally Antisocial Safe(你安全我还不安全)。模型跑出来的结果跟真人实验一致——竞赛压力本身就能筛选出条件性不安全行为,跟个人的风险偏好关系不大。
这个结论对AI治理挺有杀伤力的——就算每个实验室都招了最好的安全团队,只要竞赛压力不变,不安全开发的概率仍然会升高。这是结构性的压力。
论文两位作者在讨论部分给出的政策建议是——与其只盯着"让开发者更负责",不如直接减少竞赛压力本身,比如推动透明度协议、建立安全审查的共同窗口期、让实验室在安全措施上合作而不是单边行动。
当然这是一个简化实验。真实的AI竞赛比两个玩家选Safe/Unsafe复杂得多,有多家竞争、不同技术路线、外部监管介入。但论文抓住了一个核心机制:落后是比贪婪更直接的驱动因素。
在AI公司做安全或治理的人,可以翻翻这篇论文。它最有价值的结论是——不改变竞赛结构,光靠自律压不住那根弦。
相关链接
- 论文页面:https://arxiv.org/abs/2607.26034
- PDF全文:https://arxiv.org/pdf/2607.26034
- HTML版(实验性):https://arxiv.org/html/2607.26034v1