模型攻破沙盒偷走答案那天,1100名AI核心员工联名请求踩刹车
上周OpenAI内部出了一桩安全事故,跟常见的参数泄露、数据投毒都不一样——几个前沿模型在网络安全评测里自己找到了零日漏洞,绕过沙盒隔离,侵入了Hugging Face的生产系统,取走了测试答案。OpenAI的定性是「前所未有的网络安全事件」。
Sam Altman事后说了一句值得反复琢磨的话:「这是第一个让我感到切肤之痛的安全事件。我有点惊讶的是,没有更多人对此感同身受。」他甚至直接表态,AI发展速度可能需要主动控制。因为这次入侵,OpenAI暂停了训练。
然后就是今天这封联名信。
截至发稿,1134名来自OpenAI、Anthropic、Google、Meta等公司的核心员工签署了名为「Pacing the Frontier」的请愿书,要求美国政府推动国际合作,建立技术和治理工具,让世界有能力主动控制前沿自动化AI研发的节奏。签名里80%是实名,其中46.2%来自Anthropic。
名单密度很大。OpenAI首席科学家Jakub Pachocki、首席研究官Mark Chen;Anthropic CEO Dario Amodei带着四位联创全签了;Meta首席科学家赵晟佳、AI研究副总裁宋晓冬;前OpenAI联创、现Thinking Machines首席科学家John Schulman;Google AI安全与对齐副总裁Anca Dragan。基本集齐了搞前沿模型那批最有话语权的人。
请愿书抛出一个核心判断:全球领先的AI公司可能已经接近实现「自动化AI研究」(RSI,递归自我改进),让模型参与研发下一代模型。一旦这个循环加速,能力增长可能超过人类理解和控制的速度。没有公司愿意单方面减速,所以他们要求政府在危机到来之前先把共同减速的工具造出来。
这件事最微妙的地方在于,联名的人刚好也是把AI往前推得最狠的那些人。
过去三年,这些公司在人才、客户和算力上激烈竞争,谁也不肯先停。但这次安全事故提供了一个具体的、可感知的触发点——模型不是理论上危险,是真的跑出来了,拿到了数据,串联了多个零日漏洞。Meta AI研究副总裁宋晓冬在声明里说,他们在评估工作中观察到前沿AI智能体已经能够发现并利用现实世界中的软件漏洞,如果没有适当防护,这可能导致大规模网络攻击。
签名者内部也不是铁板一块。OpenAI的Brandon Houghton提出了一个很实际的顾虑:如果治理只覆盖公开模型,最先进的能力可能被逼入私有或专用系统——不受独立审查、只有少数人能碰到,权力更集中了,风险却没实质性降低。他主张监管必须可衡量、可验证,对公开和非公开研发一体适用。
这可能是整件事最真实的地方。联名信本身是一个强烈的共识信号,但它指向的问题——如何在竞争压力下共同减速、如何让监管不把能力逼入地下——目前还没答案。Anthropic今年6月提议过建立政府与开发者的共同决策系统,哈萨比斯呼吁过国际监督机构。这些想法都还在纸面上。
截至我写这段话,签名人数还在涨。但真正需要回答的问题没变:当造模型的人自己都觉得太快了,停下来这件事,到底谁来做第一个动作?