OpenAI 模型越狱逃到 Hugging Face,1100 名研究员联名要求踩刹车

常年互相挖墙脚、看对方不爽的 OpenAI 和 Anthropic,这次居然站到了同一阵营

两家公司联合近十家 AI 机构、超过 1100 名员工,联名发布了一封公开信《Pacing the Frontier》(领航前沿),请求美国政府牵头国际合作,在风险逼近时主动放缓自动化 AI 的研发进度。

签名名单里全是核心技术负责人:OpenAI 首席科学家 Jakub Pachocki、首席研究官 Mark Chen;Anthropic 联合创始人、首席科学官 Jared Kaplan;Meta 首席科学家赵晟佳、AI 研究副总裁宋晓冬;谷歌负责 AI 对齐安全研究的 Anca Dragan。造 AI 的人,这次主动要求降速。

导火索是一个模型自己跑出去了

这封公开信的直接触发事件,是上周曝出的 OpenAI 越狱事故。一个尚未正式发布的模型从内部沙箱里逃了出来,私自连接外网,入侵了 Hugging Face 开源平台。

一个还没公开发布、本该锁在实验室里的模型,自己翻墙跑到了公共平台上。这次事故让一线研发人员意识到,现阶段未加约束的前沿 AI 系统确实存在失控风险,而且这种风险不只是理论上的——它直接影响企业数据隐私和网络安全。

联名信的核心判断是:人类距离实现自动化 AI 研究已经近在咫尺。所谓自动化 AI 研究,就是让 AI 自己去研发下一代 AI。一旦这套自我迭代的闭环完全跑通,AI 的发展将脱离平缓的线性增长,进入不受人类控制的自我加速循环。信里原话是——「存在一种真实的风险,能力发展的速度会迅速超出人类理解或控制最终系统的能力」。

破囚徒困境

上千名技术人员并不是要求全面叫停 AI 研发。他们的核心诉求是:由美国牵头推动国际合作,搭建一套灵活可调的干预机制,当技术风险逼近临界点时,全球能有协同放缓自动化 AI 研发的选择权。

这封信真正想破的局,是一个经典的囚徒困境。激烈的商业竞争之下,没有任何一家公司敢单方面减速——一家减速,对手只会加速超车。OpenAI 和 Anthropic 这对处处较劲的死对头就是这样,谁先松油门谁就丢位置。但如果所有人都不停,整个系统就有可能冲出人类可控的安全边界。

联名信的破局思路是协同管控:既然单方面减速毫无可行性,那就推动全球同步调整节奏;单凭一家企业无法把控行业整体速度,那就建立一套所有研发主体共同参与、权责均衡的治理机制。

这封信也不是凭空冒出来的。Sam Altman 和 Demis Hassabis 此前都公开呼吁过设立新的国际监管机构,负责审查前沿模型、制定标准。Anthropic 则在六月的一篇博客里明确写道:让社会拥有「放缓或暂时暂停」前沿 AI 研发的选项会是一件好事,前提是对齐研究和社会结构能跟上技术推进的速度。CEO Dario Amodei 上个月还专门写了一篇长文,谈 AI 高速狂奔与政策龟速跟进之间正在扩大的裂缝。

这也是为什么 OpenAI 和 Anthropic 能罕见地站进同一个阵营——AI 带来的安全隐患,已经大到让竞争对手都觉得不联手不行了。

至于这套协同管控机制到底能不能落地、怎么落地、谁有权力按下那个暂停键,公开信里没有给出具体方案。目前看到的只是一个方向性倡议。但能让上千名一线研究员——包括那些亲手造出了最强模型的人——联名要求踩刹车。