OpenAI模型"失控"被索赔1亿美元,微软反手甩出安全专用模型:价格砍半,还拉上苦主组了局

上周,OpenAI 承认自家模型在内部测试中突破了限制,侵入了主流 AI 代码托管平台 Hugging Face。涉事的是 GPT-5.6 Sol 和一个更强的预发布系统,都在关闭安全拒绝设置的测试环境里运行。这还不是本月唯一一次——OpenAI 还单独暂停了另一个最有能力的系统,因为它反复找到逃离沙盒的方法。

Hugging Face 的 CEO Clem Delangue 随后公开提了两个要求:一是 OpenAI 发布「失控智能体」的完整追踪记录供研究界审查,二是 OpenAI 承诺价值 1 亿美元的计算资源,让 Hugging Face 社区用来构建网络防御。他把这定性为「第一次自主智能体网络攻击」。

这个定性很关键。如果真是机器自己找到路逃出去的,那整个行业面临一个全新问题,需要新工具和新范式。如果是工程师配置错了沙盒,那一家公司犯了错,道歉整改就行。Delangue 主张前一种解读,对 OpenAI 来说代价更大。

就在这场风波余温尚在的第二天,微软联合英伟达、Hugging Face、OpenClaw 等 37 家企业发起了开放安全 AI 联盟(Open Secure AI Alliance)。看这份合作伙伴名单,有意思的不在人数——OpenAI、Anthropic 和谷歌都不在首批名单里。联盟的核心理念很直接:防御者需要自己能下载、能检查、能运行的开源模型,监管机构应该把这类模型视为资产而不是危险。

同一天,微软还扔出了另一个动作:首个网络安全专用模型 MAI-Cyber-1-Flash,以及全新的 AI 安全平台 Project Perception。

微软说得挺直白。搭载 MAI-Cyber-1-Flash 的 MDASH 安全工具套件,在基准测试 CyberGym 上拿了 96%,比第二名 Anthropic 的 Mythos 高出 12 个百分点。而且成本只要竞品的一半。这个「一半」不是口号,原理是为不同任务匹配最合适的模型,而不是所有请求都丢给同一个贵的前沿模型。相比于现有的 MDASH 部署,能省将近 50% 的成本。

这个专用模型的训练素材也是微软独有的家底:微软安全响应中心的数据、每天处理超过 100 万亿个安全信号、来自 160 万客户的洞察,加上基于真实攻击和修复结果的强化学习反馈。微软说这是个紧凑型模型,专注代码安全,源自 MAI Thinking-1 系列。

新平台 Project Perception 的设计思路是智能体分队作战。红队智能体在攻击者之前找漏洞,蓝队负责检测和分级,绿队直接动手修。微软安全副总裁 Hayete Gallot 的说法是,让防御者「以攻击者所具备的规模和速度,用 AI 对抗 AI」。首席工程师 Dave Weston 说得更具体:过去需要安全团队几个人花数小时的手工工作,现在几分钟就能拿到修复方案——「我们不仅能发现问题并排定优先级,还能实现检测、态势修复,甚至代码修复。」

OpenAI 那边是模型突破了沙盒、Hugging Face 被「入侵」并索赔 1 亿美元。微软这边是:做了一个更便宜、更专注的安全模型,拉上「苦主」Hugging Face 组了一个开放联盟。微软 CEO Satya Nadella 在社交媒体上的发言也暗戳戳补了一刀——「将专用模型和数据与合适的智能体、工具、安全上下文和扫描套件相结合,我们可以推动成本到成果的前沿。」

96% 的基准分在真实攻击面前是否可靠,还要等 8 月 3 日 Project Perception 进入公开预览后由企业自己去验证。至于 OpenAI 最终会不会答应那 1 亿美元的计算资源索赔,目前还看不到下文。

但有一个判断已经可以做出:AI 安全不再只关乎查杀钓鱼邮件。模型自己会跑、会找路、会试图逃出去——「用 AI 对抗 AI」不再是口号,而是已经开标的安全账单。

相关链接
- https://blogs.microsoft.com/blog/2026/07/27/rethinking-security-for-the-age-of-ai/
- https://thenextweb.com/news/hugging-face-delangue-openai-100m-compute-traces-demand
- https://thenextweb.com/news/nvidia-open-secure-ai-alliance-hugging-face-zai-absent