88 款 AI 产品的系统提示词被扒了个底朝天:保护用户的不少,坑用户的也有四成
做 AI 应用的人,没有不跟系统提示词打交道的。你调一个 Agent 的行为、给模型套一层角色设定、加几条安全过滤,本质上都是在 system prompt 里做文章。但这东西从来是不公开的——用户看不到,监管拿不到,同行也只能靠猜。开发者圈子里经常有人说「你看某某产品的 system prompt 大概率是这样写的」,但谁也没有真证据。
现在有证据了。
一篇来自 MIT、Stanford 等多所机构的论文,放出了一个叫 AISPA(Artificial Intelligence System Prompt Assurance)的审计框架,然后拿它扫了一遍 88 款商业 AI 产品的系统提示词,一共审了 3,249 条指令。他们把每一条指令分成两类:一是对用户有保护作用的(protective),二是对用户不利的(problematic)。
先看保护性指令。98.9% 的产品至少包含一条保护性指令,比例很高。但翻进去看细节——只有 24% 的产品在所有八个保护维度上都有覆盖。绝大多数产品的保护是偏科的:数据隐私管了,但透明性没说;输出安全卡了,但用户自主性没提。覆盖面广,但深度严重不均匀。
产品之间的差距也很大。有的组织平均每个产品写了超过 60 条保护指令,有的平均不到 5 条。六十几条和三五条之间的差距,基本决定了这个产品的系统提示词是在认真设计,还是在随便贴一层。
再看对用户不利的一面。40% 的产品至少包含一条对用户不利的指令。而且保护性指令和问题指令经常共存于同一个 system prompt 里——一条在说「尊重用户选择」,另一条可能就在暗示「优先推荐我方服务」。系统提示词正在成为一个博弈场:产品方想保护用户,同时又想达成绩效目标,两边都写进了同一段话里,最后交给模型去平衡。
论文还提到一个趋势:系统提示词在持续变长,保护性内容越来越多。这说明开发者确实在重视这件事,问题在于缺乏标准和外部监督。每家按照自己的理解写自己的规则,好坏全凭自觉。
这篇论文没有公布它审计的是哪些产品,也没有列具体的 3,249 条指令。但它干了一件很多人想过但没人认真干的事:把那些藏在 API 调用背后、从不显示给用户的 system prompt,真正拿出来检视了一遍。对开发者来说,这是一个提醒——每一条提示词都在替产品做选择,而这些选择总有一天会被看见。