只看输出就能还原你的 Prompt——这篇新论文把 LLM 反推做到了「近乎精确」
用 LLM API 搭产品、写工作流,或者花了不少精力调 system prompt 的团队,这篇论文值得留意。
7 月 31 日,arXiv 上出现了一篇论文,标题翻译过来是:基于前一个 Token 预测的 LLM 反推方法,实现近乎精确的 Prompt 重建。作者是 Pirzada Suhail、Nagasai Saketh Naidu、Atanu R Sinha 和 Amit Sethi,编号 2607.29378。
核心发现:在完全黑盒的条件下——不需要拿到模型权重,也不需要看 logits——仅凭 LLM 输出的文本,就能以接近原文的精度把输入的 prompt 还原出来。
这不是语义级别的「猜个大概」。之前的工作走的是语义重建路线:用额外的 seq-to-seq 模型在外部数据集上微调,同时需要访问模型权重或 logits,最终也只产出一个「意思差不多」的 prompt。这篇论文走了一条不一样的路。
作者训练了一个专门的逆向语言模型,完全从零开始,训练数据来自目标 LLM 自己生成的合成数据。技术上对标的是正向的 next-token prediction(预测下一个 token),但改成预测上一个 token——previous-token prediction。正反两个方向在结构上形成对称,这让逆向生成在信息保真度上和之前的工作拉开了差距。
它不止能还原一个 prompt。通过采样,模型可以生成多个不同但都能诱导出相似响应的 prompt。这提供了一个新视角:一个 LLM 输出背后,对应着什么样的输入空间。
论文还做了跨数据集和跨模型迁移的实验。用某个 LLM 训练出来的逆向模型,可以在其他 LLM 的输出上也有重建能力。在基于 token 的评估指标上,他们称全面超过了之前的工作。
我看到这篇论文的第一反应不是技术兴奋,而是一个有点麻烦的问题:在 API 里精心设计的 prompt 如果可以被别人从输出反推,那 system prompt 还安全吗?
现在不少 AI 产品把 prompt 当成核心资产——客服 prompt、内容策略 prompt、审核 prompt、流程编排 prompt——这些都是花时间调出来的,有些直接写在商业合同里作为交付物。输出本身就足以还原输入,「我的 prompt 只有我自己知道」这个假设可能站不住脚。
当然也得冷静。这是一篇 arXiv 论文,还没有看到实际的攻击工具化或大规模验证。评估指标基于 token 匹配,不是语义层面的百分百一致。而且从论文描述看,它需要针对目标 LLM 生成训练数据并训练专用模型——不是随便拿一段输出就能一键反查。但 LLM 的输出透露的信息远超多数人的预想。
对于正在做 AI 产品的团队,这是一个及时的提醒:在意 prompt 隐私的话,可能需要开始考虑输出层面的扰动、对 system prompt 做分段隔离设计,或者至少不要把最敏感的指令写在任何人都能通过 API 输出反推的位置。
论文在 arXiv 上可以全文查看,感兴趣的可以去翻具体的实验设置和指标。离产品化还有距离,但值得放进安全评估清单里。