AI 检测器被改写文本打回原形:准确率从 93% 暴跌到 15%,一个新基准暴露的盲区

用 AI 文本检测器判断一篇文章是不是 AI 写的,这件事的难度可能一直被低估。大部分检测器在标准测试集上表现不错,能认出 90% 以上的纯 LLM 生成文本。但现实场景中很少有人直接把模型吐出来的东西交出去——更多情况是,人在 AI 生成的基础上改几段,或者反过来,用 AI 润色自己写的内容。刚挂上 arXiv 的一个新基准测试表明,检测器在这种「改写」场景下,几乎直接报废。

这篇由 Gaetano Perrone 和 Simon Pietro Romano 发布的论文,提出了一个叫 ARB(Authorship-Rewriting Benchmark)的数据集。设计思路很直接:检测器的真实使用场景经常是判断文本有没有被 AI 改过,而标准测试集只看它是不是 AI 直接生成的,测试就该往真实场景靠。

ARB 从 XSum、WritingPrompts、OpenWebText 三个数据集各取了 600 条文本,总共 1800 条人类源文本。每条源文本被处理成四个版本:原始人类写的(HUMAN)、直接让 LLM 生成的(Free-LLM)、让 LLM 改写人类文本(H2L)、以及让同一个 LLM 改写 LLM 生成的文本(LLM2L)。用来干改写和生成的是四个开源模型:Llama-3.2-3B、Qwen2.5-7B、Mistral-7B、Gemma-2-9B。

然后他们用五个检测器在 1% 误报率这个严格阈值下跑了一遍。结果非常难看。

FastDetectGPT 检测直接 LLM 文本时有 91.2% 的召回率,但到了改写后的人类文本上只剩 30.8%,掉了 60 个百分点。Binoculars-falcon-7b 更惨,从 93.5% 直接跌到 15.1%,降了将近 78 个百分点。RADAR 从 66.8% 掉到 12.2%。两个基于 BERT 和 RoBERTa 的检测器更不用说,在所有场景下召回率都不到 3%。

如果一个作者先用自己风格写一段话,再让 AI 改一遍措辞,目前最好的检测器也基本认不出来。

有一个发现:当 LLM 生成的文本被同一个模型自己改写时(LLM2L 场景),FastDetectGPT 和 Binoculars 分别保住了 78.3% 和 83.0% 的召回率,只掉了 10-13 个点。这说明检测器对改写来源很敏感——它们能识别 AI 改写 AI 的痕迹,但对 AI 改写人类文本基本失灵。

这个结果指向了一个很实际的问题:现在绝大多数 AI 文本检测 benchmark 用的都是「人类写 vs. AI 直接生成」的对比框架,但真实世界的文本生产流程要复杂得多。人用 AI 写大纲、自己写正文、再让 AI 润色,或者写了初稿让 AI 改表述——这些才是常见操作。检测器在标准测试集上的表现,在这个场景下几乎没有任何预测价值。

论文没有给出解决方案。这是一篇测量和揭露问题的论文,不打算提出新方法。但它说清了一件事:在生产环境里部署了某个检测器,如果测试报告只给了它在标准 benchmark 上的分数,那它对「改写后的人类文本被 AI 污染」的检测能力,基本是盲的。

检测领域的竞争重点正在变化:以前看谁更能抓出 AI 写的文本,现在看谁更能识别 AI 参与的文本。ARB 提供了一个更逼近真实语境的测试起点。接下来要看的是,有没有检测器能在这个新基准上跑出还看得过去的数字,以及——当改写变成日常操作之后,「检测」这个概念本身是不是该重新定义了。

相关链接
- ARB 论文:https://arxiv.org/abs/2607.29539
- 论文 PDF:https://arxiv.org/pdf/2607.29539