Pangram 4 发布|AI 文本检测卷到 AUROC 0.9916,误报率万分之一

Pangram Labs 前两天放出了 Pangram 4 的技术报告,几个数字值得聊一下。

AUROC 0.9916。做分类的人知道这个数字——接近 1 意味着模型对 AI 文本和人类文本的区分能力已经很极限了。报告给出的误报率(FPR)0.0041%,一万次判断里大约只错 4 次。漏报率(FNR)0.3396%,差不多一千次漏掉 3-4 篇 AI 文本。

误报率才是真正关键的点。AI 检测工具之前在学校、编辑部、评审流程里推不动,最大阻力不是抓不到 AI 文本,是误报。学生自己写的论文被判定成 AI 生成,对方拿出手稿和编辑记录自证清白,这事就会闹大。0.0041% 的误报率如果能在真实场景兑现,很多之前不敢上检测的流程就能开始试了。

比 AUROC 和误报率更有意思的是两个新能力。

一个是对混合人机协作文本的检测。现在很多人用 AI 写草稿,然后人工改结构、加案例、调语气,成文单看不太容易判断。Pangram 4 宣称能做「边界检测」——一段文本里哪部分是 AI 写的、哪部分是人的——以及「交错式 AI 辅助」——让 AI 帮忙改了个句子、续写了一段,它也能看出来。这个方向比单纯说"全文是 AI 还是人"实用得多。真实工作流里,纯 AI 产的最终文档很少,更多是 AI 参与一段、人改一段,需要定位的是特定段落用了 AI,不是整篇定性。

另一个是对抗攻击鲁棒性。之前不少检测器可以被简单手法绕过——加少量拼写错误、换同义词、改标点。Pangram 4 在报告里专门提了这个方向上的提升,细节不多,但作为产品来说很关键:没有鲁棒性,检测器在真实对抗环境里一碰就碎。

技术报告没有给出具体部署方案、推理成本、响应时间这些落地信息。AUROC 再高,跑一次几秒钟、每篇文档费用比人工审核还贵,那在教育和大规模审核场景里仍然推不动。目前只放了论文,还没有公开 API 或 demo 页面的消息。

还有一个问题:数据。Pangram 4 训练用了哪些语料、有没有涵盖中文、多语言表现如何——报告摘要没有展开,这些对国内用户都是必问的。英语文本检测做到这个水平已经很硬,能不能迁移到中文场景,得等更多信息。

Pangram 4 是 AI 文本检测领域一个扎实的进展,误报率控制和混合文本检测两个方向踩中了真实场景里最疼的点。但技术指标和产品落地之间还有一段路——价格、延迟、覆盖语言、接口形态,这些信息出来之前,可以先关注,不用急着做判断。