arXiv新突破:实现LLM生成Token的精准定位检测
在人类与人工智能协同创作日益普及的背景下,如何精准识别文本中哪些部分由大语言模型(LLM)生成,已成为学术界和工业界关注的焦点。2026年7月23日,Yangjun Lu、Hongyi Zhou等人在arXiv上发布了一篇题为《Detecting LLM-Generated Tokens in Human--LLM Coauthored Text》的研究论文 [1]。该研究提出了一种全新的细粒度检测方法,能够精准定位混合作者文档中由LLM生成的具体内容。
现有方法的局限与需求
当前,针对LLM生成文本的检测方法主要集中在文档级别的分类上 [1]。然而,随着人机协作写作模式的兴起,仅对整篇文档进行“是否由AI生成”的二元判断已无法满足实际需求。研究者、编辑和内容平台迫切需要一种能够识别文本局部来源的方法,即明确知道文档中的哪一段落、甚至哪一个词是由LLM生成的 [1]。这种对“细粒度检测”的需求,构成了本研究的核心动机 [1]。
核心方法:基于Token级的自适应平滑检测
针对上述痛点,研究团队提出了一种在Token级别(现代语言模型的自然处理单位)进行操作的新方法 [1]。该方法不依赖复杂的端到端训练,而是建立在现有的Token级检测分数之上,通过统计学手段优化检测效果 [1]。
其核心创新点在于引入了自适应Lepski-type规则 [1]。具体而言,该方法通过平滑相邻Token的检测分数来降低其波动性,并利用自适应规则根据局部的作者结构动态选择平滑带宽 [1]。这种设计使得模型能够更好地捕捉文本中人类写作与AI生成内容的边界 [1]。
值得注意的是,该方法具有无需Token级标注数据的优势 [1]。这意味着在实际应用中,开发者不需要耗费大量资源去人工标注每一句话或每一个词的来源,即可部署使用,极大地降低了落地门槛 [1]。
理论与实证表现
从理论层面分析,研究人员刻画了偏差与方差之间的权衡关系,并证明了所提出的方法在估计底层信号时能够实现有利的均方误差性能 [1]。
在实证评估方面,该研究在合成数据集和真实世界数据集上均展示了强大的性能 [1]。通过与多种基线方法(baselines)的对比,该Token级自适应平滑方法在定位LLM生成内容方面表现优异 [1]。
开源与工具部署
为了方便社区研究和应用,研究团队已经部署了一个公开可访问的网站,实现了文中提出的检测方法 [1]。这一举措为AI从业者、开发者以及内容审核人员提供了一个实用的工具,用于分析和验证人机协作文本的来源构成 [1]。
参考文献
[1] Yangjun Lu, Hongyi Zhou, Fabian Spill, Kai Ye, Chengchun Shi, Jin Zhu. Detecting LLM-Generated Tokens in Human--LLM Coauthored Text. arXiv preprint arXiv:2607.21458, July 2026. Available at: https://arxiv.org/abs/2607.21458