人工修正(Artificial Epanorthosis):大语言模型为何频繁自我纠正?

引言

在与人机对话时,你是否注意到一个现象:大语言模型(LLM)经常先给出一个陈述,然后立即用“不”、“不对”或“更正”来否定自己,随后再给出修正后的版本。例如:

“答案不是42。正确答案是……”

这种修辞手法在古典修辞学中被称为 epanorthosis(人工修正),即说话者故意否定自己先前所说的话,以引起注意或强调修正内容。而最新研究指出,这一现象在大语言模型中被系统性、过度地使用。


论文核心事实

项目 信息
论文标题 Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it
作者 Federico Boggia
提交日期 2026年7月23日
arXiv ID arXiv:2607.21498
页数 17页
学科分类 Computation and Language (cs.CL) / Artificial Intelligence (cs.AI)
许可证 CC BY 4.0
DOI https://doi.org/10.48550/arXiv.2607.21498
PDF链接 https://arxiv.org/pdf/2607.21498
实验HTML https://arxiv.org/html/2607.21498v1

什么是"人工修正"(Epanorthosis)?

Epanorthosis 源自古典修辞学,由西塞罗(Cicero)和昆体良(Quintilian)在两千年前就已记录。它指的是说话者在表达过程中故意否定自己先前所说的话,通常用于:

  • 纠正一个刚刚说出的错误
  • 强调修正后的观点
  • 引导听众的注意力

Fontanier 将其归类为 "思想之修辞"(figure of thought),即它涉及思维层面的调整,而非仅仅语言形式的修饰。


大语言模型为何过度使用 epanorthosis?

两大核心驱动因素

1. 训练语料中的宣传性文本偏置

模型的预训练数据中富含 promotional prose(宣传性/推销性文本),这类文本倾向于使用强调性、对比性的表达方式。模型在学习语言模式时,自然习得了"先说一个说法,再用转折词否定并给出另一个说法"的模式。

2. 偏好调优(RLHF)的奖励机制

在基于人类反馈的强化学习(RLHF)阶段,模型被训练去迎合人类的偏好。研究发现,RLHF 奖励那些 自信且具强调效果 的表达方式。当模型试图表现得"有帮助"时,它倾向于使用 epanorthosis 来展示审慎和准确性——即便实际上并不需要这样做。

生成机制的角色

模型 从左到右的自回归生成方式 放大了这一现象,但它并非根本原因。根因在于训练分布和偏好对齐过程。


Epanorthosis Index(人工修正指数)

为了量化这一现象,研究者提出了 Epanorthosis Index —— 一种衡量 epanorthosis 使用频率相对于人类基准的指标。

关键发现

在一项针对某指令微调模型家族(三个不同规模)的初步测量中,研究者发现了以下结果:

文体类型 模型表现 偏差方向
演讲/演说类(Oratory) 过度使用 2倍,意大利语中接近 3倍(集中在较大参数规模的模型中)
非正式问答(Informal Q&A) 使用不足 低于人类基准
议论文(Argument) 与人类匹配 基本一致
新闻报道(Journalism) 与人类匹配 基本一致
百科类文本(Encyclopedic prose) 与人类匹配 基本一致

关键洞察:模型并非在所有文体中都过度使用 epanorthosis,而是存在 按文体的校准偏差(mis-calibration by register)。在需要强调和说服的文体中过度使用,而在轻松的对话场景中又使用不足。


缓解方案:如何让模型少说"不"?

三种建设性贡献

  1. 缓解技术综述:系统梳理了当前可用的减轻 epanorthosis 过度使用的技术,重点介绍了 轻量级 LoRA 适配器

  2. 意大利语实证演示
    - 仅通过 一行指令(one-line instruction),即可将 epanorthosis 的使用频率降低至原来的 一半到四分之三
    - 通过 监督微调(SFT)的 LoRA 适配器,可以几乎完全消除该现象
    - 引入一个 缩放系数,可以将输出调节回接近人类使用频率的水平

  3. 核心理念:目标不是 消除 epanorthosis,而是实现 按文体的校准——让每种文体下的使用频率与人类基准相匹配。


深层启示:真正的风险是什么?

论文结尾提出了一个深刻的观点:

真正的风险不在于机器写得太像人,而在于我们开始写得像机器。

当 epanorthosis 这种修辞手法被过度自动化和机械化地使用时,它可能:

  • 削弱语言的真实性和自然感
  • 使沟通变得冗余和低效
  • 最终影响人机交互的体验质量

如果我们在写作中不自觉地模仿机器的这种倾向——频繁地在表达中插入不必要的自我否定和修正——那么语言的优雅和简洁将被侵蚀。


对 AI 从业者的实践建议

1. 监控模型的修辞行为

不要只关注模型的"准确性",还要关注其 语言风格和行为模式。Epanorthosis Index 提供了一种可量化的监测框架。

2. 利用轻量级适配技术

LoRA 等参数高效微调方法可以低成本地纠正模型的修辞偏差,无需重新训练整个模型。

3. 按文体定制输出

针对不同应用场景(如客服对话 vs. 正式报告),应分别校准模型的修辞使用频率,而非采用一刀切的策略。

4. 设计更精细的对齐信号

在 RLHF 或其他对齐方法中,应考虑奖励信号的细微差别——避免过度奖励"强调式"表达,防止模型学会不必要的自我否定模式。


结语

Federico Boggia 的这篇论文虽然只有17页,却从一个独特的修辞学视角切入,揭示了大语言模型中一个普遍存在却鲜被关注的现象。它不仅提供了诊断工具(Epanorthosis Index),还给出了实用的解决方案(LoRA 适配器和指令干预),更重要的是,它提醒我们:当我们塑造机器时,机器也在潜移默化地塑造我们的语言和思维方式。


参考链接
- arXiv 页面:https://arxiv.org/abs/2607.21498
- PDF 下载:https://arxiv.org/pdf/2607.21498
- 实验 HTML 版:https://arxiv.org/html/2607.21498v1
- DOI:https://doi.org/10.48550/arXiv.2607.21498