人工修正(Artificial Epanorthosis):大语言模型为何频繁自我纠正?
引言
在与人机对话时,你是否注意到一个现象:大语言模型(LLM)经常先给出一个陈述,然后立即用“不”、“不对”或“更正”来否定自己,随后再给出修正后的版本。例如:
“答案不是42。正确答案是……”
这种修辞手法在古典修辞学中被称为 epanorthosis(人工修正),即说话者故意否定自己先前所说的话,以引起注意或强调修正内容。而最新研究指出,这一现象在大语言模型中被系统性、过度地使用。
论文核心事实
| 项目 | 信息 |
|---|---|
| 论文标题 | Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it |
| 作者 | Federico Boggia |
| 提交日期 | 2026年7月23日 |
| arXiv ID | arXiv:2607.21498 |
| 页数 | 17页 |
| 学科分类 | Computation and Language (cs.CL) / Artificial Intelligence (cs.AI) |
| 许可证 | CC BY 4.0 |
| DOI | https://doi.org/10.48550/arXiv.2607.21498 |
| PDF链接 | https://arxiv.org/pdf/2607.21498 |
| 实验HTML | https://arxiv.org/html/2607.21498v1 |
什么是"人工修正"(Epanorthosis)?
Epanorthosis 源自古典修辞学,由西塞罗(Cicero)和昆体良(Quintilian)在两千年前就已记录。它指的是说话者在表达过程中故意否定自己先前所说的话,通常用于:
- 纠正一个刚刚说出的错误
- 强调修正后的观点
- 引导听众的注意力
Fontanier 将其归类为 "思想之修辞"(figure of thought),即它涉及思维层面的调整,而非仅仅语言形式的修饰。
大语言模型为何过度使用 epanorthosis?
两大核心驱动因素
1. 训练语料中的宣传性文本偏置
模型的预训练数据中富含 promotional prose(宣传性/推销性文本),这类文本倾向于使用强调性、对比性的表达方式。模型在学习语言模式时,自然习得了"先说一个说法,再用转折词否定并给出另一个说法"的模式。
2. 偏好调优(RLHF)的奖励机制
在基于人类反馈的强化学习(RLHF)阶段,模型被训练去迎合人类的偏好。研究发现,RLHF 奖励那些 自信且具强调效果 的表达方式。当模型试图表现得"有帮助"时,它倾向于使用 epanorthosis 来展示审慎和准确性——即便实际上并不需要这样做。
生成机制的角色
模型 从左到右的自回归生成方式 放大了这一现象,但它并非根本原因。根因在于训练分布和偏好对齐过程。
Epanorthosis Index(人工修正指数)
为了量化这一现象,研究者提出了 Epanorthosis Index —— 一种衡量 epanorthosis 使用频率相对于人类基准的指标。
关键发现
在一项针对某指令微调模型家族(三个不同规模)的初步测量中,研究者发现了以下结果:
| 文体类型 | 模型表现 | 偏差方向 |
|---|---|---|
| 演讲/演说类(Oratory) | 过度使用 | 约 2倍,意大利语中接近 3倍(集中在较大参数规模的模型中) |
| 非正式问答(Informal Q&A) | 使用不足 | 低于人类基准 |
| 议论文(Argument) | 与人类匹配 | 基本一致 |
| 新闻报道(Journalism) | 与人类匹配 | 基本一致 |
| 百科类文本(Encyclopedic prose) | 与人类匹配 | 基本一致 |
关键洞察:模型并非在所有文体中都过度使用 epanorthosis,而是存在 按文体的校准偏差(mis-calibration by register)。在需要强调和说服的文体中过度使用,而在轻松的对话场景中又使用不足。
缓解方案:如何让模型少说"不"?
三种建设性贡献
-
缓解技术综述:系统梳理了当前可用的减轻 epanorthosis 过度使用的技术,重点介绍了 轻量级 LoRA 适配器。
-
意大利语实证演示:
- 仅通过 一行指令(one-line instruction),即可将 epanorthosis 的使用频率降低至原来的 一半到四分之三
- 通过 监督微调(SFT)的 LoRA 适配器,可以几乎完全消除该现象
- 引入一个 缩放系数,可以将输出调节回接近人类使用频率的水平 -
核心理念:目标不是 消除 epanorthosis,而是实现 按文体的校准——让每种文体下的使用频率与人类基准相匹配。
深层启示:真正的风险是什么?
论文结尾提出了一个深刻的观点:
真正的风险不在于机器写得太像人,而在于我们开始写得像机器。
当 epanorthosis 这种修辞手法被过度自动化和机械化地使用时,它可能:
- 削弱语言的真实性和自然感
- 使沟通变得冗余和低效
- 最终影响人机交互的体验质量
如果我们在写作中不自觉地模仿机器的这种倾向——频繁地在表达中插入不必要的自我否定和修正——那么语言的优雅和简洁将被侵蚀。
对 AI 从业者的实践建议
1. 监控模型的修辞行为
不要只关注模型的"准确性",还要关注其 语言风格和行为模式。Epanorthosis Index 提供了一种可量化的监测框架。
2. 利用轻量级适配技术
LoRA 等参数高效微调方法可以低成本地纠正模型的修辞偏差,无需重新训练整个模型。
3. 按文体定制输出
针对不同应用场景(如客服对话 vs. 正式报告),应分别校准模型的修辞使用频率,而非采用一刀切的策略。
4. 设计更精细的对齐信号
在 RLHF 或其他对齐方法中,应考虑奖励信号的细微差别——避免过度奖励"强调式"表达,防止模型学会不必要的自我否定模式。
结语
Federico Boggia 的这篇论文虽然只有17页,却从一个独特的修辞学视角切入,揭示了大语言模型中一个普遍存在却鲜被关注的现象。它不仅提供了诊断工具(Epanorthosis Index),还给出了实用的解决方案(LoRA 适配器和指令干预),更重要的是,它提醒我们:当我们塑造机器时,机器也在潜移默化地塑造我们的语言和思维方式。
参考链接:
- arXiv 页面:https://arxiv.org/abs/2607.21498
- PDF 下载:https://arxiv.org/pdf/2607.21498
- 实验 HTML 版:https://arxiv.org/html/2607.21498v1
- DOI:https://doi.org/10.48550/arXiv.2607.21498