翻译也要「想一想」:ACL 2026 这篇论文让模型学会按难度分配推理量

做翻译的人都有这种体感:翻「今天天气不错」几乎不用过脑子,但碰到一段充满术语的法律条款或者文化梗密集的广告文案,就得停下来查资料,反复斟酌措辞。人类译员天然知道什么时候该快、什么时候该慢,机器翻译长期以来却是一刀切的——每个句子过一遍同样的解码流程,不论难易。

ACL 2026 上的一篇新工作——Translation with Thought(TwT),由厦门大学和中国科学院的研究者完成——给出了一个解法。核心思路直白但执行不简单:让模型学会按难度动态分配推理量,简单句子快速过,复杂句子多绕几个弯。

怎么让模型「想多少」变得可控

TwT 的训练分两个阶段。第一阶段是监督微调——从 DeepSeek-R1 蒸馏出带难度感知的长链思维轨迹,然后用 GPT-4o 重写,把那些不必要的绕路剪掉,让 CoT 更接近人类译员的思考「性价比」。第二阶段是强化学习,用一个混合奖励函数同时优化翻译质量和推理效率——翻译质量高加分,推理 token 多用扣分。

这个设计把质量和效率的权衡变成了可学习的目标。硬翻不出来的复杂句子,多花 token 是值得的;简单句硬要过一遍复杂推理链,反而被惩罚。

小模型压过大模型,token 省了三分之一到六成

结果放在 benchmark 上很有说服力。TwT-7B 和 TwT-14B 在 15 个 benchmark 上做了评估,覆盖领域内和领域外场景,涉及 3 种见过和 59 种未见过的语言,并在三个不同基座模型上做了消融。论文报告的结论是:TwT 在翻译质量上超过了参数量大得多的 SOTA 推理模型,同时 token 用量减少了 32% 到 60%

这些数字值得细看。通常推理能力被理解为靠堆算力、堆参数,但 TwT 走的是一条更聪明的路——不是所有输入都值得动用同样的推理预算。对那些跑翻译管线、按 token 付 API 账单的团队来说,质量持平甚至更好、成本砍掉一半,这账太好算了。

不是所有的推理都是好推理

这篇论文也暴露了一个现状:当前大部分推理模型的「思考」还是粗放的。给模型加 CoT prompt,它就每个问题都列一遍推理步骤,从「1+1=?」到「证明黎曼猜想」都一样。TwT 的贡献在于把「何时思考、思考多少」这个决策本身变成了可学习的目标。

不过这毕竟是一篇学术论文,离产品化还有距离。59 种未见语言上的泛化能力听起来不错,但具体每种语言的提升幅度、对低资源语言的表现、部署时的推理延迟——论文里有答案,但对一线开发者来说,更关心的可能是什么时候能在自己的翻译管线上跑起来。

值得盯的一个方向

TwT 的标签是「多领域机器翻译」,但它的核心机制——难度自适应的推理——显然不限于翻译。代码生成、文本总结、客服问答,这些场景里同样存在大量简单输入和复杂输入混在一起的情况。如果这种按难度分配推理量的思路能推广,那对 API 账单和响应延迟的双重改善就不只是翻译一个领域的利好。

论文地址:https://arxiv.org/abs/2607.29287,代码和数据暂时还没看到公开链接,感兴趣的可以持续关注。