语音翻译把"呃"删干净,论文说这是个错误

用过语音翻译或会议录音转写工具的人,大概见过这个操作:AI 自动把"呃"、"就是"、"那个"、"嗯"全部抹掉,输出一段干干净净的文本。看起来确实利索,像是替人把嘴捋直了。

但一篇刚挂在 arXiv 上的论文说,这么干是有代价的。

Maike Züfle 等 8 位作者在《The Role of Disfluencies in Speech Translation》里提出了一个反直觉的结论:那些被当成噪音去掉的不流畅语(filled pauses、false starts、self-repairs),其实携带了意义——清掉它们,翻译质量反而会往下掉。

不是所有"呃"都是废话

论文用了一个叫 Uh-Mazing 的基准测试集来展开分析。他们用人工翻译加人工标注的方式,把 Switchboard 语料里英语不流畅语对应的 8 种目标语言翻译全部标了出来,然后拿当前主流的语音翻译系统——包括 SpeechLLMs——上去跑。

结果不意外:几乎所有模型都在自动清洗不流畅语,倾向于直接省略而不是翻译。

对不流畅语类型的进一步分析显示,真正拖累翻译质量的不是那些填充停顿(uh、um),也不是话语标记(you know、I mean),而是 假启动(false starts)和自我修复(self-repairs)——话说一半换了个说法、或者意识到说错了立刻纠正的那种。

日常对话中这种场景太多了:"我明天——不对,后天去开会。"前半截"明天"就是假启动,后半截"后天"是自我修复。如果翻译系统直接把"明天"砍掉,只输出"后天去开会",语义确实没丢,但语气、犹豫、修正过程全没了。在某些场景下——谈判、采访、医疗问诊——这些信号比字面意思还重要。

不用重新训练,改解码就行

论文给了一个挺实用的解法:推理时解码策略调整,不需要重新训练模型。在解码阶段让模型不倾向于直接省略不流畅语,就能把翻译质量拉回来一部分。

这对做产品的人来说是个好消息——不需要推倒重来训一个新模型,改改推理侧的参数或者加个后处理判断,就能在一定程度上保住那些"呃"里藏的信息。

论文把 Uh-Mazing 基准测试集和代码都开源了,入口在 arXiv 2608.02138。想测试翻译模型对"呃"的处理表现,可以直接拿去跑一轮。

一点个人的看法

我这两年用语音转写和翻译工具的体感是,产品经理们对"干净文本"有一种执念——好像去掉所有犹豫和重复才是"AI 应该有的水平"。但现实中的交流本来就是充满停顿、修正、重复的。把"呃"全删了,有时候删掉的不只是噪音,还有说话人的态度、不确定性和优先级暗示。

这篇论文没给什么惊天结论,但它提醒了一件事:翻译跟转写不一样。转写追求字面准确,翻译要传递的是交流意图。那些不流畅的地方,恰恰是意图最密集的位置。

当然,论文也有边界。Uh-Mazing 目前只覆盖 8 种语言,大部分是欧洲语系,中日韩这类高信息密度语言的表现还没测。另外,推理时解码能缓解多少、有没有副作用,也还需要更多实验。

但至少从今天开始,再看到语音翻译工具把"呃"默默删掉的时候,不妨多想一句:它删掉的,可能不只是噪音。


相关链接
- 论文页:arXiv:2608.02138
- PDF:View PDF
- HTML 体验版:arxiv.org/html/2608.02138v1