TTS 横评 960 组音频:情感语音仍是合成最难的一关

arXiv 上周上线了一篇很扎实的 TTS 评测论文。四位研究者把四款主流语音合成系统放到四个场景里硬碰硬比了一轮,跑了 960 组音频,结论一句话就能说清楚:聊天气氛最好捏,动真情最难演。

论文评测的四款 TTS 是 Indic-Parler-TTS、MMS-TTS、Microsoft Edge TTS 和 Google Gemini TTS,覆盖四个语音领域:Formal(正式)、Conversational(对话)、Literary/Storytelling(文学/讲故事)和 Emotional(情感表达)。评测方法也不是单一指标——MUSHRA 听力测试、ABX 辨别测试、基于 Resemblyzer 的说话人相似度打分,外加 MCD(mel-cepstral distortion)和 F0 RMSE 两维声学分析,评估框架相当完整。

结果最醒目的数字来自情感语音。平均 MCD 达到 12.03 dB,平均 F0 RMSE 高达 889 cents。两个指标放在一起的意思是:合成语音在模拟情绪时,声学特征和真实人声之间的偏差大、基频抖动也厉害,听感上很难不掉线。相比之下,对话场景的声学保真度最高——日常闲聊那种调子,现在的 TTS 已经能处理得比较体面了。

对于真正在搭语音产品的人,这个结论比一张排行榜更有用——没有哪个 TTS 能通吃所有场景。角色激动时喊一嗓子、低落时压低声音,目前几家头部 TTS 在这个维度上都有明显短板,选哪家更多是在不同场景的勉强可用之间做取舍。论文把四个系统放在低资源语言上测,进一步压缩了声学数据的丰富度——如果连英语情感语音都没完全搞定,换成数据更稀缺的语言,差距只会更大。

论文本身也有实用的一面。作者把评测脚本、结果表格和可执行的 Colab Notebook 都公开了,License 走的 CC BY-NC-ND 4.0。这意味着不需要从零搭一套评测管线,直接拿来跑自己的 TTS 输出,就能出一个同等规格的报告。团队内部做 TTS 选型,或者上线前做人耳听感摸底,这套框架比单看 MOS 分更有区分度。

这篇论文有明确的边界:定位是评测方法论,不在系统之间打榜排名,重点是用数据展示不同场景下的表现差异。情感语音最难合成这件事,做语音的人心里多少有数,但看到 MCD 和 F0 RMSE 的数字摆到一起,还是能更清楚地知道差距具体在哪。

对于正在做语音助手、有声内容生成、或者任何需要 TTS 输出带一点表演性质内容的团队,这篇论文值得翻一下。至少下次被产品经理问「为什么这里的语气听起来不对」的时候,可以甩出 12.03 dB 和 889 cents 两个数,然后说这本来就是个 open problem,不全是模型的问题。

相关链接:
- 论文地址:https://arxiv.org/abs/2608.02235
- PDF:https://arxiv.org/pdf/2608.02235
- 论文 License:CC BY-NC-ND 4.0