4.15ms 对齐误差,Hinglish 语音终于不再被 MFA 当外星语处理了

做了几年语音相关的东西,有一个场景每次碰到都头疼:双语混着说的时候,强制对齐工具基本是瞎的。

Montreal Forced Aligner(MFA)是语音圈很常用的对齐工具,给一段音频和对应文本,它能把每个音素在哪一秒出现标出来。这东西单独跑英语或单独跑印地语都还行,一碰上 Hindi-English 混着讲——也就是 Hinglish——就开始乱来。

Ayushi Pandey、Pamir Gogoi 和 Kevin Tang 刚挂出来的这篇 arXiv 论文,把这个问题摊开了,而且给了非常具体的数字。

混码语音(code-mixed speech)难在哪?三个坑:音素表比单语大一截,转写经常拼错或混拼,再加上不同说话人的发音漂移很大。论文直接测了一轮:拿 MFA 默认的单语印地语词典去对齐 Hinglish,平均误差 38.18ms;用单语英语词典做同样的事,37.58ms。这个误差在语音对齐里基本不可用,做细颗粒度的语音分析、TTS 数据清洗或者 ASR 强制对齐都会出事。

但他们试了另一条路——用 bootstrapping 策略构建词典,然后在句子级别混码数据上重新训练声学模型。结果对齐平均误差降到 4.15ms,比单语方案好了一个数量级。

注意这个 4.15ms 不是用某个花哨新模型跑出来的,MFA 还是那个 MFA,区别全在词典设计和训练数据。核心发现其实很直接:混码语音的对齐问题,靠单语词典救不了,必须用混码数据来训练。

这工作对做印度市场语音产品的团队是一个挺实的底噪参考。正在做印地语 ASR、或者给印度用户做语音 Agent 的团队,值得把这个 4.15ms 的基线拉到自己的 pipeline 里测一测。论文用的也是 MFA,开源工具,门槛不高。

不过这只是个实验室评估,走的还是受控语料。真实场景里口音更杂、转写更乱,4.15ms 能不能扛住得另说。但至少方向清楚了:别再拿英语对齐工具硬怼 Hinglish 了,词典和数据都得重来。

论文链接:https://arxiv.org/abs/2607.25581