DONDO:面向非洲语言的开源 w2v-BERT 语音识别基础模型发布
2026 年 7 月 23 日,研究人员 Paul Azunre 向 arXiv 提交了论文《DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages》(arXiv:2607.21540),正式发布了 DONDO 系列开源自动语音识别(ASR)基础模型。该模型家族专为非洲语言设计,基于 w2v-BERT 2.0 自监督语音编码器构建,旨在解决低资源语言在语音识别领域长期缺乏高质量训练数据的痛点。
广泛的非洲语言覆盖
DONDO 模型家族展现了令人印象深刻的语言多样性:
- 21 个单语模型:针对特定语言进行深度优化
- 5 个多语模型:支持跨语言识别,实现单一检查点覆盖多种语言
- 共计 27 种语言变体:主要分布在加纳、塞拉利昂、尼日利亚、塞内加尔、肯尼亚和津巴布韦等非洲国家
这些模型所覆盖的语言拥有约 1 亿第一语言使用者;若计入第二语言使用者,数量将更为庞大。
底层技术:w2v-BERT 2.0 自监督编码
DONDO 的底层依托于 w2v-BERT 2.0 自监督语音编码器。该技术能够从大量无标签音频中高效提取语音特征,为低资源语言提供了强大的预训练基础。这意味着即使在没有充足标注数据的情况下,模型依然能够学习到高质量的语音表示。
创新数据策略:宗教文本的巧妙利用
针对非洲许多语言缺乏转录音频数据的核心难题,DONDO 项目采取了一种独特且合规的数据获取路径:
- 数据来源:主要来自宗教文本的朗读录音
- 选择理由:宗教文本通常具备广泛覆盖范围、清晰的版权许可以及一致的拼写规范
- 核心价值:对于其他方面缺乏转录音频的语言,这些数据成为宝贵的训练素材
这一策略不仅解决了数据稀缺问题,也为其他低资源语言的语音识别研究提供了可借鉴的思路。
精炼的训练方法
两阶段微调流程
研究团队设计了一套带有学习率退火的精细微调程序:
- 第一步:以较高学习率适应共享的多语言模型
- 第二步:降低学习率,恢复并进一步提升单语模型的基准性能
注:其中一个模型家族采用了三步微调流程,以追求更优的性能表现。
轻量级语言控制机制
为了实现单一多语模型检查点对目标语言的灵活切换,DONDO 引入了一种创新的轻量级语言条件注入机制:
- 将独热编码的语言身份标识作为序列的前缀帧
- 这些前缀帧被前置到声学特征之前
- 在推理阶段,通过该机制即可将模型"引导"至特定的目标语言
显著的性能提升
在五个多语模型家族的评测中,经过学习率退火处理的模型达到了平均 10%-13% 的词错误率(WER)。这一成绩不仅缩小了与单语模型之间的性能差距,同时实现了通过单个检查点覆盖多种语言的工程优势。
完全开源,自由使用
所有 DONDO 模型均在 Hugging Face 的 KhayaAI 组织账户下发布,采用 Apache-2.0 许可证。该许可证仅需署名,允许他人自由微调,包括用于商业用途。这种开放的姿态极大降低了开发者和服务提供商在非洲语言语音识别领域的采用门槛。
资源链接
- arXiv 论文页:https://arxiv.org/abs/2607.21540
- DOI 链接:https://doi.org/10.48550/arXiv.2607.21540
- 实验性 HTML 版本:https://arxiv.org/html/2607.21540v1
- PDF 下载:https://arxiv.org/pdf/2607.21540
DONDO 项目的发布标志着非洲语言语音识别领域的重要里程碑。通过创新的低资源数据策略、精心设计的训练方法以及完全开源的许可证,DONDO 为全球开发者和研究者提供了一套强大且易于使用的工具,推动非洲语言在人工智能时代的数字化进程。