原地扩展:如何为预训练大模型无缝升级分词器?

原地扩展:如何为预训练大模型无缝升级分词器?

在大规模语言模型(LLM)的开发中,分词器(Tokenizer)的词汇表通常是在预训练初期根据当时的语料库优先级固定的。然而,随着技术演进和新语言的加入,这种静态分配导致后来者往往被拆分成更多的碎片化 token,从而增加了延迟、计算量和能耗。

对于云端模型而言,embedding 和 LM-head 矩阵仅占参数的一小部分,因此可以负担庞大的词汇表。但对于紧凑型模型(尤其是端侧设备上的模型),这些矩阵占据了 token 解码带宽的显著比例,迫使开发者必须使用较小的词汇表,并接受特定语言的分词碎片化问题。

2026 年 7 月 16 日,Jimmy T.H. Smith 等人在论文《In-Place Tokenizer Expansion for Pre-trained LLMs》[1] 中提出了一种"分词器原地扩展"(Tokenizer Expansion)方案。该方案允许模型生产者在控制设计的前提下,对已预训练模型的分词器进行原地升级。

核心技术:如何"原地"扩展分词器?

该研究提出的核心方法并非从头训练新的分词器,而是通过以下步骤实现平滑过渡:

  1. 延续 BPE 合并规则:在多语言语料上继续现有的分词器 BPE(Byte-Pair Encoding)合并操作。
  2. 保留现有 Token:大多数源词汇表中的 token 保持不变,直接作为单个 token 继承下来。
  3. 新 Token 分解:每一个新增的 token 都能精确分解为原有的源子词(sub-tokens)。
  4. Embedding 初始化策略
    • 继承未改变的 embedding 行,保持原样。
    • 将新 token 的 embedding 初始化为对应源子词 embedding 的平均值。
  5. 两阶段适应过程
    • 第一阶段:仅对 embedding 层进行训练。
    • 第二阶段:对整个模型进行继续预训练(Continued Pre-training),以恢复源检查点的质量。

此外,作者还公开了塑造这一技术路线的"负面发现"(negative findings),为后续研究提供了宝贵的参考。

实验验证:LFM2 到 LFM2.5 的性能跃升

为了验证该方法的有效性,研究团队将其应用到了 LFM2-8B-A1B(一个拥有 80 亿参数的混合专家 MoE 模型)的继续预训练检查点上,成功生成了配备 128K 大词汇表的 LFM2.5-8B-A1B 模型。

关键性能指标

  • 编码效率提升
    • 印地语(Hindi):编码所需的 token 数量减少约 2.4 倍
    • 越南语(Vietnamese):编码所需的 token 数量减少约 2.6 倍
    • 泰语(Thai):最高减少 4.0 倍
  • 解码速度加速
    结合词汇表增大带来的单 token 成本变化与上述编码缩减效应,在参考设备上估算,针对上述语言的每字符解码速度提升了 2.2 至 3.7 倍

对 AI 从业者与开发者的启示

这项研究为端侧 AI 和多语言模型部署提供了新的思路:

  1. 无需从头训练:当业务需求从单一语言扩展到多语言,或者需要支持新语言时,开发者可以利用此方法在现有模型基础上低成本升级分词器,避免重新预训练的巨额开销。
  2. 端侧模型的优化空间:对于资源受限的设备,通过扩大词汇表来减少 token 数量,可以直接转化为更低的延迟和更高的能效比。
  3. 开源生态的贡献:作者不仅发布了 LFM2.5-8B-A1B 的模型权重和扩展后的分词器,还分享了技术细节与负面经验,有助于整个社区推动更高效的多语言模型发展。

总结

"分词器原地扩展"技术提供了一种在不移除原有知识的前提下,高效升级预训练模型分词器的路径。随着 LFM2.5 等模型的开源,AI 从业者和开发者可以进一步探索如何在边缘设备上实现更快速、更节能的多语言推理。


参考文献
[1] Jimmy T.H. Smith et al., "In-Place Tokenizer Expansion for Pre-trained LLMs," arXiv:2607.15232, July 2026. [Online]. Available: https://arxiv.org/abs/2607.15232