同一个量化方案,一个翻译模型扛住了,另一个直接崩了
上周翻 arXiv,看到一篇新论文里这句话,实在没忍住:「EuroLLM shows strong sensitivity and translation quality collapses rapidly for all considered quantization formats。」翻译过来就是:同一个量化方案,Hy-MT2 扛住了,EuroLLM 的译文质量直接跳水,所有量化格式都救不回来。
这篇论文来自 Jim Zhao、Sohir Maskey 等人,7月31日刚挂 arXiv,标题很学术——《Studying quantization trade-offs for efficient inference deployment in machine translation》。但只把它当又一篇量化调参报告,就错过它真正想提醒的事了。它戳了一个不少团队正在踩、但还没意识到的坑:用标准翻译 benchmark 测出来的量化后质量,跟实际上线跑长文档很可能是两回事。
先看实验设计。EuroLLM 和 Hy-MT2 两个翻译模型家族,从 1.7B 到 22B 一共五款模型,单卡 A100 或 H100,测了 W4A8、W8A8 两种量化格式,再叠加上文档分块策略。结果符合预期——量化确实在延迟-吞吐的 Pareto 曲线上往前推了一截。
但真正的发现不在性能曲线上。标准机器翻译 benchmark 怎么测的?给一个孤立句子,翻完打分。这跟真实部署差太远了——实际上线跑的是整篇文档、整段对话,上下文是连续的。论文专门从 WMT24++ 拉了一个文档级评测集,用来评估分块策略在量化条件下对翻译质量的影响。结果很干脆:标准句子级评测无法预测量化对长文档翻译的真正影响。Bench 上看着好好的,一上文档就露馅。
更极端的是模型之间的差异。Hy-MT2 在量化下表现稳定,EuroLLM 则极其敏感,所有测试的量化格式都导致质量急剧下降。同样 W4A8,一个还能用,另一个已经没法看。这跟量化精度关系不大,而是模型本身对量化的友好度不同——这个差异在句子级评测里很可能被平滑掉了,只有拉到文档级才现出原形。
论文最后给了一个很务实的结论:推理效率和翻译质量之间的取舍,不仅取决于量化格式,还取决于选什么分块策略。选 W4A8 只是第一步,怎么切文档、窗口多长、有没有重叠——这些工程决策跟量化格式一样决定最终质量。
对于正在部署翻译模型的团队,这篇论文相当于给了一个三层 checklist:别信句子级 benchmark 的量化结果,上文档再测一次;换模型家族要重新做量化压力测试,EuroLLM 的经验不能迁移到 Hy-MT2,反过来也一样;分块策略跟量化是耦合的,必须放在一起调。
这类工作我猜会越来越多。模型越做越大,大家被迫上量化,但量化评测的标准化程度还停在「跑个 perplexity 或刷个 benchmark」的阶段,离生产环境太远。翻译还算好评估的——译文好坏至少人看得出来。换到更开放的任务,量化埋的坑可能更深。
相关链接
- 论文 arXiv 页面:https://arxiv.org/abs/2607.29397
- PDF:https://arxiv.org/pdf/2607.29397