全模态模型的算力账单,终于有人开始抠预算分配了 | OmniDelta
Qwen2.5-Omni 这类全模态模型的好处是直观的:文本、音频、视频一起吃,统一理解。坏处也摆在面上——音频加视频的 token 序列太长,显存和推理成本直接起飞。压缩 token 不是新问题,但一直有个前置没人认真管:有限的预算,到底该分给音频多少、视频多少?问天气的时候是多听一段环境声,还是问画面内容时多看几帧?
最新挂到 arXiv 上的 OmniDelta 就在做这件事。它是一个训练无关的预算分配框架,不改模型结构,只在推理阶段重新算预算该往哪投。
效果:在 Qwen2.5-Omni-7B 上只保留 25% 的 token,GPU 内存降了 22%,端到端推理快了 1.64 倍。不是简单砍——它在四个音视频 benchmark 上精度没崩,甚至比均匀分配做得更好。
OmniDelta 的思路分两层。
第一层,跨模态分配。给模型装了音频和视频两个"技能池",根据 query 的实际需求决定哪个模态拿更多预算。问"视频里的人在说什么",音频预算该多;问"画面里是什么场景",视频占大头。听起来很直觉,但论文发现直接拿 query 和音视频算相似度来定预算并不可靠,容易跑偏。
第二层,模态内部分配。确定了音频和视频各自拿多少之后,每个模态内部再做二次分配。音频分片、视频分帧,一段静音和一段对话密集区、一帧静态画面和一帧动作场景,值得花的 token 数量不一样。OmniDelta 用局部复杂度和时序冗余度做这个微调。
两层算完,最终的局部预算可以直接喂给现有的 pruning 策略,总保留比例不变,但每枚 token 花得更准了。
训练无关这个属性意味着不需要重新训模型,推理阶段加一层分配逻辑就能用。已经在跑 Qwen2.5-Omni 的团队可以直接试。
论文也有边界。实验基于两个规模的 Qwen2.5-Omni 模型、在四个 benchmark 上验证,跨模型泛化性和多轮对话场景没有覆盖。Skill Pool 的具体构建需不需要标注数据,也是没完全讲清的点。
全模态模型刚出来的时候,大家先关注能不能做;下一步自然会问能不能做得便宜。OmniDelta 属于后一类里思路比较清爽的——不折腾模型结构,不动训练流程,只是重新算了一遍预算分配。
PDF 24 页。如果你在搭音视频理解管线、或者在头疼全模态模型的推理成本,可以翻一下。
相关链接:
- 论文页面:https://arxiv.org/abs/2607.25669
- PDF 全文:https://arxiv.org/pdf/2607.25669