给模型5张参考图它就开始"打架"——ECCV 2026这篇Oral用14K数据解了多参考难题

做视觉设计的大概都遇到过这个场景:一张图定人物长相,一张图定场景氛围,再来一张姿势参考和一张风格参考——五张图凑齐,丢进模型,出来的结果经常是人物记住了但姿势变了样,风格压过了主体,光照跟背景各说各话。

这不是模型偷懒,是它真的处理不过来。主流开源图像生成模型在单张或少张参考图时表现还行,参考图一多、类型组合一复杂,生成质量就会明显下降。而真实的设计工作很少只靠一句 prompt 或一张参考图完成——广告视觉、IP形象延展、视频关键帧生成,往往同时需要参考人物、场景、姿态、风格、光影等多种条件。

最近被 ECCV 2026 接收为 Oral 的论文《Scaling Multi-Reference Image Generation with Dynamic Reward Optimization》就是冲这个问题来的。团队提出的 DyRef 框架,核心是让模型在多张参考图之间学会协调。

多参考图像生成里,每张参考图承担的角色不一样。主体图提供身份,背景图定义场景,姿势图约束动作,风格和光照图影响整体视觉走向。对人类设计师来说,从不同素材里抽要素再组合是基本工作流;但对生成模型来说,这是一场多约束协同考试——信息冲突几乎必然出现,模型很容易顾此失彼。

团队发现,现有的评测基准不够"难"。很多 benchmark 只关注主体是否一致,不太测试模型能否同时处理五种视觉约束。于是他们自己建了一个更严格的考场:OmniRef-Bench,包含 395 个专家标注样本,每个样本带 2 到 7 张参考图,覆盖主体、背景、风格、光照、姿势五类参考类型和十种组合方式。评估维度也拆得很细——主体看身份一致性,背景看场景匹配,风格看视觉迁移,光照看明暗关系,姿势看动作对齐。画面好看没用,该保留的参考信息都保住才算及格。

DyRef 的训练分两步。先通过监督微调让模型具备多参考处理的基础能力,再引入强化学习让模型学会在不同参考条件之间对齐。核心设计是动态奖励优化——复杂多参考任务里不同样本难度差异很大,两张图的简单编辑和七张图的混合约束不是同一类题。DyRef 在训练时更关注模型当前还做不好的复杂样本,同时拉开生成结果之间的差距,让模型明确该向哪些结果学习。

结果上,DyRef 在 OmniRef-Bench 的 MLLM 评估里把 Qwen-Image-Edit-2511 的分数从 4.97 拉到 8.38,跟 Nano Banana Pro 水平相当,超过了 Seedream4.5 的 8.13。而且是只用 14K 数据微调做到的。在 MultiBanana 和 OmniContext 这两个多参考 benchmark 上,DyRef 相比基线方法也有稳定提升。

还有个问题:专门练复杂多参考,会不会把模型原本的单图编辑能力练坏?实验结果显示反而有提升——在 ImgEdit 和 DreamBench++ 上,DyRef 训练后的模型单图编辑表现保持了甚至更好。增强多参考能力没有以牺牲基础能力为代价,反而让模型对整体视觉条件和用户指令的理解更强了。

14K 数据、开源模型追平闭源旗舰、单图能力不掉——这几个信号叠在一起看,DyRef 确实在把图像生成往真正能干活的方向推了一大步。不过也得说一句:论文 benchmark 漂亮是一回事,放进真实生产流程里能不能扛住反复调用和极端案例,是另一回事。好在代码已经开源,感兴趣的可以自己去跑跑看。

相关链接:
- 论文:https://arxiv.org/pdf/2606.26947
- 代码:https://github.com/Weistrass/DyRef