Prompt Optimizers Are Blind to Images. This Paper Finally Gives Them Eyes.

当提示优化器不看图:视觉语言模型的盲点

自动提示优化有个奇怪的地方:优化器会读问题、读模型的预测、读正确答案——但它从来不打开图片文件。它为一个多模态模型调优提示词,却不看那个最关键的模态。

Liu 等人新发的论文(arXiv:2607.24354)直接用标题点破这件事:"Are Prompt Optimizers Blind?" 在多模态任务上,答案基本上是肯定的。反馈通道是纯文本。当一个 VLM 在视觉上出错——比如在复杂光照下混淆两个物体,或者在拥挤场景里漏掉一个小细节——优化器只看到一个错误答案,无法诊断视觉层面的根因。它只能重写提示词,然后指望碰运气。

论文提出的修复方案,交叉模态视觉反馈(Cross-Modal Visual Feedback, CMVF),简单到让人想问为什么之前没人把它当标准做法。它在优化循环里加了两个环节。第一是基于失败的视觉诊断:当模型答错时,一个更强的 VLM 直接检查出错的图像——不打标签、不做预测,只看图,尝试找出什么样的图像特征可能导致模型在这个输入上翻车。第二是错误感知的聚合,把这些观察压缩成可复用的、任务层面的"视觉盲点模式"——本质上是一份视觉陷阱清单——然后用这些信息驱动下一轮提示词重写。

关键设计在于:图像只在优化阶段参与。部署出去的产物仍然是普通文本提示词。推理时,计算成本和纯文本基线完全一样。不需要额外管线,也不需要每查一次就调一遍第二个模型。

12 个 VQA 数据集和 4 个目标 VLM 上的测试结果显示,CMVF 在所有排名中持续排第一——在每一个目标模型上平均比最强基线高出 2.4 个百分点,单个基准测试上最高领先 6.5 个百分点。优化器还会自发组织出类似专家经验的视觉检查清单,并且不需要重新优化就能跨模型迁移——为某个 VLM 发现的模式可以直接应用到完全不同的模型上,处理同样的任务。

这篇论文属于那种读完后会觉得贡献理所当然的论文。一个从不看图的优化器当然会漏掉视觉层面的错误。洞察并不复杂——只是之前没有人把这个修复方案形式化并大规模验证它有效。CMVF 没有提出更大的模型或者更贵的管线,它只是堵上了一个毫无道理的信息缺口。

跨模型迁移那部分是我最关注的。如果这些盲点检查清单不需要重新优化就能泛化,那就是一种廉价的方式,可以为任何 VLM 构建任务层面的视觉先验知识。这种杠杆效应在提示优化中很少见——通常每个模型都要从头开始优化。