CAVE 论文:视频定位模型「蒙对答案」的盲区,终于有人治了

做视频时间定位(Video Temporal Grounding)的团队,这两年基本都在用强化学习(RL)微调大视觉语言模型(LVLM)。给定一句描述,让模型从视频里找到对应的起止时间——效果确实在涨。

但有一个盲区一直没被认真戳破。

现有 RL 方法只考核最终预测的时间区间是否正确。模型预测对了起止时间,就算过关。但没人追问:它到底是因为看到了正确的视觉证据才给出的判断,还是碰巧蒙对了?

这是一个很关键的问题。假设让模型从一段监控视频里找到「有人把包裹放在门口」的时刻。模型给出了一个正确的时间段——但它实际盯着的画面可能是路过的一只猫,而不是包裹本身。在 benchmark 上跑分好看,一换场景就掉,这种「伪对齐」很可能是根源之一。

8 月 3 号挂在 arXiv 上的一篇新论文(2608.02078)专门盯的就是这个漏洞。论文来自 Wei Jia、Zhicong Lu 等八位作者,提出了一个叫做 CAVE(Competence-Aware Visual Boundary Evidence Alignment)的方案。

核心思路是在 RL 训练里加一层「证据级对齐」。具体来说,CAVE 引入了边界专用的证据 token(boundary-specific evidence tokens),先通过一个轻量监督的 warm-up 阶段让这些 token 学会关注边界语义——相当于先给模型做了一轮「怎么才算看对了」的示范。然后在 RL 阶段,额外加一个视觉边界证据对齐奖励,强制这些证据 token 的视觉注意力落在真实边界内部——光猜对时间不够,注意力也得对准。

CAVE 还引入了 performance-aware gating:当模型定位已经很准了,自动减弱证据监督的力度,避免过度约束影响精细调整;模型还比较弱的时候,则保留较强的证据引导。这个自适应门控使约束力度随模型能力动态变化,避免了一刀切加 loss。

论文在多个公开 VTG 基准上做了实验,验证了有效性。不过目前只有 abstract 上线,具体涨了多少点、在哪些数据集上有效、对推理开销的影响,得等全文出来再细看。

这个方向把「证据—答案」对齐从 NLP 里常见的归因做法(思维链、引用来源)搬到了视频时序定位里,用专门的 token 设计和自适应门控来贴近「模型到底怎么看」这个问题。

做视频理解或时序定位的话,这篇值得放进跟踪列表。

论文入口:https://arxiv.org/abs/2608.02078