CoT 真的需要“一直看”图片吗?最新研究揭示视觉语言模型的推理瓶颈
在视觉语言模型(Vision-Language Models, VLMs)的发展中,思维链(Chain-of-Thought, CoT)提示作为一种测试时扩展策略被广泛应用。然而,一个核心问题始终悬而未决:当 VLMs 生成更长的推理轨迹时,它们究竟在"延伸"什么?是持续访问图像 token 的能力,还是主要利用在前向传播早期已经获取的视觉信息?
最新发表于 arXiv 的研究论文《Visual Access Boundaries in Vision-Language Model Reasoning》(arXiv:2607.12815)通过引入一种因果干预方法,首次明确界定了 VLMs 中的视觉访问边界(Visual Access Boundary, VAB),并揭示了 CoT 提升性能的真实机制与瓶颈所在。
核心发现:CoT 并非延长"看图"时间
该研究由 Hiroto Osaka、Shohei Taniguchi、Gouki Minegishi、Kai Yamashita、Masahiro Suzuki 和 Yutaka Matsuo 共同完成,于 2026 年 7 月 14 日提交。
研究团队对 Qwen2.5-VL(32B 规模)和 InternVL3(14B 和 38B 规模)等六种模型配置进行了实验。结果发现,无论是无 CoT 的直接回答,还是 CoT 提示,都存在有限的视觉访问边界。
特别是在 Qwen2.5-VL-32B 和 InternVL3 模型中,尽管 CoT 生成了 substantially 更长的文本轨迹,但其 VAB 层与无 CoT 的边界相比,差异最多仅为两层。这一发现有力地证明:CoT 并没有主要通过在整个推理轨迹中延长对图像 token 的直接访问来提升性能。
相反,CoT 的核心作用在于扩展语言侧的计算,即利用前向传播早期从图像中提取的隐藏状态信息(image-derived hidden-state information)进行更深层次的逻辑推演。
技术突破:Visual Access Sweep 与 VAB 定义
为了精确测量模型对图像信息的依赖程度,研究团队提出了Visual Access Sweep方法。这是一种因果干预手段,通过沿网络深度(layer depth)和生成时间(generation time),掩码(mask)生成的 token queries 到图像 token keys 之间的注意力连接。
基于此,他们定义了Visual Access Boundary (VAB):即在保持任务准确率不下降的前提下,模型所需的最小视觉访问区域。
瓶颈在于"感知读取",而非"计数能力"
研究进一步指出,CoT 的性能增益受到感知读取(perceptual readout)的限制:
- CoT 的有效性取决于视觉属性是否可被可靠读取。如果模型能够可靠地读取查询到的视觉属性,CoT 就能发挥作用;反之则无效。
- 符号属性预言机实验表明,一旦将真实属性的视觉信息以文本形式提供给模型,CoT 能够显著改善计数表现。
- 单对象探测与解码检查显示,某些难以输出的"硬属性"其实可以从隐藏状态中线性恢复。这说明困难不在于模型内部是否"看到"了特征,而在于模型能否将这些特征准确"输出"。
综合这些分析,研究团队得出结论:当前的瓶颈在于"读取"(readout),而非"计数"或"推理"本身。
对 AI 从业者与开发者的启示
这项研究为 VLMs 的优化提供了新的视角:
- 架构优化方向:既然 CoT 的主要价值在于语言侧的深度计算,而非持续访问图像,那么优化模型的语言推理模块或利用早期提取的高质量视觉隐藏状态,可能比盲目增加视觉 token 的访问频率更有效。
- 数据与提示工程:对于计数等特定任务,如果模型难以直接从图像中读取属性,可以尝试在提示中提供结构化的视觉属性描述(如本研究中的符号属性预言机所示),从而激活 CoT 的推理潜力。
- 评估指标改进:传统的 CoT 评估可能忽略了模型在"感知读取"阶段的失败。未来评估应区分模型是"没看懂"(感知问题)还是"算不对"(推理问题)。
参考文献与资源
- 论文标题: Visual Access Boundaries in Vision-Language Model Reasoning
- 作者: Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi, Kai Yamashita, Masahiro Suzuki, Yutaka Matsuo
- arXiv ID: 2607.12815
- 提交日期: 2026 年 7 月 14 日
- 原文链接: https://arxiv.org/abs/2607.12815
- DOI: https://doi.org/10.48550/arXiv.2607.12815
- PDF 下载: View PDF
- HTML 实验版: HTML (experimental)