RAG 喂整页还是裁细节?一篇建筑文档论文测了 160 遍,答案不是二选一

做过文档类 RAG 应用的人,大概率都纠结过一个具体问题:一个 PDF 页面送进多模态模型之前,到底该给它看整页概览,还是把关键区域裁成小图喂进去?整页信息全但分辨率低,小图看得清但容易断上下文。我见过不少人直接「都扔进去让模型自己挑」,心里其实没底。

最近 arXiv 上挂出来一篇建筑文档审查方向的论文,标题叫《Evidence-Grounded Constraint Checking in Construction Documents》,作者 Rashid Mushkani、Hugo Berard 和 Shin Koseki。它没在产品发布会上画饼,也没端出一个碾压一切的 benchmark,而是老老实实测了一个非常具体的问题:当你要从 PDF 里找证据来核验建筑规范约束时,视觉信息的分配方式——看整页还是看局部特写——到底怎么影响判断准确率?

结果是:看情况。而且情况比一刀切复杂得多。

论文设计了一套证据约束检查管线,先把 PDF 中的事实抽取出来做规范化,然后用四态规则做确定性执行,同时保留原文来源跨度,解决不了的就升级给人工。他们拿这套管线在 29 个建筑项目的 160 个参考任务上做了评测,用了两套测试设计:一套是重复的四系统测试,一套是不重叠的两系统广度扩展测试。

关键发现出现在第一套测试里。把分配给每个问题的四张图片预算,从四张整页概览调整为「一张概览加三张重叠局部切片」之后,项目族标准化决策准确率提升了 10.6 个百分点(95% 置信区间: 4.3–18.0,精确 p=0.031)。这个数字看着不错,p 值也过了显著性门槛,乍看像是「裁图更好」的实锤。

但第二套测试里,同样用区域聚焦策略——论文里叫 Region-RAG——准确率反而掉了 4.1 个百分点(95% 置信区间: -10.2 到 1.9,精确 p=0.209)。这个结果不显著,但方向已经是反的了。用同等的图片数量做公平对比时,整页概览反而占优。

也就是说,同一个策略,在更受控的实验设置里有效,放到更多样的任务集合里反而拖后腿。论文没有掩饰这一点,它直接给出了几个不太好听的数字:精确的发现集恢复率仍然很低,错误通过(false pass)普遍存在,重复运行之间的一致性校准也很差。

这其实比「某个方法吊打一切」的结论有力得多。它说清楚了一件事:多模态 RAG 里的「分辨率 vs 视野」是一个真实的 trade-off,不存在一刀切的答案。对某些类型的约束检查——比如需要比对细部尺寸标注和局部构造做法——切片特写确实帮得上忙;但对更多需要理解页面整体布局、上下文衔接和跨区域关系的任务,整页概览的广度更重要。

论文最后给的建议也很老实:不要盲目上 Region-RAG,要按规则类型做证据路由(rule-aware evidence routing),而且专家审查环节不能省。

这其实点到了多模态 RAG 当前的核心矛盾:模型看局部看得更清楚了,但看全局的能力没有同步跟上。你不能既想让它放大看焊缝细节,又指望它不忽略整张图纸的图例说明。做产品落地的人应该能从这篇论文里读出两层意思:一是视觉证据分配本身就是需要设计的策略空间,不是「把图丢进去就行」;二是目前没有银弹,混合策略和人工兜底在一段时间内仍是必需品。

另外,这篇论文 2026 年 7 月 31 号才提交,11 页正文 3 张图 4 张表,篇幅克制,论证扎实。如果你也在做文档审查类的工具或者多模态 RAG 的策略设计,值得抽半小时看看 PDF 全文——它给的不是一个爽快结论,而是一个更诚实的工程坐标系。