多智能体「隐式通信」的因果审计:传了,但未必用上了

多智能体系统之间不传文字,直接传 latent vector——这个概念最近半年在 Agent 圈子里被反复提起。卖点很直接:连续向量比离散 token 的信息容量大得多,理论上通信效率更高。但有一个问题一直没被认真回答:接收方到底有没有在用这些信息?还是模型只是被额外的计算路径带偏了,凑巧涨了点分?

一篇 7 月 29 日上传到 arXiv 的论文(编号 2607.26773)专门做了这件事。作者 Huixiang Zhang 和 Mahzabeen Emu 设计了一套「因果审计」方法,在 latent 通信的边界上做受控替换,去拆解一条 latent message 到底贡献了什么。

传统评估只比端到端指标:有通信 vs 无通信,分数涨了就说通信有效。但作者指出,这个逻辑不成立——聚合分数的变化可能来自消息本身的存在(不管内容是什么)、消息里针对当前样本的内容、或者消息来自另一个智能体这个事实。他们把这几层拆开,设计了四种消息设置、五组测量。

实验放在 latent relay 场景上,用 Qwen3-4B 和 Qwen3-8B 跑 GSM8K、ARC-C 和 MATH-500。

以 GSM8K 为例。Qwen3-4B 模型在接入 latent 通信后,整体准确率变化是 -1.00 个百分点——不仅是负的,而且几乎为零。但拆开看:消息本身的存在(换成其他样本的消息)带来了 -6.17 个百分点的效果,当前样本的具体内容贡献了 +5.17 个百分点。通信机制本身在拖后腿,样本内容在往回拉,最后互相抵消出一个 -1.00。到了 8B 模型上,两个分量的方向完全反转。同样一套 latent 通信配置,在不同规模模型上的行为是根本不同的。

MATH-500 上,Qwen3-4B 获得了 +15.00 个百分点的总提升,其中 +8.33 来自非当前样本的消息,+6.67 来自当前样本的具体内容。到了 8B,总涨幅几乎全被「消息本身存在」这个分量吃掉,当前样本具体内容的贡献趋近于零。同一份 latent 向量,4B 在用它,8B 只是被它激活了一下——但聚合分数显示两者都「有效」。

论文里还有一个自替换对比,进一步证明「当前样本的内容」和「来自另一个智能体」是两个独立的影响因素。看到的效果不一定来自「更丰富的通信」,可能只是模型多了一个计算入口。

对正在搭多智能体系统的团队来说,这篇论文更像一个提醒。如果在实验里看到 latent 通信涨了点,别急着归因于「信息传得更好了」。先换一条不相关的消息进去跑一轮,看看分数怎么变。这个动作只需要多跑一次推理,但能避免把噪声当信号。

文末附了论文链接。实验设计部分的审计思路可以移植到自己项目的评估流程里。

相关链接

  • 论文页面:https://arxiv.org/abs/2607.26773
  • PDF:https://arxiv.org/pdf/2607.26773
  • HTML 版:https://arxiv.org/html/2607.26773v1