南洋理工大学S-Agent:让空间智能迈入Agent时代

空间智能迈入 Agent 时代:NTU S-Lab 提出 S-Agent 框架,让 VLM “动起来”

长久以来,视觉语言模型(VLM)在处理空间理解任务时,往往被视为一个“一次性问答机器”。你给一张全景图或一段视频,它直接吐出答案。然而,真实世界中的空间推理是动态的、多步的,需要像人类一样不断观察、测量和验证。

南洋理工大学(NTU)S-Lab 联合 Ropedia 提出的 S-Agent 框架,正是对这一范式的颠覆。它不再让 VLM 独自硬扛所有计算,而是将其重塑为一个具备规划能力的 Agent,通过“行动即推理”的核心机制,标志着空间智能正式从静态问答迈向可执行、可追踪的 Agent 时代。

一、 核心革新:行动即推理

S-Agent 最引人注目的主张是:行动本身即是推理。

在传统模式下,模型试图在内部完成所有几何转换。而 S-Agent 构建了一个持续的循环:它不再急于给出答案,而是不断追问“下一步该看哪里?”、“需要测什么深度?”、“如何验证当前的坐标对齐?”。

案例解析:从离散线索到三维结论

让我们通过论文中的一个典型动态空间推理问题来理解其工作流:

问题:“站在耳机旁,背对入口门,相机在你的哪个方向?”

在这个场景中,模型接收到的并非一张完整的全景图,而是从视频中抽取的 64 帧分散线索。S-Agent 通过以下四个步骤解决了这个复杂的空间映射问题:

  1. 定位实体:首先在图像中识别出“耳机”、“入口门”和“相机”这三个关键对象。
  2. 3D 对齐:将这 64 帧离散的 2D 视觉线索,提升到同一个共享的 3D 场景坐标系中。
  3. 坐标系转换:以“耳机”为原点,以“背对入口门”的方向为朝向,建立一个自我中心坐标系(Egocentric Coordinate System)。
  4. 得出结论:基于上述坐标系,最终判断出相机位于人的“右后方”。

整个过程包含 3 轮规划6 次工具调用。每一步行动都在累积证据,并将这些证据转化为可追踪的世界状态变化。这种“边做边想”的模式,使得模型能够处理极其复杂的长程空间依赖。

二、 系统架构:三层分工的协作体系

S-Agent 并不迷信“大模型万能论”,而是采用了一种“语义规划 + 专用工具”的精妙协作模式,将任务拆解为三个层级:

  • VLM 作为语义规划器(大脑)
    负责理解问题的意图,识别实体间的关系,并决定下一步需要什么类型的证据(例如:“我需要知道耳机的深度”),进而调用相应的工具。
  • 专用模型处理几何(小脑)
    通用 VLM 在几何感知上往往存在短板。S-Agent 引入如 DA3 等专用模型,专门处理深度估计、相机位姿和 3D 对齐等高精度的几何任务。
  • 空间专家转化输出(翻译官)
    将密集且晦涩的几何数据(如点云、变换矩阵)转化为高层的、人类可读的空间事实(如“A 在 B 的左边”)。

三级工具体系

为了支撑上述架构,S-Agent 设计了层层递进的工具体系:

  1. Level 1(2D 视觉证据):负责基础感知,包括关键帧选择、实体定位及开放词汇检测。
  2. Level 2(3D 空间提升):负责几何重建,包括度量深度估计、相机位姿估计及视角对齐。
  3. Level 3(空间专家):负责逻辑推理,进行计数、精确测量、相对位置判断,并过滤噪声生成最终的空间事实。

此外,系统还引入了双记忆机制,确保在前几步行动中获取的证据不会丢失,而是在后续的行动中持续生效。

三、 性能表现:Zero-shot 领先与蒸馏增效

在无需对底座模型进行任何微调的情况下,S-Agent 便展现了强大的零样本(Zero-shot)能力,并在随后的知识蒸馏中证明了其让小模型“变强”的潜力。

1. Zero-shot 设置下的显著优势

基准测试 S-Agent Gemini 3 Pro GPT-5.4 InternVL3.5-8B (底座)
MMSI-Bench 46.4% 45.2% 41.9% 29.0% (+17.4%)
相机运动子任务 - - - +31.1%
ViewSpatial-Bench 60.0% - - -
ReVSI (平均) 58.8% - - -

数据显示,仅通过 S-Agent 框架,InternVL3.5-8B 在 MMSI-Bench 上的总分就提升了 17.4 个百分点,尤其在难度较高的“相机运动”子任务上,提升幅度高达 31.1 个百分点,甚至超越了 Gemini 3 Pro 和 GPT-5.4 等更强模型。

2. 蒸馏增效:小模型的逆袭

研究团队利用 S-Agent 生成的约 29.2 万条 高质量推理轨迹,对轻量级的 Qwen3-VL-8B 进行了监督微调(SFT),得到了 S-Agent-8B。结果令人振奋:

  • MMSI-Bench:从底座模型的 31.1% 提升至 41.6%,几乎追平 GPT-5.4 (41.9%)。
  • ViewSpatial-Bench:从 42.2% 跃升至 46.8%,不仅大幅超越底座,还超过了 GPT-5.4 (45.6%) 1.2 个百分点。

这证明了一个紧凑的模型,只要学会了“如何行动”和“如何整合证据”,就能实现系统级能力的跨越。

四、 S-300K:将“过程”转化为资产

为了让小模型也能学会这种复杂的推理能力,团队构建了 S-300K 数据集。与传统的数据集不同,S-300K 不是简单的“问题-答案”对,而是包含了强模型驱动 S-Agent 生成的完整空间推理轨迹

多粒度监督信号

S-300K 提供了三个层面的学习素材:

  1. 完整轨迹:展示从问题出发,经过多步规划到达结论的全过程,教导模型全局推导逻辑。
  2. 轮次级样本:训练模型在当前上下文下,精准选择“下一步动作”。
  3. 专家/工具级样本:专门训练模型如何正确调用特定工具以及如何解读工具的返回结果。

这种方法巧妙地避开了将海量空间知识强行“压缩”进参数的小模型困境,转而教会模型何时行动如何解释结果以及如何跨步整合证据

五、 展望:从实验室走向现实世界

S-Agent 展示了一条不同于单纯堆砌参数规模的技术路线。它通过让通用 VLM 专注于高层的语义规划,将繁琐的几何恢复交给专用工具,并利用可检查的推理轨迹将能力蒸馏回更小的模型。

这一思路具有极高的扩展性,有望自然延伸到以下领域:
* 机器人导航:让机器人通过多步观测规划路径。
* AR/VR 空间助手:提供符合物理直觉的空间交互体验。
* 长视频问答:处理时间跨度大、线索分散的视频内容。
* 自动驾驶场景理解:在动态环境中进行实时的空间推理与决策。

随着 S-Agent 的提出,空间智能不再仅仅是“看懂”,更是“行动”。我们正站在从静态问答迈向可执行、可积累、可迁移的 Agent 时代的门槛上。


参考资料:
* 论文标题:S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
* 项目页面:https://ropedia.github.io/S-Agent
* 论文链接:https://arxiv.org/abs/2606.20515
* 演示视频:https://youtu.be/f89D0ZCJWKo