MLLM 开无人机,成功率不到 35%:MissionBench 给 22 个模型上了一课

两天前 arXiv 上挂了一篇 preprint,标题很长,核心动作很直接——把 22 个多模态大模型(MLLM)塞进无人机,看它们能不能凭一句人话指令完成整套任务。结果不太好看:最好模型成功率不到 35%,人类基线是 84.4%。

这个基准叫 MissionBench,来自 Wolfram Burgard 组和其他几家机构合作。120 个任务分布在 5 个模拟 3D 环境里,涵盖 4 类任务族。模型需要自己规划路径、导航、判断任务完成状态并报告结果,全程只靠机载视角的 egocentric 观测和历史动作,没有针对无人机做过任何微调。它的目标直接是「使命级」任务——「飞到目标区域,识别指定物体,完成操作,返航报告」这种多步骤长链条,不搞 VQA 或看图说话那一套。模型拿到的输入和人类飞行员差不多,效果差了不止一倍。

测试覆盖了 22 个开源和闭源模型,从轻量级到最前沿都有。几个数字:

  • 最好模型 < 35%。试 100 个任务,最多完成 35 个。全体都卡在这个水平。
  • 人类基线 84.4%。说明任务难度在合理范围内,是模型能力还没跟上。
  • 规模有效。同一模型家族里,更大版本表现更好,说明 Scaling 确实能带出一些空间推理和多步规划能力,哪怕模型没有专门为这些做过训练。

论文同时点明:使命级能力需要多步规划和自适应推理的协同,单一的空间感知不够用。空间感知可能被 Scaling 带出来一些,但「先想几步再飞」和「飞错路之后自己纠正」这种能力,目前还远没到能用。

这个结果放在今天的语境里挺应景。过去半年不少人在讨论 MLLM 做 embodied agent 的可能性,各种 demo 展示模型接上机械臂、轮式机器人、无人机。但 MissionBench 提醒了一件事:demo 和可靠的任务完成之间,隔着一条长链条的规划和纠错能力——目前最好模型也只跨过了三分之一。

对于做无人机、巡检、测绘、安防方向的人来说,这个 benchmark 的模拟环境开源位置还没明确标注(preprint 阶段),但论文的任务框架和分析方法本身已经值一看——能帮你快速判断某个模型到底只是会描述画面,还是真能驱动一个自主决策循环。

文章最后留了一个观察:Scaling 带来的提升既让人看到希望,也放大了风险——能力上来了但不可控的时候,无人机做错决策的后果远比对话模型说错一句话严重。