WAIC 2026 多模态辩论:五大首席科学家拆解 AI 下半场核心命题

多模态的十字路口:WAIC 2026 上五位科学家的深度交锋

7 月 18 日上午,在商汤科技承办的 WAIC 2026"基座大模型架构创新与生态合作论坛"上,一场备受瞩目的圆桌对话引发了行业广泛关注。

由商汤科技首席科学家林达华主持,复旦大学邱锡鹏教授、达摩院首席科学家赵德丽、阶跃星辰首席科学家张祥雨、新加坡南洋理工大学刘子纬教授同台,围绕多模态在大模型时代的定位与瓶颈展开了深度交锋。


核心命题:多模态是"外挂"还是"灵魂"?

当前业内对于多模态的定位存在两种截然不同的观点:

一种认为多模态只是大语言模型能力边界的自然延伸——语言中心论;另一种则坚持多模态是下一代智能的基础组成部分,而非语言模型的外挂——原生智能论。

五位科学家的观点各有侧重,但共同指向一个趋势:多模态正在从辅助工具走向核心基础设施。


五位科学家的观点碰撞

科学家 核心立场 关键论点
邱锡鹏 语言中心 + 情境智能 多模态发展重点是与语言对齐;当前模型欠缺的是对真实世界复杂情境的理解能力(Context)。
赵德丽 世界中心 + 范式变革 多模态是下一代智能的范式;物理世界需要四维因果关系建模,而大语言模型仅是一维的。
张祥雨 学习范式优先 核心不是语言 vs 视觉之争,而是如何让智能体学会自主学习(在线学习、持续进化)。
刘子纬 脱虚向实 + 原生多模态 语言是低维投影,多模态数据是下一个时代能源;任务层面制造业等必须依赖多模态。

三大瓶颈:数据、架构、范式

林达华将讨论拉回现实:当前主流方法是否足以支撑下一阶段突破?

1. 数据瓶颈

刘子纬指出,互联网 20 年积累的语料为语言模型提供了天然优势,但多模态数据缺乏长程关联记录。赵德丽以机器人为例补充道,去年 10 万小时数据已属领先,今年才讨论大几十万小时,远不足以支撑 GPT-3.5 水平训练。

不过,赵德丽也强调了中国优势:中国在工业、服务业、家电场景的多样性上具有天然数据优势。

2. 架构瓶颈

刘子纬提出,整体架构仍以语言模型为核心,多模态以桥接方式进入,原生多模态架构尚未成熟。张祥雨则聚焦于 Memory 机制——Transformer 的 Context 本质上是工作记忆,无法有效承载长期结构化记忆。人类会主动压缩清除,而视觉信号一旦输入就永远留在 Context 中。

3. 范式瓶颈

张祥雨强调,自主学习是共识,但具体路径存在分歧。在线学习是短期内最可能出成果的投入方向。赵德丽提醒,算法架构创新远未停止,PPO、GRPO、Sparse Attention 等技术进步仍在推动领域发展。


五年预言:什么被高估?什么被低估?

维度 高估 低估
邱锡鹏 技术演化速度;"AI for AI"可能成为下一代范式
赵德丽 Agent 在企业级场景的自主化能力 AI 对社会运作方式的改变(如智能体支付体系重构)

林达华分享了自己观察到的变化:2023 年初大家焦虑 AI 取代工作,但今天看更多是改变工作方式;而强化学习在 2025–2026 年重新成为核心方法、"测试时扩展"成为独立竞赛维度,是当初未被预料到的。


对从业者的五大启示

  1. 多模态不是终点,而是起点:从数字空间走向物理空间是不可逆趋势。
  2. Memory 机制是关键前沿:如何设计分层记忆(瞬时感知→短期工作→长期情境/语义)是架构创新的突破口。
  3. 在线学习是近期重点:自主学习、探索与好奇心建模、学习效率优化是三大核心挑战。
  4. 中国场景优势待释放:工业、服务业、具身智能的数据多样性可能成为全球竞争的关键变量。
  5. 保持开放心态:邱锡鹏提醒,刻意追求某些方向未必成功,看似不受关注的可能反而得到充分发展。

本文基于 WAIC 2026 公开论坛内容整理,所有事实与引述均来自原始材料。