WAIC 2026 多模态辩论:五大首席科学家拆解 AI 下半场核心命题
多模态的十字路口:WAIC 2026 上五位科学家的深度交锋
7 月 18 日上午,在商汤科技承办的 WAIC 2026"基座大模型架构创新与生态合作论坛"上,一场备受瞩目的圆桌对话引发了行业广泛关注。
由商汤科技首席科学家林达华主持,复旦大学邱锡鹏教授、达摩院首席科学家赵德丽、阶跃星辰首席科学家张祥雨、新加坡南洋理工大学刘子纬教授同台,围绕多模态在大模型时代的定位与瓶颈展开了深度交锋。
核心命题:多模态是"外挂"还是"灵魂"?
当前业内对于多模态的定位存在两种截然不同的观点:
一种认为多模态只是大语言模型能力边界的自然延伸——语言中心论;另一种则坚持多模态是下一代智能的基础组成部分,而非语言模型的外挂——原生智能论。
五位科学家的观点各有侧重,但共同指向一个趋势:多模态正在从辅助工具走向核心基础设施。
五位科学家的观点碰撞
| 科学家 | 核心立场 | 关键论点 |
|---|---|---|
| 邱锡鹏 | 语言中心 + 情境智能 | 多模态发展重点是与语言对齐;当前模型欠缺的是对真实世界复杂情境的理解能力(Context)。 |
| 赵德丽 | 世界中心 + 范式变革 | 多模态是下一代智能的范式;物理世界需要四维因果关系建模,而大语言模型仅是一维的。 |
| 张祥雨 | 学习范式优先 | 核心不是语言 vs 视觉之争,而是如何让智能体学会自主学习(在线学习、持续进化)。 |
| 刘子纬 | 脱虚向实 + 原生多模态 | 语言是低维投影,多模态数据是下一个时代能源;任务层面制造业等必须依赖多模态。 |
三大瓶颈:数据、架构、范式
林达华将讨论拉回现实:当前主流方法是否足以支撑下一阶段突破?
1. 数据瓶颈
刘子纬指出,互联网 20 年积累的语料为语言模型提供了天然优势,但多模态数据缺乏长程关联记录。赵德丽以机器人为例补充道,去年 10 万小时数据已属领先,今年才讨论大几十万小时,远不足以支撑 GPT-3.5 水平训练。
不过,赵德丽也强调了中国优势:中国在工业、服务业、家电场景的多样性上具有天然数据优势。
2. 架构瓶颈
刘子纬提出,整体架构仍以语言模型为核心,多模态以桥接方式进入,原生多模态架构尚未成熟。张祥雨则聚焦于 Memory 机制——Transformer 的 Context 本质上是工作记忆,无法有效承载长期结构化记忆。人类会主动压缩清除,而视觉信号一旦输入就永远留在 Context 中。
3. 范式瓶颈
张祥雨强调,自主学习是共识,但具体路径存在分歧。在线学习是短期内最可能出成果的投入方向。赵德丽提醒,算法架构创新远未停止,PPO、GRPO、Sparse Attention 等技术进步仍在推动领域发展。
五年预言:什么被高估?什么被低估?
| 维度 | 高估 | 低估 |
|---|---|---|
| 邱锡鹏 | — | 技术演化速度;"AI for AI"可能成为下一代范式 |
| 赵德丽 | Agent 在企业级场景的自主化能力 | AI 对社会运作方式的改变(如智能体支付体系重构) |
林达华分享了自己观察到的变化:2023 年初大家焦虑 AI 取代工作,但今天看更多是改变工作方式;而强化学习在 2025–2026 年重新成为核心方法、"测试时扩展"成为独立竞赛维度,是当初未被预料到的。
对从业者的五大启示
- 多模态不是终点,而是起点:从数字空间走向物理空间是不可逆趋势。
- Memory 机制是关键前沿:如何设计分层记忆(瞬时感知→短期工作→长期情境/语义)是架构创新的突破口。
- 在线学习是近期重点:自主学习、探索与好奇心建模、学习效率优化是三大核心挑战。
- 中国场景优势待释放:工业、服务业、具身智能的数据多样性可能成为全球竞争的关键变量。
- 保持开放心态:邱锡鹏提醒,刻意追求某些方向未必成功,看似不受关注的可能反而得到充分发展。
本文基于 WAIC 2026 公开论坛内容整理,所有事实与引述均来自原始材料。