Video Rebirth 发布世界模型 Olympus:为何选择「视频原生」路线?

2026世界模型之战:Video Rebirth 如何用“视频原生”路线重塑物理智能?

2026年,人工智能领域的竞争焦点已经悄然转移。当大语言模型(LLM)的天花板逐渐显现,世界模型(World Models)已成为科技界最炙手可热的新高地。然而,通往这一终局的路径并非只有一条。

在这场从“是否进入”转向“如何进入”的博弈中,AI基础模型公司 Video Rebirth(重生视界) 选择了一条独特且极具野心的道路——“视频原生”。随着其阶段性成果 世界模型 Olympus 的发布,这条路线正从概念走向现实,并引发了业界对“物理智能体”未来的重新思考。

一、 为什么是视频?从“呈现”到“理解”的范式跃迁

在 Video Rebirth 看来,传统的大语言模型存在一个天然的局限:它主要压缩的是人类已写下的知识。

文字可以描述苹果落地,但无法完整承载重力加速度、空气阻力以及苹果落地瞬间的细微形变。物体运动、光照变化等物理规律,难以用符号系统精确书写,更依赖于从数据中直接学习。因此,Video Rebirth 将视频视为理解与生成世界的基础载体。

这一选择背后有着清晰的逻辑分层:
* 视频生成解决的是“如何呈现世界”的问题;
* 世界模型解决的是“如何理解世界的运转机制”的问题。

Olympus 的核心特质被定义为“实时可交互”。在演示场景中,用户通过按键操控角色进行移动、跳跃、攀爬、攻击甚至游泳,画面并非预渲染,而是随操作即时生成与响应。这种能力不仅服务于数字娱乐,更旨在构建一个统一的世界模型,同时覆盖数字世界与物理世界,为机器人、自动驾驶等需要与真实物理世界打交道的场景提供底层能力。

二、 沉浸式世界的三大基石:一致性

衡量一个世界模型的优劣维度众多,但 Video Rebirth 将差异化押注在三个关键的“一致性”上,这也是支撑沉浸式虚拟世界的基石:

  1. 逼真的物理一致性:这是世界模型的底线。确保物体运动、场景结构在不同视角和连续动作中保持一致,做到不穿帮、不穿模。任何物理规律的违背都会瞬间打破用户的沉浸感。
  2. 声画同步的一致性:沉浸感的断裂往往源于细节的缺失。角色的脚步声、喘息声必须与画面动作严格贴合,多感官的协同是构建真实感的关键。
  3. 长程记忆一致性:世界不是舞台剧,不会因观众离场而重置。模型必须能“记住”用户离开后的场景状态,当用户重返时,环境保持原貌。这是实现长期交互的前提。

三、 技术内核:BACH 引擎与隐式物理学习

Olympus 并非凭空而生,它建立在 Video Rebirth 自研的视频生成引擎 BACH 之上。2026年5月,BACH 在 Artificial Analysis Video Arena 盲测中首次登榜即位列全球第6,是榜单排名最高的初创公司模型,这为其世界模型的构建奠定了坚实的技术基础。

三阶段训练体系

Olympus 的训练过程分为三个阶段,层层递进:
* 领域微调:在大规模可交互场景数据上进行训练,让模型熟悉可交互世界的生成规律。
* 因果建模与控制注入(Causal Teacher):教会模型根据历史画面和当前动作生成后续画面,建立“动作-结果”的因果联系。
* 自回归蒸馏:提升生成效率和连贯性,满足实时交互的需求。

隐式学习与工程优化

值得注意的是,Olympus 并非通过编码重力公式等显式规则来理解世界,而是从数据中隐式学习物理规律。这种数据驱动的方式更具泛化能力。

针对“实时响应”,系统通过 Cross-attention 调制操作指令与生成画面;针对“记忆”,则依靠专门录制的重访数据和推理阶段 KV cache 中的历史状态复用。

在工程层面,为了降低延迟,Olympus 采用了多卡并行、状态缓存和异步计算等策略。一个亮点是,它是已知最早在 AMD MI350 系列上完成部署的世界模型。AMD Instinct MI350 配备的 288GB HBM3E 超大显存,为长时间交互下缓存大量中间状态提供了充足空间,极大地放大了系统优化的效果。

此外,Video Rebirth 构建了由“真实世界视频”和“合成数据”共同驱动的飞轮:
* 真实数据教模型“世界长什么样”;
* 合成数据提供精准的“动作-画面”配对,教模型“动作会带来什么后果”。

四、 第三条路:视频显式路线

业界通往世界模型的路径大致可分为三条,Video Rebirth 视其为互补而非对立:

路线 代表/理念 特点
三维显式路线 如 World Labs 将世界还原为三维空间,擅长表达结构化刚体,但在处理形变、流体时面临挑战。
视频隐式路线 如 Yann LeCun 倡导的思路 在抽象表征空间进行预测,侧重理解能力,但可视化交互性较弱。
视频显式路线 Video Rebirth (Olympus) 以视频为原生载体,直接学习并生成可视、可交互的“4D数据”。

Video Rebirth 首席战略官李迪夫表示,Olympus 的定位是连接数字与物理世界的桥梁,通过同一套底层能力实现独有的 scaling law(缩放定律)。

五、 终局思维:从世界模型到物理智能体

对于 AI 的未来,Video Rebirth 创始人兼 CEO 刘威博士有着清晰的终局判断:

  • 大语言模型的终局是 Coding Agent,服务于数字世界;
  • 世界模型的终局是 Simulation Agent,服务于物理世界。

顺着这一逻辑,Olympus 的应用场景清晰展开:
* 在数字世界:面向游戏智能体,提供更真实的 NPC 行为和物理交互;
* 在物理世界:指向机器人、具身智能、L5级自动驾驶及工业仿真等“物理 AI”场景。

刘威博士认为,下一个十年的核心命题是让 AI 真正理解其所处的物理世界,而世界模型将是下一代 AI 面向真实世界的共同地基。

随着 Olympus 的发布,Video Rebirth 正在用“视频原生”的第三条路,证明理解物理世界不必非要拆解为三维坐标或抽象向量,视频本身,就是世界最直接的表达。