合肥押中的新独角兽,赌的是「世界模型」这条路能跑通

21亿砸进“世界模型”:智象未来的豪赌与资本的逻辑

7月23日,多模态AI公司智象未来(HiDream.ai)宣布完成15亿元C轮融资。加上前两轮,这家创业公司在短短三个月内吸纳了超21亿元资金,估值跨过10亿美元门槛,正式跻身全球AI独角兽行列。

资金涌入的速度令人咋舌,但真正值得玩味的,是谁在掏钱,以及为什么在这个节点集体下注

一张奇特的股东名单:当社保基金遇上影视巨头

翻看智象未来的投资名单,你会发现一种罕见的“跨界混搭”。

领投方工银资本与跟投的社保基金四川振兴科创基金,代表了“国家队”的资金意志。这是社保基金和工银资本首次大规模涉足多模态大模型领域。与此同时,上影股份和华策影视两家影视行业龙头并肩入局,而安徽、上海、浙江、福建、湖南等地的地方国资也密集亮相,老股东合肥产投继续加注。

这种阵容折射出不同属性资本在同一标的上的各取所需:

  • 国家队看路线:认可从视觉切入构建“世界模型”的技术方向,将其视为继LLM之后的下一个战略高地。
  • 影视产业看工具:急需内容生产工具的换代升级,期待全模态技术能重构视频创作流程。
  • 地方国资算产业账:合肥在长鑫存储、京东方等案例中证明了自己擅长在行业黎明期下重注的能力。如今,智象被摆在了类似的位置上。

能把这么多取向不同的资金拉到同一张牌桌上,靠的不仅仅是赛道热度。

赛道升温与LLM的估值分歧

宏观背景确实有利。2026年,国内AI视觉领域融资总额逼近300亿。字节系的Seedance和可灵(Keling)的ARR都在快速增长,独立创业公司也在密集关账或突围。

但更深层的原因在于,过去两年由大语言模型(LLM)垄断的资本焦点正在松动。

随着参数堆叠带来的文本能力领先窗口越来越短,开源模型的冲击以及估值分歧的加大,投资人开始寻找下一个确定性。法国AI院士杨立昆(Yann LeCun)的观点日益受到重视:未来三到五年,“世界模型”将取代LLM成为主流AI架构。

智象未来选择的,正是这条少有人走的路。

拒绝做“缝合怪”:UiT架构的底层逻辑

主流多模态模型本质上是“缝合怪”——通过独立的文本编码器处理语言,再用VAE(变分自编码器)作为翻译器连接图像和视频。

智象则试图拆掉这些缝合线。他们构建了原生的全模态架构UiT,不依赖独立的文本模块,而是将图像像素、文本Token、视频体素、空间关系等所有信号,统一输入同一个Transformer中进行理解、生成和推理。

这是一条高风险的技术路线:如果“世界模型”无法在逻辑上自洽,前期的巨额研发投入将面临归零风险。但如果成功,它将建立起极高的技术壁垒。

从榜单到“廉价感”:技术落地的双重验证

技术路线是否可行?数据给出了初步回答。

2026年5月,智象开源的8B参数模型HiDream-O1-Image(匿名代号“Peanut”)登上Artificial Analysis榜单,以极小的参数量拿下文生图开源模型第一。随后商用版1.5冲到全球前三,成为榜单排名最高的中国图像模型。

尽管榜单更新周期按月计算,单次登顶不足以定论终局,但它证明了“从论文到可验证结果”的闭环已经跑通

比数据更具说服力的,是一个极端的用户测试案例。

在智象发布的无限时长视频创作智能体vivago R1上,有创作者输入了一条极具挑战性的指令:生成一部“叶什尔查姆风格”的荒诞科幻短片。叶什尔查姆是土耳其上世纪低成本山寨电影的代表,特征是硬纸板怪兽、泡沫塑料道具和手绘背景,核心是一种“廉价到极致反而形成幽默”的独特美学。

大多数AI视频模型面对此类指令时,倾向于输出“精美的画面”,而忽略“特定的风格语境”。但vivago R1准确捕捉到了那种荒谬感——画面呈现出刻意制造的“假”质感,但叙事连贯,风格神似。

这个案例揭示了一个深刻的逻辑:只有真正理解了物理世界的光影、空间和运动规律,才能精准地制造出“不够好但是对”的廉价感。 这是对模型理解深度的一次极佳检验。

目前,vivago R1的内容商用成功率已达85%,海外版覆盖100多个国家,累计用户超5000万,灰度版曾登顶Product Hunt日榜第一,被硅谷评价为“视频领域的Claude Code”。

结语:牌桌已摆开,容错率降低

尽管成绩亮眼,但我们仍必须保持冷静。

“世界模型”至今仍未被完全验证,技术难度、算力成本和商业化周期都充满不确定性。21亿元的融资和多路资本的加持,并不意味着这条路一定能走通。相反,它让这张牌桌上的筹码变重了,同时也意味着智象未来的容错率降低了

大语言模型的狂欢暂告一段落,世界模型的竞赛刚刚鸣枪。在这场新的豪赌中,智象未来拿到了厚厚的一手牌,但能否赢到最后,还要看它在接下来的技术长跑中,能否持续兑现那个关于“原生全模态”的承诺。