21亿元押注世界模型:智象未来的技术突围与资本共识
最近,AI圈发生了一件大事。
多模态大模型公司智象未来(HiDream.ai)宣布完成15亿元人民币C轮融资。加上此前的资金,短短三个月内,这家公司累计融资超21亿元,投后估值突破10亿美元,正式跻身全球AI独角兽行列。
这不仅仅是资本市场的又一条新闻。对于在AI行业摸爬滚打的我们来说,这更像是一个信号弹:AI行业的竞争焦点,正在从单纯的文本生成,转向对物理世界的理解与推演。
一、 资本风向变了:不再盲目押注“下一个LLM”
先说个大背景。大语言模型(LLM)市场确实还在高速增长。Anthropic的年度经常性收入(ARR)半年内从90亿飙到490亿,智谱5个月就从1亿跨到10亿,OpenRouter平台的Token消耗量几个月增长了3.5倍。数据很性感,市场远未见顶。
但问题来了:随着DeepSeek V4、GLM-5.2、Kimi K3等模型密集发布,通用大模型的能力差距正在迅速缩小。当大家都能写代码、能聊天、能推理时,MaaS(模型即服务)很快就要进入残酷的价格战阶段。
这时候,资本开始变得谨慎且聪明。继续押注“下一个大语言模型”的想象空间在收窄,估值逻辑也趋于稳定。他们开始寻找具备结构性壁垒的新赛道。
看看智象未来的投资人名单,你就懂了。这次出手的,是五大类资金:
- 国家级资本(如社保基金四川振兴科创基金):看的是长期技术路线和产业价值,不纠结短期财务回报。
- 金融资本(如工银资本、交银资本、兴业AIC基金):坚持“投早、投小、投长期、投硬科技”,押注底层技术能力。
- 市场化基金(如敦鸿资产、东方富海):看重成长性和技术串联能力。敦鸿资产就明确指出,世界模型是串联人工智能、具身智能、新一代算力的关键纽带。
- 地方国资(如合肥产投、厦门国贸资本、余杭国资):玩的是“以投带引”,看重产业生态的引入和补链强链。
- 产业资本(如华策影视、上影新视野基金、湖北长江电影集团):直接押注下一代AI内容生产体系,构建智能体协同创作、语料共建及IP全链路开发的基础设施。
当这五类资金同时看好一条技术路线时,说明市场共识已经形成:多模态和世界模型,是下一阶段的主战场。
二、 为什么是多模态?因为这里有“护城河”
智象未来创始人兼CEO梅涛有句话很犀利:“从多模态走向构建原生全模态世界模型,是通往AGI的必经之路。”
为什么这么说?因为相比纯文本LLM,多模态大模型有四道天然的壁垒:
- 数据壁垒:高质量视觉数据涉及版权、IP、肖像权,不可爬取,难以替代。你没法像抓网页文本一样随便抓视频数据。
- 工程壁垒:处理空间关系、时间连续性、光影物理和角色一致性,像素级生成的复杂度远超文本Token预测。
- 工作流壁垒:影视、广告等行业一旦完成了AI流程改造,迁移成本远高于切换一个模型API。
- 行业Know-how壁垒:不同内容行业对镜头语言、叙事节奏等有长期积累,这不是换个模型就能解决的。
因此,多模态赛道的格局预计不会像LLM那样高度集中。大厂占三家,中型公司三四家,再加上多个垂直领域的并行发展,这才是健康的市场结构。
三、 技术突围:UiT统一架构 vs 模块化拼接
在技术实现上,智象未来选择了一条更难但更彻底的路:UiT(Unified Transformer)统一架构。
目前行业主流方案还是“文本编码器+VAE+图像生成器”的模块化拼接。但这有个痛点:VAE压缩会导致高频细节损失,文本和图像分别处理会造成语义对齐间隙。
UiT架构怎么做?它砍掉了VAE和独立的文本编码器,将文本、图像、视频等多模态信息映射进同一个共享Token空间,由同一套Transformer统一处理。简单说,就是让不同模态在同一个“大脑”里理解和生成,无需依赖模块间不断对齐。
这个架构的性能已经通过公开榜单验证:
* 4月:发布千亿参数闭源版本HiDream-O1,六项基准测试达到SOTA。
* 5月:开源版本HiDream-O1-Image登顶Artificial Analysis文生图榜单全球开源模型第一。
* 6月:商用版HiDream-O1-Image-1.5登上AA图像生成模型榜单,位列中国第一。
当然,统一架构不是智象独有。Google的Gemini Embedding 2、NVIDIA的Nemotron 3 Nano Omni也在尝试将更多模态纳入统一表示空间。但智象更进一步,探索世界模型的三种核心能力:“表达世界、推演世界、构造世界”,并已在具身智能训练数据生成、分子动力学理解等领域进行跨领域复用验证。
四、 商业闭环:从“模型能力”到“系统交付”
对于AI公司而言,模型领先仅是入场券。真正的护城河,在于能否将模型能力转化为稳定的生产力。
在WAIC 2026上,智象未来发布了全球首个无限时长内容创作智能体vivago R1。
它的技术逻辑很有意思:并非简单拉长视频,而是通过HD-AgentOS智能体操作系统,将完整创作流程拆解为需求理解、故事线规划、分镜设计、素材生成等环节,由多个智能体协同完成。
核心价值是什么?解决传统大模型概率性输出偏差导致的返工成本,将内容有效可用成功率提升至85%。企业采购的不再是单一模型,而是“基础模型+智能体系统”的稳定交付能力。
目前,智象已形成“1+1+3”的产品架构:以基础模型和Token Hub为底层支撑,通过三大场景智能体矩阵覆盖内容创作、商业营销、影视制作。其产品已覆盖全球100多个国家和地区,拥有超5000万用户、4万家企业客户及百万级付费用户。其中,HiBurst成为TikTok官方前五大AI合作伙伴之一,“帧赞”累计制作短漫剧超5000分钟。
结语
智象未来的崛起,标志着AI行业的价值评估标准正在重构。
在LLM竞争趋于同质化的今天,资本重新审视AI公司的价值:能够沉淀为产业基础设施、进入行业工作流、并持续创造商业价值的技术路线,才值得长期下注。
世界模型是否最终通向AGI仍是开放的技术问题,但多模态大模型及其衍生的智能体系统,已成为连接AI技术与实体产业的关键桥梁。
对于从业者和创业者而言,理解这一从“文本生成”到“世界建模”、从“模型能力”到“系统交付”的转变,或许是把握下一阶段AI机遇的关键。
毕竟,AI不仅要会“说话”,更要懂“世界”。