vivago R1实测:模型聚合之上,长视频编排能力成新护城河

智象未来发布vivago R1:AI视频生成的“无限时长”革命与编排护城河

2026年7月18日,世界人工智能大会(WAIC)的聚光灯下,智象未来(HiDream.ai)抛出了一枚重磅炸弹:全球首个无限时长内容创作多模态智能体——vivago R1正式发布。同日,公司宣布已完成C轮融资,近三个月累计融资超20亿元人民币,正式跻身独角兽行列。

这一系列动作不仅标志着智象未来的崛起,更预示着AI视频生成领域正在经历一场从“拼模型”到“拼编排”的深刻范式转移。

一、 破局:当“拥有模型”不再是壁垒

在AI视频生成的早期阶段,谁掌握了最先进的底层模型,谁就拥有了话语权。然而,随着Sora、可灵(Keling)、Veo等头部模型的竞相问世,画质差距正在迅速收窄,且大多开放API接口。“谁有模型”已不再是核心壁垒,模型能力的商品化已成定局。

正是在这样的背景下,vivago R1的诞生具有了里程碑式的意义。它标志着行业共识正从比拼底层模型参数,转向比拼Agent编排能力与长视频生成技术。如果说之前的AI视频工具是“点石成金”的魔法棒,那么vivago R1则更像是一个不知疲倦、逻辑严密的“超级导演”。

二、 vivago R1的核心突破:从3分钟到“无限”

智象未来面向专业创作者推出的智能体平台vivago,其前身Vivago Video Agent曾于2026年5月登顶Product Hunt,但当时单条视频输出上限仅为3分钟。而此次发布的vivago R1,核心突破在于彻底打破了这一限制,实现了“无限时长”视频创作。

具体而言,vivago R1主打三大特质:

  1. 无限时长与全场景适配:彻底打破行业主流的15-30秒短镜头限制,支持短剧、专题片、品牌宣传片等长周期创作场景。这意味着创作者不再需要为了时长妥协叙事结构。
  2. 长任务思考保障逻辑连贯:具备精细化逻辑构思、镜头排布与风格校准能力,有效解决了AI视频生成中常见的画面跳变、人设崩塌和叙事断层问题。
  3. 高稳定生成赋能商业交付:依托AgentOS全流程调度,将内容有效可用成功率提升至约85%,大幅降低了后期修改调试的成本,使其真正具备商业交付价值。

三、 技术拆解:自研与聚合的混合架构

关于vivago R1的技术底座,公开证据显示其采取的是“自研模型 + 聚合第三方 + 上层Agent编排”的混合架构。这种策略既保证了灵活性,又最大化利用了现有资源。

  • 聚合侧:官网llms.txt文件明确列出其聚合了Sora 2、可灵v2.6 Pro、Veo 3/3.1以及自研的Vivago 2.0。用户无需关心底层使用的是哪家供应商,系统会根据技能需求自动路由。
  • 自研侧:智象未来拥有HiDream-O1-image系列及自研视频模型(现更名为HiDream 2.0),这为其提供了核心的差异化能力。

通过逆向工程分析发现,前端请求域名均指向vivago网关,底层模型被完全封装。R1本质上是一个技能驱动的编排Agent,包含17个功能技能(如cinematic-story-director)。在参数层面,单段视频生成时长被细化为4至15秒不等,长视频依然依赖多段拼接与缝合,但关键在于如何无缝地拼接。

四、 实测验证:土耳其山寨「星战」的启示

为了测试vivago R1在复杂叙事、多机位切换及风格一致性上的极限表现,我们设计了一个极具挑战性的测试案例:“叶什尔查姆风格的荒诞科幻烂片”(即低成本土耳其山寨版《星球大战》)。

1. 成片效果惊艳,一致性极高

一部仅1分11秒的短片中,人物(八字胡红紧身衣队长、漏勺头盔纸板怪兽)、道具及廉价美学风格从头到尾保持高度统一。在AI视频生成中,常见的“审美坍缩”或“CGI过度精致化”现象并未出现。仅在41秒处出现短暂画面发黏,背景在1分钟处有轻微漂移,整体完成度极高。

2. 编排机制揭秘:锁定参考图

从后台日志看,R1执行了名为cinematic-story-director的Skill,其流程严谨而复杂:
理解任务 → 故事初稿 → 视听剧本 → 拆分场景 → 美术指导 → 生成锁定参考图 → 文字分镜 → 视频提示词 → 逐场景生成 → 拼接成片。

关键在于Node5阶段:R1先生成了主角、场景和道具的“锁定参考图”,随后所有分镜均基于同一套参考图进行生成。这种“锁参考图+逐段参考图生视频”的工程编排手段,正是实现全片人物不崩的秘密所在。

3. 资产复用实现真正的“无限”

所谓的“无限时长”并非指单次生成两小时电影,而是指形象、道具、场景可固化为资产并复用。在实测中,我们将故事续写第二集时,人物与机器人形象依然高度统一,验证了资产复用的可行性。

五、 更多场景实测:覆盖典型痛点

除了长片叙事,vivago R1还在以下三个典型痛点场景中表现出色:

  • 形象可控性(案例:狗狗特工队):在无厘头默剧短片中,狗狗肢体未出现漂移,跨时间生成中宠物形象保持一致。虽有个别段落因服务端切换模型产生轻微风格差异,但整体质量很高。
  • 理解力极限(案例:不存在的产品宣传片):针对一款现实中不存在的“厨房吊柜下投影模块”,R1能基本理解产品逻辑并制作竖版宣传片。但在涉及物理空间位置等复杂世界模型认知上,仍出现了少量不符合产品逻辑的画面,显示出其在物理常识理解上仍有提升空间。
  • 批量生产能力(案例:十二星座安全屋):在未枚举具体星座的情况下,R1在规划阶段自动生成了全部十二星座的图片并进入流程(甚至多出一个),一口气将多个场景串联成片,无需用户手动拼接,展现了强大的批量生成能力。

六、 行业启示:编排即护城河

2026年,随着伯克利哈斯商学院等机构指出“纯软件Agent编排层护城河脆弱”的观点,市场一度对AI应用层的价值产生质疑。然而,vivago R1的案例有力地反驳了这一观点。

聚合只是手段,编排出来的体验才是产品核心。

当模型能力变为水电般的基础设施,稀缺性转移到了“从想法到成片”的整条链路体验上。就像消费者去超市不仅是为了买可乐,更是为了购买选品、动线和服务打通的体验一样。vivago R1通过AgentOS将脏活、累活的镜头语言和叙事规划自动化,证明了在长视频领域,优秀的编排能力正是当下最坚实的护城河。

智象未来通过vivago R1的发布,不仅展示了其技术实力,更指明了AI视频生成行业的下一个发展方向:不再是单纯追求画质的极致,而是追求叙事逻辑、角色一致性和创作效率的全面突破。对于专业创作者而言,这或许是一个全新的黄金时代的开端。