Vivix发布A1实时交互多模态模型:近30B参数实现消费级GPU流式推理
量子位 | 公众号 QbitAI
Vivix正式发布了其首个实时互动模型A1,这是一个基于统一流式架构的多模态模型。与此同时,Vivix还推出了旨在改变剧情走向的W1模型。
核心事件与产品概览
Vivix此次发布的A1模型被定位为“全球首个在一套原生流式架构中,统一多模态参考、实时交互和流式生成的基础模型”。
与传统数字人或视频生成模型不同,A1强调角色拥有“身体”。这意味着屏幕内的角色不仅能对着镜头说话,还能行动、转身、改变姿态,并与所在世界里的物体和环境持续互动。这种互动是实时的,角色的反应基于用户的即时输入,而非预先编排。
此外,Vivix同步推出的W1模型赋予用户“实时导演”能力,允许用户介入并改变人物的选择、行动及剧情走向。
技术突破:统一流式架构
A1的核心挑战在于如何在持续生成过程中保持角色、物体和场景的长期一致性,同时响应用户的实时交互。
1. 统一多模态参考、交互与流式生成
传统Clip-based视频模型通常一次性生成完整片段,易于统筹前后动作和画面。而流式生成无法预知未来内容,只能根据已生成的画面和用户新指令实时预测下一段内容。这导致误差容易累积,可能出现角色外形漂移或空间关系破坏。
A1通过以下方式解决此问题:
* 因果时序建模和流式状态维护: 将图片、视频、声音、交互历史和已生成内容写入持续状态,并在后续生成中反复生效。
* 双重先验机制:
* 局部连续性先验: 确保相邻动作自然衔接。
* 全局序列先验: 在更长时间范围内维持角色身份、场景和物体关系。
* 优化目标: 包括开放式指令遵循、时间连续性、角色一致性、物体一致性和运动动态,重点处理视觉漂移、误差累积和动作衰减。
2. Speech、Audio、Gesture与Event统一建模
大多数现有数字人采用流水线模式:ASR转文字 -> LLM生成回答 -> TTS转声音 -> Motion/Video Model补口型和动作。这种模式存在等待延迟,且语气、情绪、环境音等非文本信息易丢失。
A1直接对语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号进行统一建模。
* 快思考(最小时间片推理): 多模态上下文(音视频参考、系统prompt、历史帧等)原生输入给A1模型,模型在约300ms内推理出响应token。
* 慢思考(Director Agent): 负责推理、思考和工具使用,异步给出长时序宏观行为控制。
这使得感知、规划、行为控制和音视频生成进入同一条实时链路,实现了持续聆听和事件触发响应。
3. MJD多维联合蒸馏:从8-Step压缩到2-Step
视频扩散模型的采样步骤承担不同任务(结构、细节、连续性)。直接减少步数会损失质量。Vivix提出了MJD(Multidimensional Joint Distillation,多维联合蒸馏):
* 基线: 以8-Step版本为质量基线。
* 压缩: 将不同去噪阶段的能力压缩进2-Step模型。
* 三大优化目标:
1. Short-Horizon Generation Quality: 保留快速采样下的视觉细节和运动表现。
2. Long-Horizon Temporal Consistency: 抑制连续rollout中的漂移与累计误差。
3. Multimodal Distribution Alignment: 对齐latent空间、像素空间以及语义和动作分布。
MJD防止模型通过“少动”来换取稳定,确保学生模型学习教师模型更完整的动作分布。
基础设施:VMI与消费级GPU实时推理
A1拥有近30B激活参数,采用8x8x4的高质量压缩率,这对推理成本和实时性构成巨大挑战。为此,Vivix推出了Vivix Model Infra (VMI)。
1. Encoder与Decoder解耦
- 问题: 多模态Encoder适合大Batch高吞吐,Real-Time Decoder Loop需低延迟稳定输出。同一资源池会导致任务拥堵。
- 解决方案: 拆分为独立服务,分别配置进程、资源池和扩缩容策略。
- PD分离架构: 在推理阶段引入prefill/decode分离,重新设计KV Cache传输层,减少状态搬运和等待。
- 效果: 支持稳定连续生成、模型级打断和实时重定向。响应新输入最短300毫秒,平均延迟低于0.6秒。
2. 原生NVFP4训推协同
- 挑战: 视频扩散模型对量化误差敏感,微小偏差会累积导致细节退化和角色漂移。
- 方案:
- 将Blackwell GPU支持的NVFP4 GEMM设为目标推理路径。
- 引入low-precision-aware distillation,让模型提前适应4-bit数值分布,而非仅做PTQ。
- 加入专门的去噪误差校正,压制量化误差累积。
- 训练过程直接对齐最终部署使用的NVFP4 GEMM Kernel。
- 效果: 生成质量接近无损,同时降低显存占用并提高推理吞吐。
3. 计算、通信调度与Mega-kernel
针对多卡系统中GPU、PCIe和显存的等待瓶颈:
* Compute-Communication-Memory Co-Scheduling Engine: 将计算、通信和显存调度纳入同一张推理执行图。
* 并行与融合:
* 让Attention通信、显存Offload和跨服务数据传输运行在不同CUDA Stream中,与GPU计算重叠。
* 将计算与通信融合进Mega Kernel,减少中间状态写回和同步等待。
* 利用CUDA Graphs捕获整张流式推理图,将数百次Kernel Launch压缩成少量统一提交。
* 性能数据: 单卡吞吐超过10,000 video tokens/s;多卡链路中PCIe带宽利用率达到88%+。
总结与展望
Vivix通过A1模型和VMI基础设施,实现了近30B激活参数模型在消费级GPU上的实时流式生成。
- A1: 交付了一套已经运行起来的原生流式多模态模型,实现了角色与用户的实时视频通话式交互。
- W1: 进一步让用户能介入并改变剧情走向。
官方已开放内测,欢迎访问官网及API开放平台申请体验:https://vivix.ai/
信息来源:量子位公众号文章《刚刚,AI接通了平行世界的电话!全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型》