商汤发布SenseNova U1 Pro:8K直出与交付级AI生图的博弈

商汤发布SenseNova U1 Pro:8K直出与交付级AI生图的博弈

事件概要

在世界人工智能大会(WAIC)上,商汤科技正式发布下一代多模态基座模型——日日新SenseNova-U1 Pro。商汤科技董事长兼 CEO 徐立在现场揭晓了一幅为 WAIC 九周年特制的 8K 东方城市长卷《智会世图》,该作品由 U1 Pro 直接生成。

此次发布的核心理念是"交付"而非单纯的"生成"。商汤科技联合创始人、首席科学家林达华将其定位为"创作模型",强调从"能生成"向"能交付"的跨越。


技术架构:NEO-unify 统一理解与生成

U1 Pro 采用商汤自研的理解生成统一架构 NEO-unify,其核心特征包括:

  • 统一 Transformer:砍掉了传统多模态架构中 VE(视觉编码,负责理解)和 VAE(变分自编码器,负责生成)两个独立组件,让理解、生成、行动共用同一套表征和计算。
  • 自回归序列:生成过程中没有专门的调度器指挥,模型一路预测下一个 token,自行判断何时输出图像 token。文字和图像始终跑在同一条自回归序列上。
  • 效率优势:据称仅需十分之一数据即可追平顶尖 SOTA,训练和推理成本低于谷歌和 OpenAI。

商汤在今年 4 月率先发布了 SenseNova U1 轻量级开源模型,并在 5 月至 7 月间升级了 infographic-V1、V2 和 V3 等多个版本。


8K 直出:算力瓶颈的工程解法

U1 Pro 将原生分辨率提升至 8K,但面临 Transformer 注意力开销随 token 数量平方增长的挑战。商汤采用两项关键技术解决:

  1. 32×32 大 patch:普通生图模型使用 16×16 patch,U1 Pro 改用 32×32 大 patch 覆盖更大画面,将 token 量直接降至四分之一。
  2. 自适应分级噪声控制:在细节吃紧处注入更多噪声,迫使模型分配更多算力抠细节,弥补大 patch 带来的精度损失。

"图文交错思维"与 Agentic Generation Loop

U1 Pro 的创作流程被拆解为生成、编辑、局部重绘、组合等动作空间,每步操作后回看前序结果再决定下一步。这一机制被称为"图文交错思维",背后依赖:

  • 指令思维链:冷启动阶段将设计师的专业判断整理为指令思维链,让模型学会"先定版式、再铺大色、最后抠细节"的章法。
  • 强化学习:使用几十维度的奖励模型对构图、文字准确度、设计美感、整体一致性打分,通过反馈迭代模型判断力。

整套流程被称为 Agentic Generation Loop,可进行数十轮长程迭代。


评测与对比

商汤邀请 200 位美院学生和设计师组成评审团,标准是"一批图里六成敢直接交给客户才算合格"。结果显示:

  • 目前仅有 U1 Pro 和 GPT Image 2 两个模型能达到这一标准。
  • 在文字精准度、设计感和东方细节处理上,U1 Pro 略胜一筹。

现场还展示了 U1 Pro 与 GPT Image 2 在同一提示词下的对比案例(如"麻婆豆腐"菜谱图),以及多场景生成演示,包括盛唐长安西市、民国上海电影海报、国风二次元乐队海报、商业广告、展览海报、科普信息等。


行业信号:从"像"到"能用"

商汤提出的观点是,图像生成十年走过两级台阶——先解决"像",再解决"真"——而第三级台阶是"美",即通过专业级设计美感达到工业交付标准。

林达华表示,SenseNova-Vision 已开源,展示了深度、遮挡、镜面、近大远小等视觉常识的学习进展,并称之为"视觉涌现"的初步迹象。其长期愿景是"Words to Worlds",让视觉和语言真正在一个空间内融合。

U1 Pro 的未来应用方向包括通用视觉感知、空间智能、具身大脑、城市规划和建筑设计。


关键事实速查

项目 信息
发布时间 WAIC 大会当天
发布方 商汤科技
产品名称 日日新 SenseNova-U1 Pro
核心架构 NEO-unify
原生分辨率 8K
Patch 大小 32×32
数据效率 十分之一追平 SOTA
开源历史 4 月发布 SenseNova U1,5-7 月升级 infographic V1-V3
评审规模 200 位美院学生和设计师
交付合格率 六成敢交客户为合格线
对标模型 GPT Image 2
相关开源 SenseNova-Vision