商汤WAIC 2026发布日日新SenseNova U1 Pro:原生8K与"图文交错思维"的生成范式跃迁
一、核心事件
商汤在WAIC 2026上正式发布新模型——日日新SenseNova U1 Pro。
U1 Pro是一套面向复杂多模态任务的交付系统,围绕目标完成理解、规划、信息组织、多模态生成、检查修正和最终交付,内核是"理解、生成、行动的原生统一"。
二、三大技术亮点
1. 原生8K输出
重点不只是像素更高,还在于超大画幅里继续维持文字、构图和细节。商汤采用的关键方案是使用32×32的大Patch。
常见生图模型可能采用16×16 Patch,如果一个Patch对应一个或一组Token,边长扩大一倍后,视觉Token总数可以降到原来的四分之一。
为了解决大格子更容易丢细节的问题,团队又加入了自适应Noise Control,对细节区域使用更有针对性的训练策略;Patch之间保留一定重叠,同时在空间采样、Loss设计和模型结构上进行优化。
2. 图文交错思维
模型可以围绕目标连续完成草图、细化、着色、检查和调整。商汤联合创始人、首席科学家林达华表示:"商汤在U1阶段已经观察到连续创作的雏形。模型可以先画草图,再补充细节、着色,逐步生成完整图像。"
进入U1 Pro后,这套流程进一步扩展成一条闭环:理解目标、规划任务、组织信息、生成内容、检查问题、持续修正,最后完成交付。
3. 面向成品交付
商汤瞄准的场景包括信息图、城市规划、影视分镜、学术海报和商业设计,希望模型少一些反复抽卡,多一些真正能拿去用的结果。
三、四项实测验证
测试一:8K版"二十四节气"长图
任务要求:24个节气的名称和顺序不能乱;每个节气要对应合适的物候与季节颜色;24个竖向单元需要彼此区分,同时保持完整的视觉风格;从春到冬的色彩也要自然过渡。
结果:模型把24个节点放进了同一套横向版式里,每一格的山水高度、植物位置和留白都在变化,画面有了类似屏风和长卷结合的节奏。
测试二:高级实验室视觉海报
Prompt主题:《机器如何观察和理解人类》
画面要求:中央出现一位背对镜头、略微侧身的人物,头部和上半身叠加检测框、坐标轴、几何圆、运动轨迹、视线追踪、空间网格和数据节点。
结果:暗金线条、黑色背景与纸张颗粒感,形成了比较完整的视觉层级。中心焦点明确,信息量很高,画面没有完全失控。
测试三:琉璃质感古风建筑山河图
材质要求:山体像琉璃、玉石和珐琅共同烧制,表面有流动高光、釉面层次和金色描边;水面要有通透感和反射;建筑则不能变成廉价的3D模型。
结果:模型能够把琉璃山体、水系、古建和未来建筑组织成相对完整的世界,体现出对复杂风格要求的执行力。
测试四:可商用电影海报
要求:整体为高完成度、可直接上映宣传使用的成片海报,气质介于东方诗意、悬疑史诗与现代艺术电影之间,具有强烈的视觉冲击力和高级审美。
结果:字字清晰,整体效果可以直接商用。
四、行业意义:生图正在复刻AI Coding的路
商汤CEO徐立在现场将当前问题概括为:"能交互,不等于能交付。"
从行业角度看,U1 Pro对应的是一次产品范式变化。我们可以参考AI Coding的发展路径:
- AI Coding第一阶段:Copilot,帮助专业开发者补全代码
- 第二阶段:Vibe Coding,用户用自然语言表达需求
- 第三阶段:Coding Agent,开始拆解任务、写代码、调用工具、测试和修复,承担完整工程
模型价值也从"写了多少行代码",转向"能不能把项目做出来"。
多模态的内容也正在出现相似变化:
- 第一阶段:单点生成
- 第二阶段:意图驱动,用户可以持续修改
- 第三阶段:系统级内容交付——模型不只生成一张图,还要理解目标、组织信息、保持长程一致性、检查错误,并交付可以使用的结果
商汤由此判断,图文交错思维和理解生成统一,也可能打开视觉设计这条差异化赛道。
五、待验证环节
U1 Pro目前还不能说是完美:
- 异步生成意味着用户要用等待时间换更高完成度
- 编辑能力、成本和稳定性仍需真实项目验证
- 专业设计场景也不会只依赖一张最终图片,图层、矢量元素、版本管理和团队协作同样重要
但可以确定的是,方向已经变得清楚——当生图告别反复抽卡,开始对结果负责,多模态Agent的竞争,才算真正开场。
来源:量子位 | 公众号 QbitAI | 记者:金磊
原始链接:https://mp.weixin.qq.com/s/NDNUFfwY7ETyI4QeOmyYyg