Google 发布 Nano Banana 2 Lite 与 Omni Flash:视觉生成的流水线革命

Google 发布 Nano Banana 2 Lite 与 Omni Flash:视觉生成的流水线革命

引言:4 秒出图背后的战略意图

6 月 30 日,Google 发布了两款面向开发者的新模型——Nano Banana 2 LiteGemini Omni Flash。这不仅是两款新产品的上线,更标志着 Google 对图像生成赛道的一次重新定义。

Nano Banana 2 Lite(又名 Gemini 3.1 Flash-Lite Image)的定位非常明确:速度最快、成本最低。它能以 4 秒生成一张 1K(1024×1024)分辨率的图像,单张价格仅为 0.034 美元,折合约人民币 0.25 元。而 Omni Flash 则负责将图片转化为视频,每秒收费 0.10 美元。

两家模型的组合,正在改变一个根本性问题:图片在软件系统中到底是什么?


一、产品定位:从"精品创作"到"流水线零件"

1.1 图像模型的价格轴

各家图像模型的产品线几乎都遵循同一逻辑:顶层定位专业终稿,追求极致质量;中间层覆盖日常需求,平衡成本与效果;底层主打廉价快速,以量取胜。

海外的 Flux、Grok Imagine,国内字节的 Seedream,都有自己的廉价档图像模型,价格普遍在 1.5 到 3.5 美分(约 0.1 到 0.25 元人民币)一张的量级。

但 Nano Banana 2 Lite 的特殊之处在于,它把调用一次的门槛压到了几乎可以忽略。一张图只要四秒、三分钱,做图这件事就从"生成一张"变成了"可以批量生成、随时重来、快速试错"。

1.2 Nano Banana 家族矩阵

型号 分辨率 速度 单价 定位
Nano Banana PRO 最高 4K 较慢 最高 专业终稿、复杂推理
Nano Banana 2 (NB2) - 20 秒 0.067 美元 通用主力、质量成本平衡
Nano Banana 2 Lite 1K (1024×1024) 4 秒 0.034 美元(批量档 0.0168 美元) 廉价快速、批量生产

Lite 只支持 1K 输出,不支持 Google Search grounding,在小字、复杂信息图和事实准确性上更容易暴露问题。它的核心取舍是:用分辨率和部分复杂任务能力,换取更低的推理成本与延迟。

1.3 Omni Flash:补齐视频链路

在此之前,谷歌的图像生成和视频生成是两个独立的产品线,中间没有官方推荐的衔接方式。开发者想从图片推进到视频,需要自己写胶水代码、做格式转换、处理接口不一致等问题。

Omni Flash 在 5 月 19 日的 I/O 大会上首次亮相,并在当天上线了消费端产品,而 6 月 30 日是它首次通过 API 向开发者开放的日子。它能:
- 把一张图或一段文字变成 10 秒视频
- 靠 Interactions API 维持会话状态
- 让人用自然语言在同一段视频上连续叠加编辑(官方上限是三次)

这次 Google 在架构层面把图生视频的标准链路做通了,本质上是在补中间那截缺失的管道。


二、技术取舍:Lite 省掉了什么?

2.1 "Thinking On"机制

新一代的 Nano Banana 出图方式已经变了。出图之前和过程中,模型会先花一部分算力去想构图、检查空间关系和物理是否合理、斟酌图里的文字,然后才落笔。这个"想"的过程要花时间。

Lite 的核心取舍,就是把大部分斟酌的步骤省掉。但官方依然显示有 Thinking On——这是谷歌官方生成截图里标注的一个状态字段,表示模型在输出前启动了内部推演机制。换句话说,就是前面说的"先在脑子里摆盘"的那个过程。

PRO 像一个接单的大厨,拿到一个新需求会先在脑子里摆盘、分析客户的定制要求,再动手,慢,但讲究。Lite 像大排档炒饭的师傅,同一道菜炒过一万遍,凭肌肉记忆直接出锅,4 秒上桌,图个七十分管饱。

2.2 官方 Benchmark 数据

维度 Nano Banana 2 Lite NB2 初代 Flux 低配版 Grok Imagine Seedream Lite
生成质量 1251 1270 1151 1069 1174 1132
编辑质量 1308 1387 - - 1329 -
延迟 4 秒 20 秒 - 4 秒 - 45 秒
单价 0.034 美元 0.067 美元 - 0.016 美元起 - -

从这几个维度的 Benchmark 数据可以看出,Lite 不是最便宜的,但它在速度、质量、价格三者平衡上却是最优的。

有两个值得注意的细节:
1. 彩蛋 1:Lite 有"Thinking On",说明它不是完全放弃思考的傻瓜式生成,依然有内部推理过程,只是比 PRO 少了很多斟酌。
2. 彩蛋 2:官方 Benchmark 里只对比了 Lite、NB2、初代和竞品,但 PRO 缺席了。潜台词可能是:PRO 定位的是专业级终稿,它的评分体系和这几款不在一条赛道上。


三、实测分析:六个场景验证边界

为了判断 Lite 的能力边界,测试将 Nano Banana 家族的 Lite、NB2、PRO 和字节的 Seedream 4.5 放在同一套提示词下并排跑了实测,分为三个维度、六个场景。

3.1 维度 A:内容即资产的场景

这类场景包括高端快消品横版大海报、无线耳机电商详情首图等。核心特点是容错率太低,错了就是事故。

场景一:高端快消品横版海报
- 任务:给地铁站或高端商场灯箱设计海报
- 难点:半空凝固的液体飞溅、凝露反光、电影级轮廓光、大量留白的编辑排版、三级中文文字(主标题、副标题、底角品牌细则小字)
- 结果:四家表现都没出问题,但 NB2 和 NB PRO 有光影的应用细节,证实了在重度生产力端这两个模型依旧有独特的优势
- 结论:资产场景的核心问题是容错率太低,错了就是事故,所以该用 PRO 还是得用 PRO。Lite 在这个维度上还没有达到靠得住的标准。

场景二:无线耳机电商详情首图
- 任务:白底正方形图片,考验产品保真度和小字标签
- 结果:四个模型输出几乎没差别,如果盲测可能都难以分辨
- 结论:Lite 在资产场景尚未达到可靠标准

3.2 维度 B:内容是耗材的场景

这类场景包括教学示意图、信息流促销图等。特点是量大、看个大概就行,对成本非常敏感。

场景三:初中生物线粒体结构示意图
- 任务:卡通风格,中文标注外膜、内膜、嵴、基质
- 结果:Lite 在线粒体的"嵴"字出现乱码,Seedream 4.5 表现也一样,NB2 还把内膜和外膜都标准反了
- 结论:教育场景虽然内容是消耗品,但生僻字出现概率大且需要一定的严谨性,这类图如果当作资产来对待,用 PRO 更稳妥

场景四:夏季快干 T 恤的信息流促销图
- 任务:正方形,中文大字"夏日上新"加一行促销文案
- 结果:Lite 出的图比较有视觉冲击力,是大促或者低成本铺量销售的首选
- 结论:促销图、批量素材这类量大管饱的需求,Lite 几乎是完美匹配,它生成的图片够快、够便宜、够好看

3.3 维度 C:介于资产和耗材之间的场景

场景五:公众号推文封面图
- 任务:横版,把香蕉和科技元素结合,还有中文大标题
- 结果:Lite 出的是传统发光科技风,中规中矩,是快速配图发文的首选
- 结论:公众号封面、配图这类好看就行的需求,Lite 完全够用

场景六:英伟达季度营收财经数据图
- 任务:柱状图加折线,中文标题加一堆数字和百分比标签
- 结果:Lite 带点科幻风,但里面小字有点糊
- 结论:数据图表这类需要有准确信息的需求,Lite 会编造数字、糊掉小字,拿去做 B-roll 凑合,但要直接发布就危险。分水岭是:图是装饰还是信息载体?装饰用 Lite,信息载体上用 PRO

3.4 实测总结

场景类型 代表场景 Lite 适用性 推荐模型
内容即资产 品牌海报、电商首图 ❌ 不适用 PRO / NB2
内容即耗材 促销图、批量素材 ✅ 首选 Lite
装饰用途 公众号封面、配图 ✅ 可用 Lite
信息载体 数据图表、教学插图 ❌ 有风险 PRO

四、工作流变革:从"生成"到"质检"

4.1 标准自动化链路的四个环节

当生成速度和价格继续下降,系统的瓶颈也会从能否生成转向能否控制错误。一条标准的自动化链路至少要包含四个环节:

第一层:生成
Lite 根据提示词、参考图和结构化参数快速产生多张候选素材。它的任务是用低成本生成多张图片,让系统有更多结果可选。

第二层:自动校验
这是硬门槛。OCR 扫一遍标题和小字,规则程序核对价格、日期、参数,图像相似度判断商品主体有没有跑偏,内容审核模型再过滤违规元素。只要踩了任何一条红线,直接淘汰,根本不会到发布这步。

第三层:模型分流
对构图一般、风格不匹配但事实层没有问题的图片,可以继续调用 Lite 重生成;对复杂排版、品牌主视觉和多参考图一致性任务,则升级到 NB2 或 PRO。模型选择不应在任务开始前固定,而应由风险和失败类型动态决定。

第四层:人工验收
只有品牌资产、专业知识、商品真实性和公开数据等高风险内容,才进入人工审核。人的时间不再花在从零制作每一张图,而是集中处理自动校验无法覆盖的边界情况。

4.2 成本账怎么算

假设 Lite 一次生成十张候选只需要约 0.34 美元,但其中有三张存在文字或结构错误。如果系统可以自动淘汰,错误成本接近于零;如果每张都需要编辑逐一检查,模型节省的生成费用很快就会被人工验收时间抵消。

因此,判断 Lite 是否划算,不能只比较每张 0.034 美元的图片的生成成本,而要计算总成本。而总成本还包括自动校验的成本、人工审核、返工、错误发布造成的风险成本。

在低风险、高重复、可自动验证的任务里,生成成本仍然占据重要位置,Lite 的优势能够直接体现。到了数据图表、教学插图和品牌物料这类场景,生成费用可能只是总成本中最小的一项,错误检测和责任成本才是主要变量。

4.3 定价策略透露的目标用户

区分给人用还是给系统用不只是看单价高低,而是价格结构。

  • 消费级产品:按次付费、按张计费,贵但灵活
  • 流水线定价:单价压到足够低,同时提供批量折扣(批量档再砍一半),暗示调用方是按千次、万次为单位消耗的

一个人一个月做不了 1000 张图,但一个广告系统一小时就能跑掉一万张。这套定价不是让用户买得起,是让系统亏得起。

Nano Banana 2 Lite 批量档价格可以降到 0.0168 美元,而 Flux 2 Klein 9B 起价仅为 0.016 美元,只是质量上并不如 Lite。


五、启示:真正的壁垒是什么?

5.1 图片角色的转变

Nano Banana 2 Lite 真正的意义,是改变图片在软件系统中的角色:

过去,图片通常是由人制作并上传的成品;现在,它可以像文本和接口返回值一样,在 Agent 执行任务时被即时生成、筛选、丢弃和重做。

视觉生成由独立的创作动作,变成自动化工作流中的一个可调用环节。

5.2 难以复制的能力

当一套系统每小时可以生成一万张图时,真正的技术问题已经不是能不能生成图片,而是图片生成之后的验收这一步怎么来做。

真正难以复制的,不是 4 秒出图,而是针对不同任务建立风险分级、自动校验和模式选择:
- 哪些素材可以直接使用
- 哪些需要升级到更强模型
- 哪些必须由确定性工具或人工完成

Lite 降低了候选素材的生成成本,却没有消除质量成本;它只是把质量控制从生成后的人工补救,前移成工作流内部的工程问题。

5.3 给从业者的建议

  1. 明确场景属性:先判断你的图片需求是"资产"还是"耗材",是"装饰"还是"信息载体"
  2. 建立自动校验管线:OCR、规则引擎、内容审核模型是必选项
  3. 动态模型选择:不要固定使用某个模型,应根据风险和失败类型动态决定
  4. 关注总成本:不要只看生成单价,要考虑校验、审核、返工、风险的全链路成本

结语

Google 此次的目标,不是一个更优秀的图像生成工具。它想把生成一张视觉素材这件事,做成一个像调用函数一样便宜、能塞进任何自动化流程的环节。Nano Banana 2 Lite 加 Omni Flash,是它把视觉生产接进工作流的第一套零件。

当生成速度越来越快、价格越来越低,竞争的关键将从"谁能生成更好的图片"转向"谁能更好地管理和控制生成的内容"。对于 AI 从业者、开发者和创业者而言,理解这一转变,比单纯追逐模型性能指标更为重要。


本文基于 6 月 30 日 Google 发布的官方信息及实测数据撰写,所有事实、数字和时间均来自可核对的材料来源。