Google 把 Gemini 焊进芯片:一杯 Cappuccino 还没萃取完,就喊了 Frozen

The Information 刚曝出来,Google 正在搞一颗代号「Frozen v2」的服务器芯片,打算把 Gemini 的部分架构直接固化进硬件。据知情人士的说法,这颗芯片每瓦功耗能输出的 Token 数,可能达到 Google 现有自研 AI 芯片的 6 到 10 倍,最快 2028 年部署。

先冷静。6 到 10 倍这个数字,说的是「每瓦能效」,不是单卡绝对算力。而且这是知情人士给出的大致范围,不是官方承诺。但方向已经非常清楚:Google 准备造一颗专供 Gemini 的芯片,而且是一次定型、不再回头的那种。

模型怎么「焊」进芯片?

一个大模型拆开,核心两样东西:权重(几千亿个参数,决定它知道什么)和架构(多少层、什么算子、数据怎么流过计算单元)。按照目前披露的方案,Frozen v2 想固化的不是权重——权重可以继续更新,模型也可以继续训练——而是那条「怎么算」的主干。

通用芯片之所以通用,是因为它要服务不同模型和任务,每次运行时编译器都要重新处理调度、数据搬运、缓存分配。Frozen v2 则把这套 overhead 省掉了:Gemini 怎么算、怎么搬,出厂前就定死在电路里。省调度、省搬运、敢压精度——用更低精度换更高吞吐,因为不用再给其他模型留余地。

这套思路其实是 Google 的祖传手艺。2015 年初代 TPU 干的就是这件事——把 CPU、GPU 里 AI 用不上的通用功能全删了,芯片面积全让给矩阵运算。十年过去,Google 准备把专用化再推一步:GPU 保留通用性,TPU 收窄到 AI 常用运算,Frozen v2 连「兼容各种模型架构」这个包袱都准备扔掉。每收窄一层,效率升一层,回头的余地也少一层。

但尴尬的是,Gemini 自己还在难产。

Frozen v2 曝光的几天前,Gemini 3.5 Pro(内部代号 Cappuccino)刚刚宣布延期。5 月 I/O 大会上说 6 月上线,6 月没上。前几天圈子里传 7 月 17 日发布,结果等来的是延期数月——原因是编码能力没达到内部标准。Google 紧急更新了一轮训练数据想抢救,但结果用彭博社的转述说——「令人失望」。消息一出,Alphabet 股价当天跌超 4%。

有前员工形容 Google 的跨部门协调「就像试图煮沸整个大海」。更扎心的是,因为 GPU 容量不够,Google 自己的工程师经常用不上自家的 AI 编码工具。这个手握自研 TPU、今年资本开支奔着 1900 亿美元去的公司,自己人也被算力卡脖子。

缺便宜的算力缺到这个份上,就不难理解它为什么盯上「焊芯片」这条最极端的省电路线。但矛盾摆在那里:芯片最早 2028 年部署,如果那之前 Gemini 只是换权重、扩规模,它还能继续跑;但如果底层计算方式变了,今天换来的高能效,明天就是死胡同。

说来也巧,这两件事的代号已经把矛盾写得明明白白:Cappuccino,还在萃取;Frozen,准备冷冻。起名的人可能比谁都懂 Google 现在的处境。

那为什么还敢赌?

因为在 Google 眼里,赔率变了。最近几轮旗舰模型的更新,其实都没有早期那种肉眼可见的能力飞跃了。沃顿商学院一位教授管这叫「下一代巨模型失望陷阱」——堆数据堆算力换能力跃升的老路,收益递减,发布会越开越像挤牙膏。

对模型公司是坏消息,但对芯片设计师是好事。正因为架构不再月月大改,「把骨架焊死」才第一次从疯狂变成可行。而 Gemini 3.5 的难产,恰恰给这个判断做了注脚——连 Google 自己都很难再让模型发生「长相级」的变化了。

当然赌就是赌。万一范式转移真来了——全新的注意力结构、新的记忆机制、甚至非 Transformer 的形态——Frozen v2 的效率一夜之间就会变成技术包袱。Google 等于把 2028 年之后的筹码,现在就押上了桌。

而且这不是 Google 一家在赌。

2020 年,Google 研究员 Sara Hooker 写过一篇论文叫《The Hardware Lottery》,核心观点是:AI 历史上胜出的研究方向,往往不是因为思想最好,而是因为恰好适配了当时的硬件。深度学习本身就是最大的中奖者——神经网络的思想上世纪就有了,苦等几十年,直到撞上 GPU 这张彩票才翻了身。

过去是硬件开奖,模型来抽。现在这台彩票机被反过来了:芯片开始只认某一个模型的骨架。

创业公司 Etched 把 Transformer 的运算模式固化进芯片,其他架构一概不跑。更极端的 Taalas,连模型权重都直接做进硅片,一颗芯片就是一个模型,官网口号叫「The Model is the Computer」。微软 Maia、亚马逊 Trainium、Meta 的 MTIA,虽然没走这么极端,但方向也都一致——芯片为自家负载定制,越来越不通用。

币圈已经把这条路走过一遍。比特币挖矿从 CPU 到 GPU,再到 ASIC 矿机。专用化每前进一步效率大幅上升,但单颗芯片能做的事也越来越少。

五年后,如果全世界的数据中心里插满了优先服务 Transformer、甚至只认 Gemini 骨架的芯片。那个可能颠覆 Transformer 的新架构,要先跑在什么机器上?它的「GPU 时刻」,又由谁提供?

这个问题,没有写在任何一张芯片的路线图里。