Groq被英伟达200亿美元收编:推理越快等于模型越聪明?
在人工智能基础设施的演进历程中,推理速度长期被视为一项单纯的工程优化指标,其价值主要被限定在改善用户体验与降低服务成本的范畴内。然而,随着智能体应用的爆发式增长与实时交互需求的急剧攀升,这一传统认知正在经历深刻修正。
Groq 创始人兼 Google TPU 发明者 Jonathan Ross 近期指出:推理延迟的降低并非仅仅让响应变快,而是直接扩展了模型的搜索深度与反思能力。 他进一步阐明了 GPU 与 LPU 的互补关系如何提升推理速度,并揭示了这一技术变革背后的商业逻辑——就在不久前的 2025 年 12 月,英伟达以 200 亿美元向 Groq 支付费用,获得了其 IP 授权并聘请了大部分团队成员。
一、算力新范式:GPU 与 LPU 的互补效应
外界常将 Groq 视为 NVIDIA 的挑战者,但 Jonathan Ross 明确了两者的互补关系。他以美国物流网络作比:若只能选择 18 轮重卡或最后一公里配送货车中的一种,答案显然是都要。
在大语言模型(LLM)的推理过程中,不同计算环节面临不同的瓶颈:注意力机制(Attention)受限于算力,而权重应用(Weight Application)则受限于内存带宽。 Groq 率先推出了专为 AI 推理设计的 LPU(Language Processing Unit)架构,这与依赖高带宽存储、擅长训练与通用计算的 GPU 形成了鲜明对比。
Jonathan Ross 分享了团队的测试结果:将计算密集型任务分配给 GPU、内存吞吐密集型任务交给 LPU,可在全性能曲线上实现更优表现。这一整合方案最初由 Groq COO Sunny Madra 提出,并经团队验证。当向黄仁勋展示成果并表达采购 10 万块 GPU 的意向时,黄仁勋当即判断该技术应面向所有客户开放。从首次沟通到 200 亿美元交易完成、资金到账,全程仅耗时三周。
二、模型越快越聪明:从 AlphaGo 看推理深度
基于 GPU 与 LPU 的互补基础,Jonathan Ross 提出了「模型越快越聪明」的观点。他类比「快思考与慢思考」理论,表示推理速度的提升直接扩展了模型的反思与探索能力,从而在具体局面下能找到全局更好的路径。
Jonathan Ross 以 AlphaGo 为例进行了深度剖析:
-
ELO 评分跃升:AlphaGo 模型在 GPU 上的 ELO 评分约为 3200,而迁移至 TPU 后,这一数字跃升至 3900 以上。
-
搜索深度的价值:AI 面对棋盘上 270 种可能走法时,会对它们进行排名并虚拟演练。更快的硬件允许它在相同时间内搜索更深的决策链,从而发现原本因计算深度不足而被忽略的最优解。
-
「Move 37」的诞生:在与李世石的对局中,著名的「Move 37」在训练数据中曾出现(万分之一概率),但在 GPU 上运行时未被找到——因为它在搜索链中太深了。当 TPU 提供了足够的推理速度,这一步创造性的走法才被「思考」出来。
三、商业巨变与未来展望
2016 年,前 Google TPU 团队工程师 Jonathan Ross 创立了 Groq。而在 2026 年 3 月的 NVIDIA GTC 2026 大会上,英伟达发布了搭载 Groq LPU 的 NVIDIA Vera Rubin 平台,标志着这一技术路线正式融入主流生态。
这种由速度带来的智能提升,也将重塑多智能体的协作效率。Jonathan Ross 认为,当 AI 调用其他 AI 时,人类可容忍的 1 至 2 秒延迟对机器而言是一种浪费,而 LPU 带来的极速响应可使 Agent 能以接近自身思维节奏运行。例如,他的 AI 助理会在主任务执行期间自动启动子 Agent 调研备选工具,进而形成自我强化的工作流。
AI 时代正在经历的不仅是算力的堆叠,更是工程生产关系的重构。正如 Jonathan Ross 所言,量化核心目标、意向性领导与信息透明机制,以及现实商数和制造不满的人才筛选标准,将帮助组织在长周期竞争中找准方向。