Agent拉爆算力?中国杀出新物种:日冲10万亿Token,还赚钱了

Agent拉爆算力?中国杀出新物种:日冲10万亿Token,还赚钱了

核心摘要

本文深度解析商汤科技在上海WAIC发布的Agentic时代AI基础设施创新方案及“银河计划”。文章指出,在国产算力受限背景下,商汤通过“异构混合推理”技术,成功将大模型推理拆分为不同硬件优势区间,实现了商业化盈利。这不仅标志着国产算力从“可用”迈向“好用且可盈利”,更揭示了AI基础设施竞争范式从“拼GPU数量”向“拼生产效率”的根本性转移。


一、 行业痛点:算力供需的“剪刀差”

随着AI应用从“陪聊”转向“干活”,Agent成为算力消耗主体,导致供需矛盾激化:
- 需求侧:编码Agent等任务中,每生成1个输出Token需处理约154个输入Token;推理算力需求同比增长5-10倍。
- 供给侧:英伟达高端显卡进口受限,存量供给几乎零增长。

传统“单卡全栈推理”模式失效,亟需新的系统架构解法。


二、 技术突破:异构混合推理——把“铁人三项”拆开跑

商汤提出的核心解法是“异构混合推理”,利用不同芯片的特性分工协作:

工序 技术名称 功能描述 硬件选择 优势逻辑
第一道 Prefill(读题) 理解上下文、文档 通用国产卡 依赖计算吞吐量,国产卡已具备优势
第二道 Decode(答题) 逐字生成答案 高端显卡(如英伟达) 依赖显存带宽,高端卡仍占优

工程挑战与解决方案

  • 挑战:国产卡效率较低,导致调度比例失衡(纯英伟达方案为4:1,国产方案高达30:1),系统复杂度极高。
  • 解决:商汤凭借多年底层技术积累(编译器、算子、网络等),实现99.9%的系统可靠性,适配GLM 5.2、DeepSeek V4等主流模型。

三、 商业验证:国产算力如何“上桌吃饭”?

此前国产算力常陷于“能跑但亏钱”困境,商汤此次明确了“可盈利”标准:收入覆盖折旧、摊销、机柜租赁、电费和人员服务费后利润为正。

盈利三步走策略

  1. 榨取性能:定向优化国产芯片,单卡MFU最高提升152%。
  2. 扩大产出:异构混推使同成本下Token产出规模扩大2.5倍。
  3. 规模效应:日均Token量从年初4,000亿预计至年底10万亿,增长25倍。

关键洞察:国产算力无需等待单卡全面追平,可通过系统级分工提前盈利。


四、 架构演进:从“五老板管工厂”到“端到端Token工厂”

痛点:分层割裂

传统智算中心产业链被分割(厂房、机器、销售分属不同公司),导致优化空间受限,利润流失严重。

商汤模式:端到端控制

商汤打通从物理层到客户Token流量的整条链路,实现系统级联合调优。

“Token工厂”闭环生态

  • 类比:芯片=机器,网络=流水线,KV Cache=仓库,调度=厂长,电力=原料,Token=产品。
  • Agent反哺:使用Agent辅助算子迁移和优化,加速国产芯片适配。
  • 算电协同:结合宁德时代储能和国网需求响应,配合峰谷电价弹性调度,单位电力成本Token产出提升80%,电费降低10%。

五、 战略发布:“银河计划”与全球布局

“银河计划”四大目标

联合寒武纪、华为昇腾等近20家伙伴,旨在构建:
1. 1个Token工厂
2. 5个万卡国产集群
3. 10个共创技术方向
4. 200+家AI初创组织接入

为何选择“5个万卡”而非“1个10万卡”?

面向第三方市场,任务多样(LLM、视频生成、具身智能等),灵活组合比单一模型优化更重要。

区域与前沿布局

  • 出海:香港打造全港最大国产智算中心(2030年40,000P+);沙特输出整套“中国AI方案”。
  • 太空算力:发射“商汤号”算力卫星,构建天地一体化AI算力星座,服务于无网络覆盖地区。

六、 总结与启示

1. 竞争范式转移

AI基础设施竞争已从“军备竞赛”(拼峰值算力)转向“生产效率竞赛”(拼速度、成本、稳定性)。

2. 赢家画像

未来的赢家未必是拥有最多GPU的公司,而是最擅长将不同芯片、电价、模型和任务组织成高效生产线的公司。系统级优化能力比单点硬件指标更具商业价值。

3. 国产算力新阶段

国产算力已跨过“可用”门槛,进入“好用且可盈利”阶段。Agent不仅是算力消费者,也是提升算力生产效率的工具。