Agent拉爆算力?中国杀出新物种:日冲10万亿Token,还赚钱了
核心摘要
本文深度解析商汤科技在上海WAIC发布的Agentic时代AI基础设施创新方案及“银河计划”。文章指出,在国产算力受限背景下,商汤通过“异构混合推理”技术,成功将大模型推理拆分为不同硬件优势区间,实现了商业化盈利。这不仅标志着国产算力从“可用”迈向“好用且可盈利”,更揭示了AI基础设施竞争范式从“拼GPU数量”向“拼生产效率”的根本性转移。
一、 行业痛点:算力供需的“剪刀差”
随着AI应用从“陪聊”转向“干活”,Agent成为算力消耗主体,导致供需矛盾激化:
- 需求侧:编码Agent等任务中,每生成1个输出Token需处理约154个输入Token;推理算力需求同比增长5-10倍。
- 供给侧:英伟达高端显卡进口受限,存量供给几乎零增长。
传统“单卡全栈推理”模式失效,亟需新的系统架构解法。
二、 技术突破:异构混合推理——把“铁人三项”拆开跑
商汤提出的核心解法是“异构混合推理”,利用不同芯片的特性分工协作:
| 工序 | 技术名称 | 功能描述 | 硬件选择 | 优势逻辑 |
|---|---|---|---|---|
| 第一道 | Prefill(读题) | 理解上下文、文档 | 通用国产卡 | 依赖计算吞吐量,国产卡已具备优势 |
| 第二道 | Decode(答题) | 逐字生成答案 | 高端显卡(如英伟达) | 依赖显存带宽,高端卡仍占优 |
工程挑战与解决方案
- 挑战:国产卡效率较低,导致调度比例失衡(纯英伟达方案为4:1,国产方案高达30:1),系统复杂度极高。
- 解决:商汤凭借多年底层技术积累(编译器、算子、网络等),实现99.9%的系统可靠性,适配GLM 5.2、DeepSeek V4等主流模型。
三、 商业验证:国产算力如何“上桌吃饭”?
此前国产算力常陷于“能跑但亏钱”困境,商汤此次明确了“可盈利”标准:收入覆盖折旧、摊销、机柜租赁、电费和人员服务费后利润为正。
盈利三步走策略
- 榨取性能:定向优化国产芯片,单卡MFU最高提升152%。
- 扩大产出:异构混推使同成本下Token产出规模扩大2.5倍。
- 规模效应:日均Token量从年初4,000亿预计至年底10万亿,增长25倍。
关键洞察:国产算力无需等待单卡全面追平,可通过系统级分工提前盈利。
四、 架构演进:从“五老板管工厂”到“端到端Token工厂”
痛点:分层割裂
传统智算中心产业链被分割(厂房、机器、销售分属不同公司),导致优化空间受限,利润流失严重。
商汤模式:端到端控制
商汤打通从物理层到客户Token流量的整条链路,实现系统级联合调优。
“Token工厂”闭环生态
- 类比:芯片=机器,网络=流水线,KV Cache=仓库,调度=厂长,电力=原料,Token=产品。
- Agent反哺:使用Agent辅助算子迁移和优化,加速国产芯片适配。
- 算电协同:结合宁德时代储能和国网需求响应,配合峰谷电价弹性调度,单位电力成本Token产出提升80%,电费降低10%。
五、 战略发布:“银河计划”与全球布局
“银河计划”四大目标
联合寒武纪、华为昇腾等近20家伙伴,旨在构建:
1. 1个Token工厂
2. 5个万卡国产集群
3. 10个共创技术方向
4. 200+家AI初创组织接入
为何选择“5个万卡”而非“1个10万卡”?
面向第三方市场,任务多样(LLM、视频生成、具身智能等),灵活组合比单一模型优化更重要。
区域与前沿布局
- 出海:香港打造全港最大国产智算中心(2030年40,000P+);沙特输出整套“中国AI方案”。
- 太空算力:发射“商汤号”算力卫星,构建天地一体化AI算力星座,服务于无网络覆盖地区。
六、 总结与启示
1. 竞争范式转移
AI基础设施竞争已从“军备竞赛”(拼峰值算力)转向“生产效率竞赛”(拼速度、成本、稳定性)。
2. 赢家画像
未来的赢家未必是拥有最多GPU的公司,而是最擅长将不同芯片、电价、模型和任务组织成高效生产线的公司。系统级优化能力比单点硬件指标更具商业价值。
3. 国产算力新阶段
国产算力已跨过“可用”门槛,进入“好用且可盈利”阶段。Agent不仅是算力消费者,也是提升算力生产效率的工具。