DeepSeek梁文锋:TileLang瓦解CUDA生态,国产GPU仅落后2年
在人工智能硬件与算法加速演进的关键节点,DeepSeek 创始人梁文锋近日公开阐述了该机构在技术路线、算力战略及开源生态上的核心规划。其核心观点指出,中国 GPU 硬件目前仅落后约 2 年,而 DeepSeek 自研的 TileLang 编译器正在快速瓦解 CUDA 的生态护城河。
算力战略:不将英伟达视为必需品
在算力资源方面,DeepSeek 采取了极度务实且激进的采购策略。目前,DeepSeek 拥有约 2 万张 H 等效算力,且大部分为近期到位。对于算力采购,其态度是在合理价格区间内“能买多少卡就买多少卡”,愿意支付溢价将资金转化为算力资产。
梁文锋明确判断,英伟达 GPU 未来并非绝对必需品。通过深度适配国产芯片,算力中心完全可以满足需求。以华为为例,DeepSeek 已部署约 1.6 万张华为 950 加速卡。根据实测数据,约 4 张华为 950 的性能可顶 1 张 NVIDIA GB300/B 系列。尽管在硬件设计与时间上存在约 2 年的客观代差,但产能(Capacity)限制才是当前真正的核心瓶颈,而非技术不可逾越。
技术破局:TileLang 如何瓦解 CUDA 生态
DeepSeek 认为,AI 辅助编程与高级编译器技术的结合,正在从根本上降低构建新芯片生态的代码门槛。
具体而言,DeepSeek 自研了 TileLang 高级编译器。该技术路线通过高级语言重写算子,使得系统几乎可以脱离对 NVIDIA CUDA 原生生态的依赖。数据显示,使用 TileLang 仅牺牲约 1%~2% 的性能,却大幅提升了代码开发效率与跨硬件适配能力。
梁文锋预期,在 1 年之内,通过“AI + TileLang 高级编译器”模式,行业将彻底改变对国产芯片“生态不好、用不起来”的既有认知。此外,计算卡与游戏卡的解耦趋势,也让专用加速芯片的生态构建变得更加直接。
研发主线:聚焦持续学习与智能体
在模型演进阶梯上,DeepSeek 的路径清晰划分为:语言模型 (LLM) ➔ 思维链 (CoT) ➔ 智能体 (Agent) ➔ 持续学习 (Continuous Learning)。
- 当前重点:Agent(智能体)是当前重中之重,旨在扩大能力边界。
- 下一个瓶颈:持续学习。目前的模型缺乏类似人类员工入职后积累上下文的能力,解决此问题后,模型将协助研究人员开发下一代模型,进而迈向自我迭代奇点。
- 非主线业务:视频生成(如 Sora)、3D 生成等被归类为非核心组件;多模态与搜索仅作为模型的“组件”,V4 及后续版本虽将原生支持多模态,但这不等于智能主线。
在 Scaling(规模效应)方面,DeepSeek 未遇到上限。受限于算力,目前模型停留在几十 B 激活参数规模,下一步计划在算力到位后,推向 150B ~ 250B 激活参数的更大尺度规模。
商业哲学:10个月回本与不追求盈利
DeepSeek 的运营逻辑与传统商业化公司截然不同。其唯一的核心利益是保持核心研究团队的稳定性,以此换取 AGI 的实现概率。为此,团队在大模型巨大的商业利益面前选择“克制”,不争夺过度的市场份额与 C 端短期变现机会。
在 API 定价上,DeepSeek 遵循“10 个月回本”法则,即设定在购买设备后约 10 个月收回硬件成本的合理利润区间(约对应 6 倍利润)。得益于算法优化和极高的部署效率,竞争对手的成本往往高出数倍。
组织管理上,DeepSeek 实行双轨制:正式项目占用员工时间不超过 50%,保留 50% 以上的时间给研究员自由探索。同时,最优先研发的垂直领域 Agent 是 Coding Agent(代码智能体),因为其能直接提升内部研发下一代 AGI 模型的效率,而金融、医疗等垂直领域则交由合作伙伴共建。
结语
DeepSeek 的未来路线图显示,以 AGI 主线为根本,以 TileLang 编译器等工程手段弥补硬件代差,并充分拥抱国产算力,是一条可行的突围路径。这不仅验证了软件重构对硬件性能的补偿作用,也为国产 AI 芯片的生态突破提供了实战范本。