DeepSeek梁文锋内部谈话辨析:克制、愿景与AGI的长期主义
DeepSeek梁文锋内部谈话辨析:克制、愿景与AGI的长期主义
核心事件:2024年5月20日,DeepSeek创始人梁文锋与内部投资人进行沟通。
信息来源:沟通录音整理文字实录(原始标题:梁文锋4小时谈话全文)。
1. 组织哲学:愿景驱动与“平凡人”叙事
DeepSeek的组织架构与管理逻辑显著区别于传统互联网大厂。梁文锋在谈话中明确指出,公司成立初衷并非以“商业利益最大化”或“上市”为目标,而是基于“对世界巨大的善意”和“对人类有用”的愿景。
- 无组织的管理:公司不依赖规章制度或KPI考核,而是依靠愿景驱动。梁文锋引用杰克·韦尔奇的观点,强调愿景是“怎么做”而非“怎么说”。公司内部实行“双轨制”管理:
- 从上到下:正式分工(如发布V4版本),但要求正式工作占用员工时间不超过一半。
- 从下而上:员工拥有50%的自由探索时间,无需前置要求,只需公司算力支持即可自行决定研究方向。
- 团队稳定性为核心利益:梁文锋认为,DeepSeek最大的核心利益(甚至唯一不能退让的利益)是保持团队稳定性。只要核心团队稳定,AGI的实现只是时间问题。相比之下,资金和资源被视为容易获得的要素。
- “平凡人”叙事:公司强调由一群“平凡的人”做出不平凡的事,这种叙事与公司的“克制”文化一脉相承,旨在凝聚共识而非依赖天才光环。
2. 开源策略:克制作为战略
DeepSeek将开源视为“克制”的一部分,并认为在AI领域,开源与商业化并不冲突,前提是接受“合理利润”而非“垄断利润”。
- 开源的逻辑:
- 历史观:AI市场巨大(可能占GDP 10%),独占市场违背客观规律,必然遭遇阻力。只有分享利益,才能做成大事。
- 商业考量:通过开源降低社会总成本,换取更广泛的生态支持和技术迭代加速。
- 定价与利润:
- 十个月回本原则:API定价基于设备成本的“十个月收回成本”,对应约6倍利润。梁文锋认为这是合理利润,若追求更高利润(如100倍)则开源会影响商业模式,但在6倍利润前提下,开源不会影响收入。
- 无弹性需求:当前价格区间内,用户需求无弹性,降价不会显著增加Token消耗量,因此维持在“大家开心、公司满意”的价格点。
- 对竞争对手的态度:不担心第三方部署开源模型进行竞争,因为独立部署要达到同等低成本极具难度(需解决管理、物理制约等难点)。相反,DeepSeek希望协助社区复现模型,认为这能扩大生态。
3. 技术路线图:持续学习是下一阶梯
梁文锋详细阐述了DeepSeek对AGI发展路径的判断,认为技术演进是有迹可循的阶梯式上升。
- 技术阶梯:
- 语言模型(基础)
- 思维链(CoT)(去年突破,提升智能上限)
- Agent(今年突破,扩大能力范围)
- 持续学习(Continuous Learning)(下一步瓶颈,解决AI无法像人类一样长期适应环境的问题)
- 智能奇点(模型具备自我迭代能力)
- 具身智能(进入物理世界)
- 持续学习的重要性:当前AI缺乏上下文之外的持续学习能力(如新员工需两个月熟悉环境)。解决持续学习是实现自我迭代奇点的关键,且能大幅加速DeepSeek自身的研发效率(AI辅助AI研究)。
- 非主线技术:
- 世界模型/视频生成:认为与智能上限无直接关系,属于商业好生意但非技术主线,故不投入核心资源。
- 多模态:视为组件而非主线,V4及后续版本将支持原生多模态,但不将其等同于智能本身。
- Scaling定律:DeepSeek坚信Scaling有效,目前尚未触及上限。限制因素仅为算力,而非模型规模本身。
4. 资源约束与中国AI的结构性优势
DeepSeek承认在算力资源上与美国存在差距,但认为通过效率优化和生态创新可以部分弥补。
- 算力现状:
- 目前拥有约2万张H等效算力,大部分为近期到位。
- 训练最大模型(800B激活参数)需5万张GB300或20万张华为910,目前资源仅支持几十B激活规模的实验。
- 采购策略:融资资金优先用于购买英伟达芯片,若能买到愿意支付一定溢价;同时深入参与华为生态适配(如TileLang编译器)。
- 国产芯片替代:
- 生态瓦解:认为CUDA护城河正在被AI辅助编程和高级语言(如TileLang)瓦解。预计一年内国产芯片生态问题将得到验证和扭转。
- 性能评估:华为910超节点在性能上可平替英伟达GB200/GB300,代价是4张华为卡顶1张英伟达卡,且落后约两年。
- 中国AI的结构性优势:
- 成本优势:中国人能将AI产品做到最便宜,形成系统性低成本。
- 效率优势:通过算法优化(如降低推理成本),在较少算力下实现 comparable 效果。
- 人才:认为中美人才差距不大,瓶颈在于算力导致的实验机会差异。
5. 商业化判断:降维打击与副产品
DeepSeek认为其C端用户和B端收入是追求AGI过程中的“副产品”,而非首要目标。
- 降维打击:以AGI为最高目标,使得公司在处理C端/B端应用时具有技术和组织优势。例如,去年春节C端流量爆发并非刻意运营结果,而是技术溢出效应。
- 商业化时机:目前阶段聚焦AGI技术延伸(提升智能下限)比丰富产品线或探索复杂商业化路径(如广告、电商)更具收益。彻底转向商业化时间点尚远。
- To B前景:认为To B需求受限于当前AGI技术水平,虽会快速增长但有上限。ARR收入有望达数亿美金,足以覆盖成本,但这并非核心驱动力。
结语
梁文锋的谈话揭示了一家典型的中国AI初创公司的独特生存逻辑:以愿景凝聚人才,以开源换取生态,以克制避免内耗,以效率弥补资源。在算力受限的背景下,DeepSeek选择了一条“巧算”而非“硬算”的路径,将持续学习作为通往AGI的关键阶梯,并坚信长期来看,成本优势和生态开放将是其核心竞争力。对于投资者和行业而言,理解这种“非传统”的商业理性,是解读DeepSeek崛起的关键。