DeepSeek梁文锋内部谈话辨析:克制、愿景与AGI的长期主义

DeepSeek梁文锋内部谈话辨析:克制、愿景与AGI的长期主义

核心事件:2024年5月20日,DeepSeek创始人梁文锋与内部投资人进行沟通。
信息来源:沟通录音整理文字实录(原始标题:梁文锋4小时谈话全文)。

1. 组织哲学:愿景驱动与“平凡人”叙事

DeepSeek的组织架构与管理逻辑显著区别于传统互联网大厂。梁文锋在谈话中明确指出,公司成立初衷并非以“商业利益最大化”或“上市”为目标,而是基于“对世界巨大的善意”和“对人类有用”的愿景。

  • 无组织的管理:公司不依赖规章制度或KPI考核,而是依靠愿景驱动。梁文锋引用杰克·韦尔奇的观点,强调愿景是“怎么做”而非“怎么说”。公司内部实行“双轨制”管理:
    • 从上到下:正式分工(如发布V4版本),但要求正式工作占用员工时间不超过一半。
    • 从下而上:员工拥有50%的自由探索时间,无需前置要求,只需公司算力支持即可自行决定研究方向。
  • 团队稳定性为核心利益:梁文锋认为,DeepSeek最大的核心利益(甚至唯一不能退让的利益)是保持团队稳定性。只要核心团队稳定,AGI的实现只是时间问题。相比之下,资金和资源被视为容易获得的要素。
  • “平凡人”叙事:公司强调由一群“平凡的人”做出不平凡的事,这种叙事与公司的“克制”文化一脉相承,旨在凝聚共识而非依赖天才光环。

2. 开源策略:克制作为战略

DeepSeek将开源视为“克制”的一部分,并认为在AI领域,开源与商业化并不冲突,前提是接受“合理利润”而非“垄断利润”。

  • 开源的逻辑
    • 历史观:AI市场巨大(可能占GDP 10%),独占市场违背客观规律,必然遭遇阻力。只有分享利益,才能做成大事。
    • 商业考量:通过开源降低社会总成本,换取更广泛的生态支持和技术迭代加速。
  • 定价与利润
    • 十个月回本原则:API定价基于设备成本的“十个月收回成本”,对应约6倍利润。梁文锋认为这是合理利润,若追求更高利润(如100倍)则开源会影响商业模式,但在6倍利润前提下,开源不会影响收入。
    • 无弹性需求:当前价格区间内,用户需求无弹性,降价不会显著增加Token消耗量,因此维持在“大家开心、公司满意”的价格点。
  • 对竞争对手的态度:不担心第三方部署开源模型进行竞争,因为独立部署要达到同等低成本极具难度(需解决管理、物理制约等难点)。相反,DeepSeek希望协助社区复现模型,认为这能扩大生态。

3. 技术路线图:持续学习是下一阶梯

梁文锋详细阐述了DeepSeek对AGI发展路径的判断,认为技术演进是有迹可循的阶梯式上升。

  • 技术阶梯
    1. 语言模型(基础)
    2. 思维链(CoT)(去年突破,提升智能上限)
    3. Agent(今年突破,扩大能力范围)
    4. 持续学习(Continuous Learning)(下一步瓶颈,解决AI无法像人类一样长期适应环境的问题)
    5. 智能奇点(模型具备自我迭代能力)
    6. 具身智能(进入物理世界)
  • 持续学习的重要性:当前AI缺乏上下文之外的持续学习能力(如新员工需两个月熟悉环境)。解决持续学习是实现自我迭代奇点的关键,且能大幅加速DeepSeek自身的研发效率(AI辅助AI研究)。
  • 非主线技术
    • 世界模型/视频生成:认为与智能上限无直接关系,属于商业好生意但非技术主线,故不投入核心资源。
    • 多模态:视为组件而非主线,V4及后续版本将支持原生多模态,但不将其等同于智能本身。
  • Scaling定律:DeepSeek坚信Scaling有效,目前尚未触及上限。限制因素仅为算力,而非模型规模本身。

4. 资源约束与中国AI的结构性优势

DeepSeek承认在算力资源上与美国存在差距,但认为通过效率优化和生态创新可以部分弥补。

  • 算力现状
    • 目前拥有约2万张H等效算力,大部分为近期到位。
    • 训练最大模型(800B激活参数)需5万张GB300或20万张华为910,目前资源仅支持几十B激活规模的实验。
    • 采购策略:融资资金优先用于购买英伟达芯片,若能买到愿意支付一定溢价;同时深入参与华为生态适配(如TileLang编译器)。
  • 国产芯片替代
    • 生态瓦解:认为CUDA护城河正在被AI辅助编程和高级语言(如TileLang)瓦解。预计一年内国产芯片生态问题将得到验证和扭转。
    • 性能评估:华为910超节点在性能上可平替英伟达GB200/GB300,代价是4张华为卡顶1张英伟达卡,且落后约两年。
  • 中国AI的结构性优势
    • 成本优势:中国人能将AI产品做到最便宜,形成系统性低成本。
    • 效率优势:通过算法优化(如降低推理成本),在较少算力下实现 comparable 效果。
    • 人才:认为中美人才差距不大,瓶颈在于算力导致的实验机会差异。

5. 商业化判断:降维打击与副产品

DeepSeek认为其C端用户和B端收入是追求AGI过程中的“副产品”,而非首要目标。

  • 降维打击:以AGI为最高目标,使得公司在处理C端/B端应用时具有技术和组织优势。例如,去年春节C端流量爆发并非刻意运营结果,而是技术溢出效应。
  • 商业化时机:目前阶段聚焦AGI技术延伸(提升智能下限)比丰富产品线或探索复杂商业化路径(如广告、电商)更具收益。彻底转向商业化时间点尚远。
  • To B前景:认为To B需求受限于当前AGI技术水平,虽会快速增长但有上限。ARR收入有望达数亿美金,足以覆盖成本,但这并非核心驱动力。

结语

梁文锋的谈话揭示了一家典型的中国AI初创公司的独特生存逻辑:以愿景凝聚人才,以开源换取生态,以克制避免内耗,以效率弥补资源。在算力受限的背景下,DeepSeek选择了一条“巧算”而非“硬算”的路径,将持续学习作为通往AGI的关键阶梯,并坚信长期来看,成本优势和生态开放将是其核心竞争力。对于投资者和行业而言,理解这种“非传统”的商业理性,是解读DeepSeek崛起的关键。