贾扬清离开英伟达再创业,一句话造的推理引擎跑出 6.3 倍提速
加入英伟达一年后,贾扬清又出来了。新公司叫 Intent Lab,首批交出三份作业——GLM-5.2 推理引擎、一行 prompt 生成的数据库引擎、带形式化验证的文件系统。乍看互不搭边,背后是一套叫 Fleet 的生成引擎,定位很狂:「首个将意图转换为生产级软件的自主团队」。
不过今天不谈这句口号。有两件事比定位更值得说清楚:Lepton 被收购之后发生了什么,以及那个推理引擎快在哪、怎么做到的。
时间线回到 2023 年 3 月。贾扬清从阿里离职创立 Lepton AI,做 AI Infra——用云原生加多云整合调度全球 GPU,给开发者提供算力租赁和模型部署。创始团队里有 ONNX 的联合创始人,一帮开源老伙计再聚头。2025 年 3 到 4 月,英伟达以约 7 亿美元收购 Lepton,改名 DGX Cloud Lepton 并入 DGX Cloud 体系。
然后事情就开始拧了。
Lepton 的产品理念是「Python 原生、开箱即用」,面向 AI 原生开发者,轻量敏捷。英伟达那边面向大企业客户,产品管理更封闭。据材料描述,DGX Lepton 在收购后几个月就基本停止对外运营,团队精力被消耗在 UI 调整这类表层工作上,多租户这样的核心技术问题一直没解决。
更直接的一刀是开源承诺。收购时英伟达曾答应 2026 年前开源 Lepton 的核心平台,最终被否决。目前 GitHub 上只有客户端 SDK 和 CLI,后端调度引擎和云平台管理还是闭的。原因不难想:Lepton 的调度器一旦开源,竞争对手也能用它高效管理非英伟达的 GPU,这和英伟达卖硬件的商业模式直接冲突。但贾扬清这个人整个职业生涯长在 Caffe、PyTorch、ONNX 这一串开源项目上——所以 2025 年 6 月离开英伟达,不算意外。
中间有个插曲:Hyperbolic Labs 请他当顾问,方向是云基础设施、GPU marketplace、多云编排,和 Lepton AI 最初的目标几乎一字不改。大家以为他要重操旧业——结果只是一个支线。
他的原话是:「我们把整个职业生涯花在了世界上最大的分布式系统和 AI 基础设施上,一直是精心的架构设计,一次做一个系统。但现在更感兴趣的,是一次能产出一千个系统的系统。」
Intent Lab 把 Fleet 定位为「把意图变成生产级软件的自主团队」。第一批三个成果,官方口径是全部端到端完成,没有人工介入。
GLM-5.2 推理引擎是这批成果里技术细节最完整的一个。
最初意图只有一句话:重新改造 TensorRT-LLM 的代码,让 GLM-5.2 跑在 Grace Blackwell 节点上,自己识别可优化的类别,自己实现,自己验证。TensorRT-LLM 是英伟达反复打磨过的推理框架,在上面再抠性能,属于牙膏皮上挤牙膏。
Fleet 最终交付的优化覆盖了四个方向,在两台 Grace Blackwell 节点上把输出速度从 102 tokens/s 推到 647 tokens/s,提升 6.3 倍。每项优化都有实际收益:内核层面通过 kernel fusion 加 agent 直接生成 PTX 和 SASS,绕过编译器拿到指令级控制,贡献 +24%;运行时方面用 H2D batching 把稳态 decode 步骤中 host-to-device 的元数据拷贝从大约十次降到零,贡献 +16%;通信层面用一个融合的 MNNVL all-reduce 把 residual add 和 RMSNorm 折进集合通信里,每层省一次 kernel launch 和一整轮内存往返,贡献 +18%。投机解码配合优化过的 DSpark drafter,一次提出多个 token 再统一验证——前面几层把瓶颈清得很干净,投机解码才能叠出 4 倍。
Fleet 跑这套优化的流程像一整个开发团队:roofline 分析、瓶颈识别,然后 propose、verify、compound,验证不过就打回重来,一轮结束再回去找下一个瓶颈。
贾扬清对这个问题的判断是对的。他说模型现在写代码已经很快了,但从「能跑起来的代码」到「你愿意放进生产并且持有很多年的软件」,中间还隔着一段真实距离。他不认为这段距离是模型能力的限制,缺的是中间一层——一个把模糊意图变成真实设计、检查结果是否站得住、在系统跑起来后让它继续演进的自主系统。Intent Lab 把这一层拆成六个环节:Understand、Design、Coordinate、Build、Verify、Evolve——就是一个靠谱工程团队的日常,只不过主语从人换成了智能体系统。
目前 Intent Lab 计划与外部合作,专门面向那些「工程量太大、一直排在清单上没人力去做」的系统。
从 Caffe、PyTorch、ONNX,到 Lepton AI,再到 Intent Lab,贾扬清一直在做同一件事的不同版本:让别人更容易用上算力。但这次的做法不太一样——不是造一个工具给人用,而是造一个能自己造工具的团队。能不能真正落地,还得看 Fleet 在面对真实生产系统的复杂度时,是不是真能像宣传那样全程不人工介入。至少目前 GLM-5.2 这个例子的技术细节足够扎实,不是那种「用 AI 写了个 hello world 就号称取代程序员」的路数。
相关链接