贾扬清官宣 Intent Lab,这次不帮你管 GPU 了
一个月前贾扬清离开英伟达的消息出来时,圈子里大多猜他还会回 GPU 云。从阿里云到 LeptonAI 再到英伟达 DGX Cloud,他这几年一直在跟算力调度、集群利用率、多云部署这些硬核 Infra 问题死磕。六月又接了 GPU 云厂商 Hyperbolic 的顾问,怎么看都是老路数的延续。
结果新公司 Intent Lab 正式官宣,方向没按这个剧本走。
联合 Junjie Bai、Xiang L.、Casber Wang 几个开源老将,这次不搞 GPU 云平台了,而是做一件更上层的事——让 AI 自己造生产级系统。核心产品叫 Fleet,定位是全球第一个把意图变成生产级软件的自主团队。你给一个高层目标,一组 Agent 自己完成理解需求、拆解设计、写代码、做验证、上线部署、持续迭代的整条链路。
Intent Lab 官宣时放了三个案例,把 Fleet 的能力边界卡得挺清楚。
第一个是 GLM-5.2 的推理引擎优化。在两台 Grace Blackwell 节点上,输出速度从 102 tokens/s 拉到 647 tokens/s,6.3 倍。优化本身不稀奇,但 Fleet 的做法值得看——它自己先做瓶颈分析,再提方案、实现、验证,失败了回退,成了继续找下一个瓶颈。四类优化分别是:内核层做 kernel fusion 并直接生成 PTX 和 SASS 绕过普通编译器路径;运行时层通过 H2D batching 减少 CPU 到 GPU 的不必要元数据拷贝;通信层把 residual add 和 RMSNorm 算子融合进 all-reduce;再加上投机解码配合更好的 drafter 批量产出 token 再验证。每一层都是系统级手术。
第二个案例是一句话生成一个数据库引擎,最终通过了 600 万条 SQLite 兼容性测试。数据库要处理查询语义、存储结构、事务行为、边界条件和历史兼容。Agent 写出「看起来能跑」的数据库不难,难的是把自己放进严格测试体系里一轮轮修正,直到行为接近真实生产系统的要求。Fleet 在这个案例里展示的,是这种持续自验证的能力。
第三个案例是 AgentFS,一个专门给 AI Agent 用的分布式文件系统。Agent 在云端跑的时候不断启沙箱、扫目录、读写大量小文件,传统云存储方案如 Amazon EFS 能凑合但不适合这种高频并发的负载。Fleet 从零搭了一个,基础操作比 EFS 快了数十倍到数百倍,Git 操作快了 2.5 到 14 倍。它不只是把代码写出来——对核心协议做了约 190 万个状态的形式化验证,配合 300 个集成测试和故障注入,过程中还抓住并修了一个普通 coding agent 在分布式创建和删除文件时导致数据损坏的 bug。
三个案例摆出来,Intent Lab 想补的缺口很清楚。
过去一年 coding agent 进步快,但很多团队用下来会发现演示效果和生产价值之间有落差。Agent 可以很快写出版本、很快修 bug,但当系统变复杂、状态变多、依赖变长、错误代价变高,它就容易从效率工具变成风险来源。Fleet 要做的是让 Agent 不仅能写代码,还能做架构设计、瓶颈分析、形式化验证和生产级迭代。
降低别人用上算力和系统的门槛,是贾扬清这几年的主线。Caffe 让深度学习走出实验室,PyTorch 让模型变成生产基础设施,LeptonAI 让 GPU 集群更好用。到 Intent Lab,他试图让造一个生产级系统这件事从手艺活变成自动化流程。
这背后是 AI Infra 的价值在重新排序。过去 Infra 最值钱的是资源和封装,但 Agentic Coding 崛起后,一部分封装复杂性的价值正在被 AI 自己吃掉。真正变得稀缺的,是让 AI 理解模糊意图、拆解架构设计、持续验证并发现隐藏 bug 的深层系统能力。AI Infra 的竞争,方向已经从帮人管理基础设施,变成让 AI 成为基础设施的建造者。
Intent Lab 能不能跑通还不好说,但至少他把问题定义到了一个值得较真的位置——不是 AI 能不能写代码,而是 AI 能不能组建一支工程团队,并且让它交付你不敢不检查的东西。