Forge CLI

Forge CLI

32 个并行智能体,自动为任意 HuggingFace/PyTorch 模型优化 CUDA/Triton,加速 GPU 计算

4.7(10)
104点赞
2026-01-06
Forge CLI screenshot 1
点击查看大图
Forge CLI screenshot 2
点击查看大图
Forge CLI screenshot 3
点击查看大图
Forge CLI screenshot 4
点击查看大图
Forge CLI screenshot 5
点击查看大图
Forge 会从任意 PyTorch 或 HuggingFace 模型自动生成优化后的 GPU 内核。32 个并行的“生成—评估”智能体相互竞赛,挑选出最快的 CUDA/Triton 实现,性能相比 torch.compile(mode='max-autotune') 最多可提升 5 倍,且保持 97.6% 的正确率。只需输入 HuggingFace 模型 ID,即可获取每一层的优化内核。后端由经调优的 NVIDIA Nemotron 3 Nano 30B 提供支持,吞吐率高达 250k tokens/s。若未能超越 torch.compile,承诺全额退款。

产品评分

4.7(10 条评分)
登录后即可评分
5
0.0%
4
0.0%
3
0.0%
2
0.0%
1
0.0%
访问官网

相关产品