
点击查看大图

点击查看大图

点击查看大图

点击查看大图

点击查看大图
Forge 会从任意 PyTorch 或 HuggingFace 模型自动生成优化后的 GPU 内核。32 个并行的“生成—评估”智能体相互竞赛,挑选出最快的 CUDA/Triton 实现,性能相比 torch.compile(mode='max-autotune') 最多可提升 5 倍,且保持 97.6% 的正确率。只需输入 HuggingFace 模型 ID,即可获取每一层的优化内核。后端由经调优的 NVIDIA Nemotron 3 Nano 30B 提供支持,吞吐率高达 250k tokens/s。若未能超越 torch.compile,承诺全额退款。
产品评分
4.7(10 条评分)
登录后即可评分
5
0.0%
4
0.0%
3
0.0%
2
0.0%
1
0.0%
















