Qwen3.8-27B-FP8 发布:27B 量测档,1M 上下文,Agent 跑得动

Qwen 团队把 Qwen3.8-27B 的 FP8 量化权重上传到了 Hugging Face,仓库名叫 Qwen/Qwen3.8-27B-FP8。不是那种简单打个量测就跑的版本——官方用的是细粒度 FP8,block size 128,声明的性能指标跟原始模型基本持平。

27B 模型,1M 上下文

27B 参数,5120 隐藏维度,64 层,结构是 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))。这个混合架构在 Qwen3.5 上就出现过,Qwen3.8 在此基础上做了一些增强。

上下文长度原生支持 262,144 tokens,通过 YaRN 可以扩展到 1,000,000。不过官方在部署建议里特别提醒了一下:所有主流开源框架实现的 YaRN 都是静态缩放,缩放因子是固定的,对短文本的性能可能会有影响,建议只在真正需要长上下文的时候才改配置。

量化版能信吗

FP8 量化最常见的担忧就是质量损失。这个仓库用的是 fine-grained FP8,block size 128,跟常见的 int8 或粗放 fp8 不太一样——block size 越小,对精度分布的捕捉就越细。官方 benchmark 显示,在多个指标上 Qwen3.8-27B 追平了参数更大的模型,比如 SWE-bench Pro 拿到 61.7,超过了 Muse Glimmer-30B 的 51.2;CoWorkBench 70.7,OSWorld-Verified 84.3。

至于量化版具体的质量损失,官方只说了一句「nearly identical」,没有给量化前后逐条对比的数据,这块儿只能实际部署后再验证了。

Agent 能力是这次的重点

从 benchmark 来看,Qwen3.8-27B 在 agentic 场景上明显下了一番功夫:

  • SWE-bench Pro: 61.7,比 Qwen3.6-27B 的 53.5 高了接近 8 分
  • DeepSWE 1.1: 42.2,作为对比 Qwen3.6-27B 只有 13.3
  • CoWorkBench(长时办公任务): 70.7
  • AndroidWorld(移动端使用): 81.9
  • OSWorld-Verified(桌面操作): 84.3

这些 benchmark 里有不少用的都是 Claude Code harness,测试条件是 temp=1.0、top_p=0.95、256K 上下文。

Thinking mode 默认开启,推理深度可以通过 reasoning_effort 参数调节(xhigh / medium / low)。同时默认开了 preserve_thinking,会把历史对话中的推理过程保留下来——这对 multi-turn agent 场景挺重要的,不然每一轮都得重新推导一遍。

官方还提醒了一个反直觉的点:在 multi-turn agent 任务里,调低 reasoning effort 不一定能省时间,因为分析不充分可能导致更多重试,反而更慢。

部署兼容性

权重文件兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed。官方推荐生产环境用 SGLang、vLLM 或 TokenSpeed 这类专用 serving 引擎。

如果想走 API 而不是自己部署,Qwen Cloud 的官方服务马上要上线托管版本,会自带 1M 上下文和内置工具,目前状态是「coming soon」。

值得注意的限制

量化模型文件是 28B params,tensor type 是 BF16 · F8_E4M3。这意味着推理时需要支持 FP8 的硬件或框架后端,不是随便找张 CUDA 卡就能跑起来的。

长上下文需要改 YaRN 配置,多模态视频理解要调整 video_preprocessor_config.json 里的 longest_edge 参数才能发挥上限。这些额外的步骤意味着,「下载权重直接跑」和「跑好一个生产任务」之间还是有距离的。

相关链接:

  • 模型页面:https://huggingface.co/Qwen/Qwen3.8-27B-FP8
  • Qwen Cloud 模型页:https://www.qwen.com/model