Qwen3.8 开源|2.4T 参数,阿里把「Max 级」模型放出来了
Qwen 团队最近在 Hugging Face 放了一个比较重量级的东西:Qwen3.8-2.4T-A95B。用他们自己的话说,这是「Qwen 开源家族迄今最强的一个」。这是第一次把 Qwen-Max 级别的模型真正开源出来——此前它只是 API 里的云产品。
这个模型总参数量 2.4T,激活参数 95B,用的是 MoE 架构。具体布局是 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)),混合了 Gated DeltaNet 和 Gated Attention 两种注意力机制。上下文窗口原生 262K,官方说可以扩展到 1M。模型本身是纯文本的,而且必须开 thinking 模式,不能关掉,推理过程用 thinking... response 包裹,最终答案才输出。
Qwen3.5 和 Qwen3.6 系列在开源社区已经有不错的渗透率,但这次直接上 Max 级,意味着开源侧真正有了一个能在编码和 Agent 任务上对标前沿闭源模型的选择。
Terminal Bench 2.1 跑了 86.6(Claude Opus 4.8 是 84.6),SWE-bench Pro 67.7,DeepSWE 1.1 是 56.6,PaperBench 跑到 93.0,超过了 Opus 4.8 的 80.3。GPQA Diamond 是 92.6,HLE 是 43.6。Coding Agent 和 General Agent 两条线的表现才是这个模型的设计重点。
部署方面,开源权重以 safetensors 格式提供,支持 vLLM、SGLang 和 TokenSpeed 这几个推理框架,官方都有对应的 recipe 或 cookbook。如果用 Qwen Cloud 的 API,可以直接调 Qwen3.8-Max,除了这个基础模型的能力之外,还多了视觉输入、非 thinking 模式、1M 默认上下文和内置工具支持。
模型还提供了一个 reasoning_effort 参数,分 xhigh(默认)、medium、low 三个档位,可以按任务复杂度调节推理深度和成本。preserve_thinking 默认开启,会把历史消息里的推理过程保留下来,这对多轮 agent 任务有意义。官方推荐的采样参数是 temperature=1.0、top_p=0.95、top_k=20,最小输出长度建议 reasoning 部分设到 262K、最终回答部分 131K,用来给复杂任务留足空间。
Hugging Face 上这个模型上月下载量约 978 次,目前还有 2 个 finetune 版本和 6 个量化版本。社区已经在 DeepSWE 和 SWE-bench Pro 等数据集上跑出了 56.6 和 67.7 的成绩。
这次开源把 Max 级的能力直接交到了社区手里,不再只留在 API 端。对于需要自己控制推理成本、想在本地或私有部署里用强 coding/agent 能力的团队来说,这是一个少花钱、少等待的选择。模型必须开 thinking、不能关,这对部分追求低延迟或低 token 成本的场景是个约束,部署时需要考虑清楚。
相关链接:
- 模型仓库:https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
- Qwen3.8-Max 官方博客:https://qwen.ai/blog?id=qwen3.8
- Qwen Cloud API:https://www.qwencloud.com
- SGLang cookbook:https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8
- vLLM recipe:https://recipes.vllm.ai/Qwen/Qwen3.8-2.4T-A95B