Qwen 推出 27B 稠密模型 Qwen3.8:长上下文、原生多模态与 Agent 的执行能力

Qwen3.8-27B 上线:稠密模型的新一轮冲刺

阿里通义实验室最近在 Hugging Face 上架了 Qwen3.8-27B,这是一个 27B 参数的原生多模态稠密模型,支持图像和视频理解,默认开启思考模式,原生上下文 262K,可通过 RoPE 缩放扩展到 1M。它不是 MoE 架构,而是沿用 Qwen3.5 的混合设计,在同一张卡上就能跑完整的长程 Agent 任务。

业界主流开源路线几乎都押注 MoE——DeepSeek-V3、Qwen2.5-MoE 系列都是这个思路,用稀疏激活换取参数规模。但稠密模型部署门槛低、推理延迟稳定、KV cache 可预测,Qwen3.8-27B 的目标是在这个区间里重新拉高上限。

架构:DeltaNet + Gated Attention 的混合体

27B 参数的 Qwen3.8-27B 使用了一种混合结构:隐藏维度 5120,64 层,每层包含 3 个 Gated DeltaNet 块 + 1 个 Gated Attention 块,交替堆叠。Gated DeltaNet 负责线性注意力的高效部分(48 个 V 头 + 16 个 QK 头,头维度 128),Gated Attention 负责传统注意力(24 个 Q 头 + 4 个 KV 头,头维度 256)。

DeltaNet 是一种带门的线性注意力变体,在长序列上计算复杂度更低,适合做上下文扩展;传统注意力精度更高,在关键位置提供细粒度建模。

模型支持 Multi-Token Prediction(MTP),训练时多步预测,对推理阶段的吞吐量优化有帮助。量化版本已经在 Hugging Face 上架(66 个量化模型),方便不同硬件条件下的部署。

长上下文和 Agent 执行能力

27B 模型原生支持 262K 上下文,官方声称可通过 YaRN 扩展到 1M。在开源稠密模型里这个水平较高,可以处理长文档、长代码库和长时间 Agent 任务。

官方描述中提到 Agent 任务「更强的自主规划和更好的环境反馈处理」。benchmark 数据:

  • SWE-bench Pro:61.7(用 Claude Code harness 评测)
  • DeepSWE 1.1:42.2
  • CoWorkBench(长程办公任务):70.7
  • JobBench(专业工作任务):33.4
  • Agents' Last Exam:Pass@1 20.4

SWE-bench Pro 和 CoWorkBench 的数据最有参考价值——前者是真实 GitHub issue 修复任务,后者是多领域长程办公任务,都是 Agent 能力的硬指标。同系列的 Qwen3.6-27B 在 SWE-bench Pro 上只有 53.5,CoWorkBench 上 61.0。

多模态:不只是看图,还能看视频

Qwen3.8-27B 是原生多模态模型,支持图像和小时级视频理解。视频处理的默认配置比较保守,官方建议将 longest_edge 设为 469,762,048(对应 224K 视频 token)来启用更高帧率的采样。

多模态 benchmark:

  • OSWorld-Verified(电脑使用):84.3
  • WebArena-Verified(浏览器使用):64.8
  • AndroidWorld(手机使用):81.9
  • RecreationBench(应用还原,跨平台):47.1
  • MathVision(带 CI):94.6
  • BabyVision(视觉推理,带 CI):85.6
  • Vision2Web(视觉网页开发):62.9

OSWorld 和 AndroidWorld 测试的是计算机和手机操作层面的理解能力,RecreationBench 则是跨平台的长程应用还原任务。

思考模式的灵活控制

Qwen3.8 默认开启思考模式,响应前会先生成 reasoning content(<think>...</think> 包裹)。用户可以通过参数控制思考深度:

  • reasoning_effortxhigh(默认)、mediumlow,分别对应复杂分析、平衡、速度优化
  • preserve_thinking:默认开启,保留历史消息中的思考内容,对多轮 Agent 任务有用
  • 也可以通过 enable_thinking: false 关闭思考,直接用 instruct 模式

官方特别提醒:在长程 Agent 任务中,降低 reasoning_effort 并不总能缩短总耗时——因为分析不足可能导致更多重试。

部署和接入

模型权重以 safetensors 格式发布,兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等主流推理框架。API 方面,Qwen Cloud 将提供托管服务,默认支持 1M 上下文和内置工具。

推荐采样参数:
- 思考模式:temperature=1.0,top_p=0.95,top_k=20
- Instruct 模式:temperature=0.7,top_p=0.80,top_k=20

建议为 Agent 任务分配充足的输出长度:推理内容 262K,最终输出 131K,在 1M 上下文框架内留出足够空间。

怎么看这个模型

Qwen3.8-27B 在 27B 这个稠密模型区间里,把长上下文、多模态和 Agent 执行能力做到尽可能高的水平。适合需要稳定部署、控制成本、同时处理复杂任务的团队。

它的竞争对手是同量级的开源稠密方案,以及部分闭源 API 的性价比。在 SWE-bench Pro 上领先同系列上一代约 8 个百分点,多模态 Agent 任务上也普遍有 10-20 点的提升。

模型已开源,权重和配置文件可在 Hugging Face 获取,量化版本也已经就位。