GEOZ

Qwen3.8 开源:Qwen-Max 级能力首次下放,推理深度可调

2026/9/21
Qwen3.8 开源:Qwen-Max 级能力首次下放,推理深度可调

AIAI Summary (BLUF)

Qwen3.8 是 Qwen 系列最新开源模型,首次将 Qwen-Max 级能力开放给社区。它在编码、专业工作、研究和长周期智能体任务上大幅提升,支持通过 reasoning_effort 调节推理深度,并通过 preserve_thinking 保留历史推理上下文。模型权重已在 Hugging Face 和 ModelScope 发布,包含 27B 和 2.4T-A95B 两个版本。

核心洞察

Qwen3.8 这次把 Qwen-Max 级别的模型直接开源了,这在以前是没有过的事。我比较在意的是 reasoning_effortpreserve_thinking 这两个参数,它们让推理深度变成可调的,而不是一刀切。另外 2.4T 参数、95B 激活的 MoE 架构,部署门槛不低,普通开发者可能还是得看 27B 那个版本。


欢迎来到 Qwen3.5 系列开源模型的 GitHub 仓库,这里涵盖 Qwen3.5、Qwen3.6 以及最新的 Qwen3.8。你可以在这里找到 Qwen3.8 的官方信息,提交问题(Issues),也可以在和社区的讨论(Discussions)里分享你的想法。

核心结论

  1. Qwen3.8 首次将 Qwen-Max 级别的模型开源,提供 2.4T 参数、95B 激活的 MoE 架构(Qwen3.8-2.4T-A95B)以及 27B 版本(Qwen3.8-27B)两种规格。
  2. Qwen3.8 引入 reasoning_effortpreserve_thinking 两个参数,使推理深度可调,并可在对话历史中保留推理上下文。
  3. Qwen3.8-2.4T-A95B 于 2026-08-12 上线,Qwen3.8-27B 于 2026-08-14 上线,均发布于 Hugging Face HubModelScope
  4. Qwen3.5 支持扩展至 201 种语言和方言,其多模态训练效率接近纯文本训练的 100%。
  5. Qwen3.8 支持 SGLang、vLLM、TokenSpeed 等推理框架部署,上下文长度可达 262144。

简介

Qwen3.8

Qwen3.8 第一次把 Qwen-Max 级别的模型拿出来开源。它建立在 Qwen3.5 的架构基础上,在编程、专业工作、研究以及长周期智能体任务上都有大幅提升。不只是回答更难的问题,Qwen3.8 的设计目标是让复杂的多步骤任务能更可靠地跑完。

Qwen3.8 的改进包括:

  • 核心能力:编程、专业工作、研究和长周期智能体任务全面增强。
  • 智能体执行:自主规划能力更强,对环境反馈的处理更好,端到端任务完成更可靠。
  • 下游兼容:支持更多主流框架和开发工具,接入现有技术栈更方便。
  • 灵活思考控制:通过 reasoning_effort 调节推理深度,通过 preserve_thinking 保留历史消息中的推理上下文。

Qwen3.6

在 Qwen3.5 的基础突破之上,Qwen3.6 更注重稳定性和实际可用性。它给开发者带来的是更直观、响应更快、真正能提高生产力的编程体验,这些改进很多来自社区的反馈。这次更新主要在以下方面有大幅升级:

  • 智能体编程:模型处理前端工作流和仓库级推理时更流畅、更精准。
  • 思考保留:新功能可以在对话历史中保留思考上下文,迭代开发更顺畅,开销也更小。

Qwen3.5

过去几个月,我们把重心放在了开发实用性和性能都出色的基础模型上。Qwen3.5 是一次大跨越,融合了多模态学习、架构效率、强化学习规模和全球可访问性方面的突破,给开发者和企业带来了前所未有的能力和效率。

Qwen3.5 的改进包括:

  • 统一视觉语言基础:在数万亿多模态 token 上做早期融合训练,推理、编程、智能体和视觉理解等基准上达到了与 Qwen3 跨代持平的水平,并超过了 Qwen3-VL 系列。
  • 高效混合架构:门控 Delta 网络结合稀疏专家混合,实现高吞吐推理,延迟和成本开销都很低。
  • 可扩展的强化学习泛化:强化学习扩展到百万级智能体环境,任务分布逐步复杂化,真实场景适应性更强。
  • 全球语言覆盖:支持扩展到 201 种语言和方言,可以面向全球部署,理解不同文化和地区差异。
  • 新一代训练基础设施:多模态训练效率接近纯文本训练的 100%,异步强化学习框架支持大规模智能体脚手架和环境编排。

新闻

  • 2026-08-14:Qwen3.8-27B 已在 Hugging Face Hub 和 ModelScope 上线。详情见模型卡。
  • 2026-08-12:Qwen3.8-2.4T-A95B 已在 Hugging Face Hub 和 ModelScope 上线。详情见模型卡。
  • 2026-04-22:Qwen3.6-27B 已在 Hugging Face Hub 和 ModelScope 上线。详情见发布博客。
  • 2026-04-16:Qwen3.6-35B-A3B 已在 Hugging Face Hub 和 ModelScope 上线。详情见发布博客。
  • 2026-03-02:Qwen3.5-9B、Qwen3.5-4B、Qwen3.5-2B 和 Qwen3.5-0.8B 已在 Hugging Face Hub 和 ModelScope 上线。
  • 2026-02-24:Qwen3.5-122B-A10B、Qwen3.5-35B-A3B 和 Qwen3.5-27B 发布。模型卡见 Hugging Face Hub 或 ModelScope。
  • 2026-02-16:Qwen3.5 发布。首个版本包含一个 397B-A17B MoE 模型。详情见发布博客。更多尺寸即将推出,新年快乐。
  • 2025-09-11:Qwen3-Next-80B-A3B 发布,这是一个超稀疏专家混合模型,采用混合注意力架构,专为极致效率设计。详情见博客。

模型

官方模型权重发布在:

  • Hugging Face Hub:大多数 LLM 框架和应用支持通过指定模型 ID 自动从 Hugging Face Hub 下载模型文件,比如 Qwen/Qwen3.8-27BQwen/Qwen3.6-35B-A3BQwen/Qwen3.5-397B-A17B。你也可以用 huggingface downloadgit clone 手动下载。具体操作请参照模型页面上的说明。
  • ModelScope:如果无法访问 Hugging Face Hub,强烈建议使用 ModelScope。对于支持的框架,可以通过设置环境变量从 ModelScope 下载,比如 SGLANG_USE_MODELSCOPE=trueVLLM_USE_MODELSCOPE=true。也可以用 modelscope downloadgit clone 手动下载。具体操作请参照模型页面上的说明。

基准测试

Qwen3.8 开源模型

详细结果请查看 Qwen3.8-2.4T-A95B 模型卡和 Qwen3.8-27B 模型卡。

Qwen3.6 开源模型

详细结果请查看 Qwen3.6-35B-A3B 博客和 Qwen3.6-27B 博客。

Qwen3.5 开源模型

详细结果请查看 Qwen3.5 博客。

快速开始

官方渠道

你可以在官方站点上试用 Qwen3.8,体验深度研究、Web 开发和自适应工具调用等额外功能。

Qwen Studio

如果你只是想试试 Qwen3.8,Qwen Studio 是面向所有人的 AI 助手。免费使用,对所有人开放,可以帮你做创意、协作和各种事情。

Qoder

Qwen3.8 现在可以直接在 Qoder 上使用。Qoder 是一个面向真实软件开发的智能体编程平台,有独立应用。按照它的文档就可以开始。

QwenWork

Qwen3.8 现在可以直接在 QwenWork 上使用。QwenWork 是阿里巴巴推出的一站式 AI 工作平台。按照它的文档就可以开始。

Qwen API

QwenCloud 对 Qwen3.8 提供一流支持,兼容 OpenAI 和 Anthropic 等多种 API 规范,方便你在自己的应用里试用 Qwen3.8。

Qwen Code

Qwen Code 是一个面向终端的开源 AI 智能体,针对 Qwen 模型做了优化。它帮你理解大型代码库、自动化繁琐工作、更快交付。按照它的文档就可以开始。

本地使用

Hugging Face Transformers

transformers 是目前开源权重 LLM 生态中的模型定义框架,也包含 LLM 推理和训练功能。transformers 新增的 serving 能力让集成新模型到开发流程中变得容易很多。

启动一个服务,直接用 transformers serve 命令:

transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching

OpenAI 兼容 API 会在 http://localhost:8000/v1 可用。更多信息见 Serve CLI 指南。

llama.cpp

llama.cpp 可以在各种硬件上以最少的配置实现 LLM 推理,性能也是顶尖的。llama.cpp 支持 Qwen3.5 系列开源模型(文本和视觉)。在 Hugging Face Hub 上找以 GGUF 结尾的模型。

MLX(Apple Silicon)

如果你在 Apple Silicon 上运行,mlx-lm(纯文本)和 mlx-vlm(视觉加文本)都支持 Qwen3.5 系列开源模型。在 Hugging Face Hub 上找以 MLX 结尾的模型。

Unsloth

Unsloth 带有一个本地 UI,可以运行和训练 LLM 及扩散模型,包括 Qwen3.8 等。运行 Qwen3.8 量化版本的方法见 Qwen3.8 指南。

部署

Qwen3.5 系列开源模型支持多种推理框架。这里演示 SGLang、vLLM 和 TokenSpeed 的用法。

SGLang

SGLang 是一个面向大语言模型和视觉语言模型的快速服务框架。可以用 SGLang 启动一个带 OpenAI 兼容 API 的服务。

sglang serve --model-path Qwen/Qwen3.8-27B --port 8000 --tp-size 4 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder

OpenAI 兼容 API 会在 http://localhost:8000/v1 可用。也可以看 SGLang Cookbook 上的 Qwen3.8 部署指南。

vLLM

vLLM 是一个高吞吐、内存高效的 LLM 推理和服务引擎。可以用 vLLM 启动一个带 OpenAI 兼容 API 的服务。

vllm serve Qwen/Qwen3.8-27B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

OpenAI 兼容 API 会在 http://localhost:8000/v1 可用。也可以看 vLLM Recipes 上的 Qwen3.8 部署指南。

TokenSpeed

TokenSpeed 是一个极速 LLM 推理引擎。可以用 TokenSpeed 启动一个带 OpenAI 兼容 API 的服务。

tokenspeed serve Qwen/Qwen3.8-27B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

OpenAI 兼容 API 会在 http://localhost:8000/v1 可用。也可以看 TokenSpeed Recipes 上的 Qwen3.8 部署指南。

微调

建议使用 Unsloth、Swift、Llama-Factory 等训练框架,通过 SFT、DPO、GRPO 等方式微调模型。

许可协议

许可文件随模型权重一起发布在 Hugging Face Hub 或 ModelScope 上。

引用

如果觉得我们的工作有帮助,欢迎引用。

@misc{qwen3.8,
    title  = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    author = {{Qwen Team}},
    year   = {2026},
    month  = {August},
    url    = {https://qwen.ai/blog?id=qwen3.8}
}

@misc{qwen3.6-27b,
    title  = {{Qwen3.6-27B}: Flagship-Level Coding in a {27B} Dense Model},
    author = {{Qwen Team}},
    year   = {2026},
    month  = {April},
    url    = {https://qwen.ai/blog?id=qwen3.6-27b}
}

@misc{qwen3.6-35b-a3b,
    title  = {{Qwen3.6-35B-A3B}: Agentic Coding Power, Now Open to All},
    author = {{Qwen Team}},
    year   = {2026},
    month  = {April},
    url    = {https://qwen.ai/blog?id=qwen3.6-35b-a3b}
}

@misc{qwen3.5,
    title  = {{Qwen3.5}: Towards Native Multimodal Agents},
    author = {{Qwen Team}},
    year   = {2026},
    month  = {February},
    url    = {https://qwen.ai/blog?id=qwen3.5}
}

联系我们

如果想给研究团队或产品团队留言,加入我们的 Discord 或微信群。

常见问题(FAQ)

Qwen3.8 和之前的 Qwen3.6、Qwen3.5 相比,主要升级在哪里?

Qwen3.8 首次把 Qwen-Max 级能力开源,在编程、专业工作、研究和长周期智能体任务上大幅提升。它基于 Qwen3.5 架构,相比 Qwen3.6 更强调自主规划与环境反馈处理,端到端任务完成更可靠。

reasoning_effortpreserve_thinking 这两个参数到底有什么用?

reasoning_effort 用来调节推理深度,让思考强度按需分配而非一刀切;preserve_thinking 则保留历史消息中的推理上下文,使多轮迭代开发更连贯、开销更小,适合复杂多步骤任务。

Qwen3.8 开源了哪些版本?普通开发者该选哪个?

Qwen3.8 包含 27B 和 2.4T-A95B 两个版本,权重已发布在 Hugging Face 和 ModelScope。2.4T 参数、95B 激活的 MoE 部署门槛较高,普通开发者建议优先考虑 27B 版本。

阿凯广州
本文由 阿凯 审核,最后更新于 2026年9月21日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。