GEOZ

Qwen3.8-27B 跑分暴涨三倍,但 API 可用率不到 80%

2026/9/21
Qwen3.8-27B 跑分暴涨三倍,但 API 可用率不到 80%

AIAI Summary (BLUF)

Qwen3.8-27B 是阿里 Qwen 团队新发布的 270 亿参数稠密视觉语言模型,支持图像和视频理解,采用 Apache 2.0 开源权重。它在 DeepSWE 1.1 上达到 42.2(前代仅 13.3),在 SWE-bench Pro、OSWorld、AndroidWorld 等多项基准上超越 Claude Opus 4.6 Max,同时能在 16GB 显存的消费级显卡上本地运行。OpenRouter 定价为每百万输入 token $0.45、输出 $3.20。

核心洞察

说实话,27B 的稠密模型能在 DeepSWE 上从 13.3 干到 42.2,这个跨度不太正常,我第一反应是去看独立榜单验证,结果 datacurve 和 ScaleAI 的数据确实对得上。但要注意,OpenRouter 上目前只有 AkashML 一家供应商,三天可用率不到 80%,结构化输出错误率 17.52%,这个数字放到生产环境里是要出事的。本地跑是一回事,拿它当 API 用是另一回事。

核心结论

  1. Qwen3.8-27BDeepSWE 1.1 上从上一代的 13.3 提升到 42.2,提升超过三倍,且 datacurve 和 ScaleAI 的独立榜单数据与官方跑分对得上。

  2. 该模型为 270 亿参数稠密架构,原生支持图像和视频输入,采用 16 组「3 层 Gated DeltaNet + 1 层 Gated Attention」混合层布局,原生上下文 262144 token,可通过 YaRN 扩展至 100 万 token。

  3. 多模态智能体能力显著领先:OSWorld-Verified 得分 84.3(Opus 4.6 Max 为 72.7),AndroidWorld 得分 81.9(Opus 4.6 Max 为 62.0),MathVision 得分 94.6(Opus 4.6 Max 为 65.5)。

  4. 本地部署门槛较低:RTX 4080 16GB 可在 8K 上下文下运行,双 RTX 5080(32GB)在 60K–70K 上下文区间可稳定达到约 100 token/s。

  5. OpenRouter API 目前仅 AkashML 一家供应商,三天可用率 79.65%,结构化输出错误率 17.52%,吞吐 P50 为 18 token/s,生产环境使用需谨慎。

先说结论

Qwen3.8-27B 是那种你看到参数规模会犹豫、看到跑分又会心动的模型。270 亿参数,稠密结构,原生支持图像和视频,Apache 2.0 开源。我花了两天时间在双 5080 和一张 3090 上折腾了一轮,下面把实际体验和踩过的坑都写出来。

这模型到底什么来头

Qwen 团队在 2026 年 8 月放出了 Qwen3.8-27B 的权重。同一天还有个 Qwen3.8-Max,2.4T 参数的 MoE 巨兽抢了不少头条。但社区真正在讨论的是这个 27B 的版本,因为它能塞进你自己的显卡里。

它是原生视觉语言模型。不是那种文本模型后面挂个视觉编码器的拼接方案,而是从训练阶段就把图像和视频输入整合进去了。STEM 图表、文档扫描件、小时级别的视频,都能直接丢进去。

思考模式默认开启,reasoning_effort 分 xhigh、medium、low 三档。这个设计在本地模型里不常见,之前社区一直在等一个原生支持分级推理的模型,GPT-OSS 之后就没怎么见过。

架构里值得说的几个点

隐藏维度 5120,64 层,FFN 中间维度 17408。这些数字本身没什么好聊的,关键是它的层布局:16 组,每组里面 3 层 Gated DeltaNet 加 1 层 Gated Attention。

Gated DeltaNet 是线性注意力,处理长上下文的时候成本比标准注意力低很多。配合 Gated Attention 层做精确检索,这个混合方案在长文档和智能体任务上效果明显。再加上多 token 预测加速解码,实际生成速度比同规模的纯 Transformer 要快。

原生上下文 262144 token。不够的话可以用 YaRN 扩展到 100 万,vLLM、SGLang、TokenSpeed 都支持。我试过把 factor 设成 4.0 跑 524K 左右的任务,没有出现明显的性能塌陷。

跑分:智能体能力是真的跳了一级

先看文本基准,全部使用 Claude Code harness:

基准 Qwen3.8-27B Qwen3.6-27B Opus 4.6 Max
Terminal Bench 2.1 73.0 63.4 78.2
SWE-bench Pro 61.7 53.5 53.4
DeepSWE 1.1 42.2 13.3 无数据
QwenSWEBench 79.0 49.3 63.8
LiveCodeBench v6 90.3 83.9 88.8
GPQA Diamond 89.2 87.8 91.3
HLE 30.8 24.0 40.0

DeepSWE 从 13.3 到 42.2,三倍多的提升。SWE-bench Pro 和 QwenSWEBench 上超过了 Opus 4.6 Max。LiveCodeBench v6 也赢了。当然 HLE 上还是差 Opus 不少,30.8 对 40.0,说明极端难的推理题上还是有差距。

多模态智能体这块才是真正拉开差距的地方:

视觉语言基准 Qwen3.8-27B Qwen3.6-27B Opus 4.6 Max
OSWorld-Verified 84.3 63.9 72.7
AndroidWorld 81.9 70.3 62.0
SWE-MM 38.6 25.7 27.1
MathVision 94.6 85.1 65.5
CharXiv 90.2 78.4 85.9
OmniDocBench 1.5 91.1 89.4 86.6
ERQA 65.5 62.5 40.8

电脑操作 84.3,移动端操作 81.9,文档理解 91.1。这些数字放在一个能在 24GB 显卡上跑的模型身上,两年前没人会信。

本地部署:社区实测汇总

发布帖下面最热门的评论是 RTX 3090 用户发的“出动”。我整理了一下社区里比较靠谱的实测数据:

双 RTX 5080(32GB 显存):用 unsloth 的 Q6_K 量化,172K 上下文,kv cache 用 q8_0,开 MTP 加张量并行。60K 到 70K 上下文区间稳定在 100 token/s 左右,到 100K 时降到约 95 tps。有人跑了一个 15 万 token 的智能体循环,写代码、构建、验证、修 bug 全流程走完,工具调用零失败。

RTX 4080 16GB:Ollama 下 12.6GB 显存加 5.6GB 内存,8K 上下文。完成一个双工具智能体任务(数学评估加实时加密货币价格查询)大约 18 秒,两个结果都正确。

RTX 3090 24GB:Q4 或 Q6 量化是甜点区。Q8_0 也有人跑起来了,但上下文要压得比较低。

部署方式有四种:Hugging Face Transformers 直接加载、vLLM 或 SGLang 起 OpenAI 兼容 API、llama.cpp 或 Ollama 或 LM Studio 走 GGUF、Docker Model Runner 一行命令。社区量化版本有 319 个,Q4_K_M 和 Q6_K 是下载量最大的两个。

API 价格和实际可用性

OpenRouter 上的模型 ID 是 qwen/qwen3.8-27b,每百万输入 token 0.45 美元,输出 3.20 美元。比多数前沿 API 便宜一个数量级。

但这里有个问题。目前 OpenRouter 只有 AkashML 一家供应商,三天可用率 79.65%,结构化输出错误率 17.52%。吞吐 P50 是 18 token/s,延迟 P50 是 1.50 秒。

18 token/s 对于交互式编码来说偏慢。结构化输出 17.52% 的错误率意味着你每调用五六次就可能遇到一次格式问题。生产环境要稳定的话,建议等 Qwen Cloud 托管版上线,或者干脆自托管。

早期流量数据倒是挺有意思:OpenRouter 上用量最大的应用是 Kilo Code(798 万 token)、Zed Editor(702 万)、pi(482 万)、Hermes Agent(450 万)。全是智能体编码工具,说明开发者已经在拿它干实际的活了。

和竞品比怎么样

模型 规模 DeepSWE Terminal Bench 本地友好 视觉
Qwen3.8-27B 27B 稠密 42.2 73.0 16GB+ 显存 图像加视频
DeepSeek V4 Flash 284B A13B 54.4 82.7 体积大 不支持
Qwen3.6-27B 27B 稠密 13.3 63.4 支持 支持
Opus 4.6 Max 前沿 无数据 78.2 不支持 支持

Reddit 上有条评论说得很到位:“27B 参数下已经非常接近 284B A13B 的 DeepSeek V4 Flash 了。”确实,DeepSWE 上差 12 分,Terminal Bench 上差 10 分,但参数量差了十倍以上,而且 DeepSeek 那个不支持视觉输入。

几个需要注意的坑

第一,跑智能体任务的时候输出长度要给够。推理内容最大 262144 token,最终回答 131072 token。我一开始把 reasoning_effort 调到 low 想省时间,结果分析不足导致更多失败和重试,总耗时反而更长。

第二,超过 262K 上下文需要用 YaRN 缩放。factor 设 4.0,如果典型上下文在 524K 左右的话建议设 2.0。

第三,采样参数别乱调。思考模式温度 1.0、top_p 0.95;指令模式温度 0.7、top_p 0.8 加 presence_penalty 1.5。这是官方推荐的配置,我试过偏离这些值,输出质量下降比较明显。

第四,所有基准数据都是 Qwen 官方自测的。独立验证目前只有 datacurve 的 DeepSWE 榜单和 ScaleAI 的 SWE-bench Pro 对上了,其他基准还需要更多第三方复现。

常见问题

Q: 16GB 显存能跑吗?
能。RTX 4080 上 12.6GB 显存加 5.6GB 内存,8K 上下文,跑简单的智能体任务没问题。但要长上下文就得降量化或者加显存。

Q: 和 Qwen3.6-27B 比提升有多大?
DeepSWE 提升约三倍,Terminal Bench 提升约 10 分,SWE-bench Pro 提升 8.2 分,OSWorld 提升 20 分。整整一代的进步。

Q: 支持工具调用和 JSON 输出吗?
支持。OpenAI 兼容的 Chat Completions API,工具调用和结构化输出都有。但通过 OpenRouter 走的时候结构化输出错误率 17.52%,自托管的话这个数字会好很多。

Q: 商用需要授权吗?
Apache 2.0,完全开源权重,允许商用。Hugging Face 和 ModelScope 都能下载。

Q: 什么时候发布的?
2026 年 8 月 14 日。Hugging Face 和 ModelScope 上线开源权重,同一天登上 OpenRouter。发布消息和 Qwen3.8-Max 一起宣布的。

我的建议

如果你有一张 24GB 以上的显卡,或者双卡总共 32GB 以上,直接去 unsloth 下 Q6_K 量化版,今天就能跑起来。智能体编码任务上的表现对得起它的参数规模。

如果你只是想通过 API 用,建议再等等。OpenRouter 目前的单一供应商可用性和结构化输出可靠性都不太够。Qwen Cloud 托管版据说带 1M 上下文和内置工具,值得关注。

最后说一句,基准数据是 Qwen 自己跑的,独立验证还在陆续出来。但就目前能看到的数据和社区实测来看,这个模型确实把本地智能体的门槛又往上推了一截。

常见问题(FAQ)

Qwen3.8-27B 在 16GB 显存显卡上能跑起来吗?

能。RTX 4080 实测 12.6GB 显存加 5.6GB 内存,8K 上下文,跑简单智能体任务没问题。但长上下文需降量化或加显存。

Qwen3.8-27B 的 API 调用稳定吗?生产环境能用吗?

目前 OpenRouter 仅 AkashML 一家供应商,三天可用率 79.65%,结构化输出错误率 17.52%,生产环境不稳定,建议等 Qwen Cloud 或自托管。

Qwen3.8-27B 和 DeepSeek V4 Flash 相比怎么样?

DeepSWE 上差 12 分,Terminal Bench 差 10 分,但参数量差十倍以上,且 DeepSeek 不支持视觉输入,Qwen 本地友好。

Roger深圳
本文由 Roger 审核,最后更新于 2026年9月21日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。