Qwen 是阿里云 Qwen 团队的模型系列,权重发在 Hugging Face 和 ModelScope 的 Qwen 组织下,开源那一档基本都是 Apache 2.0,带 -Max / -Plus 后缀的闭源版本只走 API。到 2026 年 8 月,这条线已经跑到了 Qwen3.8:8 月 14 日放出的 Qwen3.8-27B 是你能自己部署的那一半,Apache 2.0;8 月 12 日的 Qwen3.8-2.4T-A95B 走的是自定义的 Qwen3.8-Max 许可,年营收超过 5,000 万美元还得单独谈商用。中间的 Qwen3.7 只出了 Max 和 Plus,开源那一档直接跳过去了 —— 所以如果你在找「Qwen3.7 开源权重」,答案是没有。
从 Qwen3.5 开始,架构换成了 Gated DeltaNet 线性注意力配 Gated Attention 的混合结构,27B 的 64 层里只有 16 层保留 KV cache,其余走不需要缓存的线性层;9B 是 32 层里留 8 层。带来的结果很直接:262,144 tokens 原生上下文(YaRN 可以再扩到约 100 万),而 KV 开销大约只有传统 27B 稠密模型的四分之一,32K 上下文算下来约 2GB。这就是为什么一张 24GB 的消费卡能同时装下 27B 的四位量化权重和一段很长的上下文,换成 2024 年那批同参数量的模型是不可能的。
代价是工具链挑版本,而且挑得很硬:vLLM 要 0.17 以上才有 GDN kernel,llama.cpp 得是带 llama_memory_hybrid 的构建才认这个架构,--mamba-cache-mode align 是必填项,A100 这类 Ampere 卡压根没有 FP8 张量核。这些坑在本机一张卡上一个个试,代价是几个通宵。NexGPU 覆盖 51 个国家和地区、1,175 个已验证可租节点、2,498 张 GPU、75 种型号,随开随停按秒计费,没有起租时长、没有开通费、不用申请配额,2,000+ 预置镜像里 vLLM、PyTorch 都是现成的 —— 换张卡重试一次的成本,是几毛钱。
01 —
Qwen 各版本显存对照
2026 年还在维护的三条线:Qwen3.5、Qwen3.6、Qwen3.8。表里是权重占用,KV cache 要另外算。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Qwen3.8-27B | 27B 稠密(GDN + Gated Attention 混合) | bf16 ~54GB / FP8 ~28GB / Q8_0 ~29GB / Q6_K ~22.9GB / Q4_K_M ~17.1GB | 262,144(YaRN 可扩到约 1M) | 2026 年 8 月 14 日发布的开源旗舰稠密模型,Apache 2.0。原生支持图片和视频输入,reasoning_effort 可以在 low / medium / xhigh 之间调,默认 xhigh。想自建的绝大多数人应该从这个开始。 |
| Qwen3.8-2.4T-A95B(Qwen3.8-Max) | 2.4T 总参 / 约 95B 激活 MoE | 自建不现实,FP8 权重也在 TB 量级 | 1M | 8 月 12 日放出的 Max 级权重,用的是自定义 Qwen3.8-Max 许可而不是 Apache 2.0。除非你有整机柜,否则这个走 API 更现实 —— 列在这里是为了让你知道它和 Qwen3.8-27B 完全是两回事。 |
| Qwen3.6-35B-A3B | 35B 总参 / 3B 激活 MoE | bf16 ~69GB / FP8 ~35GB / Q4_K_M ~18–22GB | 262,144 | 2026 年 4 月 16 日发布,Apache 2.0,agentic coding 的主力:SWE-bench Verified 73.4%、MCPMark 37.0。官方有 Qwen3.6-35B-A3B-FP8,block size 128 的细粒度量化,掉点几乎看不出来。 |
| Qwen3.5-9B | 9B 稠密 | bf16 ~18GB / FP8 ~9GB / Q4_K_M ~5.5GB | 262,144 | 单卡在线服务的甜点位。32 层里只有 8 层留 KV,FP8 权重才 9GB,一张 24GB 卡剩下的 15GB 全给 vLLM 拿去做并发批处理,吞吐非常好看。 |
| Qwen3.5-4B | 4B 稠密 | bf16 ~9GB / Q4 ~3GB(Ollama 打包 3.4GB) | 262,144 | 端侧和批量流水线用。抽取、分类、改写、打标这类活儿不需要更大的模型,Tesla T4 16GB 就能吃下,成本压到最低。 |
| Qwen3.5-122B-A10B | 122B 总参 / 10B 激活 MoE(256 专家) | bf16 ~244GB / FP8 ~122GB / Q8_0 ~130GB / Q4_K_M ~77GB | 262,144 | 想要接近闭源质量又必须自己托管时的现实上限。再往上是 Qwen3.5-397B-A17B,FP8 约 397GB,只能上多卡节点,而且官方没发 AWQ 权重,社区量化质量参差。 |
02 —
在 NexGPU 上该租哪张卡
按权重格式对号入座。别拿 24GB 去接 bf16 的 27B,也别在 Ampere 卡上写 --quantization fp8。
先用 Q4_K_M 把 Qwen3.8-27B 跑通,验证效果
RTX 4090 24GB$0.540/卡·时
17.1GB 权重加上 32K 上下文约 2GB 的 KV,24GB 还留得下余量;Ada 有原生 FP8 单元,之后想切 Qwen3.5-9B 的 FP8(约 9GB)不用换卡。预算再紧就换 RTX 3090 24GB($0.193/卡·时),走 GGUF 这条路线本来也用不上 FP8。
Qwen3.8-27B 的 Q8_0 近无损推理,或要开满 128K 长上下文
RTX A6000 48GB$0.817/卡·时
Q8_0 的 29GB 放进 48GB 之后上下文完全不用缩,Q6_K 的 22.9GB 更是绰绰有余。注意 A6000 是 Ampere,没有 FP8 张量核,这张卡上请走 GGUF 或 AWQ INT4,别加 --quantization fp8。
Qwen3.8-27B 或 Qwen3.6-35B-A3B 的 FP8 正式上线
H100 SXM 80GB$3.582/卡·时
27B FP8 约 28GB、35B-A3B FP8 约 35GB,80GB 把剩下的全部让给 KV 和连续批处理;Hopper 的 FP8 正是这批官方权重的目标格式,不用做任何反量化。能接受 bf16 的话,A100 SXM4 80GB 只要 $1.088/卡·时,54GB 的 27B 权重也装得下,就是拿不到 FP8 的速度。
Qwen3.5-122B-A10B 的 FP8 单卡装下
H200 141GB$6.660/卡·时
FP8 全量权重约 122GB,141GB 是唯一不做张量并行就能单卡加载的选择,省掉一整层 TP 调优。要上 Qwen3.5-397B-A17B(FP8 约 397GB)就开多卡节点 —— NexGPU 单节点最多 14 张卡、最大 2,152GB 显存,够塞得下。
03 —
四步把 Qwen3.8-27B 跑起来
全程在一台 NexGPU 实例上完成,SSH、Jupyter、Web 终端随便挑一个。
- 01
开卡,把 vLLM 升到 0.17 以上
Gated DeltaNet 的 kernel 是 vLLM 0.17 才进主线的。老版本要么根本不认这个 model class,要么只能靠 --trust-remote-code 硬扛,然后在某个 batch 上炸掉。NexGPU 的 2,000+ 预置镜像里 vLLM 和 PyTorch 都是现成的,开机直接升级即可。
uv pip install -U vllm --torch-backend=auto - 02
拉权重
Qwen3.8-27B 的 bf16 全量约 54GB,官方 FP8 约 28GB。亚太节点建议改用 ModelScope 源,同一份权重下载时间能差好几倍。只想先看效果的话直接拿 GGUF:bartowski/Qwen3.8-27B-GGUF 里 Q4_K_M 是 17.1GB、IQ4_XS 15.7GB(16GB 卡能整份装下)、Q3_K_M 13.8GB。
hf download Qwen/Qwen3.8-27B --local-dir /workspace/Qwen3.8-27B - 03
起 vLLM 服务,把 GDN 专属参数带上
--mamba-cache-mode align 是必填的,GDN 不支持 all 模式。另外千万别用默认的 262,144 上下文直接开,单卡必 OOM,先压到 32768 跑通再往上顶。纯文本场景加 --language-model-only 跳过视觉编码器,能再省一块显存。走 GGUF 的话对应命令是 llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M -c 32768 -ngl 99。
vllm serve /workspace/Qwen3.8-27B --max-model-len 32768 --mamba-cache-mode align --enable-prefix-caching --reasoning-parser qwen3 --port 8000 - 04
验证,顺手把思考模式关掉
Qwen3.8 默认开着 thinking,每次都会先吐一段 <think>…</think>。批量任务里这段是纯浪费 token,用 chat_template_kwargs 按请求关,或者启动时加 --default-chat-template-kwargs '{"enable_thinking": false}' 全局关。想保留一部分推理能力就把 reasoning_effort 调到 low 或 medium。注意字段名是 enable_thinking,写成 thinking 在某些 0-day 分支上会出精度异常。思考模式下官方推荐 temperature=1.0、top_p=0.95、top_k=20。
curl http://localhost:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"/workspace/Qwen3.8-27B","messages":[{"role":"user","content":"你好"}],"chat_template_kwargs":{"enable_thinking":false}}'
一天跑下来到底多少钱
先算最常见的那条路:Qwen3.8-27B 的 Q4_K_M 跑在 RTX 4090 24GB 上,$0.540/卡·时。下载 17.1GB 权重加装 vLLM 大约 20 分钟,也就是 0.33 小时 × $0.540 = $0.18;接着连续跑 8 小时评估,8 × $0.540 = $4.32;这一天合计 $4.50。停机之后计算立刻停止计费,只有那 17.1GB 权重按存储算,17.1 × $0.414/GB·月 = $7.08/月,摊到每天两毛四。想再便宜就把这台换成 RTX 3090 24GB,$0.193/卡·时,同样 8 小时只要 $1.54。|要把 FP8 版本放上生产:H100 SXM 80GB $3.582/卡·时,只在业务时段每天开 10 小时、每月 22 个工作日,3.582 × 10 × 22 = $788.04;真要 7×24 常驻则是 3.582 × 24 × 30 = $2,579.04。|再往上一档,Qwen3.5-122B-A10B 的 FP8 权重约 122GB,H200 141GB 是唯一单卡装得下的,$6.660/卡·时,跑一轮 6 小时全量评测 6 × $6.660 = $39.96 —— 比为它买一张卡便宜得多。所有价格按秒计量、按小时计价,没有最低消费、没有开通费、不用提配额工单,出网流量中位数 $0.0081/GB。
04 —
