跳到主要内容

文本大模型

Qwen 本地部署,一张 24GB 卡就能跑起 27B

Qwen3.8-27B 的 Q4_K_M 权重 17.1GB,混合注意力让 32K 上下文的 KV cache 只占约 2GB —— 24GB 显存是真的装得下。下面是 Qwen3.5 / 3.6 / 3.8 每个版本的显存账、该配哪张卡,以及 NexGPU 上按秒计费的实际价格。

Qwen 是阿里云 Qwen 团队的模型系列,权重发在 Hugging Face 和 ModelScope 的 Qwen 组织下,开源那一档基本都是 Apache 2.0,带 -Max / -Plus 后缀的闭源版本只走 API。到 2026 年 8 月,这条线已经跑到了 Qwen3.8:8 月 14 日放出的 Qwen3.8-27B 是你能自己部署的那一半,Apache 2.0;8 月 12 日的 Qwen3.8-2.4T-A95B 走的是自定义的 Qwen3.8-Max 许可,年营收超过 5,000 万美元还得单独谈商用。中间的 Qwen3.7 只出了 Max 和 Plus,开源那一档直接跳过去了 —— 所以如果你在找「Qwen3.7 开源权重」,答案是没有。

从 Qwen3.5 开始,架构换成了 Gated DeltaNet 线性注意力配 Gated Attention 的混合结构,27B 的 64 层里只有 16 层保留 KV cache,其余走不需要缓存的线性层;9B 是 32 层里留 8 层。带来的结果很直接:262,144 tokens 原生上下文(YaRN 可以再扩到约 100 万),而 KV 开销大约只有传统 27B 稠密模型的四分之一,32K 上下文算下来约 2GB。这就是为什么一张 24GB 的消费卡能同时装下 27B 的四位量化权重和一段很长的上下文,换成 2024 年那批同参数量的模型是不可能的。

代价是工具链挑版本,而且挑得很硬:vLLM 要 0.17 以上才有 GDN kernel,llama.cpp 得是带 llama_memory_hybrid 的构建才认这个架构,--mamba-cache-mode align 是必填项,A100 这类 Ampere 卡压根没有 FP8 张量核。这些坑在本机一张卡上一个个试,代价是几个通宵。NexGPU 覆盖 51 个国家和地区、1,175 个已验证可租节点、2,498 张 GPU、75 种型号,随开随停按秒计费,没有起租时长、没有开通费、不用申请配额,2,000+ 预置镜像里 vLLM、PyTorch 都是现成的 —— 换张卡重试一次的成本,是几毛钱。

01 —

Qwen 各版本显存对照

2026 年还在维护的三条线:Qwen3.5、Qwen3.6、Qwen3.8。表里是权重占用,KV cache 要另外算。

版本参数量显存上下文说明
Qwen3.8-27B27B 稠密(GDN + Gated Attention 混合)bf16 ~54GB / FP8 ~28GB / Q8_0 ~29GB / Q6_K ~22.9GB / Q4_K_M ~17.1GB262,144(YaRN 可扩到约 1M)2026 年 8 月 14 日发布的开源旗舰稠密模型,Apache 2.0。原生支持图片和视频输入,reasoning_effort 可以在 low / medium / xhigh 之间调,默认 xhigh。想自建的绝大多数人应该从这个开始。
Qwen3.8-2.4T-A95B(Qwen3.8-Max)2.4T 总参 / 约 95B 激活 MoE自建不现实,FP8 权重也在 TB 量级1M8 月 12 日放出的 Max 级权重,用的是自定义 Qwen3.8-Max 许可而不是 Apache 2.0。除非你有整机柜,否则这个走 API 更现实 —— 列在这里是为了让你知道它和 Qwen3.8-27B 完全是两回事。
Qwen3.6-35B-A3B35B 总参 / 3B 激活 MoEbf16 ~69GB / FP8 ~35GB / Q4_K_M ~18–22GB262,1442026 年 4 月 16 日发布,Apache 2.0,agentic coding 的主力:SWE-bench Verified 73.4%、MCPMark 37.0。官方有 Qwen3.6-35B-A3B-FP8,block size 128 的细粒度量化,掉点几乎看不出来。
Qwen3.5-9B9B 稠密bf16 ~18GB / FP8 ~9GB / Q4_K_M ~5.5GB262,144单卡在线服务的甜点位。32 层里只有 8 层留 KV,FP8 权重才 9GB,一张 24GB 卡剩下的 15GB 全给 vLLM 拿去做并发批处理,吞吐非常好看。
Qwen3.5-4B4B 稠密bf16 ~9GB / Q4 ~3GB(Ollama 打包 3.4GB)262,144端侧和批量流水线用。抽取、分类、改写、打标这类活儿不需要更大的模型,Tesla T4 16GB 就能吃下,成本压到最低。
Qwen3.5-122B-A10B122B 总参 / 10B 激活 MoE(256 专家)bf16 ~244GB / FP8 ~122GB / Q8_0 ~130GB / Q4_K_M ~77GB262,144想要接近闭源质量又必须自己托管时的现实上限。再往上是 Qwen3.5-397B-A17B,FP8 约 397GB,只能上多卡节点,而且官方没发 AWQ 权重,社区量化质量参差。

02 —

在 NexGPU 上该租哪张卡

按权重格式对号入座。别拿 24GB 去接 bf16 的 27B,也别在 Ampere 卡上写 --quantization fp8。

  • 先用 Q4_K_M 把 Qwen3.8-27B 跑通,验证效果

    RTX 4090 24GB$0.540/卡·时

    17.1GB 权重加上 32K 上下文约 2GB 的 KV,24GB 还留得下余量;Ada 有原生 FP8 单元,之后想切 Qwen3.5-9B 的 FP8(约 9GB)不用换卡。预算再紧就换 RTX 3090 24GB($0.193/卡·时),走 GGUF 这条路线本来也用不上 FP8。

  • Qwen3.8-27B 的 Q8_0 近无损推理,或要开满 128K 长上下文

    RTX A6000 48GB$0.817/卡·时

    Q8_0 的 29GB 放进 48GB 之后上下文完全不用缩,Q6_K 的 22.9GB 更是绰绰有余。注意 A6000 是 Ampere,没有 FP8 张量核,这张卡上请走 GGUF 或 AWQ INT4,别加 --quantization fp8。

  • Qwen3.8-27B 或 Qwen3.6-35B-A3B 的 FP8 正式上线

    H100 SXM 80GB$3.582/卡·时

    27B FP8 约 28GB、35B-A3B FP8 约 35GB,80GB 把剩下的全部让给 KV 和连续批处理;Hopper 的 FP8 正是这批官方权重的目标格式,不用做任何反量化。能接受 bf16 的话,A100 SXM4 80GB 只要 $1.088/卡·时,54GB 的 27B 权重也装得下,就是拿不到 FP8 的速度。

  • Qwen3.5-122B-A10B 的 FP8 单卡装下

    H200 141GB$6.660/卡·时

    FP8 全量权重约 122GB,141GB 是唯一不做张量并行就能单卡加载的选择,省掉一整层 TP 调优。要上 Qwen3.5-397B-A17B(FP8 约 397GB)就开多卡节点 —— NexGPU 单节点最多 14 张卡、最大 2,152GB 显存,够塞得下。

03 —

四步把 Qwen3.8-27B 跑起来

全程在一台 NexGPU 实例上完成,SSH、Jupyter、Web 终端随便挑一个。

  1. 01

    开卡,把 vLLM 升到 0.17 以上

    Gated DeltaNet 的 kernel 是 vLLM 0.17 才进主线的。老版本要么根本不认这个 model class,要么只能靠 --trust-remote-code 硬扛,然后在某个 batch 上炸掉。NexGPU 的 2,000+ 预置镜像里 vLLM 和 PyTorch 都是现成的,开机直接升级即可。

    uv pip install -U vllm --torch-backend=auto
  2. 02

    拉权重

    Qwen3.8-27B 的 bf16 全量约 54GB,官方 FP8 约 28GB。亚太节点建议改用 ModelScope 源,同一份权重下载时间能差好几倍。只想先看效果的话直接拿 GGUF:bartowski/Qwen3.8-27B-GGUF 里 Q4_K_M 是 17.1GB、IQ4_XS 15.7GB(16GB 卡能整份装下)、Q3_K_M 13.8GB。

    hf download Qwen/Qwen3.8-27B --local-dir /workspace/Qwen3.8-27B
  3. 03

    起 vLLM 服务,把 GDN 专属参数带上

    --mamba-cache-mode align 是必填的,GDN 不支持 all 模式。另外千万别用默认的 262,144 上下文直接开,单卡必 OOM,先压到 32768 跑通再往上顶。纯文本场景加 --language-model-only 跳过视觉编码器,能再省一块显存。走 GGUF 的话对应命令是 llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M -c 32768 -ngl 99。

    vllm serve /workspace/Qwen3.8-27B --max-model-len 32768 --mamba-cache-mode align --enable-prefix-caching --reasoning-parser qwen3 --port 8000
  4. 04

    验证,顺手把思考模式关掉

    Qwen3.8 默认开着 thinking,每次都会先吐一段 <think>…</think>。批量任务里这段是纯浪费 token,用 chat_template_kwargs 按请求关,或者启动时加 --default-chat-template-kwargs '{"enable_thinking": false}' 全局关。想保留一部分推理能力就把 reasoning_effort 调到 low 或 medium。注意字段名是 enable_thinking,写成 thinking 在某些 0-day 分支上会出精度异常。思考模式下官方推荐 temperature=1.0、top_p=0.95、top_k=20。

    curl http://localhost:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"/workspace/Qwen3.8-27B","messages":[{"role":"user","content":"你好"}],"chat_template_kwargs":{"enable_thinking":false}}'

一天跑下来到底多少钱

先算最常见的那条路:Qwen3.8-27B 的 Q4_K_M 跑在 RTX 4090 24GB 上,$0.540/卡·时。下载 17.1GB 权重加装 vLLM 大约 20 分钟,也就是 0.33 小时 × $0.540 = $0.18;接着连续跑 8 小时评估,8 × $0.540 = $4.32;这一天合计 $4.50。停机之后计算立刻停止计费,只有那 17.1GB 权重按存储算,17.1 × $0.414/GB·月 = $7.08/月,摊到每天两毛四。想再便宜就把这台换成 RTX 3090 24GB,$0.193/卡·时,同样 8 小时只要 $1.54。|要把 FP8 版本放上生产:H100 SXM 80GB $3.582/卡·时,只在业务时段每天开 10 小时、每月 22 个工作日,3.582 × 10 × 22 = $788.04;真要 7×24 常驻则是 3.582 × 24 × 30 = $2,579.04。|再往上一档,Qwen3.5-122B-A10B 的 FP8 权重约 122GB,H200 141GB 是唯一单卡装得下的,$6.660/卡·时,跑一轮 6 小时全量评测 6 × $6.660 = $39.96 —— 比为它买一张卡便宜得多。所有价格按秒计量、按小时计价,没有最低消费、没有开通费、不用提配额工单,出网流量中位数 $0.0081/GB。

04 —

常见问题

Qwen 现在最新是哪一代?我手上的 Qwen3 还能用吗?

当前是 Qwen3.8:8 月 14 日的 Qwen3.8-27B(Apache 2.0,可自建)和 8 月 12 日的 Qwen3.8-2.4T-A95B(Qwen3.8-Max 自定义许可)。往前是 2026 年 4 月的 Qwen3.6-35B-A3B / 27B 和 2 月的 Qwen3.5 全家。Qwen3.7 只出了闭源的 Max 和 Plus,开源那一档跳过了。2025 年 4 月的 Qwen3 当然还能跑,但上下文只有 128K,也吃不到 Gated DeltaNet 省 KV 的红利 —— 同样一张卡,Qwen3.8-27B 能开的上下文比它长得多。在 NexGPU 上开一台 RTX 4090 花二十分钟做个 A/B,比继续猜有用。

Qwen3.8-27B 到底要多大显存?24GB 够不够?

看格式。Q4_K_M 是 17.1GB,加上 32K 上下文约 2GB 的 KV,24GB 够,这是绝大多数人的答案;Q6_K 22.9GB 也塞得进但没什么余量。FP8 是 28GB、Q8_0 是 29GB,24GB 不够,得上 32GB 以上;bf16 54GB 就要 80GB 卡了。NexGPU 上这几档分别对应 RTX 4090 24GB $0.540、RTX A6000 48GB $0.817、A100 SXM4 80GB $1.088,按秒计费,选错了停掉换一台的成本可以忽略。

A100 能跑 FP8 的 Qwen 吗?

不能。A100 是 Ampere 架构,没有 FP8 张量核,加 --quantization fp8 要么直接报错,要么悄悄回落到 FP16 —— 后者更坑,你会以为省了显存结果 OOM。A100 上请走 bf16、AWQ INT4 或者 GGUF。真要 FP8 就用有原生支持的架构:Hopper 的 H100 / H200,Ada 的 RTX 4090,Blackwell 的 RTX 5090。这几张 NexGPU 都有现货:H100 SXM 80GB $3.582、H200 141GB $6.660、RTX 4090 24GB $0.540、RTX 5090 32GB $0.723。

为什么我的 llama.cpp / Ollama 加载不了 Qwen3.5、Qwen3.8?

因为它是混合架构 —— 一部分层是 Gated DeltaNet 这种循环式线性注意力,一部分是标准注意力。llama.cpp 要通过 llama_memory_hybrid 这条路才能同时管两种状态,旧构建根本不认,会直接拒绝加载。升级到支持 hybrid memory 的版本就好了。同样的道理,vLLM 侧要 0.17 以上,而且必须带 --mamba-cache-mode align,因为 GDN 不支持 all 模式;align 模式下的 prefix caching 还是实验特性,缓存命中和冷跑的生成结果不是逐 bit 一致的,做回归测试时要留意。这些版本组合在 NexGPU 的预置镜像里已经配好了,省掉一轮编译。

Qwen 的思考模式怎么关?输出老是先来一段 think 太浪费了。

vLLM 启动时加 --default-chat-template-kwargs '{"enable_thinking": false}' 全局关闭,或者每次请求带 chat_template_kwargs: {"enable_thinking": false} 单独关。字段名一定是 enable_thinking,有人写成 thinking,在部分 0-day 分支上会触发精度异常,Qwen3.5-27B 和 2B 上都复现过。Qwen3.8 还多一层控制:reasoning_effort 可以设成 low / medium / xhigh,不用非黑即白。要试这些开关的排列组合,在 NexGPU 上按秒计费开一台跑一轮就行。

Qwen3.6-35B-A3B 只激活 3B 参数,是不是 8GB 显存就够了?

不是,这是 MoE 最常见的误解。激活的只是每个 token 走的那部分算力,35B 的全量权重必须整份常驻显存,路由随时可能选到任何一个专家。所以还是按总参数量配卡:bf16 约 69GB、官方 FP8 约 35GB、Q4_K_M 约 18–22GB。MoE 省的是算力和延迟,不是显存。落到 NexGPU:Q4 走 RTX 4090 24GB $0.540/卡·时,FP8 走 H100 SXM 80GB $3.582/卡·时,bf16 用 A100 SXM4 80GB $1.088/卡·时,控制台在 console.nexgpu.net,中英文支持直接 Telegram,不用排工单。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。