Qwen-VL 这个名字有两层含义。狭义的 Qwen-VL 指 2023 年 8 月 QwenLM/Qwen-VL 仓库里那套东西:Qwen-7B 当语言塔、外挂一个 ViT,图像固定 448×448 输入,附带 Qwen-VL-Chat 与 Qwen-VL-Chat-Int4 两个可跑权重。它在当年是少见的敢上 448 分辨率、能做细粒度文字识别和 bounding box 标注的开源模型,但那个仓库如今已经把访客指向后续版本。广义的 Qwen-VL 是一整条产品线:Qwen-VL(2023)→ Qwen2-VL(2024,引入原生动态分辨率与 M-RoPE)→ Qwen2.5-VL(2025 年 1 月,3B/7B/32B/72B,Apache 2.0)→ Qwen3-VL(2025 年 9 至 10 月)。如果你现在要做私有化部署,答案是 Qwen3-VL,不是 2023 年那版。
更值得知道的一件事:带 -VL 后缀的独立分支已经结束了。Qwen3-VL 是最后一代用 VL 命名的模型,覆盖 2B / 4B / 8B / 32B 四个稠密尺寸加 30B-A3B / 235B-A22B 两个 MoE,每个尺寸都有 Instruct 与 Thinking 双版本,原生 256K 上下文、用 YaRN 可外推到 1M,架构上是 Interleaved-MRoPE、DeepStack 与 Text–Timestamp Alignment 三件套,整条线 Apache 2.0。到 2026 年 2 月的 Qwen3.5,视觉被并进了主干:0.8B、2B、4B、9B、27B、35B-A3B、122B-A10B、397B-A17B 全部是原生多模态(early fusion + Gated DeltaNet 与稀疏 MoE 混合),再没有单独的 VL 仓库;之后的 Qwen3.6-27B / 35B-A3B 和 Qwen3.8-27B 也都自带视觉。所以「Qwen-VL 最新版」这个问题的正确答案,取决于你要的是稳定生态(Qwen3-VL)还是最新能力(Qwen3.8-27B)。
部署这类模型时,真正把人坑住的从来不是权重大小,而是视觉 token。动态分辨率意味着一张 4K 截图会被切成上千个 token 塞进上下文——Qwen2.5-VL 给的经验区间是 min_pixels = 256×28×28 到 max_pixels = 1280×28×28,不设上限的话,权重明明只占 5GB,显存却在第三张图上炸掉。这也是我们建议按「权重 + 视觉 token 预算 + KV cache」三项一起估显存的原因。NexGPU 从 RTX 3090 24GB($0.193/卡·时)一路到 H200 141GB($6.660/卡·时)整条梯度都可租,单节点最多 14 卡、最大整机显存 2,152GB,按秒计量、按小时定价,不用提配额工单,试错成本低到你可以先租两小时把 max_pixels 调准再决定上哪张卡。
01 —
Qwen3-VL 全系尺寸与显存对照
量化体积取官方 GGUF 仓库公布的文件大小,是权重本身,实际还要给 mmproj 视觉塔、KV cache 和视觉 token 留出余量。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Qwen3-VL-2B / 4B-Instruct(均含 Thinking) | 2B / 4B | 2B:Q4_K_M 1.11GB / Q8_0 1.83GB / F16 3.45GB;4B:Q4_K_M 2.5GB / Q8_0 4.28GB / F16 8.05GB | 256K 原生,YaRN 可到 1M | 端侧、边缘盒子和 OCR 批处理流水线的甜点位。一张 24GB 卡能同时开好几个副本做并发文档解析。 |
| Qwen3-VL-8B-Instruct / Thinking | 8B(HF 页面按 9B 计权重) | Q4_K_M 5.03GB / Q8_0 8.71GB / F16 16.4GB | 256K 原生,YaRN 可到 1M | 单卡私有化部署的主力型号。F16 权重 16.4GB 正好卡在 24GB 卡的边缘,上下文压到 32K 能跑得很稳。 |
| Qwen3-VL-30B-A3B-Instruct / Thinking(MoE) | 30B-A3B | Q4_K_M 18.6GB / Q8_0 32.5GB / F16 61.1GB | 256K 原生,YaRN 可到 1M | 总参 30B 但每 token 只激活约 3B,吞吐优先的选择;显存按总参算,速度按激活参数算。 |
| Qwen3-VL-32B-Instruct / Thinking | 32B 稠密 | Q4_K_M 19.8GB / Q8_0 34.8GB / F16 65.5GB | 256K 原生,YaRN 可到 1M | 稠密线里视觉推理最强的一档,复杂图表、GUI 操作和 3D 空间理解上明显拉开 8B。另有官方 FP8 版本。 |
| Qwen3-VL-235B-A22B-Instruct / Thinking(含官方 FP8) | 235B-A22B | Q4_K_M 142GB / Q8_0 250GB / F16 470GB | 256K 原生,YaRN 可到 1M | 旗舰。注意官方 FP8 权重 Transformers 不能直接加载,必须走 vLLM 或 SGLang,官方示例给的是 gpu_memory_utilization=0.70。 |
| Qwen3.5 / Qwen3.6 / Qwen3.8-27B(原生多模态继任者) | 0.8B~397B-A17B / 27B / 35B-A3B | Qwen3.5-9B:4bit ~6.5GB、8bit ~13GB、BF16 ~19GB;Qwen3.5-27B:4bit ~17GB、BF16 ~54GB;Qwen3.8-27B:4bit 16–19GB、8bit ~31GB、BF16 ~56GB | 262,144 原生,YaRN 可到 1,010,000 | 不再叫 VL,视觉直接融进主干。Qwen3.8-27B 用的是 Gated DeltaNet 与 Gated Attention 的混合层,Apache 2.0;同期的 Qwen3.8-2.4T-A95B 是纯文本且非开源许可,别拿它当视觉模型选。 |
02 —
按跑法选卡:NexGPU 实价对照
显存按「量化权重 + mmproj + 视觉 token + KV cache」估,不要只看权重文件那个数字。
Qwen3-VL-2B / 4B 的 Q4_K_M,跑通链路、做 OCR 与发票批处理
RTX 3090 24GB$0.193/卡·时
4B 的 Q4_K_M 才 2.5GB,剩下 20 多 GB 全留给视觉 token 和并发 KV,是全站最便宜的多模态试错位。
Qwen3-VL-8B F16 单卡上线,32K 上下文、中等并发
RTX 4090 24GB$0.540/卡·时
16.4GB 权重装得下,Ada 的 FP8 还能再把权重砍掉一半换吞吐;想开 128K 上下文或多图并发就换 RTX 5090 32GB($0.723/卡·时)。
Qwen3-VL-32B 的 Q4_K_M(19.8GB)或 30B-A3B 的 Q8_0(32.5GB)做正式评测
RTX A6000 48GB$0.817/卡·时
48GB 让 Q8 权重和长上下文 KV 同时住得下,不用为了塞进 32GB 把质量降到 Q4。要跑 32B F16 的 65.5GB 就上 A100 SXM4 80GB($1.088/卡·时)。
Qwen3-VL-235B-A22B 官方 FP8 全量私有化上线
H200 141GB × 2$6.660/卡·时
两卡 282GB 显存装 FP8 权重加 KV 更从容,2 × 6.660 = $13.32/小时,比 4 张 H100 SXM 80GB 的 4 × 3.582 = $14.328/小时 还便宜,卡间通信也少一跳。
03 —
在 NexGPU 上把 Qwen3-VL 跑起来
2,000+ 预置镜像里已经有 PyTorch 和 vLLM,不用自己装 CUDA。
- 01
开机并连上去
在 1,175 个已验证可租节点里挑一台,选 vLLM 或 PyTorch 预置镜像。开机后 SSH、Jupyter、Web 终端、REST API、CLI 五种方式随便用,计算从实例启动那一秒开始计费。
ssh root@<node-ip> -p <port> - 02
拉权重,顺手把 transformers 校准到位
Qwen3-VL 需要 transformers 4.57.0 及以上;那阵子它还没进正式发行版,官方给的做法是直接从 main 分支装。Qwen3.5 之后的模型对 vLLM / SGLang 的 main 分支也有同样要求。国内节点走 ModelScope 镜像会快很多。
pip install git+https://github.com/huggingface/transformers && hf download Qwen/Qwen3-VL-8B-Instruct --local-dir /workspace/qwen3-vl-8b - 03
起一个 OpenAI 兼容服务
vLLM 一行命令就能对外提供 /v1/chat/completions,图片按 image_url 传。先把 max-model-len 压到 32K 观察显存曲线,再往上放;官方 FP8 示例推荐的 gpu-memory-utilization 是 0.70。SGLang 用 python3 -m sglang.launch_server --model-path ... --host 0.0.0.0 --port 30000 同理。
vllm serve Qwen/Qwen3-VL-8B-Instruct --gpu-memory-utilization 0.70 --max-model-len 32768 --port 8000 - 04
想省显存走 GGUF?别漏了 mmproj
这是 Qwen3-VL 自部署最常见的一个坑:llama.cpp 要同时加载语言模型 GGUF 和视觉投影器 mmproj 两个文件,只下前者会得到一个「看不见图」的模型。用 llama-mtmd-cli 或 llama-server 显式指定 --mmproj。Instruct 版推荐 temp 0.7 / top_p 0.8 / top_k 20,Thinking 版用 temp 1.0 / top_p 0.95 / top_k 20。
llama-server -m Qwen3VL-8B-Instruct-Q4_K_M.gguf --mmproj mmproj-Qwen3VL-8B-Instruct-F16.gguf --ctx-size 8192 -ngl 99 --port 8080
一次完整的 Qwen3-VL 选型实验要花多少钱
典型路径是先小后大。第一步用 RTX 3090 24GB($0.193/卡·时)跑 Qwen3-VL-4B 的 Q4_K_M(2.5GB),把 prompt、图片预处理和 max_pixels 上限调通,2 小时 = 2 × 0.193 = $0.386。链路稳了再开 RTX A6000 48GB($0.817/卡·时)上 Qwen3-VL-32B 的 Q4_K_M(19.8GB)跑正式评测,6 小时 = 6 × 0.817 = $4.902。权重加数据集共 60GB,留 3 天方便复跑:60 × 0.414 × 3 ÷ 30 = $2.48。结果和日志 8GB 导出:8 × 0.0081 = $0.065。四项相加 0.386 + 4.902 + 2.48 + 0.065 = $7.83,不到八美元你就有了 4B 与 32B 在自己业务数据上的真实对照。如果要顺带评一下旗舰,H200 141GB 两卡跑 235B-A22B 的 FP8 是 2 × 6.660 = $13.32/小时,4 小时对比测试 $53.28——同样的活换成 4 张 H100 SXM 80GB 要 4 × 3.582 = $14.328/小时,反而更贵。计算部分在实例停止的那一秒就停止计费,存储会继续算到你销毁为止,所以评测跑完记得把不用的卷删掉。没有最低消费、没有开通费、没有配额工单。
04 —
