跳到主要内容

多模态视觉语言模型

Qwen-VL 本地部署:从 2B 到 235B 的那笔显存账

先说结论:今天你搜到的 Qwen-VL,真正该部署的是 Qwen3-VL——2B 的 Q4_K_M 只有 1.11GB,235B-A22B 的 Q4_K_M 要 142GB,中间十几倍的差距,决定了你该租哪张卡。

Qwen-VL 这个名字有两层含义。狭义的 Qwen-VL 指 2023 年 8 月 QwenLM/Qwen-VL 仓库里那套东西:Qwen-7B 当语言塔、外挂一个 ViT,图像固定 448×448 输入,附带 Qwen-VL-Chat 与 Qwen-VL-Chat-Int4 两个可跑权重。它在当年是少见的敢上 448 分辨率、能做细粒度文字识别和 bounding box 标注的开源模型,但那个仓库如今已经把访客指向后续版本。广义的 Qwen-VL 是一整条产品线:Qwen-VL(2023)→ Qwen2-VL(2024,引入原生动态分辨率与 M-RoPE)→ Qwen2.5-VL(2025 年 1 月,3B/7B/32B/72B,Apache 2.0)→ Qwen3-VL(2025 年 9 至 10 月)。如果你现在要做私有化部署,答案是 Qwen3-VL,不是 2023 年那版。

更值得知道的一件事:带 -VL 后缀的独立分支已经结束了。Qwen3-VL 是最后一代用 VL 命名的模型,覆盖 2B / 4B / 8B / 32B 四个稠密尺寸加 30B-A3B / 235B-A22B 两个 MoE,每个尺寸都有 Instruct 与 Thinking 双版本,原生 256K 上下文、用 YaRN 可外推到 1M,架构上是 Interleaved-MRoPE、DeepStack 与 Text–Timestamp Alignment 三件套,整条线 Apache 2.0。到 2026 年 2 月的 Qwen3.5,视觉被并进了主干:0.8B、2B、4B、9B、27B、35B-A3B、122B-A10B、397B-A17B 全部是原生多模态(early fusion + Gated DeltaNet 与稀疏 MoE 混合),再没有单独的 VL 仓库;之后的 Qwen3.6-27B / 35B-A3B 和 Qwen3.8-27B 也都自带视觉。所以「Qwen-VL 最新版」这个问题的正确答案,取决于你要的是稳定生态(Qwen3-VL)还是最新能力(Qwen3.8-27B)。

部署这类模型时,真正把人坑住的从来不是权重大小,而是视觉 token。动态分辨率意味着一张 4K 截图会被切成上千个 token 塞进上下文——Qwen2.5-VL 给的经验区间是 min_pixels = 256×28×28 到 max_pixels = 1280×28×28,不设上限的话,权重明明只占 5GB,显存却在第三张图上炸掉。这也是我们建议按「权重 + 视觉 token 预算 + KV cache」三项一起估显存的原因。NexGPU 从 RTX 3090 24GB($0.193/卡·时)一路到 H200 141GB($6.660/卡·时)整条梯度都可租,单节点最多 14 卡、最大整机显存 2,152GB,按秒计量、按小时定价,不用提配额工单,试错成本低到你可以先租两小时把 max_pixels 调准再决定上哪张卡。

01 —

Qwen3-VL 全系尺寸与显存对照

量化体积取官方 GGUF 仓库公布的文件大小,是权重本身,实际还要给 mmproj 视觉塔、KV cache 和视觉 token 留出余量。

版本参数量显存上下文说明
Qwen3-VL-2B / 4B-Instruct(均含 Thinking)2B / 4B2B:Q4_K_M 1.11GB / Q8_0 1.83GB / F16 3.45GB;4B:Q4_K_M 2.5GB / Q8_0 4.28GB / F16 8.05GB256K 原生,YaRN 可到 1M端侧、边缘盒子和 OCR 批处理流水线的甜点位。一张 24GB 卡能同时开好几个副本做并发文档解析。
Qwen3-VL-8B-Instruct / Thinking8B(HF 页面按 9B 计权重)Q4_K_M 5.03GB / Q8_0 8.71GB / F16 16.4GB256K 原生,YaRN 可到 1M单卡私有化部署的主力型号。F16 权重 16.4GB 正好卡在 24GB 卡的边缘,上下文压到 32K 能跑得很稳。
Qwen3-VL-30B-A3B-Instruct / Thinking(MoE)30B-A3BQ4_K_M 18.6GB / Q8_0 32.5GB / F16 61.1GB256K 原生,YaRN 可到 1M总参 30B 但每 token 只激活约 3B,吞吐优先的选择;显存按总参算,速度按激活参数算。
Qwen3-VL-32B-Instruct / Thinking32B 稠密Q4_K_M 19.8GB / Q8_0 34.8GB / F16 65.5GB256K 原生,YaRN 可到 1M稠密线里视觉推理最强的一档,复杂图表、GUI 操作和 3D 空间理解上明显拉开 8B。另有官方 FP8 版本。
Qwen3-VL-235B-A22B-Instruct / Thinking(含官方 FP8)235B-A22BQ4_K_M 142GB / Q8_0 250GB / F16 470GB256K 原生,YaRN 可到 1M旗舰。注意官方 FP8 权重 Transformers 不能直接加载,必须走 vLLM 或 SGLang,官方示例给的是 gpu_memory_utilization=0.70。
Qwen3.5 / Qwen3.6 / Qwen3.8-27B(原生多模态继任者)0.8B~397B-A17B / 27B / 35B-A3BQwen3.5-9B:4bit ~6.5GB、8bit ~13GB、BF16 ~19GB;Qwen3.5-27B:4bit ~17GB、BF16 ~54GB;Qwen3.8-27B:4bit 16–19GB、8bit ~31GB、BF16 ~56GB262,144 原生,YaRN 可到 1,010,000不再叫 VL,视觉直接融进主干。Qwen3.8-27B 用的是 Gated DeltaNet 与 Gated Attention 的混合层,Apache 2.0;同期的 Qwen3.8-2.4T-A95B 是纯文本且非开源许可,别拿它当视觉模型选。

02 —

按跑法选卡:NexGPU 实价对照

显存按「量化权重 + mmproj + 视觉 token + KV cache」估,不要只看权重文件那个数字。

  • Qwen3-VL-2B / 4B 的 Q4_K_M,跑通链路、做 OCR 与发票批处理

    RTX 3090 24GB$0.193/卡·时

    4B 的 Q4_K_M 才 2.5GB,剩下 20 多 GB 全留给视觉 token 和并发 KV,是全站最便宜的多模态试错位。

  • Qwen3-VL-8B F16 单卡上线,32K 上下文、中等并发

    RTX 4090 24GB$0.540/卡·时

    16.4GB 权重装得下,Ada 的 FP8 还能再把权重砍掉一半换吞吐;想开 128K 上下文或多图并发就换 RTX 5090 32GB($0.723/卡·时)。

  • Qwen3-VL-32B 的 Q4_K_M(19.8GB)或 30B-A3B 的 Q8_0(32.5GB)做正式评测

    RTX A6000 48GB$0.817/卡·时

    48GB 让 Q8 权重和长上下文 KV 同时住得下,不用为了塞进 32GB 把质量降到 Q4。要跑 32B F16 的 65.5GB 就上 A100 SXM4 80GB($1.088/卡·时)。

  • Qwen3-VL-235B-A22B 官方 FP8 全量私有化上线

    H200 141GB × 2$6.660/卡·时

    两卡 282GB 显存装 FP8 权重加 KV 更从容,2 × 6.660 = $13.32/小时,比 4 张 H100 SXM 80GB 的 4 × 3.582 = $14.328/小时 还便宜,卡间通信也少一跳。

03 —

在 NexGPU 上把 Qwen3-VL 跑起来

2,000+ 预置镜像里已经有 PyTorch 和 vLLM,不用自己装 CUDA。

  1. 01

    开机并连上去

    在 1,175 个已验证可租节点里挑一台,选 vLLM 或 PyTorch 预置镜像。开机后 SSH、Jupyter、Web 终端、REST API、CLI 五种方式随便用,计算从实例启动那一秒开始计费。

    ssh root@<node-ip> -p <port>
  2. 02

    拉权重,顺手把 transformers 校准到位

    Qwen3-VL 需要 transformers 4.57.0 及以上;那阵子它还没进正式发行版,官方给的做法是直接从 main 分支装。Qwen3.5 之后的模型对 vLLM / SGLang 的 main 分支也有同样要求。国内节点走 ModelScope 镜像会快很多。

    pip install git+https://github.com/huggingface/transformers && hf download Qwen/Qwen3-VL-8B-Instruct --local-dir /workspace/qwen3-vl-8b
  3. 03

    起一个 OpenAI 兼容服务

    vLLM 一行命令就能对外提供 /v1/chat/completions,图片按 image_url 传。先把 max-model-len 压到 32K 观察显存曲线,再往上放;官方 FP8 示例推荐的 gpu-memory-utilization 是 0.70。SGLang 用 python3 -m sglang.launch_server --model-path ... --host 0.0.0.0 --port 30000 同理。

    vllm serve Qwen/Qwen3-VL-8B-Instruct --gpu-memory-utilization 0.70 --max-model-len 32768 --port 8000
  4. 04

    想省显存走 GGUF?别漏了 mmproj

    这是 Qwen3-VL 自部署最常见的一个坑:llama.cpp 要同时加载语言模型 GGUF 和视觉投影器 mmproj 两个文件,只下前者会得到一个「看不见图」的模型。用 llama-mtmd-cli 或 llama-server 显式指定 --mmproj。Instruct 版推荐 temp 0.7 / top_p 0.8 / top_k 20,Thinking 版用 temp 1.0 / top_p 0.95 / top_k 20。

    llama-server -m Qwen3VL-8B-Instruct-Q4_K_M.gguf --mmproj mmproj-Qwen3VL-8B-Instruct-F16.gguf --ctx-size 8192 -ngl 99 --port 8080

一次完整的 Qwen3-VL 选型实验要花多少钱

典型路径是先小后大。第一步用 RTX 3090 24GB($0.193/卡·时)跑 Qwen3-VL-4B 的 Q4_K_M(2.5GB),把 prompt、图片预处理和 max_pixels 上限调通,2 小时 = 2 × 0.193 = $0.386。链路稳了再开 RTX A6000 48GB($0.817/卡·时)上 Qwen3-VL-32B 的 Q4_K_M(19.8GB)跑正式评测,6 小时 = 6 × 0.817 = $4.902。权重加数据集共 60GB,留 3 天方便复跑:60 × 0.414 × 3 ÷ 30 = $2.48。结果和日志 8GB 导出:8 × 0.0081 = $0.065。四项相加 0.386 + 4.902 + 2.48 + 0.065 = $7.83,不到八美元你就有了 4B 与 32B 在自己业务数据上的真实对照。如果要顺带评一下旗舰,H200 141GB 两卡跑 235B-A22B 的 FP8 是 2 × 6.660 = $13.32/小时,4 小时对比测试 $53.28——同样的活换成 4 张 H100 SXM 80GB 要 4 × 3.582 = $14.328/小时,反而更贵。计算部分在实例停止的那一秒就停止计费,存储会继续算到你销毁为止,所以评测跑完记得把不用的卷删掉。没有最低消费、没有开通费、没有配额工单。

04 —

常见问题

Qwen-VL 现在还能用吗?私有化部署到底应该选哪一代?

2023 年那版 Qwen-VL / Qwen-VL-Chat 权重还在,但固定 448×448 输入和 32K 以内的上下文已经跟不上今天的文档理解需求了。生产环境请选 Qwen3-VL——它是最后一代带 VL 后缀的模型,2B 到 235B-A22B 六个尺寸齐全、Apache 2.0、生态最成熟;想要最新能力就直接上原生多模态的 Qwen3.8-27B。哪一代都要卡,NexGPU 从 RTX 3090 24GB 到 H200 141GB 共 75 种 GPU 型号、2,498 张卡随时可租,换一代模型不用换供应商。

Qwen3-VL 8B 需要多大显存?24GB 的卡够不够?

官方 GGUF 仓库给的数字是 Q4_K_M 5.03GB、Q8_0 8.71GB、F16 16.4GB,这是纯权重。加上 mmproj 视觉塔、KV cache 和视觉 token,24GB 跑 F16 要把 max-model-len 控制在 32K 左右才稳;Q8_0 在 24GB 上则相当宽裕。真要开长上下文或多图并发,32GB 更省心。NexGPU 的 RTX 4090 24GB 是 $0.540/卡·时、RTX 5090 32GB 是 $0.723/卡·时,按秒计费,租一小时就能把这条线试出来。

为什么权重只占 5GB,图片一多就 OOM?

因为 Qwen 系 VL 用的是原生动态分辨率,图片越大切出的视觉 token 越多,一张高分辨率截图轻松吃掉上千 token,而这些 token 全部进 KV cache。Qwen2.5-VL 给出的经验区间是 min_pixels = 256×28×28、max_pixels = 1280×28×28,先设上限再谈并发;视频场景则要同时压 fps 和 max_pixels。调这个参数需要反复试,NexGPU 按秒计量、无最低消费,你可以只为真正跑的那几十分钟付钱。

用 llama.cpp 跑 Qwen3-VL,为什么模型看不见图片?

十有八九是只下了语言模型那个 GGUF,漏了 mmproj 视觉投影器文件。官方 GGUF 仓库把 mmproj 单独放在 FP16 和 Q8_0 两种精度里,要用 llama-mtmd-cli 或 llama-server 的 --mmproj 显式指定才会加载。另外 Thinking 版本的 chat template 曾经在 llama.cpp 上有过第二轮对话崩溃的问题(报 Value is not callable),换用修过模板的重传量化即可;Ollama 对新一代 Qwen 多模态 GGUF 的支持也一直滞后。NexGPU 的预置镜像里 llama.cpp 与 vLLM 都是现成的,省掉这一轮踩坑。

Qwen3-VL-235B-A22B 私有化部署需要几张卡?

看精度。GGUF 的 Q4_K_M 是 142GB、Q8_0 是 250GB、F16 是 470GB;官方 FP8 版本 Transformers 不能直接加载,必须用 vLLM 或 SGLang,示例里 gpu_memory_utilization 给的是 0.70。实践中两张 H200 141GB(共 282GB)跑 FP8 最省事,合 2 × 6.660 = $13.32/小时;Q4_K_M 用 2 张 A100 SXM4 80GB($1.088/卡·时)也能起。NexGPU 单节点最多 14 卡、最大整机显存 2,152GB,不用为多卡拓扑单独申请。

微调 Qwen3-VL 或换到 Qwen3.5,显存要重新算吗?

要。全参微调按 bf16 权重的三到四倍准备显存,LoRA / QLoRA 则大致在推理显存上再加几 GB。换代同样要重算:Qwen3.5-9B 的 4bit 约 6.5GB、BF16 约 19GB,Qwen3.5-27B 的 4bit 约 17GB、BF16 约 54GB,Qwen3.8-27B 的 4bit 是 16–19GB、BF16 约 56GB,并且这一代的小尺寸默认关闭 thinking。NexGPU 覆盖 51 个国家与地区、1,175 个已验证节点,微调开 A100 80GB、推理换回 4090,随时切换,Telegram 上有中英双语支持,不用排工单。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。