跳到主要内容

开源多模态大模型

Gemma 4 本地部署,一张 4090 就能起 31B

Google DeepMind 的 Gemma 4 全系换成了 Apache 2.0:31B 稠密版 Q4_0 量化后 17.5GB,26B-A4B 每次前向只激活 3.8B 参数。这一页把每个变体的真实显存、上下文和踩坑点摊开写,再告诉你该租哪张卡。

Gemma 4 于 2026 年 4 月发布,同年 6 月补上了 12B。目前是五个尺寸:E2B(5.1B 总参、2.3B 有效)、E4B(8B 总参、4.5B 有效)、12B Unified(11.95B)、26B-A4B(25.2B 总参、3.8B 激活的 MoE)和 31B Dense(30.7B)。E2B/E4B 是 128K 上下文,12B/26B-A4B/31B 都是 256K,支持 140 多种语言,训练数据截止 2025 年 1 月。最关键的变化不在参数量:Gemma 系列头一次用 Apache 2.0 发布,之前那份限制商用场景的 Gemma Terms of Use 没有了,权重可以直接进商业产品。

架构上有三件事值得单独说。第一,12B 是「无编码器」的统一多模态模型——图像 patch 和音频波形不再经过独立的视觉/音频编码器,而是用轻量线性层直接投影进 LLM 的 embedding 空间,全部模态走同一个 decoder-only transformer,所以它能在 16GB 笔记本上同时吃文本、图像、音频和视频。第二,26B-A4B 是 MoE,25.2B 权重要占显存,但每 token 只激活 3.8B,延迟接近 4B 模型而质量接近 31B。第三,Google 额外放出了 Gemma 4 Assistant 系列(如 google/gemma-4-31B-it-assistant)——纯文本的小模型,用 Multi-Token Prediction 做投机解码,并且和目标模型完全共享 KV 缓存,草稿模型直接跳过 prefill 阶段。

分数方面,31B-it 在 MMLU Pro 85.2%、AIME 2026 89.2%、LiveCodeBench v6 80.0%、GPQA Diamond 84.3%、tau2-bench 76.9%,Arena 文本榜上排到开源模型第 3;26B-A4B 是 82.6 / 88.3 / 77.1 / 82.3 / 68.2,排第 6。这个水平的模型放在自己机器上,唯一的门槛就是显存——而显存是可以按秒租的。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种型号,从 $0.188/卡·时 的 Tesla V100 到 141GB 的 H200 都能开机即用。

01 —

Gemma 4 五个变体的显存对照表

显存数字取自 Google 官方模型文档的推理内存表,不含 KV 缓存

版本参数量显存上下文说明
Gemma 4 E2B(google/gemma-4-E2B-it)5.1B 总参 / 2.3B 有效BF16 11.4GB / SFP8 5.7GB / Q4_0 2.9GB(移动端格式 1.1GB)128K端侧最小号,支持文本、图像、音频输入。移动格式对 token 生成层做了 2-bit 量化、推理相关层保留高精度,能压到 1.1GB 塞进手机。适合做本地语音助手、离线摘要这类不许出网的场景。
Gemma 4 E4B(google/gemma-4-E4B-it)8B 总参 / 4.5B 有效BF16 17.9GB / SFP8 8.9GB / Q4_0 4.5GB(移动端格式 2.5GB)128K端侧里质量拐点,GPQA Diamond 从 E2B 的 43.4% 跳到 58.6%。官方 vLLM recipe 说单张 24GB 卡就够,Q8_0 是这一档推荐的量化档位(4-bit 对 4B 级模型损伤偏大)。
Gemma 4 12B Unified(google/gemma-4-12B-it)11.95B 稠密BF16 26.7GB / SFP8 13.4GB / Q4_0 6.7GB256K无编码器统一多模态,是 Gemma 中号里第一个原生吃音频的。文本、图像、音频、视频同进一个 decoder。音频单段上限 30 秒,视频上限 60 秒 @ 1fps。基准接近 26B-A4B,总显存不到它一半,是自建多模态服务性价比最高的一档。
Gemma 4 26B-A4B MoE(google/gemma-4-26B-A4B-it)25.2B 总参 / 3.8B 激活BF16 57.7GB / SFP8 28.8GB / Q4_0 14.4GB256K高并发首选。官方没有出 W4A16 权重,因为 4-bit 下质量掉得太狠;vLLM recipe 推荐走 INT8,省约 47% 显存。GGUF 路线要注意:直接转 llama.cpp 的 Q4_0 存在 scale 不匹配,社区动态量化(UD-Q4_K_XL)把 top-1 从 70.2% 拉回 85.6%。
Gemma 4 31B Dense(google/gemma-4-31B-it)30.7B 稠密BF16 69.9GB / SFP8 34.9GB / Q4_0 17.5GB256K旗舰。60 层,滑动窗口与全局注意力混合,词表 262K,视觉编码器约 550M 参数,图像 token 预算 70–1120 可调。文本 + 图像输入(不含音频)。Q4_0 的 17.5GB 是它能挤进 24GB 消费卡的关键。

02 —

按场景选卡:NexGPU 实际报价

权重只是地板,KV 缓存才是变量——下面每一行都留了上下文余量

  • 先用 Q4_0 把 12B / E4B 跑起来验证效果

    RTX 3090 24GB$0.193/卡·时

    12B 的 Q4_0 权重只有 6.7GB,24GB 显存剩下的十几个 G 全给 KV 缓存,够你把上下文拉到很舒服的长度,是做可行性验证最便宜的一张卡。

  • 单卡跑 31B Q4_0 做团队内部问答与代码助手

    RTX 4090 24GB$0.540/卡·时

    17.5GB 权重装进 24GB 后还剩约 6GB,配 --max-model-len 32768 能稳住不 OOM;Ada 的 int4 kernel 比 Ampere 快一截,单用户体感明显好于 3090。

  • 26B-A4B 走 INT8 扛多人并发

    RTX A6000 48GB$0.817/卡·时

    28.8GB 权重放 48GB 卡上还留近 20GB 给 KV,正好对上官方推荐的 INT8 路线;MoE 每 token 只激活 3.8B,同样显存下的吞吐远高于同尺寸稠密模型。

  • 31B BF16 双卡 TP=2 上生产

    A100 SXM4 80GB ×2$1.088/卡·时

    vLLM 官方给 31B BF16 的配置就是两张 80GB。69.9GB 权重硬塞单卡后几乎没有 KV 空间,TP=2 才能把 --max-model-len 开到 32768 以上还留出连续批处理的调度余量。

03 —

在 NexGPU 上把 Gemma 4 跑起来

从开机到 OpenAI 兼容接口,四步

  1. 01

    开一台带 vLLM 的实例

    在 console.nexgpu.net 按上面的表选卡,直接挑预置的 vLLM 或 PyTorch 镜像开机(2,000+ 镜像可选),SSH、Jupyter、Web 终端三种进法随便用。Gemma 4 的算子还在 vLLM 主线快速迭代,建议装 nightly 而不是稳定版——2026 年 7 月那批更新带来了 Hopper 上的 FA4、chat template 修复和 tool-calling 补丁。

    uv pip install -U vllm --pre --extra-index-url https://wheels.vllm.ai/nightly/cu129 --index-strategy unsafe-best-match
  2. 02

    拉权重

    Apache 2.0,不需要申请授权、不需要签同意书,直接拉。要走 GGUF 路线就换成社区的动态量化包,别用裸转的 Q4_0——26B-A4B 上有 scale 不匹配的坑。带音频的变体记得额外装 vllm[audio]。

    hf download google/gemma-4-26B-A4B-it --local-dir /workspace/gemma-4-26B-A4B-it
  3. 03

    起服务,把 thinking 和 tool-calling 的 parser 挂上

    Gemma 4 的推理块和函数调用都需要专用 parser,不加 --reasoning-parser gemma4 / --tool-call-parser gemma4 就只会看到一堆原始标记混在正文里。--max-model-len 请按你真实会接的最长请求设,不要因为模型支持 256K 就填 256K——KV 缓存随上下文线性涨,填满之后连续批处理没有余量塞新请求,服务器要么丢请求要么 OOM。

    vllm serve google/gemma-4-26B-A4B-it --max-model-len 32768 --gpu-memory-utilization 0.90 --reasoning-parser gemma4 --tool-call-parser gemma4 --enable-auto-tool-choice --limit-mm-per-prompt image=4 --host 0.0.0.0 --port 8000
  4. 04

    验证并调采样参数

    Google 给的默认采样是 temperature 1.0、top_p 0.95、top_k 64,不要照搬其他模型的 0.7。想开思考模式就在 system prompt 开头加 <|think|>,想关掉在 llama.cpp 侧传 --chat-template-kwargs '{"enable_thinking":false}'。多轮对话时只保留最终可见回答,历史里的 thought 块要剔掉,否则模型会被自己的草稿带偏。

    curl -s localhost:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"google/gemma-4-26B-A4B-it","messages":[{"role":"user","content":"用一句话解释 MoE 为什么省算力"}],"temperature":1.0,"top_p":0.95,"top_k":64}'

一个月的真实账单长什么样

假设你要把 Gemma 4 落地成一个内部服务。第一步在 RTX 4090 24GB 上跑 31B 的 Q4_0 做效果评估,3 小时:0.540 × 3 = $1.62。第二步还是这张 4090,用 QLoRA 微调 31B(4-bit 训练大约吃 22GB,刚好卡在 24GB 里),8 小时:0.540 × 8 = $4.32。第三步上线,26B-A4B 走 INT8 常驻 RTX A6000 48GB 一整个月:0.817 × 24 × 30 = $588.24。再加 60GB 权重与检查点的存储:0.414 × 60 = $24.84;出网 200GB:0.0081 × 200 = $1.62。首月合计 1.62 + 4.32 + 588.24 + 24.84 + 1.62 = $620.64。要注意两件事:计费按秒结算,评估那 3 小时实际用了 2 小时 47 分就只收 2 小时 47 分;以及实例一停,算力费立刻停止,存储费会一直收到你把盘销毁为止——所以调试期间用完就停机,权重留在盘上下次直接开。没有最低消费,没有开通费,也不用提配额工单。

04 —

常见问题

Gemma 4 本地部署到底需要多大显存?

看变体和精度。BF16 下:E2B 11.4GB、E4B 17.9GB、12B 26.7GB、26B-A4B 57.7GB、31B 69.9GB。SFP8 大致减半,Q4_0 再减半:31B 只要 17.5GB、26B-A4B 14.4GB、12B 6.7GB。这些都是权重本身,KV 缓存要另算,长上下文和高并发场景请按 --max-model-len 单独留出空间。想省事就照我们上面那张场景表选:$0.193/卡·时 的 RTX 3090 跑量化验证,$0.540 的 RTX 4090 跑 31B Q4_0,$0.817 的 RTX A6000 48GB 跑 26B-A4B INT8,NexGPU 全都是开机即用的预置镜像。

已经部署了 Gemma 3,还有必要升到 Gemma 4 吗?

有,而且升级理由不只是分数。Gemma 3 到 Gemma 4 的跃迁很陡:AIME 2026 从 20.8% 到 89.2%,LiveCodeBench 从 29.1% 到 80.0%,GPQA 从 42.4% 到 84.3%。但更硬的理由是许可证——Gemma 3 用的是 Google 自己的 Gemma Terms of Use,带使用限制条款;Gemma 4 全系换成 Apache 2.0,法务那关直接过。另外 Gemma 4 把上下文从 128K 拉到 256K(中大号),并且新增了 MoE 和无编码器多模态两条技术路线。想在同一台机器上把两代跑起来横向对比,NexGPU 单节点最多支持 14 张卡、最大节点显存 2,152GB,一次开够。

26B-A4B 能不能像 31B 那样跑 4-bit 省显存?

不建议直接照搬。官方没有发布 26B-A4B 的 W4A16 权重,原因就是 4-bit 下质量损失过大——MoE 的专家权重比稠密模型对量化更敏感。vLLM 官方 recipe 给的是 INT8,省大约 47% 显存,落到 28.8GB。如果一定要走 GGUF,别用裸转的 Q4_0(存在 scale 不匹配),选社区的动态量化包,实测能把 top-1 从 70.2% 拉回 85.6%。28.8GB 这个数正好适配 NexGPU 的 RTX A6000 48GB($0.817/卡·时),留近 20GB 给 KV 缓存。

开了 thinking,为什么 OpenAI 接口返回的 reasoning_content 是空的?

这是 Gemma 4 在 vLLM 上一个已知的踩坑点:vLLM 的文本解码会在 reasoning parser 看到内容之前先把特殊标记剥掉,导致 Gemma4ReasoningParser 拿不到 thought 块、reasoning_content 填不进去。先确认你加了 --reasoning-parser gemma4 并用了官方的 tool_chat_template_gemma4.jinja;仍然为空就升级到 vLLM nightly,7 月那批更新专门修过 chat template 和 tool-calling。llama.cpp 侧则要用 llama-server 而不是 llama-cli 才能可靠地关掉推理。在 NexGPU 上换一版镜像重开一台只要几十秒,验证成本几乎为零。

Gemma 4 可以直接用在商业产品里吗?

可以。Gemma 4 是 Gemma 系列第一次采用 Apache 2.0 许可证,覆盖全部五个尺寸和全部格式(含 QAT 量化权重),商用、二次分发、闭源封装都在许可范围内,不需要向 Google 申请。这也意味着你可以放心把微调后的权重当作自己的资产存起来——NexGPU 存储中位价 $0.414/GB·月,权重放着不动、需要时再开机挂载,算力费一分不产生。

24GB 的卡能微调 31B 吗?

能,走 QLoRA。31B 的 4-bit 训练实测大约 22GB,刚好卡在 24GB 显存里;E2B 的 LoRA 只要 8–10GB,E4B 约 17GB,26B-A4B 因为要装全部专家权重,LoRA 需要 40GB 以上。也就是说 NexGPU 的 RTX 4090 24GB($0.540/卡·时)就能承担 31B 微调,26B-A4B 则请上 RTX A6000 48GB($0.817/卡·时)或 A100 PCIE 80GB($0.824/卡·时)。按秒计费意味着一次失败的实验只损失几分钟的钱,跑通了再拉长训练时长——有问题随时在 Telegram 找我们,中英文都行,不排队。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。