Gemma 4 于 2026 年 4 月发布,同年 6 月补上了 12B。目前是五个尺寸:E2B(5.1B 总参、2.3B 有效)、E4B(8B 总参、4.5B 有效)、12B Unified(11.95B)、26B-A4B(25.2B 总参、3.8B 激活的 MoE)和 31B Dense(30.7B)。E2B/E4B 是 128K 上下文,12B/26B-A4B/31B 都是 256K,支持 140 多种语言,训练数据截止 2025 年 1 月。最关键的变化不在参数量:Gemma 系列头一次用 Apache 2.0 发布,之前那份限制商用场景的 Gemma Terms of Use 没有了,权重可以直接进商业产品。
架构上有三件事值得单独说。第一,12B 是「无编码器」的统一多模态模型——图像 patch 和音频波形不再经过独立的视觉/音频编码器,而是用轻量线性层直接投影进 LLM 的 embedding 空间,全部模态走同一个 decoder-only transformer,所以它能在 16GB 笔记本上同时吃文本、图像、音频和视频。第二,26B-A4B 是 MoE,25.2B 权重要占显存,但每 token 只激活 3.8B,延迟接近 4B 模型而质量接近 31B。第三,Google 额外放出了 Gemma 4 Assistant 系列(如 google/gemma-4-31B-it-assistant)——纯文本的小模型,用 Multi-Token Prediction 做投机解码,并且和目标模型完全共享 KV 缓存,草稿模型直接跳过 prefill 阶段。
分数方面,31B-it 在 MMLU Pro 85.2%、AIME 2026 89.2%、LiveCodeBench v6 80.0%、GPQA Diamond 84.3%、tau2-bench 76.9%,Arena 文本榜上排到开源模型第 3;26B-A4B 是 82.6 / 88.3 / 77.1 / 82.3 / 68.2,排第 6。这个水平的模型放在自己机器上,唯一的门槛就是显存——而显存是可以按秒租的。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种型号,从 $0.188/卡·时 的 Tesla V100 到 141GB 的 H200 都能开机即用。
01 —
Gemma 4 五个变体的显存对照表
显存数字取自 Google 官方模型文档的推理内存表,不含 KV 缓存
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Gemma 4 E2B(google/gemma-4-E2B-it) | 5.1B 总参 / 2.3B 有效 | BF16 11.4GB / SFP8 5.7GB / Q4_0 2.9GB(移动端格式 1.1GB) | 128K | 端侧最小号,支持文本、图像、音频输入。移动格式对 token 生成层做了 2-bit 量化、推理相关层保留高精度,能压到 1.1GB 塞进手机。适合做本地语音助手、离线摘要这类不许出网的场景。 |
| Gemma 4 E4B(google/gemma-4-E4B-it) | 8B 总参 / 4.5B 有效 | BF16 17.9GB / SFP8 8.9GB / Q4_0 4.5GB(移动端格式 2.5GB) | 128K | 端侧里质量拐点,GPQA Diamond 从 E2B 的 43.4% 跳到 58.6%。官方 vLLM recipe 说单张 24GB 卡就够,Q8_0 是这一档推荐的量化档位(4-bit 对 4B 级模型损伤偏大)。 |
| Gemma 4 12B Unified(google/gemma-4-12B-it) | 11.95B 稠密 | BF16 26.7GB / SFP8 13.4GB / Q4_0 6.7GB | 256K | 无编码器统一多模态,是 Gemma 中号里第一个原生吃音频的。文本、图像、音频、视频同进一个 decoder。音频单段上限 30 秒,视频上限 60 秒 @ 1fps。基准接近 26B-A4B,总显存不到它一半,是自建多模态服务性价比最高的一档。 |
| Gemma 4 26B-A4B MoE(google/gemma-4-26B-A4B-it) | 25.2B 总参 / 3.8B 激活 | BF16 57.7GB / SFP8 28.8GB / Q4_0 14.4GB | 256K | 高并发首选。官方没有出 W4A16 权重,因为 4-bit 下质量掉得太狠;vLLM recipe 推荐走 INT8,省约 47% 显存。GGUF 路线要注意:直接转 llama.cpp 的 Q4_0 存在 scale 不匹配,社区动态量化(UD-Q4_K_XL)把 top-1 从 70.2% 拉回 85.6%。 |
| Gemma 4 31B Dense(google/gemma-4-31B-it) | 30.7B 稠密 | BF16 69.9GB / SFP8 34.9GB / Q4_0 17.5GB | 256K | 旗舰。60 层,滑动窗口与全局注意力混合,词表 262K,视觉编码器约 550M 参数,图像 token 预算 70–1120 可调。文本 + 图像输入(不含音频)。Q4_0 的 17.5GB 是它能挤进 24GB 消费卡的关键。 |
02 —
按场景选卡:NexGPU 实际报价
权重只是地板,KV 缓存才是变量——下面每一行都留了上下文余量
先用 Q4_0 把 12B / E4B 跑起来验证效果
RTX 3090 24GB$0.193/卡·时
12B 的 Q4_0 权重只有 6.7GB,24GB 显存剩下的十几个 G 全给 KV 缓存,够你把上下文拉到很舒服的长度,是做可行性验证最便宜的一张卡。
单卡跑 31B Q4_0 做团队内部问答与代码助手
RTX 4090 24GB$0.540/卡·时
17.5GB 权重装进 24GB 后还剩约 6GB,配 --max-model-len 32768 能稳住不 OOM;Ada 的 int4 kernel 比 Ampere 快一截,单用户体感明显好于 3090。
26B-A4B 走 INT8 扛多人并发
RTX A6000 48GB$0.817/卡·时
28.8GB 权重放 48GB 卡上还留近 20GB 给 KV,正好对上官方推荐的 INT8 路线;MoE 每 token 只激活 3.8B,同样显存下的吞吐远高于同尺寸稠密模型。
31B BF16 双卡 TP=2 上生产
A100 SXM4 80GB ×2$1.088/卡·时
vLLM 官方给 31B BF16 的配置就是两张 80GB。69.9GB 权重硬塞单卡后几乎没有 KV 空间,TP=2 才能把 --max-model-len 开到 32768 以上还留出连续批处理的调度余量。
03 —
在 NexGPU 上把 Gemma 4 跑起来
从开机到 OpenAI 兼容接口,四步
- 01
开一台带 vLLM 的实例
在 console.nexgpu.net 按上面的表选卡,直接挑预置的 vLLM 或 PyTorch 镜像开机(2,000+ 镜像可选),SSH、Jupyter、Web 终端三种进法随便用。Gemma 4 的算子还在 vLLM 主线快速迭代,建议装 nightly 而不是稳定版——2026 年 7 月那批更新带来了 Hopper 上的 FA4、chat template 修复和 tool-calling 补丁。
uv pip install -U vllm --pre --extra-index-url https://wheels.vllm.ai/nightly/cu129 --index-strategy unsafe-best-match - 02
拉权重
Apache 2.0,不需要申请授权、不需要签同意书,直接拉。要走 GGUF 路线就换成社区的动态量化包,别用裸转的 Q4_0——26B-A4B 上有 scale 不匹配的坑。带音频的变体记得额外装 vllm[audio]。
hf download google/gemma-4-26B-A4B-it --local-dir /workspace/gemma-4-26B-A4B-it - 03
起服务,把 thinking 和 tool-calling 的 parser 挂上
Gemma 4 的推理块和函数调用都需要专用 parser,不加 --reasoning-parser gemma4 / --tool-call-parser gemma4 就只会看到一堆原始标记混在正文里。--max-model-len 请按你真实会接的最长请求设,不要因为模型支持 256K 就填 256K——KV 缓存随上下文线性涨,填满之后连续批处理没有余量塞新请求,服务器要么丢请求要么 OOM。
vllm serve google/gemma-4-26B-A4B-it --max-model-len 32768 --gpu-memory-utilization 0.90 --reasoning-parser gemma4 --tool-call-parser gemma4 --enable-auto-tool-choice --limit-mm-per-prompt image=4 --host 0.0.0.0 --port 8000 - 04
验证并调采样参数
Google 给的默认采样是 temperature 1.0、top_p 0.95、top_k 64,不要照搬其他模型的 0.7。想开思考模式就在 system prompt 开头加 <|think|>,想关掉在 llama.cpp 侧传 --chat-template-kwargs '{"enable_thinking":false}'。多轮对话时只保留最终可见回答,历史里的 thought 块要剔掉,否则模型会被自己的草稿带偏。
curl -s localhost:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"google/gemma-4-26B-A4B-it","messages":[{"role":"user","content":"用一句话解释 MoE 为什么省算力"}],"temperature":1.0,"top_p":0.95,"top_k":64}'
一个月的真实账单长什么样
假设你要把 Gemma 4 落地成一个内部服务。第一步在 RTX 4090 24GB 上跑 31B 的 Q4_0 做效果评估,3 小时:0.540 × 3 = $1.62。第二步还是这张 4090,用 QLoRA 微调 31B(4-bit 训练大约吃 22GB,刚好卡在 24GB 里),8 小时:0.540 × 8 = $4.32。第三步上线,26B-A4B 走 INT8 常驻 RTX A6000 48GB 一整个月:0.817 × 24 × 30 = $588.24。再加 60GB 权重与检查点的存储:0.414 × 60 = $24.84;出网 200GB:0.0081 × 200 = $1.62。首月合计 1.62 + 4.32 + 588.24 + 24.84 + 1.62 = $620.64。要注意两件事:计费按秒结算,评估那 3 小时实际用了 2 小时 47 分就只收 2 小时 47 分;以及实例一停,算力费立刻停止,存储费会一直收到你把盘销毁为止——所以调试期间用完就停机,权重留在盘上下次直接开。没有最低消费,没有开通费,也不用提配额工单。
04 —
