Llama 是 Meta 从 2023 年 2 月开始放出的开源权重系列,一路走到 2025 年 4 月 5 日的 Llama 4 Scout 与 Maverick。有件事得先说清楚:Llama 4 之后 Meta 再没发布新的 Llama。2026 年 4 月,Meta Superintelligence Labs 转向了闭源权重的 Muse Spark,8 月又以 Apache 2.0 放出 30B 的 Muse Glimmer。命名线停在了 Llama 4,但权重一个没撤——Hugging Face 上 meta-llama 组织下的 Llama-4-Scout-17B-16E-Instruct、Llama-3.3-70B-Instruct 全都还能下载自建,而且生态比任何新模型都厚。
真正决定你选卡的是 Llama 4 的 MoE 结构。Scout 是 17B 激活参数、16 个专家、109B 总参数;Maverick 是 17B 激活、128 个专家、400B 总参数。推理时只算 17B,但显存里必须装下全部专家。所以官方那句“单卡 H100 就能跑 Scout”和“1000 万 token 上下文”是两个互相排斥的条件:vLLM 官方博客给出的配置,是 8×H100 张量并行才开得到 100 万上下文,8×H200 才到 360 万。这也是为什么直到今天,企业里部署量最大的开源权重模型仍然是 Llama 3.1 70B 和 Llama 3.3 70B,而不是 Llama 4。
许可上,Llama 全系走的是 Llama Community License,不符合 OSI 的开源定义,准确的说法是“开放权重”。月活超过 7 亿的产品必须单独向 Meta 申请授权、且 Meta 有权拒绝;界面和文档要显著标注 “Built with Llama”;基于它微调出来的模型名必须以 “Llama” 开头;多模态版本的授权还明确排除了主体位于欧盟的公司。这些条款不影响你在自己的机器上跑,只影响你怎么对外发布。而自建本身只有一个门槛,就是显存对不对得上——NexGPU 上从 $0.193/卡·时 的 RTX 3090 24GB 到 $6.660/卡·时 的 H200 141GB,按秒计费,不设起租量,不用提配额申请。
01 —
Llama 全系显存对照表
权重体积取自 Ollama 官方 tag 与 Unsloth 量化仓库的实测值,不是估算
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Llama 3.2 1B / 3B Instruct | 1B / 3B | Q4_K_M 808MB / 2.0GB;fp16 2.5GB / 6.4GB | 128K | 端侧与边缘档。3B 是目前最便宜的可用对话底座,Tesla T4 16GB 都能同时跑好几路,常拿来做意图识别、请求路由和结构化抽取这类不需要大脑子的活。 |
| Llama 3.1 8B Instruct | 8B | Q4_K_M 4.9GB;q8_0 8.5GB;fp16 16GB | 128K | 社区微调生态最厚的一档,LoRA 脚本、量化格式、推理后端全都拿它当默认目标。fp16 的 16GB 加 32K KV 缓存正好塞进 24GB 单卡,是自建 RAG 和微调实验的起点。 |
| Llama 3.2 11B / 90B Vision Instruct | 11B / 90B | 11B bf16 约 22GB;90B 需 64GB 以上 | 128K | 在 Llama 3.1 文本骨干上外挂视觉适配器做出来的多模态版本,适合 OCR、图表问答、票据与合同抽取。11B 那档 24GB 卡略紧、32GB 舒服,90B 基本要 80GB 起步。 |
| Llama 3.3 70B Instruct | 70B | Q4_K_M 43GB;q8_0 75GB;fp16 141GB | 128K | 2024 年 12 月发布,用 70B 的体积摸到了 Llama 3.1 405B 的水平,是整个开源权重阵营里被部署得最多的一个,20 多家 API 厂商在托管它。新项目要自建 Llama,默认就选它。 |
| Llama 4 Scout 17B-16E Instruct | 17B 激活 / 109B 总参 | INT4 约 55GB;IQ1_S 33.8GB;Q2_K_XL 42.2GB;Q4_K_XL 65.6GB;bf16 约 210GB | 标称 10M,实际取决于 KV 缓存 | 首个原生多模态的 Llama。Meta 宣称 INT4 可单卡 H100,实测装得进但 KV 缓存很快见底;社区还反馈超过 300 万 token 会静默挂起,而且这个模型不支持 torch.compile。 |
| Llama 4 Maverick 17B-128E Instruct FP8 | 17B 激活 / 400B 总参 | FP8 约 400GB;IQ1_S 122GB;Q2_K_XL 151GB;Q4_K_XL 243GB | 1M(8×H100 实开到 430K) | Llama 系列顶配,官方直接提供 FP8 权重。注意它在 LMArena 上的高分来自一个从未公开的实验版本,公开权重实测排名要低得多,选型时别照着榜单下结论。 |
02 —
按场景选卡
显存对不上就是 OOM,下面每一条都按权重加 KV 缓存的真实占用来配
Llama 3.1 8B fp16 或 3.2 3B 单卡开发自测
RTX 3090 24GB$0.193/卡·时
8B 的 fp16 权重 16GB,剩下 8GB 给 32K KV 缓存正好够,是能完整跑 Llama 8B 全精度的最便宜一档。
Llama 3.3 70B 走 AWQ 或 Q4_K_M 做生产推理
A100 PCIE 80GB$0.824/卡·时
Q4 权重 43GB,只有 80GB 单卡才留得出足够 KV 缓存跑并发;48GB 的 A6000 只够短上下文单路对话。
Llama 3.3 70B fp16 全精度推理或 LoRA 微调
A100 SXM4 80GB ×2$1.088/卡·时
fp16 权重就要 141GB,双卡 160GB 才装得下,SXM4 的 NVLink 让张量并行不被 PCIe 带宽卡住。
Llama 4 Scout INT4 跑长上下文
H200 141GB$6.660/卡·时
55GB 权重之外还剩 86GB 全给 KV 缓存,是唯一能单卡把 Scout 上下文拉到几十万 token 的选择。
03 —
四步把 Llama 跑起来
以 Llama 3.3 70B 单卡 A100 80GB 为例,vLLM 与 Ollama 两条路都给
- 01
开实例,直接选预置镜像
在 console.nexgpu.net 按上面的表选卡,用预置的 vLLM 或 PyTorch 镜像开机,省掉 CUDA、驱动、PyTorch 三方版本对齐这一整轮折腾。2,000+ 镜像里 vLLM、PyTorch、Ollama 都是现成的。开机后 SSH、Jupyter、网页终端任选一个进去先确认卡在。
nvidia-smi && python -c 'import vllm; print(vllm.__version__)' - 02
拿权重,注意 meta-llama 是 gated 仓库
meta-llama 组织下所有 Llama 仓库都要先在 Hugging Face 页面上手动接受 Llama Community License,审批通过后才能用 token 拉取——这一步卡住过很多人,脚本里报 401 基本都是没接受协议。70B 的 fp16 权重约 141GB,Q4 约 43GB,拉之前先确认磁盘。
hf auth login && hf download meta-llama/Llama-3.3-70B-Instruct --local-dir /workspace/llama-3.3-70b - 03
起 vLLM,别把上下文开满
单卡 80GB 跑 70B 要走 4-bit AWQ,权重压到 40GB 左右。最关键的一条是别把 --max-model-len 开到 128K:KV 缓存按上下文长度线性吃显存,你开满它就在启动时把剩余显存全预留掉,然后直接 OOM。绝大多数业务 32K 足够。起来后是标准 OpenAI 兼容接口。
vllm serve casperhansen/llama-3.3-70b-instruct-awq --max-model-len 32768 --gpu-memory-utilization 0.92 --port 8000 - 04
只想先看效果,就用 Ollama
不做并发、只想验证模型行不行,Ollama 比 vLLM 省事得多,GGUF 权重自动下载。llama3.3 的默认标签就是 70B 的 Q4_K_M,43GB;想省钱先试小的,换成 llama3.1:8b 只有 4.9GB,RTX 3090 上秒开。跑 Llama 4 Scout 则要 8 卡张量并行,单机 14 卡的节点放得下。
curl -fsSL https://ollama.com/install.sh | sh && ollama run llama3.3:70b-instruct-q4_K_M
一个月跑 Llama 3.3 70B 到底多少钱
按 A100 PCIE 80GB $0.824/卡·时 算一套 Llama 3.3 70B 的 AWQ 4-bit 推理服务。开发期每天开 8 小时:8 × $0.824 = $6.592/天,一个月 22 个工作日就是 22 × $6.592 = $145.02。权重 43GB 加镜像和数据集按 60GB 存储算,60 × $0.414 = $24.84/月,合计约 $169.86。如果要 7×24 常驻对外提供服务:730 × $0.824 = $601.52,加存储 $24.84,约 $626.36/月。想再压一档成本,Llama 3.1 8B 用 RTX 3090 24GB 常驻,730 × $0.193 = $140.89/月,跑 fp16 全精度还有余量。计费按秒结算、按小时定价,没有起租量也没有开通费;实例一停计算费立刻停,只有存储会一直算到你把它销毁为止。
04 —
