跳到主要内容

开源权重大模型

Llama 本地部署,先算清显存这笔账

从 Llama 3.2 1B 的 808MB 到 Llama 4 Maverick 的 400GB FP8 权重,同一个名字背后是 500 倍的硬件差距。这页把每个变体的真实占用、部署命令、以及该租哪张卡一次讲清楚。

Llama 是 Meta 从 2023 年 2 月开始放出的开源权重系列,一路走到 2025 年 4 月 5 日的 Llama 4 Scout 与 Maverick。有件事得先说清楚:Llama 4 之后 Meta 再没发布新的 Llama。2026 年 4 月,Meta Superintelligence Labs 转向了闭源权重的 Muse Spark,8 月又以 Apache 2.0 放出 30B 的 Muse Glimmer。命名线停在了 Llama 4,但权重一个没撤——Hugging Face 上 meta-llama 组织下的 Llama-4-Scout-17B-16E-Instruct、Llama-3.3-70B-Instruct 全都还能下载自建,而且生态比任何新模型都厚。

真正决定你选卡的是 Llama 4 的 MoE 结构。Scout 是 17B 激活参数、16 个专家、109B 总参数;Maverick 是 17B 激活、128 个专家、400B 总参数。推理时只算 17B,但显存里必须装下全部专家。所以官方那句“单卡 H100 就能跑 Scout”和“1000 万 token 上下文”是两个互相排斥的条件:vLLM 官方博客给出的配置,是 8×H100 张量并行才开得到 100 万上下文,8×H200 才到 360 万。这也是为什么直到今天,企业里部署量最大的开源权重模型仍然是 Llama 3.1 70B 和 Llama 3.3 70B,而不是 Llama 4。

许可上,Llama 全系走的是 Llama Community License,不符合 OSI 的开源定义,准确的说法是“开放权重”。月活超过 7 亿的产品必须单独向 Meta 申请授权、且 Meta 有权拒绝;界面和文档要显著标注 “Built with Llama”;基于它微调出来的模型名必须以 “Llama” 开头;多模态版本的授权还明确排除了主体位于欧盟的公司。这些条款不影响你在自己的机器上跑,只影响你怎么对外发布。而自建本身只有一个门槛,就是显存对不对得上——NexGPU 上从 $0.193/卡·时 的 RTX 3090 24GB 到 $6.660/卡·时 的 H200 141GB,按秒计费,不设起租量,不用提配额申请。

01 —

Llama 全系显存对照表

权重体积取自 Ollama 官方 tag 与 Unsloth 量化仓库的实测值,不是估算

版本参数量显存上下文说明
Llama 3.2 1B / 3B Instruct1B / 3BQ4_K_M 808MB / 2.0GB;fp16 2.5GB / 6.4GB128K端侧与边缘档。3B 是目前最便宜的可用对话底座,Tesla T4 16GB 都能同时跑好几路,常拿来做意图识别、请求路由和结构化抽取这类不需要大脑子的活。
Llama 3.1 8B Instruct8BQ4_K_M 4.9GB;q8_0 8.5GB;fp16 16GB128K社区微调生态最厚的一档,LoRA 脚本、量化格式、推理后端全都拿它当默认目标。fp16 的 16GB 加 32K KV 缓存正好塞进 24GB 单卡,是自建 RAG 和微调实验的起点。
Llama 3.2 11B / 90B Vision Instruct11B / 90B11B bf16 约 22GB;90B 需 64GB 以上128K在 Llama 3.1 文本骨干上外挂视觉适配器做出来的多模态版本,适合 OCR、图表问答、票据与合同抽取。11B 那档 24GB 卡略紧、32GB 舒服,90B 基本要 80GB 起步。
Llama 3.3 70B Instruct70BQ4_K_M 43GB;q8_0 75GB;fp16 141GB128K2024 年 12 月发布,用 70B 的体积摸到了 Llama 3.1 405B 的水平,是整个开源权重阵营里被部署得最多的一个,20 多家 API 厂商在托管它。新项目要自建 Llama,默认就选它。
Llama 4 Scout 17B-16E Instruct17B 激活 / 109B 总参INT4 约 55GB;IQ1_S 33.8GB;Q2_K_XL 42.2GB;Q4_K_XL 65.6GB;bf16 约 210GB标称 10M,实际取决于 KV 缓存首个原生多模态的 Llama。Meta 宣称 INT4 可单卡 H100,实测装得进但 KV 缓存很快见底;社区还反馈超过 300 万 token 会静默挂起,而且这个模型不支持 torch.compile。
Llama 4 Maverick 17B-128E Instruct FP817B 激活 / 400B 总参FP8 约 400GB;IQ1_S 122GB;Q2_K_XL 151GB;Q4_K_XL 243GB1M(8×H100 实开到 430K)Llama 系列顶配,官方直接提供 FP8 权重。注意它在 LMArena 上的高分来自一个从未公开的实验版本,公开权重实测排名要低得多,选型时别照着榜单下结论。

02 —

按场景选卡

显存对不上就是 OOM,下面每一条都按权重加 KV 缓存的真实占用来配

  • Llama 3.1 8B fp16 或 3.2 3B 单卡开发自测

    RTX 3090 24GB$0.193/卡·时

    8B 的 fp16 权重 16GB,剩下 8GB 给 32K KV 缓存正好够,是能完整跑 Llama 8B 全精度的最便宜一档。

  • Llama 3.3 70B 走 AWQ 或 Q4_K_M 做生产推理

    A100 PCIE 80GB$0.824/卡·时

    Q4 权重 43GB,只有 80GB 单卡才留得出足够 KV 缓存跑并发;48GB 的 A6000 只够短上下文单路对话。

  • Llama 3.3 70B fp16 全精度推理或 LoRA 微调

    A100 SXM4 80GB ×2$1.088/卡·时

    fp16 权重就要 141GB,双卡 160GB 才装得下,SXM4 的 NVLink 让张量并行不被 PCIe 带宽卡住。

  • Llama 4 Scout INT4 跑长上下文

    H200 141GB$6.660/卡·时

    55GB 权重之外还剩 86GB 全给 KV 缓存,是唯一能单卡把 Scout 上下文拉到几十万 token 的选择。

03 —

四步把 Llama 跑起来

以 Llama 3.3 70B 单卡 A100 80GB 为例,vLLM 与 Ollama 两条路都给

  1. 01

    开实例,直接选预置镜像

    在 console.nexgpu.net 按上面的表选卡,用预置的 vLLM 或 PyTorch 镜像开机,省掉 CUDA、驱动、PyTorch 三方版本对齐这一整轮折腾。2,000+ 镜像里 vLLM、PyTorch、Ollama 都是现成的。开机后 SSH、Jupyter、网页终端任选一个进去先确认卡在。

    nvidia-smi && python -c 'import vllm; print(vllm.__version__)'
  2. 02

    拿权重,注意 meta-llama 是 gated 仓库

    meta-llama 组织下所有 Llama 仓库都要先在 Hugging Face 页面上手动接受 Llama Community License,审批通过后才能用 token 拉取——这一步卡住过很多人,脚本里报 401 基本都是没接受协议。70B 的 fp16 权重约 141GB,Q4 约 43GB,拉之前先确认磁盘。

    hf auth login && hf download meta-llama/Llama-3.3-70B-Instruct --local-dir /workspace/llama-3.3-70b
  3. 03

    起 vLLM,别把上下文开满

    单卡 80GB 跑 70B 要走 4-bit AWQ,权重压到 40GB 左右。最关键的一条是别把 --max-model-len 开到 128K:KV 缓存按上下文长度线性吃显存,你开满它就在启动时把剩余显存全预留掉,然后直接 OOM。绝大多数业务 32K 足够。起来后是标准 OpenAI 兼容接口。

    vllm serve casperhansen/llama-3.3-70b-instruct-awq --max-model-len 32768 --gpu-memory-utilization 0.92 --port 8000
  4. 04

    只想先看效果,就用 Ollama

    不做并发、只想验证模型行不行,Ollama 比 vLLM 省事得多,GGUF 权重自动下载。llama3.3 的默认标签就是 70B 的 Q4_K_M,43GB;想省钱先试小的,换成 llama3.1:8b 只有 4.9GB,RTX 3090 上秒开。跑 Llama 4 Scout 则要 8 卡张量并行,单机 14 卡的节点放得下。

    curl -fsSL https://ollama.com/install.sh | sh && ollama run llama3.3:70b-instruct-q4_K_M

一个月跑 Llama 3.3 70B 到底多少钱

按 A100 PCIE 80GB $0.824/卡·时 算一套 Llama 3.3 70B 的 AWQ 4-bit 推理服务。开发期每天开 8 小时:8 × $0.824 = $6.592/天,一个月 22 个工作日就是 22 × $6.592 = $145.02。权重 43GB 加镜像和数据集按 60GB 存储算,60 × $0.414 = $24.84/月,合计约 $169.86。如果要 7×24 常驻对外提供服务:730 × $0.824 = $601.52,加存储 $24.84,约 $626.36/月。想再压一档成本,Llama 3.1 8B 用 RTX 3090 24GB 常驻,730 × $0.193 = $140.89/月,跑 fp16 全精度还有余量。计费按秒结算、按小时定价,没有起租量也没有开通费;实例一停计算费立刻停,只有存储会一直算到你把它销毁为止。

04 —

常见问题

Llama 还在更新吗?现在自建应该选哪个版本?

Llama 这条线停在 2025 年 4 月的 Llama 4,之后 Meta 转向了闭源的 Muse Spark 和 Apache 2.0 的 Muse Glimmer 30B。但停更不等于不能用:Llama 3.1 70B 和 3.3 70B 至今仍是企业里部署量最大的开源权重模型,工具链、微调脚本、量化格式全都成熟稳定,反而比追新省心。新项目建议直接上 Llama 3.3 70B,除非你确实要 Llama 4 的原生多模态或超长上下文。两条路 NexGPU 上都有对应的卡:3.3 70B 用 A100 PCIE 80GB $0.824/卡·时,Llama 4 Scout 用 H200 141GB。

Llama 3.3 70B 需要多大显存?24GB 的 4090 能跑吗?

单卡跑不了。Q4_K_M 量化后权重就是 43GB,q8_0 是 75GB,fp16 是 141GB——24GB 的 4090 连 Q4 权重都装不下,除非降到 q2_K 的 26GB 再配 CPU offload,那时候质量损失已经不值当了。老实的配置是 48GB 以上单卡,或者双 24GB 卡张量并行。在 NexGPU 上,A100 PCIE 80GB $0.824/卡·时 单卡就够,比拼两张 4090($0.540 × 2 = $1.080/时)还便宜,也不用折腾并行配置。

Llama 4 Scout 号称单卡 H100 就能跑,1000 万上下文是真的吗?

权重装得下和上下文开得起来是两回事。Scout INT4 量化后约 55GB,理论上塞得进 80GB 的 H100,但剩下的显存全给 KV 缓存也就撑几万 token。vLLM 官方给出的配置是 8×H100 张量并行才开得到 100 万 token,8×H200 才到 360 万,社区还反馈超过 300 万会静默挂起。要单卡把 Scout 推到几十万上下文,只有 H200 141GB 这一档能做到,NexGPU 上是 $6.660/卡·时,按秒计费,测完就停,不用为一次验证买张卡。

Llama 私有化部署有商用限制吗?

有,而且不是标准开源协议。Llama Community License 规定:月活超过 7 亿的产品必须单独向 Meta 申请授权且 Meta 可自行决定是否批准;界面和文档要显著标注 “Built with Llama”;用它微调出的模型名必须以 “Llama” 开头;多模态版本(Llama 3.2 Vision、Llama 4)的授权明确不授予主体位于欧盟的公司。绝大多数企业内部私有化部署碰不到这些红线。合规判断归你,算力归我们——NexGPU 覆盖 51 个国家和地区、1,175 个已验证可租节点,可以按数据落地要求挑地区。

Llama 4 的 MoE 为什么不省显存?17B 激活参数不是很小吗?

激活参数省的是算力,不是显存。Scout 每次前向只算 17B,但 16 个专家的 109B 权重必须全部常驻显存,因为下一个 token 可能路由到任何一个专家。Maverick 更极端,128 个专家、400B 总参数,FP8 权重约 400GB。所以 MoE 的吞吐很好看、显存账很难看。真要压到单卡,得用 Unsloth 那种动态低比特量化(Scout IQ1_S 33.8GB、Maverick IQ1_S 122GB),再把专家层甩给 CPU。这类实验在 NexGPU 上开一台 RTX A6000 48GB($0.817/卡·时)试半小时就有结论。

用 Llama 做 LoRA 微调,该租什么卡?

看模型大小。Llama 3.1 8B 的 LoRA,fp16 权重 16GB 加上优化器状态和梯度,24GB 单卡够用,RTX 4090 24GB $0.540/卡·时 最划算,想把 batch 开大就上 RTX 5090 32GB $0.723/卡·时。70B 的 LoRA 要 fp16 的 141GB 权重打底,双 A100 SXM4 80GB($1.088/卡·时)起步,NVLink 对张量并行的收益很明显。NexGPU 单节点最多 14 张卡、最大 2,152GB 显存,全参微调也放得下,PyTorch 镜像开箱即用,SSH、Jupyter、REST API、CLI 随你接,支持是 Telegram 上的中英双语人工,不用排工单。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。