跳到主要内容

文本大模型 · 混合 Mamba-MoE

本地部署 Nemotron:从 30B-A3B 单卡起步,到 550B 八卡满配

NVIDIA 自家的开放权重模型族已经走到 Nemotron 3 与 3.5 Lightning。这一页把每个版本真实的显存占用、能跑起来的卡、以及自部署时必然踩的那几个坑,一次讲清楚。

先纠正一个常见误会:今天说的 Nemotron 不是 2024 年那个 Llama 微调系列。现役主线是 Nemotron 3 家族——Nano 30B-A3B、Super 120B-A12B、Ultra 550B-A55B,加上 2026 年 8 月放出的 Nemotron 3.5 Lightning 30B-A3B。它们的骨干是 Mamba-2 状态空间层、Transformer 注意力层和 MoE 层混合堆叠,以 Nano 为例:52 层里有 23 层 Mamba-2、23 层 MoE、只有 6 层是真正的注意力层,每个 MoE 层挂 128 个路由专家加 1 个共享专家,每 token 激活 6 个。这不是你熟悉的 dense Transformer,部署方式也因此不一样。

自部署 Nemotron 最容易翻车的地方是 MoE 命名。「30B-A3B」里的 A3B 指每 token 只激活约 3B 参数,所以推理算力很省、吐字很快,但显存必须按 30B 全量算——权重要整份装进卡里,激活稀疏并不省显存。真实数字是:Nemotron 3 Nano 30B-A3B 的 BF16 权重约 60GB,Q8 约 36GB,Q4_K_M 约 21GB;3.5 Lightning 的官方 NVFP4 检查点仓库约 21.6GB,社区 GGUF 的 UD-Q4-K-XL 约 20GB。谁要是照着「3B 模型」去配一张 8GB 卡,开机就是 OOM。

另一个被低估的点是上下文。Nemotron 3 全系原生支持到 1M token,但 Nano 的默认配置只开到 256K,原因写在模型卡里:显存不够。混合架构里 Mamba 层维护的是 SSM 状态缓存、注意力层维护的是 KV 缓存,两套缓存都随并发和序列长度涨。所以「权重塞得下」和「服务跑得动」是两件事,选卡时要给缓存留够余量——这也是我们下面每一档都往上留一档的原因。NexGPU 上 RTX 5090 32GB $0.723/卡·时、A100 PCIE 80GB $0.824/卡·时,按秒计费,先开一小时验证显存够不够,比买卡试错便宜太多。

01 —

Nemotron 现役版本与显存对照

官方检查点均托管在 Hugging Face 的 nvidia 组织下,代码与部署 cookbook 在 github.com/NVIDIA-NeMo/Nemotron

版本参数量显存上下文说明
NVIDIA-Nemotron-3.5-Lightning-30B-A3B30B-A3B(30B 总参 / 3B 激活)NVFP4 ≈21.6GB · GGUF UD-Q4-K-XL ≈20GB · Q8 ≈33GB · BF16 ≈60GB1M2026 年 8 月发布,专为「常驻型 Agent 的执行层」调优——工具调用、结果校验、批量例行操作,官方称输出速度可达同级模型的 4 倍,PinchBench 86%。随包附带 MTP 以及 DFlash/DSpark 草稿模型做投机解码。许可证是 OpenMDW-1.1,权重、训练数据与配方一并公开,是全系里最宽松的一档。NVFP4 版本能塞进一张 RTX 5090。
NVIDIA-Nemotron-3-Nano-30B-A3B(BF16/FP8/NVFP4)30B-A3B(约 31.6B 总参 / 约 3.5B 激活)BF16 ≈60GB · Q8 ≈36GB · Q4_K_M ≈21GB1M 原生,默认配置 256K2025 年 12 月发布的推理基线款,也是整个 Nemotron 3 家族里资料最全、社区量化最多的一版。默认开启思考模式,可用 chat template 的 enable_thinking=False 关掉,还能用 reasoning_budget 限制思维链长度。支持 transformers 5.3.0+、vLLM 0.12.0+、TensorRT-LLM、SGLang 与 llama.cpp。支持英、西、法、德、意、日六种语言。
Nemotron-3-Nano-Omni-30B-A3B-Reasoning30B-A3B 多模态(约 31B 总参 / 约 3B 激活)NVFP4 ≈18–22GB · FP8 ≈35–40GB · BF16 60GB+(尚未计入多模态输入与 KV 缓存)1M2026 年 4 月发布,把视频、音频、图像、文本统一进同一个骨干,做企业问答、摘要、转写和文档智能。要点是:显存要在文本基线上再加多模态 token 的开销,24GB 只够短上下文纯文本试玩,真正跑文档/视频/音频负载请按 40GB 以上准备。
NVIDIA-Nemotron-3-Super-120B-A12B-FP8120B-A12B(120B 总参 / 12B 激活)FP8 最低 2× H100 80GB;单张 B200/B300 可容纳(需调整张量并行)1M2026 年 3 月发布的生产主力,Latent MoE 变体,官方称吞吐是上一代 Super 的 5 倍,PinchBench 85.6%。内置 MTP 做投机解码,推理模式可开可关。官方建议 temperature=1.0、top_p=0.95 通吃所有任务。支持七种语言,其中包含中文——这是 Nano 没有的。许可证为 NVIDIA Nemotron Open Model License。
NVIDIA-Nemotron-3-Ultra-550B-A55B(BF16/NVFP4)550B-A55B(550B 总参 / 55B 激活)NVFP4 检查点 275GB → 8× H100 80GB 或 4× B200;BF16 约 1,100GB → 8× H200 或 16× H1001M2026 年 6 月发布,Artificial Analysis 智能指数 48 分,是当前美国开放权重的最强一档。vLLM 首日支持。注意一个陷阱:8× H200 合计 1,128GB,装完 1,100GB 的 BF16 权重只剩约 28GB 给全节点的 KV 缓存,实际批量根本跑不动——想上单节点就走 NVFP4。

02 —

按场景选卡:Nemotron 该租哪张

显存按「权重 + SSM 状态缓存 + KV 缓存」三份算,下面每一档都留了余量

  • 跑 3.5 Lightning 或 Nano 的 NVFP4/Q4 量化,做单卡评估与 Agent 原型

    RTX 5090 32GB$0.723/卡·时

    权重 20–21.6GB,32GB 恰好留出十来 GB 给混合缓存和并发,24GB 卡在这里会卡在上下文一开就爆的尴尬位置。

  • Nano Omni 的 4-bit/FP8 多模态部署,或 Nano 长上下文单卡服务

    RTX A6000 48GB$0.817/卡·时

    48GB 能同时装下 4-bit 多模态权重和视频/音频 token 撑起来的缓存,价格还比 A100 80GB 低。

  • Nemotron 3 Nano 或 3.5 Lightning 走 BF16 全精度,做微调基线或质量对照

    A100 PCIE 80GB$0.824/卡·时

    BF16 权重约 60GB,80GB 单卡装得下且余量够开长上下文,是全精度最省钱的整卡方案。

  • Nemotron 3 Super 120B-A12B FP8 上生产,对外提供推理服务

    H100 SXM 80GB ×2$3.582/卡·时

    官方最低配置就是 2× H100 80GB,SXM 互联带宽让 tensor-parallel-size 2 不至于被通信拖垮。

03 —

四步把 Nemotron 跑起来

以 3.5 Lightning NVFP4 单卡为例,Super/Ultra 只是并行度不同

  1. 01

    开一台带 vLLM 的实例

    在 NexGPU 控制台按上表选卡开机,直接选 vLLM 预置镜像,省掉自己装 CUDA 和编译 Mamba 内核的功夫。关键是版本:Nemotron 3 Nano 要 vLLM 0.12.0+,Super 的混合 SSM 内核要 0.17.1+,Ultra 官方用的是 v0.22.0 镜像。版本不够时光加 --trust-remote-code 是救不回来的,缺的是编译进去的内核。开机后 SSH 或网页终端进去先确认一下。

    nvidia-smi && python -c "import vllm; print(vllm.__version__)"
  2. 02

    拉权重

    从 Hugging Face 的 nvidia 组织拉对应精度的检查点。NVFP4 约 21.6GB,BF16 约 60GB,注意下载盘位——NexGPU 存储中位价 $0.414/GB·月,实例停机后计算费停、存储费继续,不用的权重记得清掉。

    hf download nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 --local-dir /workspace/lightning
  3. 03

    起服务,并且一定带上 SSM 缓存参数

    这是 Nemotron 自部署最经典的坑:混合架构里 Mamba-2 的状态缓存和 KV 缓存是两套东西,SSM 状态缓存无论权重什么精度都应该走 float32,否则输出质量会莫名其妙地掉。Nemotron 3 Super 的官方检查点已经把这个配置烤进去了,其他情况自己显式加上。如果启动时 CUDA OOM,先降 --max-num-seqs 再降 --max-model-len,模型卡的建议是先砍并发。另外别同时开 Mamba prefix caching 和 MTP 投机解码,这个组合在 NemotronH 系架构上会在 cudagraph profiling 阶段直接崩。

    vllm serve /workspace/lightning --mamba-ssm-cache-dtype float32 --max-model-len 131072 --max-num-seqs 16 --port 8000
  4. 04

    验证并按需关掉思考模式

    Nemotron 3 默认开启推理模式,做工具调用和高并发执行任务时通常要关掉,走 chat template 的 enable_thinking=False。采样参数按官方推荐:思考模式 temperature=0.6、top_p=0.95,纯指令执行可以压到 temperature=0.2;Super 则统一建议 temperature=1.0、top_p=0.95。接口是 OpenAI 兼容的,前端和 Agent 框架基本改个 base_url 就能接。

    curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"/workspace/lightning","messages":[{"role":"user","content":"用一句话解释 MoE 的 A3B"}],"temperature":0.6,"top_p":0.95,"chat_template_kwargs":{"enable_thinking":false}}'

把账算清楚:跑一次 Nemotron 要花多少

先算最常见的验证场景:3.5 Lightning NVFP4 单卡跑在 RTX 5090 32GB 上,$0.723/卡·时,一个通宵 8 小时的 Agent 回归评测是 0.723 × 8 = $5.784。要拿 BF16 做质量对照,A100 PCIE 80GB $0.824/卡·时,连开一整天是 0.824 × 24 = $19.776。上生产就换 Super:2 张 H100 SXM 80GB 是 3.582 × 2 = $7.164/时,一个 8 小时工作日 7.164 × 8 = $57.312,比自己买两张 H100 的门槛低了整整几个数量级。真要摸 Ultra 550B 的天花板,NVFP4 的 275GB 检查点需要 8 张 H100 SXM,3.582 × 8 = $28.656/时,跑两小时做能力评估是 $57.312——和上面那个 Super 工作日一个价。存储另算:BF16 的 60GB 权重按中位价 60 × 0.414 = $24.84/月,NVFP4 的 22GB 只要 22 × 0.414 = $9.108/月,实例停了存储还在计费,跑完记得销毁。全程按秒计量、按小时定价,没有起租时长、没有开通费、不用提配额申请。

04 —

常见问题

Nemotron 3 Nano 是 30B-A3B,是不是按 3B 模型配显卡就行?

不行,这是最常见的翻车点。A3B 指每 token 只激活约 3B 参数,省的是算力不是显存,全部 30B 权重必须整份驻留在卡上——BF16 约 60GB、Q8 约 36GB、Q4_K_M 约 21GB。微调时更要按 30B 的量级准备。想快速确认自己的配置够不够,在 NexGPU 开一台 RTX 5090 32GB($0.723/卡·时)跑量化版、或 A100 PCIE 80GB($0.824/卡·时)跑 BF16,一小时就有答案。

vLLM 起 Nemotron 报缺内核或输出质量异常,怎么排查?

先看版本:Nano 要 vLLM 0.12.0+,Super 的混合 SSM 内核要 0.17.1+,Ultra 官方镜像是 v0.22.0,版本不够时加 --trust-remote-code 没有用,缺的是编译进去的 Mamba 内核。质量异常八成是 SSM 状态缓存精度——加 --mamba-ssm-cache-dtype float32。另外 Mamba prefix caching 和 MTP 投机解码同时开会在启动阶段崩,先关一个。NexGPU 的 2,000+ 预置镜像里就有对版本的 vLLM,省掉一整轮环境排错。

Nemotron 3 Ultra 550B 私有化部署到底要几张卡?

看精度。NVFP4 检查点 275GB,官方给的配置是 8× H100 80GB 或 4× B200。BF16 约 1,100GB,需要 8× H200 或 16× H100——但 8× H200 合计只有 1,128GB,装完权重全节点只剩约 28GB 给 KV 缓存,实际并发跑不起来,所以单节点方案请直接走 NVFP4。NexGPU 单节点最高支持 14 张卡、节点最大显存 2,152GB,H100 SXM 80GB $3.582/卡·时、H200 141GB $6.660/卡·时,八卡整机可以直接开。

Nemotron 的开源许可证能商用吗?

Nemotron 3 全系(Nano/Super/Ultra/Nano Omni)走的是 NVIDIA Nemotron Open Model License,定位就是让企业能自己掌控数据、随处部署。2026 年 8 月的 3.5 Lightning 更宽松,用的是 OpenMDW-1.1,连训练数据和配方都一起放出来了。具体条款以你拉到的那个仓库里的 LICENSE 为准,不同档次不完全一样。权重合规之后剩下的就是算力,NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点,可以按数据落地要求挑地区。

我该选 Nemotron 3 Nano 还是 3.5 Lightning?

看你要它干什么。Nano 是推理基线款,社区量化最全、资料最多,适合做通用问答和需要长思维链的任务。3.5 Lightning 是为常驻 Agent 的执行层调的——工具调用、结果校验、大批量例行操作,官方称输出速度可到同级模型的 4 倍,还自带 DFlash/DSpark 草稿模型做投机解码,跑一万个任务比同级竞品快 30%。两个都是 30B-A3B,显存档位几乎一样,所以最省事的做法是在 NexGPU 上开同一张 RTX 5090 32GB,$0.723/卡·时,用你自己的评测集轮流跑一遍再定。

网上搜到的 Nemotron-4 340B 和现在说的 Nemotron 4 是一回事吗?

不是,这是个很容易踩的重名坑。Nemotron-4 340B 是 2024 年的老模型,而目前媒体报道中还在训练、参数量在万亿级别的新一代 Nemotron 4 尚未发布、也没有公开的权重和发布日期。今天能真正下载下来自部署的主线是 Nemotron 3 家族和 3.5 Lightning。等新一代放出权重,NexGPU 按秒计费、无起租门槛,当天就能开机验证显存够不够。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。