跳到主要内容

开源文本大模型

Mistral 本地部署:先把显存账算明白,再决定租哪张卡

Ministral 3 8B 的 Q4_K_M 只要 5.2GB,Mistral Small 4 的 FP8 权重要 119GB,Mistral Large 3 要一整个 8 卡节点。同一个品牌,显存跨度差两个数量级——这一页把每一档都摆出来,再给你对应的机器。

Mistral 现在的开源阵容比它 2023 年靠一个 7B 出名的时候复杂得多,而且几乎全是 Apache 2.0。2025 年 12 月 2 日的 Mistral 3 发布一次性放出了 Mistral Large 3(675B 总参 / 41B 激活的稀疏 MoE,外挂 2.5B 视觉编码器)和 Ministral 3 的 3B / 8B / 14B 三个尺寸,每个尺寸各自带 Base、Instruct、Reasoning 三套权重;一周后 Devstral 2(123B)与 Devstral Small 2(24B)补上编码 Agent;2026 年 3 月 16 日的 Mistral Small 4 则是当前的主力通用款。全系 256K 上下文、原生看图。

自己部署最容易踩的坑是名字:Mistral Small 已经不是那个 24B 单卡模型了。Mistral Small 4 是 119B 总参、6.5B 激活的 MoE(128 个专家选 4 个),官方最低配置就是 2 张 H200 级别的卡,24GB 显存连它的 Q2 量化都装不下。老的 Mistral Small 3.2 24B-2506 与 Magistral Small 2509 都在 2026 年 4 月 30 日停用,magistral-small-latest 现在直接解析到 Mistral Small 4;Pixtral 12B 已退役,视觉能力并入 Small 4 与 Medium 3.5。想要单卡的,现在该看的是 Ministral 3 14B 和 Devstral Small 2 24B。另一类坑在数据格式:Mistral 官方权重大量以 FP8 E4M3 分发,而 A100、V100、3090 这些 Ampere 及更早的卡没有原生 FP8,硬跑只能退回 bf16,显存直接翻倍。

NexGPU 把这两头都覆盖了。最便宜的 RTX 3090 24GB 只要 $0.193/卡·时,足够把 Ministral 3 14B 的 Q4_K_M 连同长上下文的 KV Cache 一起装下;最重的 H200 141GB 单节点最多可以开到 14 卡、2,152GB 显存,Mistral Large 3 的 FP8 全量权重一次 TP=8 就位,不用跨节点。全网 51 个国家和地区、1,175 个已验证可租节点、2,498 张 GPU、75 种卡型,2,000+ 预置镜像里就有 vLLM 和 PyTorch,SSH、Jupyter、Web 终端、REST API、CLI 随便挑。按秒计量、按小时计价,没有起租时长、没有开通费、不用提配额申请。

01 —

Mistral 全系开源权重与显存对照

只列现在还值得部署的版本,以及已经停用、别再入坑的那几个。

版本参数量显存上下文说明
Mistral-Small-4-119B-2603119B 总参 / 6.5B 激活(128 专家选 4)bf16 ~238GB / FP8 ~119GB / NVFP4 ~72GB / GGUF UD-Q4_K_M 73.8GB / UD-Q3_K_M 54.4GB / UD-Q2_K_XL 40.2GB256K2026 年 3 月 16 日发布的当前主力,Apache 2.0。把原来分散的 Magistral 推理、Pixtral 视觉、Devstral 编码三条线合并进一个权重,请求级 reasoning_effort 只接受 none 或 high。官方最低 2×H200 / 2×B200 / 2×MI300X。
Mistral-Large-3-675B-Instruct-2512675B 总参 / 41B 激活 + 2.5B 视觉编码器FP8 权重 ~675GB(官方推荐单个 8×H200 节点);NVFP4 量化可下探到 8×H100 或 8×A100 单节点;另有 BF16 版本256K目前主流实验室里最大的开源权重 MoE,Apache 2.0,vLLM 建议 --tensor-parallel-size 8。官方自己也承认它不是为纯推理任务调优的,纯视觉任务打不过专门的视觉模型。
Ministral 3(3B / 8B / 14B,均为 -2512)8B 版为 8.4B 语言模型 + 0.4B 视觉编码器;每个尺寸都有 Base / Instruct / Reasoning 三套权重8B:Q4_K_M 5.2GB / Q5_K_M 6.06GB / Q8_0 9.03GB / BF16 17GB;14B:Q4_K_M 8.24GB / Q8_0 14.4GB / BF16 27GB。8B FP8 约 12GB,14B FP8 可塞进 24GB 卡256KApache 2.0,40+ 语言、原生看图。14B Reasoning 在 AIME '25 上到 85%。这是单卡自部署的甜点位,Instruct 官方建议 temperature 压到 0.15 甚至 0.1。
Devstral-Small-2-24B-Instruct-251224B 稠密FP8 ~25GB(官方主分发格式)/ bf16 ~48GB256KApache 2.0 的编码 Agent,SWE-bench Verified 68.0%、SWE-bench Multilingual 55.7%、Terminal-Bench 2 22.5%。架构与 Ministral 3 同源,带视觉,配 Mistral Vibe CLI 或 OpenHands 用。
Devstral-2(123B)与 Mistral-Medium-3.5-128BDevstral 2 为 123B 稠密;Medium 3.5 为 128B 稠密Devstral 2 约 128GB 可跑;Medium 3.5 官方示例用 --tensor-parallel-size 8256K这两个是 Modified MIT 而不是 Apache 2.0——月营收 2,000 万美元以下可自由商用,超过要另谈。Devstral 2 在 SWE-bench Verified 上 72.2%,Medium 3.5 已经把 Devstral 2 的编码能力也吸收进去了。
已停用 / 退役:Mistral 7B v0.3、Mixtral、Mistral Small 3.2 24B-2506、Magistral Small 2509、Pixtral 12B7B / 8x7B / 24B / 12BMistral 7B 的 Q4 量化可以塞进 6GB 卡;Mistral Small 3.2 24B 的 bf16/fp16 约需 55GB,Q4_K_M 约 18.9GBMistral 7B 为 32K,Mistral Small 3.2 为 128KMistral Small 3.2 与 Magistral Small 2509 均在 2026-04-30 停用,官方明确让新集成改用 Mistral Small 4;Magistral Small 2509 于 2026-07-31 正式下线。权重还留在 Hugging Face 上,自己跑没人拦你,但别拿它做新项目的基线。Mistral 7B 现在只在 6–8GB 老卡这种极端场景下还有意义。

02 —

按配置选卡:NexGPU 实时可租机型

显存对得上才推荐,不会把 675B 的活儿塞给一张 24GB 的卡。

  • Ministral 3 8B / 14B 跑 Q4_K_M 量化,做本地评估、RAG、批量抽取

    RTX 3090 24GB$0.193/卡·时

    8B 的 Q4_K_M 才 5.2GB、14B 才 8.24GB,24GB 显存剩下的一大半全留给长上下文的 KV Cache,这是全站最便宜的一张能真干活的卡。

  • Devstral Small 2 24B 用官方 FP8 权重跑编码 Agent,或 Ministral 3 14B 上 bf16

    RTX 5090 32GB$0.723/卡·时

    FP8 权重约 25GB,24GB 卡差一口气、48GB 又浪费,而 5090 是 Blackwell 架构、原生支持 FP8 与 FP4,不用退回 bf16 把显存占用翻倍。

  • Mistral Small 4 119B 用官方 FP8 权重上 vLLM 做生产推理

    H100 SXM 80GB ×2$3.582/卡·时(两卡合计 $7.164/时)

    FP8 权重约 119GB,TP=2 的 160GB 刚好装下,Hopper 也原生吃 FP8;官方提示 256K 满上下文容易 OOM,把 --max-model-len 降到 131072 就稳了,要跑满 256K 就换成 2×H200 141GB($6.660/卡·时)。

  • Mistral Large 3 675B FP8 单节点全量部署

    H200 141GB ×8$6.660/卡·时(八卡合计 $53.28/时)

    官方推荐配置就是单个 8×H200 节点跑 FP8 权重,而 NexGPU 单节点最多 14 卡、2,152GB 显存,TP=8 一次开够,不必跨节点拼 NCCL。

03 —

四步把 Mistral 跑起来

以 vLLM 为例,llama.cpp / Ollama / LM Studio 走 GGUF 那条路更省事。

  1. 01

    开一台带 vLLM 的实例

    在 console.nexgpu.net 按上表选卡,镜像直接挑预置的 vLLM 或 PyTorch,2,000+ 镜像里都有。开机后 SSH、Jupyter、Web 终端任选。注意 vLLM 要 0.20.0 或更高,才带 --reasoning-parser mistral 和 --tool-call-parser mistral;版本低了官方给的替代方案是 mistralllm/vllm-ms4 镜像。

    pip install -U "vllm>=0.20.0" mistral_common
  2. 02

    拉权重

    Mistral 官方仓库在 Hugging Face 的 mistralai 组织下。Apache 2.0 的那些(Small 4、Large 3、Ministral 3、Devstral Small 2、Leanstral 1.5、Shieldstral 1.0)直接下,不用签协议。想省显存就先拉 NVFP4 或 GGUF 版本,别默认拉 bf16。

    hf download mistralai/Devstral-Small-2-24B-Instruct-2512 --local-dir ./devstral-small-2
  3. 03

    起 vLLM 服务

    Mistral 格式的权重要显式声明 tokenizer 与 config 格式,否则会走 HF 的 chat template,工具调用大概率解析不出来。带 Agent 用途的一定要开 --enable-auto-tool-choice,Small 4 这类带推理开关的再加 --reasoning-parser mistral,请求里的 reasoning_effort 只认 none 和 high 两个值。

    vllm serve mistralai/Mistral-Small-4-119B-2603 --max-model-len 131072 --tensor-parallel-size 2 --tool-call-parser mistral --enable-auto-tool-choice --reasoning-parser mistral --max-num-batched-tokens 16384 --max-num-seqs 128 --gpu-memory-utilization 0.8
  4. 04

    验证并接入

    vLLM 起的是 OpenAI 兼容端点,把 base_url 指过来就能替换掉原来的 API 调用。跑 GGUF 的话一行 llama.cpp 也能直接起带 Web UI 的本地服务,适合先在便宜卡上验证效果再决定要不要上大机器。

    llama serve -hf unsloth/Ministral-3-14B-Instruct-2512-GGUF:Q4_K_XL --jinja -ngl 99 --ctx-size 32768 --temp 0.15

这笔账到底多少钱

算一个真实场景:一个五人后端团队用 Devstral Small 2 24B 的 FP8 权重做代码审查和补丁生成,跑在 RTX 5090 32GB 上。每天开机 6 小时、一个月 20 个工作日,就是 120 小时;120 × $0.723 = $86.76。权重加镜像缓存按 60GB 常驻算,60 × $0.414 = $24.84/月。合计约 $111.60/月,一台机器供全组用。再看重的那头:Mistral Small 4 119B 用 2 张 H100 SXM 80GB,2 × $3.582 = $7.164/时,跑一轮 40 分钟的批量评测就是 0.667 × $7.164 ≈ $4.78——按秒计量、按小时计价,停机的那一秒计算费用就停了,只有存储会继续算到你把它销毁为止。对照 Mistral 官方 API 的 Small 4 定价 $0.15/百万输入 token、$0.60/百万输出 token,你可以直接用自己的实际吞吐量算出交叉点在哪里;数据不能出境、要长期高并发、或者要在权重上做微调的场景,自部署几乎总是赢的那一边。没有起租时长、没有开通费、不用提配额申请。

04 —

常见问题

Mistral 本地部署到底需要多大显存?

看你说的是哪个 Mistral。Ministral 3 8B 的 Q4_K_M 只要 5.2GB、BF16 要 17GB;14B 的 Q4_K_M 8.24GB、BF16 27GB。Devstral Small 2 24B 的 FP8 约 25GB、bf16 约 48GB。Mistral Small 4 119B 的 NVFP4 要 72GB、FP8 要 119GB、bf16 要 238GB。Mistral Large 3 675B 的 FP8 权重接近 675GB,得一整个 8 卡节点。NexGPU 从 $0.193/卡·时 的 RTX 3090 24GB 一路到 8×H200 141GB 都能按秒开,先在便宜卡上验证量化版本,效果满意再往上换机器。

Mistral Small 4 能用一张 24GB 的 4090 跑吗?

不能,而且差得远。Mistral Small 4 是 119B 总参的 MoE,激活参数虽然只有 6.5B,但全部专家权重都要常驻显存——最激进的 GGUF UD-Q2_K_XL 也要 40.2GB,UD-IQ1_M 都还有 32.3GB,质量已经不值得看了。想单卡就换模型:Ministral 3 14B 或 Devstral Small 2 24B 才是为单卡设计的。真要跑 Small 4,NexGPU 的 2×H100 SXM 80GB($3.582/卡·时)或 2×H200 141GB($6.660/卡·时)是正路。

Mistral Small 3.2 和 Magistral 还能用吗?

Mistral Small 3.2 24B-2506 与 Magistral Small 2509 都在 2026 年 4 月 30 日被标记停用,官方文档直接写明新集成请改用 Mistral Small 4,Magistral Small 2509 在 2026 年 7 月 31 日正式下线,magistral-small-latest 现在解析到 Mistral Small 4。Pixtral 12B 也已退役,视觉能力并入 Small 4 与 Medium 3.5。开源权重还挂在 Hugging Face 上,你自己部署不受影响,NexGPU 上一张 A100 PCIE 80GB($0.824/卡·时)跑 Small 3.2 的 bf16 绰绰有余——但新项目别拿它当基线。

A100 或 V100 能跑 Mistral 的 FP8 权重吗?

不能原生跑。A100 是 Ampere(sm80),Tesla V100 更老,都没有 FP8 张量核心;Mistral 从 Ministral 3 开始把 FP8 E4M3 当主分发格式,落到这些卡上只能反量化回 bf16,显存占用直接翻倍,速度也拿不到 FP8 的好处。要吃 FP8 就得 Ada 以上:RTX 4090 24GB($0.540/卡·时)、RTX 5090 32GB($0.723,Blackwell,连 NVFP4 也原生支持)、H100 SXM 80GB($3.582)、H200 141GB($6.660)。A100 80GB(PCIE $0.824 / SXM4 $1.088)更适合跑 bf16 或 GPTQ/AWQ 的 INT4 权重,NexGPU 这几种卡都在同一个控制台里,换一台重开就行。

vLLM 跑 Mistral 老是报错或者工具调用解析不出来,怎么办?

四个高频原因。一是 tokenizer:Mistral 格式的权重要加 --tokenizer_mode mistral --config_format mistral --load_format mistral,否则会去读 HF 的 chat template,而 Mistral 的模板在 chat_template.json 里、不在 tokenizer_config.json,工具调用就会断。二是版本:--reasoning-parser mistral 和 --tool-call-parser mistral 需要 vLLM 0.20.0 以上。三是上下文:Small 4 在 2×H200 上跑满 256K 都可能 OOM,把 --max-model-len 降到 131072 或 65536 立刻好。四是参数:reasoning_effort 只接受 none 或 high,传别的值会被拒。NexGPU 的预置 vLLM 镜像已经是新版本,开机就能直接 serve,卡在哪一步了就在 Telegram 上找我们,中英双语、没有工单队列。

想微调 Ministral 3 或 Devstral Small 2,该租什么卡?

Ministral 3 8B 做 QLoRA/LoRA,一张 RTX 4090 24GB($0.540/卡·时)就够,Unsloth 也提供了现成的 bnb-4bit 与 FP8 权重。14B 的 LoRA 建议上 RTX A6000 48GB($0.817/卡·时),全参微调或者 Devstral Small 2 24B 的 bf16 训练就走 A100 SXM4 80GB($1.088/卡·时)。数据集和 checkpoint 放持久化存储,$0.414/GB·月中位价,出网流量 $0.0081/GB 中位价;训练跑完停机,计算费用当场停止,存储费到你销毁为止。想同时开多卡做 FSDP,NexGPU 单节点最多 14 张卡、2,152GB 显存,一个节点内解决。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。