Mistral 现在的开源阵容比它 2023 年靠一个 7B 出名的时候复杂得多,而且几乎全是 Apache 2.0。2025 年 12 月 2 日的 Mistral 3 发布一次性放出了 Mistral Large 3(675B 总参 / 41B 激活的稀疏 MoE,外挂 2.5B 视觉编码器)和 Ministral 3 的 3B / 8B / 14B 三个尺寸,每个尺寸各自带 Base、Instruct、Reasoning 三套权重;一周后 Devstral 2(123B)与 Devstral Small 2(24B)补上编码 Agent;2026 年 3 月 16 日的 Mistral Small 4 则是当前的主力通用款。全系 256K 上下文、原生看图。
自己部署最容易踩的坑是名字:Mistral Small 已经不是那个 24B 单卡模型了。Mistral Small 4 是 119B 总参、6.5B 激活的 MoE(128 个专家选 4 个),官方最低配置就是 2 张 H200 级别的卡,24GB 显存连它的 Q2 量化都装不下。老的 Mistral Small 3.2 24B-2506 与 Magistral Small 2509 都在 2026 年 4 月 30 日停用,magistral-small-latest 现在直接解析到 Mistral Small 4;Pixtral 12B 已退役,视觉能力并入 Small 4 与 Medium 3.5。想要单卡的,现在该看的是 Ministral 3 14B 和 Devstral Small 2 24B。另一类坑在数据格式:Mistral 官方权重大量以 FP8 E4M3 分发,而 A100、V100、3090 这些 Ampere 及更早的卡没有原生 FP8,硬跑只能退回 bf16,显存直接翻倍。
NexGPU 把这两头都覆盖了。最便宜的 RTX 3090 24GB 只要 $0.193/卡·时,足够把 Ministral 3 14B 的 Q4_K_M 连同长上下文的 KV Cache 一起装下;最重的 H200 141GB 单节点最多可以开到 14 卡、2,152GB 显存,Mistral Large 3 的 FP8 全量权重一次 TP=8 就位,不用跨节点。全网 51 个国家和地区、1,175 个已验证可租节点、2,498 张 GPU、75 种卡型,2,000+ 预置镜像里就有 vLLM 和 PyTorch,SSH、Jupyter、Web 终端、REST API、CLI 随便挑。按秒计量、按小时计价,没有起租时长、没有开通费、不用提配额申请。
01 —
Mistral 全系开源权重与显存对照
只列现在还值得部署的版本,以及已经停用、别再入坑的那几个。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Mistral-Small-4-119B-2603 | 119B 总参 / 6.5B 激活(128 专家选 4) | bf16 ~238GB / FP8 ~119GB / NVFP4 ~72GB / GGUF UD-Q4_K_M 73.8GB / UD-Q3_K_M 54.4GB / UD-Q2_K_XL 40.2GB | 256K | 2026 年 3 月 16 日发布的当前主力,Apache 2.0。把原来分散的 Magistral 推理、Pixtral 视觉、Devstral 编码三条线合并进一个权重,请求级 reasoning_effort 只接受 none 或 high。官方最低 2×H200 / 2×B200 / 2×MI300X。 |
| Mistral-Large-3-675B-Instruct-2512 | 675B 总参 / 41B 激活 + 2.5B 视觉编码器 | FP8 权重 ~675GB(官方推荐单个 8×H200 节点);NVFP4 量化可下探到 8×H100 或 8×A100 单节点;另有 BF16 版本 | 256K | 目前主流实验室里最大的开源权重 MoE,Apache 2.0,vLLM 建议 --tensor-parallel-size 8。官方自己也承认它不是为纯推理任务调优的,纯视觉任务打不过专门的视觉模型。 |
| Ministral 3(3B / 8B / 14B,均为 -2512) | 8B 版为 8.4B 语言模型 + 0.4B 视觉编码器;每个尺寸都有 Base / Instruct / Reasoning 三套权重 | 8B:Q4_K_M 5.2GB / Q5_K_M 6.06GB / Q8_0 9.03GB / BF16 17GB;14B:Q4_K_M 8.24GB / Q8_0 14.4GB / BF16 27GB。8B FP8 约 12GB,14B FP8 可塞进 24GB 卡 | 256K | Apache 2.0,40+ 语言、原生看图。14B Reasoning 在 AIME '25 上到 85%。这是单卡自部署的甜点位,Instruct 官方建议 temperature 压到 0.15 甚至 0.1。 |
| Devstral-Small-2-24B-Instruct-2512 | 24B 稠密 | FP8 ~25GB(官方主分发格式)/ bf16 ~48GB | 256K | Apache 2.0 的编码 Agent,SWE-bench Verified 68.0%、SWE-bench Multilingual 55.7%、Terminal-Bench 2 22.5%。架构与 Ministral 3 同源,带视觉,配 Mistral Vibe CLI 或 OpenHands 用。 |
| Devstral-2(123B)与 Mistral-Medium-3.5-128B | Devstral 2 为 123B 稠密;Medium 3.5 为 128B 稠密 | Devstral 2 约 128GB 可跑;Medium 3.5 官方示例用 --tensor-parallel-size 8 | 256K | 这两个是 Modified MIT 而不是 Apache 2.0——月营收 2,000 万美元以下可自由商用,超过要另谈。Devstral 2 在 SWE-bench Verified 上 72.2%,Medium 3.5 已经把 Devstral 2 的编码能力也吸收进去了。 |
| 已停用 / 退役:Mistral 7B v0.3、Mixtral、Mistral Small 3.2 24B-2506、Magistral Small 2509、Pixtral 12B | 7B / 8x7B / 24B / 12B | Mistral 7B 的 Q4 量化可以塞进 6GB 卡;Mistral Small 3.2 24B 的 bf16/fp16 约需 55GB,Q4_K_M 约 18.9GB | Mistral 7B 为 32K,Mistral Small 3.2 为 128K | Mistral Small 3.2 与 Magistral Small 2509 均在 2026-04-30 停用,官方明确让新集成改用 Mistral Small 4;Magistral Small 2509 于 2026-07-31 正式下线。权重还留在 Hugging Face 上,自己跑没人拦你,但别拿它做新项目的基线。Mistral 7B 现在只在 6–8GB 老卡这种极端场景下还有意义。 |
02 —
按配置选卡:NexGPU 实时可租机型
显存对得上才推荐,不会把 675B 的活儿塞给一张 24GB 的卡。
Ministral 3 8B / 14B 跑 Q4_K_M 量化,做本地评估、RAG、批量抽取
RTX 3090 24GB$0.193/卡·时
8B 的 Q4_K_M 才 5.2GB、14B 才 8.24GB,24GB 显存剩下的一大半全留给长上下文的 KV Cache,这是全站最便宜的一张能真干活的卡。
Devstral Small 2 24B 用官方 FP8 权重跑编码 Agent,或 Ministral 3 14B 上 bf16
RTX 5090 32GB$0.723/卡·时
FP8 权重约 25GB,24GB 卡差一口气、48GB 又浪费,而 5090 是 Blackwell 架构、原生支持 FP8 与 FP4,不用退回 bf16 把显存占用翻倍。
Mistral Small 4 119B 用官方 FP8 权重上 vLLM 做生产推理
H100 SXM 80GB ×2$3.582/卡·时(两卡合计 $7.164/时)
FP8 权重约 119GB,TP=2 的 160GB 刚好装下,Hopper 也原生吃 FP8;官方提示 256K 满上下文容易 OOM,把 --max-model-len 降到 131072 就稳了,要跑满 256K 就换成 2×H200 141GB($6.660/卡·时)。
Mistral Large 3 675B FP8 单节点全量部署
H200 141GB ×8$6.660/卡·时(八卡合计 $53.28/时)
官方推荐配置就是单个 8×H200 节点跑 FP8 权重,而 NexGPU 单节点最多 14 卡、2,152GB 显存,TP=8 一次开够,不必跨节点拼 NCCL。
03 —
四步把 Mistral 跑起来
以 vLLM 为例,llama.cpp / Ollama / LM Studio 走 GGUF 那条路更省事。
- 01
开一台带 vLLM 的实例
在 console.nexgpu.net 按上表选卡,镜像直接挑预置的 vLLM 或 PyTorch,2,000+ 镜像里都有。开机后 SSH、Jupyter、Web 终端任选。注意 vLLM 要 0.20.0 或更高,才带 --reasoning-parser mistral 和 --tool-call-parser mistral;版本低了官方给的替代方案是 mistralllm/vllm-ms4 镜像。
pip install -U "vllm>=0.20.0" mistral_common - 02
拉权重
Mistral 官方仓库在 Hugging Face 的 mistralai 组织下。Apache 2.0 的那些(Small 4、Large 3、Ministral 3、Devstral Small 2、Leanstral 1.5、Shieldstral 1.0)直接下,不用签协议。想省显存就先拉 NVFP4 或 GGUF 版本,别默认拉 bf16。
hf download mistralai/Devstral-Small-2-24B-Instruct-2512 --local-dir ./devstral-small-2 - 03
起 vLLM 服务
Mistral 格式的权重要显式声明 tokenizer 与 config 格式,否则会走 HF 的 chat template,工具调用大概率解析不出来。带 Agent 用途的一定要开 --enable-auto-tool-choice,Small 4 这类带推理开关的再加 --reasoning-parser mistral,请求里的 reasoning_effort 只认 none 和 high 两个值。
vllm serve mistralai/Mistral-Small-4-119B-2603 --max-model-len 131072 --tensor-parallel-size 2 --tool-call-parser mistral --enable-auto-tool-choice --reasoning-parser mistral --max-num-batched-tokens 16384 --max-num-seqs 128 --gpu-memory-utilization 0.8 - 04
验证并接入
vLLM 起的是 OpenAI 兼容端点,把 base_url 指过来就能替换掉原来的 API 调用。跑 GGUF 的话一行 llama.cpp 也能直接起带 Web UI 的本地服务,适合先在便宜卡上验证效果再决定要不要上大机器。
llama serve -hf unsloth/Ministral-3-14B-Instruct-2512-GGUF:Q4_K_XL --jinja -ngl 99 --ctx-size 32768 --temp 0.15
这笔账到底多少钱
算一个真实场景:一个五人后端团队用 Devstral Small 2 24B 的 FP8 权重做代码审查和补丁生成,跑在 RTX 5090 32GB 上。每天开机 6 小时、一个月 20 个工作日,就是 120 小时;120 × $0.723 = $86.76。权重加镜像缓存按 60GB 常驻算,60 × $0.414 = $24.84/月。合计约 $111.60/月,一台机器供全组用。再看重的那头:Mistral Small 4 119B 用 2 张 H100 SXM 80GB,2 × $3.582 = $7.164/时,跑一轮 40 分钟的批量评测就是 0.667 × $7.164 ≈ $4.78——按秒计量、按小时计价,停机的那一秒计算费用就停了,只有存储会继续算到你把它销毁为止。对照 Mistral 官方 API 的 Small 4 定价 $0.15/百万输入 token、$0.60/百万输出 token,你可以直接用自己的实际吞吐量算出交叉点在哪里;数据不能出境、要长期高并发、或者要在权重上做微调的场景,自部署几乎总是赢的那一边。没有起租时长、没有开通费、不用提配额申请。
04 —
