MiniCPM 这个名字在国内几乎是「端侧大模型」的同义词。它由面壁智能(ModelBest)联合清华大学自然语言处理实验室 THUNLP 维护,代码和权重挂在 OpenBMB 组织下:语言模型在 github.com/OpenBMB/MiniCPM,多模态的 MiniCPM-V 与全模态的 MiniCPM-o 在 github.com/OpenBMB/MiniCPM-V,部署手册单独放在 OpenSQZ/MiniCPM-V-CookBook。整条线统一 Apache-2.0,权重和代码都可以直接商用,这一点在国产模型里并不常见。
很多人对 MiniCPM 的印象还停留在 2024 年那个 2.4B 的 MiniCPM-2B,那已经是两代之前的事了。现在的主线是:MiniCPM4.1-8B(2025 年 9 月)带 InfLLM v2 可训练稀疏注意力和混合推理开关;MiniCPM-SALA(2026 年 2 月)用 25% 稀疏 + 75% 线性注意力的混合架构冲到 1M+ token;MiniCPM-o 4.5(2026 年 2 月)是端到端全模态、支持全双工流式语音;MiniCPM-V 4.6(2026 年 5 月)把多模态压到 1.3B 塞进手机;MiniCPM5-1B(2026 年 5 月)是最新的端侧文本主力。如果你搜到的教程还在写 MiniCPM-2B-dpo,直接跳过。
MiniCPM 的部署性价比来自它的「小」,但小不等于随便一张卡都行。1.3B 的 MiniCPM-V 4.6 官方给的显存是 4GB,量化后 2~3GB;而 9B 的 MiniCPM-o 4.5 光 bf16 就要 19.0GB,还要留视频帧和音频编码器的空间。下面这几张表按官方公布的数字和直接可推算的权重体积列清楚,然后把 NexGPU 的卡对上去——不猜、不凑、不把 70B 的建议抄到 8B 上。
01 —
MiniCPM 现役版本与显存对照
参数量、上下文、量化体积,全部取自 OpenBMB 官方模型卡与仓库 README
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| MiniCPM5-1B | 1.08B(非嵌入 0.68B) | bf16 权重约 2.2GB / GGUF Q4 量级约 0.8GB | 131,072(128K) | 2026 年 5 月发布的端侧文本主力。LlamaForCausalLM 架构、24 层、16 个查询头配 2 个 KV 头的 GQA,chat template 内置 <think> 与 enable_thinking 开关。官方称后训练里的 RL + On-Policy Distillation 让平均分提升 16 分、超长啰嗦回复减少 29 个百分点。SGLang 是官方推荐的工具调用后端。 |
| MiniCPM4.1-8B | 8B | bf16 权重约 16GB / GPTQ-Int4 约 9GB / GGUF Q4_K_M 4.97GB | 原生 65,536,改 rope_scaling 走 LongRoPE 可到 131,072 | 最实用的一档。InfLLM v2 可训练稀疏注意力,稠密与稀疏可切换;混合推理,tokenizer 里 enable_thinking=True/False 一键切深度思考。官方在 RTX 4090 上实测推理模式解码提速 3 倍。官方同时放出 AutoAWQ、GPTQ、Marlin、MLX、GGUF 五条量化线。 |
| MiniCPM-SALA | 9B | bf16 权重约 18GB,百万上下文的 KV 另算 | 1M+ token | 2026 年 2 月的长文本特化款。Sparse-And-Linear-Attention:25% InfLLM-V2 稀疏层 + 75% Lightning Attention 线性层,配 HyPE 混合位置编码。官方在 A6000D 上量到 256K 序列比 Qwen3-8B 快 3.5 倍;Qwen3-8B 在 1M token 直接 OOM,SALA 能跑完。官方建议 temperature 设 0.9。 |
| MiniCPM-V 4.6 | 1.3B(SigLIP2-400M 视觉塔 + Qwen3.5-0.8B 语言塔) | bf16 约 4GB / int4(BNB、AWQ、GPTQ)约 3GB / GGUF 约 2GB | 256K | MiniCPM-V 系列迄今最小的一代,2026 年 6 月已并入 Ollama 官方模型库。混合 4×/16× 视觉 token 压缩,视觉编码 FLOPs 砍掉一半以上,单图、多图、视频通吃。视频默认 ≤128 秒按 1 FPS 抽帧、上限 128 帧。注意还有一个独立的 MiniCPM-V-4.6-Thinking 检查点,别和 Instruct 版混用。 |
| MiniCPM-o 4.5 | 9B(SigLip2 + Whisper-medium + CosyVoice2 + Qwen3-8B) | bf16 19.0GB / int4 11.0GB(官方实测值) | 图像最高 1.8M 像素,视频任意宽高比最高 10fps | 端到端全模态:视觉、语音、文本进,文本与语音出,支持全双工流式和 1Hz 主动决策。OpenCompass 77.6。官方效率表:bf16 解码 154.3 tok/s、int4 212.3 tok/s,TTFT 均 0.6 秒。已知问题是全模态模式下语音输出偶有发音不稳和中英混说。 |
| MiniCPM4-8B / MiniCPM4-0.5B / BitCPM4 | 8B / 0.5B / 1B 三值 | MiniCPM4-0.5B-QAT-Int4 权重约 0.3GB | MiniCPM4-8B 为 32K | 2025 年 6 月的上一代,仍在仓库里维护。MiniCPM4-0.5B-QAT-Int4 走量化感知训练,BitCPM4-1B / 0.5B 是三值量化线,这两条是真要落到端侧芯片、Jetson AGX Orin 这类设备上时才会选。做服务端私有化直接上 4.1-8B。 |
02 —
按场景选卡:MiniCPM 该租哪张 GPU
NexGPU 全部为按秒计量、按小时计价的公开挂牌价,无最低消费、无开通费
跑 MiniCPM5-1B 或 MiniCPM-V 4.6,做端侧模型的效果回归与 prompt 调优
RTX 3090 24GB$0.193/卡·时
1.3B 的 MiniCPM-V 4.6 官方显存只要 4GB,24GB 卡把 256K 上下文的 KV 一起装下都绰绰有余,而 3090 是我们价目表里最便宜的一张带完整 bf16 支持的卡。
MiniCPM4.1-8B 量化版(GPTQ-Int4 或 GGUF Q4_K_M)起 vLLM 服务扛并发
RTX 4090 24GB$0.540/卡·时
官方那个「推理模式解码快 3 倍」的数字就是在 RTX 4090 上测的,9GB 的 Int4 权重留出 15GB 给 KV cache 和批处理,单卡就能撑起一个像样的内部 API。
MiniCPM4.1-8B bf16 全精度加 128K LongRoPE,或 MiniCPM-o 4.5 全模态 bf16
RTX 5090 32GB$0.723/卡·时
MiniCPM-o 4.5 官方实测 bf16 占 19.0GB,32GB 装得下还剩余量喂视频帧和音频编码器;8B 的 16GB bf16 权重加长上下文 KV 也正好卡在这个档,24GB 会紧。
MiniCPM-SALA 冲 1M token,或一次性并排压测多个 MiniCPM 版本
RTX A6000 48GB$0.817/卡·时
SALA 官方 3.5 倍加速就是在 A6000D 上量的。48GB 让 9B 权重、百万级 KV 和 Lightning Attention 的中间状态一起驻留,不用切张量并行,省掉一整轮调参。
03 —
四步把 MiniCPM 跑起来
NexGPU 提供 2000+ 预置镜像,PyTorch、vLLM、Ubuntu CLI 开机即用,SSH / Jupyter / Web 终端 / REST API / CLI 五种入口任选
- 01
开机,先把版本对齐
在 console.nexgpu.net 选卡、挂 vLLM 或 PyTorch 预置镜像,起机后第一件事是核对框架版本。MiniCPM 系列高度依赖新架构支持:MiniCPM-V 4.6 需要 vLLM ≥ 0.22.0 和 transformers ≥ 5.7.0,版本不够会直接报「不认识这个 architecture」。历史上 vLLM 0.6.x 加载 MiniCPM 量化权重踩过 min_thread_n 整除和 absmax KeyError 两个坑,宁可版本往上走。
nvidia-smi && python -c "import torch, transformers, vllm; print(torch.__version__, transformers.__version__, vllm.__version__)" - 02
拉权重
Hugging Face 上的组织是 openbmb。文本主力拉 MiniCPM4.1-8B,端侧拉 MiniCPM5-1B,多模态拉 MiniCPM-V-4.6,全模态拉 MiniCPM-o-4_5。显存吃紧就直接拉官方量化仓库:MiniCPM4.1-8B-GPTQ、MiniCPM4.1-8B-AutoAWQ、MiniCPM4.1-8B-GGUF(Q4_K_M 只有 4.97GB)。NexGPU 存储中位价 $0.414/GB·月,实例停机后计算立刻停止计费,存储要销毁才停。
hf download openbmb/MiniCPM4.1-8B --local-dir ./MiniCPM4.1-8B - 03
起 vLLM,暴露 OpenAI 兼容接口
MiniCPM 全系都要加 --trust-remote-code,这是官方 modeling 文件的硬要求,少一个参数就起不来。先用原生 65,536 上下文跑通,确认吞吐和显存曲线之后再考虑改 config.json 里的 rope_scaling 走 LongRoPE 扩到 128K——扩上下文是改配置,不是改启动参数,很多人在这里卡住。深度思考模式在请求侧用 chat_template_kwargs 里的 enable_thinking 控制。
vllm serve openbmb/MiniCPM4.1-8B --trust-remote-code --max-model-len 65536 --port 8000 - 04
分岔:多模态、稀疏注意力、GGUF
多模态走 MiniCPM-V-4.6,先用小的 --max-model-len 8192 起,跑通再往 256K 加;如果出现停不下来的连续生成,官方 recipe 明确给了 stop_token_ids: [248044, 248046],这是 Qwen3.5 新词表带来的行为。视频输入要装 vllm[video] 额外依赖,torchcodec 和 CUDA 版本不匹配时会抛 Could not load libtorchcodec,把 torch 和 CUDA 对齐即可。想要 InfLLM v2 稀疏注意力的真实加速,vLLM 目前走的是稠密路径,得改用 Transformers 或官方 CPM.cu。纯 CPU 或小显存则直接 llama.cpp 跑 GGUF。
./llama-cli -m MiniCPM4.1-8B-Q4_K_M.gguf -p "北京有什么好玩的地方?" -n 1500
算一笔真实账:MiniCPM 全系选型评测要花多少
假设你要在两天内把 MiniCPM 整条线摸一遍,选出最适合业务的那一档。第一步用 RTX 3090 24GB($0.193/卡·时)跑 MiniCPM5-1B 和 MiniCPM-V 4.6 两个小模型,3 小时跑完全套 prompt 回归:3 × $0.193 = $0.579。第二步换 RTX 5090 32GB($0.723/卡·时),上 MiniCPM4.1-8B bf16 和 MiniCPM-o 4.5 bf16(官方实测 19.0GB,32GB 装得下),压测 5 小时:5 × $0.723 = $3.615。存储方面,4.1-8B 的 bf16 约 16GB、o 4.5 约 18GB、两个小模型约 6GB,合计 40GB,按 $0.414/GB·月的中位价只留 2 天:40 × 0.414 × 2 ÷ 30 ≈ $1.10。最后把评测日志和结果 2GB 拉回本地,出网按 $0.0081/GB 中位价:2 × 0.0081 ≈ $0.02。合计 $0.579 + $3.615 + $1.10 + $0.02 ≈ $5.31——不到六美元,你就拿到了自己业务数据上的完整对比结论,而不是别人榜单上的数字。计算按秒计量,跑完停机立刻停止计费;存储要显式销毁才停,评测结束记得清盘。
04 —
