现在搜「Baichuan」,你会搜到两条几乎不相干的线。一条是 2023 年 9 月开源的 Baichuan2-7B / 13B,通用中文底座,4K 上下文,至今仍是很多国产模型评测里的基线;另一条是 2025 年 4 月百川智能宣布战略收缩、全面转向 AI 医疗之后的产物 —— Baichuan-M1-14B、Baichuan-M2-32B,以及 2026 年 1 月开源的旗舰 Baichuan-M3-235B。中间的 Baichuan 3 / Baichuan 4 从未放出权重,只在 platform.baichuan-ai.com 上以闭源 API 存在。所以「Baichuan 最新版本」这个问题的答案是:通用开源线停在 Baichuan2,活跃的开源线是 M 系列医疗模型。
M 系列的血统很直白,也决定了它的部署方式。Baichuan-M2-32B 的 config.json 里写着 Qwen2ForCausalLM,64 层、hidden 5120、152064 词表 —— 它是在 Qwen2.5-32B 上做医疗强化训练得来的,所以 vLLM、SGLang 开箱即用,只要加一句 --reasoning-parser qwen3。Baichuan-M3-235B 更进一步,config 里是 Qwen3MoeForCausalLM,94 层、128 个专家、每 token 激活 8 个,也就是 Qwen3-235B-A22B 那套 MoE 骨架(不少中文报道称它是 Dense 架构,配置文件并不支持这个说法)。反倒是自研架构的 Baichuan-M1-14B 最麻烦:BaichuanM1ForCausalLM,20 个全局注意力头配 40 个滑窗头、奇数层挂 8192 的 sliding window,必须 trust_remote_code=True 才能加载,vLLM 的原生支持至今还挂在 issue 里。
显存这件事没有含糊空间。Baichuan-M2-32B 的 bf16 权重在 Hugging Face 上是 67.1GB,官方 GPTQ-Int4 是 20.9GB,官方 Q4_K_M GGUF 是 21.9GB;Baichuan-M3-235B 的 GPTQ-INT4 仓库是 125GB,FP8 约 235GB,bf16 约 470GB。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种卡型,单节点最多 14 张卡、最大 2,152GB 显存,按秒计量、按小时计价,没有起租量、没有开通费、不用申请配额。下面每一档配置都直接给出卡型和挂牌价,你自己核对。
01 —
Baichuan 现存的模型变体与真实显存
显存数字取自 Hugging Face 仓库实际权重体积与官方 README 的显存表,不是估算。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Baichuan-M3-235B(含 FP8 / GPTQ-INT4 / Q4_K_M GGUF) | 235B-A22B(MoE,128 专家激活 8) | bf16 ~470GB / FP8 ~235GB / GPTQ-INT4 ~125GB | 40,960 | 2026 年 1 月开源的旗舰医疗模型,HealthBench 65.1、HealthBench Hard 44.4,Apache 2.0,官方部署示例用 8×H20 96GB 跑 TP=8 加 EAGLE3 投机采样。 |
| Baichuan-M2-32B(含 GPTQ-Int4 / Q4_K_M GGUF) | 32B(Qwen2.5-32B 底座) | bf16 67.1GB / GPTQ-Int4 20.9GB / Q4_K_M GGUF 21.9GB | 131,072 | 单机自部署的主力款,HealthBench 60.1、AIME24 83.4、Arena-Hard-v2.0 45.8,Apache 2.0,仓库里带 draft 目录可直接开 EAGLE3 投机解码。 |
| Baichuan-M1-14B-Base / -Instruct | 14B(自研架构,20T token 从零训练) | bf16 ~29GB / 4-bit ~9GB | 32,768 | 行业首个开源医疗增强模型,滑窗注意力 8192 挂在奇数层;许可证是《Baichuan-M1-14B 社区许可协议》而非 Apache,需要 transformers ≥ 4.47.0 且 trust_remote_code=True。 |
| Baichuan2-13B-Base / -Chat | 13B | bf16 27.5GB / int8 16.1GB / int4 8.6GB | 4,096 | 13B 用 ALiBi 位置编码(7B 用 RoPE),2.6 万亿 token 训练;vLLM 有原生 baichuan 实现,是老项目迁移时最省事的一条路。 |
| Baichuan2-7B-Base / -Chat | 7B | bf16 15.3GB / int8 8.0GB / int4 5.1GB | 4,096 | 最轻的一档,int4 只要 5.1GB,适合做中文基线对照或者在便宜卡上批量跑离线任务。 |
| BaichuanMed-OCR-7B / -72B | 7B / 72B(Qwen2.5-VL 底座) | 7B bf16 ~17GB / 72B bf16 ~145GB | 随底座 | 把化验单、影像报告图片转成结构化 Markdown 再问答,7B 版在医疗报告基准上 83.5%,明显高于底座 Qwen2.5-VL-7B 的 71.3%;许可证标注为 other,商用前先看条款。 |
02 —
按配置选卡:NexGPU 挂牌价直接对照
KV Cache 按 config.json 算:M2-32B 是 64 层 ×8 个 KV 头 ×128 维,每 token 256KB;M3-235B 是 94 层 ×4 个 KV 头,每 token 约 188KB。
Baichuan-M2-32B-GPTQ-Int4 单卡起服务,8K 以内上下文做批量评测
RTX 4090 24GB$0.540/卡·时
20.9GB 权重刚好塞进 24GB,但只剩 2~3GB 给 KV,按 256KB/token 算差不多就是 8~10K 上下文,短问答评测够用、长病历会直接 OOM。
Baichuan-M2-32B INT4 开到 24K~32K 上下文,跑长病历问诊
RTX 5090 32GB$0.723/卡·时
32GB 减去权重后能腾出约 8GB 给 KV Cache,正好覆盖 32K 长文档,是 M2 单卡部署里性价比最合适的一档。
Baichuan-M2-32B bf16 全精度上线,或做 QLoRA 微调
A100 PCIE 80GB$0.824/卡·时
67.1GB 权重单卡装得下,比 RTX 5090 每小时只贵 $0.101,却彻底绕开量化误差 —— 32B 这个尺寸在我们的价目表上,量化省下来的钱其实很有限。
Baichuan-M3-235B-GPTQ-INT4 四卡张量并行,起一套 235B 医疗推理
A100 SXM4 80GB$1.088/卡·时
125GB 权重摊到 4 张卡共 320GB 显存,余量充足,SXM4 的 NVLink 让 TP=4 的 all-reduce 不至于成为瓶颈,整套 $4.352/时。
03 —
四步把 Baichuan-M2-32B 跑起来
以单张 RTX 5090 32GB + GPTQ-Int4 为例,从开机到发出第一条问诊请求。
- 01
开一台带 vLLM 的实例
在 console.nexgpu.net 选 RTX 5090 32GB,直接挑 2,000+ 预置镜像里的 vLLM 镜像,SSH、Jupyter、Web 终端、REST API、CLI 五种入口任选。M3-235B 的官方要求是 vllm ≥ 0.9.0 或 sglang ≥ 0.4.6.post1,M2-32B 同样吃这一版本线,镜像里没有就顺手升一下。
pip install -U "vllm>=0.9.0" huggingface_hub - 02
拉官方 INT4 权重
拉 baichuan-inc/Baichuan-M2-32B-GPTQ-Int4,四个 safetensors 分片合计 20.9GB。想走 llama.cpp 路线就换 baichuan-inc/Baichuan-M2-32B-Q4_K_M-GGUF,单文件 21.9GB —— 注意它比 GPTQ 版还大 1GB,24GB 卡上会更紧张。
hf download baichuan-inc/Baichuan-M2-32B-GPTQ-Int4 --local-dir /workspace/m2-int4 - 03
起 OpenAI 兼容服务,并把上下文卡在显存能承受的位置
关键是 --reasoning-parser qwen3:M2 是带思维链的推理模型,不加这个参数,thinking 段会原样混进 content 字段。--max-model-len 24576 对应约 6GB KV,在 32GB 卡上留足余量;换成 A6000 48GB 可以往上开到接近 100K。
vllm serve /workspace/m2-int4 --served-model-name Baichuan-M2-32B --reasoning-parser qwen3 --max-model-len 24576 --gpu-memory-utilization 0.92 - 04
发一条真实问诊请求验活,然后按秒停机
官方推荐 temperature 0.6,评测时 max_tokens 给到 32k(AIME 类任务给 64k)。验完直接停实例,算力计费当场停止;数据卷会继续按 $0.414/GB·月 中位价计费,直到你销毁它。
curl -s http://127.0.0.1:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"Baichuan-M2-32B","temperature":0.6,"messages":[{"role":"user","content":"58 岁男性,胸痛 2 小时,心电图 II、III、aVF 导联 ST 段抬高,下一步处置?"}]}'
一次真实评测跑下来要多少钱
假设你要用 Baichuan-M2-32B-GPTQ-Int4 跑 5,000 条内部病历问答做离线评测,单张 RTX 5090 32GB。开机、拉 20.9GB 权重、预热大约 0.4 小时,评测本身 5.6 小时,合计 6 小时:6 × $0.723 = $4.34。权重加 Python 环境占一个 60GB 的卷,留 3 天备复跑:60 × $0.414 × 3/30 = $2.48。导出 2GB 结果:2 × $0.0081 = $0.02。总计约 $6.84。有意思的是对照组:同样 6 小时改用 bf16 全精度跑在 A100 PCIE 80GB 上,是 6 × $0.824 = $4.94,比 5090 那档只贵 $0.60,却省掉了整个量化环节 —— 32B 这个尺寸上,量化更多是为了塞进小卡,不是为了省钱。往上一档,Baichuan-M3-235B-GPTQ-INT4 用 4×A100 SXM4 80GB 是 4 × $1.088 = $4.352/时,一次 8 小时的科室级压测 $34.82;同样 8 小时若走 FP8 原生精度、上 2×H200 141GB,是 2 × $6.660 × 8 = $106.56。三档之间差的不是一点,值不值得,看你要的是评测数字还是上线精度。
04 —
