跳到主要内容

文本大模型 · 医疗方向

把 Baichuan 医疗大模型 部署在自己的 GPU 上

从 Baichuan2-7B 的 5.1GB int4,到 Baichuan-M3-235B 的 125GB INT4 权重,这一页把每个变体的真实显存、可选卡型和每小时价格摆在一起。

现在搜「Baichuan」,你会搜到两条几乎不相干的线。一条是 2023 年 9 月开源的 Baichuan2-7B / 13B,通用中文底座,4K 上下文,至今仍是很多国产模型评测里的基线;另一条是 2025 年 4 月百川智能宣布战略收缩、全面转向 AI 医疗之后的产物 —— Baichuan-M1-14B、Baichuan-M2-32B,以及 2026 年 1 月开源的旗舰 Baichuan-M3-235B。中间的 Baichuan 3 / Baichuan 4 从未放出权重,只在 platform.baichuan-ai.com 上以闭源 API 存在。所以「Baichuan 最新版本」这个问题的答案是:通用开源线停在 Baichuan2,活跃的开源线是 M 系列医疗模型。

M 系列的血统很直白,也决定了它的部署方式。Baichuan-M2-32B 的 config.json 里写着 Qwen2ForCausalLM,64 层、hidden 5120、152064 词表 —— 它是在 Qwen2.5-32B 上做医疗强化训练得来的,所以 vLLM、SGLang 开箱即用,只要加一句 --reasoning-parser qwen3。Baichuan-M3-235B 更进一步,config 里是 Qwen3MoeForCausalLM,94 层、128 个专家、每 token 激活 8 个,也就是 Qwen3-235B-A22B 那套 MoE 骨架(不少中文报道称它是 Dense 架构,配置文件并不支持这个说法)。反倒是自研架构的 Baichuan-M1-14B 最麻烦:BaichuanM1ForCausalLM,20 个全局注意力头配 40 个滑窗头、奇数层挂 8192 的 sliding window,必须 trust_remote_code=True 才能加载,vLLM 的原生支持至今还挂在 issue 里。

显存这件事没有含糊空间。Baichuan-M2-32B 的 bf16 权重在 Hugging Face 上是 67.1GB,官方 GPTQ-Int4 是 20.9GB,官方 Q4_K_M GGUF 是 21.9GB;Baichuan-M3-235B 的 GPTQ-INT4 仓库是 125GB,FP8 约 235GB,bf16 约 470GB。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种卡型,单节点最多 14 张卡、最大 2,152GB 显存,按秒计量、按小时计价,没有起租量、没有开通费、不用申请配额。下面每一档配置都直接给出卡型和挂牌价,你自己核对。

01 —

Baichuan 现存的模型变体与真实显存

显存数字取自 Hugging Face 仓库实际权重体积与官方 README 的显存表,不是估算。

版本参数量显存上下文说明
Baichuan-M3-235B(含 FP8 / GPTQ-INT4 / Q4_K_M GGUF)235B-A22B(MoE,128 专家激活 8)bf16 ~470GB / FP8 ~235GB / GPTQ-INT4 ~125GB40,9602026 年 1 月开源的旗舰医疗模型,HealthBench 65.1、HealthBench Hard 44.4,Apache 2.0,官方部署示例用 8×H20 96GB 跑 TP=8 加 EAGLE3 投机采样。
Baichuan-M2-32B(含 GPTQ-Int4 / Q4_K_M GGUF)32B(Qwen2.5-32B 底座)bf16 67.1GB / GPTQ-Int4 20.9GB / Q4_K_M GGUF 21.9GB131,072单机自部署的主力款,HealthBench 60.1、AIME24 83.4、Arena-Hard-v2.0 45.8,Apache 2.0,仓库里带 draft 目录可直接开 EAGLE3 投机解码。
Baichuan-M1-14B-Base / -Instruct14B(自研架构,20T token 从零训练)bf16 ~29GB / 4-bit ~9GB32,768行业首个开源医疗增强模型,滑窗注意力 8192 挂在奇数层;许可证是《Baichuan-M1-14B 社区许可协议》而非 Apache,需要 transformers ≥ 4.47.0 且 trust_remote_code=True。
Baichuan2-13B-Base / -Chat13Bbf16 27.5GB / int8 16.1GB / int4 8.6GB4,09613B 用 ALiBi 位置编码(7B 用 RoPE),2.6 万亿 token 训练;vLLM 有原生 baichuan 实现,是老项目迁移时最省事的一条路。
Baichuan2-7B-Base / -Chat7Bbf16 15.3GB / int8 8.0GB / int4 5.1GB4,096最轻的一档,int4 只要 5.1GB,适合做中文基线对照或者在便宜卡上批量跑离线任务。
BaichuanMed-OCR-7B / -72B7B / 72B(Qwen2.5-VL 底座)7B bf16 ~17GB / 72B bf16 ~145GB随底座把化验单、影像报告图片转成结构化 Markdown 再问答,7B 版在医疗报告基准上 83.5%,明显高于底座 Qwen2.5-VL-7B 的 71.3%;许可证标注为 other,商用前先看条款。

02 —

按配置选卡:NexGPU 挂牌价直接对照

KV Cache 按 config.json 算:M2-32B 是 64 层 ×8 个 KV 头 ×128 维,每 token 256KB;M3-235B 是 94 层 ×4 个 KV 头,每 token 约 188KB。

  • Baichuan-M2-32B-GPTQ-Int4 单卡起服务,8K 以内上下文做批量评测

    RTX 4090 24GB$0.540/卡·时

    20.9GB 权重刚好塞进 24GB,但只剩 2~3GB 给 KV,按 256KB/token 算差不多就是 8~10K 上下文,短问答评测够用、长病历会直接 OOM。

  • Baichuan-M2-32B INT4 开到 24K~32K 上下文,跑长病历问诊

    RTX 5090 32GB$0.723/卡·时

    32GB 减去权重后能腾出约 8GB 给 KV Cache,正好覆盖 32K 长文档,是 M2 单卡部署里性价比最合适的一档。

  • Baichuan-M2-32B bf16 全精度上线,或做 QLoRA 微调

    A100 PCIE 80GB$0.824/卡·时

    67.1GB 权重单卡装得下,比 RTX 5090 每小时只贵 $0.101,却彻底绕开量化误差 —— 32B 这个尺寸在我们的价目表上,量化省下来的钱其实很有限。

  • Baichuan-M3-235B-GPTQ-INT4 四卡张量并行,起一套 235B 医疗推理

    A100 SXM4 80GB$1.088/卡·时

    125GB 权重摊到 4 张卡共 320GB 显存,余量充足,SXM4 的 NVLink 让 TP=4 的 all-reduce 不至于成为瓶颈,整套 $4.352/时。

03 —

四步把 Baichuan-M2-32B 跑起来

以单张 RTX 5090 32GB + GPTQ-Int4 为例,从开机到发出第一条问诊请求。

  1. 01

    开一台带 vLLM 的实例

    在 console.nexgpu.net 选 RTX 5090 32GB,直接挑 2,000+ 预置镜像里的 vLLM 镜像,SSH、Jupyter、Web 终端、REST API、CLI 五种入口任选。M3-235B 的官方要求是 vllm ≥ 0.9.0 或 sglang ≥ 0.4.6.post1,M2-32B 同样吃这一版本线,镜像里没有就顺手升一下。

    pip install -U "vllm>=0.9.0" huggingface_hub
  2. 02

    拉官方 INT4 权重

    拉 baichuan-inc/Baichuan-M2-32B-GPTQ-Int4,四个 safetensors 分片合计 20.9GB。想走 llama.cpp 路线就换 baichuan-inc/Baichuan-M2-32B-Q4_K_M-GGUF,单文件 21.9GB —— 注意它比 GPTQ 版还大 1GB,24GB 卡上会更紧张。

    hf download baichuan-inc/Baichuan-M2-32B-GPTQ-Int4 --local-dir /workspace/m2-int4
  3. 03

    起 OpenAI 兼容服务,并把上下文卡在显存能承受的位置

    关键是 --reasoning-parser qwen3:M2 是带思维链的推理模型,不加这个参数,thinking 段会原样混进 content 字段。--max-model-len 24576 对应约 6GB KV,在 32GB 卡上留足余量;换成 A6000 48GB 可以往上开到接近 100K。

    vllm serve /workspace/m2-int4 --served-model-name Baichuan-M2-32B --reasoning-parser qwen3 --max-model-len 24576 --gpu-memory-utilization 0.92
  4. 04

    发一条真实问诊请求验活,然后按秒停机

    官方推荐 temperature 0.6,评测时 max_tokens 给到 32k(AIME 类任务给 64k)。验完直接停实例,算力计费当场停止;数据卷会继续按 $0.414/GB·月 中位价计费,直到你销毁它。

    curl -s http://127.0.0.1:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"Baichuan-M2-32B","temperature":0.6,"messages":[{"role":"user","content":"58 岁男性,胸痛 2 小时,心电图 II、III、aVF 导联 ST 段抬高,下一步处置?"}]}'

一次真实评测跑下来要多少钱

假设你要用 Baichuan-M2-32B-GPTQ-Int4 跑 5,000 条内部病历问答做离线评测,单张 RTX 5090 32GB。开机、拉 20.9GB 权重、预热大约 0.4 小时,评测本身 5.6 小时,合计 6 小时:6 × $0.723 = $4.34。权重加 Python 环境占一个 60GB 的卷,留 3 天备复跑:60 × $0.414 × 3/30 = $2.48。导出 2GB 结果:2 × $0.0081 = $0.02。总计约 $6.84。有意思的是对照组:同样 6 小时改用 bf16 全精度跑在 A100 PCIE 80GB 上,是 6 × $0.824 = $4.94,比 5090 那档只贵 $0.60,却省掉了整个量化环节 —— 32B 这个尺寸上,量化更多是为了塞进小卡,不是为了省钱。往上一档,Baichuan-M3-235B-GPTQ-INT4 用 4×A100 SXM4 80GB 是 4 × $1.088 = $4.352/时,一次 8 小时的科室级压测 $34.82;同样 8 小时若走 FP8 原生精度、上 2×H200 141GB,是 2 × $6.660 × 8 = $106.56。三档之间差的不是一点,值不值得,看你要的是评测数字还是上线精度。

04 —

常见问题

Baichuan 还在更新吗?2026 年应该用哪个版本?

通用开源线停在 2023 年 9 月的 Baichuan2-7B / 13B,Baichuan 3 和 Baichuan 4 从未开源权重。2025 年 4 月百川智能宣布战略收缩、全面转向 AI 医疗,此后的开源全部集中在医疗方向:Baichuan-M1-14B、Baichuan-M2-32B,以及 2026 年 1 月发布的 Baichuan-M3-235B。要做通用中文任务,Baichuan2 依然可用但已经明显落后;要做医疗问答、病历理解、临床决策辅助,直接上 M2 或 M3。哪一档都能在 NexGPU 上按秒开一台对应显存的卡先试,试完就停,不留尾巴。

Baichuan-M2-32B 真的能用一张 RTX 4090 跑吗?

能跑,但要知道边界在哪。官方 GPTQ-Int4 权重是 20.9GB,24GB 卡装下之后只剩 2~3GB;M2 的 KV Cache 是每 token 256KB(64 层 × 8 个 KV 头 × 128 维 × 2 字节 × K/V),换算下来大约 8~10K 上下文,做短问答评测完全够,喂一份完整住院病历就会 OOM。想要 32K 就上 RTX 5090 32GB($0.723/卡·时),想接近 128K 满上下文就上 RTX A6000 48GB($0.817/卡·时)。这三张卡在 NexGPU 都是现货,换一张重开就是几分钟的事。

Baichuan-M3-235B 私有化部署需要多大显存、几张卡?

看精度。bf16 权重约 470GB,需要 4×H200 141GB(564GB,$26.64/时)或者 8×H100 SXM 80GB;FP8 版约 235GB,2×H200 141GB 共 282GB 刚好合适($13.32/时),注意 FP8 需要 Hopper 卡才有原生算力;GPTQ-INT4 仓库实测 125GB,4×A100 SXM4 80GB 共 320GB 最划算,$4.352/时。它的 KV 很省,94 层只有 4 个 KV 头,每 token 约 188KB,40K 满上下文也才 7.3GB。NexGPU 单节点最多 14 张卡、最大 2,152GB 显存,上面这几种组合都能在一台机器里搞定,不用跨节点。

加载 Baichuan2 报 'BaichuanTokenizer' object has no attribute 'sp_model' 怎么解决?

这是 transformers 4.34 引入的破坏性改动,和 Baichuan2 自带的 remote code tokenizer 冲突,官方仓库 issue 里讨论了很久。最省事的办法是加载时指定 revision="v2.0",或者把 transformers 降到 4.33.x;另一条路是干脆别走 transformers,用 vLLM 的原生 baichuan 实现,它不依赖那份 remote code。顺带一提,Baichuan2 需要 PyTorch 2.0 以上才能用 F.scaled_dot_product_attention 加速,CPU 推理必须改成 float32。NexGPU 的 PyTorch 预置镜像里可以直接建独立环境,把版本钉死,不用跟本机打架。

Baichuan 各个版本能商用吗?许可证一样吗?

不一样,这点很多人踩过坑。Baichuan-M2-32B 和 Baichuan-M3-235B 是 Apache 2.0,研究和商用都放开;Baichuan-M1-14B 走的是《Baichuan-M1-14B 模型社区许可协议》;Baichuan2 是 Apache 2.0 叠加社区许可协议,商用需要发邮件到 [email protected] 申请,并满足日活低于 100 万、自身不是软件或云服务提供商、不向第三方二次授权这三个条件;BaichuanMed-OCR 系列的许可证字段标注为 other,落地前务必自己读一遍。另外所有 M 系列模型都带医疗免责声明,只能用于研究和参考,不能替代专业诊疗。

微调 Baichuan-M2-32B 需要几张卡?

全参数 bf16 微调要算清楚三笔账:权重 65GB、梯度 65GB、AdamW 的 fp32 主权重加一阶二阶动量约 394GB(每参数 12 字节),合计 500GB 以上,实际要 8×A100 80GB(640GB)配 ZeRO-3 才跑得动,在 NexGPU 上是 8 × $1.088 = $8.704/时。绝大多数医疗场景没必要走这条路:QLoRA 把底座压到 4-bit 之后,单张 A100 PCIE 80GB($0.824/卡·时)就能带起 32B 的 LoRA 训练,短序列下甚至 RTX A6000 48GB($0.817/卡·时)也能跑。先用一张卡把数据管线和超参调通,确认有效再横向扩到多卡 —— 按秒计费意味着这种试错几乎不产生沉没成本,中英文支持团队在 Telegram 上随时能接上,不用排工单。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。