搜「InternLM 本地部署」的人,大多还停在 InternLM2.5 或 InternLM3。这条线没有停更,只是不再叫 InternLM4 了:上海人工智能实验室把主线迁到了 Intern-S 命名下,从 Intern-S1(241B,235B 的 Qwen3 MoE 语言塔加 6B InternViT 视觉塔)、Intern-S1-Pro(1T 总参、512 专家、每 token 激活 8 个专家共 22B),一路走到 2026 年的 Intern-S2-Preview 系列与 Intern-S2-Mobius。整条家族链,代码和权重都是 Apache-2.0。
显存这件事,这一家跨了三个数量级,选错卡就是纯烧钱。最轻的一头,官方 GGUF 的 InternLM3-8B-Instruct q4_k_m 大约 5GB,4-bit 加载约 8GB 显存,一张 16GB 的 T4 都富余;往上,Intern-S1-mini 是 9B(Qwen3-8B 稠密底座加 0.3B InternViT),bf16 权重约 18GB;再往上,Intern-S2-Preview-35B 是 36B 总参、3B 激活、256 专家的 MoE,bf16 要一张 H200 141GB 或者两张 H100 80GB,换成 FP8 单张 H100 就够;Intern-S1 的 241B bf16 官方硬性要求 8 张 80GB;顶上的 Intern-S1-Pro 直接是两个 8 卡 H200 节点起步的活。
这正是租卡的意义:同一个模型家族,从一张 3090 到一整排 A100,你不需要为最大的那个版本买硬件。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张卡、75 种 GPU 型号,单节点最多 14 卡、最大节点显存 2,152GB。2,000 多个预置镜像里 PyTorch 和 vLLM 开箱即用,按秒计量、按小时计价,没有最低消费,也不用申请配额。
01 —
书生·浦语现役版本与显存对照
从 8B 单卡到 1T 双节点,按你真正要跑的那一档挑
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Intern-S2-Preview-397B | 397B | 8×H100 80GB 或 8×H200,TP8 | 256K 文本 / 64K 多模态 | 2026 年的旗舰科学智能体模型,跑长程 agent 任务用它。官方命令要带 --mm-encoder-tp-mode data,超长上下文可开到 1,010K。 |
| Intern-S2-Preview-35B | 36B 总参 / 3B 激活,256 专家 | bf16 单张 H200 141GB 或 2×H100 80GB;FP8 单张 H100 即可 | 262K 原生,YaRN 可拉到 512K | 从 Qwen3.5 续训,文本+视觉+时序三模态。性价比最高的一档,配 MTP 投机解码提速明显。 |
| Intern-S2-Mobius | 35B(另有 FP8 版) | bf16 权重约 70GB,LMDeploy --tp 1 需 80GB 级单卡 | 128K | Mobius-v0 架构:把知识抽成全局共享 Memory,让多个 Reasoner 反复查询精炼,技术报告称端到端推理近 4 倍加速、思维链明显更短。 |
| Intern-S1 / Intern-S1-FP8 | 241B(235B MoE 语言塔 + 6B InternViT) | bf16 8×A100 80GB、8×H100/H800 或 4×H200;FP8 4×H100/H800 或 2×H200 | 未单独标注,按 --max-model-len 自行设定 | 5T 多模态 token 预训练,其中超过 2.5T 是科学领域语料。要完整的科学多模态能力就是这一档。 |
| Intern-S1-mini / Intern-S1-mini-FP8 | 9B(Qwen3-8B + 0.3B InternViT) | bf16 权重约 18GB,官方口径单张 80GB 级卡;FP8 版仅限 H800/H100/H200 | 未单独标注,按 --max-model-len 自行设定 | 整条线里唯一真正的单卡多模态版本。要求 transformers≥4.55.2、vLLM≥0.10.1、LMDeploy≥0.9.2.post1。 |
| InternLM3-8B-Instruct | 8B 稠密 | bf16 约 16GB;官方 GGUF q4_k_m 约 5GB,4-bit 加载约 8GB 显存 | 128K(RULER 4–128K 实测) | 纯文本主线的终点站,也是全家最省显存的入口。仅用 4T token 训成,自带深度思考模式,思维链最长 8,192 token。 |
02 —
该租哪张卡
按你要跑的版本对号入座,价格是 NexGPU 每卡每小时列表价
InternLM3-8B 量化推理/提示词调试
RTX 3090 24GB$0.193/卡·时
q4_k_m 约 5GB、bf16 约 16GB 都塞得进 24GB,而这是全网最便宜的 24GB 一档,调一天提示词不到两美元。
Intern-S1-mini 9B 多模态 bf16 单卡服务
A100 PCIE 80GB$0.824/卡·时
18GB 权重之外留足空间给 InternViT 的高分辨率切片和 KV 缓存,正好对上官方硬件表里的单张 80GB 卡口径。
Intern-S2-Preview-35B FP8 单卡长上下文
H100 SXM 80GB$3.582/卡·时
FP8 权重只认 Hopper,A100 被官方明确排除;单张 H100 就能把 36B/3B 激活的 MoE 连同 262K 上下文一起端起来。
Intern-S1 241B bf16 全量推理,TP8
A100 SXM4 80GB ×8$1.088/卡·时(8 卡合计 $8.704/时)
官方 bf16 最低配就是 8×80GB,SXM4 的 NVLink 是八路张量并行的关键;单节点最多 14 卡,640GB 显存一个节点装得下。
03 —
四步把书生·浦语跑起来
以 Intern-S1-mini 为例,换成 Intern-S1 只需要加 --tensor-parallel-size 8
- 01
开机,把版本钉死
控制台选 vLLM 或 PyTorch 预置镜像开卡。Intern-S 系列对版本很挑:transformers 低于 4.55.2 会直接加载失败,Intern-S2-Preview 还需要带 InternS2PreviewForConditionalGeneration 支持的 vLLM 版本,稳定版轮子不认这个架构。
pip install -U "vllm>=0.10.1" "transformers>=4.55.2" "lmdeploy>=0.9.2.post1" - 02
拉权重
先估好盘:9B 的 bf16 约 18GB,241B 的 bf16 约 482GB。存储按 $0.414/GB·月 中位价计,大权重跑完记得销毁卷——算力停机即停止计费,存储不会。
hf download internlm/Intern-S1-mini --local-dir /workspace/Intern-S1-mini - 03
起服务,别搞混解析器
这是最常见的翻车点:Intern-S1 系列用 --reasoning-parser intern-s1 和 --tool-call-parser intern-s1;Intern-S2-Preview 因为底座是 Qwen3.5,要换成 --reasoning-parser qwen3 加 --tool-call-parser qwen3_coder。配错了工具调用会静默变成一段普通文本。SGLang 部署 Intern-S1 还要加 --grammar-backend none。
lmdeploy serve api_server internlm/Intern-S1-mini --reasoning-parser intern-s1 --tool-call-parser intern-s1 - 04
关掉思考模式,压住上下文
Intern-S 全系默认开启思考模式,不关的话每条回复都先吐一大段思维链,延迟和 token 开销都翻倍。另外原生上下文拉满基本必 OOM:官方在 Intern-S1-Pro 上直接用 --max-model-len 65536 兜底,Intern-S2-Preview 建议从 65K–131K 起步再往上试。
curl http://localhost:23333/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"internlm/Intern-S1-mini","messages":[{"role":"user","content":"介绍一下你自己"}],"chat_template_kwargs":{"enable_thinking":false}}'
把账算给你看
两笔真实的账。第一笔:用 InternLM3-8B 的 q4_k_m 调提示词,RTX 3090 24GB 是 $0.193/卡·时,连着调 10 小时就是 10 × $0.193 = $1.93,比一杯咖啡便宜。第二笔:Intern-S1 241B bf16 全量推理,官方最低配 8 张 80GB。走 A100 SXM4 80GB,8 × $1.088 = $8.704/时,跑一轮 3 小时的 benchmark 是 3 × $8.704 = $26.11;同样八卡换成 H100 SXM 80GB,8 × $3.582 = $28.656/时,3 小时要 $85.97 —— 同一份 bf16 权重,A100 SXM4 省掉约七成。真正容易被忽略的是存储:Intern-S1 的 bf16 权重约 482GB(241B × 2 字节),按 $0.414/GB·月 的中位价,光放着就是每月约 $199。算力在实例停机那一秒停止计费,存储不会,所以 benchmark 跑完要么销毁卷,要么只留 FP8 权重——FP8 版体积减半,还能把部署从 8 卡压到 4 张 H100 或 2 张 H200。
04 —
