跳到主要内容

文本与多模态大模型

InternLM 本地部署,从 5GB 显存到 8 卡 A100

书生·浦语这条线已经从纯文本的 InternLM3 走到了多模态科学模型 Intern-S2。每个版本真实的显存开销、能跑它的卡、以及自托管时一定会踩的坑,这一页讲清楚。

搜「InternLM 本地部署」的人,大多还停在 InternLM2.5 或 InternLM3。这条线没有停更,只是不再叫 InternLM4 了:上海人工智能实验室把主线迁到了 Intern-S 命名下,从 Intern-S1(241B,235B 的 Qwen3 MoE 语言塔加 6B InternViT 视觉塔)、Intern-S1-Pro(1T 总参、512 专家、每 token 激活 8 个专家共 22B),一路走到 2026 年的 Intern-S2-Preview 系列与 Intern-S2-Mobius。整条家族链,代码和权重都是 Apache-2.0。

显存这件事,这一家跨了三个数量级,选错卡就是纯烧钱。最轻的一头,官方 GGUF 的 InternLM3-8B-Instruct q4_k_m 大约 5GB,4-bit 加载约 8GB 显存,一张 16GB 的 T4 都富余;往上,Intern-S1-mini 是 9B(Qwen3-8B 稠密底座加 0.3B InternViT),bf16 权重约 18GB;再往上,Intern-S2-Preview-35B 是 36B 总参、3B 激活、256 专家的 MoE,bf16 要一张 H200 141GB 或者两张 H100 80GB,换成 FP8 单张 H100 就够;Intern-S1 的 241B bf16 官方硬性要求 8 张 80GB;顶上的 Intern-S1-Pro 直接是两个 8 卡 H200 节点起步的活。

这正是租卡的意义:同一个模型家族,从一张 3090 到一整排 A100,你不需要为最大的那个版本买硬件。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张卡、75 种 GPU 型号,单节点最多 14 卡、最大节点显存 2,152GB。2,000 多个预置镜像里 PyTorch 和 vLLM 开箱即用,按秒计量、按小时计价,没有最低消费,也不用申请配额。

01 —

书生·浦语现役版本与显存对照

从 8B 单卡到 1T 双节点,按你真正要跑的那一档挑

版本参数量显存上下文说明
Intern-S2-Preview-397B397B8×H100 80GB 或 8×H200,TP8256K 文本 / 64K 多模态2026 年的旗舰科学智能体模型,跑长程 agent 任务用它。官方命令要带 --mm-encoder-tp-mode data,超长上下文可开到 1,010K。
Intern-S2-Preview-35B36B 总参 / 3B 激活,256 专家bf16 单张 H200 141GB 或 2×H100 80GB;FP8 单张 H100 即可262K 原生,YaRN 可拉到 512K从 Qwen3.5 续训,文本+视觉+时序三模态。性价比最高的一档,配 MTP 投机解码提速明显。
Intern-S2-Mobius35B(另有 FP8 版)bf16 权重约 70GB,LMDeploy --tp 1 需 80GB 级单卡128KMobius-v0 架构:把知识抽成全局共享 Memory,让多个 Reasoner 反复查询精炼,技术报告称端到端推理近 4 倍加速、思维链明显更短。
Intern-S1 / Intern-S1-FP8241B(235B MoE 语言塔 + 6B InternViT)bf16 8×A100 80GB、8×H100/H800 或 4×H200;FP8 4×H100/H800 或 2×H200未单独标注,按 --max-model-len 自行设定5T 多模态 token 预训练,其中超过 2.5T 是科学领域语料。要完整的科学多模态能力就是这一档。
Intern-S1-mini / Intern-S1-mini-FP89B(Qwen3-8B + 0.3B InternViT)bf16 权重约 18GB,官方口径单张 80GB 级卡;FP8 版仅限 H800/H100/H200未单独标注,按 --max-model-len 自行设定整条线里唯一真正的单卡多模态版本。要求 transformers≥4.55.2、vLLM≥0.10.1、LMDeploy≥0.9.2.post1。
InternLM3-8B-Instruct8B 稠密bf16 约 16GB;官方 GGUF q4_k_m 约 5GB,4-bit 加载约 8GB 显存128K(RULER 4–128K 实测)纯文本主线的终点站,也是全家最省显存的入口。仅用 4T token 训成,自带深度思考模式,思维链最长 8,192 token。

02 —

该租哪张卡

按你要跑的版本对号入座,价格是 NexGPU 每卡每小时列表价

  • InternLM3-8B 量化推理/提示词调试

    RTX 3090 24GB$0.193/卡·时

    q4_k_m 约 5GB、bf16 约 16GB 都塞得进 24GB,而这是全网最便宜的 24GB 一档,调一天提示词不到两美元。

  • Intern-S1-mini 9B 多模态 bf16 单卡服务

    A100 PCIE 80GB$0.824/卡·时

    18GB 权重之外留足空间给 InternViT 的高分辨率切片和 KV 缓存,正好对上官方硬件表里的单张 80GB 卡口径。

  • Intern-S2-Preview-35B FP8 单卡长上下文

    H100 SXM 80GB$3.582/卡·时

    FP8 权重只认 Hopper,A100 被官方明确排除;单张 H100 就能把 36B/3B 激活的 MoE 连同 262K 上下文一起端起来。

  • Intern-S1 241B bf16 全量推理,TP8

    A100 SXM4 80GB ×8$1.088/卡·时(8 卡合计 $8.704/时)

    官方 bf16 最低配就是 8×80GB,SXM4 的 NVLink 是八路张量并行的关键;单节点最多 14 卡,640GB 显存一个节点装得下。

03 —

四步把书生·浦语跑起来

以 Intern-S1-mini 为例,换成 Intern-S1 只需要加 --tensor-parallel-size 8

  1. 01

    开机,把版本钉死

    控制台选 vLLM 或 PyTorch 预置镜像开卡。Intern-S 系列对版本很挑:transformers 低于 4.55.2 会直接加载失败,Intern-S2-Preview 还需要带 InternS2PreviewForConditionalGeneration 支持的 vLLM 版本,稳定版轮子不认这个架构。

    pip install -U "vllm>=0.10.1" "transformers>=4.55.2" "lmdeploy>=0.9.2.post1"
  2. 02

    拉权重

    先估好盘:9B 的 bf16 约 18GB,241B 的 bf16 约 482GB。存储按 $0.414/GB·月 中位价计,大权重跑完记得销毁卷——算力停机即停止计费,存储不会。

    hf download internlm/Intern-S1-mini --local-dir /workspace/Intern-S1-mini
  3. 03

    起服务,别搞混解析器

    这是最常见的翻车点:Intern-S1 系列用 --reasoning-parser intern-s1 和 --tool-call-parser intern-s1;Intern-S2-Preview 因为底座是 Qwen3.5,要换成 --reasoning-parser qwen3 加 --tool-call-parser qwen3_coder。配错了工具调用会静默变成一段普通文本。SGLang 部署 Intern-S1 还要加 --grammar-backend none。

    lmdeploy serve api_server internlm/Intern-S1-mini --reasoning-parser intern-s1 --tool-call-parser intern-s1
  4. 04

    关掉思考模式,压住上下文

    Intern-S 全系默认开启思考模式,不关的话每条回复都先吐一大段思维链,延迟和 token 开销都翻倍。另外原生上下文拉满基本必 OOM:官方在 Intern-S1-Pro 上直接用 --max-model-len 65536 兜底,Intern-S2-Preview 建议从 65K–131K 起步再往上试。

    curl http://localhost:23333/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"internlm/Intern-S1-mini","messages":[{"role":"user","content":"介绍一下你自己"}],"chat_template_kwargs":{"enable_thinking":false}}'

把账算给你看

两笔真实的账。第一笔:用 InternLM3-8B 的 q4_k_m 调提示词,RTX 3090 24GB 是 $0.193/卡·时,连着调 10 小时就是 10 × $0.193 = $1.93,比一杯咖啡便宜。第二笔:Intern-S1 241B bf16 全量推理,官方最低配 8 张 80GB。走 A100 SXM4 80GB,8 × $1.088 = $8.704/时,跑一轮 3 小时的 benchmark 是 3 × $8.704 = $26.11;同样八卡换成 H100 SXM 80GB,8 × $3.582 = $28.656/时,3 小时要 $85.97 —— 同一份 bf16 权重,A100 SXM4 省掉约七成。真正容易被忽略的是存储:Intern-S1 的 bf16 权重约 482GB(241B × 2 字节),按 $0.414/GB·月 的中位价,光放着就是每月约 $199。算力在实例停机那一秒停止计费,存储不会,所以 benchmark 跑完要么销毁卷,要么只留 FP8 权重——FP8 版体积减半,还能把部署从 8 卡压到 4 张 H100 或 2 张 H200。

04 —

常见问题

InternLM 停更了吗?为什么找不到 InternLM4?

没停更,是改名了。纯文本主线停在 2025 年 1 月的 InternLM3-8B-Instruct,之后上海人工智能实验室把主线迁到了多模态科学模型 Intern-S:Intern-S1(241B)、Intern-S1-Pro(1T 总参 / 22B 激活 / 512 专家)、以及 2026 年的 Intern-S2-Preview 系列和 Intern-S2-Mobius,全部 Apache-2.0。想按时间线把这几代挨个上手比一遍,在 NexGPU 按秒起卡最划算:试完停机,算力费当场停止。

Intern-S1 本地部署需要多大显存?单卡能跑吗?

单卡跑不了。241B 的 bf16 官方硬件表给的是 8×A100 80GB、8×H100、8×H800 或者 4×H200;FP8 版可以压到 4×H100/H800 或 2×H200。NexGPU 的 A100 SXM4 80GB 是 $1.088/卡·时,八卡合计 $8.704/时,单节点最多 14 卡、最大节点显存 2,152GB,八路张量并行走 NVLink 一个节点内就能完成。

Intern-S1-FP8 或 Intern-S2 的 FP8 权重能在 A100 上跑吗?

不能。官方硬件表里 FP8 只列了 H800、H100、H200,A100 是被明确排除的——Ampere 架构没有 FP8 张量核心。要 FP8 就得上 Hopper:NexGPU H100 SXM 80GB $3.582/卡·时、H200 141GB $6.660/卡·时。预算敏感就老实用 bf16 配 A100 PCIE 80GB $0.824/卡·时,权重大一倍但单价便宜四倍多。

为什么模型每次都先吐一大段思考过程?怎么关?

Intern-S 全系默认开启思考模式。在 tokenizer.apply_chat_template 里传 enable_thinking=False,或者在 OpenAI 兼容请求里带 chat_template_kwargs 的 enable_thinking 字段即可。顺带三个常踩的坑:SGLang 跑 Intern-S1 要加 --grammar-backend none;reasoning parser 在 S1 上是 intern-s1、在 S2-Preview 上是 qwen3;Intern-S2-Preview 需要带对应架构支持的 vLLM 版本。这些在 NexGPU 的 vLLM 预置镜像里试一遍,几分钟就通了。

24GB 显存够跑 InternLM3-8B 吗?

够,而且很宽裕。bf16 权重约 16GB,24GB 卡放得下中等长度上下文;官方 GGUF 的 q4_k_m 约 5GB,4-bit 加载约 8GB 显存,连 16GB 的 T4 都还有富余。NexGPU 的 RTX 3090 24GB $0.193/卡·时 是这条路线最便宜的一档,只跑量化推理可以选 Tesla T4 16GB $0.298/卡·时,要更快的解码就上 RTX 4090 24GB $0.540/卡·时。

InternLM 和 Intern-S 能商用吗?配套工具链有哪些?

可以,代码和权重都是 Apache-2.0。配套的三件套同样开源:LMDeploy 负责压缩、部署与服务,XTuner 负责微调(20B 级别的单卡 QLoRA 24GB 显存就够),OpenCompass 负责评测。NexGPU 的 2,000 多个预置镜像里 PyTorch、vLLM 直接可用,接入方式 SSH、Jupyter、Web 终端、REST API、CLI 随便挑,无最低消费、无开通费、无需申请配额,遇到问题在 Telegram 上中英文直接找人,没有工单队列。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。