跳到主要内容

文本 / 多模态大模型

Kimi 本地部署:先算清楚这 1.56TB 权重要落在几张卡上

月之暗面把 K2.5、K2.6、K2.7-Code 直到 K3 的权重全放了出来,可它们从 16B 到 2.8T 横跨两个数量级。这页把每个版本真实的显存账摊开,再把对应的卡按小时租给你。

Kimi 是月之暗面(Moonshot AI)的对话产品,但工程师搜「Kimi 本地部署」时真正要找的,是 huggingface.co/moonshotai 上那一堆开放权重。这条线到今天已经拉得很长:2025 年 7 月的 Kimi K2(1T 总参 / 32B 激活,上下文从 128K 在 9 月更新到 256K),11 月的 K2 Thinking,2026 年 1 月的 K2.5 补上原生多模态与 instant/thinking 双模,4 月 20 日的 K2.6 带来 Agent Swarm,6 月 12 日的 K2.7-Code 专攻智能体编码,再到 7 月 27 日开放权重的 K3 —— 2.8T 总参、104B 激活、1M 上下文。

版本换代直接改写了自建的算术。K2.5 之后的每一代都带原生 INT4 检查点,量化是在后训练阶段用 QAT 做进去的,不是事后拿 GPTQ 一刀切,所以 1T 参数落地只有约 594GB(K2.7-Code 约 630GB),实测显存占用约 640GB,官方验证配置就是 8 卡 H200 141GB、TP=8。K3 更激进:MXFP4 权重配 MXFP8 激活,从 SFT 阶段起就做量化感知训练,Hugging Face 仓库 96 个 safetensors 分片合计 1.561TB。这已经不是「一张卡够不够」的问题了。

所以真正该问的从来不是「Kimi 需要多大显存」,而是「你要哪一个 Kimi」。想跑通视觉推理,Kimi-VL-A3B-Thinking-2506 只有 16B、MIT 许可,一张 48GB 卡就够;想验证 KDA 线性注意力和百万上下文,Kimi Linear 48B-A3B 在 FP16 下约 102GB,两张 A100 80GB 拿下;想要 K2.6 那套多模态 Agent 能力,八张 H200 起步;想要 K3 原生精度,得准备 1.7TB 以上的聚合显存。NexGPU 从 $0.188/卡·时 的 V100 一路排到 141GB 的 H200,单节点最多 14 张卡、2,152GB 显存,这四条路线都开得起来。

01 —

Kimi 开放权重版本对照

从 16B 单卡可跑,到 2.8T 需要整机柜,全在同一个 moonshotai 组织下

版本参数量显存上下文说明
Kimi K32.8T-A104B(896 专家选 16 + 2 共享)原生 MXFP4 检查点 1.561TB;社区 GGUF 最低 UD-IQ1_S 594GB(建议 RAM+VRAM ≥ 610GB)1,048,576(1M)当前旗舰。首个用 Kimi Delta Attention(69 层 KDA + 24 层 Gated MLA)的正式版,强制 thinking,原生看图看视频。授权是自成一体的 Kimi K3 License,不是 MIT。
Kimi K2.7-Code1T-A32B(384 专家选 8 + 1 共享)原生 INT4 约 630GB,需每卡 ≥140GB 的 8 卡机(TP=8)256K智能体编码专用,强制 thinking 且 preserve_thinking 常开,思考 token 比 K2.6 少约 30%。第三方引擎不支持视频输入与 instant 模式。
Kimi K2.61T-A32B(61 层,MLA 隐藏维 7168 / 64 头)原生 INT4 约 594GB,实测显存约 640GB256K通用多模态主力,带 400M 的 MoonViT 视觉编码器与 Agent Swarm。Modified MIT,vLLM/SGLang/KTransformers 都跑得通,是自建性价比最高的 1T 档。
Kimi K2.51T-A32B原生 INT4 约 594GB256K第一个原生多模态的 K2,1.5 万亿 token 视觉语言预训练,instant 与 thinking 双模可切。想要非思考模式的低延迟响应就选它,K2.7-Code 已经不给关思考的选项了。
Kimi Linear 48B-A3B-Instruct48B-A3BFP16 约 102GB(1K 上下文)/约 114GB(跑满 1M 上下文)1MKDA 的公开验证机,线性注意力与 MLA 按 3:1 交错,KV cache 砍掉约 75%、解码最快约 6 倍。想在两三张卡上摸清 K3 的架构脾气,从这里入手最划算。
Kimi-VL-A3B-Thinking-250616B-A2.8Bbf16 约 32GB(加视觉塔与 KV 留到 40GB 上下)131,072MIT 许可的视觉推理小模型,单图支持到 320 万像素,VideoMMMU 65.2。整个 Kimi 家族里唯一真能塞进一张消费级/工作站卡的选择。

02 —

四种 Kimi 自建场景该租哪张卡

按显存诚实匹配:1T 模型不会被塞进 24GB 卡里糊弄你

  • 单卡跑 Kimi-VL-A3B-Thinking-2506 做视觉推理评测

    RTX A6000 48GB$0.817/卡·时

    16B 权重 bf16 约 32GB,48GB 给 MoonViT 的高分辨率图块和 128K KV 留足余量,不用开张量并行也不用降精度。

  • 两卡跑 Kimi Linear 48B-A3B,验证 KDA 与 1M 长上下文

    A100 PCIE 80GB × 2$0.824/卡·时

    官方 FP16 占用 102GB 起、拉满百万上下文约 114GB,160GB 聚合显存刚好覆盖,还留得下 CUDA Graph 和批处理空间。

  • 生产级部署 Kimi K2.6 / K2.5 / K2.7-Code 原生 INT4

    H200 141GB × 8$6.660/卡·时

    官方验证的就是 8 卡 TP=8,1,128GB 聚合显存装下约 640GB 权重后,剩下的全给 256K 上下文的 KV 池和多路并发。

  • K3 原生 MXFP4 全精度单节点推理

    H200 141GB × 14$6.660/卡·时

    1.561TB 检查点摊到 14 卡是每卡约 112GB 权重,1,974GB 聚合显存留出的 KV 余量比公开的 16 卡两节点报告(每卡 102.75GB 权重 + 7.95GB KV)还宽。

03 —

从开机到 Kimi 接口可用

以 K2.6 原生 INT4 为主线,顺带交代 K3 的多卡拓扑和预算路线

  1. 01

    开实例、拉权重,先看清楚仓库有多大

    在 NexGPU 控制台选 8 卡 H200 节点,挑 vLLM 预置镜像(2,000+ 镜像里已经带好 CUDA 与 PyTorch)。K2.6 的 INT4 权重约 594GB,K3 是 1.561TB、96 个分片,务必先把数据盘开够。计算按秒计费、停机即停,但存储要到你销毁卷才停。

    hf download moonshotai/Kimi-K2.6 --local-dir /workspace/Kimi-K2.6
  2. 02

    用 vLLM 起服务,两个 parser 一个都不能少

    Kimi 的思考内容和工具调用都要靠专用 parser 才能被正确拆出来:漏掉 --reasoning-parser 就拿不到 reasoning_content,漏掉 --tool-call-parser 就只能收到裸文本。多模态编码器建议走数据并行,TP 越大 MoonViT 的开销反而越明显。transformers 需要 >=4.57.1,<5.0.0。

    vllm serve /workspace/Kimi-K2.6 -tp 8 --mm-encoder-tp-mode data --trust-remote-code --tool-call-parser kimi_k2 --reasoning-parser kimi_k2 --max-model-len 262144
  3. 03

    多轮工具调用把 reasoning_content 原样回灌

    这是自建 Kimi 最常踩的坑:多步工具调用时,上一轮 assistant 消息里的 reasoning_content 必须原封不动放回上下文,否则直接报错。工具调用 ID 也得是 functions.{函数名}:{序号} 这种格式,历史里出现 search:0 之类的畸形 ID,模型后面就会跟着生成错的 ID。采样按官方建议用 temperature 1.0、top_p 0.95。

    messages.append({"role": "assistant", "reasoning_content": msg.reasoning_content, "tool_calls": msg.tool_calls})
  4. 04

    预算路线:llama.cpp 跑 K3 低比特 GGUF

    不想为 1.561TB 买单,就走社区量化。Unsloth 的动态量化里 UD-IQ1_S 是 594GB(top-1 约 78.9%,PPL 2.58),UD-IQ1_M 648.9GB(81.2%),UD-Q2_K_XL 861.3GB(90.4%,PPL 1.74),UD-Q8_K_XL 1,560GB 才算无损。经验法则是 RAM 加 VRAM 约等于量化文件本身的大小。另外提醒:K3 在 Hopper 上没有原生 MXFP4,SGLang 要走 marlin 反量化,公开报告里单流只有 16.8 tok/s、54 并发时约 147 tok/s,冷启动加载权重要十一分钟左右;Triton 的 JIT 缓存记得指到本地 /tmp,放共享盘会因为 rank 冲突崩掉。

    ./llama.cpp/llama-server --model /workspace/K3/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-*.gguf --mmproj mmproj-BF16.gguf --ctx-size 32768 --temp 1.0 --top-p 0.95 -ngl 99

把 Kimi 跑起来到底要花多少

一轮 6 小时的 K2.6 私有化评测:8 张 H200 是 8 × $6.660 = $53.28/时,6 小时 $319.68;594GB 的 INT4 权重留 3 天,594 × $0.414 ÷ 30 × 3 ≈ $24.59;导出 20GB 评测日志与结果,20 × $0.0081 ≈ $0.16。合计约 $344.43,跑完停机,计算立刻停止计费。想省钱就换一条线:Kimi Linear 48B-A3B 在两张 A100 PCIE 80GB 上是 2 × $0.824 = $1.648/时,连续跑满一周 168 小时也才 $276.86,比上面那 6 小时还便宜。真要碰 K3 全精度就得认账:14 张 H200 是 $93.24/时,光是加载 1.561TB 权重的约 11 分钟加 40 秒 CUDA Graph 编译,按秒计费也要扣掉约 $20.2 —— 所以调参时别频繁重启服务,能热改就热改。没有最低消费、没有开通费、不用提配额工单,这三笔账就是全部账。

04 —

常见问题

Kimi 能在一张 24GB 显卡上本地部署吗?

K2 系列和 K3 都不行,1T 模型光 INT4 权重就 594GB。但 Kimi 家族里确实有能单卡跑的:Kimi-VL-A3B-Thinking-2506 只有 16B,bf16 约 32GB,一张 RTX A6000 48GB($0.817/卡·时)就能带 128K 上下文跑视觉推理。想先在 24GB 上摸摸 Kimi 的对话与推理风格,NexGPU 的 RTX 4090 是 $0.540/卡·时,RTX 3090 更低到 $0.193,按秒计费,试完就停。

Kimi K3 和 Kimi K2.6 自建,我该选哪个?

看你有多少卡。K2.6 是 1T-A32B、256K 上下文、Modified MIT,原生 INT4 约 594GB,八张 H200 一个节点就搞定,是绝大多数团队私有化的正确答案。K3 是 2.8T-A104B、1M 上下文,MXFP4 检查点 1.561TB,还要面对 Hopper 上的 marlin 反量化损耗。NexGPU 单节点最多 14 张卡、2,152GB 显存,两条路都开得出来,先用 8 卡 H200 把 K2.6 跑通再决定要不要上 K3,是更省钱的顺序。

Kimi 开源权重的许可证能直接商用吗?

K2、K2.5、K2.6、K2.7-Code 都是 Modified MIT:标准 MIT 文本后面加一条,月活超过 1 亿或月收入超过 2000 万美元的产品要在界面上显著标注模型名。K3 换了,用的是自成一体的 Kimi K3 License,五条编号条款,其中对做 Model as a Service 的公司额外要求:连续 12 个月合计收入超过 2000 万美元的,商用前需要单独和月之暗面签协议。落地前请让法务读原文,别照抄「Kimi 是 MIT」这句旧结论。在 NexGPU 上跑的是你自己的实例,权重和数据都在你手里,不经过我们的推理服务。

1T 参数为什么只要 594GB?我按 FP16 算是 2TB。

因为 Kimi 的 INT4 不是事后量化的。K2 Thinking 之后每一代都在后训练阶段做 QAT(量化感知训练),官方直接发布原生 INT4 检查点,推理速度约翻倍、显存约省一半,质量损失很小。K3 更进一步,从 SFT 阶段起就用 MXFP4 权重加 MXFP8 激活训练。所以别拿参数量乘二字节去估卡,直接按发布的检查点大小算。要验证这个数字,在 NexGPU 开 8 卡 H200 跑一小时 $53.28 就能自己量出来。

自建 Kimi 比调官方 API 便宜吗?

纯按 token 算,通常不便宜。K2.6 官方 API 大约是每百万 token 输入 $0.95、输出 $4;K3 是输入 $3、输出 $15,缓存命中降到 $0.30。而八卡 H200 是 $53.28/时,要靠吞吐把这笔钱摊平,需要相当高的持续并发。自建真正值钱的地方在别处:数据不出你的 VPC、可以在权重上继续做微调和蒸馏、版本被你冻住不会某天被下线、延迟和路由由你决定。NexGPU 覆盖 51 个国家和地区、1,175 个已验证可租节点,数据合规该落在哪个区就落在哪个区。

Kimi K2 Thinking 现在还值得部署吗?

它已经被 K2.5、K2.6 接棒了 —— 后者在同样的 1T-A32B 骨架上补了原生多模态和 Agent Swarm,上下文也从 K2 早期的 128K 提到 256K。除非你的评测基线绑死在 K2 Thinking 上,否则新项目直接从 K2.6 起步;纯做智能体编码就上 K2.7-Code,思考 token 还能再省约 30%。这几个版本的硬件形态几乎一样,都是 8 卡 H200、TP=8,在 NexGPU 上换个镜像换个权重目录就能对比,按秒计费,跑完就停。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。