Kimi 是月之暗面(Moonshot AI)的对话产品,但工程师搜「Kimi 本地部署」时真正要找的,是 huggingface.co/moonshotai 上那一堆开放权重。这条线到今天已经拉得很长:2025 年 7 月的 Kimi K2(1T 总参 / 32B 激活,上下文从 128K 在 9 月更新到 256K),11 月的 K2 Thinking,2026 年 1 月的 K2.5 补上原生多模态与 instant/thinking 双模,4 月 20 日的 K2.6 带来 Agent Swarm,6 月 12 日的 K2.7-Code 专攻智能体编码,再到 7 月 27 日开放权重的 K3 —— 2.8T 总参、104B 激活、1M 上下文。
版本换代直接改写了自建的算术。K2.5 之后的每一代都带原生 INT4 检查点,量化是在后训练阶段用 QAT 做进去的,不是事后拿 GPTQ 一刀切,所以 1T 参数落地只有约 594GB(K2.7-Code 约 630GB),实测显存占用约 640GB,官方验证配置就是 8 卡 H200 141GB、TP=8。K3 更激进:MXFP4 权重配 MXFP8 激活,从 SFT 阶段起就做量化感知训练,Hugging Face 仓库 96 个 safetensors 分片合计 1.561TB。这已经不是「一张卡够不够」的问题了。
所以真正该问的从来不是「Kimi 需要多大显存」,而是「你要哪一个 Kimi」。想跑通视觉推理,Kimi-VL-A3B-Thinking-2506 只有 16B、MIT 许可,一张 48GB 卡就够;想验证 KDA 线性注意力和百万上下文,Kimi Linear 48B-A3B 在 FP16 下约 102GB,两张 A100 80GB 拿下;想要 K2.6 那套多模态 Agent 能力,八张 H200 起步;想要 K3 原生精度,得准备 1.7TB 以上的聚合显存。NexGPU 从 $0.188/卡·时 的 V100 一路排到 141GB 的 H200,单节点最多 14 张卡、2,152GB 显存,这四条路线都开得起来。
01 —
Kimi 开放权重版本对照
从 16B 单卡可跑,到 2.8T 需要整机柜,全在同一个 moonshotai 组织下
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Kimi K3 | 2.8T-A104B(896 专家选 16 + 2 共享) | 原生 MXFP4 检查点 1.561TB;社区 GGUF 最低 UD-IQ1_S 594GB(建议 RAM+VRAM ≥ 610GB) | 1,048,576(1M) | 当前旗舰。首个用 Kimi Delta Attention(69 层 KDA + 24 层 Gated MLA)的正式版,强制 thinking,原生看图看视频。授权是自成一体的 Kimi K3 License,不是 MIT。 |
| Kimi K2.7-Code | 1T-A32B(384 专家选 8 + 1 共享) | 原生 INT4 约 630GB,需每卡 ≥140GB 的 8 卡机(TP=8) | 256K | 智能体编码专用,强制 thinking 且 preserve_thinking 常开,思考 token 比 K2.6 少约 30%。第三方引擎不支持视频输入与 instant 模式。 |
| Kimi K2.6 | 1T-A32B(61 层,MLA 隐藏维 7168 / 64 头) | 原生 INT4 约 594GB,实测显存约 640GB | 256K | 通用多模态主力,带 400M 的 MoonViT 视觉编码器与 Agent Swarm。Modified MIT,vLLM/SGLang/KTransformers 都跑得通,是自建性价比最高的 1T 档。 |
| Kimi K2.5 | 1T-A32B | 原生 INT4 约 594GB | 256K | 第一个原生多模态的 K2,1.5 万亿 token 视觉语言预训练,instant 与 thinking 双模可切。想要非思考模式的低延迟响应就选它,K2.7-Code 已经不给关思考的选项了。 |
| Kimi Linear 48B-A3B-Instruct | 48B-A3B | FP16 约 102GB(1K 上下文)/约 114GB(跑满 1M 上下文) | 1M | KDA 的公开验证机,线性注意力与 MLA 按 3:1 交错,KV cache 砍掉约 75%、解码最快约 6 倍。想在两三张卡上摸清 K3 的架构脾气,从这里入手最划算。 |
| Kimi-VL-A3B-Thinking-2506 | 16B-A2.8B | bf16 约 32GB(加视觉塔与 KV 留到 40GB 上下) | 131,072 | MIT 许可的视觉推理小模型,单图支持到 320 万像素,VideoMMMU 65.2。整个 Kimi 家族里唯一真能塞进一张消费级/工作站卡的选择。 |
02 —
四种 Kimi 自建场景该租哪张卡
按显存诚实匹配:1T 模型不会被塞进 24GB 卡里糊弄你
单卡跑 Kimi-VL-A3B-Thinking-2506 做视觉推理评测
RTX A6000 48GB$0.817/卡·时
16B 权重 bf16 约 32GB,48GB 给 MoonViT 的高分辨率图块和 128K KV 留足余量,不用开张量并行也不用降精度。
两卡跑 Kimi Linear 48B-A3B,验证 KDA 与 1M 长上下文
A100 PCIE 80GB × 2$0.824/卡·时
官方 FP16 占用 102GB 起、拉满百万上下文约 114GB,160GB 聚合显存刚好覆盖,还留得下 CUDA Graph 和批处理空间。
生产级部署 Kimi K2.6 / K2.5 / K2.7-Code 原生 INT4
H200 141GB × 8$6.660/卡·时
官方验证的就是 8 卡 TP=8,1,128GB 聚合显存装下约 640GB 权重后,剩下的全给 256K 上下文的 KV 池和多路并发。
K3 原生 MXFP4 全精度单节点推理
H200 141GB × 14$6.660/卡·时
1.561TB 检查点摊到 14 卡是每卡约 112GB 权重,1,974GB 聚合显存留出的 KV 余量比公开的 16 卡两节点报告(每卡 102.75GB 权重 + 7.95GB KV)还宽。
03 —
从开机到 Kimi 接口可用
以 K2.6 原生 INT4 为主线,顺带交代 K3 的多卡拓扑和预算路线
- 01
开实例、拉权重,先看清楚仓库有多大
在 NexGPU 控制台选 8 卡 H200 节点,挑 vLLM 预置镜像(2,000+ 镜像里已经带好 CUDA 与 PyTorch)。K2.6 的 INT4 权重约 594GB,K3 是 1.561TB、96 个分片,务必先把数据盘开够。计算按秒计费、停机即停,但存储要到你销毁卷才停。
hf download moonshotai/Kimi-K2.6 --local-dir /workspace/Kimi-K2.6 - 02
用 vLLM 起服务,两个 parser 一个都不能少
Kimi 的思考内容和工具调用都要靠专用 parser 才能被正确拆出来:漏掉 --reasoning-parser 就拿不到 reasoning_content,漏掉 --tool-call-parser 就只能收到裸文本。多模态编码器建议走数据并行,TP 越大 MoonViT 的开销反而越明显。transformers 需要 >=4.57.1,<5.0.0。
vllm serve /workspace/Kimi-K2.6 -tp 8 --mm-encoder-tp-mode data --trust-remote-code --tool-call-parser kimi_k2 --reasoning-parser kimi_k2 --max-model-len 262144 - 03
多轮工具调用把 reasoning_content 原样回灌
这是自建 Kimi 最常踩的坑:多步工具调用时,上一轮 assistant 消息里的 reasoning_content 必须原封不动放回上下文,否则直接报错。工具调用 ID 也得是 functions.{函数名}:{序号} 这种格式,历史里出现 search:0 之类的畸形 ID,模型后面就会跟着生成错的 ID。采样按官方建议用 temperature 1.0、top_p 0.95。
messages.append({"role": "assistant", "reasoning_content": msg.reasoning_content, "tool_calls": msg.tool_calls}) - 04
预算路线:llama.cpp 跑 K3 低比特 GGUF
不想为 1.561TB 买单,就走社区量化。Unsloth 的动态量化里 UD-IQ1_S 是 594GB(top-1 约 78.9%,PPL 2.58),UD-IQ1_M 648.9GB(81.2%),UD-Q2_K_XL 861.3GB(90.4%,PPL 1.74),UD-Q8_K_XL 1,560GB 才算无损。经验法则是 RAM 加 VRAM 约等于量化文件本身的大小。另外提醒:K3 在 Hopper 上没有原生 MXFP4,SGLang 要走 marlin 反量化,公开报告里单流只有 16.8 tok/s、54 并发时约 147 tok/s,冷启动加载权重要十一分钟左右;Triton 的 JIT 缓存记得指到本地 /tmp,放共享盘会因为 rank 冲突崩掉。
./llama.cpp/llama-server --model /workspace/K3/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-*.gguf --mmproj mmproj-BF16.gguf --ctx-size 32768 --temp 1.0 --top-p 0.95 -ngl 99
把 Kimi 跑起来到底要花多少
一轮 6 小时的 K2.6 私有化评测:8 张 H200 是 8 × $6.660 = $53.28/时,6 小时 $319.68;594GB 的 INT4 权重留 3 天,594 × $0.414 ÷ 30 × 3 ≈ $24.59;导出 20GB 评测日志与结果,20 × $0.0081 ≈ $0.16。合计约 $344.43,跑完停机,计算立刻停止计费。想省钱就换一条线:Kimi Linear 48B-A3B 在两张 A100 PCIE 80GB 上是 2 × $0.824 = $1.648/时,连续跑满一周 168 小时也才 $276.86,比上面那 6 小时还便宜。真要碰 K3 全精度就得认账:14 张 H200 是 $93.24/时,光是加载 1.561TB 权重的约 11 分钟加 40 秒 CUDA Graph 编译,按秒计费也要扣掉约 $20.2 —— 所以调参时别频繁重启服务,能热改就热改。没有最低消费、没有开通费、不用提配额工单,这三笔账就是全部账。
04 —
