01 — 先判断要不要
什么时候值得私有化部署
私有化部署不是默认更好的选项,它是一笔用成本换控制权的交易。调 API 的边际成本几乎为零、不用管运维、模型永远是最新的;私有化部署要你自己扛内存、扛并发、扛升级。所以先问清楚:你到底在买什么。
值得买的情况有三种。一是数据根本不允许离开你的网络——金融风控、病历、法务合同、未公开的设计图纸,这类场景里合规不是加分项而是准入门槛。二是长期高并发,当调用量大到 API 账单持续跑在一台包月机器之上时,自建的摊薄成本会反超。三是你要改模型本身:继续预训练、灌行业语料、做结构化输出的深度对齐,这些都需要权重在手。
不值得的情况更常见:日调用量几千次、没有强合规要求、团队没有推理运维经验。这种情况下按 token 付费几乎总是更便宜,而且省下的时间比省下的钱值钱。真正的分界线不是模型多大,而是你有没有一个必须持续占住显存的理由。
02 — 典型场景
哪些场景必须私有化
共同点不是模型能力,而是数据不能走出去。
内网知识库与文档问答
把内部规章、产品手册、历史工单灌进检索库,模型只回答自己企业的知识。全流程在你租用的实例内完成,语料与索引都不经过第三方 API,也不进任何厂商的训练数据。
受监管行业的合规推理
金融、医疗、政企场景里,数据出网本身就是风险事件。私有化部署配合独占实例与专有网络,可以把模型在哪台机器上运算写进合规文档,也能配合指定地区部署满足数据驻留要求。
持续高并发的自有服务
当线上服务的调用量长期稳定在高位,按 token 付费的账单会持续超过一台常驻机器的成本。这时候把推理搬到自己的实例上,成本从变动支出变成固定支出,也不再受上游限流影响。
需要动权重的深度定制
继续预训练、行业语料微调、结构化输出对齐——凡是要改模型本身而不只是改提示词的,都必须拿到权重。开源模型的价值在这里才真正兑现。
03 — 部署栈
三条路线,按并发选
同一份权重,用不同的推理引擎跑,吞吐和显存占用差别很大。
vLLM / SGLang — 高并发生产
PagedAttention 与连续批处理让显存利用率显著提高,是有并发压力时的默认选择。原生提供 OpenAI 兼容接口,现有代码把 base_url 换掉就能接。适合把私有模型当成内部服务对外提供。
vLLM · SGLang · OpenAI 兼容 · 张量并行
llama.cpp / GGUF — 极限压内存
GGUF 量化把权重压到三到八比特,是让超大 MoE 模型挤进有限内存的关键。社区量化版本齐全,也支持 GPU 与内存混合加载。代价是吞吐低于 vLLM,适合单人或小团队内测。
llama.cpp · GGUF · 3–8bit 量化 · CPU/GPU 混合
Ollama / Open WebUI — 最快跑通
一条命令拉起模型,配上 Open WebUI 就是一个可用的内部聊天入口。适合先验证效果、给业务方演示,确认价值之后再换成 vLLM 做生产。
Ollama · Open WebUI · 一键启动
04 — 内存对照
哪个模型需要多少内存
内存要装下权重加 KV cache。下表按量化后的权重体积给出门槛,并匹配当前库存里最便宜的合规机型;大模型需要多卡节点整机租用。
| 模型与量化 | 内存门槛 | 当前最便宜可选 | 说明 |
|---|---|---|---|
| Qwen3.8-27B · 四比特量化 | 20GB | Tesla V100$0.188/小时 | 27.78B 稠密原生多模态,Apache 2.0。量化后单卡即可承载,是私有化部署里最容易落地的一档。 |
| DeepSeek-V4-Flash · 三比特 IQ3_XXS | 110GB | H200$6.660/小时 | 权重约 103GB。284B 总参数、13B 激活的 MoE,极限压缩下可跑,质量有损失。单张大显存卡或多卡节点都能承载。 |
| DeepSeek-V4-Flash · 四比特 Q4_K_XL | 162GB | B200$10.797/小时 | 权重约 155GB,生产部署最常见的选择。要求 162GB 以上可用内存,单卡大显存机型或多卡节点均可。 |
| DeepSeek-V4-Pro / Qwen3.8-Max | 400GB | 需多卡节点 | 1.6T 与 2.4T 级 MoE。官方无 GGUF,社区量化压到 Q2_K 仍约 400GB,自建不现实——按小时租多卡节点做评估更划算。 |
「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。
05 — 上手
三步跑起第一个私有模型
01
按内存门槛选机型
先用上表定下量化档位与内存门槛,再选对应的单卡或多卡节点。多卡节点整机出租,显存可合并使用,不必自己配互联。
02
拉起推理引擎
从预置镜像启动 vLLM 或 Ollama,或直接拉你自己的 Docker 镜像。权重可从公开仓库下载到实例内,也可以从你的私有仓库拉取。
03
接入并压测
OpenAI 兼容接口指向实例端口,现有代码改一行 base_url。先按真实并发压一轮,确认吞吐和内存余量之后再决定长期用预留实例还是按小时。
06 — FAQ
