跳到主要内容

大模型私有化部署

开源权重跑在你自己的机器

权重是公开的,卡不是。DeepSeek-V4-Flash 四比特量化后 155GB,一张卡装不下;Qwen3.8-27B 量化后单卡就够。这一页把能真正下载到权重的主流开源模型、各自的内存门槛、以及对应该租哪种机型,一次列清。

27B 级模型每小时起
$0.540
V4-Flash 最小可用量化
103GB
单节点最高显存
2152GB

01 — 先判断要不要

什么时候值得私有化部署

私有化部署不是默认更好的选项,它是一笔用成本换控制权的交易。调 API 的边际成本几乎为零、不用管运维、模型永远是最新的;私有化部署要你自己扛内存、扛并发、扛升级。所以先问清楚:你到底在买什么。

值得买的情况有三种。一是数据根本不允许离开你的网络——金融风控、病历、法务合同、未公开的设计图纸,这类场景里合规不是加分项而是准入门槛。二是长期高并发,当调用量大到 API 账单持续跑在一台包月机器之上时,自建的摊薄成本会反超。三是你要改模型本身:继续预训练、灌行业语料、做结构化输出的深度对齐,这些都需要权重在手。

不值得的情况更常见:日调用量几千次、没有强合规要求、团队没有推理运维经验。这种情况下按 token 付费几乎总是更便宜,而且省下的时间比省下的钱值钱。真正的分界线不是模型多大,而是你有没有一个必须持续占住显存的理由。

02 — 典型场景

哪些场景必须私有化

共同点不是模型能力,而是数据不能走出去。

  • 内网知识库与文档问答

    把内部规章、产品手册、历史工单灌进检索库,模型只回答自己企业的知识。全流程在你租用的实例内完成,语料与索引都不经过第三方 API,也不进任何厂商的训练数据。

  • 受监管行业的合规推理

    金融、医疗、政企场景里,数据出网本身就是风险事件。私有化部署配合独占实例与专有网络,可以把模型在哪台机器上运算写进合规文档,也能配合指定地区部署满足数据驻留要求。

  • 持续高并发的自有服务

    当线上服务的调用量长期稳定在高位,按 token 付费的账单会持续超过一台常驻机器的成本。这时候把推理搬到自己的实例上,成本从变动支出变成固定支出,也不再受上游限流影响。

  • 需要动权重的深度定制

    继续预训练、行业语料微调、结构化输出对齐——凡是要改模型本身而不只是改提示词的,都必须拿到权重。开源模型的价值在这里才真正兑现。

03 — 部署栈

三条路线,按并发选

同一份权重,用不同的推理引擎跑,吞吐和显存占用差别很大。

  • vLLM / SGLang — 高并发生产

    PagedAttention 与连续批处理让显存利用率显著提高,是有并发压力时的默认选择。原生提供 OpenAI 兼容接口,现有代码把 base_url 换掉就能接。适合把私有模型当成内部服务对外提供。

    vLLM · SGLang · OpenAI 兼容 · 张量并行

  • llama.cpp / GGUF — 极限压内存

    GGUF 量化把权重压到三到八比特,是让超大 MoE 模型挤进有限内存的关键。社区量化版本齐全,也支持 GPU 与内存混合加载。代价是吞吐低于 vLLM,适合单人或小团队内测。

    llama.cpp · GGUF · 3–8bit 量化 · CPU/GPU 混合

  • Ollama / Open WebUI — 最快跑通

    一条命令拉起模型,配上 Open WebUI 就是一个可用的内部聊天入口。适合先验证效果、给业务方演示,确认价值之后再换成 vLLM 做生产。

    Ollama · Open WebUI · 一键启动

04 — 内存对照

哪个模型需要多少内存

内存要装下权重加 KV cache。下表按量化后的权重体积给出门槛,并匹配当前库存里最便宜的合规机型;大模型需要多卡节点整机租用。

模型与量化内存门槛当前最便宜可选说明
Qwen3.8-27B · 四比特量化20GBTesla V100$0.188/小时27.78B 稠密原生多模态,Apache 2.0。量化后单卡即可承载,是私有化部署里最容易落地的一档。
DeepSeek-V4-Flash · 三比特 IQ3_XXS110GBH200$6.660/小时权重约 103GB。284B 总参数、13B 激活的 MoE,极限压缩下可跑,质量有损失。单张大显存卡或多卡节点都能承载。
DeepSeek-V4-Flash · 四比特 Q4_K_XL162GBB200$10.797/小时权重约 155GB,生产部署最常见的选择。要求 162GB 以上可用内存,单卡大显存机型或多卡节点均可。
DeepSeek-V4-Pro / Qwen3.8-Max400GB需多卡节点1.6T 与 2.4T 级 MoE。官方无 GGUF,社区量化压到 Q2_K 仍约 400GB,自建不现实——按小时租多卡节点做评估更划算。

「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。

05 — 上手

三步跑起第一个私有模型

  • 01

    按内存门槛选机型

    先用上表定下量化档位与内存门槛,再选对应的单卡或多卡节点。多卡节点整机出租,显存可合并使用,不必自己配互联。

  • 02

    拉起推理引擎

    从预置镜像启动 vLLM 或 Ollama,或直接拉你自己的 Docker 镜像。权重可从公开仓库下载到实例内,也可以从你的私有仓库拉取。

  • 03

    接入并压测

    OpenAI 兼容接口指向实例端口,现有代码改一行 base_url。先按真实并发压一轮,确认吞吐和内存余量之后再决定长期用预留实例还是按小时。

06 — FAQ

关于大模型私有化部署

DeepSeek V4 私有化部署需要多少显存?

取决于量化档位。DeepSeek-V4-Flash(284B 总参数 / 13B 激活)社区 GGUF 量化后:三比特 IQ3_XXS 权重约 103GB、建议内存 110GB 起;四比特 Q4_K_XL 约 155GB、建议 162GB 起;近乎无损的 Q8_K_XL 约 162GB、建议 169GB 起。旗舰 V4-Pro(1.6T 总参数 / 49B 激活)官方未提供 GGUF,社区版即使压到 Q2_K 仍约 400GB,本地自建不现实。以上为社区实测值,实际占用还要加 KV cache,随上下文长度增长。

Qwen3.8 能私有化部署吗?单卡够不够?

能。Qwen3.8-27B 于 2026 年 8 月 14 日以 Apache 2.0 开源,27.78B 稠密原生多模态,上下文 262K 可扩展至 1M,量化后单卡可跑。更高一档的 Qwen3.8-Max(2.4T 总参数 / 约 95B 激活)权重也已于 8 月 12 日放出,但 2.4T 规模自建推理集群门槛极高,通常按小时租多卡节点做评估更合适。

私有化部署和调 API 相比,成本什么时候划算?

分界线是显存被占住的时长。按小时租用只在实例运行时计费,所以做评估、跑批量任务、间断使用时,租用几乎总是更便宜。当线上服务需要 7×24 常驻显存、且调用量长期稳定在高位时,包月或预留实例的摊薄成本才会反超按 token 付费。真正无法用成本衡量的是合规——数据不允许出网时,这不是一道算术题。

私有化部署时我的数据和权重安全吗?

实例为独占使用,运行期间的权重与数据存放在你所租用的节点上,销毁实例即释放。企业方案可选数据隔离、专有网络与指定地区部署。需要注意一个区别:公有云上的私有化部署,指的是模型与数据不经过第三方推理 API,而不是物理隔离机房;若你的合规要求是后者,应当走专属集群方案。具体条款以《服务条款》与《隐私政策》为准。

所有开源模型都能私有化部署吗?

不是。开源这个词经常被混用:有的模型只开放 API,从未公布可下载权重。例如 DeepSeek-V4-Flash-Vision-Exp 于 2026 年 8 月 21 日上线 API,但未公布参数规模与权重下载,无法私有化部署。选型时要确认三件事:权重是否真的可下载、许可证是否允许商用(MIT 与 Apache 2.0 最宽松)、以及有没有地域限制。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。