跳到主要内容

文本大模型

DeepSeek 本地部署:284B 到 1.57T,显存到底要多少

从 3B 的 OCR-2 到 1.57T 的 V4-Pro,DeepSeek 现在是一整个家族。这一页把每一档的真实权重体积、能跑它的卡、以及自建时会踩的坑一次讲清楚。

先纠正一个过时前提:DeepSeek 的主线早已不是很多教程里还在写的 R1 和 V3,而是 V4。V4 于 2026 年 4 月首发,7 月 31 日更新出 DeepSeek-V4-Flash-0731,8 月 13 日 DeepSeek-V4-Pro-0813 作为正式旗舰取代了 4 月的预览版。两个尺寸都是 MoE:Flash 284B 总参、每 token 激活 13B;Pro 1.57T 总参、激活 48B。全部 MIT 许可,权重在 Hugging Face 的 deepseek-ai 组织下直接可下。顺带回答一个高频搜索——R2 至今没有发布,官方也从未给过时间表,DeepSeek 的做法是把推理能力用 low / high / max 三档 reasoning effort 并进 V4 主线,你不必再等一个独立的推理模型。

架构上 V4 和 V3.2 是两回事,而这直接决定你的显存账。V4 用混合稀疏注意力:每层先在最近 128 个原始 token 上做滑动窗口,再叠一路压缩——要么 4:1 的 top-k 稀疏(C4),要么 128:1 的密集压缩(C128),靠这套把上下文顶到 1M,最大输出 384K。同时用 mHC(manifold-constrained hyper-connections)把残差流换成 hc_mult 条并行分支上的逐 token 混合。效率提升是实打实的:在 1M 上下文下,V4-Pro 单 token 推理只需要 V3.2 的 27% FLOPs 和 10% KV cache。Pro 的具体规格是 61 层、hidden 7168、每个 MoE 层 384 个路由专家加 1 个共享专家、每 token 激活 6 个,并且原生带 FP4 专家权重。

落到你真正要问的问题上——租多大的卡。Flash 的 FP8 原生权重约 148.66 GiB,Q4 量化 GGUF 是 155GB,最激进的 UD-IQ1_S 也要 82.5GB;Pro 的 Q4 直接 850GB。所以「DeepSeek 本地部署 24GB 显卡够不够」这个问题,对 V4 的答案是明确不够,对 DeepSeek-OCR-2(3B)和 DeepSeek-R1-Distill-Qwen-32B(Q4_K_M 约 18–20GB)的答案是够。下面按这几条真实路线分开给配置,不做乐观估计。

01 —

DeepSeek 各版本参数与显存对照

体积以官方权重文件和 Unsloth 实测量化为准,不是推算值

版本参数量显存上下文说明
DeepSeek-V4-Pro-08131.57T 总参 / 48B 激活GGUF UD-Q4_K_XL 850GB、UD-Q8_K_XL 873GB1M(最大输出 384K)当前旗舰,8 月 13 日正式版取代 4 月预览版,agentic 能力是这次升级重点。自建门槛在 TB 级显存,属于整机柜级别的活。
DeepSeek-V4-Flash-0731284B 总参 / 13B 激活FP8 原生权重 ≈148.66 GiB;GGUF UD-Q4_K_XL 155GB、UD-IQ3_XXS 104GB、UD-IQ1_S 82.5GB1M(最大输出 384K)自建最现实的一档。13B 激活意味着解码的算力压力远小于 284B 这个数字给人的印象,真正的瓶颈是「装不装得下」。
DeepSeek-V4-Flash-DSpark284B / 13B 激活 + 投机解码头在对应量化基础上再留约 10GB;drafter 本体 Q8_0 10.9GB、BF16 11.3GB1M同一份 checkpoint 外挂 MTP 投机解码模块,解码最高约 2 倍提速,代价是额外显存。上生产值得开,做效果验证可以先不开。
DeepSeek-V4-Flash-Vision-Exp基于 Flash 的多模态实验版目前只在官方 API 提供,未见对应开放权重1M如果你既要视觉输入又必须私有化,这一档暂时走不通,需要排期等权重放出,规划时不要把它算进去。
DeepSeek-OCR-23BBF16 约 7GB,单卡随便跑动态分辨率 (0–6)×768×768 + 1×1024×10241 月 27 日发布,DeepEncoder V2 加 Visual Causal Flow,olmOCR-bench 总分 76.3,Apache 2.0 许可,中文版面表现明显好过上一代。V4 是通用语言模型,并不替代它。
DeepSeek-R1-Distill-Qwen-32B32B 稠密Q4_K_M 约 18–20GB128K(config 标称)老模型,但仍是 24GB 单卡上唯一跑得动的 DeepSeek 系推理模型。留约 4GB 给 KV cache 正好塞满一张 24GB 卡,做本地评估和离线批处理够用。

02 —

按真实场景选卡

显存对不上就是起不来,这里不给「勉强能跑」的建议

  • 跑 DeepSeek-OCR-2,或 R1-Distill-Qwen-32B 的 Q4,做单卡本地评估

    RTX 4090 24GB$0.540/卡·时

    OCR-2 的 3B BF16 只吃 7GB 左右,32B 蒸馏的 Q4_K_M 18–20GB 也刚好留出 KV cache 余量;预算再紧可以换 RTX 3090 24GB,$0.193/卡·时。

  • 用 llama.cpp 跑 V4-Flash 的 UD-Q4_K_XL(155GB)做完整效果验证

    A100 PCIE 80GB ×4$0.824/卡·时

    四卡 320GB 装 155GB 权重加上下文绰绰有余,合计 $3.296/时,是把完整 DeepSeek-V4-Flash 跑起来最便宜的一条路。

  • vLLM / SGLang 上线 V4-Flash 的 FP8 原生权重,要吞吐

    H200 141GB ×2$6.660/卡·时

    FP8 张量核心从 Hopper 起才有,148.66 GiB 权重两张 H200 共 282GB 装得下;配上 DSpark 投机解码,吞吐可以对齐官方 API。

  • 私有化整套 V4-Pro,Q4 量化 850GB

    H200 141GB ×8$6.660/卡·时

    八卡 1,128GB 才压得住 850GB 权重加 1M 上下文的 KV。我们单节点最多 14 卡、最大 2,152GB 显存,这一档开得出来。

03 —

在 NexGPU 上把 DeepSeek 跑起来

以 V4-Flash 为例,两条路线:GGUF 快速验证,FP8 上生产

  1. 01

    开实例,直接选带 vLLM 的预置镜像

    在 console.nexgpu.net 挑一台 4×A100 PCIE 80GB 或 2×H200 的节点,从 2,000+ 预置镜像里选 vLLM 或 PyTorch,省掉 CUDA、驱动、FlashInfer 的版本对齐。SSH、Jupyter、Web 终端、REST API、CLI 都通。开机即计费,按秒计量。

    ssh root@<your-node> -p <port>
  2. 02

    拉权重

    GGUF 路线拉 Unsloth 的动态量化,FP8 路线直接拉官方仓库。155GB 别放系统盘,挂到数据盘再落地——实例停了算力不计费,权重还在,下次开机不用重下。

    hf download unsloth/DeepSeek-V4-Flash-0731-GGUF --include "*UD-Q4_K_XL*" --local-dir /workspace/v4-flash
  3. 03

    起服务

    验证效果用 llama.cpp 一行就够:llama serve -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q4_K_XL。上生产走 vLLM 的 FP8 路线,三个必须注意的点:V4 有自己的 tokenizer 和 tool-call parser,要显式指定;block-size 给到 256;KV cache 用 fp8。想开 Think Max 就必须把 max-model-len 拉到 393216,否则输出会被截断。

    vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --tensor-parallel-size 2 --kv-cache-dtype fp8 --block-size 256 --trust-remote-code --tokenizer-mode deepseek_v4 --tool-call-parser deepseek_v4 --gpu-memory-utilization 0.92 --max-model-len 393216
  4. 04

    验证并接入

    服务是 OpenAI 兼容接口,原来打官方 API 的代码改一个 base_url 就切过来了。确认 reasoning effort 三档都按预期生效之后,再决定要不要挂 DSpark drafter 用约 10GB 显存换解码速度。

    curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"你好"}]}'

一次完整的 V4-Flash 验证要花多少钱

按 4×A100 PCIE 80GB 跑 UD-Q4_K_XL 算:$0.824 × 4 = $3.296/时,连续压测 8 小时就是 $26.37。权重 155GB 存这 8 小时,按 $0.414/GB·月 折算是 155 × 0.414 ÷ 730 × 8 ≈ $0.70。跑完导出 20GB 日志和评测结果,egress 按 $0.0081/GB 计是 $0.16。合计约 $27.23,就把完整的 DeepSeek-V4-Flash 效果摸清楚了。同样 8 小时如果换成 2×H200 的 FP8 生产配置,是 $6.660 × 2 × 8 = $106.56,多出来的钱买的是吞吐和上线路径,值不值你自己判断。计费按秒计量、按小时定价,没有起租时长、没有开通费、不用申请配额;实例一停算力就不再计费,只有存储会一直算到你把它销毁为止。

04 —

常见问题

DeepSeek 本地部署到底需要多大显存?

取决于你部署哪一档。DeepSeek-V4-Flash 的 FP8 原生权重约 148.66 GiB,Q4 量化 GGUF 是 155GB,最激进的 UD-IQ1_S 也要 82.5GB;V4-Pro 的 Q4 直接 850GB。想单卡跑就只能退到 DeepSeek-OCR-2(3B,BF16 约 7GB)或 R1-Distill-Qwen-32B(Q4_K_M 18–20GB)。NexGPU 从 24GB 的 RTX 3090($0.193/卡·时)到 141GB 的 H200,单节点最多 14 卡、最大 2,152GB 显存,这四档需求都能一次开出来。

24GB 的 RTX 4090 能跑 DeepSeek-V4 吗?

跑不了。V4-Flash 最小的量化也要 82.5GB,24GB 差着一个数量级,靠系统内存 offload 只会慢到没有实用价值。24GB 卡上现实的 DeepSeek 选择是 R1-Distill-Qwen-32B 的 Q4_K_M(18–20GB,留约 4GB 给 KV cache)和 DeepSeek-OCR-2。这两个在 NexGPU 的 RTX 4090 24GB($0.540/卡·时)上开箱即用,想更省就用 RTX 3090 24GB($0.193/卡·时)。

A100 能直接吃 DeepSeek-V4 的 FP8 权重吗?

不能。A100 是 Ampere 架构,没有 FP8 张量核心——FP8 要从 Hopper(H100/H200)起才有硬件支持。在 A100 上你要么把权重反量化回 bf16(284B 的 Flash 会膨胀到 500GB 以上),要么走 llama.cpp 的 GGUF 路线,后者才是 A100 跑 V4-Flash 的正确姿势:4 张 A100 PCIE 80GB 共 320GB,$0.824/卡·时。真要上 FP8 生产,NexGPU 的 H100 SXM 80GB($3.582/卡·时)和 H200 141GB($6.660/卡·时)随时可开。

DeepSeek R2 什么时候发布?现在该等它吗?

别等了。到目前为止 R2 从未正式发布,官方也没给过任何时间表,网上流传的 R2 规格基本都是猜测。DeepSeek 实际的做法是把推理能力并进主线——V4 自带 low / high / max 三档 reasoning effort,要深度推理就把档位拉到 max(记得 max-model-len 给到 393216,否则输出会被截断)。想现在就试,在 NexGPU 上开一台带 vLLM 预置镜像的机器,按秒计费,试完就停。

DeepSeek V3.2 和 R1 现在还值得部署吗?

看场景。V3.2 是 671B 总参 / 37B 激活、用 DSA 稀疏注意力,效率上已经被 V4 明显甩开——V4-Pro 在 1M 上下文下单 token 只要 V3.2 的 27% FLOPs 和 10% KV cache,新项目没有理由从 V3.2 起步。R1 本体同理,但它的 32B 蒸馏版仍是 24GB 单卡上唯一跑得动的 DeepSeek 系推理模型,做离线批处理还有价值。这两条线在 NexGPU 上都能开,差别只是你选 RTX 4090 还是 H200。

DeepSeek 的开源许可能商用吗?自建有哪些坑?

许可上很干净:V4-Pro 和 V4-Flash 都是 MIT,DeepSeek-OCR-2 是 Apache 2.0,商用没有额外授权成本。坑主要在工程侧——V4 用自己的 encoding 脚本而不是 Jinja chat template,vLLM 必须显式指定 tokenizer-mode 和 tool-call-parser;NVFP4 专家权重不走 deep_gemm_mega_moe(那条 kernel 只吃 FP8),会掉回默认 MoE 后端而损失性能;张量并行用 2 的幂次卡数才好排布。这些在 NexGPU 上试错成本很低:按秒计费、无起租、无开通费,Telegram 上有中英文工程支持,不用排工单。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。