先纠正一个过时前提:DeepSeek 的主线早已不是很多教程里还在写的 R1 和 V3,而是 V4。V4 于 2026 年 4 月首发,7 月 31 日更新出 DeepSeek-V4-Flash-0731,8 月 13 日 DeepSeek-V4-Pro-0813 作为正式旗舰取代了 4 月的预览版。两个尺寸都是 MoE:Flash 284B 总参、每 token 激活 13B;Pro 1.57T 总参、激活 48B。全部 MIT 许可,权重在 Hugging Face 的 deepseek-ai 组织下直接可下。顺带回答一个高频搜索——R2 至今没有发布,官方也从未给过时间表,DeepSeek 的做法是把推理能力用 low / high / max 三档 reasoning effort 并进 V4 主线,你不必再等一个独立的推理模型。
架构上 V4 和 V3.2 是两回事,而这直接决定你的显存账。V4 用混合稀疏注意力:每层先在最近 128 个原始 token 上做滑动窗口,再叠一路压缩——要么 4:1 的 top-k 稀疏(C4),要么 128:1 的密集压缩(C128),靠这套把上下文顶到 1M,最大输出 384K。同时用 mHC(manifold-constrained hyper-connections)把残差流换成 hc_mult 条并行分支上的逐 token 混合。效率提升是实打实的:在 1M 上下文下,V4-Pro 单 token 推理只需要 V3.2 的 27% FLOPs 和 10% KV cache。Pro 的具体规格是 61 层、hidden 7168、每个 MoE 层 384 个路由专家加 1 个共享专家、每 token 激活 6 个,并且原生带 FP4 专家权重。
落到你真正要问的问题上——租多大的卡。Flash 的 FP8 原生权重约 148.66 GiB,Q4 量化 GGUF 是 155GB,最激进的 UD-IQ1_S 也要 82.5GB;Pro 的 Q4 直接 850GB。所以「DeepSeek 本地部署 24GB 显卡够不够」这个问题,对 V4 的答案是明确不够,对 DeepSeek-OCR-2(3B)和 DeepSeek-R1-Distill-Qwen-32B(Q4_K_M 约 18–20GB)的答案是够。下面按这几条真实路线分开给配置,不做乐观估计。
01 —
DeepSeek 各版本参数与显存对照
体积以官方权重文件和 Unsloth 实测量化为准,不是推算值
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| DeepSeek-V4-Pro-0813 | 1.57T 总参 / 48B 激活 | GGUF UD-Q4_K_XL 850GB、UD-Q8_K_XL 873GB | 1M(最大输出 384K) | 当前旗舰,8 月 13 日正式版取代 4 月预览版,agentic 能力是这次升级重点。自建门槛在 TB 级显存,属于整机柜级别的活。 |
| DeepSeek-V4-Flash-0731 | 284B 总参 / 13B 激活 | FP8 原生权重 ≈148.66 GiB;GGUF UD-Q4_K_XL 155GB、UD-IQ3_XXS 104GB、UD-IQ1_S 82.5GB | 1M(最大输出 384K) | 自建最现实的一档。13B 激活意味着解码的算力压力远小于 284B 这个数字给人的印象,真正的瓶颈是「装不装得下」。 |
| DeepSeek-V4-Flash-DSpark | 284B / 13B 激活 + 投机解码头 | 在对应量化基础上再留约 10GB;drafter 本体 Q8_0 10.9GB、BF16 11.3GB | 1M | 同一份 checkpoint 外挂 MTP 投机解码模块,解码最高约 2 倍提速,代价是额外显存。上生产值得开,做效果验证可以先不开。 |
| DeepSeek-V4-Flash-Vision-Exp | 基于 Flash 的多模态实验版 | 目前只在官方 API 提供,未见对应开放权重 | 1M | 如果你既要视觉输入又必须私有化,这一档暂时走不通,需要排期等权重放出,规划时不要把它算进去。 |
| DeepSeek-OCR-2 | 3B | BF16 约 7GB,单卡随便跑 | 动态分辨率 (0–6)×768×768 + 1×1024×1024 | 1 月 27 日发布,DeepEncoder V2 加 Visual Causal Flow,olmOCR-bench 总分 76.3,Apache 2.0 许可,中文版面表现明显好过上一代。V4 是通用语言模型,并不替代它。 |
| DeepSeek-R1-Distill-Qwen-32B | 32B 稠密 | Q4_K_M 约 18–20GB | 128K(config 标称) | 老模型,但仍是 24GB 单卡上唯一跑得动的 DeepSeek 系推理模型。留约 4GB 给 KV cache 正好塞满一张 24GB 卡,做本地评估和离线批处理够用。 |
02 —
按真实场景选卡
显存对不上就是起不来,这里不给「勉强能跑」的建议
跑 DeepSeek-OCR-2,或 R1-Distill-Qwen-32B 的 Q4,做单卡本地评估
RTX 4090 24GB$0.540/卡·时
OCR-2 的 3B BF16 只吃 7GB 左右,32B 蒸馏的 Q4_K_M 18–20GB 也刚好留出 KV cache 余量;预算再紧可以换 RTX 3090 24GB,$0.193/卡·时。
用 llama.cpp 跑 V4-Flash 的 UD-Q4_K_XL(155GB)做完整效果验证
A100 PCIE 80GB ×4$0.824/卡·时
四卡 320GB 装 155GB 权重加上下文绰绰有余,合计 $3.296/时,是把完整 DeepSeek-V4-Flash 跑起来最便宜的一条路。
vLLM / SGLang 上线 V4-Flash 的 FP8 原生权重,要吞吐
H200 141GB ×2$6.660/卡·时
FP8 张量核心从 Hopper 起才有,148.66 GiB 权重两张 H200 共 282GB 装得下;配上 DSpark 投机解码,吞吐可以对齐官方 API。
私有化整套 V4-Pro,Q4 量化 850GB
H200 141GB ×8$6.660/卡·时
八卡 1,128GB 才压得住 850GB 权重加 1M 上下文的 KV。我们单节点最多 14 卡、最大 2,152GB 显存,这一档开得出来。
03 —
在 NexGPU 上把 DeepSeek 跑起来
以 V4-Flash 为例,两条路线:GGUF 快速验证,FP8 上生产
- 01
开实例,直接选带 vLLM 的预置镜像
在 console.nexgpu.net 挑一台 4×A100 PCIE 80GB 或 2×H200 的节点,从 2,000+ 预置镜像里选 vLLM 或 PyTorch,省掉 CUDA、驱动、FlashInfer 的版本对齐。SSH、Jupyter、Web 终端、REST API、CLI 都通。开机即计费,按秒计量。
ssh root@<your-node> -p <port> - 02
拉权重
GGUF 路线拉 Unsloth 的动态量化,FP8 路线直接拉官方仓库。155GB 别放系统盘,挂到数据盘再落地——实例停了算力不计费,权重还在,下次开机不用重下。
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF --include "*UD-Q4_K_XL*" --local-dir /workspace/v4-flash - 03
起服务
验证效果用 llama.cpp 一行就够:llama serve -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q4_K_XL。上生产走 vLLM 的 FP8 路线,三个必须注意的点:V4 有自己的 tokenizer 和 tool-call parser,要显式指定;block-size 给到 256;KV cache 用 fp8。想开 Think Max 就必须把 max-model-len 拉到 393216,否则输出会被截断。
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --tensor-parallel-size 2 --kv-cache-dtype fp8 --block-size 256 --trust-remote-code --tokenizer-mode deepseek_v4 --tool-call-parser deepseek_v4 --gpu-memory-utilization 0.92 --max-model-len 393216 - 04
验证并接入
服务是 OpenAI 兼容接口,原来打官方 API 的代码改一个 base_url 就切过来了。确认 reasoning effort 三档都按预期生效之后,再决定要不要挂 DSpark drafter 用约 10GB 显存换解码速度。
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"你好"}]}'
一次完整的 V4-Flash 验证要花多少钱
按 4×A100 PCIE 80GB 跑 UD-Q4_K_XL 算:$0.824 × 4 = $3.296/时,连续压测 8 小时就是 $26.37。权重 155GB 存这 8 小时,按 $0.414/GB·月 折算是 155 × 0.414 ÷ 730 × 8 ≈ $0.70。跑完导出 20GB 日志和评测结果,egress 按 $0.0081/GB 计是 $0.16。合计约 $27.23,就把完整的 DeepSeek-V4-Flash 效果摸清楚了。同样 8 小时如果换成 2×H200 的 FP8 生产配置,是 $6.660 × 2 × 8 = $106.56,多出来的钱买的是吞吐和上线路径,值不值你自己判断。计费按秒计量、按小时定价,没有起租时长、没有开通费、不用申请配额;实例一停算力就不再计费,只有存储会一直算到你把它销毁为止。
04 —
