跳到主要内容

图像生成模型

Stable Diffusion 本地部署:4GB 到 48GB,每一档都有对应的卡

SD 1.5、SDXL、SD 3.5 三代权重的显存需求差了十倍以上。这一页把每个变体的真实占用、能跑它的 NexGPU 机型和每小时价格并排列出来,租之前就知道该租哪张。

Stable Diffusion 从来不是一个模型,而是一条代际差别极大的血脉。SD 1.5 是 0.9B 的 UNet、原生 512×512、CreativeML OpenRAIL-M 授权;SDXL 1.0 换成 3.5B 的 base 加上 refiner 组成专家集成管线,原生 1024×1024,授权升级为 OpenRAIL++-M;到 SD 3.5 这一代架构整个换成 MMDiT 多模态扩散 Transformer,Large 8.1B、Medium 2.5B,授权变成 Stability AI Community License——年营收 1000 万人民币量级(官方口径 100 万美元)以下免费商用,超过就要谈企业授权。搜索结果里那些「SD4 已发布」的文章可以直接跳过:Stability 官网的公告栏里,2025 到 2026 年发的是 Stable Audio 3.0、Brand Studio 以及和环球、华纳的合作,图像侧的开放权重最新仍然停在 3.5,Hugging Face 上 stabilityai 组织里也找不到任何 3.5 之后的图像模型。

真正决定你要租多大显存的,往往不是主干网络,而是文本编码器。SD 1.5 只挂一个 CLIP ViT-L,SDXL 挂 CLIP-L 加 OpenCLIP-G,两者加起来不到 1B;但 SD 3 系列多了一个 T5-XXL,光这一个编码器就是 4.7B 参数,fp16 常驻要吃掉约 9.5GB。这就是为什么 Stability 官方给 SD 3.5 Medium 标的数字是「9.9GB VRAM(不含文本编码器)」——把三个编码器算进去,账立刻翻倍。社区的通用解法是把 T5 换成 fp8_e4m3fn_scaled 版本,ComfyUI 的官方指引写得很直白:内存超过 32GB 用 t5xxl_fp16.safetensors,否则用 t5xxl_fp8_e4m3fn_scaled.safetensors。fp8 一体包 sd3.5_large_fp8_scaled.safetensors 把 8B 主干和编码器打包压到 11GB 出头,24GB 卡才因此变得可用。

生态这一层还得说实话:LoRA、ControlNet、IP-Adapter、各家写实和二次元 checkpoint,绝大部分仍然堆在 SDXL 和 SD 1.5 上,SD 3.5 官方只放出 canny、depth、blur 三个 ControlNet,社区微调数量远不如前两代;同时 FLUX.2 dev、Qwen-Image 这些新开放权重在提示词遵从和图内文字上又形成了新的对照组。结论就是没有一个版本能一招通吃,你多半要在同一批 prompt 上把 SDXL、SD 3.5 Large、Turbo 各跑一遍再定型。这种活最不适合先买一张卡——NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种型号,2,000+ 预置镜像里 ComfyUI、Stable Diffusion、AUTOMATIC1111、PyTorch、vLLM 都在列,按秒计费、无最低消费、无开通费,试完一档换一档,比在本机反复腾显存快得多。

01 —

各代权重与显存对照

同一条血脉,显存需求差了一个数量级,选错档位就是白租

版本参数量显存上下文说明
Stable Diffusion 3.5 Large8.1B(MMDiT)bf16 主干 ≈16GB;配 T5-XXL fp16 整条管线 ≈26GB;sd3.5_large_fp8_scaled 一体包 ≈11–12GB1MP 原生(1024×1024)|CLIP 77 token + T5 256 tokenSD 线目前的旗舰开放权重,官方 diffusers 示例用 28 步、guidance 3.5。官方 ControlNet 只有 canny / depth / blur 三个,放在 models/controlnet 下。
Stable Diffusion 3.5 Large Turbo8.1B(ADD 对抗蒸馏)与 Large 同档,fp8 一体包 ≈11GB1MP|ComfyUI 官方建议 4 步、CFG 1.24 步就能出可用画面,适合 prompt 海选和实时预览;定稿再切回 Large 跑 28 步补细节,两个权重可以共用同一套文本编码器。
Stable Diffusion 3.5 Medium2.5B(MMDiT-X)官方口径 9.9GB(不含文本编码器);用 sd3.5_medium_incl_clips_t5xxlfp8scaled 一体包约 12–14GB0.25–2MP(约 512×512 到 1440×1440)|CLIP 77 + T5 256 token唯一为消费级卡设计的 3.5 变体,位置嵌入扩展到 384×384,训练分辨率从 256 一路渐进到 1440,所以出 1440 长边不用硬拉。
SDXL 1.0(base + refiner)base 3.5B;base+refiner 整条管线 6.6Bfp16 约 8GB 能跑,10–12GB 舒适;refiner 同时常驻再加约 6GB1024×1024 原生|双编码器各 77 token专家集成去噪:base 跑前 80% 步数、refiner 收尾。LoRA / ControlNet / IP-Adapter 生态最厚的一代,CreativeML Open RAIL++-M 授权没有 3.5 的营收门槛。
SDXL Turbo3.5B(ADD 蒸馏)fp16 约 8GB512×512|1–4 步,CFG 关闭(设为 0)单步就能成图的实时档,用来做交互式画布、边画边生成、直播滤镜这类要低延迟的场景,画质换的是响应时间。
Stable Diffusion 1.50.9B UNetfp16 约 4GB;开 --lowvram 能压到 2–3GB512×512 原生|CLIP ViT-L 单编码器 77 token老而未死的一代,CreativeML OpenRAIL-M。注意原始的 runwayml/stable-diffusion-v1-5 仓库已被删除,现在要指向 sd-legacy 维护的 stable-diffusion-v1-5/stable-diffusion-v1-5 镜像,老脚本会 404。

02 —

该租哪张卡

按显存需求诚实匹配,不把 48GB 的活塞进 24GB 的卡

  • SD 1.5 / SDXL 日常出图与 LoRA 训练

    RTX 3090 24GB$0.193/卡·时

    目前最便宜的 24GB 方案,SDXL fp16 主干、refiner、ControlNet、fp16-fix 版 VAE 全部常驻还剩余量,挂一整夜批量出图也不到五美元。

  • SD 3.5 Medium 或 Large 的 fp8 一体包快速迭代

    RTX 4090 24GB$0.540/卡·时

    sd3.5_large_fp8_scaled 约 11GB,24GB 装得下还能开 batch,而 Ada 架构原生支持 FP8 张量核心,正好吃这套权重不用软件模拟。

  • SD 3.5 Large 走 bf16 主干 + T5-XXL fp16 不降精度

    RTX A6000 48GB$0.817/卡·时

    8B 主干的 16GB 加 T5 的 9.5GB 再加 ControlNet 与激活值一起常驻,48GB 是能完全不用 enable_model_cpu_offload 的最低档,出图节奏不会被 CPU 换入换出拖住。

  • SDXL / SD 3.5 全参微调、DreamBooth、多分辨率 bucket 训练

    A100 SXM4 80GB$1.088/卡·时

    80GB 装得下优化器状态和梯度,不必靠梯度检查点用速度换显存;SXM4 的互联带宽让多卡扩展不掉链子,单节点最多可挂 14 张卡。

03 —

四步把 SD 3.5 跑起来

以 ComfyUI 预置镜像为例,从开机到出第一张图

  1. 01

    开实例并把 ComfyUI 端口带回本地

    在 console.nexgpu.net 选 ComfyUI 或 PyTorch 镜像开一台机器,按上面的表选卡。实例起来后用 SSH 做端口转发,浏览器直接开 127.0.0.1:8188 就是远端的 ComfyUI;不想开终端也可以走控制台的 Jupyter 或 Web 终端。

    ssh -p <port> root@<node>.nexgpu.net -L 8188:127.0.0.1:8188
  2. 02

    接受 Community License,拉 8B 主权重

    SD 3.5 系列在 Hugging Face 上是 gated 仓库,必须先在网页上勾选同意 Stability AI Community License,再用带 token 的 CLI 下载,否则直接报 401。想省显存就把主权重换成 sd3.5_large_fp8_scaled.safetensors,编码器已经打包在里面,第三步可以跳过。

    hf auth login && hf download stabilityai/stable-diffusion-3.5-large sd3.5_large.safetensors --local-dir /workspace/ComfyUI/models/checkpoints
  3. 03

    补齐三个文本编码器,这一步决定你的显存账单

    CLIP-L、OpenCLIP-G、T5-XXL 三个编码器要落到 ComfyUI/models/text_encoders 目录。T5 选 fp8_e4m3fn 大约 5GB,选 fp16 大约 9.5GB——这一个选择就能让整条管线在 24GB 卡上跑得动还是跑不动。用 SDXL 的话这步换成给它配 madebyollin/sdxl-vae-fp16-fix,否则 fp16 下 VAE 会溢出成 NaN 出黑图。

    hf download stabilityai/stable-diffusion-3.5-large text_encoders/clip_l.safetensors text_encoders/clip_g.safetensors text_encoders/t5xxl_fp8_e4m3fn.safetensors --local-dir /workspace/ComfyUI/models
  4. 04

    出第一张图,或者直接起服务

    ComfyUI 侧用官方 SD3.5 工作流即可:Large 走 28 步、CFG 3.5,Large Turbo 走 4 步、CFG 1.2。要接进自己的后端就用 diffusers 的 StableDiffusion3Pipeline,显存吃紧时加一行 enable_model_cpu_offload 换取空间。跑完 stop 实例,计算立刻停止计费,权重留在存储盘上下次直接接着用。

    python -c "import torch; from diffusers import StableDiffusion3Pipeline; p=StableDiffusion3Pipeline.from_pretrained('stabilityai/stable-diffusion-3.5-large', torch_dtype=torch.bfloat16).to('cuda'); p('a neon-lit noodle stall in Chongqing at night', num_inference_steps=28, guidance_scale=3.5).images[0].save('out.png')"

一轮完整出图流程要花多少钱

假设做一批产品概念图:先在 RTX 4090 24GB($0.540/卡·时)上用 sd3.5_large_fp8_scaled 一体包试 prompt、调 ControlNet,跑 2 小时 → 2 × 0.540 = $1.08。方向定了换 RTX A6000 48GB($0.817/卡·时)跑 bf16 主干加 T5-XXL fp16 的正式批次,3 小时 → 3 × 0.817 = $2.451。权重要留着,挂一块 30GB 的模型盘(sd3.5_large 约 16.5GB、T5 fp16 约 9.5GB,再加几个 SDXL checkpoint 和 LoRA),存储按 $0.414/GB·月 计,整月是 30 × 0.414 = $12.42,只留 5 天则 12.42 × 5 ÷ 30 = $2.07。成品图导出 2GB,出网按 $0.0081/GB 计 = $0.016。四项相加 1.08 + 2.451 + 2.07 + 0.016 ≈ $5.62,一轮完整的多版本对比加正式出图就结束了。要记住两件事:计算是按秒计量、按小时计价的,实例 stop 的那一秒计算费就停了;存储费则一直算到你把盘销毁为止,所以对比做完记得清掉不再需要的 checkpoint。

04 —

常见问题

Stable Diffusion 现在最新是哪个版本?网上说的 SD4 是真的吗?

开放权重最新的仍然是 Stable Diffusion 3.5,包含 Large 8.1B、Large Turbo 和 Medium 2.5B 三个变体。Stability AI 官网公告栏里 2025 到 2026 年发布的是 Stable Audio 3.0、Brand Studio 以及和环球音乐、华纳音乐的合作,Hugging Face 的 stabilityai 组织里最近更新的图像模型也只是 SD 3.5 和 SDXL 的 AMD NPU 移植版,没有任何 3.5 之后的新图像权重。那些标题写着「SD4 已发布、支持 4096×4096」的文章是拼凑出来的 SEO 内容,不要按它们的规格去配硬件。真想验证,在 NexGPU 上开一台 RTX 3090 花不到两毛钱一小时,把 3.5 和 SDXL 各跑一遍,比看十篇测评有用。

Stable Diffusion 本地部署到底需要多大显存?

分四档记:SD 1.5 fp16 约 4GB,开 --lowvram 能压进 2–3GB;SDXL fp16 约 8GB 能跑、10–12GB 舒适,同时挂 refiner 再加约 6GB;SD 3.5 Medium 官方口径是 9.9GB(不含文本编码器),加上 fp8 编码器一体包实际 12–14GB;SD 3.5 Large 用 fp8 一体包约 11–12GB,走 bf16 主干加 T5-XXL fp16 则要 26GB 上下。NexGPU 这四档分别对应 Tesla T4 16GB $0.298、RTX 3090 24GB $0.193、RTX 4090 24GB $0.540 和 RTX A6000 48GB $0.817,按秒计费,跑错档位换一台重开就行。

24GB 的 4090 能跑 SD 3.5 Large 吗?

能,但要走量化路线。最省事的是直接下 ComfyUI 的 sd3.5_large_fp8_scaled.safetensors 一体包,主干和三个编码器一起压到 11GB 出头,24GB 绰绰有余还能开 batch;走 diffusers 的话用 bitsandbytes 的 NF4 量化,再加 enable_model_cpu_offload,同样能塞进 24GB。想要 bf16 主干配 T5-XXL fp16 完全不降精度,24GB 就不够了,得上 RTX 5090 32GB($0.723/卡·时)或者 RTX A6000 48GB($0.817/卡·时)。这两档 NexGPU 都有现货,切换只是重开一台的事。

SDXL 和 SD 3.5 我该选哪个?

看你要生态还是要画质和授权自由度。SDXL 1.0 的 LoRA、ControlNet、IP-Adapter、社区 checkpoint 数量是 SD 3.5 的很多倍,CreativeML Open RAIL++-M 授权也没有营收门槛,做风格化、角色一致性、既有工作流迁移基本还是它;SD 3.5 Large 在提示词遵从和图内文字上明显更强,但官方 ControlNet 只有三个,且商用要受 Community License 的年营收 100 万美元门槛约束,超过要谈企业授权。最现实的做法是同一批 prompt 两边各跑一遍再决定——在 NexGPU 上开两台 RTX 3090 并行跑,一小时不到四毛钱,比争论快。

为什么我的 SDXL 出图全是黑的或者报 NaN?

这是 SDXL 最经典的坑:原版 VAE 的内部激活值太大,在 fp16 下会数值溢出变成 NaN,解码出来就是纯黑图。两个解法,一是换成 madebyollin/sdxl-vae-fp16-fix,它把网络内部的权重和偏置缩小、保持最终输出一致,专门为 fp16 修的;二是在 AUTOMATIC1111 或 Forge 启动参数里加 --no-half-vae,让 VAE 单独跑 fp32,代价是多吃一点显存。NexGPU 的 24GB 卡跑第二种方案完全不吃力,SDXL 的 ComfyUI 和 AUTOMATIC1111 镜像也都在 2,000+ 预置镜像里,开机就是配好的环境。

runwayml/stable-diffusion-v1-5 打不开了,SD 1.5 现在从哪拉?

RunwayML 已经把那个仓库从 Hugging Face 上撤了,所有指向 runwayml/stable-diffusion-v1-5 的老脚本和 Dockerfile 都会 404。现在的标准做法是改用 sd-legacy 组织维护的镜像 stable-diffusion-v1-5/stable-diffusion-v1-5,模型本身没变,仍是 0.9B、512×512、CreativeML OpenRAIL-M 授权,只是仓库 ID 换了。SD 1.5 fp16 只要 4GB 显存,在 NexGPU 上用 Tesla P40 24GB($0.214/卡·时)或 RTX 3090 24GB($0.193/卡·时)跑批量图性价比很高,双语支持走 Telegram,没有工单排队。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。