Stable Diffusion 从来不是一个模型,而是一条代际差别极大的血脉。SD 1.5 是 0.9B 的 UNet、原生 512×512、CreativeML OpenRAIL-M 授权;SDXL 1.0 换成 3.5B 的 base 加上 refiner 组成专家集成管线,原生 1024×1024,授权升级为 OpenRAIL++-M;到 SD 3.5 这一代架构整个换成 MMDiT 多模态扩散 Transformer,Large 8.1B、Medium 2.5B,授权变成 Stability AI Community License——年营收 1000 万人民币量级(官方口径 100 万美元)以下免费商用,超过就要谈企业授权。搜索结果里那些「SD4 已发布」的文章可以直接跳过:Stability 官网的公告栏里,2025 到 2026 年发的是 Stable Audio 3.0、Brand Studio 以及和环球、华纳的合作,图像侧的开放权重最新仍然停在 3.5,Hugging Face 上 stabilityai 组织里也找不到任何 3.5 之后的图像模型。
真正决定你要租多大显存的,往往不是主干网络,而是文本编码器。SD 1.5 只挂一个 CLIP ViT-L,SDXL 挂 CLIP-L 加 OpenCLIP-G,两者加起来不到 1B;但 SD 3 系列多了一个 T5-XXL,光这一个编码器就是 4.7B 参数,fp16 常驻要吃掉约 9.5GB。这就是为什么 Stability 官方给 SD 3.5 Medium 标的数字是「9.9GB VRAM(不含文本编码器)」——把三个编码器算进去,账立刻翻倍。社区的通用解法是把 T5 换成 fp8_e4m3fn_scaled 版本,ComfyUI 的官方指引写得很直白:内存超过 32GB 用 t5xxl_fp16.safetensors,否则用 t5xxl_fp8_e4m3fn_scaled.safetensors。fp8 一体包 sd3.5_large_fp8_scaled.safetensors 把 8B 主干和编码器打包压到 11GB 出头,24GB 卡才因此变得可用。
生态这一层还得说实话:LoRA、ControlNet、IP-Adapter、各家写实和二次元 checkpoint,绝大部分仍然堆在 SDXL 和 SD 1.5 上,SD 3.5 官方只放出 canny、depth、blur 三个 ControlNet,社区微调数量远不如前两代;同时 FLUX.2 dev、Qwen-Image 这些新开放权重在提示词遵从和图内文字上又形成了新的对照组。结论就是没有一个版本能一招通吃,你多半要在同一批 prompt 上把 SDXL、SD 3.5 Large、Turbo 各跑一遍再定型。这种活最不适合先买一张卡——NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种型号,2,000+ 预置镜像里 ComfyUI、Stable Diffusion、AUTOMATIC1111、PyTorch、vLLM 都在列,按秒计费、无最低消费、无开通费,试完一档换一档,比在本机反复腾显存快得多。
01 —
各代权重与显存对照
同一条血脉,显存需求差了一个数量级,选错档位就是白租
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Stable Diffusion 3.5 Large | 8.1B(MMDiT) | bf16 主干 ≈16GB;配 T5-XXL fp16 整条管线 ≈26GB;sd3.5_large_fp8_scaled 一体包 ≈11–12GB | 1MP 原生(1024×1024)|CLIP 77 token + T5 256 token | SD 线目前的旗舰开放权重,官方 diffusers 示例用 28 步、guidance 3.5。官方 ControlNet 只有 canny / depth / blur 三个,放在 models/controlnet 下。 |
| Stable Diffusion 3.5 Large Turbo | 8.1B(ADD 对抗蒸馏) | 与 Large 同档,fp8 一体包 ≈11GB | 1MP|ComfyUI 官方建议 4 步、CFG 1.2 | 4 步就能出可用画面,适合 prompt 海选和实时预览;定稿再切回 Large 跑 28 步补细节,两个权重可以共用同一套文本编码器。 |
| Stable Diffusion 3.5 Medium | 2.5B(MMDiT-X) | 官方口径 9.9GB(不含文本编码器);用 sd3.5_medium_incl_clips_t5xxlfp8scaled 一体包约 12–14GB | 0.25–2MP(约 512×512 到 1440×1440)|CLIP 77 + T5 256 token | 唯一为消费级卡设计的 3.5 变体,位置嵌入扩展到 384×384,训练分辨率从 256 一路渐进到 1440,所以出 1440 长边不用硬拉。 |
| SDXL 1.0(base + refiner) | base 3.5B;base+refiner 整条管线 6.6B | fp16 约 8GB 能跑,10–12GB 舒适;refiner 同时常驻再加约 6GB | 1024×1024 原生|双编码器各 77 token | 专家集成去噪:base 跑前 80% 步数、refiner 收尾。LoRA / ControlNet / IP-Adapter 生态最厚的一代,CreativeML Open RAIL++-M 授权没有 3.5 的营收门槛。 |
| SDXL Turbo | 3.5B(ADD 蒸馏) | fp16 约 8GB | 512×512|1–4 步,CFG 关闭(设为 0) | 单步就能成图的实时档,用来做交互式画布、边画边生成、直播滤镜这类要低延迟的场景,画质换的是响应时间。 |
| Stable Diffusion 1.5 | 0.9B UNet | fp16 约 4GB;开 --lowvram 能压到 2–3GB | 512×512 原生|CLIP ViT-L 单编码器 77 token | 老而未死的一代,CreativeML OpenRAIL-M。注意原始的 runwayml/stable-diffusion-v1-5 仓库已被删除,现在要指向 sd-legacy 维护的 stable-diffusion-v1-5/stable-diffusion-v1-5 镜像,老脚本会 404。 |
02 —
该租哪张卡
按显存需求诚实匹配,不把 48GB 的活塞进 24GB 的卡
SD 1.5 / SDXL 日常出图与 LoRA 训练
RTX 3090 24GB$0.193/卡·时
目前最便宜的 24GB 方案,SDXL fp16 主干、refiner、ControlNet、fp16-fix 版 VAE 全部常驻还剩余量,挂一整夜批量出图也不到五美元。
SD 3.5 Medium 或 Large 的 fp8 一体包快速迭代
RTX 4090 24GB$0.540/卡·时
sd3.5_large_fp8_scaled 约 11GB,24GB 装得下还能开 batch,而 Ada 架构原生支持 FP8 张量核心,正好吃这套权重不用软件模拟。
SD 3.5 Large 走 bf16 主干 + T5-XXL fp16 不降精度
RTX A6000 48GB$0.817/卡·时
8B 主干的 16GB 加 T5 的 9.5GB 再加 ControlNet 与激活值一起常驻,48GB 是能完全不用 enable_model_cpu_offload 的最低档,出图节奏不会被 CPU 换入换出拖住。
SDXL / SD 3.5 全参微调、DreamBooth、多分辨率 bucket 训练
A100 SXM4 80GB$1.088/卡·时
80GB 装得下优化器状态和梯度,不必靠梯度检查点用速度换显存;SXM4 的互联带宽让多卡扩展不掉链子,单节点最多可挂 14 张卡。
03 —
四步把 SD 3.5 跑起来
以 ComfyUI 预置镜像为例,从开机到出第一张图
- 01
开实例并把 ComfyUI 端口带回本地
在 console.nexgpu.net 选 ComfyUI 或 PyTorch 镜像开一台机器,按上面的表选卡。实例起来后用 SSH 做端口转发,浏览器直接开 127.0.0.1:8188 就是远端的 ComfyUI;不想开终端也可以走控制台的 Jupyter 或 Web 终端。
ssh -p <port> root@<node>.nexgpu.net -L 8188:127.0.0.1:8188 - 02
接受 Community License,拉 8B 主权重
SD 3.5 系列在 Hugging Face 上是 gated 仓库,必须先在网页上勾选同意 Stability AI Community License,再用带 token 的 CLI 下载,否则直接报 401。想省显存就把主权重换成 sd3.5_large_fp8_scaled.safetensors,编码器已经打包在里面,第三步可以跳过。
hf auth login && hf download stabilityai/stable-diffusion-3.5-large sd3.5_large.safetensors --local-dir /workspace/ComfyUI/models/checkpoints - 03
补齐三个文本编码器,这一步决定你的显存账单
CLIP-L、OpenCLIP-G、T5-XXL 三个编码器要落到 ComfyUI/models/text_encoders 目录。T5 选 fp8_e4m3fn 大约 5GB,选 fp16 大约 9.5GB——这一个选择就能让整条管线在 24GB 卡上跑得动还是跑不动。用 SDXL 的话这步换成给它配 madebyollin/sdxl-vae-fp16-fix,否则 fp16 下 VAE 会溢出成 NaN 出黑图。
hf download stabilityai/stable-diffusion-3.5-large text_encoders/clip_l.safetensors text_encoders/clip_g.safetensors text_encoders/t5xxl_fp8_e4m3fn.safetensors --local-dir /workspace/ComfyUI/models - 04
出第一张图,或者直接起服务
ComfyUI 侧用官方 SD3.5 工作流即可:Large 走 28 步、CFG 3.5,Large Turbo 走 4 步、CFG 1.2。要接进自己的后端就用 diffusers 的 StableDiffusion3Pipeline,显存吃紧时加一行 enable_model_cpu_offload 换取空间。跑完 stop 实例,计算立刻停止计费,权重留在存储盘上下次直接接着用。
python -c "import torch; from diffusers import StableDiffusion3Pipeline; p=StableDiffusion3Pipeline.from_pretrained('stabilityai/stable-diffusion-3.5-large', torch_dtype=torch.bfloat16).to('cuda'); p('a neon-lit noodle stall in Chongqing at night', num_inference_steps=28, guidance_scale=3.5).images[0].save('out.png')"
一轮完整出图流程要花多少钱
假设做一批产品概念图:先在 RTX 4090 24GB($0.540/卡·时)上用 sd3.5_large_fp8_scaled 一体包试 prompt、调 ControlNet,跑 2 小时 → 2 × 0.540 = $1.08。方向定了换 RTX A6000 48GB($0.817/卡·时)跑 bf16 主干加 T5-XXL fp16 的正式批次,3 小时 → 3 × 0.817 = $2.451。权重要留着,挂一块 30GB 的模型盘(sd3.5_large 约 16.5GB、T5 fp16 约 9.5GB,再加几个 SDXL checkpoint 和 LoRA),存储按 $0.414/GB·月 计,整月是 30 × 0.414 = $12.42,只留 5 天则 12.42 × 5 ÷ 30 = $2.07。成品图导出 2GB,出网按 $0.0081/GB 计 = $0.016。四项相加 1.08 + 2.451 + 2.07 + 0.016 ≈ $5.62,一轮完整的多版本对比加正式出图就结束了。要记住两件事:计算是按秒计量、按小时计价的,实例 stop 的那一秒计算费就停了;存储费则一直算到你把盘销毁为止,所以对比做完记得清掉不再需要的 checkpoint。
04 —
