AUTOMATIC1111/stable-diffusion-webui 是 GitHub 上 16.4 万星、3.06 万 fork 的 AGPL-3.0 项目,也是整个 Stable Diffusion 扩展生态事实上的接口标准。它的现状需要先说清楚:功能封版在 v1.10.0——那一版带来了 SD3 支持、Align Your Steps / KL Optimal / Normal / DDIM / Simple / Beta 六个新调度器、DDIM CFG++ 采样器,以及前若干步跳过 CFG 的选项;之后的 v1.10.1 只改了一件事,changelog 原文是 fix image upscale on cpu。master 分支的最后一次提交停在 2024-07-27。但它并没有死:dev 分支仍在收装机类修复,2025-10 修 Linux 下的 uv、2025-12 更新 stable_diffusion_repo 地址、2026-02 修 CLIP 安装失败、2026-03 修 pip install 'setuptools<70' 在 cmd 下失败——全是「让它还能装上」的活。
真正劝退本机安装的是那份依赖清单。requirements_versions.txt 至今钉着 gradio==3.41.2、transformers==4.30.2、numpy==1.26.2、Pillow==9.5.0、pytorch_lightning==1.9.4、fastapi==0.94.0、setuptools==69.5.1,launch_utils.py 里默认 pip install torch==2.1.2 torchvision==0.16.2 走 cu121 索引,xformers 钉在 0.0.23.post1。webui.sh 默认去找 python3.10,Windows 上更是只认 3.10,装完还会因为版本不是 3.10.6 给你告警。numpy 锁在 1.x 意味着这个 venv 里塞不进任何现代包。还有一个新装必踩的坑:modules/sd_models.py 里默认权重下载地址仍写死 runwayml/stable-diffusion-v1-5/resolve/main/v1-5-pruned-emaonly.safetensors,而那个仓库现在直接返回 401,models/Stable-diffusion 为空的全新安装会卡在这一步。
分叉这条线也得摊开讲。lllyasviel 的 Forge 基于 webui 1.10.1、换成 Gradio 4,补上了上游从未有过的 Flux 支持(BitsAndBytes NF4、GGUF Q8_0/Q5/Q4)、多路 ControlNet、IP-Adapter 和 Instant-ID,主分支最后一次提交是 2025-06-26(Add Chroma、Add support for fp8 scaled 都在那前后);Haoming02 的 forge-classic 把 classic 分支当归档留在 Gradio 3.41.2、只保 SD1/SDXL,活跃的是 neo 分支,推荐 torch 2.10.0+cu130、xformers 0.0.34、Python 3.11.9,砍掉 SD2/SD3/超网络/Deepbooru/TI 训练/bitsandbytes,换上 SageAttention、FlashAttention 和 torch.compile。同一套 UI、同一批扩展、四条互不兼容的依赖栈——这正是它该跑在租来的机器上而不是你本机的理由。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种型号,2,000+ 预置镜像里 AUTOMATIC1111、Stable Diffusion、ComfyUI、PyTorch 都在列,按秒计费、无最低消费、无开通费、无需申请配额,装崩一次销毁重开的成本以分计。
01 —
版本、分叉与它们各自能跑的东西
上游封版、dev 续命、Forge 系接棒——选错分支,你想跑的模型根本加载不出来。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| v1.10.1(当前唯一正式版) | gradio 3.41.2 · torch 2.1.2+cu121 · xformers 0.0.23.post1 | SD 1.5 开 xformers 峰值约 2.8GB;SDXL 实用起步 12GB | SD 1.x / SD 2.x / SDXL / SD3 Medium | AGPL-3.0。相对 1.10.0 的唯一改动是 fix image upscale on cpu,所以功能上等同封版。ControlNet、ADetailer 这类主流扩展全部针对这套接口编写,兼容性最好的仍是它。 |
| v1.10.0(功能封版点) | master 最后一批合并,2024-07-27 定格 | SD3 Medium 一体包 4.34GB / 5.97GB / 10.87GB(t5 fp8) / 15.76GB(t5 fp16) | 新增 SD3 支持,Euler 为推荐采样器 | 带来六个新调度器(Align Your Steps、KL Optimal、Normal、DDIM、Simple、Beta)、DDIM CFG++ 采样器、前几步跳过 CFG 的选项,以及下载后按 hash 校验模型。SD 3.5 是它封版之后三个月才发布的,从未进过上游。 |
| dev 分支(仍在维护) | 依赖 pin 与 master 几乎一致,仅 safetensors 由 0.4.2 提到 0.4.5 | 与 v1.10.1 相同 | 不加新模型,只保证装得上 | 最近的提交清一色是安装修复:fix uv on linux(2025-10)、update stable_diffusion_repo url(2025-12)、Fix CLIP installation failures(2026-02)、修 setuptools 安装(2026-03)。在 2026 年新开机器,直接 clone -b dev 比 master 省事。 |
| Forge(lllyasviel) | 基于 webui 1.10.1 · Gradio 4.40 · 推荐 CUDA 12.1 + PyTorch 2.3.1 | Flux GGUF Q4_K_S 6.81GB / Q8_0 12.71GB / F16 23.80GB(仅主干,不含 T5-XXL) | SD 1.5 / SDXL / SD3 / Flux | 上游 A1111 一天都没支持过 Flux,要在这套 UI 里跑 Flux 只能走 Forge 系。支持 BitsAndBytes NF4 与 GGUF Q8_0/Q5_0/Q5_1/Q4_0/Q4_1、多 ControlNet、IP-Adapter、Instant-ID。README 的原话是「不要把 GPU Weight 设太高,调低它能解决 99% 的问题」。主分支最后一次提交 2025-06-26。 |
| forge-classic / neo(Haoming02) | neo:torch 2.10.0+cu130 · xformers 0.0.34 · Python 3.11.9 | 随所载权重浮动,neo 支持 fp8 与 torch.compile 后显存曲线更平 | neo 分支跟进新一代开放权重 | classic 分支明确定位为归档(Gradio 3.41.2,只保 SD1 与 SDXL,仅收关键 bug 修复);neo 是活跃线,删掉 SD2、SD3、超网络、CLIP Interrogator、Deepbooru、TI 训练与 bitsandbytes,补上 SageAttention、FlashAttention 与 torch.compile。README 明确写着 xformers 不支持 RTX 50 系。 |
02 —
按你实际要跑的东西选卡
A1111 的显存账不看 UI,看你加载哪一代权重、开不开 xformers、要不要多模型常驻。
SD 1.5 / SDXL 日常出图、挂 ControlNet、批量跑 API
RTX 3090 24GB$0.193/卡·时
Ampere 正好吃 A1111 原生钉死的 torch 2.1.2+cu121 与 xformers 0.0.23.post1,--xformers 开箱可用;官方 wiki 实测 SD 1.5 在 xformers 下 batch 1 到 8 的峰值都是 2.8GB,batch 16 才 4.1GB,24GB 全留给 SDXL 高分辨率与 hires.fix。
SDXL 1024 高强度出图,ADetailer + hires.fix 串成流水线
RTX 4090 24GB$0.540/卡·时
同样 24GB 但 Ada 单卡吞吐高一档;sd_xl_base_1.0.safetensors 6.94GB 加 refiner、fp16 VAE 与若干 LoRA 常驻仍有余量,不必挂 --medvram-sdxl 拿速度换显存。
SD3 Medium 带 fp16 T5-XXL,或多个 checkpoint 常驻热切换
RTX A6000 48GB$0.817/卡·时
sd3_medium_incl_clips_t5xxlfp16.safetensors 单文件就 15.76GB,再叠 SDXL 与几个社区模型在设置里来回切,48GB 才能不重载;比 A100 SXM4 80GB 的 $1.088 便宜约 25%。
改跑 Forge / forge-neo 上的 Flux 与新一代权重
RTX 5090 32GB$0.723/卡·时
32GB 装得下 Flux GGUF Q8_0 的 12.71GB 主干再加 T5-XXL 与 VAE。注意 Blackwell 需要 CUDA 12.8 以上的 torch,A1111 原生 pin 的 2.1.2+cu121 没有对应算子,必须用 TORCH_COMMAND 覆盖,并把 --xformers 换成 --opt-sdp-attention。
03 —
在一台租来的卡上把它跑起来
四步,全部命令可直接粘贴;避开默认权重下载 401 和 WebUI 裸奔上公网这两个最常见的坑。
- 01
开机并把 7860 端口拉回本地
在控制台选一张 24GB 卡,镜像直接选 AUTOMATIC1111,或选 Ubuntu CLI / PyTorch 自己装。实例起来后不要急着 --listen,先用 SSH 本地端口转发把 WebUI 接到你自己的浏览器上——A1111 默认没有任何鉴权。
ssh -N -L 7860:127.0.0.1:7860 -p <port> root@<node-ip> - 02
钉死 Python 3.10,并直接切 dev 分支
webui.sh 默认去找 python3.10,launch_utils.py 对非 3.10.6 会给告警;numpy==1.26.2 和 Pillow==9.5.0 这些 pin 在 3.12/3.13 上没有可用轮子。dev 分支收了 2025 到 2026 年那几个 CLIP 与 setuptools 安装修复,比 master 更容易一次装成。
sudo apt install -y wget git python3.10 python3.10-venv libgl1 libglib2.0-0 && git clone -b dev https://github.com/AUTOMATIC1111/stable-diffusion-webui && cd stable-diffusion-webui - 03
先把权重放进去,别等它自己下
modules/sd_models.py 里默认下载地址仍指向 runwayml/stable-diffusion-v1-5,而那个 Hugging Face 仓库现在返回 401。官方镜像已迁到 stable-diffusion-v1-5/stable-diffusion-v1-5(emaonly 4.27GB、完整版 7.70GB)。跑 SDXL 就换成 sd_xl_base_1.0.safetensors(6.94GB)。
wget -P models/Stable-diffusion https://huggingface.co/stable-diffusion-v1-5/stable-diffusion-v1-5/resolve/main/v1-5-pruned-emaonly.safetensors - 04
带 REST API 启动,接进你自己的服务
--api 会挂上 /sdapi/v1/txt2img、/sdapi/v1/img2img、/sdapi/v1/png-info、/sdapi/v1/progress、/sdapi/v1/sd-models、/sdapi/v1/options 等路由;只想要后端就加 --nowebui(官方描述:只启动 API,不启动 UI)。--no-download-sd-model 跳过那个失效的自动下载。在 RTX 5090 这类 Blackwell 卡上,先 export TORCH_COMMAND="pip install torch torchvision --index-url https://download.pytorch.org/whl/cu128",并把 --xformers 换成 --opt-sdp-attention。
bash webui.sh -f --xformers --api --no-download-sd-model --port 7860
一次完整跑通要花多少钱
用 RTX 3090 24GB 跑一轮 SDXL 批量出图:装机(apt 依赖 + venv + pip 全套 pin)约 15 分钟即 0.25 小时;拉 sd_xl_base_1.0.safetensors 6.94GB 加两个社区 checkpoint 与一批 ControlNet 权重共约 20GB,10 分钟即 0.17 小时;真正出图 3 小时。合计 3.42 小时 × $0.193 = $0.660。数据卷开 60GB,跑完立刻销毁则存储不再计费;若留到第二天接着用,按存储中位价 $0.414/GB·月折日约 $0.0138/GB,60GB 一天 $0.828。把 800 张 1024×1024 PNG(约 1.2GB)下载回本地,按出网中位价 $0.0081/GB 计为 $0.010。所以:不留卷一次 $0.67,连卷留一天也就 $1.50。想快一档,RTX 4090 24GB 是 3.42 × $0.540 = $1.847;要 48GB 多模型常驻,RTX A6000 是 3.42 × $0.817 = $2.794。计费按秒走、按小时报价,实例一停算力立刻停计,只有卷在销毁前继续算存储。
04 —
