跳到主要内容

图像生成运行时

AUTOMATIC1111 本地部署:功能封版在 v1.10.1,但装对了它仍是扩展生态的主场

master 分支的最后一次提交停在 2024 年 7 月,依赖却还钉着 torch 2.1.2+cu121、gradio 3.41.2、transformers 4.30.2。这一页把真实的显存数字、真实的装机坑和对应的 NexGPU 机型价格摆出来,让你租之前就知道该租哪张卡、该切哪条分支。

AUTOMATIC1111/stable-diffusion-webui 是 GitHub 上 16.4 万星、3.06 万 fork 的 AGPL-3.0 项目,也是整个 Stable Diffusion 扩展生态事实上的接口标准。它的现状需要先说清楚:功能封版在 v1.10.0——那一版带来了 SD3 支持、Align Your Steps / KL Optimal / Normal / DDIM / Simple / Beta 六个新调度器、DDIM CFG++ 采样器,以及前若干步跳过 CFG 的选项;之后的 v1.10.1 只改了一件事,changelog 原文是 fix image upscale on cpu。master 分支的最后一次提交停在 2024-07-27。但它并没有死:dev 分支仍在收装机类修复,2025-10 修 Linux 下的 uv、2025-12 更新 stable_diffusion_repo 地址、2026-02 修 CLIP 安装失败、2026-03 修 pip install 'setuptools<70' 在 cmd 下失败——全是「让它还能装上」的活。

真正劝退本机安装的是那份依赖清单。requirements_versions.txt 至今钉着 gradio==3.41.2、transformers==4.30.2、numpy==1.26.2、Pillow==9.5.0、pytorch_lightning==1.9.4、fastapi==0.94.0、setuptools==69.5.1,launch_utils.py 里默认 pip install torch==2.1.2 torchvision==0.16.2 走 cu121 索引,xformers 钉在 0.0.23.post1。webui.sh 默认去找 python3.10,Windows 上更是只认 3.10,装完还会因为版本不是 3.10.6 给你告警。numpy 锁在 1.x 意味着这个 venv 里塞不进任何现代包。还有一个新装必踩的坑:modules/sd_models.py 里默认权重下载地址仍写死 runwayml/stable-diffusion-v1-5/resolve/main/v1-5-pruned-emaonly.safetensors,而那个仓库现在直接返回 401,models/Stable-diffusion 为空的全新安装会卡在这一步。

分叉这条线也得摊开讲。lllyasviel 的 Forge 基于 webui 1.10.1、换成 Gradio 4,补上了上游从未有过的 Flux 支持(BitsAndBytes NF4、GGUF Q8_0/Q5/Q4)、多路 ControlNet、IP-Adapter 和 Instant-ID,主分支最后一次提交是 2025-06-26(Add Chroma、Add support for fp8 scaled 都在那前后);Haoming02 的 forge-classic 把 classic 分支当归档留在 Gradio 3.41.2、只保 SD1/SDXL,活跃的是 neo 分支,推荐 torch 2.10.0+cu130、xformers 0.0.34、Python 3.11.9,砍掉 SD2/SD3/超网络/Deepbooru/TI 训练/bitsandbytes,换上 SageAttention、FlashAttention 和 torch.compile。同一套 UI、同一批扩展、四条互不兼容的依赖栈——这正是它该跑在租来的机器上而不是你本机的理由。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种型号,2,000+ 预置镜像里 AUTOMATIC1111、Stable Diffusion、ComfyUI、PyTorch 都在列,按秒计费、无最低消费、无开通费、无需申请配额,装崩一次销毁重开的成本以分计。

01 —

版本、分叉与它们各自能跑的东西

上游封版、dev 续命、Forge 系接棒——选错分支,你想跑的模型根本加载不出来。

版本参数量显存上下文说明
v1.10.1(当前唯一正式版)gradio 3.41.2 · torch 2.1.2+cu121 · xformers 0.0.23.post1SD 1.5 开 xformers 峰值约 2.8GB;SDXL 实用起步 12GBSD 1.x / SD 2.x / SDXL / SD3 MediumAGPL-3.0。相对 1.10.0 的唯一改动是 fix image upscale on cpu,所以功能上等同封版。ControlNet、ADetailer 这类主流扩展全部针对这套接口编写,兼容性最好的仍是它。
v1.10.0(功能封版点)master 最后一批合并,2024-07-27 定格SD3 Medium 一体包 4.34GB / 5.97GB / 10.87GB(t5 fp8) / 15.76GB(t5 fp16)新增 SD3 支持,Euler 为推荐采样器带来六个新调度器(Align Your Steps、KL Optimal、Normal、DDIM、Simple、Beta)、DDIM CFG++ 采样器、前几步跳过 CFG 的选项,以及下载后按 hash 校验模型。SD 3.5 是它封版之后三个月才发布的,从未进过上游。
dev 分支(仍在维护)依赖 pin 与 master 几乎一致,仅 safetensors 由 0.4.2 提到 0.4.5与 v1.10.1 相同不加新模型,只保证装得上最近的提交清一色是安装修复:fix uv on linux(2025-10)、update stable_diffusion_repo url(2025-12)、Fix CLIP installation failures(2026-02)、修 setuptools 安装(2026-03)。在 2026 年新开机器,直接 clone -b dev 比 master 省事。
Forge(lllyasviel)基于 webui 1.10.1 · Gradio 4.40 · 推荐 CUDA 12.1 + PyTorch 2.3.1Flux GGUF Q4_K_S 6.81GB / Q8_0 12.71GB / F16 23.80GB(仅主干,不含 T5-XXL)SD 1.5 / SDXL / SD3 / Flux上游 A1111 一天都没支持过 Flux,要在这套 UI 里跑 Flux 只能走 Forge 系。支持 BitsAndBytes NF4 与 GGUF Q8_0/Q5_0/Q5_1/Q4_0/Q4_1、多 ControlNet、IP-Adapter、Instant-ID。README 的原话是「不要把 GPU Weight 设太高,调低它能解决 99% 的问题」。主分支最后一次提交 2025-06-26。
forge-classic / neo(Haoming02)neo:torch 2.10.0+cu130 · xformers 0.0.34 · Python 3.11.9随所载权重浮动,neo 支持 fp8 与 torch.compile 后显存曲线更平neo 分支跟进新一代开放权重classic 分支明确定位为归档(Gradio 3.41.2,只保 SD1 与 SDXL,仅收关键 bug 修复);neo 是活跃线,删掉 SD2、SD3、超网络、CLIP Interrogator、Deepbooru、TI 训练与 bitsandbytes,补上 SageAttention、FlashAttention 与 torch.compile。README 明确写着 xformers 不支持 RTX 50 系。

02 —

按你实际要跑的东西选卡

A1111 的显存账不看 UI,看你加载哪一代权重、开不开 xformers、要不要多模型常驻。

  • SD 1.5 / SDXL 日常出图、挂 ControlNet、批量跑 API

    RTX 3090 24GB$0.193/卡·时

    Ampere 正好吃 A1111 原生钉死的 torch 2.1.2+cu121 与 xformers 0.0.23.post1,--xformers 开箱可用;官方 wiki 实测 SD 1.5 在 xformers 下 batch 1 到 8 的峰值都是 2.8GB,batch 16 才 4.1GB,24GB 全留给 SDXL 高分辨率与 hires.fix。

  • SDXL 1024 高强度出图,ADetailer + hires.fix 串成流水线

    RTX 4090 24GB$0.540/卡·时

    同样 24GB 但 Ada 单卡吞吐高一档;sd_xl_base_1.0.safetensors 6.94GB 加 refiner、fp16 VAE 与若干 LoRA 常驻仍有余量,不必挂 --medvram-sdxl 拿速度换显存。

  • SD3 Medium 带 fp16 T5-XXL,或多个 checkpoint 常驻热切换

    RTX A6000 48GB$0.817/卡·时

    sd3_medium_incl_clips_t5xxlfp16.safetensors 单文件就 15.76GB,再叠 SDXL 与几个社区模型在设置里来回切,48GB 才能不重载;比 A100 SXM4 80GB 的 $1.088 便宜约 25%。

  • 改跑 Forge / forge-neo 上的 Flux 与新一代权重

    RTX 5090 32GB$0.723/卡·时

    32GB 装得下 Flux GGUF Q8_0 的 12.71GB 主干再加 T5-XXL 与 VAE。注意 Blackwell 需要 CUDA 12.8 以上的 torch,A1111 原生 pin 的 2.1.2+cu121 没有对应算子,必须用 TORCH_COMMAND 覆盖,并把 --xformers 换成 --opt-sdp-attention。

03 —

在一台租来的卡上把它跑起来

四步,全部命令可直接粘贴;避开默认权重下载 401 和 WebUI 裸奔上公网这两个最常见的坑。

  1. 01

    开机并把 7860 端口拉回本地

    在控制台选一张 24GB 卡,镜像直接选 AUTOMATIC1111,或选 Ubuntu CLI / PyTorch 自己装。实例起来后不要急着 --listen,先用 SSH 本地端口转发把 WebUI 接到你自己的浏览器上——A1111 默认没有任何鉴权。

    ssh -N -L 7860:127.0.0.1:7860 -p <port> root@<node-ip>
  2. 02

    钉死 Python 3.10,并直接切 dev 分支

    webui.sh 默认去找 python3.10,launch_utils.py 对非 3.10.6 会给告警;numpy==1.26.2 和 Pillow==9.5.0 这些 pin 在 3.12/3.13 上没有可用轮子。dev 分支收了 2025 到 2026 年那几个 CLIP 与 setuptools 安装修复,比 master 更容易一次装成。

    sudo apt install -y wget git python3.10 python3.10-venv libgl1 libglib2.0-0 && git clone -b dev https://github.com/AUTOMATIC1111/stable-diffusion-webui && cd stable-diffusion-webui
  3. 03

    先把权重放进去,别等它自己下

    modules/sd_models.py 里默认下载地址仍指向 runwayml/stable-diffusion-v1-5,而那个 Hugging Face 仓库现在返回 401。官方镜像已迁到 stable-diffusion-v1-5/stable-diffusion-v1-5(emaonly 4.27GB、完整版 7.70GB)。跑 SDXL 就换成 sd_xl_base_1.0.safetensors(6.94GB)。

    wget -P models/Stable-diffusion https://huggingface.co/stable-diffusion-v1-5/stable-diffusion-v1-5/resolve/main/v1-5-pruned-emaonly.safetensors
  4. 04

    带 REST API 启动,接进你自己的服务

    --api 会挂上 /sdapi/v1/txt2img、/sdapi/v1/img2img、/sdapi/v1/png-info、/sdapi/v1/progress、/sdapi/v1/sd-models、/sdapi/v1/options 等路由;只想要后端就加 --nowebui(官方描述:只启动 API,不启动 UI)。--no-download-sd-model 跳过那个失效的自动下载。在 RTX 5090 这类 Blackwell 卡上,先 export TORCH_COMMAND="pip install torch torchvision --index-url https://download.pytorch.org/whl/cu128",并把 --xformers 换成 --opt-sdp-attention。

    bash webui.sh -f --xformers --api --no-download-sd-model --port 7860

一次完整跑通要花多少钱

用 RTX 3090 24GB 跑一轮 SDXL 批量出图:装机(apt 依赖 + venv + pip 全套 pin)约 15 分钟即 0.25 小时;拉 sd_xl_base_1.0.safetensors 6.94GB 加两个社区 checkpoint 与一批 ControlNet 权重共约 20GB,10 分钟即 0.17 小时;真正出图 3 小时。合计 3.42 小时 × $0.193 = $0.660。数据卷开 60GB,跑完立刻销毁则存储不再计费;若留到第二天接着用,按存储中位价 $0.414/GB·月折日约 $0.0138/GB,60GB 一天 $0.828。把 800 张 1024×1024 PNG(约 1.2GB)下载回本地,按出网中位价 $0.0081/GB 计为 $0.010。所以:不留卷一次 $0.67,连卷留一天也就 $1.50。想快一档,RTX 4090 24GB 是 3.42 × $0.540 = $1.847;要 48GB 多模型常驻,RTX A6000 是 3.42 × $0.817 = $2.794。计费按秒走、按小时报价,实例一停算力立刻停计,只有卷在销毁前继续算存储。

04 —

常见问题

AUTOMATIC1111 还在更新吗?2026 年装它还有意义吗?

功能上封版了:master 最后一次提交是 2024-07-27,唯一的后续正式版 v1.10.1 只改了 fix image upscale on cpu 这一件事。但 dev 分支还在收装机修复,最近一次是 2026-03-02 修 pip install 'setuptools<70' 在 cmd 下失败,之前还有 2026-02 的 CLIP 安装修复。意义在于生态:数千个扩展、ControlNet、ADetailer、几乎所有社区教程都是照这套 UI 与 API 写的,短期内没有替代品。要新模型就再开一台跑 Forge 系。在 NexGPU 上这两条路都是几分钟的事,2,000+ 预置镜像里就有 AUTOMATIC1111,按秒计费,装崩了销毁重开不心疼。

Automatic1111 需要多大显存?说的 4GB 显卡真能跑吗?

README 原文确实写着支持 4GB 显卡、还有 2GB 跑通的报告,靠的是 --lowvram(官方描述:牺牲大量速度换取极低显存占用)。但真实数字要看官方 wiki 的优化表:RTX 3060 上跑 SD 1.5,开 xformers 时 batch 1/2/4/8 的峰值都是 2.8GB,batch 16 才到 4.1GB;不开优化的默认 Doggettx 在 batch 8 就要 6.6GB。SDXL 完全是另一本账,base 权重本身就 6.94GB,8GB 卡得靠 --medvram-sdxl 才勉强,实际请按 12GB 起步。NexGPU 最便宜的 24GB 卡是 RTX 3090,$0.193/卡·时,这三档全部覆盖还留足余量。

A1111 能跑 Flux 吗?能跑 SD 3.5 吗?

上游都不能。v1.10.0 加的是 SD3 Medium,而 SD 3.5 比 master 冻结晚了三个月,从未进过上游;Flux 更是一次都没进过。要在这套熟悉的 UI 里跑它们,只能换 Forge(BitsAndBytes NF4 与 GGUF,city96 那套量化里 Q4_K_S 6.81GB、Q8_0 12.71GB、F16 23.80GB,均不含 T5-XXL)或更新的 forge-neo 分支。对应到卡:Q4 量化 RTX 4090 24GB $0.540/卡·时就够,Q8 加 fp16 T5 建议上 RTX 5090 32GB $0.723 或 RTX A6000 48GB $0.817,NexGPU 都能按秒开关。

在 RTX 5090 上装 AUTOMATIC1111 报 no kernel image is available 怎么办?

因为 launch_utils.py 里默认执行的是 pip install torch==2.1.2 torchvision==0.16.2 --extra-index-url https://download.pytorch.org/whl/cu121,cu121 的 torch 2.1.2 里根本没有 Blackwell(sm_120)的算子;配套钉死的 xformers==0.0.23.post1 同样没有 50 系构建,forge-neo 的 README 就直说 xformers 不支持 RTX 50 系。解法是启动前用 TORCH_COMMAND 覆盖成 cu128 索引的新 torch,并把 --xformers 换成 --opt-sdp-attention(官方描述:启用缩放点积交叉注意力优化,需要 PyTorch 2.*)。想彻底省掉这一步,直接在 NexGPU 上租 RTX 3090 24GB $0.193 或 RTX 4090 24GB $0.540,原生 pin 直接可用,开机即出图。

新装的 WebUI 卡在下载默认模型,v1-5-pruned-emaonly 拉不下来怎么办?

这不是你的网络问题。modules/sd_models.py 至今把默认下载地址写死成 runwayml/stable-diffusion-v1-5/resolve/main/v1-5-pruned-emaonly.safetensors,而 runwayml 那个仓库现在直接返回 401。官方权重已迁到 stable-diffusion-v1-5/stable-diffusion-v1-5,emaonly 4.27GB、完整版 7.70GB。手动 wget 到 models/Stable-diffusion 目录,或者加 --no-download-sd-model 直接跳过自动下载。NexGPU 的节点分布在 51 个国家和地区,挑一个离 Hugging Face 近的区域,20GB 模型很快落盘;数据卷不销毁就一直留着,下次开机直接挂上去,不用重下。

云上跑 WebUI 怎么安全访问?要不要开 --share?

不要。--share 的官方描述是给 gradio 传 share=True、通过它自己的站点把界面暴露到公网;随手 --listen 让它监听 0.0.0.0:7860 也一样危险,因为 A1111 默认没有任何鉴权,再叠一个 --enable-insecure-extension-access 基本等于把任意代码执行权交出去。正确做法是只监听本地,用 SSH 隧道 -L 7860:127.0.0.1:7860 转回自己机器;做后端服务就加 --api 或 --nowebui。NexGPU 每台实例都同时给 SSH、Jupyter、Web 终端、REST API 和 CLI,隧道两秒就通,遇到问题在 Telegram 上找中英文双语支持,不用排工单。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。