跳到主要内容

生成式 AI 运行时

ComfyUI 私有化部署:显存要多大,取决于你往画布上拖了什么

ComfyUI 这个引擎本身几乎不吃显存,真正吃显存的是你在 Load Diffusion Model 节点里选的那个权重。这一页把 SDXL 到 Flux.2、Wan 2.2 的实测占用摊开讲清楚,再告诉你该租哪张卡。

ComfyUI 是 Comfy Org 维护的节点式生成引擎,GPL-3.0 开源,仓库在 github.com/comfyanonymous/ComfyUI。它早就不是「Stable Diffusion 的另一个前端」了:当前版本原生支持的图像线包括 SD1.5、SDXL、SD3.5、Flux.1、Flux.2、Qwen Image、Z-Image、Hunyuan Image 2.1、HiDream、Lumina Image 2.0;视频线有 Wan 2.1/2.2、LTX-Video 2/2.3/2.5、HunyuanVideo 1.5、MiniMax-H3;音频有 ACE-Step 1.5、Stable Audio 3、MiniMax Music 3;三维与视觉还有 Hunyuan3D 2.1、TripoSplat、SAM、Depth Anything。项目按周迭代,目标发版日是周一,大约每两周切一个稳定大版本,v0.30 到 v0.33 这一串就发生在最近几周之内。

环境这一层比很多人预期的挑剔。官方推荐 Python 3.13(3.12 作为兼容兜底,3.14 能跑但部分自定义节点会出问题),PyTorch 最低 2.7、强烈建议更高,而 NVIDIA 20 系及以上必须用 cu130 或更新的 PyTorch 构建。requirements.txt 里还把一批包钉死了版本——comfyui-frontend-package==1.49.6、comfyui-workflow-templates==0.11.46、comfy-kitchen==0.2.31、comfy-aimdo==0.4.13——官方文档明确写着「不要自行升级到最新版」。在自己的 Windows 主力机上凑齐这一套,往往比在一台干净的 Linux 卡机上装一遍还费劲。

更现实的问题是显存曲线太陡。Z-Image-Turbo 6B 官方说 16GB 消费卡就能从容运行;Qwen-Image bf16 权重单文件就是 40.9GB;Wan 2.2 的 I2V-A14B 是高噪、低噪两个 fp16 分片、各约 28GB。同一个 ComfyUI 界面,跨度就是 8GB 到 80GB。本地一张卡不可能覆盖全谱,而 NexGPU 有 51 个国家/地区的 1,175 个可租节点、2,498 张 GPU、75 种型号,单节点最多 14 卡、最大节点显存 2,152GB,按秒计费、无最低消费、无配额申请——今天试 SDXL 用 3090,明天跑 Qwen-Image bf16 换 A100,工作流不用改一行。

01 —

ComfyUI 里各条模型线的真实显存占用

引擎版本停在 v0.33.x,但决定你租哪张卡的从来不是它,而是下面这几行。

版本参数量显存上下文说明
Z-Image-Turbo6B官方称 16GB 消费级显存即可从容运行8 NFE(约 9 步)出图Apache 2.0 授权,中英双语文字渲染是强项,步数极少。想用最便宜的卡把 ComfyUI 跑通,从这条线开始最省事。
SDXL 1.0 / SD3.5 Large3.5B UNet / 8BSDXL fp16 单 checkpoint 约 7GB,8GB 卡可跑;SD3.5 Large fp16 约 16GB1024×1024 原生LoRA、ControlNet、IPAdapter 生态最完整的一条线。调工作流、验证节点连线逻辑,用这两个模型最不浪费卡时。
Flux.1 dev12Bfp8_e4m3fn 权重约 12GB/bf16 约 24GB,另需 T5-XXL 文本编码器与 VAE1024–2048 分辨率ComfyUI 官方示例明确写着:Load Diffusion Model 节点的 weight_dtype 选 fp8「显存占用减半,画质略降」。24GB 卡上跑 fp8 是当前最主流的组合。
Flux.2 dev32Bbf16 权重约 64GB;官方另发 4-bit 量化版,对应 RTX 4090 / RTX 5090 级消费卡高分辨率单图与多图参考Black Forest Labs 的 32B 整流流 Transformer,FLUX Non-Commercial License,ComfyUI 已原生支持。想上 bf16 就别想 24GB 卡了。
Qwen-Image20B MMDiTbf16 40.9GB/fp8_e4m3fn 20.4GB(配 qwen_2.5_vl_7b_fp8_scaled 文本编码器)1328×1328 等原生比例官方在 RTX 4090D 24GB 上实测:fp8 占用约 86% 显存,首图约 94 秒、第二张约 71 秒;挂 8 步 lightx2v LoRA 后降到约 34 秒。这是全站最有参考价值的一组数字。
Wan 2.2 / HunyuanVideo 1.5(视频线)TI2V-5B / T2V-A14B / 8.3BWan2.2 5B fp16 约 10GB,官方称原生卸载下 8GB 显存可跑;T2V-A14B fp8 scaled 约 7GB×2;I2V-A14B fp16 约 28GB×2;HunyuanVideo 1.5 最低 14GB(需开模型卸载)480p / 720p,可超分到 1080pA14B 是高噪声、低噪声两个专家模型轮流加载,显存峰值按单个算、但磁盘和加载时间按两个算。视频线是 ComfyUI 里唯一会把 80GB 卡吃满的场景。

02 —

该租哪张卡:按你要加载的权重对号入座

NexGPU 全部为按秒计量、按小时计价的公开报价,停机即停算力计费。

  • 跑 SDXL / SD3.5、Z-Image-Turbo,或者只是把工作流连通、调节点参数

    RTX 3090 24GB$0.193/卡·时

    全站最便宜的 24GB 卡,装下 SDXL 全家桶和 Z-Image-Turbo 绰绰有余,调线三小时也就半美元出头。

  • Flux.1 dev fp8、Qwen-Image fp8、Wan 2.2 TI2V-5B 的日常出图与出片

    RTX 4090 24GB$0.540/卡·时

    Ada 架构原生支持 fp8,和 ComfyUI 官方那组 4090D 24GB 基准同级——你能直接拿 71 秒/张来算成本。

  • Flux.1 dev 上 bf16 全精度,Wan 2.2 A14B 双专家常驻,HunyuanVideo 1.5 720p 不开卸载

    RTX A6000 48GB$0.817/卡·时

    48GB 让你不必为省显存牺牲画质,也不用忍受每步都在 CPU 和 GPU 之间搬权重的卸载惩罚。

  • Qwen-Image bf16 40.9GB 全精度、Wan 2.2 I2V-A14B fp16 28GB×2,或多队列并发出图

    A100 SXM4 80GB$1.088/卡·时

    80GB 是同时装下大模型主体、文本编码器和 VAE 还留出激活空间的门槛,SXM4 的带宽也扛得住视频线的长序列。

03 —

从空实例到能出图,四步

NexGPU 提供 SSH、Jupyter、Web 终端、REST API 与 CLI,2,000+ 预置镜像里就有 ComfyUI 和 PyTorch。

  1. 01

    开机并装好 ComfyUI

    直接选 ComfyUI 预置镜像可以跳过这一步。手动装的话,务必用独立虚拟环境——官方文档写得很直白:ComfyUI 的依赖会和系统上其他依赖打架。注意 PyTorch 轮子要 cu130 及以上,20 系之后的 N 卡是硬性要求。

    git clone https://github.com/comfyanonymous/ComfyUI.git && cd ComfyUI && pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130 && pip install -r requirements.txt
  2. 02

    起服务,把 8188 端口安全地接到本地浏览器

    ComfyUI 默认监听 127.0.0.1:8188,所以你在远端直接起服务,本地是打不开的。最干净的做法不是把它暴露到公网,而是开一条 SSH 隧道:ssh -L 8188:localhost:8188 <用户>@<节点地址>,然后在本机浏览器访问 localhost:8188。确实需要 --listen 0.0.0.0 时,记得把 ComfyUI-Manager 的 config.ini 安全级设成 normal- 或 strong。

    python main.py --listen 127.0.0.1 --port 8188 --enable-manager
  3. 03

    把权重放进正确的目录

    ComfyUI 对目录很挑:完整 checkpoint 进 models/checkpoints,单独的扩散权重进 models/diffusion_models,T5-XXL / Qwen2.5-VL 这类进 models/text_encoders,VAE 进 models/vae,LoRA 进 models/loras。把模型放在持久卷上,再用 extra_model_paths.yaml 指过去,重开实例就不用重下 20GB。

    comfy model download --url <huggingface-url> --relative-path models/diffusion_models
  4. 04

    显存不够就降级,或者干脆把 ComfyUI 当后端调

    显存紧张时依次尝试 --lowvram(文本编码器丢 CPU)、--novram(更激进的卸载)、--reserve-vram 1 与 --vram-headroom 给系统留余量、--fp8_e4m3fn-unet 直接以 fp8 载入扩散模型、--cpu-vae 把解码搬走;显存富余就反过来上 --highvram 或 --gpu-only。注意力后端可以试 --use-sage-attention / --use-flash-attention / --use-ck-attention。要做无界面批量生产,走 HTTP:POST /prompt 提交工作流 JSON,GET /history/{prompt_id} 取结果,GET /view 拿图,WebSocket /ws 收进度,GET /system_stats 查显存。

    python main.py --lowvram --reserve-vram 1 --fp8_e4m3fn-unet --use-sage-attention

算一笔账:ComfyUI 出图到底多少钱一张

拿 ComfyUI 官方在 24GB 卡上的实测当基准。Qwen-Image fp8 稳态每张约 71 秒,租一张 RTX 4090 24GB,$0.540/卡·时,一小时能出 3600 ÷ 71 ≈ 50 张,单张成本 $0.540 ÷ 50 ≈ $0.0108。挂上 8 步 lightx2v 加速 LoRA 后每张约 34 秒,一小时 ≈ 105 张,单张 ≈ $0.0051——半美分一张。如果只是连节点、试参数、根本没到批量出图那步,换 RTX 3090 24GB $0.193/卡·时,连调三小时是 $0.579。模型盘另算:Qwen-Image fp8 主体 20.4GB 加上 Qwen2.5-VL 文本编码器和 VAE 约 25GB,存储中位价 $0.414/GB·月 × 25GB ≈ $10.35/月,只要不销毁卷就一直计费,但算力计费在实例停止的那一秒就停了。把 50 张图拉回本地约 100MB,出站 $0.0081/GB × 0.1GB ≈ $0.0008,可以忽略。整套流程无最低消费、无开通费、无需提配额申请。

04 —

常见问题

ComfyUI 到底需要多大显存?8GB 显卡能跑吗?

ComfyUI 引擎本身开销很小,显存全部花在你加载的模型上。8GB 可以跑 SDXL 和 Wan 2.2 TI2V-5B(靠原生卸载);16GB 能从容跑 Z-Image-Turbo;24GB 是 Flux.1 dev fp8 和 Qwen-Image fp8 的甜点位;要上 Qwen-Image bf16 的 40.9GB 或 Flux.2 dev 的 bf16,48GB 起步、80GB 才舒服。与其为最重的那个场景买卡,不如在 NexGPU 上按秒租:RTX 3090 24GB $0.193/卡·时起,A100 SXM4 80GB $1.088/卡·时,同一个工作流换台机器就能跑。

ComfyUI 支持多卡吗?一个大模型能拆到两张卡上跑吗?

不能——ComfyUI 不做单模型的张量并行。它提供的是设备选择:--cuda-device 指定用哪张卡(也接受 all),--default-device 指定默认设备,让你把扩散模型和文本编码器分别落在不同卡上。真正的横向扩展方式是多开进程、每个进程占一张卡,前面挂一层队列分发。NexGPU 单节点最多 14 张 GPU、最大节点显存 2,152GB,一台机器就能起一排 ComfyUI 实例,不用自己拼集群。

远程服务器上的 ComfyUI 怎么在本地浏览器打开?

ComfyUI 默认只监听 127.0.0.1:8188,这是有意为之的安全默认值。推荐做法是 SSH 隧道:ssh -L 8188:localhost:8188 <用户>@<节点>,然后访问本机 localhost:8188,全程不开公网端口。如果非要 --listen 0.0.0.0,请同时把 ComfyUI-Manager 的安全级从 weak 调到 normal- 或 strong——normal- 的作用正是在非环回监听时拦掉高风险操作。NexGPU 每台实例都自带 SSH、Jupyter 和 Web 终端,隧道一条命令的事。

装了几个自定义节点之后 ComfyUI 起不来了,怎么定位?

这是 ComfyUI 的头号坑,而且官方自己也警告过:update_comfyui_and_python_dependencies 这类脚本会重装全部依赖,可能覆盖你手工装的包、也可能弄坏依赖特定版本的自定义节点。排查顺序是:先 --disable-all-custom-nodes 确认是不是节点的问题,再用 --whitelist-custom-nodes 只加载可疑的那几个二分定位;修依赖时严格按 requirements.txt 里的钉死版本走,别自作主张升级 comfyui-frontend-package 这种。租实例的另一个好处是,真搞坏了就销毁重开,几十秒的事,不会污染你的主力机。

ComfyUI 能当无界面的后端 API 用吗?

可以,而且这是生产环境的正确用法。把画布上的工作流导出成 API 格式的 JSON,POST /prompt 提交,GET /history/{prompt_id} 取执行结果,GET /view 下载产物,POST /upload/image 送输入图,WebSocket /ws 收实时进度,GET /object_info 查所有节点定义,GET /system_stats 看设备和显存。想彻底断网离线跑就加 --disable-api-nodes,关掉所有调用闭源模型的 partner 节点。NexGPU 本身也提供 REST API 和 CLI,开机、挂载、销毁都能脚本化。

ComfyUI 是免费的吗?它和 Comfy Cloud、ComfyUI Desktop 是什么关系?

ComfyUI 本体 GPL-3.0 开源、完全免费,由 Comfy Org 维护,周更、约每两周一个稳定大版本。ComfyUI Desktop 是官方桌面封装,Comfy Cloud 是官方托管的付费服务,另外那批 partner / API 节点调的是 Nano Banana、Seedance 这类闭源模型,按次计费——加 --disable-api-nodes 就能全部关掉。自己拿卡跑就完全没有这层订阅:在 NexGPU 租一张 GPU 只按秒付算力,模型和工作流都在你自己手里,Telegram 上是中英双语真人支持,不排工单队列。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。