ComfyUI 是 Comfy Org 维护的节点式生成引擎,GPL-3.0 开源,仓库在 github.com/comfyanonymous/ComfyUI。它早就不是「Stable Diffusion 的另一个前端」了:当前版本原生支持的图像线包括 SD1.5、SDXL、SD3.5、Flux.1、Flux.2、Qwen Image、Z-Image、Hunyuan Image 2.1、HiDream、Lumina Image 2.0;视频线有 Wan 2.1/2.2、LTX-Video 2/2.3/2.5、HunyuanVideo 1.5、MiniMax-H3;音频有 ACE-Step 1.5、Stable Audio 3、MiniMax Music 3;三维与视觉还有 Hunyuan3D 2.1、TripoSplat、SAM、Depth Anything。项目按周迭代,目标发版日是周一,大约每两周切一个稳定大版本,v0.30 到 v0.33 这一串就发生在最近几周之内。
环境这一层比很多人预期的挑剔。官方推荐 Python 3.13(3.12 作为兼容兜底,3.14 能跑但部分自定义节点会出问题),PyTorch 最低 2.7、强烈建议更高,而 NVIDIA 20 系及以上必须用 cu130 或更新的 PyTorch 构建。requirements.txt 里还把一批包钉死了版本——comfyui-frontend-package==1.49.6、comfyui-workflow-templates==0.11.46、comfy-kitchen==0.2.31、comfy-aimdo==0.4.13——官方文档明确写着「不要自行升级到最新版」。在自己的 Windows 主力机上凑齐这一套,往往比在一台干净的 Linux 卡机上装一遍还费劲。
更现实的问题是显存曲线太陡。Z-Image-Turbo 6B 官方说 16GB 消费卡就能从容运行;Qwen-Image bf16 权重单文件就是 40.9GB;Wan 2.2 的 I2V-A14B 是高噪、低噪两个 fp16 分片、各约 28GB。同一个 ComfyUI 界面,跨度就是 8GB 到 80GB。本地一张卡不可能覆盖全谱,而 NexGPU 有 51 个国家/地区的 1,175 个可租节点、2,498 张 GPU、75 种型号,单节点最多 14 卡、最大节点显存 2,152GB,按秒计费、无最低消费、无配额申请——今天试 SDXL 用 3090,明天跑 Qwen-Image bf16 换 A100,工作流不用改一行。
01 —
ComfyUI 里各条模型线的真实显存占用
引擎版本停在 v0.33.x,但决定你租哪张卡的从来不是它,而是下面这几行。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Z-Image-Turbo | 6B | 官方称 16GB 消费级显存即可从容运行 | 8 NFE(约 9 步)出图 | Apache 2.0 授权,中英双语文字渲染是强项,步数极少。想用最便宜的卡把 ComfyUI 跑通,从这条线开始最省事。 |
| SDXL 1.0 / SD3.5 Large | 3.5B UNet / 8B | SDXL fp16 单 checkpoint 约 7GB,8GB 卡可跑;SD3.5 Large fp16 约 16GB | 1024×1024 原生 | LoRA、ControlNet、IPAdapter 生态最完整的一条线。调工作流、验证节点连线逻辑,用这两个模型最不浪费卡时。 |
| Flux.1 dev | 12B | fp8_e4m3fn 权重约 12GB/bf16 约 24GB,另需 T5-XXL 文本编码器与 VAE | 1024–2048 分辨率 | ComfyUI 官方示例明确写着:Load Diffusion Model 节点的 weight_dtype 选 fp8「显存占用减半,画质略降」。24GB 卡上跑 fp8 是当前最主流的组合。 |
| Flux.2 dev | 32B | bf16 权重约 64GB;官方另发 4-bit 量化版,对应 RTX 4090 / RTX 5090 级消费卡 | 高分辨率单图与多图参考 | Black Forest Labs 的 32B 整流流 Transformer,FLUX Non-Commercial License,ComfyUI 已原生支持。想上 bf16 就别想 24GB 卡了。 |
| Qwen-Image | 20B MMDiT | bf16 40.9GB/fp8_e4m3fn 20.4GB(配 qwen_2.5_vl_7b_fp8_scaled 文本编码器) | 1328×1328 等原生比例 | 官方在 RTX 4090D 24GB 上实测:fp8 占用约 86% 显存,首图约 94 秒、第二张约 71 秒;挂 8 步 lightx2v LoRA 后降到约 34 秒。这是全站最有参考价值的一组数字。 |
| Wan 2.2 / HunyuanVideo 1.5(视频线) | TI2V-5B / T2V-A14B / 8.3B | Wan2.2 5B fp16 约 10GB,官方称原生卸载下 8GB 显存可跑;T2V-A14B fp8 scaled 约 7GB×2;I2V-A14B fp16 约 28GB×2;HunyuanVideo 1.5 最低 14GB(需开模型卸载) | 480p / 720p,可超分到 1080p | A14B 是高噪声、低噪声两个专家模型轮流加载,显存峰值按单个算、但磁盘和加载时间按两个算。视频线是 ComfyUI 里唯一会把 80GB 卡吃满的场景。 |
02 —
该租哪张卡:按你要加载的权重对号入座
NexGPU 全部为按秒计量、按小时计价的公开报价,停机即停算力计费。
跑 SDXL / SD3.5、Z-Image-Turbo,或者只是把工作流连通、调节点参数
RTX 3090 24GB$0.193/卡·时
全站最便宜的 24GB 卡,装下 SDXL 全家桶和 Z-Image-Turbo 绰绰有余,调线三小时也就半美元出头。
Flux.1 dev fp8、Qwen-Image fp8、Wan 2.2 TI2V-5B 的日常出图与出片
RTX 4090 24GB$0.540/卡·时
Ada 架构原生支持 fp8,和 ComfyUI 官方那组 4090D 24GB 基准同级——你能直接拿 71 秒/张来算成本。
Flux.1 dev 上 bf16 全精度,Wan 2.2 A14B 双专家常驻,HunyuanVideo 1.5 720p 不开卸载
RTX A6000 48GB$0.817/卡·时
48GB 让你不必为省显存牺牲画质,也不用忍受每步都在 CPU 和 GPU 之间搬权重的卸载惩罚。
Qwen-Image bf16 40.9GB 全精度、Wan 2.2 I2V-A14B fp16 28GB×2,或多队列并发出图
A100 SXM4 80GB$1.088/卡·时
80GB 是同时装下大模型主体、文本编码器和 VAE 还留出激活空间的门槛,SXM4 的带宽也扛得住视频线的长序列。
03 —
从空实例到能出图,四步
NexGPU 提供 SSH、Jupyter、Web 终端、REST API 与 CLI,2,000+ 预置镜像里就有 ComfyUI 和 PyTorch。
- 01
开机并装好 ComfyUI
直接选 ComfyUI 预置镜像可以跳过这一步。手动装的话,务必用独立虚拟环境——官方文档写得很直白:ComfyUI 的依赖会和系统上其他依赖打架。注意 PyTorch 轮子要 cu130 及以上,20 系之后的 N 卡是硬性要求。
git clone https://github.com/comfyanonymous/ComfyUI.git && cd ComfyUI && pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130 && pip install -r requirements.txt - 02
起服务,把 8188 端口安全地接到本地浏览器
ComfyUI 默认监听 127.0.0.1:8188,所以你在远端直接起服务,本地是打不开的。最干净的做法不是把它暴露到公网,而是开一条 SSH 隧道:ssh -L 8188:localhost:8188 <用户>@<节点地址>,然后在本机浏览器访问 localhost:8188。确实需要 --listen 0.0.0.0 时,记得把 ComfyUI-Manager 的 config.ini 安全级设成 normal- 或 strong。
python main.py --listen 127.0.0.1 --port 8188 --enable-manager - 03
把权重放进正确的目录
ComfyUI 对目录很挑:完整 checkpoint 进 models/checkpoints,单独的扩散权重进 models/diffusion_models,T5-XXL / Qwen2.5-VL 这类进 models/text_encoders,VAE 进 models/vae,LoRA 进 models/loras。把模型放在持久卷上,再用 extra_model_paths.yaml 指过去,重开实例就不用重下 20GB。
comfy model download --url <huggingface-url> --relative-path models/diffusion_models - 04
显存不够就降级,或者干脆把 ComfyUI 当后端调
显存紧张时依次尝试 --lowvram(文本编码器丢 CPU)、--novram(更激进的卸载)、--reserve-vram 1 与 --vram-headroom 给系统留余量、--fp8_e4m3fn-unet 直接以 fp8 载入扩散模型、--cpu-vae 把解码搬走;显存富余就反过来上 --highvram 或 --gpu-only。注意力后端可以试 --use-sage-attention / --use-flash-attention / --use-ck-attention。要做无界面批量生产,走 HTTP:POST /prompt 提交工作流 JSON,GET /history/{prompt_id} 取结果,GET /view 拿图,WebSocket /ws 收进度,GET /system_stats 查显存。
python main.py --lowvram --reserve-vram 1 --fp8_e4m3fn-unet --use-sage-attention
算一笔账:ComfyUI 出图到底多少钱一张
拿 ComfyUI 官方在 24GB 卡上的实测当基准。Qwen-Image fp8 稳态每张约 71 秒,租一张 RTX 4090 24GB,$0.540/卡·时,一小时能出 3600 ÷ 71 ≈ 50 张,单张成本 $0.540 ÷ 50 ≈ $0.0108。挂上 8 步 lightx2v 加速 LoRA 后每张约 34 秒,一小时 ≈ 105 张,单张 ≈ $0.0051——半美分一张。如果只是连节点、试参数、根本没到批量出图那步,换 RTX 3090 24GB $0.193/卡·时,连调三小时是 $0.579。模型盘另算:Qwen-Image fp8 主体 20.4GB 加上 Qwen2.5-VL 文本编码器和 VAE 约 25GB,存储中位价 $0.414/GB·月 × 25GB ≈ $10.35/月,只要不销毁卷就一直计费,但算力计费在实例停止的那一秒就停了。把 50 张图拉回本地约 100MB,出站 $0.0081/GB × 0.1GB ≈ $0.0008,可以忽略。整套流程无最低消费、无开通费、无需提配额申请。
04 —
