FLUX 是 Black Forest Labs 的图像生成与编辑模型线,主线现在走到 FLUX.2。这一代分四档:pro 和 flex 只走 API,dev 和 klein 放开权重。真正改变显存账的是架构那一刀——FLUX.1 用 T5-XXL 加 CLIP-L 双文本编码器,FLUX.2 换成了单个 Mistral-3 24B 视觉语言模型。文本编码器从两三 GB 变成二十多 B 参数,于是「FLUX 需要多大显存」这个问题的答案,一半以上不在扩散模型本身。
FLUX.2 [dev] 是 32B 的流匹配 Transformer,bf16 全部常驻显存要 141GB 以上,开 CPU offload 峰值降到约 80GB,4-bit 量化配 4-bit 文本编码器约 20GB,4-bit 配远程文本编码器约 18GB——官方点名这条路能跑在 RTX 4090 和 RTX 5090 上。klein 是尺寸蒸馏加步数蒸馏的小号:默认 4 步、guidance 1.0,4B 约 13GB 且是 Apache 2.0,9B 约 29GB(含 Qwen3-8B 编码器)但走非商用授权,官方另发了 fp8 权重。
FLUX.1 那条线也没退休。dev、Krea [dev]、Kontext [dev] 都是 12B,bf16 约 24GB、fp8 约 12GB、GGUF Q4 落在 6–8GB,ComfyUI 生态、LoRA 生态、TensorRT FP8/FP4 权重全是现成的,做产品图和批量编辑仍然是性价比最高的一档。你真正需要的,是在同一天里用 RTX 3090 试 klein 4B、用 RTX 4090 跑 4-bit dev、用 A6000 拉 klein 9B 全精度,然后只为跑掉的那几个小时付钱。NexGPU 有 2,498 张卡、75 个 GPU 型号、1,175 个已验证可租节点,按秒计费,没有起租门槛,也不用提配额工单。
01 —
FLUX 各版本参数与显存对照
开权重的六个主力变体,显存按社区和官方公开的实测口径列
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| FLUX.2 [dev] | 32B(文本编码器 Mistral-3 24B) | bf16 全量 ~141GB / CPU offload 峰值 ~80GB / fp8 ~32GB / 4-bit + 远程编码器 ~18GB | 最高 4MP 输出,最多 10 张参考图,总输入 14MP | 目前开权重里最强的一档,文生图和多图编辑同一套权重。FLUX.2-dev 非商用授权,商用要单独找 BFL 拿许可。 |
| FLUX.2 [klein] 9B | 9B(文本编码器 Qwen3-8B) | bf16 ~29GB;官方另有 FLUX.2-klein-9b-fp8 权重 | 4 步蒸馏,guidance 1.0,1024×1024 | 质量与延迟的甜点位,蒸馏后号称能对上大五倍模型的水准。非商用授权,另有 klein-9b-base 未蒸馏版本可做微调底座。 |
| FLUX.2 [klein] 4B | 4B(文本编码器 Qwen3-4B) | bf16 ~13GB;GGUF 单 transformer Q8_0 4.3GB、Q4_K_M 2.6GB、Q2_K 1.83GB | 4 步蒸馏,guidance 1.0,端到端可进亚秒级 | 整个 FLUX.2 家族里唯一 Apache 2.0 的权重,加上同样 Apache 2.0 的 FLUX.2-VAE,是可以直接商用的那条路。 |
| FLUX.1 [dev] | 12B(T5-XXL + CLIP-L) | bf16 ~24GB / fp8 ~12GB / GGUF Q4 ~6–8GB | 1024×1024,官方示例 50 步、guidance_scale 3.5 | 引导蒸馏模型,真 CFG 固定为 1,调的是 guidance embedding。LoRA 和工作流生态最厚的一代,非商用授权。 |
| FLUX.1 Kontext [dev] | 12B | 与 FLUX.1 [dev] 同量级;官方提供 BF16 / FP8 / FP4 TensorRT 权重 | 指令式图像编辑,兼容 FLUX.1 [dev] 推理代码 | 「把这个人的衬衫换成红色」这类改图任务的开权重主力。ComfyUI、Diffusers、TensorRT 都是首日支持。 |
| FLUX.1 [schnell] | 12B | bf16 ~16GB 起,fp8 / GGUF 档位与 dev 相同 | 4 步出图 | Apache 2.0。想在 FLUX.1 这条线上做商用又不想谈授权,schnell 是唯一选项。 |
02 —
跑 FLUX 该租哪张卡
按显存诚实匹配,不把 32B 全精度往 24GB 卡上塞
先试风格:klein 4B GGUF、FLUX.1 dev fp8 或 Q4,看画风和 prompt 跟随对不对
RTX 3090 24GB$0.193/卡·时
13GB 的 klein 4B 和 12GB 的 FLUX.1 fp8 都能整卡放下,这是全网单位显存最便宜的试错档。
FLUX.2 dev 4-bit 量化 + 远程或 4-bit 文本编码器,峰值约 18–20GB
RTX 4090 24GB$0.540/卡·时
官方 diffusers/FLUX.2-dev-bnb-4bit 直接点名的消费级路径,24GB 刚好覆盖峰值还留出 1024×1024 的激活空间。
klein 9B bf16 全精度,喂 10 张参考图、出 4MP 大图
RTX A6000 48GB$0.817/卡·时
29GB 权重在 32GB 卡上多参考图时会顶到边,48GB 让 4 步蒸馏的速度优势不被 offload 抵消。
FLUX.2 dev fp8 生产批量出图,32B 加 Mistral-3 编码器全程常驻
A100 SXM4 80GB$1.088/卡·时
约 32GB 的 fp8 权重加编码器还剩大半张卡做并发批次,比反复量化反量化省时间也省钱。
03 —
四步把 FLUX 跑起来
官方 flux2 仓库和 Diffusers 两条路都给,选一条走完
- 01
开实例,选带 CUDA 的镜像
在 console.nexgpu.net 按上面的表选卡,直接挑 PyTorch 或 ComfyUI 预置镜像开机。官方 flux2 仓库在 CUDA 12.9 + Python 3.12 上验证过,2,000+ 预置镜像里选对应的那一个能省掉半小时装驱动。开机后 SSH、Jupyter、网页终端任选。
ssh root@<your-instance> -p <port> - 02
装官方推理仓库
black-forest-labs/flux2 是 FLUX.2 的官方推理代码,klein 4B / klein 9B / dev 都从同一个 CLI 进。注意用 cu129 的 wheel index,装错 CUDA 版本是最常见的第一个坑。
git clone https://github.com/black-forest-labs/flux2 && cd flux2 && python3.12 -m venv .venv && source .venv/bin/activate && pip install -e . --extra-index-url https://download.pytorch.org/whl/cu129 - 03
拉权重,先用 klein 4B 打通链路
klein 4B 是 Apache 2.0,不用点同意条款,13GB 显存就能出图,用它验证环境最快。CLI 的 --name 接受 klein-4b、klein-9b、dev 等注册名;权重放在自定义目录的话用 MODEL_PATH 和 AE_MODEL_PATH 指过去,实例重开也不用重新下载。klein 默认 4 步、guidance 1.0,别按 FLUX.1 的习惯去堆步数。
hf download black-forest-labs/FLUX.2-klein-4B && PYTHONPATH=src python scripts/cli.py --name klein-4b - 04
换 dev 32B:走 4-bit 或 CPU offload
要上 32B,在 24GB 卡上就用官方的 4-bit 量化权重加模型级 offload;显存够就直接 bf16 加载。dev 的推理默认 50 步、guidance 4.0,赶时间可以降到 28 步。VAE 在量化版里仍然是 bf16,别去动它。
python -c "import torch; from diffusers import Flux2Pipeline; pipe=Flux2Pipeline.from_pretrained('diffusers/FLUX.2-dev-bnb-4bit', torch_dtype=torch.bfloat16); pipe.enable_model_cpu_offload(); pipe('a studio product shot of a matte black espresso machine', num_inference_steps=28, guidance_scale=4.0).images[0].save('out.png')"
一次真实批量出图要花多少钱
假设你要用 FLUX.2 dev 4-bit 出一批 300 张商品图,租 RTX 4090 24GB,$0.540/卡·时。建环境加拉权重算半小时:0.5 × $0.540 = $0.27;连续出图 4 小时:4 × $0.540 = $2.16;算力小计 $2.43。权重留在盘上过夜,4-bit dev 加 klein 4B GGUF 加编码器按 60GB 算,存储 $0.414/GB·月,一天就是 60 × 0.414 ÷ 30 = $0.83。300 张 1024×1024 PNG 大约 1.5GB 出网,1.5 × $0.0081 ≈ $0.01。整趟合计约 $3.27。同样这批图,如果换 RTX A6000 48GB 用 klein 9B bf16 跑,4.5 小时是 4.5 × $0.817 = $3.68;而 H200 141GB 把 dev 32B 加 Mistral-3 24B 编码器 bf16 全量常驻不做任何卸载,$6.660/卡·时——一个小时就比上面整趟还贵。这就是为什么先算显存再选卡:算力计费在实例停止的那一秒就停,存储会一直算到你把它销毁为止。
04 —
