跳到主要内容

图像生成模型

FLUX.2 本地部署:32B 要 141GB,4B 只要 13GB

从 klein 4B 的 Apache 2.0 权重到 dev 32B 的全精度推理,FLUX 家族的显存跨度差了十倍以上。这一页把每个变体的真实占用、量化档位和该租哪张卡摆在一起。

FLUX 是 Black Forest Labs 的图像生成与编辑模型线,主线现在走到 FLUX.2。这一代分四档:pro 和 flex 只走 API,dev 和 klein 放开权重。真正改变显存账的是架构那一刀——FLUX.1 用 T5-XXL 加 CLIP-L 双文本编码器,FLUX.2 换成了单个 Mistral-3 24B 视觉语言模型。文本编码器从两三 GB 变成二十多 B 参数,于是「FLUX 需要多大显存」这个问题的答案,一半以上不在扩散模型本身。

FLUX.2 [dev] 是 32B 的流匹配 Transformer,bf16 全部常驻显存要 141GB 以上,开 CPU offload 峰值降到约 80GB,4-bit 量化配 4-bit 文本编码器约 20GB,4-bit 配远程文本编码器约 18GB——官方点名这条路能跑在 RTX 4090 和 RTX 5090 上。klein 是尺寸蒸馏加步数蒸馏的小号:默认 4 步、guidance 1.0,4B 约 13GB 且是 Apache 2.0,9B 约 29GB(含 Qwen3-8B 编码器)但走非商用授权,官方另发了 fp8 权重。

FLUX.1 那条线也没退休。dev、Krea [dev]、Kontext [dev] 都是 12B,bf16 约 24GB、fp8 约 12GB、GGUF Q4 落在 6–8GB,ComfyUI 生态、LoRA 生态、TensorRT FP8/FP4 权重全是现成的,做产品图和批量编辑仍然是性价比最高的一档。你真正需要的,是在同一天里用 RTX 3090 试 klein 4B、用 RTX 4090 跑 4-bit dev、用 A6000 拉 klein 9B 全精度,然后只为跑掉的那几个小时付钱。NexGPU 有 2,498 张卡、75 个 GPU 型号、1,175 个已验证可租节点,按秒计费,没有起租门槛,也不用提配额工单。

01 —

FLUX 各版本参数与显存对照

开权重的六个主力变体,显存按社区和官方公开的实测口径列

版本参数量显存上下文说明
FLUX.2 [dev]32B(文本编码器 Mistral-3 24B)bf16 全量 ~141GB / CPU offload 峰值 ~80GB / fp8 ~32GB / 4-bit + 远程编码器 ~18GB最高 4MP 输出,最多 10 张参考图,总输入 14MP目前开权重里最强的一档,文生图和多图编辑同一套权重。FLUX.2-dev 非商用授权,商用要单独找 BFL 拿许可。
FLUX.2 [klein] 9B9B(文本编码器 Qwen3-8B)bf16 ~29GB;官方另有 FLUX.2-klein-9b-fp8 权重4 步蒸馏,guidance 1.0,1024×1024质量与延迟的甜点位,蒸馏后号称能对上大五倍模型的水准。非商用授权,另有 klein-9b-base 未蒸馏版本可做微调底座。
FLUX.2 [klein] 4B4B(文本编码器 Qwen3-4B)bf16 ~13GB;GGUF 单 transformer Q8_0 4.3GB、Q4_K_M 2.6GB、Q2_K 1.83GB4 步蒸馏,guidance 1.0,端到端可进亚秒级整个 FLUX.2 家族里唯一 Apache 2.0 的权重,加上同样 Apache 2.0 的 FLUX.2-VAE,是可以直接商用的那条路。
FLUX.1 [dev]12B(T5-XXL + CLIP-L)bf16 ~24GB / fp8 ~12GB / GGUF Q4 ~6–8GB1024×1024,官方示例 50 步、guidance_scale 3.5引导蒸馏模型,真 CFG 固定为 1,调的是 guidance embedding。LoRA 和工作流生态最厚的一代,非商用授权。
FLUX.1 Kontext [dev]12B与 FLUX.1 [dev] 同量级;官方提供 BF16 / FP8 / FP4 TensorRT 权重指令式图像编辑,兼容 FLUX.1 [dev] 推理代码「把这个人的衬衫换成红色」这类改图任务的开权重主力。ComfyUI、Diffusers、TensorRT 都是首日支持。
FLUX.1 [schnell]12Bbf16 ~16GB 起,fp8 / GGUF 档位与 dev 相同4 步出图Apache 2.0。想在 FLUX.1 这条线上做商用又不想谈授权,schnell 是唯一选项。

02 —

跑 FLUX 该租哪张卡

按显存诚实匹配,不把 32B 全精度往 24GB 卡上塞

  • 先试风格:klein 4B GGUF、FLUX.1 dev fp8 或 Q4,看画风和 prompt 跟随对不对

    RTX 3090 24GB$0.193/卡·时

    13GB 的 klein 4B 和 12GB 的 FLUX.1 fp8 都能整卡放下,这是全网单位显存最便宜的试错档。

  • FLUX.2 dev 4-bit 量化 + 远程或 4-bit 文本编码器,峰值约 18–20GB

    RTX 4090 24GB$0.540/卡·时

    官方 diffusers/FLUX.2-dev-bnb-4bit 直接点名的消费级路径,24GB 刚好覆盖峰值还留出 1024×1024 的激活空间。

  • klein 9B bf16 全精度,喂 10 张参考图、出 4MP 大图

    RTX A6000 48GB$0.817/卡·时

    29GB 权重在 32GB 卡上多参考图时会顶到边,48GB 让 4 步蒸馏的速度优势不被 offload 抵消。

  • FLUX.2 dev fp8 生产批量出图,32B 加 Mistral-3 编码器全程常驻

    A100 SXM4 80GB$1.088/卡·时

    约 32GB 的 fp8 权重加编码器还剩大半张卡做并发批次,比反复量化反量化省时间也省钱。

03 —

四步把 FLUX 跑起来

官方 flux2 仓库和 Diffusers 两条路都给,选一条走完

  1. 01

    开实例,选带 CUDA 的镜像

    在 console.nexgpu.net 按上面的表选卡,直接挑 PyTorch 或 ComfyUI 预置镜像开机。官方 flux2 仓库在 CUDA 12.9 + Python 3.12 上验证过,2,000+ 预置镜像里选对应的那一个能省掉半小时装驱动。开机后 SSH、Jupyter、网页终端任选。

    ssh root@<your-instance> -p <port>
  2. 02

    装官方推理仓库

    black-forest-labs/flux2 是 FLUX.2 的官方推理代码,klein 4B / klein 9B / dev 都从同一个 CLI 进。注意用 cu129 的 wheel index,装错 CUDA 版本是最常见的第一个坑。

    git clone https://github.com/black-forest-labs/flux2 && cd flux2 && python3.12 -m venv .venv && source .venv/bin/activate && pip install -e . --extra-index-url https://download.pytorch.org/whl/cu129
  3. 03

    拉权重,先用 klein 4B 打通链路

    klein 4B 是 Apache 2.0,不用点同意条款,13GB 显存就能出图,用它验证环境最快。CLI 的 --name 接受 klein-4b、klein-9b、dev 等注册名;权重放在自定义目录的话用 MODEL_PATH 和 AE_MODEL_PATH 指过去,实例重开也不用重新下载。klein 默认 4 步、guidance 1.0,别按 FLUX.1 的习惯去堆步数。

    hf download black-forest-labs/FLUX.2-klein-4B && PYTHONPATH=src python scripts/cli.py --name klein-4b
  4. 04

    换 dev 32B:走 4-bit 或 CPU offload

    要上 32B,在 24GB 卡上就用官方的 4-bit 量化权重加模型级 offload;显存够就直接 bf16 加载。dev 的推理默认 50 步、guidance 4.0,赶时间可以降到 28 步。VAE 在量化版里仍然是 bf16,别去动它。

    python -c "import torch; from diffusers import Flux2Pipeline; pipe=Flux2Pipeline.from_pretrained('diffusers/FLUX.2-dev-bnb-4bit', torch_dtype=torch.bfloat16); pipe.enable_model_cpu_offload(); pipe('a studio product shot of a matte black espresso machine', num_inference_steps=28, guidance_scale=4.0).images[0].save('out.png')"

一次真实批量出图要花多少钱

假设你要用 FLUX.2 dev 4-bit 出一批 300 张商品图,租 RTX 4090 24GB,$0.540/卡·时。建环境加拉权重算半小时:0.5 × $0.540 = $0.27;连续出图 4 小时:4 × $0.540 = $2.16;算力小计 $2.43。权重留在盘上过夜,4-bit dev 加 klein 4B GGUF 加编码器按 60GB 算,存储 $0.414/GB·月,一天就是 60 × 0.414 ÷ 30 = $0.83。300 张 1024×1024 PNG 大约 1.5GB 出网,1.5 × $0.0081 ≈ $0.01。整趟合计约 $3.27。同样这批图,如果换 RTX A6000 48GB 用 klein 9B bf16 跑,4.5 小时是 4.5 × $0.817 = $3.68;而 H200 141GB 把 dev 32B 加 Mistral-3 24B 编码器 bf16 全量常驻不做任何卸载,$6.660/卡·时——一个小时就比上面整趟还贵。这就是为什么先算显存再选卡:算力计费在实例停止的那一秒就停,存储会一直算到你把它销毁为止。

04 —

常见问题

FLUX.2 dev 到底需要多大显存?24GB 的卡能不能跑?

分四种口径:bf16 全部常驻显存需要 141GB 以上,只有 H200 这一级别扛得住;开 CPU offload 让组件轮流上卡,峰值约 80GB;4-bit 量化配 4-bit 文本编码器约 20GB;4-bit 配远程文本编码器约 18GB。所以 24GB 能跑,但必须走量化路线,而且这个数字是 1024×1024 的口径,往 4MP 或者多参考图上堆,激活还会往上走。NexGPU 上这几档正好对应 RTX 4090 24GB $0.540、A100 SXM4 80GB $1.088 和 H200 141GB $6.660,先租 4090 试 4-bit,觉得画质不够再换大卡,中间不用重新申请配额。

FLUX.1 dev 还值得跑吗?和 FLUX.2 差在哪?

值得。FLUX.1 dev 是 12B,bf16 约 24GB、fp8 约 12GB、GGUF Q4 只要 6–8GB,一张 RTX 3090 就能全速跑;FLUX.2 dev 是 32B,还挂了个 Mistral-3 24B 的文本编码器,显存直接跳一个数量级。换来的是 4MP 输出、最多 10 张参考图的多图编辑和明显更好的文字渲染。如果你的活是批量产品图、风格化插画、已有一堆 FLUX.1 LoRA,留在 FLUX.1 这条线上更划算;要做多图一致性和复杂排版才有必要上 FLUX.2。NexGPU 上 RTX 3090 24GB 只要 $0.193/卡·时,两条线并排开两台实例对比一下,成本还不到一杯咖啡。

FLUX 生成的图能商用吗?授权怎么算?

要看具体是哪个权重。FLUX.2 [klein] 4B 是 Apache 2.0,FLUX.2-VAE 也是 Apache 2.0,这条路可以直接商用;FLUX.1 [schnell] 同样是 Apache 2.0。FLUX.2 [dev]、FLUX.2 [klein] 9B、以及 FLUX.1 的 dev / Krea / Kontext / Fill / Depth / Canny / Redux 全部是非商用授权,商用需要走 BFL 的自助许可门户单独拿商业条款。另外 FLUX.2-dev 的授权还要求你在输入和输出两端都加 NSFW 与侵权内容过滤。这是法务问题不是算力问题,但它会决定你到底该租多大的卡——如果只能用 4B,13GB 就够了,NexGPU 上一张 RTX 3090 24GB 绰绰有余。

GGUF Q4 掉画质吗?量化档位怎么选?

掉,但掉在哪儿是可预期的:Q4 最先牺牲的是细密纹理和文字渲染,构图和色彩基本保得住。klein 4B 的 GGUF 里,Q8_0 是 4.3GB、Q6_K 3.41GB、Q4_K_M 2.6GB、Q2_K 1.83GB(都只算 transformer,不含编码器和 VAE)。做草稿和构图筛选用 Q4 完全够,终稿建议至少 Q8 或者干脆 fp8。还有个高频坑:在 ComfyUI 里用 GGUF 必须装 ComfyUI-GGUF 自定义节点走 Unet Loader (GGUF),而且文本编码器也得换成对应的 GGUF 版本,混用 fp16 编码器会直接报错或出废图。在 NexGPU 的 ComfyUI 预置镜像上开机,这套依赖是现成的,$0.193/卡·时起。

训 FLUX LoRA 需要什么显卡?

FLUX.1 dev 的 LoRA 训练在 ai-toolkit 这类工具里有现成的 24GB 配置(train_lora_flux_24gb.yaml),一张 RTX 4090 24GB 或 RTX 3090 24GB 就能开工,$0.540 和 $0.193 两个价位随你挑。想跑得舒服、批次大一点、分辨率高一点,RTX A6000 48GB $0.817 或 A100 PCIE 80GB $0.824 更合适——注意这两个价格几乎一样,80GB 显存基本是白送的。FLUX.2 这一代因为 32B 主干加 24B 编码器,微调请直接按 80GB 起步规划,或者用 klein-9b-base、klein-4b-base 这类未蒸馏版本做底座。NexGPU 单节点最多 14 张卡、最大节点显存 2,152GB,训练要横向扩也不用换供应商。

我在 4090 上一加载就 OOM,通常是哪里错了?

按出现频率排:第一,忘了 FLUX.2 的文本编码器是 Mistral-3 24B,你量化了扩散主干却让编码器跑 bf16,光编码器就吃掉整张卡——解法是同时量化编码器,或者用远程文本编码器把这部分挪出去。第二,没调 enable_model_cpu_offload(),所有组件同时驻留。第三,GGUF 编码器和主干版本不匹配。第四,系统内存不够:offload 会把权重往 RAM 里搬,官方口径是 32GB 系统内存起步、要做卸载建议 64GB,光看显存不看内存一样会崩。第五,权重下载没算够盘,FLUX.2 dev 加编码器加 VAE 一套下来 60GB 打底。这几条在 NexGPU 上都是选配置时就能避开的——挑一台内存和盘都够的节点开机,跑完停掉,算力按秒结算,不为踩坑的时间买单。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。