跳到主要内容

图像生成模型

Lumina 本地部署与显存实测:2.6B 起步,一张 24GB 卡就够

上海人工智能实验室 Alpha-VLLM 的 Lumina 系列,是国产开源图像生成里少数把「扩散」「自回归」「离散扩散」三条路线全走了一遍的家族。这一页把每条线的真实权重体积、显存占用和出图耗时摊开讲,再告诉你该租哪张卡。

很多人搜「Lumina 需要多大显存」时,心里想的其实是三个完全不同的模型。主线的 Lumina-Image 2.0 是 2.6B 的 Next-DiT 扩散模型,1024×1024 出图;Lumina-DiMOO 是 8B 的全离散扩散统一模型,生成、编辑、理解一把抓;Lumina-mGPT 2.0 则是纯自回归、逐 token 吐像素的路线。三者显存差了整整一个数量级,把它们当成一个模型去估算硬件,一定会踩坑。

Lumina-Image 2.0 最容易被低估的地方在于:它不是那种「一个 checkpoint 走天下」的 SD 系模型。ComfyUI 官方 repack 拆开来是三个文件——lumina_2_model_bf16.safetensors 5.22GB、gemma_2_2b_fp16.safetensors 5.23GB、ae.safetensors 335MB,合计 10.8GB。也就是说文本编码器和 DiT 主干几乎一样重。只按 2.6B 参数去算「5GB 显存够了吧」的人,加载到一半就会 OOM。另外 Hugging Face 官方仓库的张量类型标的是 F32,直接 from_pretrained 拉下来的体积比这份 bf16 repack 大一圈,磁盘和出网流量都要按那个数算。

真正让 Lumina 在中文社区活起来的,其实不是官方权重,而是基于它的动漫向微调:neta-art 的 Neta Lumina v1.0,以及在其之上继续训练的 NetaYume-Lumina-Image-2.0 v2。这条线保留了 Lumina-Image 2.0 的架构和 Apache-2.0 授权,同时把 Danbooru 标签和自然语言混排的提示词习惯带了进来,官方文档给出的最低配置是 8GB 显存、只跑在 ComfyUI 上。想在本地或云端复现这套流程,往下看硬件表。

01 —

Lumina 家族现役版本与显存占用

参数量、权重体积、分辨率和各自的定位,数字全部来自官方仓库

版本参数量显存上下文说明
Lumina-Image 2.02.6B(Next-DiT)bf16 三件套约 10.8GB:DiT 5.22GB + Gemma-2-2B fp16 5.23GB + VAE 335MB1024×1024主线文生图模型,Apache-2.0,ICCV 2025 收录。文本编码器用 Gemma-2-2B,VAE 用 FLUX 的 16 通道 autoencoder。diffusers 里是 Lumina2Pipeline,默认 50 步、guidance_scale 4.0、cfg_trunc_ratio 0.25。
Lumina-DiMOO8B(全离散扩散)A800 实测单卡 38.9GB;开 ML-Cache 后升到 45.9GB任意分辨率 / 高分辨率把文本和图像都当离散扩散处理的统一多模态模型,同时做文生图、图生图、编辑、局部重绘、外扩和图像理解。2025 年 9 月在 UniGenBench 生成榜拿过第一,Diffusers 与 ComfyUI 均已支持,是家族里更新最勤的一条线。
Lumina-mGPT 2.0 / 2.0-Omni7B(HF 权重页按 8B、BF16 标注)原生推理 80GB(A100);投机 Jacobi 解码 79.2GB;投机 Jacobi + 量化降到 33.8GB文生图 768px;图生图 512px / 768px从零训练的 decoder-only 自回归图像模型,Omni 版本额外覆盖图像对生成、主体驱动、多轮编辑、可控生成和稠密预测。速度是它的代价:A100 上原生 694 秒一张,加投机 Jacobi 324 秒,两项都开 304 秒。
Neta Lumina v1.02.6B(Lumina-Image 2.0 微调)与底模同级,官方标注最低 8GB 显存1024×1024 / 768×1532 / 968×1322,建议不低于 1024neta-art 出品的动漫向微调,也是中文社区里用得最多的 Lumina 分支。官方推荐 res_multistep 或 euler_ancestral 采样器、linear_quadratic 调度、30 步、CFG 4~5.5,仅支持 ComfyUI。提供 all-in-one 合并版,也可以按 unet / text_encoders / vae 三件套分开放。
NetaYume-Lumina-Image-2.0 v2(含 GGUF)2.6B 量化GGUF 主干:Q4_K_M 2.13GB / Q5_K_M 2.35GB / Q8_0 3.09GB / BF16 5.22GB(均不含文本编码器)1024 级在 Neta Lumina 基础上继续训练,兼顾写实人像与动漫。社区做了完整的 GGUF 量化梯度,最低 Q2_K 只有 1.43GB。注意量化的只是 DiT 主干,Gemma-2-2B 文本编码器和 VAE 还得另算,别照着 2.13GB 去选卡。推荐 CFG 4~7、40~50 步。
Lumina-Video 1.0Multi-scale Next-DiT官方未公布显存数字,需自行实测1248×704,24fps,最长 96 帧(约 4 秒)家族里的视频线探索版,checkpoint 是 Alpha-VLLM/Lumina-Video-f24R960。发布后维护节奏明显慢于图像线,想做视频建议先把它当技术验证,别当生产管线。

02 —

跑 Lumina 该租哪张卡

按实测显存对齐 NexGPU 的实际卡型和按秒计费的挂牌价

  • Lumina-Image 2.0 / Neta Lumina 单卡出图,1024×1024 全精度不量化

    RTX 3090 24GB$0.193/卡·时

    10.8GB 权重加上 1024² 的激活,24GB 显存留足余量,而且它是全网表里最便宜的 24GB 卡——比 16GB 的 Tesla T4($0.298)还便宜,没有理由为了省显存去挤 T4。

  • Lumina-Image 2.0 LoRA 微调、批量出图、或同时挂 Neta 与 NetaYume 两套权重

    RTX 4090 24GB$0.540/卡·时

    Ada 架构的 bf16 吞吐远高于 3090,50 步一张的固定成本被压下来,微调时梯度和优化器状态也压得住;显存吃紧就换 RTX A6000 48GB($0.817/卡·时)。

  • Lumina-DiMOO 8B 全功能推理,含 ML-Cache 加速

    A100 PCIE 80GB$0.824/卡·时

    38.9GB 基线看似 48GB 卡能塞下,但开了 ML-Cache 要 45.9GB,余量太薄;A100 PCIE 80GB 只比 A6000 48GB 贵 $0.007,多出来的 32GB 白送,没必要为这点钱冒 OOM 的险。

  • Lumina-mGPT 2.0 7B 原生 768px 自回归生成,不做量化

    A100 SXM4 80GB$1.088/卡·时

    官方实测就是 80GB 显存打底,SXM4 的带宽对逐 token 解码这种访存密集型负载更友好;如果接受投机 Jacobi + 量化把占用压到 33.8GB,回落到 RTX A6000 48GB($0.817/卡·时)就够。

03 —

从开卡到出第一张图

四步,走 ComfyUI 或 diffusers 两条路都写清楚了

  1. 01

    开一台带 ComfyUI 或 PyTorch 的实例

    NexGPU 有 2,000 多个预置镜像,ComfyUI、PyTorch、Stable Diffusion 都在里面,不用自己装驱动和 CUDA。SSH、Jupyter、Web 终端、REST API、CLI 五种进入方式随便挑。开机后先确认卡型和显存对不对得上。

    nvidia-smi --query-gpu=name,memory.total --format=csv
  2. 02

    拉三件套权重,别只拉 DiT

    Comfy-Org 的 repack 仓库把 bf16 主干、fp16 的 Gemma-2-2B 和 16 通道 VAE 拆好了,分别放进 ComfyUI 的 unet、text_encoders、vae 目录。走官方 Alpha-VLLM 仓库也行,但那边张量是 F32,体积更大。动漫向就把主干换成 neta-lumina-v1.0.safetensors 或 NetaYume_Lumina_v2_all_in_one.safetensors,文本编码器和 VAE 完全复用。

    hf download Comfy-Org/Lumina_Image_2.0_Repackaged split_files/diffusion_models/lumina_2_model_bf16.safetensors --local-dir ./models
  3. 03

    走 diffusers 的话,记得带上 cfg_trunc_ratio

    Lumina2Pipeline 已经进了 diffusers 主线。cfg_trunc_ratio=0.25 是这个模型的特色参数——CFG 只在前 25% 的时间步上生效,抄别的模型的采样代码而漏掉它,出图风格会明显不一样。显存不够就在 pipeline 上调用 enable_model_cpu_offload() 把权重换到 CPU。

    python -c "import torch; from diffusers import Lumina2Pipeline; p=Lumina2Pipeline.from_pretrained('Alpha-VLLM/Lumina-Image-2.0', torch_dtype=torch.bfloat16).to('cuda'); p('a serene lake at dusk', height=1024, width=1024, guidance_scale=4.0, num_inference_steps=50, cfg_trunc_ratio=0.25).images[0].save('out.png')"
  4. 04

    要编辑、外扩和图像理解,换 Lumina-DiMOO

    Lumina-Image 2.0 只做文生图。局部重绘、外扩、主体驱动、多轮编辑加图像理解这些活儿在 Lumina-DiMOO 上是一个 8B 模型全包。ML-Cache 有 cache_ratio、warmup_ratio、refresh_interval 三个旋钮,速度提升在图像生成上最明显,图像理解那边因为是分块解码,收益要小得多。这一步请直接开 80GB 的卡。

    git clone https://github.com/Alpha-VLLM/Lumina-DiMOO.git && cd Lumina-DiMOO && pip install -r requirements.txt

一次真实的成本核算

拿 Lumina-DiMOO 官方在 A800 上给的实测数据算:单张图 58.2 秒,开 ML-Cache 后 32.2 秒。A800 和 A100 是同一颗核心,单卡推理速度基本可以对齐 NexGPU 的 A100 PCIE 80GB($0.824/卡·时)。跑 500 张图——不开缓存是 500 × 58.2 秒 = 29,100 秒 = 8.083 小时,8.083 × 0.824 = $6.66;开 ML-Cache 是 500 × 32.2 秒 = 16,100 秒 = 4.472 小时,4.472 × 0.824 = $3.69。同样 500 张省下 $2.98,代价是显存从 38.9GB 涨到 45.9GB,所以这张卡必须是 80GB 那一档,48GB 卡省不下这笔钱。换到 Lumina-Image 2.0 / Neta Lumina 这条线,权重只有 10.8GB,RTX 3090 24GB 是 $0.193/卡·时,通宵跑 8 小时批量出图就是 0.193 × 8 = $1.54。权重留在持久盘上,10.8GB × $0.414 = 每月 $4.47;计算在实例停止的那一秒就停止计费,存储要销毁才停。按秒计费、按小时计价,没有最低消费、没有开通费、不用提配额申请。

04 —

常见问题

Lumina-Image 2.0 本地部署到底需要多大显存?24GB 够不够?

够,而且余量不小。bf16 下 DiT 主干 5.22GB、Gemma-2-2B 文本编码器 5.23GB、16 通道 VAE 335MB,合计 10.8GB,1024×1024 的激活再吃几个 GB,24GB 卡跑得很舒服。真正的陷阱是只按 2.6B 参数算显存,忘了文本编码器几乎和主干一样重。在 NexGPU 上 RTX 3090 24GB 是 $0.193/卡·时,按秒计费,试一晚也就一块多美元。

Lumina、Neta Lumina、NetaYume Lumina 到底是什么关系?

Lumina-Image 2.0 是上海人工智能实验室 Alpha-VLLM 的底模;neta-art 在它上面做动漫向微调得到 Neta Lumina v1.0;duongve 又在 Neta Lumina 的骨干上继续训练出 NetaYume-Lumina-Image-2.0 v2,兼顾写实人像和动漫。三者架构一致,文本编码器(Gemma-2-2B)和 VAE(FLUX 16 通道)完全通用,换主干文件就能切。想同时把三套权重摆在一台机器上对比,NexGPU 的 RTX 4090 24GB $0.540/卡·时 起,实例停了计算就不计费。

Lumina-DiMOO 开了 ML-Cache 反而更费显存,这正常吗?

正常,这就是这个缓存的设计取舍。官方在 A800 上的数字是:不开缓存 58.2 秒 / 38.9GB,开了 32.2 秒 / 45.9GB——用 7GB 显存换掉将近一半的时间。所以「加速版」反而卡不下 48GB 那一档的余量。要用 ML-Cache 就直接上 NexGPU 的 A100 PCIE 80GB,$0.824/卡·时,只比 A6000 48GB 贵 $0.007。

为什么 Lumina-mGPT 2.0 出一张图要好几分钟?

因为它是纯自回归的 decoder-only 模型,图像是一个 token 一个 token 生成出来的,不是扩散那样几十步并行去噪。官方在 A100 上的实测:768px 原生 694 秒,加投机 Jacobi 解码 324 秒,投机 Jacobi + 量化 304 秒。顺带一提,投机 Jacobi 不建议用在图生图任务上。这种长任务最适合按秒计费的租用方式——NexGPU 的 A100 SXM4 80GB $1.088/卡·时,跑完就停,不用为空转买单。

显存只有 8GB,能用 GGUF 量化在本地跑 Lumina 吗?

Neta Lumina 官方标注的最低配置就是 8GB 显存(仅 ComfyUI),社区也做了完整的 GGUF 量化:Q4_K_M 2.13GB、Q8_0 3.09GB、最低的 Q2_K 只有 1.43GB。但量化的只是 DiT 主干,Gemma-2-2B 文本编码器和 VAE 还得另外占位,8GB 卡上基本要靠文本编码器换出到内存才转得动,出图速度和画质都要打折。想直接拿全精度出成品图,NexGPU 的 RTX 3090 24GB 只要 $0.193/卡·时,比折腾量化划算得多。

Lumina 是什么许可证?拿来做商业项目有没有坑?

Lumina-Image 2.0、Lumina-DiMOO、Lumina-mGPT 2.0、Neta Lumina、NetaYume 的权重都是 Apache-2.0,本体很干净。要注意的是配套组件:文本编码器是 Google 的 Gemma-2-2B,走的是 Gemma 自己的使用条款而不是 Apache-2.0,从官方 google/gemma-2-2b 仓库拉还要先在 Hugging Face 上接受条款并带 token(Comfy-Org 的 repack 版可以绕过这一步);VAE 沿用 FLUX 的 16 通道 autoencoder,商用前也值得把这一层的授权确认一遍。合规问题自己把关,算力这边 NexGPU 覆盖 51 个国家和地区、1,175 个已验证可租节点、2,498 张 GPU,需要哪个地区的机器都开得出来。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。