很多人搜「Lumina 需要多大显存」时,心里想的其实是三个完全不同的模型。主线的 Lumina-Image 2.0 是 2.6B 的 Next-DiT 扩散模型,1024×1024 出图;Lumina-DiMOO 是 8B 的全离散扩散统一模型,生成、编辑、理解一把抓;Lumina-mGPT 2.0 则是纯自回归、逐 token 吐像素的路线。三者显存差了整整一个数量级,把它们当成一个模型去估算硬件,一定会踩坑。
Lumina-Image 2.0 最容易被低估的地方在于:它不是那种「一个 checkpoint 走天下」的 SD 系模型。ComfyUI 官方 repack 拆开来是三个文件——lumina_2_model_bf16.safetensors 5.22GB、gemma_2_2b_fp16.safetensors 5.23GB、ae.safetensors 335MB,合计 10.8GB。也就是说文本编码器和 DiT 主干几乎一样重。只按 2.6B 参数去算「5GB 显存够了吧」的人,加载到一半就会 OOM。另外 Hugging Face 官方仓库的张量类型标的是 F32,直接 from_pretrained 拉下来的体积比这份 bf16 repack 大一圈,磁盘和出网流量都要按那个数算。
真正让 Lumina 在中文社区活起来的,其实不是官方权重,而是基于它的动漫向微调:neta-art 的 Neta Lumina v1.0,以及在其之上继续训练的 NetaYume-Lumina-Image-2.0 v2。这条线保留了 Lumina-Image 2.0 的架构和 Apache-2.0 授权,同时把 Danbooru 标签和自然语言混排的提示词习惯带了进来,官方文档给出的最低配置是 8GB 显存、只跑在 ComfyUI 上。想在本地或云端复现这套流程,往下看硬件表。
01 —
Lumina 家族现役版本与显存占用
参数量、权重体积、分辨率和各自的定位,数字全部来自官方仓库
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Lumina-Image 2.0 | 2.6B(Next-DiT) | bf16 三件套约 10.8GB:DiT 5.22GB + Gemma-2-2B fp16 5.23GB + VAE 335MB | 1024×1024 | 主线文生图模型,Apache-2.0,ICCV 2025 收录。文本编码器用 Gemma-2-2B,VAE 用 FLUX 的 16 通道 autoencoder。diffusers 里是 Lumina2Pipeline,默认 50 步、guidance_scale 4.0、cfg_trunc_ratio 0.25。 |
| Lumina-DiMOO | 8B(全离散扩散) | A800 实测单卡 38.9GB;开 ML-Cache 后升到 45.9GB | 任意分辨率 / 高分辨率 | 把文本和图像都当离散扩散处理的统一多模态模型,同时做文生图、图生图、编辑、局部重绘、外扩和图像理解。2025 年 9 月在 UniGenBench 生成榜拿过第一,Diffusers 与 ComfyUI 均已支持,是家族里更新最勤的一条线。 |
| Lumina-mGPT 2.0 / 2.0-Omni | 7B(HF 权重页按 8B、BF16 标注) | 原生推理 80GB(A100);投机 Jacobi 解码 79.2GB;投机 Jacobi + 量化降到 33.8GB | 文生图 768px;图生图 512px / 768px | 从零训练的 decoder-only 自回归图像模型,Omni 版本额外覆盖图像对生成、主体驱动、多轮编辑、可控生成和稠密预测。速度是它的代价:A100 上原生 694 秒一张,加投机 Jacobi 324 秒,两项都开 304 秒。 |
| Neta Lumina v1.0 | 2.6B(Lumina-Image 2.0 微调) | 与底模同级,官方标注最低 8GB 显存 | 1024×1024 / 768×1532 / 968×1322,建议不低于 1024 | neta-art 出品的动漫向微调,也是中文社区里用得最多的 Lumina 分支。官方推荐 res_multistep 或 euler_ancestral 采样器、linear_quadratic 调度、30 步、CFG 4~5.5,仅支持 ComfyUI。提供 all-in-one 合并版,也可以按 unet / text_encoders / vae 三件套分开放。 |
| NetaYume-Lumina-Image-2.0 v2(含 GGUF) | 2.6B 量化 | GGUF 主干:Q4_K_M 2.13GB / Q5_K_M 2.35GB / Q8_0 3.09GB / BF16 5.22GB(均不含文本编码器) | 1024 级 | 在 Neta Lumina 基础上继续训练,兼顾写实人像与动漫。社区做了完整的 GGUF 量化梯度,最低 Q2_K 只有 1.43GB。注意量化的只是 DiT 主干,Gemma-2-2B 文本编码器和 VAE 还得另算,别照着 2.13GB 去选卡。推荐 CFG 4~7、40~50 步。 |
| Lumina-Video 1.0 | Multi-scale Next-DiT | 官方未公布显存数字,需自行实测 | 1248×704,24fps,最长 96 帧(约 4 秒) | 家族里的视频线探索版,checkpoint 是 Alpha-VLLM/Lumina-Video-f24R960。发布后维护节奏明显慢于图像线,想做视频建议先把它当技术验证,别当生产管线。 |
02 —
跑 Lumina 该租哪张卡
按实测显存对齐 NexGPU 的实际卡型和按秒计费的挂牌价
Lumina-Image 2.0 / Neta Lumina 单卡出图,1024×1024 全精度不量化
RTX 3090 24GB$0.193/卡·时
10.8GB 权重加上 1024² 的激活,24GB 显存留足余量,而且它是全网表里最便宜的 24GB 卡——比 16GB 的 Tesla T4($0.298)还便宜,没有理由为了省显存去挤 T4。
Lumina-Image 2.0 LoRA 微调、批量出图、或同时挂 Neta 与 NetaYume 两套权重
RTX 4090 24GB$0.540/卡·时
Ada 架构的 bf16 吞吐远高于 3090,50 步一张的固定成本被压下来,微调时梯度和优化器状态也压得住;显存吃紧就换 RTX A6000 48GB($0.817/卡·时)。
Lumina-DiMOO 8B 全功能推理,含 ML-Cache 加速
A100 PCIE 80GB$0.824/卡·时
38.9GB 基线看似 48GB 卡能塞下,但开了 ML-Cache 要 45.9GB,余量太薄;A100 PCIE 80GB 只比 A6000 48GB 贵 $0.007,多出来的 32GB 白送,没必要为这点钱冒 OOM 的险。
Lumina-mGPT 2.0 7B 原生 768px 自回归生成,不做量化
A100 SXM4 80GB$1.088/卡·时
官方实测就是 80GB 显存打底,SXM4 的带宽对逐 token 解码这种访存密集型负载更友好;如果接受投机 Jacobi + 量化把占用压到 33.8GB,回落到 RTX A6000 48GB($0.817/卡·时)就够。
03 —
从开卡到出第一张图
四步,走 ComfyUI 或 diffusers 两条路都写清楚了
- 01
开一台带 ComfyUI 或 PyTorch 的实例
NexGPU 有 2,000 多个预置镜像,ComfyUI、PyTorch、Stable Diffusion 都在里面,不用自己装驱动和 CUDA。SSH、Jupyter、Web 终端、REST API、CLI 五种进入方式随便挑。开机后先确认卡型和显存对不对得上。
nvidia-smi --query-gpu=name,memory.total --format=csv - 02
拉三件套权重,别只拉 DiT
Comfy-Org 的 repack 仓库把 bf16 主干、fp16 的 Gemma-2-2B 和 16 通道 VAE 拆好了,分别放进 ComfyUI 的 unet、text_encoders、vae 目录。走官方 Alpha-VLLM 仓库也行,但那边张量是 F32,体积更大。动漫向就把主干换成 neta-lumina-v1.0.safetensors 或 NetaYume_Lumina_v2_all_in_one.safetensors,文本编码器和 VAE 完全复用。
hf download Comfy-Org/Lumina_Image_2.0_Repackaged split_files/diffusion_models/lumina_2_model_bf16.safetensors --local-dir ./models - 03
走 diffusers 的话,记得带上 cfg_trunc_ratio
Lumina2Pipeline 已经进了 diffusers 主线。cfg_trunc_ratio=0.25 是这个模型的特色参数——CFG 只在前 25% 的时间步上生效,抄别的模型的采样代码而漏掉它,出图风格会明显不一样。显存不够就在 pipeline 上调用 enable_model_cpu_offload() 把权重换到 CPU。
python -c "import torch; from diffusers import Lumina2Pipeline; p=Lumina2Pipeline.from_pretrained('Alpha-VLLM/Lumina-Image-2.0', torch_dtype=torch.bfloat16).to('cuda'); p('a serene lake at dusk', height=1024, width=1024, guidance_scale=4.0, num_inference_steps=50, cfg_trunc_ratio=0.25).images[0].save('out.png')" - 04
要编辑、外扩和图像理解,换 Lumina-DiMOO
Lumina-Image 2.0 只做文生图。局部重绘、外扩、主体驱动、多轮编辑加图像理解这些活儿在 Lumina-DiMOO 上是一个 8B 模型全包。ML-Cache 有 cache_ratio、warmup_ratio、refresh_interval 三个旋钮,速度提升在图像生成上最明显,图像理解那边因为是分块解码,收益要小得多。这一步请直接开 80GB 的卡。
git clone https://github.com/Alpha-VLLM/Lumina-DiMOO.git && cd Lumina-DiMOO && pip install -r requirements.txt
一次真实的成本核算
拿 Lumina-DiMOO 官方在 A800 上给的实测数据算:单张图 58.2 秒,开 ML-Cache 后 32.2 秒。A800 和 A100 是同一颗核心,单卡推理速度基本可以对齐 NexGPU 的 A100 PCIE 80GB($0.824/卡·时)。跑 500 张图——不开缓存是 500 × 58.2 秒 = 29,100 秒 = 8.083 小时,8.083 × 0.824 = $6.66;开 ML-Cache 是 500 × 32.2 秒 = 16,100 秒 = 4.472 小时,4.472 × 0.824 = $3.69。同样 500 张省下 $2.98,代价是显存从 38.9GB 涨到 45.9GB,所以这张卡必须是 80GB 那一档,48GB 卡省不下这笔钱。换到 Lumina-Image 2.0 / Neta Lumina 这条线,权重只有 10.8GB,RTX 3090 24GB 是 $0.193/卡·时,通宵跑 8 小时批量出图就是 0.193 × 8 = $1.54。权重留在持久盘上,10.8GB × $0.414 = 每月 $4.47;计算在实例停止的那一秒就停止计费,存储要销毁才停。按秒计费、按小时计价,没有最低消费、没有开通费、不用提配额申请。
04 —
