跳到主要内容

视频生成模型

LTX-Video 本地部署:22B 的 LTX-2 到底要多大显存

Lightricks 已经把开发主线从 LTX-Video 搬到了 LTX-2 —— 一个视频流 14B、音频流 5B 的联合音视频 DiT。下面是每个版本的真实权重体积、跑得动它的卡,以及按秒计费的价格。

搜「LTX-Video 本地部署」的人,大多还停在 0.9.x。但 LTX-Video 仓库首页现在挂着一句话:LTX-2 is now the primary home for LTX development。旧线最后一次大更新是 2025 年 7 月 16 日的 0.9.8 蒸馏模型,把单条视频拉长到 60 秒,默认 1216×704 @30fps,没有音频,走 OpenRAIL-M 授权。LTX-2 在 2025 年 10 月 23 日发布,原生 4K、最高 50fps、音视频一次生成且严格同步 —— 这是两个不同的东西,别拿旧线的显存经验去估新线的账。

LTX-2 的架构是一个非对称双流 transformer:14B 的视频流和 5B 的音频流,用双向音视频交叉注意力加时序位置编码耦合起来,再用跨模态 AdaLN 共享 timestep 条件,所以它给视频分的容量远多于音频。到 LTX-2.3 和当前推荐的 LTX-2.5,规模涨到 22B,文本编码器从 Gemma 3 12B 换成了随模型一起微调的 Gemma 4 12B。2.5 还把权重拆成了单组件文件,你可以只下管线真正用到的那几个 —— 官方 Quick Start 那一套是五个文件、约 66GiB。

显存这件事没有含糊空间。ComfyUI-LTXVideo 的前置要求写得很直白:CUDA 显卡 32GB+ 显存、100GB+ 空闲磁盘;仓库里那个 low_vram_loaders.py 存在的唯一理由,就是靠调度加载顺序和卸载把生成压进 32GB。bf16 的 22B transformer 单文件 39.13GiB,Gemma 4 编码器 24.46GiB —— 要么上 80GB 卡让它们常驻,要么靠 --quantization fp8-cast / nvfp4-cast 配 --offload cpu|disk 硬塞。NexGPU 上 RTX 5090 32GB、A100 SXM4 80GB、H100 SXM 80GB、H200 141GB 都能按秒开,不用申请配额。

01 —

LTX 全系版本与权重体积

文件大小取自 Hugging Face 官方仓库,是你真正要下载、要装进显存的东西。

版本参数量显存上下文说明
LTX-2.5 22B distilled(当前推荐)22Bbf16 39.13GiB / NVFP4 17.44GiB / ComfyUI int8 20.03GiB默认 121 帧 @24fps ≈ 5 秒;两阶段管线分辨率需被 64 整除DistilledPipeline 用它,走 8 个预设 sigma(stage 1 八步、stage 2 四步),是官方 Quick Start 的默认选择。ICLoraPipeline 和 DubItPipeline 也认这个权重。
LTX-2.5 22B dev22Bbf16 39.13GiB / ComfyUI int8 20.03GiB单阶段默认输出 512×768,两阶段再 2× 空间上采样引导式两阶段管线(TI2VidTwoStages、TI2VidTwoStagesHQ、DFR)要的完整模型,stage 2 精修还需要 ltx-2.5-22b-distilled-lora-450-bf16(8.29GiB)。
Gemma 4 12B 文本编码器(LTX-2.5 专用)12Bbf16 24.46GiB / ComfyUI int8 14.32GiB版本标识 gemma4-12b-ltx-v1,加载时强制校验每条管线都必需,且已随模型微调、把文本投影打包在内。Google 官方的 Gemma 4 不能替代,版本对不上会直接报错。
LTX-2.3 22B dev / distilled-1.122B单文件 42.98GiB(打包 transformer、音视频 VAE 与文本投影)配 Gemma 3 12B(gemma-3-12b-it-qat-q4_0-unquantized),需单独下载上一代单文件布局,ComfyUI 现成工作流最多的一档,IC-LoRA 生态(Union Control、HDR、Dub-It、着色、去模糊)也最全。权重与 LoRA 都不能和 2.5 混用。
LTX-2 19B dev / distilled19B(14B 视频流 + 5B 音频流)bf16 40.31GiB / FP8 25.22GiB / NVFP4 18.62GiB原生 4K、最高 50fps、同步音频最长约 10 秒技术报告里的那一版,也是唯一 fp8、fp4 预量化权重都公开齐全的一代。要在 24–32GB 卡上试 LTX-2 的音视频联合生成,从 19b-dev-fp4 起步最省事。
LTX-Video 0.9.8(13B / 2B,旧线)13B / 2B13B bf16 26.62GiB、fp8 14.62GiB;2B distilled 5.91GiB、fp8 4.16GiB默认 1216×704 @30fps,单次 ≤257 帧(8k+1),最长 60 秒OpenRAIL-M 授权,没有音频,文本编码器是 T5-XXL。24GB 卡上唯一舒服的一代,适合先跑通 i2v/t2v 再决定要不要上 LTX-2。

02 —

按版本选卡:NexGPU 上真正跑得动的配置

显存对得上才推荐;对不上的档我们直接说别租。

  • 先用旧线 LTX-Video 0.9.8 跑通 t2v / i2v

    RTX 4090 24GB$0.540/卡·时

    Ada 架构原生支持 FP8,13B-fp8 权重 14.62GiB 加 T5-XXL 分批加载正好塞进 24GB,2B distilled(5.91GiB)更是绰绰有余。

  • LTX-2.5 单卡自托管,走 NVFP4 量化

    RTX 5090 32GB$0.723/卡·时

    --quantization nvfp4-cast / nvfp4-prequant 只在 Blackwell(SM ≥ 10)上可用,17.44GiB 的 NVFP4 transformer 配 int8 编码器刚好压在 ComfyUI 官方那条 32GB 线上。

  • LTX-2.5 bf16 不量化、不卸载地出片

    A100 SXM4 80GB$1.088/卡·时

    39.13GiB 的 transformer 和 24.46GiB 的 Gemma 4 能一起常驻,省掉 --offload cpu 的反复搬运;Ampere 没有原生 FP8,就老实跑 bf16 + PyTorch SDPA,胜在便宜。

  • 批量出片、4K DFR 细节渲染加时序超分

    H100 SXM 80GB$3.582/卡·时

    Hopper 才能用 --quantization fp8-scaled-mm 和 FlashAttention 3;要一次吃下 4K 两阶段再叠两轮时间超分,往上还有 H200 141GB($6.660/卡·时)。

03 —

四步把 LTX-2.5 跑起来

从空实例到第一条带同步音频的 mp4。

  1. 01

    开实例并装依赖

    从 2,000+ 预置镜像里选 PyTorch 或 ComfyUI 镜像,clone 仓库后用 uv 同步。natten 是 diffusion VAE 解码最快的后端,只在 Linux + CUDA 上装得上,Windows / macOS 会自动跳过并回退到 Triton 或 eager 实现。

    git clone https://github.com/Lightricks/LTX-2.git && cd LTX-2 && uv sync --extra natten
  2. 02

    登录并拉权重(仓库是 gated 的)

    LTX-2.5 在 Hugging Face 上是受限仓库:先在网页接受模型条款,再用 Read token 登录,fine-grained token 还得勾上「read gated repos」权限,否则 hf download 直接 401/403。下面这五个文件合计约 66GiB。

    hf auth login && hf download Lightricks/LTX-2.5 diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors vae/ltx-2.5-video-vae-bf16.safetensors vae/ltx-2.5-audio-vae-bf16.safetensors latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors --local-dir models/ltx-2.5
  3. 03

    跑 DistilledPipeline 出第一条片

    默认 121 帧 @24fps,约 5 秒,视频和音频一起出。显存吃紧就加 --quantization fp8-cast 和 --offload cpu(内存也不够就 disk,会明显变慢);开量化时记得设 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True。提示词按镜头脚本写,单段 200 词以内效果最好。

    PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True uv run python -m ltx_pipelines.distilled --transformer-path models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors --text-encoder-path models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors --video-vae-path models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors --audio-vae-path models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors --num-frames 121 --seed 42 --quantization fp8-cast --offload cpu --output-path output.mp4 --prompt 'A medium close-up shot of a man looking directly at the camera, speaking in a calm voice, static camera, shallow depth of field, soft window light'
  4. 04

    换 ComfyUI 或更高质量的管线

    LTX-2 已经进了 ComfyUI 核心,额外节点和示例工作流在 ComfyUI-LTXVideo 里;显存紧张就用仓库自带的 low_vram_loaders.py,它会安排好加载顺序把生成压进 32GB,再配 --reserve-vram 留出余量。追细节就换 DFRPipeline:先半分辨率生成关键帧,再全分辨率细节重渲,可选两轮 2× 时序超分,快速运动不容易糊。

    python -m main --reserve-vram 5

一条 5 秒带音频的片子,租卡到底花多少

以 LTX-2.5 distilled 为例。拉那 66GiB 权重按 0.5 小时算,再花 2 小时调提示词、分辨率和步数,一共 2.5 小时:A100 SXM4 80GB 是 $1.088 × 2.5 = $2.72;换 RTX 5090 32GB 走 NVFP4 是 $0.723 × 2.5 = $1.81;要 Hopper 的 fp8-scaled-mm 和 FlashAttention 3,H100 SXM 80GB 是 $3.582 × 2.5 = $8.96。真正会咬人的是存储:66GB 权重按 $0.414/GB·月的中位价算,就是 66 × 0.414 = $27.32 每月,比不少人的算力账单还高 —— 所以跑完就销毁卷,或者只留 NVFP4 那一份 17.44GB(17.44 × 0.414 ≈ $7.22/月)。成片导出走出网流量 $0.0081/GB,100 条 1080p 短片约 20GB,也就 20 × 0.0081 ≈ $0.16。计算按秒计量、按小时计价,实例一停就不再计费;存储要到卷销毁才停 —— 这一点在 66GiB 的视频模型上尤其值得记住。

04 —

常见问题

LTX-Video 和 LTX-2 是什么关系?现在还该不该部署 0.9.8?

LTX-Video 仓库首页已经明说 LTX-2 是 LTX 开发的主线所在。旧线停在 2025 年 7 月 16 日的 0.9.8:13B / 2B、无音频、OpenRAIL-M 授权、最长 60 秒、默认 1216×704 @30fps。它并没有失去价值 —— 24GB 卡就能跑,迭代快,适合验证分镜和运动。但要同步音频、要 4K、要进生产,就直接上 LTX-2.5。两条线在 NexGPU 上分别对应 RTX 4090 24GB($0.540/卡·时)和 RTX 5090 32GB 起步($0.723/卡·时),先开小的验证、再换大的出片,中间不用重新申请任何配额。

LTX-2.5 本地部署最低需要多大显存?

官方给的硬门槛是 32GB+ 显存加 100GB+ 空闲磁盘,ComfyUI-LTXVideo 的前置要求里就是这么写的,仓库里的 low_vram_loaders.py 也是为了「让生成刚好装进 32GB」而存在。算一下就明白:bf16 transformer 39.13GiB、Gemma 4 编码器 24.46GiB,32GB 卡必须靠 NVFP4 或 int8 量化加 --offload 才进得去。不想折腾就 80GB 起步。NexGPU 上 RTX 5090 32GB $0.723/卡·时、A100 PCIE 80GB $0.824/卡·时、A100 SXM4 80GB $1.088/卡·时,可以先按小时试哪一档更划算。

24GB 的 RTX 4090 能跑 LTX-2 吗?

硬塞是能的 —— fp8-cast 加 --offload disk,再对 VAE 解码开 tiling 避免 OOM,但全程都在换页,体验很差,调一次参数要等很久。24GB 更合适的是旧线 0.9.8:13B-fp8 才 14.62GiB,2B distilled 5.91GiB,跑得很舒服。真要 LTX-2,最省心的入门是 19b-dev-fp4(18.62GiB)配 32GB 卡。NexGPU 的 RTX 4090 24GB 是 $0.540/卡·时、RTX 5090 32GB 是 $0.723/卡·时,差价小到没必要在 24GB 上硬扛。

hf download 报 401 / 403,或者换了 checkpoint 就加载失败,怎么回事?

三个坑。一,LTX-2.5 是 gated 仓库,要先在网页接受条款,再用带「read gated repos」权限的 Read token 登录。二,LTX-2.3 和 LTX-2.5 的 checkpoint 不通用,LoRA 也绑定训练时的模型版本,混用必然失败。三,文本编码器必须用随模型分发的 gemma4-12b-with-proj-ltx-2.5,加载时会校验 gemma4-12b-ltx-v1 这个版本标识,Google 官方 Gemma 4 顶不上。在 NexGPU 实例里用 SSH、Jupyter 或网页终端登录一次就够,权重落在卷上,下次开机直接挂载,不用重下 66GiB。

LTX-2 可以商用吗?授权门槛在哪?

走的是 LTX-2.x Community License Agreement。关键条款是:年收入达到 $10,000,000 的实体(子公司、关联方和受同一控制的公司要合并计算)任何商业使用都必须另外向 Lightricks 购买 Commercial Use Agreement;只有个人的研究学习娱乐,以及企业在非生产环境下的测试评估,才算 Non-Commercial Purpose。旧线 0.9.x 是 OpenRAIL-M,宽松得多。我们只提供算力,授权关系在你和 Lightricks 之间 —— 不过在 NexGPU 上花几美元把评测跑完,正好落在授权明确允许的「非生产环境测试评估」范围里,做决策前先把效果看清楚。

生成太慢,有哪些提速手段?

官方推荐的顺序是:优先用 DistilledPipeline(8 个预设 sigma,stage 1 八步 + stage 2 四步);开量化,Hopper+ 用 fp8-scaled-mm、Blackwell 用 nvfp4;装对注意力后端 —— Hopper 装 FlashAttention 3,数据中心级 Blackwell(B200)手动装 flash-attn-4==4.0.0b9,其余 CUDA 卡自动走 PyTorch SDPA;用 gradient estimation 把 40 步降到 20–30 步;显存富裕就关掉阶段之间的显存清理。这些手段几乎每一条都绑定架构,所以选卡本身就是调优的一部分。NexGPU 有 75 种 GPU 型号、2,498 张卡分布在 51 个国家和地区,单节点最多 14 卡、最大节点显存 2,152GB,想比较 Ada、Hopper、Blackwell 在同一条管线上的差别,开三台跑一轮就有答案。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。