搜「LTX-Video 本地部署」的人,大多还停在 0.9.x。但 LTX-Video 仓库首页现在挂着一句话:LTX-2 is now the primary home for LTX development。旧线最后一次大更新是 2025 年 7 月 16 日的 0.9.8 蒸馏模型,把单条视频拉长到 60 秒,默认 1216×704 @30fps,没有音频,走 OpenRAIL-M 授权。LTX-2 在 2025 年 10 月 23 日发布,原生 4K、最高 50fps、音视频一次生成且严格同步 —— 这是两个不同的东西,别拿旧线的显存经验去估新线的账。
LTX-2 的架构是一个非对称双流 transformer:14B 的视频流和 5B 的音频流,用双向音视频交叉注意力加时序位置编码耦合起来,再用跨模态 AdaLN 共享 timestep 条件,所以它给视频分的容量远多于音频。到 LTX-2.3 和当前推荐的 LTX-2.5,规模涨到 22B,文本编码器从 Gemma 3 12B 换成了随模型一起微调的 Gemma 4 12B。2.5 还把权重拆成了单组件文件,你可以只下管线真正用到的那几个 —— 官方 Quick Start 那一套是五个文件、约 66GiB。
显存这件事没有含糊空间。ComfyUI-LTXVideo 的前置要求写得很直白:CUDA 显卡 32GB+ 显存、100GB+ 空闲磁盘;仓库里那个 low_vram_loaders.py 存在的唯一理由,就是靠调度加载顺序和卸载把生成压进 32GB。bf16 的 22B transformer 单文件 39.13GiB,Gemma 4 编码器 24.46GiB —— 要么上 80GB 卡让它们常驻,要么靠 --quantization fp8-cast / nvfp4-cast 配 --offload cpu|disk 硬塞。NexGPU 上 RTX 5090 32GB、A100 SXM4 80GB、H100 SXM 80GB、H200 141GB 都能按秒开,不用申请配额。
01 —
LTX 全系版本与权重体积
文件大小取自 Hugging Face 官方仓库,是你真正要下载、要装进显存的东西。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| LTX-2.5 22B distilled(当前推荐) | 22B | bf16 39.13GiB / NVFP4 17.44GiB / ComfyUI int8 20.03GiB | 默认 121 帧 @24fps ≈ 5 秒;两阶段管线分辨率需被 64 整除 | DistilledPipeline 用它,走 8 个预设 sigma(stage 1 八步、stage 2 四步),是官方 Quick Start 的默认选择。ICLoraPipeline 和 DubItPipeline 也认这个权重。 |
| LTX-2.5 22B dev | 22B | bf16 39.13GiB / ComfyUI int8 20.03GiB | 单阶段默认输出 512×768,两阶段再 2× 空间上采样 | 引导式两阶段管线(TI2VidTwoStages、TI2VidTwoStagesHQ、DFR)要的完整模型,stage 2 精修还需要 ltx-2.5-22b-distilled-lora-450-bf16(8.29GiB)。 |
| Gemma 4 12B 文本编码器(LTX-2.5 专用) | 12B | bf16 24.46GiB / ComfyUI int8 14.32GiB | 版本标识 gemma4-12b-ltx-v1,加载时强制校验 | 每条管线都必需,且已随模型微调、把文本投影打包在内。Google 官方的 Gemma 4 不能替代,版本对不上会直接报错。 |
| LTX-2.3 22B dev / distilled-1.1 | 22B | 单文件 42.98GiB(打包 transformer、音视频 VAE 与文本投影) | 配 Gemma 3 12B(gemma-3-12b-it-qat-q4_0-unquantized),需单独下载 | 上一代单文件布局,ComfyUI 现成工作流最多的一档,IC-LoRA 生态(Union Control、HDR、Dub-It、着色、去模糊)也最全。权重与 LoRA 都不能和 2.5 混用。 |
| LTX-2 19B dev / distilled | 19B(14B 视频流 + 5B 音频流) | bf16 40.31GiB / FP8 25.22GiB / NVFP4 18.62GiB | 原生 4K、最高 50fps、同步音频最长约 10 秒 | 技术报告里的那一版,也是唯一 fp8、fp4 预量化权重都公开齐全的一代。要在 24–32GB 卡上试 LTX-2 的音视频联合生成,从 19b-dev-fp4 起步最省事。 |
| LTX-Video 0.9.8(13B / 2B,旧线) | 13B / 2B | 13B bf16 26.62GiB、fp8 14.62GiB;2B distilled 5.91GiB、fp8 4.16GiB | 默认 1216×704 @30fps,单次 ≤257 帧(8k+1),最长 60 秒 | OpenRAIL-M 授权,没有音频,文本编码器是 T5-XXL。24GB 卡上唯一舒服的一代,适合先跑通 i2v/t2v 再决定要不要上 LTX-2。 |
02 —
按版本选卡:NexGPU 上真正跑得动的配置
显存对得上才推荐;对不上的档我们直接说别租。
先用旧线 LTX-Video 0.9.8 跑通 t2v / i2v
RTX 4090 24GB$0.540/卡·时
Ada 架构原生支持 FP8,13B-fp8 权重 14.62GiB 加 T5-XXL 分批加载正好塞进 24GB,2B distilled(5.91GiB)更是绰绰有余。
LTX-2.5 单卡自托管,走 NVFP4 量化
RTX 5090 32GB$0.723/卡·时
--quantization nvfp4-cast / nvfp4-prequant 只在 Blackwell(SM ≥ 10)上可用,17.44GiB 的 NVFP4 transformer 配 int8 编码器刚好压在 ComfyUI 官方那条 32GB 线上。
LTX-2.5 bf16 不量化、不卸载地出片
A100 SXM4 80GB$1.088/卡·时
39.13GiB 的 transformer 和 24.46GiB 的 Gemma 4 能一起常驻,省掉 --offload cpu 的反复搬运;Ampere 没有原生 FP8,就老实跑 bf16 + PyTorch SDPA,胜在便宜。
批量出片、4K DFR 细节渲染加时序超分
H100 SXM 80GB$3.582/卡·时
Hopper 才能用 --quantization fp8-scaled-mm 和 FlashAttention 3;要一次吃下 4K 两阶段再叠两轮时间超分,往上还有 H200 141GB($6.660/卡·时)。
03 —
四步把 LTX-2.5 跑起来
从空实例到第一条带同步音频的 mp4。
- 01
开实例并装依赖
从 2,000+ 预置镜像里选 PyTorch 或 ComfyUI 镜像,clone 仓库后用 uv 同步。natten 是 diffusion VAE 解码最快的后端,只在 Linux + CUDA 上装得上,Windows / macOS 会自动跳过并回退到 Triton 或 eager 实现。
git clone https://github.com/Lightricks/LTX-2.git && cd LTX-2 && uv sync --extra natten - 02
登录并拉权重(仓库是 gated 的)
LTX-2.5 在 Hugging Face 上是受限仓库:先在网页接受模型条款,再用 Read token 登录,fine-grained token 还得勾上「read gated repos」权限,否则 hf download 直接 401/403。下面这五个文件合计约 66GiB。
hf auth login && hf download Lightricks/LTX-2.5 diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors vae/ltx-2.5-video-vae-bf16.safetensors vae/ltx-2.5-audio-vae-bf16.safetensors latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors --local-dir models/ltx-2.5 - 03
跑 DistilledPipeline 出第一条片
默认 121 帧 @24fps,约 5 秒,视频和音频一起出。显存吃紧就加 --quantization fp8-cast 和 --offload cpu(内存也不够就 disk,会明显变慢);开量化时记得设 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True。提示词按镜头脚本写,单段 200 词以内效果最好。
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True uv run python -m ltx_pipelines.distilled --transformer-path models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors --text-encoder-path models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors --video-vae-path models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors --audio-vae-path models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors --num-frames 121 --seed 42 --quantization fp8-cast --offload cpu --output-path output.mp4 --prompt 'A medium close-up shot of a man looking directly at the camera, speaking in a calm voice, static camera, shallow depth of field, soft window light' - 04
换 ComfyUI 或更高质量的管线
LTX-2 已经进了 ComfyUI 核心,额外节点和示例工作流在 ComfyUI-LTXVideo 里;显存紧张就用仓库自带的 low_vram_loaders.py,它会安排好加载顺序把生成压进 32GB,再配 --reserve-vram 留出余量。追细节就换 DFRPipeline:先半分辨率生成关键帧,再全分辨率细节重渲,可选两轮 2× 时序超分,快速运动不容易糊。
python -m main --reserve-vram 5
一条 5 秒带音频的片子,租卡到底花多少
以 LTX-2.5 distilled 为例。拉那 66GiB 权重按 0.5 小时算,再花 2 小时调提示词、分辨率和步数,一共 2.5 小时:A100 SXM4 80GB 是 $1.088 × 2.5 = $2.72;换 RTX 5090 32GB 走 NVFP4 是 $0.723 × 2.5 = $1.81;要 Hopper 的 fp8-scaled-mm 和 FlashAttention 3,H100 SXM 80GB 是 $3.582 × 2.5 = $8.96。真正会咬人的是存储:66GB 权重按 $0.414/GB·月的中位价算,就是 66 × 0.414 = $27.32 每月,比不少人的算力账单还高 —— 所以跑完就销毁卷,或者只留 NVFP4 那一份 17.44GB(17.44 × 0.414 ≈ $7.22/月)。成片导出走出网流量 $0.0081/GB,100 条 1080p 短片约 20GB,也就 20 × 0.0081 ≈ $0.16。计算按秒计量、按小时计价,实例一停就不再计费;存储要到卷销毁才停 —— 这一点在 66GiB 的视频模型上尤其值得记住。
04 —
