先把版本线说清楚,这是自建 Wan 最容易踩的第一个坑。阿里给 Wan 开的是两条平行的线:一条是 Apache 2.0 的开源权重线,托管在 Wan-Video/Wan2.2 与 Hugging Face 的 Wan-AI 组织下;另一条是百炼上只走 API 的闭源线,wan2.5-t2v-preview、wan2.6-i2v、wan2.7-t2v 都属于后者,2 至 15 秒、1080P、原生音画同步这些能力目前只在 API 里,Hugging Face 上搜不到官方的 wan2.5 权重,也不会有。想本地部署、想私有化、想接进自己的产线,能拿到手的顶格就是 Wan2.2 这一支。
好消息是 Wan2.2 这一支并没有停更。核心的 T2V-A14B、I2V-A14B、TI2V-5B 是 2025 年 7 月放出来的,之后 8 月补了音频驱动的 S2V-14B、9 月补了角色动画与替换的 Animate-14B;2026 年 7 月 13 日又开了音乐驱动长时长舞蹈的 Wan-Dancer-14B,8 月 7 日放出 Wan-Animate-2-14B,这一版把中间的动作提取器整个砍掉,让 DiT 直接吃驱动视频,还带了一个 10 步、guidance_scale=1.0 的蒸馏版。全部 Apache 2.0,权重可商用。
真正决定你该租哪张卡的,是 Wan2.2 的 MoE 结构。所谓 A14B 不是一个 14B 模型,而是 27B 总参、每步激活 14B 的双专家:高噪专家管早期的整体构图,低噪专家管后期的细节收敛,采样过程中按信噪比切换。落到磁盘上就是两份 14B 权重,落到显存上就是官方 README 那句「at least 80GB VRAM」的由来。而 TI2V-5B 走的是另一条路——它换了压缩率 4×16×16(叠加 patchify 后等效 4×32×32、总压缩 64 倍)的 Wan2.2-VAE,用压得更狠的隐空间换来 24GB 可跑,代价是分辨率被钉死在 1280×704 / 704×1280、24fps、5 秒。这两条路的取舍,下面一张表说完。
01 —
Wan 开源权重全表
所有条目均为 Apache 2.0,显存数字来自官方 README、模型卡与社区量化仓库
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Wan2.2-TI2V-5B | 5B(稠密,非 MoE) | bf16 单卡门槛 24GB(官方点名 RTX 4090);ComfyUI 原生 offload 下 8GB 也能塞进去 | 1280×704 / 704×1280,24fps,5 秒 | 文生视频与图生视频合一,官方称为最快的 720P@24fps 模型之一,4090 上一条片子不到 9 分钟。唯一用 Wan2.2-VAE 的成员,VAE 文件与 A14B 不通用。 |
| Wan2.2-T2V-A14B | 27B 总参 / 14B 激活(高噪 + 低噪双专家 MoE) | 官方单卡门槛 80GB;fp8 每个专家约 14GB(14B×1 字节);GGUF Q4_K_M 约 9.65GB/专家、Q8_0 约 15.4GB/专家、Q2_K 约 5.3GB/专家 | 480P 与 720P | 文生视频主力。相比 Wan2.1 多训了 65.6% 图像与 83.2% 视频,并带了光影、构图、对比度、色调的美学标签,可以直接在 prompt 里调电影感。用的是 wan_2.1_vae。 |
| Wan2.2-I2V-A14B | 27B 总参 / 14B 激活(同款双专家 MoE) | 与 T2V-A14B 同级:官方 80GB,社区 fp8_scaled / GGUF 双专家路线可下压到 32GB 级 | 480P 与 720P | 图生视频。首帧控制最稳的一档,做产品图转动效、分镜转片段基本都用它。ComfyUI 官方工作流里高噪与低噪是两个独立的 safetensors,要一起下。 |
| Wan2.2-S2V-14B | 14B | 官方单卡门槛 80GB,支持 FSDP + DeepSpeed Ulysses 多卡切分 | 480P / 720P,常用 1024×704,时长跟随音频自动决定 | 音频驱动的电影级生成,说话、唱歌都吃。带 --pose_video 可以在对齐音频的同时跟随指定的姿态序列;音频一长生成时间线性上涨,先用 --num_clip 出短预览再放开。 |
| Wan2.2-Animate-2-14B(含 Distilled) | 14B | 仓库默认 config 按 8×A800 调 720P;480P 官方实测 2×A800。README 未给单卡方案,需要自己改 YAML 里的并行配置 | 720P / 480P,输入为参考图 + 驱动视频 + 文本 | 2026 年 8 月 7 日发布的第二代角色动画。端到端吃驱动视频,砍掉了中间动作提取器,还支持用文本解耦镜头视角。蒸馏版 10 步、guidance_scale=1.0、Euler 调度,做流式动画用。 |
| Wan2.1-T2V-1.3B | 1.3B | 8.19GB —— 官方原话是几乎所有消费级 GPU 都能跑 | 480P,5 秒 | 上一代的小杯,但至今仍是验证 pipeline 最省钱的一档:RTX 4090 上 5 秒 480P 约 4 分钟,不做任何量化。写调度、调 prompt 模板、压测队列先拿它跑通,再换 Wan2.2。 |
02 —
按跑法选卡:四种真实配置
NexGPU 列表价,按秒计费、按小时计价,无最低消费、无开通费
先跑通 pipeline:Wan2.1-T2V-1.3B 调 prompt、验证调度与队列
RTX 3090 24GB$0.193/卡·时
1.3B 只要 8.19GB,24GB 卡绰绰有余,这是我们最便宜的一张 24GB 卡,跑通流程的成本几乎可以忽略。
单卡出 720P@24fps 成片:Wan2.2-TI2V-5B 官方 generate.py
RTX 4090 24GB$0.540/卡·时
官方 README 点名的基准卡,24GB 刚好跨过门槛,一条 5 秒 720P 不到 9 分钟,单条成本约 8 美分。
在 ComfyUI 里跑 A14B 双专家的 fp8_scaled 或 GGUF 量化
RTX 5090 32GB$0.723/卡·时
fp8 下两个专家各约 14GB,24GB 卡必须来回换出换入,32GB 才能让 umt5 文本编码器、VAE 和当前专家同时待在显存里。
官方脚本原样跑 A14B / S2V-14B 的 bf16,或做 Animate-2 多卡并行
A100 SXM4 80GB$1.088/卡·时
README 写的 80GB 就是这一档;Animate-2 的默认 config 是按 8×A800 调的,同代同显存直接对得上,单节点最多可开 14 卡。
03 —
在 NexGPU 上四步跑起来
以 Wan2.2-TI2V-5B 单卡出片为例,A14B 与多卡在第四步接上
- 01
起实例、拉仓库
在 console.nexgpu.net 选一张 RTX 4090 24GB,直接用 PyTorch 预置镜像(2,000+ 镜像里也有 ComfyUI 和 vLLM 现成的)。Wan 要求 torch >= 2.4.0,预置镜像已经满足。装依赖时如果 flash_attn 编译失败,按官方 README 的建议先把其它包装完再单独装它。
git clone https://github.com/Wan-Video/Wan2.2.git && cd Wan2.2 && pip install -r requirements.txt - 02
下权重
TI2V-5B 的 ckpt 目录里除了 5B 的 DiT,还打包了 umt5-xxl 文本编码器和 Wan2.2-VAE,一次拉全。注意 A14B 用的是 wan_2.1_vae、TI2V-5B 用的是 wan2.2_vae,两者不能混用,这是 ComfyUI 工作流里最常见的报错来源。
huggingface-cli download Wan-AI/Wan2.2-TI2V-5B --local-dir ./Wan2.2-TI2V-5B - 03
单卡出第一条片
官方给 24GB 卡的组合拳是三个 flag:--offload_model True 把不在用的模块换到内存,--convert_model_dtype 转参数精度,--t5_cpu 把文本编码器整个甩到 CPU。这三个一起上才是 24GB 能跑的前提,所以实例的系统内存也别选太小。
python generate.py --task ti2v-5B --size 1280*704 --ckpt_dir ./Wan2.2-TI2V-5B --offload_model True --convert_model_dtype --t5_cpu --prompt "Two anthropomorphic cats in boxing gear fight under a spotlight" - 04
换 A14B、上多卡
确认出片质量后再换 80GB 卡跑 A14B 全精度。多卡用 --dit_fsdp 切 DiT、--t5_fsdp 切文本编码器、--ulysses_size 做序列并行,NexGPU 单节点最多 14 卡、最大节点显存 2,152GB,Animate-2 那种默认 8 卡的 config 不用改就能落地。
torchrun --nproc_per_node=8 generate.py --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --dit_fsdp --t5_fsdp --ulysses_size 8 --prompt "..."
一次真实出片的账
按 TI2V-5B 在 RTX 4090 24GB 上算,$0.540/卡·时。起实例、装依赖、拉权重大约 0.5 小时,$0.540 × 0.5 = $0.27。官方基准是一条 5 秒 720P 片子不到 9 分钟,即 0.15 小时,单条 $0.540 × 0.15 ≈ $0.081。要出 40 条备选,40 × 0.15 = 6 小时,$0.540 × 6 = $3.24。整轮合计 6.5 小时 × $0.540 = $3.51。40 条 720P 短片下载回本地大概 0.2GB 量级,出口流量 0.2 × $0.0081 ≈ $0.002,可以忽略。要留权重不重下的话,一个 60GB 的卷按存储中位价 $0.414/GB·月 是 $24.84/月,摊到每天约 $0.83 —— 注意算力费在实例停止的那一秒就停了,存储费会一直收到卷被销毁,所以短期项目做完直接销毁卷。对照一下:同一轮活儿换成 A14B 全精度,A100 SXM4 80GB 是 $1.088/卡·时,先租一小时把 720P 效果跑出来再决定要不要上 8 卡,比一次性买断划算得多。
04 —
