跳到主要内容

视频生成模型

Wan 本地部署,从 一张 24GB 卡 开始

通义万相 Wan2.2 是目前少数几个真能在消费级单卡上出 720P@24fps 成片的一线视频模型。TI2V-5B 在 RTX 4090 上跑一条 5 秒片子不到 9 分钟,NexGPU 上这张卡 $0.540/卡·时,按秒计费。

先把版本线说清楚,这是自建 Wan 最容易踩的第一个坑。阿里给 Wan 开的是两条平行的线:一条是 Apache 2.0 的开源权重线,托管在 Wan-Video/Wan2.2 与 Hugging Face 的 Wan-AI 组织下;另一条是百炼上只走 API 的闭源线,wan2.5-t2v-preview、wan2.6-i2v、wan2.7-t2v 都属于后者,2 至 15 秒、1080P、原生音画同步这些能力目前只在 API 里,Hugging Face 上搜不到官方的 wan2.5 权重,也不会有。想本地部署、想私有化、想接进自己的产线,能拿到手的顶格就是 Wan2.2 这一支。

好消息是 Wan2.2 这一支并没有停更。核心的 T2V-A14B、I2V-A14B、TI2V-5B 是 2025 年 7 月放出来的,之后 8 月补了音频驱动的 S2V-14B、9 月补了角色动画与替换的 Animate-14B;2026 年 7 月 13 日又开了音乐驱动长时长舞蹈的 Wan-Dancer-14B,8 月 7 日放出 Wan-Animate-2-14B,这一版把中间的动作提取器整个砍掉,让 DiT 直接吃驱动视频,还带了一个 10 步、guidance_scale=1.0 的蒸馏版。全部 Apache 2.0,权重可商用。

真正决定你该租哪张卡的,是 Wan2.2 的 MoE 结构。所谓 A14B 不是一个 14B 模型,而是 27B 总参、每步激活 14B 的双专家:高噪专家管早期的整体构图,低噪专家管后期的细节收敛,采样过程中按信噪比切换。落到磁盘上就是两份 14B 权重,落到显存上就是官方 README 那句「at least 80GB VRAM」的由来。而 TI2V-5B 走的是另一条路——它换了压缩率 4×16×16(叠加 patchify 后等效 4×32×32、总压缩 64 倍)的 Wan2.2-VAE,用压得更狠的隐空间换来 24GB 可跑,代价是分辨率被钉死在 1280×704 / 704×1280、24fps、5 秒。这两条路的取舍,下面一张表说完。

01 —

Wan 开源权重全表

所有条目均为 Apache 2.0,显存数字来自官方 README、模型卡与社区量化仓库

版本参数量显存上下文说明
Wan2.2-TI2V-5B5B(稠密,非 MoE)bf16 单卡门槛 24GB(官方点名 RTX 4090);ComfyUI 原生 offload 下 8GB 也能塞进去1280×704 / 704×1280,24fps,5 秒文生视频与图生视频合一,官方称为最快的 720P@24fps 模型之一,4090 上一条片子不到 9 分钟。唯一用 Wan2.2-VAE 的成员,VAE 文件与 A14B 不通用。
Wan2.2-T2V-A14B27B 总参 / 14B 激活(高噪 + 低噪双专家 MoE)官方单卡门槛 80GB;fp8 每个专家约 14GB(14B×1 字节);GGUF Q4_K_M 约 9.65GB/专家、Q8_0 约 15.4GB/专家、Q2_K 约 5.3GB/专家480P 与 720P文生视频主力。相比 Wan2.1 多训了 65.6% 图像与 83.2% 视频,并带了光影、构图、对比度、色调的美学标签,可以直接在 prompt 里调电影感。用的是 wan_2.1_vae。
Wan2.2-I2V-A14B27B 总参 / 14B 激活(同款双专家 MoE)与 T2V-A14B 同级:官方 80GB,社区 fp8_scaled / GGUF 双专家路线可下压到 32GB 级480P 与 720P图生视频。首帧控制最稳的一档,做产品图转动效、分镜转片段基本都用它。ComfyUI 官方工作流里高噪与低噪是两个独立的 safetensors,要一起下。
Wan2.2-S2V-14B14B官方单卡门槛 80GB,支持 FSDP + DeepSpeed Ulysses 多卡切分480P / 720P,常用 1024×704,时长跟随音频自动决定音频驱动的电影级生成,说话、唱歌都吃。带 --pose_video 可以在对齐音频的同时跟随指定的姿态序列;音频一长生成时间线性上涨,先用 --num_clip 出短预览再放开。
Wan2.2-Animate-2-14B(含 Distilled)14B仓库默认 config 按 8×A800 调 720P;480P 官方实测 2×A800。README 未给单卡方案,需要自己改 YAML 里的并行配置720P / 480P,输入为参考图 + 驱动视频 + 文本2026 年 8 月 7 日发布的第二代角色动画。端到端吃驱动视频,砍掉了中间动作提取器,还支持用文本解耦镜头视角。蒸馏版 10 步、guidance_scale=1.0、Euler 调度,做流式动画用。
Wan2.1-T2V-1.3B1.3B8.19GB —— 官方原话是几乎所有消费级 GPU 都能跑480P,5 秒上一代的小杯,但至今仍是验证 pipeline 最省钱的一档:RTX 4090 上 5 秒 480P 约 4 分钟,不做任何量化。写调度、调 prompt 模板、压测队列先拿它跑通,再换 Wan2.2。

02 —

按跑法选卡:四种真实配置

NexGPU 列表价,按秒计费、按小时计价,无最低消费、无开通费

  • 先跑通 pipeline:Wan2.1-T2V-1.3B 调 prompt、验证调度与队列

    RTX 3090 24GB$0.193/卡·时

    1.3B 只要 8.19GB,24GB 卡绰绰有余,这是我们最便宜的一张 24GB 卡,跑通流程的成本几乎可以忽略。

  • 单卡出 720P@24fps 成片:Wan2.2-TI2V-5B 官方 generate.py

    RTX 4090 24GB$0.540/卡·时

    官方 README 点名的基准卡,24GB 刚好跨过门槛,一条 5 秒 720P 不到 9 分钟,单条成本约 8 美分。

  • 在 ComfyUI 里跑 A14B 双专家的 fp8_scaled 或 GGUF 量化

    RTX 5090 32GB$0.723/卡·时

    fp8 下两个专家各约 14GB,24GB 卡必须来回换出换入,32GB 才能让 umt5 文本编码器、VAE 和当前专家同时待在显存里。

  • 官方脚本原样跑 A14B / S2V-14B 的 bf16,或做 Animate-2 多卡并行

    A100 SXM4 80GB$1.088/卡·时

    README 写的 80GB 就是这一档;Animate-2 的默认 config 是按 8×A800 调的,同代同显存直接对得上,单节点最多可开 14 卡。

03 —

在 NexGPU 上四步跑起来

以 Wan2.2-TI2V-5B 单卡出片为例,A14B 与多卡在第四步接上

  1. 01

    起实例、拉仓库

    在 console.nexgpu.net 选一张 RTX 4090 24GB,直接用 PyTorch 预置镜像(2,000+ 镜像里也有 ComfyUI 和 vLLM 现成的)。Wan 要求 torch >= 2.4.0,预置镜像已经满足。装依赖时如果 flash_attn 编译失败,按官方 README 的建议先把其它包装完再单独装它。

    git clone https://github.com/Wan-Video/Wan2.2.git && cd Wan2.2 && pip install -r requirements.txt
  2. 02

    下权重

    TI2V-5B 的 ckpt 目录里除了 5B 的 DiT,还打包了 umt5-xxl 文本编码器和 Wan2.2-VAE,一次拉全。注意 A14B 用的是 wan_2.1_vae、TI2V-5B 用的是 wan2.2_vae,两者不能混用,这是 ComfyUI 工作流里最常见的报错来源。

    huggingface-cli download Wan-AI/Wan2.2-TI2V-5B --local-dir ./Wan2.2-TI2V-5B
  3. 03

    单卡出第一条片

    官方给 24GB 卡的组合拳是三个 flag:--offload_model True 把不在用的模块换到内存,--convert_model_dtype 转参数精度,--t5_cpu 把文本编码器整个甩到 CPU。这三个一起上才是 24GB 能跑的前提,所以实例的系统内存也别选太小。

    python generate.py --task ti2v-5B --size 1280*704 --ckpt_dir ./Wan2.2-TI2V-5B --offload_model True --convert_model_dtype --t5_cpu --prompt "Two anthropomorphic cats in boxing gear fight under a spotlight"
  4. 04

    换 A14B、上多卡

    确认出片质量后再换 80GB 卡跑 A14B 全精度。多卡用 --dit_fsdp 切 DiT、--t5_fsdp 切文本编码器、--ulysses_size 做序列并行,NexGPU 单节点最多 14 卡、最大节点显存 2,152GB,Animate-2 那种默认 8 卡的 config 不用改就能落地。

    torchrun --nproc_per_node=8 generate.py --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --dit_fsdp --t5_fsdp --ulysses_size 8 --prompt "..."

一次真实出片的账

按 TI2V-5B 在 RTX 4090 24GB 上算,$0.540/卡·时。起实例、装依赖、拉权重大约 0.5 小时,$0.540 × 0.5 = $0.27。官方基准是一条 5 秒 720P 片子不到 9 分钟,即 0.15 小时,单条 $0.540 × 0.15 ≈ $0.081。要出 40 条备选,40 × 0.15 = 6 小时,$0.540 × 6 = $3.24。整轮合计 6.5 小时 × $0.540 = $3.51。40 条 720P 短片下载回本地大概 0.2GB 量级,出口流量 0.2 × $0.0081 ≈ $0.002,可以忽略。要留权重不重下的话,一个 60GB 的卷按存储中位价 $0.414/GB·月 是 $24.84/月,摊到每天约 $0.83 —— 注意算力费在实例停止的那一秒就停了,存储费会一直收到卷被销毁,所以短期项目做完直接销毁卷。对照一下:同一轮活儿换成 A14B 全精度,A100 SXM4 80GB 是 $1.088/卡·时,先租一小时把 720P 效果跑出来再决定要不要上 8 卡,比一次性买断划算得多。

04 —

常见问题

Wan2.5 / Wan2.6 / Wan2.7 开源了吗?能本地部署吗?

不能。这三代目前都只有 API:wan2.5-t2v-preview 支持 480P/720P/1080P、5 或 10 秒,wan2.6 与 2026 年 6 月 12 日快照的 wan2.7-t2v 把时长放宽到 2 至 15 秒并支持原生音轨,但官方 Wan-AI 组织下从未发布过对应权重,GitHub 上也没有 Wan2.5 仓库。Hugging Face 上偶尔能搜到个人上传的「Wan-2.5」,那不是官方权重。能私有化部署的顶格就是 Wan2.2 这一支加上 Wan-Animate-2、Wan-Dancer —— 而这一支在 NexGPU 上从 $0.193/卡·时 的 RTX 3090 起就能开跑。

Wan2.2 A14B 到底要多大显存?为什么 README 写 80GB 这么夸张?

因为 A14B 不是一个 14B 模型。它是 27B 总参的双专家 MoE,磁盘上就是高噪、低噪两份 14B 权重,采样过程中按信噪比切换,再叠加 720P 隐空间和注意力的峰值占用,官方给的安全线才落在 80GB。想省显存有两条路:ComfyUI 的 fp8_scaled 版本每个专家约 14GB,社区 GGUF(QuantStack 那套,配 city96 的 ComfyUI-GGUF 节点)Q4_K_M 约 9.65GB/专家、Q8_0 约 15.4GB/专家。要原样跑官方脚本就上 A100 SXM4 80GB($1.088/卡·时),要走量化路线 RTX 5090 32GB($0.723/卡·时)更划算,NexGPU 上两张卡都能按秒计费直接开。

只有 24GB 显存能跑 Wan 吗?

能,但要选对型号。TI2V-5B 就是为这个场景设计的,官方点名 RTX 4090 24GB,加上 --offload_model True --convert_model_dtype --t5_cpu 三件套即可;Wan2.1-T2V-1.3B 只要 8.19GB,几乎所有消费级卡都能跑。A14B 在 24GB 上只能走 GGUF 量化并且专家来回换出,速度会很难看。我们这边 RTX 3090 24GB $0.193、Tesla P40 24GB $0.214、A10 24GB $0.414、RTX 4090 24GB $0.540,同一档显存四个价位,按你的耐心挑。

为什么我的 ComfyUI 工作流一加载 VAE 就报错?

十有八九是 VAE 拿错了。Wan2.2 里只有 TI2V-5B 用新的 wan2.2_vae.safetensors(压缩率 4×16×16,叠加 patchify 后等效 4×32×32),T2V-A14B 和 I2V-A14B 仍然用 wan_2.1_vae.safetensors,两者不能互换。另一个高频坑是 A14B 的高噪与低噪是两个独立文件,只下一个会在采样中途炸掉。NexGPU 的 2,000+ 预置镜像里 ComfyUI 是现成的,起实例就能直接对着官方工作流填文件,省掉一轮环境排查。

S2V-14B 做音频驱动,一段 3 分钟的口播要跑多久?

S2V 的输出时长是跟着音频走的,音频越长生成时间越线性增长,官方也没有给 3 分钟这一档的公开基准,所以别拿短片的耗时去线性外推预算。正确做法是先用 --num_clip 出一小段预览确认口型与画面对得上,再放开跑全长,同时用 --pose_video 锁姿态减少重跑。它的单卡门槛同样是 80GB,并且原生支持 FSDP + DeepSpeed Ulysses 切分,在 NexGPU 上一个节点最多 14 张卡、最大节点显存 2,152GB,长音频直接横着扩就行。

渲染任务跑完实例停了,还会继续扣费吗?

算力费在实例停止时立刻停止计费,按秒计量、按小时计价,没有最低消费、没有开通费、不用提工单申请配额。会继续产生费用的只有存储 —— 卷不销毁就一直按 $0.414/GB·月(中位价)计,所以 Wan 这种动辄几十 GB 权重的场景,短期项目跑完记得销毁卷,长期项目再留着省下重复下载的时间。NexGPU 覆盖 51 个国家和地区、1,175 个已验证可租节点、2,498 张 GPU、75 种型号,SSH、Jupyter、Web 终端、REST API、CLI 都能进,中英文支持走 Telegram,不排队。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。