很多人搜「HunyuanVideo 需要多大显存」时,翻到的还是 2024 年底那份表格:720×1280、129 帧要 60GB 显存,544×960 要 45GB,官方直接建议上 80GB 卡。那份表格没错,但它说的是初代 13B 模型。2025 年 11 月腾讯混元发布了 HunyuanVideo 1.5,参数量从 13B 降到 8.3B,官方标注的最低显存变成了 14GB(需开启模型 offload),ComfyUI 的说法更直白——目标就是让 24GB 的消费级卡跑出旗舰画质。如果你正在为了跑混元视频攒一张 A100,先看完这一页。
1.5 版本的提速不是靠砍质量硬来的。它换了一套 3D causal VAE,空间压缩 16 倍、时间压缩 4 倍,等于送进 DiT 的 token 数量大幅下降;注意力换成了 SSTA(selective and sliding tile attention),主动裁掉冗余的时空 KV 块,官方在 8 张 H800 上实测 10 秒 720p 视频比 FlashAttention-3 快 1.87 倍。文本侧用 Qwen2.5-VL-7B 做语义理解,再挂一个 byT5-small GlyphXL 做字形感知编码,中英双语提示词都能吃,画面里要出中文字的场景明显比初代稳。整条线还配了超分网络,720p 生成完再拉到 1080p,而不是硬扛 1080p 的显存。
变体多是这个项目的特点,也是坑。仓库里同时放着 480p/720p 的 T2V 和 I2V、CFG 蒸馏版、480p I2V 步数蒸馏版、720p I2V 稀疏注意力版,以及 720p 与 1080p 的超分蒸馏权重——Hugging Face 上整个 repo 加起来 372GB,闷头 clone 会把你的盘和耐心一起打满。权重走 Tencent Hunyuan Community License,可以商用,但明确不适用于欧盟、英国和韩国,月活超过 1 亿要单独找腾讯申请。真正卡住大部分人的还是那张卡:模型已经瘦到消费级能跑,但你手上那台笔记本的 8GB 显存依然进不去。这就是按秒租一张 4090 或 5090 的意义。
01 —
混元视频有哪些版本,分别吃多少显存
以下参数、步数与显存均来自官方仓库与模型卡,不是估算
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| HunyuanVideo 1.5 · 720p T2V / I2V | 8.3B DiT + 3D causal VAE | 官方最低 14GB(开 offload)/24GB 为舒适线,不 offload 建议 32GB | 720p,默认 121 帧,5–10 秒 | 当前主线。cfg 6、50 步;T2V 用 flow shift 9,I2V 用 7。质量最高的一档,先出 720p 再超分。 |
| HunyuanVideo 1.5 · 480p I2V 步数蒸馏 | 8.3B(step-distilled) | 24GB 单卡实测可跑,官方基准就是 RTX 4090 | 480p,8–12 步,flow shift 7 | 端到端耗时降低约 75%,单张 RTX 4090 约 75 秒出一条。批量试提示词、跑分镜草稿的首选,蒸馏权重只覆盖 480p I2V。 |
| HunyuanVideo 1.5 · CFG 蒸馏(480p / 720p) | 8.3B(cfg-distilled) | 与同分辨率原版一致 | 480p / 720p,cfg 置 1 | 靠内嵌 CFG 省掉负向分支,约 2 倍加速。注意:官方明确说明 CFG 蒸馏版仍必须跑满 50 步,调到 8 步会直接出废片。 |
| HunyuanVideo 1.5 · 1080p 超分蒸馏 | 独立 SR 网络 | 在 720p 出片的卡上追加一段,32GB 更从容 | 720p → 1080p,6–8 步,flow shift 2 | 官方推荐的上 1080p 路线。比直接生成 1080p 省显存也省时间,另有 720p 档超分权重。 |
| HunyuanVideo(初代 13B,2024-12) | 13B DiT,Llava-Llama3-8B + CLIP 双文本编码器 | 720×1280×129 帧 60GB;544×960×129 帧 45GB;官方建议 80GB | 540p / 720p,129 帧(帧数须为 4k+1) | 生态最厚的一代:LoRA、I2V、Avatar、Foley 都围着它长。开 --use-fp8 约省 10GB。追画风微调和现成 LoRA 就选它。 |
| 初代 13B 量化权重(GGUF / NF4) | 13B 量化 | Q8_0 权重 14GB/Q6_K 11GB/Q4_K_M 7.88GB;diffusers 的 bnb NF4 整条管线约 14GB | 建议降到 61 帧、320×512 起步试跑 | city96 的 GGUF 配 ComfyUI-GGUF 节点用,BF16 原始权重 25.6GB。显存换质量,低比特下细节和运动一致性会掉。 |
02 —
跑 HunyuanVideo 该租哪张卡
按你实际要做的事挑,别为了 8.3B 的模型去付 H100 的钱
480p I2V 步数蒸馏批量出片、刷提示词
RTX 4090 24GB$0.540/卡·时
官方 75 秒的那条基准就是在 RTX 4090 上跑出来的,同款卡同款结果,不用自己换算。
720p T2V/I2V 跑满 50 步,不开 offload,顺手超分到 1080p
RTX 5090 32GB$0.723/卡·时
多出的 8GB 正好把 offload 关掉——省下的不是显存,是每步在 CPU 和 GPU 之间搬权重的时间。
初代 13B bf16 出 720×1280×129 帧,或叠 LoRA 微调
A100 SXM4 80GB$1.088/卡·时
官方写死 60GB 才够 720p 129 帧,24GB 卡在这一档只能靠量化妥协,80GB 是唯一不用将就的答案。
SSTA 稀疏注意力加速、多卡并行、10 秒长镜头
H100 SXM 80GB$3.582/卡·时
flex-block-attn 的稀疏注意力路径要求 H 系列卡,官方 1.87 倍加速也是在 H800 集群上测的。
03 —
HunyuanVideo 1.5 私有化部署四步
从开机到第一条视频,路径就这么长
- 01
开一台带 CUDA 的实例
在 NexGPU 控制台选 RTX 4090 或 RTX 5090,直接挑 PyTorch 预置镜像,CUDA、驱动、torch 都是配好的。SSH 进去先确认卡认得出来,再装仓库依赖。官方要求 Python 3.10+,FlashAttention 建议装上。
nvidia-smi && git clone https://github.com/Tencent-Hunyuan/HunyuanVideo-1.5 && cd HunyuanVideo-1.5 && pip install -r requirements.txt - 02
只下你要的那个变体,别整仓库拉
Hugging Face 上 tencent/HunyuanVideo-1.5 整个仓库 372GB,包含全部分辨率和全部蒸馏版本。用 --include 精确挑权重:一个 720p transformer 加 VAE、超分网络,几十 GB 就够开工。入站流量不计费,下载本身不花钱,花的是这段时间的机时。
huggingface-cli download tencent/HunyuanVideo-1.5 --local-dir ./ckpts --include "transformer/720p_i2v/*" "vae/*" - 03
先把显存参数摆正,再开跑
碰到 OOM 第一件事是设分配器环境变量,这是官方 README 里点名的解法;CPU 内存紧张时再关掉 overlap group offloading。480p 步数蒸馏版记得把步数降到 8–12,CFG 蒸馏版反而必须留在 50 步——这两条搞反了,一个出废片一个白等。
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True,max_split_size_mb:128 - 04
出片,然后决定要不要留盘
单卡就把 nproc_per_node 设成 1。另外注意:提示词改写默认是开着的,它要你另起一个 vLLM 服务加载 Qwen3-235B 级别的模型——单卡场景请直接关掉,用自己写好的详细提示词。跑完把视频拉走,计算计费随实例停止而停止,存储会继续算到卷销毁为止。
torchrun --nproc_per_node=1 generate.py --prompt "一只橘猫跳上窗台,阳光穿过纱帘" --resolution 480p --model_path ./ckpts --video_length 121 --enable_step_distill true
跑一批混元视频到底多少钱
按最常见的路子算:RTX 4090 24GB,$0.540/卡·时,跑 480p I2V 步数蒸馏。先花约 0.4 小时装依赖、拉权重、热一遍模型,0.4 × $0.540 = $0.216。官方基准单条 75 秒,算上 VAE 解码和落盘按 90 秒一条估,3600 ÷ 90 = 每小时 40 条。连跑 2 小时出 80 条,2 × $0.540 = $1.08。合计 $1.296,摊到每条视频约 $0.016——不到一毛二人民币一条。换 720p 50 步这档,上 RTX 5090 32GB $0.723/卡·时,单价高 34%,但省掉 offload 的搬运开销,实际每条成本并不会差出一个量级。真正值得算的是存储:几十 GB 权重留在盘上,按 $0.414/GB·月 中位价,30GB 就是 $12.42 一个月,比你这两小时算力贵十倍。用完销毁卷、下次重拉才是对的姿势,入站流量不花钱,80 条 480p 视频拖回本地约 1GB,出站按 $0.0081/GB 中位价算,八厘钱。NexGPU 按秒计量、按小时定价,没有起租时长、没有开通费、不用提配额申请,跑完 stop 就不再计算力费。
04 —
