跳到主要内容

视频生成模型

ModelScope 文生视频本地部署,7GB 显存就能出片

1.7B 参数、16 帧 256×256 起步,开了 CPU offload 连 8 秒长片都只吃 7GB。这是整个视频生成赛道里门槛最低的一条自部署路线,也是最容易被 2023 年的旧教程带偏的一条。

ModelScope(魔搭)这个名字在视频生成圈里同时指两件事:一是阿里达摩院放出的 ModelScopeT2V 文生视频模型 —— 魔搭上的仓库 ID 是 iic/text-to-video-synthesis,HuggingFace 上是 damo-vilab/text-to-video-ms-1.7b,17 亿参数里有 5 亿专门负责时序建模;二是托管它的魔搭社区平台本身。搜「ModelScope 文生视频 本地部署」的人,九成想知道的是前者到底吃多少显存、自己那张卡跑不跑得动。

答案比想象中友好。ModelScopeT2V 走的是 Stable Diffusion 1.5 的老路子 —— VQGAN、文本编码器,加一个插了时空模块的去噪 UNet3D,默认输出 16 帧、8fps、两秒的 256×256 短片。fp16 权重配上 enable_model_cpu_offload() 和 enable_vae_slicing(),跑到 64 帧(8 秒)峰值显存也只有 7GB;官方模型卡进一步说明,再叠 attention slicing 和 PyTorch 2.0,25 秒的片能压进 16GB 以内。放在 2026 年的视频模型里,这个门槛低得反常。

代价是它确实老了。训练数据来自 WebVid-10M 等公开集,社区最常见的抱怨就是出片带 Shutterstock 水印 —— cerspense/zeroscope_v2_576w 与 zeroscope_v2_XL 这两个微调正是为了解决它而生。模型卡明确写着 Only English input is supported,许可证是 CC-BY-NC-ND,VGen 仓库同样标注 RESEARCH/NON-COMMERCIAL USE ONLY。要做今天水准的视频,主线已经换成了同一个魔搭社区团队维护的 DiffSynth-Studio:它把 Wan、HunyuanVideo、CogVideoX-5B、LTX-2 全接了进来,靠逐层 offload 能把 HunyuanVideo 的 129×512×384 压到 6GB。这几条路线在 NexGPU 上共用同一套镜像和同一套按秒计费。

01 —

ModelScope 视频线上,今天还能本地跑的几个模型

从 2023 年的 1.7B 老将,到魔搭官方维护的 DiffSynth-Studio 引擎,显存跨度 6GB 到 24GB。

版本参数量显存上下文说明
ModelScopeT2V(iic/text-to-video-synthesis · damo-vilab/text-to-video-ms-1.7b)1.7B(其中 0.5B 用于时序)fp16 ~7GB(64 帧 + CPU offload + VAE slicing)/< 16GB 可做到 25 秒默认 16 帧 @ 8fps,256×256整条线的祖先。VQGAN + 文本编码器 + 时空 UNet3D,diffusers 里对应 TextToVideoSDPipeline。只吃英文 prompt,许可证 CC-BY-NC-ND,出片常带水印,适合当最省钱的验证模型。
cerspense/zeroscope_v2_576w1.7B(ModelScopeT2V 微调)fp16 ~7.9GB(576×320,30 帧)576×320,24–36 帧社区为去掉水印重训的版本,许可证 CC-BY-NC-4.0。它是两段式工作流的第一段,负责快速出低分辨率草片。
cerspense/zeroscope_v2_XL1.7B(ModelScopeT2V 微调)fp16 ~15.3GB(1024×576,30 帧)1024×576,最多 30 帧第二段。用 VideoToVideoSDPipeline 走 vid2vid,把 576w 的草片按 strength=0.6 放大重绘,是这条老架构上能拿到的最好画质。
I2VGen-XL(ali-vilab,来自 VGen 仓库)~1Bfp16 权重约 2GB;720p 推理峰值官方未标注,实务上按 24GB 卡准备1280×720 图生视频级联扩散的图生视频模型,diffusers 里是 I2VGenXLPipeline,权重许可证为 MIT,是这条线里少数没有 NC 限制的。官方承认对动漫图和纯黑背景表现不佳。
DiffSynth-Studio(魔搭社区官方 Diffusion 引擎,Apache-2.0)接入 Wan、HunyuanVideo、CogVideoX-5B、LTX-2 等HunyuanVideo 129×720×1280 需 24GB;129×512×384 可低至 6GB逐层 offload、FP8 量化、序列并行、LoRA 与全量训练今天在魔搭生态里做视频真正该用的东西。git clone 后 pip install -e . 即可,显存管理是它最大的卖点。

02 —

按场景选卡:别为 1.7B 租 H100

ModelScopeT2V 的显存需求低到能用池子里最便宜的卡,真正吃卡的是它的后继者。

  • 跑 ModelScopeT2V 1.7B,256×256 × 16–64 帧调 prompt 出样

    Tesla V100 32GB$0.188/卡·时

    峰值 7GB 而已,V100 的 fp16 Tensor Core 对 SD 1.5 世代的 UNet3D 正合适,而它是整个池子里单价最低的卡。

  • zeroscope 两段式:576×320 草片再 vid2vid 放大到 1024×576

    RTX 3090 24GB$0.193/卡·时

    XL 阶段 30 帧要 15.3GB,24GB 既留足 VAE 解码余量,又能把 576w 和 XL 两套权重常驻显存省掉反复加载。

  • I2VGen-XL 出 720p 图生视频,或在 VGen 里做 DreamVideo/VideoComposer 微调

    RTX 4090 24GB$0.540/卡·时

    720p 长序列的时空 attention 是纯算力瓶颈,Ada 的 fp16/bf16 吞吐比 Ampere 高一大截,出片等待时间直接对折。

  • 用 DiffSynth-Studio 跑 Wan / HunyuanVideo 的 129 帧 720p,或做 LoRA 训练

    A100 PCIE 80GB$0.824/卡·时

    官方 24GB 那条路径靠的是逐层 offload,速度要打折;80GB 能整模型驻留、开 batch、做训练,且价格只比 4090 高一点。

03 —

四步在 NexGPU 上跑通

从开机到导出第一条 mp4,全程不需要申请配额。

  1. 01

    开一台带 PyTorch 的实例

    在 console.nexgpu.net 选 Tesla V100 32GB 或 RTX 3090 24GB,直接用现成的 PyTorch 镜像开机,SSH 或 Jupyter 进去先确认卡认出来了。2,000+ 预置镜像里也有 ComfyUI 和 vLLM,视频后续想接工作流不用重装。

    nvidia-smi && python -c "import torch; print(torch.__version__, torch.cuda.get_device_name(0))"
  2. 02

    装依赖,从魔搭拉权重

    modelscope 库当前是 1.39.1,Apache-2.0,要求 Python ≥ 3.10。注意仓库命名空间早就从 damo/ 迁到了 iic/,网上大量 2023 年的教程还在写 damo/text-to-video-synthesis,照抄会拉不下来。导出 mp4 需要 imageio-ffmpeg。

    pip install "modelscope>=1.39.1" diffusers transformers accelerate imageio imageio-ffmpeg && python -c "from modelscope import snapshot_download; print(snapshot_download('iic/text-to-video-synthesis'))"
  3. 03

    用 diffusers 出第一条片

    fp16 变体加上 enable_model_cpu_offload() 与 enable_vae_slicing(),64 帧只吃 7GB。想再快就把调度器换成 DPMSolverMultistepScheduler,把 num_inference_steps 降到 25。prompt 必须是英文。

    python -c "import torch;from diffusers import DiffusionPipeline;from diffusers.utils import export_to_video;p=DiffusionPipeline.from_pretrained('damo-vilab/text-to-video-ms-1.7b',torch_dtype=torch.float16,variant='fp16');p.enable_model_cpu_offload();p.enable_vae_slicing();print(export_to_video(p('a panda surfing a wave, cinematic lighting',num_frames=64).frames[0]))"
  4. 04

    要画质就换 zeroscope 两段式,要现代模型就上 DiffSynth-Studio

    zeroscope_v2_576w 先出 576×320,再交给 zeroscope_v2_XL 以 strength=0.6 放大到 1024×576,顺带甩掉水印。如果目标是今天水准的视频,直接装魔搭社区自己的 DiffSynth-Studio,Wan、HunyuanVideo、LTX-2 都在里面,显存不够就开逐层 offload 和 FP8。

    git clone https://github.com/modelscope/DiffSynth-Studio.git && cd DiffSynth-Studio && pip install -e .

一次完整出片的真实账单

按 NexGPU 的挂牌价算一笔:先用 Tesla V100 32GB($0.188/卡·时)花 3 小时把 prompt 和参数调顺,3 × $0.188 = $0.564;再换 RTX 3090 24GB($0.193/卡·时)跑 8 小时 zeroscope 两段式批量出片,8 × $0.193 = $1.544。权重加依赖占一个 15GB 的卷,存储中位价 $0.414/GB·月,留 3 天再销毁就是 15 × $0.414 × 3/30 = $0.621。成片 20GB 下载回本地,出网中位价 $0.0081/GB,20 × $0.0081 = $0.162。合计 $0.564 + $1.544 + $0.621 + $0.162 = $2.891。计费按秒结算、按小时定价,没有起租量也没有开通费;要提醒的是算力在实例停止时就停止计费,而存储会一直算到卷被销毁为止 —— 这也是为什么上面那笔账里存储占了五分之一。

04 —

常见问题

ModelScope 文生视频出来的片为什么带 Shutterstock 水印?

因为 ModelScopeT2V 的训练集包含 WebVid-10M 这类带水印的公开视频数据,水印被模型学了进去,这是社区最普遍的吐槽。想彻底避开,用 cerspense/zeroscope_v2_576w 和 zeroscope_v2_XL 这两个专门为去水印重训的微调,或者干脆跳到 DiffSynth-Studio 里的新一代模型。两条路都是几行命令的事,在 NexGPU 上开一台 RTX 3090 24GB($0.193/卡·时)同时把两套权重装上,一个下午就能比出哪条更适合你的素材。

text-to-video-ms-1.7b 到底需要多大显存?

分三档:默认 16 帧、fp16 直接 .to('cuda'),8GB 级的卡就能起;开 enable_model_cpu_offload() 加 enable_vae_slicing() 之后,64 帧(8 秒)峰值只有 7GB;官方模型卡说再叠 attention slicing 和 PyTorch 2.0,25 秒的片能压进 16GB 以内。这意味着 NexGPU 上单价最低的 Tesla V100 32GB($0.188/卡·时)就绰绰有余,完全不必为它去抢 A100。

ModelScope 文生视频支持中文 prompt 吗?

不支持。官方模型卡写得很直白:Only English input is supported。中文 prompt 不会报错,但语义会明显退化,出来的片和描述对不上。需要中文语义理解的话,得换到魔搭上的新一代视频模型,用 DiffSynth-Studio 加载。NexGPU 的 2,000+ 预置镜像里 PyTorch 环境是现成的,换模型不用重装底座。

ModelScopeT2V 和 zeroscope 能用于商业项目吗?

要谨慎。HuggingFace 上 damo-vilab/text-to-video-ms-1.7b 的许可证是 CC-BY-NC-ND,VGen 仓库也明确标注 RESEARCH/NON-COMMERCIAL USE ONLY;zeroscope 系列是 CC-BY-NC-4.0,同样带 NC。这条线里只有 I2VGen-XL 的权重挂的是 MIT。商用前请自行核对目标仓库当前的 LICENSE 文件 —— 我们只负责把卡和环境准备好,NexGPU 上跑什么模型、按什么条款用,决定权在你。

从魔搭下权重比从 HuggingFace 快吗?

在中国大陆方向是快得多,这也是 modelscope 库存在的一大理由;snapshot_download('iic/text-to-video-synthesis') 一行就能拉全。注意 modelscope 1.39.1 起要求 Python ≥ 3.10,老镜像会装不上。NexGPU 的 1,175 个可租节点分布在 51 个国家和地区,选一台就近的机器,魔搭和 HuggingFace 两边都能直连,不用折腾代理。

ModelScope 这条视频线是不是已经被淘汰了?

作为出片工具,1.7B 那代确实是 2023 年的架构,画质已经不够看;但作为最省显存的验证模型它仍然有价值 —— 7GB 就能跑通完整的文生视频链路。真正的接棒者是同一个魔搭社区团队维护的 DiffSynth-Studio,Wan、HunyuanVideo、CogVideoX-5B、LTX-2 都在里面。NexGPU 有 75 种 GPU 型号、单节点最多 14 卡、最大节点显存 2,152GB,从 $0.188 的 V100 试水到 H200 141GB 出成片,同一个控制台里就能切换。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。