ModelScope(魔搭)这个名字在视频生成圈里同时指两件事:一是阿里达摩院放出的 ModelScopeT2V 文生视频模型 —— 魔搭上的仓库 ID 是 iic/text-to-video-synthesis,HuggingFace 上是 damo-vilab/text-to-video-ms-1.7b,17 亿参数里有 5 亿专门负责时序建模;二是托管它的魔搭社区平台本身。搜「ModelScope 文生视频 本地部署」的人,九成想知道的是前者到底吃多少显存、自己那张卡跑不跑得动。
答案比想象中友好。ModelScopeT2V 走的是 Stable Diffusion 1.5 的老路子 —— VQGAN、文本编码器,加一个插了时空模块的去噪 UNet3D,默认输出 16 帧、8fps、两秒的 256×256 短片。fp16 权重配上 enable_model_cpu_offload() 和 enable_vae_slicing(),跑到 64 帧(8 秒)峰值显存也只有 7GB;官方模型卡进一步说明,再叠 attention slicing 和 PyTorch 2.0,25 秒的片能压进 16GB 以内。放在 2026 年的视频模型里,这个门槛低得反常。
代价是它确实老了。训练数据来自 WebVid-10M 等公开集,社区最常见的抱怨就是出片带 Shutterstock 水印 —— cerspense/zeroscope_v2_576w 与 zeroscope_v2_XL 这两个微调正是为了解决它而生。模型卡明确写着 Only English input is supported,许可证是 CC-BY-NC-ND,VGen 仓库同样标注 RESEARCH/NON-COMMERCIAL USE ONLY。要做今天水准的视频,主线已经换成了同一个魔搭社区团队维护的 DiffSynth-Studio:它把 Wan、HunyuanVideo、CogVideoX-5B、LTX-2 全接了进来,靠逐层 offload 能把 HunyuanVideo 的 129×512×384 压到 6GB。这几条路线在 NexGPU 上共用同一套镜像和同一套按秒计费。
01 —
ModelScope 视频线上,今天还能本地跑的几个模型
从 2023 年的 1.7B 老将,到魔搭官方维护的 DiffSynth-Studio 引擎,显存跨度 6GB 到 24GB。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| ModelScopeT2V(iic/text-to-video-synthesis · damo-vilab/text-to-video-ms-1.7b) | 1.7B(其中 0.5B 用于时序) | fp16 ~7GB(64 帧 + CPU offload + VAE slicing)/< 16GB 可做到 25 秒 | 默认 16 帧 @ 8fps,256×256 | 整条线的祖先。VQGAN + 文本编码器 + 时空 UNet3D,diffusers 里对应 TextToVideoSDPipeline。只吃英文 prompt,许可证 CC-BY-NC-ND,出片常带水印,适合当最省钱的验证模型。 |
| cerspense/zeroscope_v2_576w | 1.7B(ModelScopeT2V 微调) | fp16 ~7.9GB(576×320,30 帧) | 576×320,24–36 帧 | 社区为去掉水印重训的版本,许可证 CC-BY-NC-4.0。它是两段式工作流的第一段,负责快速出低分辨率草片。 |
| cerspense/zeroscope_v2_XL | 1.7B(ModelScopeT2V 微调) | fp16 ~15.3GB(1024×576,30 帧) | 1024×576,最多 30 帧 | 第二段。用 VideoToVideoSDPipeline 走 vid2vid,把 576w 的草片按 strength=0.6 放大重绘,是这条老架构上能拿到的最好画质。 |
| I2VGen-XL(ali-vilab,来自 VGen 仓库) | ~1B | fp16 权重约 2GB;720p 推理峰值官方未标注,实务上按 24GB 卡准备 | 1280×720 图生视频 | 级联扩散的图生视频模型,diffusers 里是 I2VGenXLPipeline,权重许可证为 MIT,是这条线里少数没有 NC 限制的。官方承认对动漫图和纯黑背景表现不佳。 |
| DiffSynth-Studio(魔搭社区官方 Diffusion 引擎,Apache-2.0) | 接入 Wan、HunyuanVideo、CogVideoX-5B、LTX-2 等 | HunyuanVideo 129×720×1280 需 24GB;129×512×384 可低至 6GB | 逐层 offload、FP8 量化、序列并行、LoRA 与全量训练 | 今天在魔搭生态里做视频真正该用的东西。git clone 后 pip install -e . 即可,显存管理是它最大的卖点。 |
02 —
按场景选卡:别为 1.7B 租 H100
ModelScopeT2V 的显存需求低到能用池子里最便宜的卡,真正吃卡的是它的后继者。
跑 ModelScopeT2V 1.7B,256×256 × 16–64 帧调 prompt 出样
Tesla V100 32GB$0.188/卡·时
峰值 7GB 而已,V100 的 fp16 Tensor Core 对 SD 1.5 世代的 UNet3D 正合适,而它是整个池子里单价最低的卡。
zeroscope 两段式:576×320 草片再 vid2vid 放大到 1024×576
RTX 3090 24GB$0.193/卡·时
XL 阶段 30 帧要 15.3GB,24GB 既留足 VAE 解码余量,又能把 576w 和 XL 两套权重常驻显存省掉反复加载。
I2VGen-XL 出 720p 图生视频,或在 VGen 里做 DreamVideo/VideoComposer 微调
RTX 4090 24GB$0.540/卡·时
720p 长序列的时空 attention 是纯算力瓶颈,Ada 的 fp16/bf16 吞吐比 Ampere 高一大截,出片等待时间直接对折。
用 DiffSynth-Studio 跑 Wan / HunyuanVideo 的 129 帧 720p,或做 LoRA 训练
A100 PCIE 80GB$0.824/卡·时
官方 24GB 那条路径靠的是逐层 offload,速度要打折;80GB 能整模型驻留、开 batch、做训练,且价格只比 4090 高一点。
03 —
四步在 NexGPU 上跑通
从开机到导出第一条 mp4,全程不需要申请配额。
- 01
开一台带 PyTorch 的实例
在 console.nexgpu.net 选 Tesla V100 32GB 或 RTX 3090 24GB,直接用现成的 PyTorch 镜像开机,SSH 或 Jupyter 进去先确认卡认出来了。2,000+ 预置镜像里也有 ComfyUI 和 vLLM,视频后续想接工作流不用重装。
nvidia-smi && python -c "import torch; print(torch.__version__, torch.cuda.get_device_name(0))" - 02
装依赖,从魔搭拉权重
modelscope 库当前是 1.39.1,Apache-2.0,要求 Python ≥ 3.10。注意仓库命名空间早就从 damo/ 迁到了 iic/,网上大量 2023 年的教程还在写 damo/text-to-video-synthesis,照抄会拉不下来。导出 mp4 需要 imageio-ffmpeg。
pip install "modelscope>=1.39.1" diffusers transformers accelerate imageio imageio-ffmpeg && python -c "from modelscope import snapshot_download; print(snapshot_download('iic/text-to-video-synthesis'))" - 03
用 diffusers 出第一条片
fp16 变体加上 enable_model_cpu_offload() 与 enable_vae_slicing(),64 帧只吃 7GB。想再快就把调度器换成 DPMSolverMultistepScheduler,把 num_inference_steps 降到 25。prompt 必须是英文。
python -c "import torch;from diffusers import DiffusionPipeline;from diffusers.utils import export_to_video;p=DiffusionPipeline.from_pretrained('damo-vilab/text-to-video-ms-1.7b',torch_dtype=torch.float16,variant='fp16');p.enable_model_cpu_offload();p.enable_vae_slicing();print(export_to_video(p('a panda surfing a wave, cinematic lighting',num_frames=64).frames[0]))" - 04
要画质就换 zeroscope 两段式,要现代模型就上 DiffSynth-Studio
zeroscope_v2_576w 先出 576×320,再交给 zeroscope_v2_XL 以 strength=0.6 放大到 1024×576,顺带甩掉水印。如果目标是今天水准的视频,直接装魔搭社区自己的 DiffSynth-Studio,Wan、HunyuanVideo、LTX-2 都在里面,显存不够就开逐层 offload 和 FP8。
git clone https://github.com/modelscope/DiffSynth-Studio.git && cd DiffSynth-Studio && pip install -e .
一次完整出片的真实账单
按 NexGPU 的挂牌价算一笔:先用 Tesla V100 32GB($0.188/卡·时)花 3 小时把 prompt 和参数调顺,3 × $0.188 = $0.564;再换 RTX 3090 24GB($0.193/卡·时)跑 8 小时 zeroscope 两段式批量出片,8 × $0.193 = $1.544。权重加依赖占一个 15GB 的卷,存储中位价 $0.414/GB·月,留 3 天再销毁就是 15 × $0.414 × 3/30 = $0.621。成片 20GB 下载回本地,出网中位价 $0.0081/GB,20 × $0.0081 = $0.162。合计 $0.564 + $1.544 + $0.621 + $0.162 = $2.891。计费按秒结算、按小时定价,没有起租量也没有开通费;要提醒的是算力在实例停止时就停止计费,而存储会一直算到卷被销毁为止 —— 这也是为什么上面那笔账里存储占了五分之一。
04 —
