Open-Sora 由 HPC-AI Tech(Colossal-AI 背后的团队)维护,仓库在 github.com/hpcaitech/Open-Sora,代码 Apache-2.0,目前 29.3k star。当前主线是 2025 年 3 月 12 日发布的 Open-Sora 2.0:一个 11B 的扩散模型,官方称训练总成本约 $200K,在 VBench 上与 11B 的 HunyuanVideo、30B 的 Step-Video 打平。它用一套权重同时吃文生视频和图生视频,支持 256px 与 768px 两档分辨率、16:9 / 9:16 / 1:1 / 2.39:1 四种画幅,帧数按 4k+1 取值,最多 129 帧。需要说明的是,2.0 之后仓库没有再发新版本,1.3 仍作为独立分支保留。
真正劝退的是显存。官方在 H100/H800、50 步采样下给出的峰值占用是:256×256 单卡 52.5GB,768×768 单卡 60.3GB。为什么这么高?11B 主干 bf16 就是 23.8GB 的 Open_Sora_v2.safetensors,加上 T5-v1_1-xxl 文本编码器、CLIP-ViT-L/14,默认的 T2I2V 文生视频管线还要再挂一个 12B 的 flux1-dev(同样 23.8GB)先出图再转视频。所以 24GB 的 RTX 4090、48GB 的 A6000 跑 2.0 都是 OOM 结局——48GB 离 52.5GB 只差一点,但差的就是这一点。想在消费级卡上落地,路只有一条:退回 Open-Sora 1.3,那一代主干只有 1.1B(VAE 259M),官方 H200 实测 360p 全程 23–25GB、720p 从 24GB 涨到 113 帧时的 35GB。
这正是租卡比买卡划算的场景。权重本身就要占掉约 114GB 磁盘(hpcai-tech/Open-Sora-v2 仓库 69.2GB,外加官方 fp32 的 t5-v1_1-xxl 44.5GB),768px 想跑出可接受的速度得靠 ColossalAI 的序列并行摊到 4–8 张卡上。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种型号,单节点最多 14 卡、最大节点显存 2,152GB,按秒计量、按小时计价,没有起租量也没有开通费——跑完一批片子把实例停掉,计算费用当场停止。
01 —
Open-Sora 各版本与显存对照
数字全部来自官方仓库实测表,不是估算
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Open-Sora 2.0 | 11B | bf16 单卡峰值 52.5GB(256px)/ 60.3GB(768px) | 256px·768px,最多 129 帧(4k+1) | 当前主线,一套权重同时做 T2V 与 I2V,多卡时 256px 走张量并行、768px 走序列并行,摊到 4 卡后每卡降到 44.3GB。 |
| Open-Sora 2.0 T2I2V 管线 | 11B + Flux.1-dev 12B | 显存同上,权重合计 69.2GB | 256px·768px,对应 t2i2v_256px.py / t2i2v_768px.py | 官方推荐的文生视频路径:先用 flux1-dev 生成首帧再转视频,画质明显好于纯 T2V,但会引入非商用许可,商用需绕开。 |
| Open-Sora 1.3(STDiT-v4) | 1.1B + 259M VAE | 360p 23–25GB / 720p 24–35GB | 360p·720p,最多 113 帧 | 唯一能塞进消费级显卡的一代。360p 从图片到 113 帧只在 23→25GB 之间浮动,720p 到 113 帧才涨到 35GB。 |
| Open-Sora 1.3 i2v(STDiT-v4-i2v) | 1.1B | 与 T2V 同档,360p 23–25GB | 360p·720p | 独立的图生视频与视频续写权重,做分镜延长、静图起势这类活比 2.0 轻得多。 |
| 依赖组件(需另外下载) | T5-v1_1-xxl + CLIP-ViT-L/14 + hunyuan_vae | t5-v1_1-xxl 官方 fp32 权重 44.5GB(磁盘) | 配置里写死 ./ckpts/google/t5-v1_1-xxl 与 ./ckpts/openai/clip-vit-large-patch14 | 这两个不在 Open-Sora-v2 仓库里,huggingface-cli 拉完主仓库还得单独补,很多人第一次跑就卡在这里报路径错误。 |
02 —
该租哪张卡:按版本和分辨率对号入座
显存按官方峰值留余量匹配,不做勉强塞卡的推荐
Open-Sora 1.3 跑 360p,单卡试产分镜
RTX 5090 32GB$0.723/卡·时
官方 H200 实测 360p 全程 23–25GB,32GB 留得下余量;24GB 的 4090 在 97 帧以上就贴着边缘走,很容易 OOM。
Open-Sora 1.3 跑 720p、113 帧长镜头
RTX A6000 48GB$0.817/卡·时
720p 帧数拉满时峰值 35GB,48GB 单卡一次过,不用为了几帧去开并行。
Open-Sora 2.0 单卡跑 256px,做效果验证
A100 PCIE 80GB$0.824/卡·时
256px 单卡峰值 52.5GB,48GB 的 A6000 差这一口气就是装不下,80GB 是能单卡跑通 2.0 的最低档位。
Open-Sora 2.0 出 768px 成片,多卡序列并行
H100 SXM 80GB × 4–8$3.582/卡·时
官方实测 4 卡 466 秒、8 卡 276 秒一条,每卡稳定在 44.3GB;单卡也能跑但要 1656 秒,近 28 分钟一条。
03 —
在 NexGPU 上从零跑通 Open-Sora
四步,命令都是官方仓库里的原文
- 01
开实例、装环境
从 2,000+ 预置镜像里选 PyTorch 镜像开机,SSH 进去建环境。注意 xformers 被官方钉死在 0.0.27.post2 的 cu121 轮子上,别自作主张升级;flash-attn 需要现场编译,第一次装会跑很久,耐心等完再往下走。
conda create -n opensora python=3.10 && conda activate opensora && git clone https://github.com/hpcaitech/Open-Sora && cd Open-Sora && pip install -v . && pip install xformers==0.0.27.post2 --index-url https://download.pytorch.org/whl/cu121 && pip install flash-attn --no-build-isolation - 02
拉权重,预算好磁盘
主仓库 69.2GB,含 Open_Sora_v2.safetensors 23.8GB、flux1-dev.safetensors 23.8GB、flux1-dev-ae.safetensors 335MB、hunyuan_vae.safetensors 493MB。T5 和 CLIP 不在里面,要按配置里的路径单独补齐,全套算下来约 114GB。
pip install "huggingface_hub[cli]" && huggingface-cli download hpcai-tech/Open-Sora-v2 --local-dir ./ckpts - 03
单卡出第一条 256px
先用 t2i2v_256px.py 验证环境通不通。--motion-score 控制画面动态强度,数值越大动得越猛,4 是官方示例里的取值。这一步在 H100 上约 60 秒出片,峰值 52.5GB。
torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --prompt "raining, sea" --motion-score 4 - 04
上多卡跑 768px 成片
768px 靠 ColossalAI 序列并行摊显存,nproc_per_node 直接对应租的卡数,每卡降到 44.3GB。显存吃紧时加 --offload True 把部分权重换到内存,代价是慢一些。图生视频则改用 256px.py 配上 --cond_type i2v_head --ref your.png。
torchrun --nproc_per_node 8 --standalone scripts/diffusion/inference.py configs/diffusion/inference/768px.py --save-dir samples --prompt "raining, sea" --offload True
一条 768px 视频到底多少钱
拿官方 768×768 的实测时间直接乘我们的费率,会得到一个反直觉的结论。8 卡 H100 SXM 80GB:8 × $3.582 = $28.656/时,276 秒即 0.0767 时,一条 $2.20;4 卡:4 × $3.582 = $14.328/时,466 秒即 0.1294 时,一条 $1.85;2 卡:$7.164/时 × 0.2397 时 = $1.72;单卡:$3.582 × 0.46 时 = $1.65。也就是说卡越多越快但单条越贵——8 卡比单卡快 6 倍,每条只多花 33%。赶片子用 8 卡,批量刷素材用 1–2 卡最省。想再压成本就退到 256px:A100 PCIE 80GB $0.824/时,即使保守按 3 分钟一条算,也只有 $0.824 × 0.05 = $0.04,四美分一条草稿。存储另计:约 114GB 权重按 $0.414/GB·月 中位价约 $47/月,实例停机后计算费立刻停止,存储会一直算到你销毁它为止。
04 —
