跳到主要内容

视频生成模型

Open-Sora 本地部署,52.5GB 是这道门槛的真实高度

11B 的 Open-Sora 2.0 不是一张 4090 能扛下来的模型。这一页把官方实测的显存表、权重体积、许可证陷阱和多卡账单一次讲清楚,然后告诉你该租哪张卡。

Open-Sora 由 HPC-AI Tech(Colossal-AI 背后的团队)维护,仓库在 github.com/hpcaitech/Open-Sora,代码 Apache-2.0,目前 29.3k star。当前主线是 2025 年 3 月 12 日发布的 Open-Sora 2.0:一个 11B 的扩散模型,官方称训练总成本约 $200K,在 VBench 上与 11B 的 HunyuanVideo、30B 的 Step-Video 打平。它用一套权重同时吃文生视频和图生视频,支持 256px 与 768px 两档分辨率、16:9 / 9:16 / 1:1 / 2.39:1 四种画幅,帧数按 4k+1 取值,最多 129 帧。需要说明的是,2.0 之后仓库没有再发新版本,1.3 仍作为独立分支保留。

真正劝退的是显存。官方在 H100/H800、50 步采样下给出的峰值占用是:256×256 单卡 52.5GB,768×768 单卡 60.3GB。为什么这么高?11B 主干 bf16 就是 23.8GB 的 Open_Sora_v2.safetensors,加上 T5-v1_1-xxl 文本编码器、CLIP-ViT-L/14,默认的 T2I2V 文生视频管线还要再挂一个 12B 的 flux1-dev(同样 23.8GB)先出图再转视频。所以 24GB 的 RTX 4090、48GB 的 A6000 跑 2.0 都是 OOM 结局——48GB 离 52.5GB 只差一点,但差的就是这一点。想在消费级卡上落地,路只有一条:退回 Open-Sora 1.3,那一代主干只有 1.1B(VAE 259M),官方 H200 实测 360p 全程 23–25GB、720p 从 24GB 涨到 113 帧时的 35GB。

这正是租卡比买卡划算的场景。权重本身就要占掉约 114GB 磁盘(hpcai-tech/Open-Sora-v2 仓库 69.2GB,外加官方 fp32 的 t5-v1_1-xxl 44.5GB),768px 想跑出可接受的速度得靠 ColossalAI 的序列并行摊到 4–8 张卡上。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种型号,单节点最多 14 卡、最大节点显存 2,152GB,按秒计量、按小时计价,没有起租量也没有开通费——跑完一批片子把实例停掉,计算费用当场停止。

01 —

Open-Sora 各版本与显存对照

数字全部来自官方仓库实测表,不是估算

版本参数量显存上下文说明
Open-Sora 2.011Bbf16 单卡峰值 52.5GB(256px)/ 60.3GB(768px)256px·768px,最多 129 帧(4k+1)当前主线,一套权重同时做 T2V 与 I2V,多卡时 256px 走张量并行、768px 走序列并行,摊到 4 卡后每卡降到 44.3GB。
Open-Sora 2.0 T2I2V 管线11B + Flux.1-dev 12B显存同上,权重合计 69.2GB256px·768px,对应 t2i2v_256px.py / t2i2v_768px.py官方推荐的文生视频路径:先用 flux1-dev 生成首帧再转视频,画质明显好于纯 T2V,但会引入非商用许可,商用需绕开。
Open-Sora 1.3(STDiT-v4)1.1B + 259M VAE360p 23–25GB / 720p 24–35GB360p·720p,最多 113 帧唯一能塞进消费级显卡的一代。360p 从图片到 113 帧只在 23→25GB 之间浮动,720p 到 113 帧才涨到 35GB。
Open-Sora 1.3 i2v(STDiT-v4-i2v)1.1B与 T2V 同档,360p 23–25GB360p·720p独立的图生视频与视频续写权重,做分镜延长、静图起势这类活比 2.0 轻得多。
依赖组件(需另外下载)T5-v1_1-xxl + CLIP-ViT-L/14 + hunyuan_vaet5-v1_1-xxl 官方 fp32 权重 44.5GB(磁盘)配置里写死 ./ckpts/google/t5-v1_1-xxl 与 ./ckpts/openai/clip-vit-large-patch14这两个不在 Open-Sora-v2 仓库里,huggingface-cli 拉完主仓库还得单独补,很多人第一次跑就卡在这里报路径错误。

02 —

该租哪张卡:按版本和分辨率对号入座

显存按官方峰值留余量匹配,不做勉强塞卡的推荐

  • Open-Sora 1.3 跑 360p,单卡试产分镜

    RTX 5090 32GB$0.723/卡·时

    官方 H200 实测 360p 全程 23–25GB,32GB 留得下余量;24GB 的 4090 在 97 帧以上就贴着边缘走,很容易 OOM。

  • Open-Sora 1.3 跑 720p、113 帧长镜头

    RTX A6000 48GB$0.817/卡·时

    720p 帧数拉满时峰值 35GB,48GB 单卡一次过,不用为了几帧去开并行。

  • Open-Sora 2.0 单卡跑 256px,做效果验证

    A100 PCIE 80GB$0.824/卡·时

    256px 单卡峰值 52.5GB,48GB 的 A6000 差这一口气就是装不下,80GB 是能单卡跑通 2.0 的最低档位。

  • Open-Sora 2.0 出 768px 成片,多卡序列并行

    H100 SXM 80GB × 4–8$3.582/卡·时

    官方实测 4 卡 466 秒、8 卡 276 秒一条,每卡稳定在 44.3GB;单卡也能跑但要 1656 秒,近 28 分钟一条。

03 —

在 NexGPU 上从零跑通 Open-Sora

四步,命令都是官方仓库里的原文

  1. 01

    开实例、装环境

    从 2,000+ 预置镜像里选 PyTorch 镜像开机,SSH 进去建环境。注意 xformers 被官方钉死在 0.0.27.post2 的 cu121 轮子上,别自作主张升级;flash-attn 需要现场编译,第一次装会跑很久,耐心等完再往下走。

    conda create -n opensora python=3.10 && conda activate opensora && git clone https://github.com/hpcaitech/Open-Sora && cd Open-Sora && pip install -v . && pip install xformers==0.0.27.post2 --index-url https://download.pytorch.org/whl/cu121 && pip install flash-attn --no-build-isolation
  2. 02

    拉权重,预算好磁盘

    主仓库 69.2GB,含 Open_Sora_v2.safetensors 23.8GB、flux1-dev.safetensors 23.8GB、flux1-dev-ae.safetensors 335MB、hunyuan_vae.safetensors 493MB。T5 和 CLIP 不在里面,要按配置里的路径单独补齐,全套算下来约 114GB。

    pip install "huggingface_hub[cli]" && huggingface-cli download hpcai-tech/Open-Sora-v2 --local-dir ./ckpts
  3. 03

    单卡出第一条 256px

    先用 t2i2v_256px.py 验证环境通不通。--motion-score 控制画面动态强度,数值越大动得越猛,4 是官方示例里的取值。这一步在 H100 上约 60 秒出片,峰值 52.5GB。

    torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --prompt "raining, sea" --motion-score 4
  4. 04

    上多卡跑 768px 成片

    768px 靠 ColossalAI 序列并行摊显存,nproc_per_node 直接对应租的卡数,每卡降到 44.3GB。显存吃紧时加 --offload True 把部分权重换到内存,代价是慢一些。图生视频则改用 256px.py 配上 --cond_type i2v_head --ref your.png。

    torchrun --nproc_per_node 8 --standalone scripts/diffusion/inference.py configs/diffusion/inference/768px.py --save-dir samples --prompt "raining, sea" --offload True

一条 768px 视频到底多少钱

拿官方 768×768 的实测时间直接乘我们的费率,会得到一个反直觉的结论。8 卡 H100 SXM 80GB:8 × $3.582 = $28.656/时,276 秒即 0.0767 时,一条 $2.20;4 卡:4 × $3.582 = $14.328/时,466 秒即 0.1294 时,一条 $1.85;2 卡:$7.164/时 × 0.2397 时 = $1.72;单卡:$3.582 × 0.46 时 = $1.65。也就是说卡越多越快但单条越贵——8 卡比单卡快 6 倍,每条只多花 33%。赶片子用 8 卡,批量刷素材用 1–2 卡最省。想再压成本就退到 256px:A100 PCIE 80GB $0.824/时,即使保守按 3 分钟一条算,也只有 $0.824 × 0.05 = $0.04,四美分一条草稿。存储另计:约 114GB 权重按 $0.414/GB·月 中位价约 $47/月,实例停机后计算费立刻停止,存储会一直算到你销毁它为止。

04 —

常见问题

Open-Sora 需要多大显存?24GB 的 RTX 4090 能跑吗?

分版本。Open-Sora 2.0 不行:官方实测 256px 单卡峰值 52.5GB、768px 60.3GB,24GB 卡差得太远,连 48GB 的 A6000 都装不下。Open-Sora 1.3 可以:360p 全程 23–25GB,但 4090 在 97 帧以上贴边很危险。稳妥做法是 1.3 上 NexGPU 的 RTX 5090 32GB($0.723/卡·时),2.0 直接上 A100 PCIE 80GB($0.824/卡·时),按秒计费,跑一条试一条不用押整月。

Open-Sora 和 OpenAI 的 Sora 是什么关系?

没有任何关系。Open-Sora 是 HPC-AI Tech 团队的独立开源项目,目标是复现 Sora 那一类视频生成能力,代码和权重全开放,Apache-2.0;OpenAI 的 Sora 是闭源商业产品,不提供权重。想私有化、想改架构、想在自己数据上继续训练,只有 Open-Sora 这条路,而它对硬件的要求正好落在 NexGPU 的 80GB 卡和多卡节点上。

Open-Sora 有 GGUF、INT4 或 FP8 量化版本吗?

官方没有。仓库配置里 dtype 写的就是 bf16,hpcai-tech 在 Hugging Face 上只发布了 bf16 的 safetensors,没有任何官方量化权重,所以网上流传的“量化后 12GB 能跑”不要当真。省显存的官方手段只有两个:加 --offload True 把权重换到内存,或者用多卡并行把每卡摊到 44.3GB。真要省事,直接在 NexGPU 租一张 A100 PCIE 80GB,$0.824/卡·时,比折腾量化的时间成本便宜得多。

Open-Sora 是 Apache-2.0,是不是就能随便商用?

代码和 Open-Sora 自己的权重确实是 Apache-2.0,但默认的文生视频管线有坑:t2i2v_*.py 会加载 flux1-dev.safetensors,而 FLUX.1 [dev] 走的是非商用许可。商用场景要么把首帧生成换成许可允许的模型,要么直接走 256px.py / 768px.py 的 T2V、I2V 路径绕开 Flux。这类合规判断建议自己过一遍法务;算力这边,NexGPU 的实例是独占的,权重和数据都在你自己的实例里。

跑 Open-Sora 要准备多少磁盘?存储怎么收费?

hpcai-tech/Open-Sora-v2 仓库总计 69.2GB(主干 23.8GB + flux1-dev 23.8GB + 两个 VAE 约 828MB),T5-v1_1-xxl 官方 fp32 权重还有 44.5GB,加上 CLIP 和输出视频,留 130GB 比较从容。NexGPU 存储中位价 $0.414/GB·月,约 114GB 权重差不多 $47/月,出网流量中位价 $0.0081/GB。注意实例停机后计算费用立刻停止,存储会一直计费到销毁为止——素材导走了就把盘清掉。

Open-Sora 2.0 之后好像没动静了,现在还值得部署吗?

2.0 发布于 2025 年 3 月,之后仓库确实没有再发新版本。但它依然是少数几个把 11B 级视频模型连训练代码一起完全开源、且用 Apache-2.0 授权的项目,做二次训练、做架构研究、做可控视频生成的基座仍然好用,官方 $200K 的训练成本也是可复现的公开数据。要评估它到底适不适合你的场景,最快的办法是在 NexGPU 开一台 A100 PCIE 80GB,$0.824/卡·时,跑几条 256px 看效果,不合适当场停机,几毛钱的事。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。