Stable Audio 3.0 是一个家族,不是一个模型。small-music 和 small-sfx 各是 459M 参数的扩散主干,配 108M 的 SAME-S 自编码器,最长出 120 秒;medium 是 1.4B 主干配 852M 的 SAME-L,最长 380 秒(6 分 20 秒);large 是 2.7B,只走 API 和企业自托管,不放权重。前三个的开放权重都在 Hugging Face 的 stabilityai/stable-audio-3-small-music、stable-audio-3-small-sfx、stable-audio-3-medium,推理与训练代码在 github.com/Stability-AI/stable-audio-3。全系输出 44.1kHz 立体声。
显存要求这么低,是架构决定的。SAME(Semantically-Aligned Music autoEncoder)把立体声波形压到 4096 倍下采样、256 维、约 10.76Hz 的潜序列——比常见音频自编码器的 1024×~2048× 激进得多,所以 380 秒的曲子在潜空间里也就四千来个 token。扩散主干用 T5Gemma(t5gemma-b-b-ul2)做文本条件,采样走 ping-pong、只要 8 步、不需要 classifier-free guidance。官方给出的 H200 数字是:medium 生成 380 秒纯采样 1.31 秒,峰值显存 6.52GB;接上 TensorRT 降到 0.43 秒。small 生成 120 秒是 0.45 秒、峰值 2.40GB。
所以自建 Stable Audio 3 的成本从来不在「跑不跑得动」,而在「一小时能出多少条」和「能不能微调成自己的音色」。游戏音效流水线要的是批量吞吐,独立音乐人要的是 LoRA 把自己的采样库喂进去,出海产品要的是权重在自己机器上、不把 prompt 交给第三方 API。这三件事都只需要一张便宜的 Ampere 卡起步,按秒计费用完就停——这正是 NexGPU 的 1,175 个可租节点在做的事。
01 —
Stable Audio 3 全系版本与显存对照
官方公布的峰值显存(H200、未开分块解码),以及社区量化后的体积
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Stable Audio 3 Small-Music | 459M(DiT)+ 108M(SAME-S) | 峰值 1.69GB(5 秒)/1.89GB(30 秒)/2.40GB(120 秒) | 最长 120 秒 | 纯音乐轻量版,官方标注 CPU 也能跑,是唯一能在移动端完成整曲创作的开放权重模型。 |
| Stable Audio 3 Small-SFX | 459M(DiT)+ 108M(SAME-S) | 峰值 1.69GB(5 秒音效)/2.40GB(120 秒) | 最长 120 秒 | 音效专用分支,配 TrackType: SFX 前缀使用;游戏、短视频批量出脚步声、环境声、UI 音的首选。 |
| Stable Audio 3 Medium | 1.4B(DiT)+ 852M(SAME-L) | 峰值 5.07GB(5 秒)/5.49GB(30 秒)/6.49GB(120 秒)/6.52GB(380 秒) | 最长 380 秒(6 分 20 秒) | 开放权重里的旗舰。仓库以 F32 分发,DiT 约 5.5GB、SAME-L 约 3.2GB,落盘约 8.8GB,推理时按 bf16 加载才是上面那组数字。 |
| Stable Audio 3 Medium-Base | 1.4B(DiT)+ 852M(SAME-L) | LoRA 训练约 6.5GB;加 --base_precision bf16 --adapter_type lora-xs 降到约 5.5GB | 最长 380 秒 | 官方指定的微调起点,scripts/train_lora.py 的 --model 只认它,不是拿成品 medium 去练。 |
| Stable Audio 3 Medium GGUF(社区量化) | 1.4B,走 sa3.cpp(C++/GGML) | 文件体积 F16 约 4.4GB/Q8_0 约 2.3GB/Q5_K_M 约 1.7GB/Q4_K_M 约 1.5GB(DiT+SAME 合计) | 最长 380 秒 | 社区把 F16 当生产路径,8GB 显存的笔记本卡也能跑;量化到 Q4 主要省的是加载体积,音质会掉。 |
| Stable Audio Open 1.0(上一代) | 约 1.1B,T5-base 文本编码 | 社区实践 8GB 起步,解码阶段内存吃到 14.5GB 左右 | 最长 47 秒 | 2024 年那一代,已被 3.0 取代:时长从 47 秒到 380 秒、采样从几十步到 8 步。老工作流可以继续用,但没有理由新建在它上面。 |
02 —
按用途选卡:Stable Audio 3 的四种真实场景
这是个小模型,别为它租 H100——除非你在对齐官方基准
small-music / small-sfx 批量出素材、音效流水线
RTX 3090 24GB$0.193/卡·时
峰值只要 2.40GB,24GB 显存可以并排开十来个推理进程批跑,是全站最便宜的 Ampere 卡、也是能装 flash-attn 2 的最低价选项。
medium 单卡跑 380 秒长曲,配 Gradio 界面试听
RTX 4090 24GB$0.540/卡·时
Ada 架构,flash-attn 2 的预编译 wheel 直接装得上;6.52GB 峰值之外还有大把余量做批量解码和多路并发。
medium-base 上做 LoRA,把自有采样库练成专属音色
RTX A6000 48GB$0.817/卡·时
官方 dora-rows 默认配置约 6.5GB,48GB 让你把 rank、batch 和数据集缓存一次拉满,跑几千步不用担心 OOM 重来。
复现官方 TensorRT 延迟基准 / 单卡扛高并发在线服务
H200 141GB$6.660/卡·时
官方那组「380 秒成品 0.43 秒生成」就是在 H200 加 TensorRT 上测的,同一张卡才好对齐口径;日常出片没必要用它。
03 —
从开机到出第一条 6 分钟成品
四步,全程用官方仓库,不走第三方封装
- 01
开一台 Ampere 及以上的卡
medium 依赖 flash-attention 2,而 FA2 要求 sm80 及以上。Turing 的 Tesla T4、Volta 的 V100、Pascal 的 P40 都装不上——这是很多人第一次跑出静电噪音的真正原因。选 RTX 3090、A10、RTX 4090 这类 Ampere/Ada 卡,挑 PyTorch 预置镜像,SSH 进去先确认算力号。
nvidia-smi --query-gpu=name,compute_cap,memory.total --format=csv - 02
拉仓库、用 uv 装环境
官方仓库用 uv 管依赖,默认按 CUDA 12.6 装 PyTorch;如果镜像里是别的 CUDA 版本,先手动装好对应的 torch 再执行 uv sync。--extra ui 带上 Gradio 界面,--extra lora 带上微调脚本。
git clone https://github.com/Stability-AI/stable-audio-3 && cd stable-audio-3 && uv sync --extra ui --extra lora - 03
装 flash-attn 预编译 wheel 并验证
从源码编译 flash-attn 在一张按秒计费的卡上是纯粹的浪费时间,官方直接推荐用预编译 wheel。装完务必验证能 import——能 import 才说明 medium 不会输出噪音。
uv pip install https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.7.16/flash_attn-2.6.3+cu126torch2.7-cp310-cp310-linux_x86_64.whl && uv run python -c 'import flash_attn; from flash_attn import flash_attn_func; print(flash_attn.__version__)' - 04
领权重、生成、起界面
Hugging Face 上 medium 是受控仓库:既要接受 Stability AI Community License,也要接受 Gemma Terms of Use(文本编码器 T5Gemma 是按 Gemma 条款转分发的,含第 3.2 节使用限制)。权重到位后用 CLI 出第一条,或 uv run python run_gradio.py --model medium 起本地界面,通过 SSH 端口转发在自己浏览器里试听。
hf download stabilityai/stable-audio-3-medium && stable-audio --model medium -p 'TrackType: Music, VocalType: Instrumental, Genre: ambient techno, 118 BPM, warm analog pads, tape saturation' --duration 380 -o track.wav
算一笔真账
先看上限。官方公布 medium 在 H200 上生成一条 380 秒(6 分 20 秒)成品,纯采样耗时 1.31 秒。H200 141GB 在 NexGPU 是 $6.660/卡·时,一小时 3600 秒理论可跑 3600 ÷ 1.31 ≈ 2,748 条,折合每条 $6.660 ÷ 2748 ≈ $0.0024;换成官方 TensorRT 路径的 0.43 秒,一小时约 8,372 条,每条约 $0.0008。这是六分钟立体声成品的单价,不到一分钱。 再看性价比。medium 峰值显存只有 6.52GB,RTX 3090 24GB 完全装得下,$0.193/卡·时。哪怕它比 H200 慢一个数量级、单条要 15 秒,一小时也是 240 条,每条 $0.193 ÷ 240 ≈ $0.0008——和 H200 上 TensorRT 的单价打平,租金却只有 2.9%。这就是为什么这个模型不该往大卡上送。 LoRA 微调:官方标准配置约 6.5GB 显存,1000 步起步。用 RTX 4090 24GB $0.540/卡·时,按两小时预算就是 2 × $0.540 = $1.08 一轮;20GB 的采样数据集按 $0.414/GB·月 计是 20 × $0.414 = $8.28/月,即 $0.276/天,训完把实例停掉、数据留着继续迭代,算力费立刻归零。按秒计费、无最低消费、无开通费——跑一轮不满意就重来,代价是一杯咖啡的零头。
04 —
