跳到主要内容

音乐与音效生成

Stable Audio 3 本地部署:6.52GB 显存跑出 6 分 20 秒立体声

Stability AI 在 2026 年 5 月把长曲生成压进了消费级显卡。medium 版 1.4B 参数、380 秒上限、峰值显存 6.52GB,一张 RTX 3090 就够——在 NexGPU 上是 $0.193/卡·时。

Stable Audio 3.0 是一个家族,不是一个模型。small-music 和 small-sfx 各是 459M 参数的扩散主干,配 108M 的 SAME-S 自编码器,最长出 120 秒;medium 是 1.4B 主干配 852M 的 SAME-L,最长 380 秒(6 分 20 秒);large 是 2.7B,只走 API 和企业自托管,不放权重。前三个的开放权重都在 Hugging Face 的 stabilityai/stable-audio-3-small-music、stable-audio-3-small-sfx、stable-audio-3-medium,推理与训练代码在 github.com/Stability-AI/stable-audio-3。全系输出 44.1kHz 立体声。

显存要求这么低,是架构决定的。SAME(Semantically-Aligned Music autoEncoder)把立体声波形压到 4096 倍下采样、256 维、约 10.76Hz 的潜序列——比常见音频自编码器的 1024×~2048× 激进得多,所以 380 秒的曲子在潜空间里也就四千来个 token。扩散主干用 T5Gemma(t5gemma-b-b-ul2)做文本条件,采样走 ping-pong、只要 8 步、不需要 classifier-free guidance。官方给出的 H200 数字是:medium 生成 380 秒纯采样 1.31 秒,峰值显存 6.52GB;接上 TensorRT 降到 0.43 秒。small 生成 120 秒是 0.45 秒、峰值 2.40GB。

所以自建 Stable Audio 3 的成本从来不在「跑不跑得动」,而在「一小时能出多少条」和「能不能微调成自己的音色」。游戏音效流水线要的是批量吞吐,独立音乐人要的是 LoRA 把自己的采样库喂进去,出海产品要的是权重在自己机器上、不把 prompt 交给第三方 API。这三件事都只需要一张便宜的 Ampere 卡起步,按秒计费用完就停——这正是 NexGPU 的 1,175 个可租节点在做的事。

01 —

Stable Audio 3 全系版本与显存对照

官方公布的峰值显存(H200、未开分块解码),以及社区量化后的体积

版本参数量显存上下文说明
Stable Audio 3 Small-Music459M(DiT)+ 108M(SAME-S)峰值 1.69GB(5 秒)/1.89GB(30 秒)/2.40GB(120 秒)最长 120 秒纯音乐轻量版,官方标注 CPU 也能跑,是唯一能在移动端完成整曲创作的开放权重模型。
Stable Audio 3 Small-SFX459M(DiT)+ 108M(SAME-S)峰值 1.69GB(5 秒音效)/2.40GB(120 秒)最长 120 秒音效专用分支,配 TrackType: SFX 前缀使用;游戏、短视频批量出脚步声、环境声、UI 音的首选。
Stable Audio 3 Medium1.4B(DiT)+ 852M(SAME-L)峰值 5.07GB(5 秒)/5.49GB(30 秒)/6.49GB(120 秒)/6.52GB(380 秒)最长 380 秒(6 分 20 秒)开放权重里的旗舰。仓库以 F32 分发,DiT 约 5.5GB、SAME-L 约 3.2GB,落盘约 8.8GB,推理时按 bf16 加载才是上面那组数字。
Stable Audio 3 Medium-Base1.4B(DiT)+ 852M(SAME-L)LoRA 训练约 6.5GB;加 --base_precision bf16 --adapter_type lora-xs 降到约 5.5GB最长 380 秒官方指定的微调起点,scripts/train_lora.py 的 --model 只认它,不是拿成品 medium 去练。
Stable Audio 3 Medium GGUF(社区量化)1.4B,走 sa3.cpp(C++/GGML)文件体积 F16 约 4.4GB/Q8_0 约 2.3GB/Q5_K_M 约 1.7GB/Q4_K_M 约 1.5GB(DiT+SAME 合计)最长 380 秒社区把 F16 当生产路径,8GB 显存的笔记本卡也能跑;量化到 Q4 主要省的是加载体积,音质会掉。
Stable Audio Open 1.0(上一代)约 1.1B,T5-base 文本编码社区实践 8GB 起步,解码阶段内存吃到 14.5GB 左右最长 47 秒2024 年那一代,已被 3.0 取代:时长从 47 秒到 380 秒、采样从几十步到 8 步。老工作流可以继续用,但没有理由新建在它上面。

02 —

按用途选卡:Stable Audio 3 的四种真实场景

这是个小模型,别为它租 H100——除非你在对齐官方基准

  • small-music / small-sfx 批量出素材、音效流水线

    RTX 3090 24GB$0.193/卡·时

    峰值只要 2.40GB,24GB 显存可以并排开十来个推理进程批跑,是全站最便宜的 Ampere 卡、也是能装 flash-attn 2 的最低价选项。

  • medium 单卡跑 380 秒长曲,配 Gradio 界面试听

    RTX 4090 24GB$0.540/卡·时

    Ada 架构,flash-attn 2 的预编译 wheel 直接装得上;6.52GB 峰值之外还有大把余量做批量解码和多路并发。

  • medium-base 上做 LoRA,把自有采样库练成专属音色

    RTX A6000 48GB$0.817/卡·时

    官方 dora-rows 默认配置约 6.5GB,48GB 让你把 rank、batch 和数据集缓存一次拉满,跑几千步不用担心 OOM 重来。

  • 复现官方 TensorRT 延迟基准 / 单卡扛高并发在线服务

    H200 141GB$6.660/卡·时

    官方那组「380 秒成品 0.43 秒生成」就是在 H200 加 TensorRT 上测的,同一张卡才好对齐口径;日常出片没必要用它。

03 —

从开机到出第一条 6 分钟成品

四步,全程用官方仓库,不走第三方封装

  1. 01

    开一台 Ampere 及以上的卡

    medium 依赖 flash-attention 2,而 FA2 要求 sm80 及以上。Turing 的 Tesla T4、Volta 的 V100、Pascal 的 P40 都装不上——这是很多人第一次跑出静电噪音的真正原因。选 RTX 3090、A10、RTX 4090 这类 Ampere/Ada 卡,挑 PyTorch 预置镜像,SSH 进去先确认算力号。

    nvidia-smi --query-gpu=name,compute_cap,memory.total --format=csv
  2. 02

    拉仓库、用 uv 装环境

    官方仓库用 uv 管依赖,默认按 CUDA 12.6 装 PyTorch;如果镜像里是别的 CUDA 版本,先手动装好对应的 torch 再执行 uv sync。--extra ui 带上 Gradio 界面,--extra lora 带上微调脚本。

    git clone https://github.com/Stability-AI/stable-audio-3 && cd stable-audio-3 && uv sync --extra ui --extra lora
  3. 03

    装 flash-attn 预编译 wheel 并验证

    从源码编译 flash-attn 在一张按秒计费的卡上是纯粹的浪费时间,官方直接推荐用预编译 wheel。装完务必验证能 import——能 import 才说明 medium 不会输出噪音。

    uv pip install https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.7.16/flash_attn-2.6.3+cu126torch2.7-cp310-cp310-linux_x86_64.whl && uv run python -c 'import flash_attn; from flash_attn import flash_attn_func; print(flash_attn.__version__)'
  4. 04

    领权重、生成、起界面

    Hugging Face 上 medium 是受控仓库:既要接受 Stability AI Community License,也要接受 Gemma Terms of Use(文本编码器 T5Gemma 是按 Gemma 条款转分发的,含第 3.2 节使用限制)。权重到位后用 CLI 出第一条,或 uv run python run_gradio.py --model medium 起本地界面,通过 SSH 端口转发在自己浏览器里试听。

    hf download stabilityai/stable-audio-3-medium && stable-audio --model medium -p 'TrackType: Music, VocalType: Instrumental, Genre: ambient techno, 118 BPM, warm analog pads, tape saturation' --duration 380 -o track.wav

算一笔真账

先看上限。官方公布 medium 在 H200 上生成一条 380 秒(6 分 20 秒)成品,纯采样耗时 1.31 秒。H200 141GB 在 NexGPU 是 $6.660/卡·时,一小时 3600 秒理论可跑 3600 ÷ 1.31 ≈ 2,748 条,折合每条 $6.660 ÷ 2748 ≈ $0.0024;换成官方 TensorRT 路径的 0.43 秒,一小时约 8,372 条,每条约 $0.0008。这是六分钟立体声成品的单价,不到一分钱。 再看性价比。medium 峰值显存只有 6.52GB,RTX 3090 24GB 完全装得下,$0.193/卡·时。哪怕它比 H200 慢一个数量级、单条要 15 秒,一小时也是 240 条,每条 $0.193 ÷ 240 ≈ $0.0008——和 H200 上 TensorRT 的单价打平,租金却只有 2.9%。这就是为什么这个模型不该往大卡上送。 LoRA 微调:官方标准配置约 6.5GB 显存,1000 步起步。用 RTX 4090 24GB $0.540/卡·时,按两小时预算就是 2 × $0.540 = $1.08 一轮;20GB 的采样数据集按 $0.414/GB·月 计是 20 × $0.414 = $8.28/月,即 $0.276/天,训完把实例停掉、数据留着继续迭代,算力费立刻归零。按秒计费、无最低消费、无开通费——跑一轮不满意就重来,代价是一杯咖啡的零头。

04 —

常见问题

Stable Audio 3 本地部署到底需要多大显存?8GB 的卡够不够?

官方数字:small 生成 120 秒峰值 2.40GB,medium 生成 380 秒峰值 6.52GB。所以 8GB 卡在 bf16 下跑 medium 是够的,只是余量很薄,长时长解码时容易贴顶;社区的 GGUF F16 路径明确说过「8GB 笔记本显卡 3.5 秒出 12 秒音频」。真要做事,直接上 24GB:NexGPU 的 RTX 3090 24GB 是 $0.193/卡·时,比你为 8GB 反复调参省得多。

small 版本官方说 CPU 就能跑,那我还有必要租 GPU 吗?

看你出多少条。官方基准里 small 生成 120 秒,Mac CPU 要 5.92 秒、CoreML 3.09 秒,H200 只要 0.45 秒。一条两条无所谓,但音效库动辄要跑几千条变体,差距会被乘上几千倍。NexGPU 按秒计费,批跑一小时 RTX 3090 才 $0.193,跑完就停——比让本机风扇转一整夜划算。

为什么我生成出来是一片静电噪音?

九成是 flash-attention 2 没装好,这是官方 README 明确点名的故障现象,只影响 medium。先跑 import flash_attn 验证;如果报的是架构不支持,那是卡选错了——FA2 需要 sm80 及以上,Tesla T4、V100、P40 都不行。在 NexGPU 上换成 RTX 3090($0.193/卡·时)或 RTX 4090($0.540/卡·时)这类 Ampere/Ada 卡,几分钟就重开一台。

Stable Audio 3 能生成带歌词的人声吗?

不能,而且这是设计如此。全系输出以器乐为主,偶尔会出现听不出词的人声质感纹理,但不生成可辨识的歌词。官方 prompt 指南建议加前缀引导:纯乐器用 TrackType: Instrument,音效用 TrackType: SFX,想压掉人声纹理用 VocalType: Instrumental,再配 Genre:、Instruments:、Format: 这些标签。另外训练描述以英文为主,中文 prompt 效果明显更差,写英文更稳。

开放权重能商用吗?和 large 版有什么关系?

small、small-sfx、medium 走 Stability AI Community License:年营收 100 万美元以下的组织可免费商用、微调、做衍生品,超过这条线要谈 Enterprise License;同时因为文本编码器是 T5Gemma,你还要一并接受 Gemma Terms of Use 里的使用限制。2.7B 的 large 不放权重,只走 API 和企业自托管。合规判断请自己或让法务确认——NexGPU 只负责让权重跑在你自己的机器上,prompt 和产出不经过第三方推理服务。

我原来用 Stable Audio Open 1.0,现在还要不要换?

该换。Open 1.0 是 2024 年那一代,约 1.1B 参数、最长 47 秒、T5-base 文本编码,社区实践显存 8GB 起步、解码阶段还会吃到 14.5GB 内存;Stable Audio 3 medium 时长提到 380 秒、采样压到 8 步、峰值显存反而降到 6.52GB。老工作流当然还能跑,但新项目没有理由建在 Open 1.0 上。在 NexGPU 开两台同规格实例做 A/B 对比,一小时成本还不到半美元。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。