跳到主要内容

声音克隆 / 语音转换

RVC 声音克隆本地部署:显存怎么算,显卡怎么选

一句话版本:推理 4GB 显存够用,训练按 WebUI 的默认公式 batch = 显存 GB ÷ 2 来估,10 到 50 分钟干净人声就能训出一个能用的音色。NexGPU 从 RTX 3090 24GB $0.193/卡·时起,按秒计费,训完就停。

RVC 的全名是 Retrieval-based Voice Conversion,仓库在 GitHub 的 RVC-Project 组织下,MIT 协议,38k star。它不是 TTS——你不能打字让它说话,你得先有一段源音频,它把源音频的音色换成目标音色,音高、语气、节奏都跟着源走。它的核心卖点是名字里的那个 retrieval:用 top1 检索把输入源的 HuBERT 特征替换成训练集里最接近的特征,以此杜绝音色泄漏,这也是同样的数据量下 RVC 比裸 VITS 像的原因。底模用接近 50 小时的开源 VCTK 训练集训过,所以你只需要在上面微调十几分钟的数据。

2026 年这个项目还在动,而且动得不小。最新的 2.3.260718 把人声伴奏分离的后端从 UVR5 换成了 PyMSS(pymss==2.0.14),加了 FCPE 音高提取,实时链路上了 CUDA Graph,官方在 4090D 上实测算法推理延时最高加速 4.7 倍;特征提取、训练、建索引三个阶段现在都能中途打断再续跑,推理时会自动检测 GPU 模式和精度,选完模型自动配对 index 路径。环境也整个换代了:Python 3.12 x64、torch 2.7.1+cu128 或 +cu118,依赖文件叫 requirments_cu128_py312.txt(是的,官方就是少了一个 e)。仓库结构也变了,入口是 webui.py,训练脚本挪到了顶层的 train/ 目录——照着 2023 年的教程敲 infer-web.py 会直接找不到文件。

至于 RVCv3,README 里提过要用更大参数和更大数据集重训底模,但到今天还没有公开权重,别等。社区里最流行的分支 Applio(IAHispano)已经官宣转入维护模式,只做安全补丁和依赖更新。所以现在把 RVC 私有化部署,主线仓库就是唯一靠谱的选择——而它的瓶颈从来不是代码,是那张卡:RMVPE 提 F0 要 GPU,训练要显存,而 faiss 依赖装的是 faiss-cpu,建索引那一步吃的是 CPU 不是显存。这些账在 NexGPU 上按秒结,训完停机就不再计费。

01 —

RVC 到底有哪些版本可选

不是参数量的差别,是采样率、特征维度和要不要建模音高的差别

版本参数量显存上下文说明
RVC v2 40k(带音高 f0)f0G40k.pth 73.1MB + f0D40k.pth 143MB推理 <4GB / 训练 6GB 起,24GB 卡默认 batch 12输出 40kHz,特征取自 16kHz HuBERT绝大多数人该用的默认组合。唱歌、说话、翻唱都跑它,社区流通的音色权重也基本是这一档。
RVC v2 48k(带音高 f0)f0G48k.pth 75.5MB + f0D48k.pth 143MB训练开销比 40k 高一档,建议 24GB 起输出 48kHz要把成品直接扔进影视混音或者交 48kHz 母带时用。日常配音、短视频没必要,多出来的采样率你听不出来但显存和时间要付。
RVC v2 32k(带音高 f0)f0G32k.pth 74MB + f0D32k.pth 143MB三档里最省,16GB 卡也能训输出 32kHz素材本身就是电话音质、老录音,或者显存实在紧张时的降级选项。输入素质撑不起 40k 的时候,硬上 40k 只是把噪声也一起放大。
RVC v2 无音高版(no-f0)G40k.pth 73MB + D40k.pth 143MB与带 f0 版接近,省掉 F0 提取那一步的时间输出 40kHz,不建模基频只换音色、不跟随源音高的纯语音场景。跑歌声千万别选它——不建模 F0 的结果就是唱什么都跑调。
RVC v1(pretrained/ 目录)40k / 48k 两档比 v2 略省HuBERT 256 维特征只为兼容 2023 年那批在网上流传的 v1 音色权重。新项目别用,v1 和 v2 的特征维度不同,权重不能互换。
配套权重:HuBERT + RMVPEhubert_base 190MB、rmvpe.pt 181MB(rmvpe.onnx 362MB)常驻显存合计不到 1GB统一在 16kHz 上工作这两个不是可选项,缺了整个流程跑不起来。注意新版 README 要的是 transformers 格式的 hubert_base/ 目录(config.json + pytorch_model.bin),不是老的 fairseq 单文件。

02 —

按你的场景选卡

RVC 的默认 batch size 就是显存 GB 除以 2,选卡这件事因此非常好算

  • 单个音色试训,10–30 分钟数据集,v2 40k

    RTX 3090 24GB$0.193/卡·时

    24GB 让 WebUI 的默认 batch 直接落在 12,fp16 走 6G 档配置(x_pad=3、x_query=10、x_center=60、x_max=65),是整个价目表里跑 RVC 性价比最高的起步卡。

  • 长数据集、48k 输出、要拉到 200 epoch

    RTX 4090 24GB$0.540/卡·时

    Ada 的 fp16 吞吐把 200 epoch 从过夜压到几小时,RMVPE 提 F0 那一步也快一大截,赶稿时多花的钱买的是当天能交。

  • 实时变声链路联调、CUDA Graph 加速验证

    RTX 5090 32GB$0.723/卡·时

    2.3.260718 的 CUDA Graph 预热与 run_cuda_graph 在新架构上收益最大,32GB 还够你一边跑 PyMSS 分离一边推理,不用在两个进程间抢显存。

  • 一口气训几十个音色、团队共用一台机器

    RTX A6000 48GB$0.817/卡·时

    48GB 对应默认 batch 24,或者同时开多个实验名并行训练互不抢显存;单卡节点最多可挂 14 张卡,整机显存上限 2,152GB。

03 —

在 NexGPU 上把 RVC 跑起来

Python 3.12 + torch 2.7.1,四步,主要时间花在下那 1.3GB 预训练权重上

  1. 01

    开实例,拉仓库,建 Python 3.12 虚拟环境

    选一个 PyTorch 预置镜像开机(2,000+ 预置镜像里有现成的),确认 Python 是 3.12 x64——这是官方唯一支持的版本,3.10/3.11 会在依赖解析上卡住。

    git clone https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI && cd Retrieval-based-Voice-Conversion-WebUI && python3.12 -m venv .venv && source .venv/bin/activate
  2. 02

    分两段装依赖:先 torch,再 requirments

    torch 和 torchaudio 故意没写进依赖文件,必须先单独装。50 系用 cu128,40 系及更早用 cu118。文件名就是 requirments 少一个 e,不要自己改。

    python -m pip install torch==2.7.1+cu128 torchaudio==2.7.1+cu128 --index-url https://download.pytorch.org/whl/cu128 && python -m pip install -r requirments_cu128_py312.txt
  3. 03

    下预训练资产到 assets/

    pretrained_v2 十二个文件合计约 1.3GB,加上 hubert_base 190MB 和 rmvpe.pt 181MB。如果只跑 40k,用 --include 过滤掉 32k/48k 能省一半下载时间。

    hf download lj1995/VoiceConversionWebUI --local-dir assets --include "hubert_base/*" "rmvpe/rmvpe.pt" "pretrained_v2/*"
  4. 04

    起 WebUI,用 SSH 隧道从本地浏览器打开

    webui.py 默认监听 7865,新版会自动找可用端口。别把 Gradio 直接公网暴露——依赖里锁的是 gradio 3.14.x,老版本的分享链接不适合放在开放网络上。用隧道把它留在本地。

    python webui.py   # 本地另开一个终端:ssh -L 7865:localhost:7865 root@<实例IP>

训一个音色到底多少钱

拿一个 30 分钟的干净人声数据集、v2 40k、200 epoch 来算。RTX 3090 24GB 是 $0.193/卡·时:装环境加下 1.3GB 权重按 0.4 小时估,preprocess 加 RMVPE 提 F0 加提特征按 0.3 小时估,训练按 2.5 小时估,最后训 faiss 索引加试推理挑 checkpoint 按 0.3 小时估——合计 3.5 卡时,3.5 × $0.193 = $0.68。换 RTX 4090 24GB $0.540/卡·时,训练段大概能压到 1.1 小时,总计约 1.9 卡时,1.9 × $0.540 = $1.03:快一倍多,只贵 $0.35。真正要小心的是存储:数据集加中间 wav 加各轮 checkpoint 很容易堆到 40GB,按 $0.414/GB·月 就是 40 × $0.414 = $16.56 一个月,而且计算停了存储照收,直到你销毁它。正确做法是训完把最终的 .pth 和 .index 拉走再销毁实例——两个文件加起来 250MB 量级,按 $0.0081/GB 出站算,0.25 × $0.0081 ≈ $0.002,两厘钱。

04 —

常见问题

RVC 需要多大显存?4GB 的卡能跑吗?

推理能跑:configs/config.py 里专门有一条 ≤4GB 的分支,会把 x_pad 压到 1、x_query 压到 5、x_center 压到 30、x_max 压到 32。训练就很勉强了,官方 FAQ 的原话是 4GB 及以下(3GB 的 1060、各种 2GB 卡)可以直接放弃。WebUI 的默认 batch size 公式是 max(1, 显存GB // 2),所以 24GB 卡默认给你 12,6GB 卡只给 3。与其在本地和 OOM 搏斗,不如在 NexGPU 上开一张 RTX 3090 24GB,$0.193/卡·时,按秒计费。

训一个音色需要多少数据?跑多少 epoch 才够?

官方建议 10 到 50 分钟;如果训练集精简、音色特征鲜明,5 到 10 分钟也 OK;1 到 2 分钟以下不建议,1 分钟以下官方说还没人成功过。epoch 看素质:底噪大的素材 20 到 30 轮就够了,再高只会让底模的音质被你的低质量数据拖下来;音质高、时长足的可以拉到 200。WebUI 默认 total_epoch 是 20、每 5 轮存一次盘。数据准备是你的活,跑得快慢是我们的活——3,090 到 A6000 随你挑。

RVC 还在更新吗?RVCv3 出了没?Applio 呢?

主仓库还在更新,2026 年发的 2.3.260718 是个实打实的大版本:PyMSS 换掉 UVR5、新增 FCPE 音高提取、实时链路上 CUDA Graph(官方在 4090D 上测到最高 4.7 倍加速)、训练与提特征支持中断续跑。RVCv3 只在 README 里提过要用更大参数和更大数据集重训底模,至今没有公开权重。社区分支 Applio 已经官宣不再频繁更新,只做安全补丁和依赖升级。所以今天要私有化部署,就认准主线仓库——在 NexGPU 上开机即用,2,000+ 预置镜像里 PyTorch 环境是现成的。

v1 还是 v2?40k、48k、32k 三个采样率怎么选?

选 v2,40k 是默认。v1 用的是 256 维 HuBERT 特征,只为兼容 2023 年那批老权重,两代的权重不能互换。48k 留给要交 48kHz 成片的场景,32k 留给素材本身音质就一般、或者显存紧张的时候。最重要的一条:训练中途绝对不要改采样率,官方 FAQ Q18 写得很清楚,要改就换一个新的实验名,否则会直接报 tensor 维度不匹配。想同时把三个采样率都试一遍?开三个实例并行跑,反正按秒计费,没有最低消费也没有开通费。

为什么我的 Tesla P40 / GTX 1660 跑 RVC 特别慢?

这不是玄学,是代码写死的。configs/config.py 里判断 sm_version == 6.1(也就是 Pascal 架构,Tesla P40 正是这一档)或者显卡名匹配 16\d{2} 且 sm 7.5(GTX 16 系)时,直接强制回落 fp32,半精度那份加速你根本拿不到。我们目录里确实有 $0.214/卡·时 的 Tesla P40,但跑 RVC 请绕开它,多花七分钱上 RTX 3090 24GB($0.193/卡·时,还更便宜),fp16 全程可用。

实时变声要什么配置?延迟能压到多少?

realtime_gui.py 的默认参数是 block time 0.25 秒、crossfade 0.05 秒、额外推理时长 2.5 秒,算法延迟按 block + crossfade + 0.01 算约 310 毫秒;README 说端到端已经做到 170 毫秒,配 ASIO 输入输出设备可以到 90 毫秒。要注意 RVCRealtimeVST 那个插件是 C++17 写的 VST2/VST3,只支持 Windows 10/11 x64,本地那台机器跑。云上该跑的是训练和批量推理:在 RTX 5090 32GB($0.723/卡·时)上把音色训好、把 CUDA Graph 路径验证过,再把 .pth 和 .index 拉回本地接进 DAW。有问题直接在 Telegram 上找我们,中英文都行,没有工单队列。

同类模型 · 声音克隆 / 声音转换

全部模型部署指南

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。