01 — 适用情况
什么时候需要自己跑转录
商业转录 API 按音频时长计费,处理零星文件很方便。但一旦你手上有几百小时的存量音频 —— 播客归档、会议录音、课程视频、客服通话 —— 按时长付费的账单会立刻变得难看,而这些任务恰恰是一次性的批处理,最适合租一台机器跑完就走。
另一个理由是数据敏感性。会议录音、医疗问诊、法律咨询、客服通话里往往包含不能外传的内容。自己跑转录,音频文件从头到尾只存在于你租用的这台机器上,销毁实例即彻底清除。
成本对比很直接:Whisper large-v3 在一张消费级 GPU 上转录 10 小时音频大约需要半小时,按 $0.193/小时的入门卡算,成本是几分钱量级。同样的量走商业 API 通常是两位数美元。
02 — 典型负载
常见的转录任务
共同点是量大、一次性、内容敏感。
存量音视频归档转写
播客、课程、访谈、直播回放 —— 几百小时的存量内容一次性转成文本,为检索、摘要或二次创作打底。
会议记录与纪要
配合说话人分离(diarization),把多人会议录音转成带发言人标记的文本,再接一个大模型自动生成纪要。整条链路都在同一台机器上完成。
字幕生成与时间轴对齐
WhisperX 提供词级时间戳,生成的字幕对齐精度远好过原版 Whisper 的句级时间戳,可直接产出可用的 SRT/VTT。
语音数据集清洗
为训练 TTS 或语音模型准备数据时,需要把大量音频转成文本并筛选质量。这类任务量大且重复,GPU 批量处理是唯一现实的做法。
03 — 软件栈
预置好的语音工具链
三种实现覆盖不同的精度与速度取舍。
faster-whisper — 速度优先
基于 CTranslate2 重实现,同等精度下比原版 Whisper 快数倍且更省显存。批量转录的默认选择。
faster-whisper · CTranslate2 · 低显存
WhisperX — 精度与对齐
在 Whisper 之上加了强制对齐与说话人分离,产出词级时间戳。做字幕和会议纪要时它是正确答案。
WhisperX · 词级时间戳 · 说话人分离
原版 Whisper 与后处理
OpenAI 官方实现,作为精度基线参考。配合大模型做转录后的纠错、标点恢复与摘要,可在同一实例内串起完整流程。
Whisper · 标点恢复 · 摘要
04 — 选卡
转录任务怎么选卡
Whisper 的显存需求不高,所以这是最能体现廉价卡价值的场景之一 —— 别为转录去租 H100。
| 任务规模 | 建议显存 | 当前最便宜可选 | 说明 |
|---|---|---|---|
| small / medium 模型转录 | 6GB | GTX 1660 S$0.083/小时 | 日常清晰录音够用,速度极快。入门卡即可,成本几乎可以忽略。 |
| large-v3 单路转录 | 10GB | RTX 3060$0.100/小时 | 最高精度的标准配置,嘈杂环境与多语种混说时明显更稳。 |
| large-v3 + 说话人分离 | 16GB | RTX 4060 Ti$0.126/小时 | WhisperX 的对齐与分离模型需要额外显存,会议场景建议留到这一档。 |
| 多路并行批量处理 | 24GB | Tesla V100$0.188/小时 | 几百小时存量音频时开多进程并行,显存越大能并的路数越多。 |
「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。
05 — 上手
转一批音频
01
先把音频放到能拉取的地方
对象存储或任意公网可访问的位置。在实例内拉取走的是宿主机带宽,比从本地上传快得多 —— 几百个文件时这个差别很关键。
02
选一张便宜卡
转录不吃显存,入门级卡就能跑满。按上表选档位,磁盘留够放音频与输出文本。
03
批量跑完就销毁
写个循环把整批音频跑完,把文本结果下载走,销毁实例。整个任务通常在一两小时内结束。
06 — FAQ
