跳到主要内容

音频转文字

十小时录音,半小时转完

Whisper 在 CPU 上跑一小时音频要几十分钟,在 GPU 上是几十秒。转录这件事的瓶颈从来不是模型,是你有没有一张卡。

转录任务每小时起
$0.193
音频约需 30 分钟
10h
支持语种数
99+

01 — 适用情况

什么时候需要自己跑转录

商业转录 API 按音频时长计费,处理零星文件很方便。但一旦你手上有几百小时的存量音频 —— 播客归档、会议录音、课程视频、客服通话 —— 按时长付费的账单会立刻变得难看,而这些任务恰恰是一次性的批处理,最适合租一台机器跑完就走。

另一个理由是数据敏感性。会议录音、医疗问诊、法律咨询、客服通话里往往包含不能外传的内容。自己跑转录,音频文件从头到尾只存在于你租用的这台机器上,销毁实例即彻底清除。

成本对比很直接:Whisper large-v3 在一张消费级 GPU 上转录 10 小时音频大约需要半小时,按 $0.193/小时的入门卡算,成本是几分钱量级。同样的量走商业 API 通常是两位数美元。

02 — 典型负载

常见的转录任务

共同点是量大、一次性、内容敏感。

  • 存量音视频归档转写

    播客、课程、访谈、直播回放 —— 几百小时的存量内容一次性转成文本,为检索、摘要或二次创作打底。

  • 会议记录与纪要

    配合说话人分离(diarization),把多人会议录音转成带发言人标记的文本,再接一个大模型自动生成纪要。整条链路都在同一台机器上完成。

  • 字幕生成与时间轴对齐

    WhisperX 提供词级时间戳,生成的字幕对齐精度远好过原版 Whisper 的句级时间戳,可直接产出可用的 SRT/VTT。

  • 语音数据集清洗

    为训练 TTS 或语音模型准备数据时,需要把大量音频转成文本并筛选质量。这类任务量大且重复,GPU 批量处理是唯一现实的做法。

03 — 软件栈

预置好的语音工具链

三种实现覆盖不同的精度与速度取舍。

  • faster-whisper — 速度优先

    基于 CTranslate2 重实现,同等精度下比原版 Whisper 快数倍且更省显存。批量转录的默认选择。

    faster-whisper · CTranslate2 · 低显存

  • WhisperX — 精度与对齐

    在 Whisper 之上加了强制对齐与说话人分离,产出词级时间戳。做字幕和会议纪要时它是正确答案。

    WhisperX · 词级时间戳 · 说话人分离

  • 原版 Whisper 与后处理

    OpenAI 官方实现,作为精度基线参考。配合大模型做转录后的纠错、标点恢复与摘要,可在同一实例内串起完整流程。

    Whisper · 标点恢复 · 摘要

04 — 选卡

转录任务怎么选卡

Whisper 的显存需求不高,所以这是最能体现廉价卡价值的场景之一 —— 别为转录去租 H100。

任务规模建议显存当前最便宜可选说明
small / medium 模型转录6GBGTX 1660 S$0.083/小时日常清晰录音够用,速度极快。入门卡即可,成本几乎可以忽略。
large-v3 单路转录10GBRTX 3060$0.100/小时最高精度的标准配置,嘈杂环境与多语种混说时明显更稳。
large-v3 + 说话人分离16GBRTX 4060 Ti$0.126/小时WhisperX 的对齐与分离模型需要额外显存,会议场景建议留到这一档。
多路并行批量处理24GBTesla V100$0.188/小时几百小时存量音频时开多进程并行,显存越大能并的路数越多。

「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。

05 — 上手

转一批音频

  • 01

    先把音频放到能拉取的地方

    对象存储或任意公网可访问的位置。在实例内拉取走的是宿主机带宽,比从本地上传快得多 —— 几百个文件时这个差别很关键。

  • 02

    选一张便宜卡

    转录不吃显存,入门级卡就能跑满。按上表选档位,磁盘留够放音频与输出文本。

  • 03

    批量跑完就销毁

    写个循环把整批音频跑完,把文本结果下载走,销毁实例。整个任务通常在一两小时内结束。

06 — FAQ

关于语音转文字

转录 10 小时音频要多少钱?

用 faster-whisper 跑 large-v3,一张消费级卡大约需要 30 分钟。按入门卡 $0.193/小时算,成本不到一毛美元;即使用 RTX 4090 也只要 $0.540 的一半左右。这个量级下真正的成本是你整理音频的时间。

中文识别准确率怎么样?

Whisper large-v3 的中文表现相当好,普通话清晰录音的准确率很高。方言、专业术语和嘈杂环境会明显下降 —— 这类场景建议配合大模型做转录后纠错,效果提升明显,而且两步可以在同一台实例上串起来跑。

能区分不同说话人吗?

可以,用 WhisperX 的说话人分离功能。它会给每段文本标注说话人编号,会议纪要和访谈整理最需要这个。注意分离模型会额外占用显存,建议按上表选 16GB 以上。

支持哪些音频格式?

镜像内含 ffmpeg,常见格式都能处理 —— mp3、wav、m4a、flac,以及直接从 mp4 视频里抽音轨。不需要提前转换格式。

转录结果能直接生成字幕吗?

可以。WhisperX 输出词级时间戳,可直接导出 SRT 或 VTT,对齐精度足以直接用。原版 Whisper 只有句级时间戳,做字幕时会有可感知的偏移。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。