KDZNR网

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 16|回复: 0

最佳 AI 转录模型横评:一档播客实测 16 个模型

[复制链接]
匿名
匿名  发表于 昨天 17:51 |阅读模式
每个模型都顺利拿下了干净的录音片段。可随后,两份云端托管的 Whisper 副本却悄悄整句整句地漏掉了对话内容。

我们拿一期真实播客的五分钟音频,同时发给 16 个云端转录模型和一台笔记本。在照稿朗读的开场白部分——437 个词、对着一支好麦克风念出来——17 次运行里有 13 次只犯了零到一个错。整个实验只花了 21 美分。如果你的录音听起来就像那段开场白,本页里几乎任何模型都够用,最便宜的一档约合一美分一小时。



可大多数录音并不是那样。它们是访谈、讲座和会议,两个人抢话、半句话从头再来,还有没人把拼写念出来的人名。正是在这里,模型们拉开了差距,而且拉开的顺序并不总是价目表暗示的那样。多年来,“该用什么转录”的标准答案一直是 Whisper。本文要说明为什么这个答案不再理所当然、该转而检查哪些地方,以及哪种模型适合哪类活儿。

干净语音上,当今每个模型都近乎完美

转录的标准评分指标是词错率,即 WER。把机器写错、漏掉或凭空添出的词数出来,再除以实际说出的词数。词错率 5% 意味着每二十个词里有一个错。低于 5% 的稿子读起来就是一份带着几处错别字的成品。

我们的测试音频选自 NASA 公共播客节目《Houston We Have a Podcast》第 425 期,选它是因为 NASA 的素材属于公有领域,而且该机构公布了完整文字稿可供对照打分。第一个片段是主持人照稿念的开场白:138 秒、单人、录音室音质,但密集埋着容易绊住转录器的东西——一个期号、“330 立方英尺”、一个缩写 SCaN,还有一位嘉宾的名字。

17 次运行里有 6 次在所有无争议的词上都与公布的文字稿完全吻合。另有 7 次恰好只错一个。最差的成绩是 437 个词错 6 个,词错率 1.4%。多数错误是同音词:有 4 个模型把“瞥见”听写成了“山峰”,两个 6 亿参数的小模型把“月面”听成了“学习者表面”。每一次运行都把嘉宾名字和那个缩写写对了。

同一段五分钟音频,17 个转录器的表现如下(列依次为:模型|开场白错误数/共437词|对话片段表现|往返耗时|每小时计费):

MAI-Transcribe 2|0 处|逐字保留,含 48 个“嗯/呃”|6.0 秒|$0.10
Whisper Large V3(托管)|0 处|漏掉两段共 23 词|6.9 秒|$0.06
GPT-4o Transcribe|0 处|干净、完整|18.0 秒|$0.22
GPT Transcribe|0 处|干净、完整|15.2 秒|$0.27
Voxtral Small 24B|0 处|干净、完整|25.7 秒|$0.18
Whisper Turbo(本地 whisper.cpp)|0 处|干净、完整|10.8 秒|$0.00
Qwen3 ASR 1.7B|1 处|干净、完整|6.9 秒|$0.03
Voxtral Mini Transcribe|1 处|干净、完整|7.9 秒|$0.18
Grok STT 1.0|1 处|干净、完整|11.9 秒|$0.10
GPT-4o Mini Transcribe|1 处|干净、完整|11.6 秒|$0.11
Fish Audio Transcribe 1|1 处|干净、完整|12.3 秒|$0.36
Deepgram Nova-3|1 处|完整,但数字被拼写为单词|5.5 秒|$0.26
Whisper Large V3 Turbo(托管)|1 处|漏掉三段共 18 词|7.8 秒|$0.01
Qwen3 ASR Flash|2 处|干净、完整|24.4 秒|$0.13
Whisper-1|2 处|在片尾音乐上凭空加了句“谢谢”|19.1 秒|$0.36
Nemotron 3.5 ASR Streaming 0.6B|4 处|把 Toledo 写成了“Toule, Ohio”|12.8 秒|$0.01
Parakeet TDT 0.6B v3|6 处|逐字保留,含 51 个“嗯/呃”|5.2 秒|$0.09

这两个片段都取自 NASA 那期播客:一段 138 秒的照稿开场白,和一段 164 秒的双人对话。错误数在转小写、去标点后对照 NASA 公布的文字稿统计。其中两个词模型之间、以及模型与 NASA 文稿之间有分歧(比如“his 还是 its”“help 还是 helped”),按争议项剔除;拼写出来的数字不算错。往返耗时指从一台办公桌前上传加处理两段音频的总时间,并非速度基准。每小时计费是按 OpenRouter 实际收费放大到 60 分钟得出的。

关于我们自己的评分要提醒一句:有一个词,16 个云端模型里有 13 个彼此一致、却和 NASA 网页不一致;另一个词则几乎对半分。公布的文字稿本身也有错,所以这两个词我们都放一边不数。像这样的小测试,除了小数点后第一位,排不出更细的名次。它能展示的是整个领域的形状:在干净语音上,免费模型和 36 美分档模型之间的差距,不过是一两个同音词。

对话,才是文字稿丢句子的地方

第二个片段是主持人和嘉宾交谈的 164 秒。里面有打断、有嘉宾把句子从头重说一遍,还有一个容易听错的地名(俄亥俄州 Toledo)。NASA 对这一段的文字稿本身就有明显错误,所以我们不算词错率,而是专门核对几样东西:人名、地名,以及每一句说出口的话是否都落到了页面上。

17 次运行里有 16 次都写了 Toledo。一个小型流式模型写成了“Toule, Ohio”。更大的失败则安静得多:托管版 Whisper Large V3 Turbo 漏掉了三段、共 18 个词,其中整整漏掉了“他妻子是医生,但他选择去市内学校工作”这一个分句;完整的托管版 Whisper Large V3 漏掉了另外两段、共 23 个词。输出里没有任何地方标记出这段空缺。前一句直接接后一句,读稿的人根本察觉不到。

这种错比拼错一个词严重得多,因为没人会去校对“根本不存在的句子”。Whisper 还有一个更广为人知的毛病:在静音或音乐上凭空添字。在我们的开场白片段里,OpenAI 托管的 Whisper-1 在稿尾添了一句谁也没说的“谢谢”,Turbo 版则多挂了一个“音乐”。一项由 Allison Koenecke 领衔的研究发现,大约 1% 的 Whisper 转写会包含一整句凭空捏造的短语或句子,多出现在长停顿附近。更新的模型有一部分就是为修复这个毛病而生的;在我们的运行里,非 Whisper 的模型没有一个凭空添句或漏句。

另一处分歧是风格。微软的 MAI-Transcribe 2 和英伟达的 Parakeet 把每个犹豫都留了下来:不到三分钟里分别保留了 48 个和 51 个“嗯/呃”。其余所有模型都把它们清掉了。两者都不算错。给访谈编码的研究者、审阅证词的律师要逐字稿;写节目简介的播客主想要干净稿。在把一大堆积压录音交给某个模型之前,先看清它给你的是哪一种。微软自家的 API 暴露了“逐字”和“干净”两档之间的开关;但通过路由调用时,你拿到的是默认档。



排行榜一致认为:Whisper 已不再是第一

五分钟音频只是抽查。要排名,得用公开基准——它们测试跨口音、跨录音条件的数小时语音。三方给出的故事是同一个。

Artificial Analysis 把商业 API 在电话语音、议会演讲和财报电话会议的混合集上打分。我们查看时,前五名的词错率落在 1.7% 到 2.3% 之间,其中 MAI-Transcribe 2 为 2.0%,ElevenLabs Scribe v2 为 2.2%。Whisper Large V3 是 4.1%:仍是一份能用的稿子,但错误率大约是头部的两倍。

在开放模型里,Hugging Face 的 Open ASR 排行榜是参照系。英伟达的 Canary-Qwen 2.5B 在那里报出平均词错率 5.63%,Parakeet TDT 0.6B v3 为 6.34%,而 Whisper Large V3 Turbo 的模型卡上是 7.83%。这些数字来自比 Artificial Analysis 更难的测试集,所以只能在同一张排行榜内部比较,绝不能跨两张榜比。

OpenAI 自己也已经走过 Whisper。它的定价页如今列出了 GPT Transcribe——一个更新的模型,能同时接受上下文、关键词提示和多种语言提示,价格还比 Whisper-1 更低。Parakeet 在我们这个小测试里排名靠后、在排行榜上分数却很强,这恰好提醒了一次抽查的分量。它是个 6 亿参数的模型,而它犯的错恰恰集中在两个短语上。

一小时音频,从一美分到 36 美分

转录是少数几种按人人都懂的单位计价的 AI 活儿:音频小时数。价差很大,而且和质量并不挂钩。下表里最贵的一行,恰恰是上面最老的模型 Whisper-1。

一小时以及 100 小时积压录音的花费(列依次为:厂商|模型|1 小时|100 小时|备注):

OpenAI|Whisper-1、GPT-4o Transcribe|$0.36|$36.00|每分钟 $0.006;带说话人分离的 GPT-4o 档同价
OpenAI|GPT Transcribe|$0.27|$27.00|每分钟 $0.0045;GPT-4o Mini Transcribe 为 $0.18/小时
Deepgram|Nova-3(预录)|$0.26|$25.80|按量付费每分钟 $0.0043;送 $200 额度
ElevenLabs|Scribe v2|$0.22|$22.00|含说话人标签和词级时间戳
AssemblyAI|Universal-3.5 Pro|$0.21|$21.00|说话人标签另加 $0.02/小时;送 $50 额度
Microsoft|MAI-Transcribe 2|$0.10|$10.00|限时优惠价,之后是否调价未定
开放权重(托管)|Whisper Large V3 Turbo|$0.01|$1.20|即我们测试中经 OpenRouter 的实际计费
开放权重(本地)|Whisper Large V3 Turbo|$0.00|$0.00|下载 547 MB,外加你自己的电费

这些是从各家定价页读出的预录文件标价。各家的实时流式档都更贵。

两个细节值得注意。微软每小时 0.10 美元是限时优惠价,公司尚未公布之后的价格。而托管 Whisper Turbo 那一美分的费率,是 OpenRouter 转录目录实际向我们收的钱,并不是承诺:同一个模型名,路由可能把它发到不同的 GPU 主机、按不同费率计费。我们那两次 Whisper Large V3 调用,计费费率相差四倍。

对一个攒了一鞋盒录音的人来说,老实的结论是:价格几乎无所谓。100 小时积压——大约相当于一档每周一小时节目攒两年——在表顶端要花 36 美元,在领跑基准的那些模型上是 10 到 27 美元。到了产品规模、每月几千小时,价格才开始重要。

说话人标签和时间戳,比准确率更决定成败

当每个模型都能写对 98% 的词时,决定性问题就变成了:除了词本身,它还带回了什么。三样附加信息最重要。

说话人标签。学名叫说话人分离,用来标注谁说了哪句。对访谈来说,它是“一份文字稿”和“一堵文字墙”的区别。Scribe v2 免费标注多达 32 个说话人。AssemblyAI 为此每小时加收 0.02 美元。OpenAI 把它做成单独的模型 GPT-4o Transcribe Diarize 出售,MAI-Transcribe 2 在发布时就带上了。开放权重的 Whisper 内置没有这一项。我们测试里一个实际的提醒:16 个模型里没有一个经路由端点返回说话人标签。如果你需要它,就直接调用厂商自家的 API。

时间戳。做字幕和可搜索音频,需要知道每个词是几点几秒说的。Scribe v2、MAI-Transcribe 2 和 Parakeet 返回词级时间。Whisper 的标准输出按段打时间。OpenAI 的 GPT Transcribe 文档里压根没提时间戳,所以在 OpenAI 上做字幕流水线,仍要走 Whisper-1。

语言。Whisper 的覆盖面仍然最广,模型卡上列了 99 种语言。Scribe v2 覆盖 90 多种,MAI-Transcribe 2 覆盖 60 种。Parakeet v3 处理 25 种欧洲语言;而开放模型里的准确率冠军 Canary-Qwen 只做英语,且输入限 40 秒。在英语和主要欧洲语之外,别信任何排行榜,先拿你自己的音频试。长度限制也各不相同:Scribe 接受最大 3 GB、最长 10 小时的文件,省得你把长录音一刀刀切开。

一台笔记本约两分钟转写完一小时音频

Whisper 也许丢了准确率王冠,但它仍是那个你能下载下来的模型。权重采用 MIT 协议,whisper.cpp 能在 Mac、Windows 或 Linux 机器上跑它,不需要 Python、不需要账号。我们把 Turbo 模型压成 547 MB 的文件,在同样两个片段上跑。

在终端里依次执行四条命令(无需账号、无需上传):

brew install whisper-cpp ffmpeg

curl -L -o turbo.bin https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-turbo-q5_0.bin

ffmpeg -i interview.mp3 -ar 16000 -ac 1 -c:a pcm_s16le interview.wav

whisper-cli -m turbo.bin -f interview.wav -otxt -osrt

在一台 M3 Max、36 GB 内存的 MacBook Pro 上、whisper.cpp 1.9.4 实测,164 秒的对话片段 5.8 秒跑完,约为实时的 28 倍。最后那条命令会在音频旁边写好一个纯文本文件和一个 srt 字幕文件。

本地运行与 NASA 开场白的文字稿逐字吻合,而且把托管副本漏掉的那些段落全都保留了下来。我们看不到主机内部,所以说不清原因在哪。但教训是一样的:“Whisper”不是一个产品。同一套权重,由谁来跑、怎么切分你的音频,表现都不一样。

按 28 倍实时算,一小时访谈在那台笔记本上只要两分多钟。Whisper 仓库里说原始 Turbo 版本约需 6 GB 内存;whisper.cpp 说那个 466 MB 的 small 模型不到 1 GB,几乎任何电脑都装得下。有 NVIDIA 显卡的人还有第二个选择 Parakeet v3,它在 CC BY 4.0 下可免费商用,只需 2 GB 内存,还返回词级时间戳。

支持本地最强的理由不是省下的那一美分。而是录音根本不离开这台机器。记者的信源、一次治疗会话、一通客户电话、一场家庭争吵,都不适合上传。CSuite 的音频工作区有一个转录模式就是基于这个思路:Whisper Base、Small 和 Large V3 Turbo 在设备端运行;同一屏里,当你想要说话人标签或云端模型的准确率时,也可以把文件发给 OpenAI、ElevenLabs 或 OpenRouter。

按活儿挑,然后专门检查难的部分

播客主和访谈者最需要说话人标签。Scribe v2 每小时 0.22 美元就含标签和词级时间戳。AssemblyAI 加上标签后合 0.23 美元。我们查看时 Scribe v2 在 Artificial Analysis 上排第四。如果下一步是做配音旁白,另一篇关于 AI 配音的指南讲的就是反方向。

记者、研究者和任何有敏感音频的人,应该从本地开始。whisper.cpp 跑的 Whisper Turbo 在我们的干净片段上无懈可击,在对话上也完整。说话人名字手动加上就行——对双人访谈来说也就几分钟的事。

攒了一堆讲座录音的学生,可以免费搭同一套本地环境,或者花约一美分一小时用托管的开放模型。讲座是单人对单麦克风,属于容易的那一档。

在做产品的开发者,应该拿自己的音频去测 MAI-Transcribe 2 和 GPT Transcribe,并为微软后续调价留出预算。

无论你选哪个,都别拿第一段干净的稿子来评判它。现在每个模型都能过这一关。挑出你手头最乱的那三分钟——有两个人抢话、有个没人拼出来的名字那段——对照音频读一遍输出。专门去找那句漏掉的话,因为那是任何拼写检查器永远发现不了的错。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|KDZNR网

GMT+8, 2026-9-26 22:26 , Processed in 0.057781 second(s), 20 queries .

Powered by Discuz! X3.4

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表