KDZNR网

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 39|回复: 0

最佳 AI 语音合成(文本转语音)音色横评

[复制链接]
匿名
匿名  发表于 昨天 17:31 |阅读模式
本帖最后由 匿名 于 2026-9-25 17:45 编辑



十二种音色朗读同一段 70 词的文稿,十种一字不差;而一小时语音的费用,从两美分到五美元不等。

我们写了一段 70 词的播客开场白(主题是天气预报),通过大多数人接触它们的三个平台——Runware、Replicate、OpenRouter——发给十一个文本转语音模型,再在一台断网的笔记本上跑一个免费开源模型。十二段输出听起来都像人在说话,其中十种逐字读对,整个实验只花了大约 19 美分。

这就是好消息,也正是挑声音变得让人困惑的原因。当每个 demo 都好听时,真正的决定因素就转到了 demo 里看不到的地方:读得有多快、一小时要花多少钱、能不能指挥它某一句怎么说、支持多少种语言、断网时能不能用。本文在同一段文稿上测量这五件事。我们不替你评判"自然度"——这里放了试听片段,自己按播放键排名吧。

十二种音色里十种逐字读对

脚本故意写得很普通:含一个年份、一个英文拼写出来的数字、一个问句、一个三项列举,还有一句加引号的话。这些小陷阱能区分"在朗读"和"在背诵"。我们用同一台笔记本上的 Whisper 把每段配音转写回文字,再和原脚本逐字比对。Whisper 不是完美裁判,它把"twenty-four"写成"24",还会在尾音静默里凭空加一句"Thank you",这两处不计入。

十段完全吻合。两处例外都是在 Replicate 上跑的开源模型:Chatterbox 读到引号那句之前就停了,本该说"Let's start with the satellites"的地方留下三秒静音;Qwen3-TTS 把"forecaster"读成了两个词,被 Whisper 听成了"fear caster"。两者再试一次都能修好,但本次测试的规矩是只试一次——因为一千行的脚本不会给你重抽的机会。

语速是你最先听出的差别

在注意到音色冷暖之前,你先注意到的是快慢。同一段 421 字符的文稿,十二次朗读从 23.3 秒到 32.5 秒,相差 40%,这是"听着像新闻播报"和"听着像睡前故事"的区别。

语速既影响心情也影响钱。所有平台都按输入字符或 token 计费,而不是按输出秒数计费,所以读得慢的声音,同样的账单能换到更多音频。一部十小时有声书,按每分钟 129 词约合 7.7 万词;按每分钟 181 词,同样十小时能装 10.9 万词。多数模型都暴露了 speed 参数,默认值只当参考——比如 Grok TTS 按官方文档支持 0.7 到 1.5 的倍率。

另一个时钟是往返耗时:你等文件回来要多久。它和语速无关,只和模型跑在哪有关。ElevenLabs Flash v2.5 用 2.4 秒就返回了 30 秒音频;Gemini 花了 17.8 秒,Qwen3-TTS 花了 26.5 秒。如果是过夜批量渲染一整本书,这些都无所谓;如果是有人在听、要边听边答的助手,这就是产品本身——也是本文里唯一一个你应该从自己所在地区重测的数字。

同一段 70 词、十二次朗读(音色|经由|听写|词/分|往返|每小时)

ElevenLabs v3|Replicate|逐字正确|138|8.7s|$4.97
GPT Audio|OpenRouter|逐字正确|138|6.3s|$4.79
MiniMax Speech 2.8 HD|Runware|逐字正确|129|9.6s|$4.66
ElevenLabs Flash v2.5|Replicate|逐字正确|139|2.4s|$2.51
Gemini 3.1 Flash TTS|Runware|逐字正确|134|17.8s|$1.81
Chatterbox|Replicate|末句前中断|152|20.2s|$1.37
Qwen3-TTS 1.7B|Replicate|forecaster 读成两词|142|26.5s|$1.02
Grok TTS|Runware|逐字正确|152|5.9s|$0.83
Fish Audio S2.1 Pro|Runware|逐字正确|131|7.0s|$0.71
GPT Audio Mini|OpenRouter|逐字正确,最快|181|4.4s|$0.23
Kokoro 82M 托管|Replicate|逐字正确|165|2.8s|$0.02
Kokoro 82M 本地|本机|逐字正确|168|8.9s|$0.00



一小时语音,从两美分到五美元

买家最想要、厂商最不愿印出来的数字,就是成品语音一小时的账单——因为每家计费单位都不一样。ElevenLabs、MiniMax、xAI、Fish Audio 按字符计费;OpenAI 和 Google 按音频 token 计费,Google 的价格页写明一秒音频约 25 个 token。所以我们用老实办法换算:拿每个平台为这段小样本实际收的钱,按该音色自己的语速放大到 60 分钟。

顶端是 ElevenLabs v3,按 Replicate 上每千字符 0.10 美元算,约合每小时 4.97 美元;GPT Audio 4.79 美元、MiniMax Speech 2.8 HD 4.66 美元紧随其后。中间档里,ElevenLabs Flash v2.5 正好是 v3 的一半,Gemini 3.1 Flash TTS 落在 1.81 美元,托管开源模型聚在一美元附近。

再往下是地板。Grok TTS 和 Fish Audio S2.1 Pro 标价都是每百万字符 15 美元,约合每小时 80 美分;GPT Audio Mini 按 OpenRouter 上每百万音频 token 2.40 美元,我们实测每小时 23 美分;Replicate 上托管的 Kokoro 只要两美分一小时,因为它只为共享 GPU 上 0.8 秒的时间计费。最贵和最便宜的全托管云声音之间相差 20 多倍,托管开源模型又比它低一个数量级,而到本地模型之间的差距,在算术意义上是无穷大。Premium 档的价格是由"人愿意付多少"决定的,不是由"跑起来花多少"决定的。

一个算术陷阱:ElevenLabs 卖订阅而不是卖字符。它的 22 美元 Creator 套餐含 12.1 万积分,v3 上一个积分一个字符,官方称约合 121 分钟语音——把积分用满约合每小时 11 美元,用不满更贵,所以小批量买同一个模型走 Replicate 更划算。如果你要对外出售成品,授权条款比价格更重要。

标签、指令和声音克隆,比预设音色更重要

预设音色是语音模型里最不重要的东西,因为如今每家都打包了几十上百个:MiniMax 在 Runware 上列了 193 个,Google 列了 30 个,xAI 列了 27 个。真正区分模型的,是你选定音色之后怎么"指挥"它读某一句,路子有三种。

第一种是行内标签:ElevenLabs v3 能读文本里的强调、叹气之类音频标签;Fish Audio 接受自由方括号提示,并支持一次请求多说话人标签;Gemini 的 schema 接受说话人名字标记来写对话。第二种是单独的指令:OpenAI 的 GPT-4o Mini TTS 除了脚本之外,还接受一段描述语气、口音、节奏的自由文本,Gemini 也以同样方式接受 style prompt。第三种是克隆:Fish Audio、MiniMax、Qwen3-TTS、Chatterbox 都能从一小段录音复刻音色,Qwen 官方称只要三秒。

各模型能力对照(模型|语言|控制方式|克隆|单次上限)

ElevenLabs v3|70+|音频标签加稳定性滑杆|支持|5,000 字符
GPT-4o Mini TTS|未公布|语气/口音/节奏自由文本指令|不支持|2,000 token
MiniMax Speech 2.8|40+|情绪预设、停顿标记、193 种音色|1.5 美元/个|50,000 字符
Gemini 3.1 Flash TTS|70+|白话 style prompt;对话标记|不支持|未公布
Grok TTS|20|0.7–1.5 倍速;行内停顿标签|不支持|60,000 字符
Fish Audio S2.1 Pro|83|自由方括号提示;多说话人标签|参考片段零样本|未公布
Qwen3-TTS(开源)|10|风格指令;文字描述设计音色|3 秒克隆|你的硬件
Chatterbox(开源)|23|夸张度与语速权重|短片段克隆|你的硬件
Kokoro 82M(开源)|8|仅调速;54 种预设音色|不支持|你的硬件

你需要哪种取决于活儿:朗读小说的旁白要标签,因为情绪一句一变;对客户说话的产品要指令,因为整个声音得一个调性;做自己频道配音的创作者要克隆——但录音前先看清克隆规则,克隆一个不属于你的声音是法律问题而不是技术问题。还有一列安静的关键数字:ElevenLabs v3 单次停在 5,000 字符,MiniMax 5 万,xAI 6 万,对一章内容来说,这决定了你的流水线要拼几刀。

语言数量从 8 到 83,但数量不等于质量

Fish Audio 说 83 种,ElevenLabs v3 说 70 种以上,Chatterbox Multilingual 列 23,xAI 列 20,Qwen3-TTS 列 10,Kokoro 只有 8。这些数字都对,却也是规格表里最没用的一行——就像一本短语手册不等于流利。一个模型列了印地语,可能读出来的口音让印地语母语者无法使用,而没有厂商公布过逐语言的质量分。

靠谱的测试就是我们这里做的:用你需要的语言,写一段带数字、带名字、带问句的话,发给三四个候选,让母语者评判。Fish Audio 和 xAI 把这件事做得很便宜,一段话不到一美分。另外两个细节比数量更重要:模型是否自动检测语言(xAI、MiniMax、Qwen 都接受 auto 设置),决定了混排多语言文本时的表现;语言列表里是否包含你要的具体口音(比如巴西葡语和葡萄牙葡语,xAI 是分开列的)。

一台笔记本九秒读完这段话,不要账号

本次测试里最便宜的声音是免费的,而且不是玩具。Kokoro 是个 8200 万参数、Apache 2.0 协议的模型,带 54 种预设音色。我们用 kokoro-js 包在 MacBook Pro 上跑,加载量化 ONNX 权重,纯 CPU、不碰 GPU,70 词脚本 8.9 秒生成完毕,约为实时的三倍快。Whisper 逐字转写无误,和 Replicate 上托管的同一模型版本长度相差不到半秒。首跑下载约 90MB 权重、加载 85 秒,之后每次加载 0.3 秒。

另外三个开源模型值得知道:阿里的 Qwen3-TTS 提供 0.6B 和 1.7B 版本,Apache 2.0,支持克隆和文字描述设计音色,本次测试里往返最慢(26.5 秒),但控制台上能力最强;Chatterbox 是 MIT 协议、5 亿参数,会给每个文件嵌一段听不见的水印,这对某些用途是特性、对另一些是约束;Supertonic 是个 6600 万参数的模型,作者在 M4 Pro CPU 上实测每秒 912 字符,也是 CSuite 应用内置做端侧语音的那个——因为它能在应用里零 key 直接跑。

取舍是:用控制力和覆盖面换隐私和价格。三个本地模型都不像 ElevenLabs 或 Fish 那样能用标签精细控制,本地语言列表也短。但永不离开本机的脚本,才是保密条款允许的那种;在火车上也能用的声音,才是断网时还能工作的那种。

按活儿挑,然后亲自听

如果声音本身就是产品(有声书、品牌节目),顶配值这个价:要逐句标签控制选 ElevenLabs v3;要一句话指令定整体调性选 GPT Audio 或 GPT-4o Mini TTS;要最大音色菜单和超长请求选 MiniMax。预算按成品语音每小时约 5 美元估,对外售卖前先读授权。

如果声音只是一个功能(读通知的 App、需要六种语言旁白的课程、要粗剪轨的视频),从地板开始:Fish Audio S2.1 Pro 和 Grok TTS 一小时不到一美元,能干净读完我们的脚本,对大多数句子的控制也够用;GPT Audio Mini 更便宜,前提是你受得了它的语速或者把它调慢。

如果文本是机密的、或者机器要离线、或者预算为零,就跑 Kokoro:它在笔记本 CPU 上九秒无错读完我们的脚本。无论你落在哪一档,在把项目交给某个声音之前,都照本文做一遍:一段带数字、问句和引语的话,只录一遍,用你自己的耳朵。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|KDZNR网

GMT+8, 2026-9-26 22:27 , Processed in 0.051690 second(s), 19 queries .

Powered by Discuz! X3.4

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表