做有声剧,ElevenLabs 的替代品怎么选(以及什么时候别换)
ElevenLabs 把单一音色的合成做到了很高的水准,但它从来不是为「给一场戏分配角色」设计的。这里诚实地比较一遍多角色有声剧创作者可选的路。
如果你在做有声剧,大概率试过 ElevenLabs,也大概率撞上了所有人都会撞上的那面墙:音色质量确实出色,可一旦剧本里同时站着四个人,工具就不再帮你了。
这不是在挑产品的毛病。ElevenLabs 是一个语音合成平台,这件事它做得比大多数同类都好。但「给一场戏分配配音阵容」「逐句抠情绪」「让同一个角色在十二集里听起来还是同一个人」「导出分轨」是另一组问题,而一个围绕文本框加音色下拉框搭起来的界面,本来就不打算解决它们。
下面把可选的路径老实梳理一遍——包括那些结论是「你就待在原地别动」的情况。
先弄清到底是哪一环卡住了
嘴上说「我需要一个 ElevenLabs 的替代品」,背后至少有五种完全不同的原因,而选什么取决于你属于哪一种。
- 成本。 你的音频产量很大,按字符计费已经成了预算里最大的一项。
- 多角色流程。 你在给每个角色单独跑一遍工具,把片段一个个下载下来,再手动在剪辑软件里拼成一场戏。
- 一致性。 常驻角色在不同批次之间会跑偏,因为参数是凭记忆重新选的。
- 控制力。 某一句你需要一个特定的情绪读法,而自动理解出来的语气给不了你。
- 授权或政策。 你的用法撞上了某条你无法接受的条款。
其中只有第二和第三是结构性的。其余三种通常靠换套餐、调参数或者把条款读细一点就能解决,换工具并不会帮上忙。
替代品分成几类
别的单音色合成平台
PlayHT、Murf、Speechify、Fish Audio、Cartesia 以及一堆同类,占的基本是同一块地:粘贴文本、挑一个音色、下载音频。它们在价格、语种覆盖、长篇朗读的自然度上确实有实打实的差别,但在架构上没有差别。如果你的问题是「在手动拼戏」,在这几家之间来回搬家属于平移。
真正值得一家家试的场景是成本和语种。按字符的单价能差好几倍,英语之外的覆盖度差得更厉害。如果你做的是巴西葡萄牙语或者韩语,可选范围会迅速收窄,赢家是「在你这门语言里真有可用音色的那一家」,而不是「英语 demo 最惊艳的那一家」。
自己跑的开源模型
XTTS、F5-TTS、Kokoro 以及它们的后继者,在一块消费级显卡上就能跑起来。跟商业服务之间的质量差距已经明显收窄;而对于一个要出很多小时音频的项目,成本差别一点也不含糊:你付的是电费,不是订阅费。
代价是你的时间。装环境要搭掉一个周末,之后得自己维护,任何近似「分配角色」的能力都得自己搭一条流水线。对一个技术上很自如、又要做长篇连载的人来说,这是理性的选择。对一个「这个月就想把有声剧做出来」的人来说,这是一个会把原项目吃掉的新项目。
多角色制作工具
这一类才是冲着真正的问题来的:你拿一份有好几个说话人的剧本进来,工具分辨出谁是谁,为每个角色分配音色,让你逐句去导,最后导出可以拿去混的素材。CastDub 属于这一类;另外有少数面向播客和对白制作的新工具,以各自的方式也在这一类里。
在这一类里要比的不是音色质量——它们底层用的合成能力大体相当——而是它的制作模型跟你实际的干活方式合不合:角色能不能跨项目留存,能不能只重出一句话而不必重跑整场戏,导出的是分轨还是只有一个成片。
真正能把它们区分开的几个问题
别看宣传片。这些工具在一句精挑细选的话上全都好听。改问下面这些。
能不能只重出一句? 这一条决定长篇项目是否可能。如果改一个词就意味着重新生成加重新拼接,你会渐渐不再修改,而作品会因此变差。
角色能不能留存? 一个音色,加语速,加一组读音修正,以某个名字存下来,下一个项目直接调用。没有这一层,一致性就只能靠人脑记忆;而在一个跨半年的项目里,人脑记忆是会输的。
有没有分轨? 一条已经混在一起的对白轨没法好好配乐。只要你打算加音乐、音效或者做任何空间摆位,按角色分开的音频文件就不是加分项,而是前提。
情绪怎么控制? 自动的情绪理解足够用来确认「这场戏立得住」,但不足以处理那一句角色绷不住了的台词。要看它有没有逐句控制,也要看这个能力在不在你付得起的那档套餐里。
读音这条线怎么解决? 任何带自造名词的项目都需要「一次修正、全项目生效」的读音规则。那种每次生成都得重新纠一遍读音的工具,会实实在在吃掉你好几个小时。
什么时候该继续留在 ElevenLabs
说真的,有好几种情况都该留下。
如果你做的是单人旁白类内容——有声书、纪录片配音、一个人的播客——那套多角色机制对你一点用都没有,你是在为用不上的功能付复杂度。
如果给自己的声音做声音克隆是你流程里的核心,大平台的克隆实现成熟、文档完备,这份成熟本身是值钱的。
如果你需要的语种别家都覆盖得不好,覆盖度胜过流程。一门语言里只有两个音色的完美流水线,不如一门语言里有真正配音阵容的笨拙流水线。
还有一种:你已经搭好了一条能跑的流水线——剧本在表格里,拼接环节写了脚本,混音有模板。这时候迁移成本比看起来高得多。一个你熟悉的流程,胜过一个你不熟悉的更好流程。
什么时候该换
当你开始经常做下面这些事的时候,就该换了:
- 为了一场戏把同一个工具跑四遍,然后手动把片段拼起来。
- 专门维护一份文档,记着哪套音色参数属于哪个角色。
- 因为「重出一场戏太烦」而决定不改那句台词。
- 在做一部连载,跨集一致性很重要,而保证它的只有你的注意力。
这几件事每一件都是结构性问题,而没有一件是靠更好的音色质量能修掉的。
关于「这篇是谁写的」,说句老实话
CastDub 本身就是一个多角色制作工具,所以我们明显希望你得出「你需要一个这样的工具」的结论。由此有两件事,我们宁愿直说,而不是让你自己猜。
第一,我们刻意没有做那种打勾打叉的对比表格。那种表格永远是照着「发布方赢」的结构搭出来的,你应该对见到的每一张都保持怀疑——包括我们可能也会手痒去做的那一张。
第二,诚实的结论范围很窄:如果你的活儿是单音色的,那些成熟平台很优秀,我们不是更好的选择;如果你的活儿是多角色、并且你正在手动拼戏,那正是我们存在的目的,值得你花一个晚上的半小时来验证我们是不是真的把它拿掉了。
真正能下结论的不是听 demo。挑一场你已经用笨办法做完的戏,在你正在考察的工具里重做一遍,然后比时间。如果没有快出一个量级,那这个工具就不适合你——音色再好听也一样。
听一段示例场景
两个角色的一段对话加一个旁白,用三把不同的音色渲染。公开试听音频制作期间,此处为占位音频。