流程

AI 有声剧生成器

有声剧是一群人演一个剧本。通用的文字转语音只给你一个演员,于是最难的那部分——挑人、导戏、让角色听起来互不混淆——还是你自己的活。这一页讲的,就是替你干这部分活的工具。

为什么这条路子在这儿行得通

角色分配自动完成

贴一场戏进来,CastDub 会认出谁在说话——「人名:」开头、标准剧本分栏、带对话标签的散文,你平时怎么写就怎么贴。系统会按你对角色的描述先推荐一个音色,你不同意的地方改掉,改完在整个项目里一直生效。

情绪挂在句子上,不是挂在角色上

戏就在角色语气转折的那一瞬间。情绪是句子的属性,所以一个角色可以平稳地讲八句,第九句崩掉。就这一个机制,决定了你做出来的是「过一遍台词」还是「一场表演」。

跨集也还是同一个人

角色卡里存着名字、人物设定、音色、默认情绪和读音修正。第十二集听起来和第一集一样,是因为卡片本来就是同一个对象,而不是因为有人记得几个月前选过什么。

导出格式贴合真实流程

想快速分享就拿混好的 MP3,要配乐做音效设计就拿按角色分轨的文件,要带字幕发布就顺手导一份 SRT。没有任何环节强迫你在一个工具里做完全部工作。

适合这类活儿的音色

Kestrel

Kestrel

低沉疲惫的女剑客,这场仗她已经输过一次

女声成年美式英语戏剧粗砺
Ashford

Ashford

天鹅绒嗓音的反派,毁掉你之前先道个歉

男声成年英式英语反派顺滑
Wren

Wren

睡前故事旁白,缓慢温暖,从不把人吵醒

女声成年美式英语旁白温暖
Cass

Cass

十七岁,正为此愤怒,是好的那种愤怒

女声少年美式英语少年现代
Torvald

Torvald

命令真能被执行的骑士团长

男声成年英式英语英气奇幻
Morrow

Morrow

地板下面那个学会了你名字的东西

中性成年美式英语恐怖耳语
Juno

Juno

边想边说、从不念稿的播客主持

女声青年美式英语播客口语
Bram

Bram

酒馆老板,顺手就成了任务发布人

男声老年英式英语桌游温暖

浏览整个音色库 →

具体怎么做

  1. 把剧本拿进来

    粘贴,或者上传文本文件。格式统一就行,不用先把剧本改成某个模板。

  2. 过一遍配音阵容

    自动分配会给每个角色推荐一个音色。把候选音色放在同一句台词上连着试听——这是唯一真能定下选角的对比方式。

  3. 给每个角色设默认值

    定好各自的基准情绪和语速。一场戏大部分都跑在默认值上,默认值对了,你只需要导那几个例外。

  4. 只导转折处

    标出真正有变化的那几句——那句告白、那句威胁、那个不像玩笑的玩笑。其余保持中性,这几句才有东西可以撞。

  5. 整场渲染,连着听完

    一口气听完整场戏,别停。有声剧的问题几乎都是节奏问题,而节奏是逐句听不出来的。

  6. 按需要的形态导出

    成片、分轨,或者分轨加字幕。如果打算加配乐和音效,一定拿分轨——已经混成一条的对白轨极难往下铺音乐。

有声剧为什么正在起势

有声虚构内容已经稳步增长了十年,背后是推动播客增长的那几件事:通勤、家务,以及音频是唯一能一边干别的一边消费的媒介。最近变的是制作成本。一部剧需要好几个演员,好几个演员就意味着约时间、租棚、找制作人,这把这个形式挡在了最想做它的那群人之外。

结果这个门类要么被有钱的正规制作占据,要么被一个人包下所有角色的独播主占据。可这两样都不是有声剧。这个形式的全部魅力就在于听到人和人之间的一场戏,一个人捏着嗓子演四个角色,听众是在忍,不是在享受。

AI 生成的表演改变的是经济账,不是手艺。选角、导戏、节奏、写作都还重要——甚至更重要了,因为现在只剩这些东西把好作品和坏作品分开。

决定一部剧成不成的四个选择

第一,为「分得开」而选角。听众完全没有视觉信息,主要靠音高区间和语速区分说话人。两个角色落在同一个音区,纸面上性格差得再远,听起来也会糊成一片。有意识地把阵容拉开,一场戏立刻清楚了。

第二,导戏要克制。人的本能是给每句话都标个情绪,结果是一团均匀的浆糊。两句有情绪、二十句中性的戏,比处处都拉满的戏动人得多。

第三,节奏。音频没有「跳读」这回事。纸上读起来很快的一场戏,念出来可能四分钟,而听众每一秒都感觉得到。解决办法几乎永远是删,不是加速。

第四,静默。句与句之间的空隙,是听众自己完成理解的地方。广播剧导演大部分时间花在空隙上,而这也是独立创作者手里最被浪费的一件工具。

一套改得起的工作流

人们放弃有声剧项目,基本不是因为第一次渲染,而是第二十次改稿——改一句台词就要手工重新拼一整集。任何让「改」变贵的流程,最后都会被自己压垮。

撑得住的结构是:一集一个项目;每个常驻角色一张角色卡;按场渲染而不是按集渲染;剧本永远是唯一的事实来源。改一句台词,重渲那一场,把文件换回成片里,别的什么都不动。

由此推出一条:剧本没锁死之前别做混音。给一场听起来不错的戏加配乐非常有诱惑力,改稿之后重做则非常痛苦。先把表演做对,再一次性配乐。

它不做什么

它不替你写剧本。这里刻意没有故事生成——有声剧里有意思的难题是制作,不是点子,而「AI 写的剧本由 AI 的声音演出来」这种产品,没人会想要第二次。

它不做混音。没有音乐床,没有混响,没有空间定位。这些属于音频编辑器,你在那里能把所有东西放在一起听;每一次试图把它们塞进渲染工具的尝试,结果都比分开做更差。

它也不在一次渲染里处理对白重叠。人说话打断彼此是真实有效的戏剧手段,但它是一个混音动作:导出分轨,把它们错开一点。任何编辑器里这都是一次拖拽,也是你能对一场吵架戏做的最真实的处理。

要花多少钱

Free

$0 / 月

够你做完一场短戏,听听自己的剧本配上音色是什么样。

  • 每月 10,000 字符——额度每月重置,不是一次性试用
  • 每个项目 2 个角色
  • 5 分钟成片
  • 导出带一段很短的 CastDub 水印
免费开始

Studio

$29 / 月

给连载类的活儿:长篇有声剧、有声书、配音流水线。

  • 每个项目角色数不限
  • 每月 200 分钟成片
  • 逐句情绪控制
  • 多轨与分轨导出(每个角色一条 WAV)
  • 3 个声音克隆槽位
选择此套餐

Team

$69 / 月

给编剧、导演和剪辑一起碰同一个项目的工作室。

  • 5 个席位,项目与角色卡共享
  • 每月 500 分钟成片
  • 10 个声音克隆槽位
  • 优先渲染队列
选择此套餐

完整对比 →

常见问题

有声剧到底是什么?

完全靠声音讲完的故事:对白、旁白、音效和音乐,没有画面。它就是广播剧那一脉,最近借着播客发行渠道明显复兴。它的标志性特征是不同角色由不同声音来演——而这恰好是单音色工具给不了你的。

和普通文字转语音差在哪?

普通文字转语音是拿一个音色念一整段文本。这里是接过一份有多个说话人的剧本,给每人分不同音色,逐句分别导戏,最后混成一条。底层的语音合成只是其中一个零件,真正是产品的是上面那层选角与导戏。

剧本格式有要求吗?

没有。标准剧本分栏、「人名:」式台词、带对话标签的普通散文都能用。如果某一场特别含糊——说话人没名字、大量靠上下文推断——那几句得你自己标一下,花不了几分钟。

一个项目能有多少个角色?

免费套餐 2 个,Creator 5 个,Studio 与 Team 不限。一场典型有声剧连旁白算三到六个说话人,所以 Creator 足够覆盖大多数单人创作,群戏则用 Studio。

能加音乐和音效吗?

CastDub 里不行——它渲染的是表演,不是混音。导出分轨,到任何音频编辑器里做。这是刻意的:对白和声音设计是两门手艺,塞进一个工具往往两边都变差。

做出来的东西能卖吗?

任何付费套餐都可以,商用授权已包含,也没有水印。免费套餐仅供个人使用,会加一段很短的水印。不管哪种情况,剧本始终是你的。

今晚就给第一场戏配上音

粘贴剧本,让 CastDub 给每个角色配一个音色,直接导出一部完整的有声剧。

免费开始创作

无需绑卡。免费套餐额度每月重置。