
Torvald
命令真能被执行的骑士团长
剧本格式、以「角色名:」开头的对话行、带对话标注的普通叙事文,都按写下来的样子解析。可以从文档、编剧软件或表格的一列里直接粘贴。支持上传 .txt;.docx 与 .srt 导入是接下来要加的两种。
说话人识别会按谁在讲话把剧本切开,再根据你对角色的描述给每个人推荐一把音色。这是建议,不是决定——每个分配都能改,改过之后在这个项目里一直有效。
情绪属于台词,不属于角色。给每个角色定一个平时的语气基调,只标出那几句基调被打断的台词。这是把「顺一遍」变成「一场表演」的唯一机制,也是主要的付费功能。
名字、人设、音色、默认情绪、语速和读音修正,一起存在这个角色名下。跨场次、跨集数、跨项目复用。系列作品几个月不走形,靠的就是这个。
自造的名字改对一次,整个项目里到哪儿都是对的,包括之后才写的章节。只要故事里有一套自己的人名地名,这件事该最先做而不是最后做。
一条混好的 MP3 或 WAV、按角色打包成 ZIP 的分轨供配乐与音效使用,以及一份由剧本生成而不是听写得来的 SRT——所以人名拼写正确,时间轴本来就对得上。
粘贴或上传。不用重排格式,也没有要填的模板。
看一遍每个角色被推荐的音色,在同一句台词上试听备选,定下合适的那把。
给每个角色一个默认情绪和语速。整场戏大部分都跑在默认值上。
标出基调被打断的具体几句——一场戏通常是三到五句。
节奏问题一句一句听不出来,从头听到尾一目了然。
成片、分轨还是字幕,看这段音频接下来要去哪儿。
语音合成已经是大路货。好几家供应商的音质都足够做有声剧,它们之间的差距比一场戏配得好与配得差之间的差距小得多。不是大路货的是合成之外的全部:认出谁在说话、让一个角色几个月都稳住、逐句导演、把音频以能拿去混音的形式交出来。
所以这里的供应商层是一个接口,后面挂着好几种实现。明年出现更好的引擎,那只是改一处配置,而不是重做一遍;你的角色卡、导演标记和读音修正原样带过去。
它不写剧本。生成的台词由生成的声音来演,这种东西没人会想要第二次,而有声剧里真正有意思的问题是制作,不是点子。
它不做混音。没有音乐床、没有混响、没有立体声摆位。这些该在音频编辑器里做,那里你能把所有声音放在一起听;把它们塞进渲染工具,结果一向比两边各自做更糟。
它不在一次渲染里做对话叠音。抢话是真实存在的戏剧手法,而它是一次混音操作——导出分轨自己错开就行。在任何编辑器里拖一下,这是你能对一场吵架做的最真实的处理。
生理性发声是目前的上限:尖叫、抽泣、边笑边说、用力时的闷哼。这些是呼吸事件而不是语音事件,也正是听众认出音频是生成的地方。能绕就绕开写,绕不开就把承担这几下的两三句录下来。一个项目里混用真人录音和生成音频很常见,只要文本撑住了那一刻,接缝是听不出来的。
很长的情绪独白是第二个弱点,原因相近:真人演员在一段独白里每隔几秒就会对潜台词做一次判断,而这里没有任何东西在尝试这件事。
目前是纯文本,粘贴或上传都行,可以是剧本格式、「角色名:」对话行,或带对话标注的叙事文。Word 文档和字幕文件是接下来要加的两种导入格式。
剧本格式下几乎总是对的。叙事文里要看你的归属写得有多明确——长段没标注是谁说的对话、以称号代称的角色,是稳定会出错的情况。渲染前扫一眼分配结果,一分钟就够。
可以,正是这个能力让长项目成立。改一句,只重渲染那一句,其余音频保持原样。
能。角色卡是一个可携带的对象,这就是重点——系列里的常驻角色只有一张卡,每一集的项目都加载它。
这里不行。导出分轨,去音频编辑器里配。这是有意画下的边界,不是缺掉的功能。
工作室和团队。免费与创作者用的是自动情绪处理,足够确认一场戏成不成立,但没法把某个特定转折放在某一句上。