
Noor
把说明密集的段落交给新闻播报级的清晰度
中性、开心、悲伤、愤怒、恐惧、耳语和兴奋,按句设置而不是按整篇。不是每把音色都支持全部基调——音色库会写明每把音色带哪几种,因为假装都有只会在渲染时给你一个坏消息。
按角色、按句给一个速度倍率。语速的作用比大多数人以为的大:它比音高更可靠地带出年龄、权威感和情绪状态。
一个词在一个项目里改对一次就一直对。对自造名字、非英语人名和任何专业词汇都是必需的。
句号是真的停顿,省略号停得更久,问号会把句尾提起来。换行会留出间隙。剧本的排版就是你的节奏控制——所以这一页一直在劝你把长句拆开。
合成引擎待在一个接口后面。目前默认是 mock 供应商,正式引擎正在接;同一个项目换引擎渲染,你的角色分配和导演标记一个字都不用改。
音色库不是付费墙。套餐之间的区别在角色数、情绪控制、克隆槽位和分钟数——不在你能用哪几把音色。
一个说话人或者很多个。只用一把音色时,它和别的文字转语音工具没什么两样。
按年龄、性别、语言和风格筛,而不是一直往下翻。用你自己的文本试听,别用示例文本。
从中性、比你觉得合适再慢一点开始。几乎每个人第一次都设得太快。
渲染任何长内容之前,把所有人名和自造词找出来,一次改对。
除了耳机,也用手机扬声器放一遍。大多数听众都在手机上。
拿到逐句情绪,本能是到处都用,结果是一团均匀的糊。听众靠对比来读情绪,所以一场戏里两句有导演、二十句是中性,效果远比处处用力要强。
真能出好结果的做法是:给每个角色定一个平时的基调,先只用默认值渲染,整段听一遍,再标出真正有变化的那两三句。五分钟的一场戏,手工导演五句差不多正好。
四个习惯就能拉开大部分差距。一句一个意图——从欣喜荡到惊恐的句子会被演成两者的平均值,所以要拆开。刻意用标点,因为它就是你的节奏。感叹词单独成行,因为渲染器念的是文本而不是舞台提示。低音色配短句,长从句一多,清晰度掉得很快。
这些都不是为绕开限制而生的技巧。它们就是导演给真人演员的同一批提示,理由也一样。
生理性发声——尖叫、抽泣、边笑边说、闷哼——是最弱的一块,而且短期内还会这样,因为它们是呼吸事件而不是语音事件。需要的话先生成一版占位,并且打算好以后替换掉。
第二个限制是解读。合成朗读是对你写下的内容一次干净、稳定、节奏得当的呈现,但它不是一串关于潜台词的判断。对大多数活儿来说这笔交换是值得的;值得的前提是清楚知道自己换掉的是哪一半。
只做单音色的话,差别不大。差别在剧本里出现第二个说话人的那一刻显现:分配角色、角色设定持续生效和逐句导演才是产品,合成只是底下的一个零件。
中性、开心、悲伤、愤怒、恐惧、耳语和兴奋。每把音色都会列出自己真正支持的基调,而不是声称七种全有。
语速可以;音高则有意只允许小幅调整。把一把音色调离它天然的音域太远,会产生在好耳机上很明显的杂感。不如直接挑一把音域合适的音色。
它按音色所属地区的习惯来念,所以美式音色会用美式读法念日期。混着不同习惯的文本才是容易出错的地方;如果你的文本混着写,先检查数字。
在这个版本里,默认引擎返回一个占位音频文件,好让整条流水线——分配角色、导演、导出——能端到端地搭起来并测试。供应商接口和真实引擎的适配器都在代码库里。
可以,不过做无障碍要的是最清楚的音色而不是最有性格的那把,并且应该在 1.5 倍速或更快的条件下测——很多读屏用户听的速度远高于常速。