
Nova
读过你档案的舰载 AI
第一种是复古电脑:重处理、按音节等时、明显是机械的。它更像一个怀旧信号而不是一个角色,而且完全靠效果而不是靠表演做出来。第二种是当代助手:悦耳、均匀、微微温厚,和一个不错的商用文字转语音音色无法区分——而它恰好就是这个东西。第三种是仿生人:音色上完全是人,行为上微妙地不是人。
只有第三种才真的算一个选角决定,也是值得花时间的那个,因为只有它能撑起一场有戏的场景。前两种是布景,而布景是便宜的。
虚构作品里的机器语言,几乎完全靠选词和句式来标记。不用缩略形式。不含糊其辞。不用残句。即便在压力下也说完整的语法句。在人会约估的地方给出精确数字——「四分十秒后」,而不是「过几分钟」。
第二个工具是回应的错配。人类角色说了一句情绪化的话,机器用信息回答。这个来回建立非人感的速度,比任何处理都快,而且经得起翻译、压缩和劣质喇叭。
你烤进去的每一个效果,都是一个再也没法重新考虑的决定。在你监听音箱上完美的环形调制,到手机上会听不清。在安静场景里成立的双声叠加,到吵闹场景里会和音乐打架。而如果你后来要改一个词,重渲出来的那条也和处理过的原素材不匹配。
生成干净音频、在剪辑软件里处理,只多花几分钟,却把上面每一个决定都留着可改。分轨导出存在的很大一部分理由就是这个。
用一个合成的声音去演一个合成的声音,这件事本身确实很好笑,也值得说出来:当代助手那种声音在这里之所以容易做,是因为它就是同一套技术、原样不动。诡异的仿生人才更难,因为它要求模型「像人得足够可信」,同时又「被控制得足够不对」。
实际含义是:复古和助手这两个音区几乎不花力气,而你的导戏时间应该花在仿生人身上——这恰好和多数人花时间的地方相反。
在科幻之外,情绪完全平直的声音最有产出的用法是喜剧。一个不由分说地悦耳的自动系统在解释一件荒唐事,一个世界观内的广播用航班信息牌的语气播报灾难性消息,一个有意见的导航语音——这些都成立,因为音区被完全固定住,而内容在不断升级。
写作规则是:机器绝不能承认这份荒唐。它一旦对正在发生的事发表评论,就变成了一个有幽默感的角色,笑点也就塌回成一个普通的搞笑声音。请让演绎保持中性、词汇保持流程化,让场景里其余的一切去反应。
上世纪六十年代的电脑、当代智能助手、诡异的仿生人,是三种声音。第一种靠处理,第二种又平又悦耳,第三种是像人但缺了点什么。
请从情绪变化天然就少的音色出发。把一个温厚的声音滤成机械感,通常只会像一个温厚的声音从坏喇叭里出来。
机器角色把话说完整、不说口语缩略形式,立刻就读作非人类,完全不需要任何处理。这是本页性价比最高的一处修改。
机器声音的渗人之处,在于它在本该有情绪的场合情绪是平的。请忍住去导它的冲动。
导出干净的音频,任何滤波、叠加或环形调制都在剪辑软件里加。干净的素材永远可以弄脏,弄脏的素材救不回来。
渲染器里没有,而且是故意的。那种声音是处理效果——环形调制、声码器、比特削减——都是事后加的。请生成干净的表演,在剪辑软件里加效果,那样等你发现它听不清时还能往回调。
因为处理过的声音明显是台机器,听众于是放松了。一个几乎像人、但情绪完全缺席的声音落在恐怖谷里,不适感来自听众无法给它归类。
写极其规范、完整的句子,情绪保持中性,并且让它在情绪化的时刻用流程性的信息回应。内容和演绎之间的错配就把事情全办了。
单次渲染里不行。请干净地生成,然后在剪辑软件里对后面的句子施加逐渐加重的劣化。放在后期做的另一个好处是你能调整衰退速率——这个速率第一次总是错的。
非常有用。广播系统、电话语音菜单、世界观内的导航语音,以及讽刺企业话术,用的都是同一个音区,而一个不由分说地悦耳的自动语音的喜剧价值几乎用不完。
可以,不过无障碍场景一般要的是最清晰的音色,而不是最平的。请按「清晰」风格标签筛,并且在加速状态下检查,因为很多读屏用户的收听速度远高于实时。