
Quill
从不显得无聊的解说音
YouTube 表现的一切都由留存决定,而一条解说视频的留存在头十五秒就被决定了一次,之后在每一个观众注意力开始飘的时刻被重新决定。声音在这里起的作用很具体:换一个声音就是一次注意力重置,而且它是免费的。
这也是为什么会演绎引语、用第二个声音说旁支、或者切到一个角色讲三十秒的频道,留人普遍比只有单一连续解说的频道好。不是那个解说不行,而是十二分钟不间断的同一个声音,要求实在有点高。
相当一部分观众用 1.25 倍甚至更快看,还有人用 2 倍。这改变了「好写作」的定义。长句变得没法解析。嵌套从句直接消失。数字和人名需要周围留更多空间,而不是更少。
实用测试是拿你真实的脚本、用 1.5 倍速试听你的解说音。能扛住那个的,在 1 倍速一定舒服。反过来做这个测试,对你大多数听众实际听到的东西毫无参考价值。
很大一部分观看发生在静音或吵闹的环境里,而字幕对留存和触达都有可测量的提升。自动字幕比没有好,但在人名和专业术语上一贯出错——而那恰好就是你这条视频在讲的词。
因为这里的字幕文件是从你的脚本生成的,而不是从音频转写来的,它天生就是对的。请上传它,而不要依赖自动字幕,你就在最严重的字幕错误出现之前把它们消掉了。
有了便宜的配音流程,最大的诱惑是多做视频,而这也是最快让一个频道不再被推荐的路,因为平台明确地针对批量生产、缺乏差异的内容做了调整。
省下来的时间更好的用法是给每条视频多写一点:加一个第二个声音、加一段演绎、写一个真正像样的冷开场。这三样都是单音色工具给不了你的,而且在观众看来,这三样都读作用心。
很大一部分长视频的观看其实不是在「看」——视频在放,人在干活、做饭或者通勤。这部分观众全部靠听、什么也没看见,这让你的视频其实是一个附带画面的音频产品。
有两个推论。永远不要说「如你所见」,因为相当一部分观众看不见。以及,把信息放在解说里而不是放在屏幕文字里,屏幕文字只用来强化、不用来承载。把这件事做好的频道留存往往异常高,原因就是他们从不丢掉那个抬头走开的听众。
观众认出一个频道,靠声音比靠封面更快。这让解说音成了一个品牌决定,而不是一条视频一条视频去定的事,也意味着你能做的最糟的事,就是因为某个新音色听起来更好,就悄悄在两条视频之间换掉它。
挑一个,存成角色卡,然后一直用。如果你确实需要换,请在视频里说一声——观众能接受一次被解释过的更换,却会被一次没解释的更换弄得别扭。
短句,一句一个意思,不要从句。观众没法把一句话重读一遍,所以任何需要回看的东西都丢掉了。
相当大一部分观众是加速看的。请在加速状态下试听你的解说音,因为很多在 1 倍速很悦耳的声音在 1.5 倍速就听不清了。
如果你的脚本引用了别人的话、演绎了一段对话,或者要演个小剧场,就把那些部分好好配上。这是最便宜的一次制作水准升级。
字幕能提高留存,也是无障碍的必需项。和音频一起生成意味着它天然就是对齐的。
单独听完美的声音,垫上音乐床可能就消失了。渲染出来放进剪辑软件,用你真正发布的音乐床音量听一遍。
允许。平台政策针对的是低投入的批量内容,以及未声明的真人合成媒体,而不是合成解说本身。用生成音色做原创脚本内容的频道并不违规;批量生成上百条几乎一样的视频的频道违规,跟用什么声音无关。
变现政策看的是原创性和价值,不看音频是怎么做出来的。风险在于批量生产套路化内容,那才是审核在找的东西。一个原创脚本用合成音念,不属于问题情形。
YouTube 要求对真实人物和事件的逼真合成呈现做声明。为你自己的脚本生成一个解说音不属于这一类,但在简介里写一句不花钱,还能建立信任。
几乎总是混音问题,不是声音问题。把音乐在对白下压低几个分贝,再在中频挖出一点空间。这两件在任何现代剪辑软件里都是一键的事。
可以,而且应该——频道识别度很大程度上就是声音识别度。请把这个解说音存成角色卡,这样每条视频用的参数都完全一致。
今天完整的音色库是英语,接下来是日语、西班牙语、巴西葡萄牙语和韩语。在那之前,字幕导出是触达非英语观众的现实路径。