
Nova
あなたの経歴を読んだ船のAI
声のカテゴリー
面白いロボットの声は、ブザーのような声ではありません。ほとんど人間なのに、1点だけ間違っている声です。完璧な均一さ、息のなさ、変なところに入る間。それは芝居の選択であり、演出できるものです。
1つめはレトロなコンピューターです。重く加工され、音節ごとに区切られ、明らかに機械的。キャラクターというより懐かしさの合図で、芝居ではなく効果だけで作られています。2つめは現代のアシスタントです。感じがよく、均一で、ほのかに温かく、良い商用の読み上げ音声と区別がつきません。実際そのとおりのものなので、当然です。3つめはアンドロイドで、音色は完全に人間、振る舞いだけがわずかに人間ではありません。
本当にキャスティングの判断なのは3つめだけで、時間をかける価値があるのもそこです。ドラマの場面を背負えるのはそれだけだからです。ほかの2つは舞台装置で、舞台装置は安い。
日本語には、この3つに乗ってくる4つめの文脈があります。合成音声そのものがキャラクターとして受け入れられてきた歴史です。歌声合成のソフトから始まって、読み上げ音声で解説動画を作る文化まで、日本の聴き手は「機械が話している」ことを不気味さではなく様式として聴くことに慣れています。つまりここでは、機械らしさを隠す必要がありません。むしろはっきり機械であることを様式として選び、その上で内容だけを人間的にするほうが、狙いどおりに届くことが多い。
フィクションにおける機械の話し方は、ほぼ完全に語の選択と構造で合図されます。縮約しない。ぼかさない。文の断片を使わない。圧力下でも文法的に完結した文。人間なら概算するところで正確な数字を出す。
2つめの道具は応答の不一致です。人間の登場人物が感情的なことを言い、機械が情報で答える。このやり取りは、どれだけ加工するよりも速く非人間性を確立しますし、翻訳にも、圧縮にも、悪いスピーカーにも耐えます。
日本語には、もうひとつ強い装置があります。一人称です。機械のキャラクターに「私」を使わせるか、一人称そのものを消すかで、印象がかなり変わります。「本機は」「当システムは」と自称する書き方は、日本語の聴き手にとって即座に非人間の合図で、しかも効果は1語で済みます。
焼き込んだ効果は、やり直せなくなった判断です。モニターで完璧だったリングモジュレーションは、スマートフォンでは聞き取れません。静かな場面で機能した二重の声は、うるさい場面では音楽とぶつかります。そしてあとで1語だけ直したくなったとき、作り直したものは加工済みの元と一致しません。
クリーンに生成して編集ソフトで処理するのは数分の手間で、その判断をすべて開いたままにできます。キャラクター別トラックの書き出しがあるのは、大部分このためです。
合成音声を使って合成音声を演じることには、本当に面白いところがあります。声に出して言っておく価値があります。現代のアシスタント音声がここで簡単に作れるのは、それが同じ技術を、何も変えずに使っているからです。不気味なアンドロイドのほうが難しい。信じられるだけ人間的で、間違っていられるだけ制御されたモデルが必要だからです。
つまり実務的には、レトロとアシスタントの音域はほぼ無料で、演出の時間を注ぐべきなのはアンドロイドです。それは、ほとんどの人が時間を注いでいる場所のちょうど反対側です。
SFの外で、感情の平坦な声のいちばん生産的な使い道はコメディです。どこまでも感じのいい自動システムが不条理な説明をする、作品世界の放送が壊滅的な知らせを発車標の口調で伝える、意見を持ったカーナビ。どれも機能するのは、音域が完全に固定されたまま、内容だけが上がっていくからです。
書き方の規則は、機械が不条理を認識してはいけないということです。起きていることに言及した瞬間、それはユーモアの分かるキャラクターになり、笑いはただの面白い声に崩れます。読みはノーマルのまま、語彙は手続き的なまま、反応はシーンの中のほかの全員に任せてください。
1960年代のコンピューター、現代のスマートスピーカー、不気味なアンドロイドは別々の音です。1つめは加工、2つめは平坦で感じがよく、3つめは人間から何かが抜けています。
もともと感情の起伏が小さい声から始めてください。温かい声をフィルターで機械にしても、たいていは悪いスピーカー越しの温かい声にしかなりません。
日本語なら、話し言葉の省略をやめることです。「してる」ではなく「しています」、「ちゃう」ではなく「しまいます」。加工を1つもかけずに、人でないことが即座に伝わります。このページでいちばん効く編集です。
機械の声の落ち着かなさは、感情を要求する状況での感情の平坦さから来ます。演出したくなるのをこらえてください。
クリーンに書き出して、フィルター、重ね、リングモジュレーションは編集ソフトで。クリーンなテイクはいつでも劣化させられますが、劣化したテイクは戻せません。
レンダラーからは出ませんし、それは意図的です。あの音はリングモジュレーション、ボコーダー、ビット削減といった後処理の効果です。芝居をクリーンに作って、編集ソフトで効果をかけてください。そこでなら、聞き取れないと分かったときに戻せます。
加工された声は明らかに機械なので、聴き手は安心します。ほとんど人間なのに感情が欠けている声は不気味の谷に入り、居心地の悪さは、聴き手がそれを分類できないことから来ます。
3つあります。1つめ、丁寧語で統一して崩さないこと。どんな場面でも「です・ます」のままだと非人間的に響きます。2つめ、数値を丸めないこと。「もうすぐ」ではなく「4分10秒後」。3つめ、漢語を多く使うこと。和語より硬く、事務的に聞こえます。「調べます」ではなく「照会します」です。
極端に正しい完結した文で書き、感情はノーマルに保ち、感情的な場面には手続き的な情報で応答させてください。内容と読みの不一致が全部やってくれます。
1回の書き出しの中ではできません。行をクリーンに生成して、後半に向かって強くなる劣化を編集ソフトでかけてください。後処理でやると、劣化の速度も調整できます。それは1回目でだいたい間違えるところです。
非常に使えます。構内放送、電話の自動応答、作品世界の案内音声、企業メッセージの風刺は同じ音域を使いますし、どこまでも感じのいい自動音声の笑いの価値はほとんど尽きません。
台本を貼り付ければ、CastDubが登場人物一人ひとりに声を割り当てます。あとは完成したボイスドラマを書き出すだけです。
無料で作ってみるクレジットカードは不要です。無料枠は一度きりの持ち分です。