音声合成

台本のための、感情のあるテキスト読み上げ

ふつうのテキスト読み上げは、1つの声で文章のかたまりを音声に変えます。ナレーションには正しい道具で、芝居のシーンには間違った道具です。このページで扱うのは音声合成そのものの層です。何を指示できて、どこで止まるのか。

試してみる声

Noor

Noor

Newsreader clarity for exposition-heavy scenes

女性大人アメリカ英語ニュースクリア
Quill

Quill

YouTube explainer voice that never sounds bored

男性青年アメリカ英語YouTubeクリア
Dorian

Dorian

Audiobook baritone for literary fiction and slow reveals

男性大人イギリス英語オーディオブック低音
Solène

Solène

Continental accent, unhurried, very expensive sounding

女性大人イギリス英語上品訛り
Halcyon

Halcyon

Meditation-adjacent narrator for slow, quiet scenes

中性大人アメリカ英語落ち着き癒やし
Indie

Indie

TikTok voiceover: fast, flat, faintly amused

女性青年アメリカ英語社交的早口
Wren

Wren

Bedtime-story narrator, slow and warm, never wakes anyone up

女性大人アメリカ英語ナレーション温かい
Hale

Hale

Documentary narrator with a hand on the listener's shoulder

男性大人アメリカ英語ナレーションドキュメンタリー

ライブラリ全体を見る →

できること

7つの感情

ノーマル、喜び、悲しみ、怒り、恐れ、ささやき、興奮。文書単位ではなく行単位で指定します。いまのエンジンでは、どの声にもすべての感情を指定できます。ただし本物の感情モデルではなく、話速・ピッチ・音量をずらして表現しています。ライブラリのタグが示すのは、そのキャラクターがどの感情を想定して書かれているかで、どれが鳴るかではありません。

話速のコントロール

PlusとProで使える、行単位の速度倍率です。話す速さは思っているより多くを担っていて、年齢も、立場の強さも、感情の状態も、ピッチより確実に伝えます。

ト書きは読み上げません

丸ごと括弧で書かれた行は、演じ手へのメモとして扱い、読み上げません。柱(シーン見出し)と地の文のト書きは別で、ナレーションとして読まれるので、聞かせたくないものは削除してください。

句読点は演出です

句点は本当の間になり、三点リーダーはもっと長い間に、疑問符は語尾を持ち上げます。改行は間を作ります。台本のレイアウトが、そのままタイミングの指示になります。このページが何度も「行を分けてください」と言うのは、そのためです。

エンジンに依存しません

音声合成エンジンはインターフェースの裏にあります。本番用エンジンをつなぐまでのあいだ、仮のエンジンで音声を作っています。同じプロジェクトを別のエンジンで書き出しても、キャスティングと演出は一切変わりません。

すべての声が、すべてのプランで

ライブラリは有料の壁ではありません。プランの差はキャストの人数、感情コントロール、分数であって、どの声を使えるかではありません。

使い方

  1. テキストを貼る

    話者が1人でも大勢でも。1つの声だけなら、ほかのテキスト読み上げと同じように動きます。

  2. キャラクターを選ぶ

    ライブラリの40人から選びます。延々とスクロールせず、年齢・性別・訛り・スタイルで絞ってください。試し聴きはサンプル文ではなく、自分の原稿で。

  3. 話速と感情を決める

    ノーマルから始めて、PlusかProなら、ちょうどいいと感じるより少し遅めにしてください。最初の一発目は、たいてい速すぎます。

  4. 読みを確かめる

    長いものを書き出す前に、人名と造語をすべて試し聴きし、読みを間違えるものは本文の表記を変えます(かなで書く、区切りを入れるなど)。読みを設定する機能はありません。

  5. 書き出して実機で確かめる

    ヘッドホンだけでなく、スマートフォンのスピーカーでも鳴らしてください。聴き手の多くはスマートフォンです。

感情のコントロールは、少ないほうが効きます

行ごとに感情を指定できると、つい全部に使いたくなります。その結果は、どこも同じにぼやけた芝居です。聴き手は対比で感情を読むので、演出した行が2つで残り20行がノーマルのシーンのほうが、全部を押したシーンよりずっと強く届きます。

うまくいく進め方はこうです。キャラクターごとにふだんの基準を決める。既定のまま書き出す。頭から通して聴く。そのうえで、本当に何かが変わる2〜3行に印をつける。5分のシーンなら、手で演出するのは5行くらいがちょうどいい分量です。

合成音声が演じられる書き方

差の大半は4つの癖で決まります。1行にひとつの意図。喜びから恐怖まで振れる一文は両方の平均として読まれるので、分けてください。句読点は意図して打つ。それがタイミングだからです。感嘆や相づちは独立した行にする。読み上げられるのはテキストであって、ト書きではありません。低い声には短い文を。修飾が長く続くと、低音は急に聞き取りにくくなります。

どれも制約に対する裏技ではありません。人の演じ手に演出家が出すのと同じ注文で、理由も同じです。

限界をはっきり書いておきます

身体的な発声、つまり叫び、嗚咽、笑いながらのセリフ、力む声がいちばん弱く、当分そのままです。これらは言葉ではなく呼吸の出来事だからです。必要なら仮として生成して、あとで差し替える前提で進めてください。

2つめの限界は解釈です。合成の読みは、書かれたものを、きれいに、ぶれず、テンポよく演じたものです。言外の意味についての判断の積み重ねではありません。たいていの仕事ではこの取引に見合いますが、何を手放しているのかは、目を開けたまま選ぶ価値があります。

よくあるご質問

ほかのテキスト読み上げと何が違いますか。

1つの声で読むだけなら、大きくは違いません。違いが出るのは、台本に話者が2人以上いた瞬間です。キャスティング、プロジェクトの中でキャラクターごとに固定される声、行ごとの演出がプロダクトで、音声合成はその下の部品です。

対応している感情を教えてください。

ノーマル、喜び、悲しみ、怒り、恐れ、ささやき、興奮で、どの声でも使えます。いまの仮のエンジンでは、演技として出しているのではなく、話速・ピッチ・音量で近づけたものです。演出した行は、頼る前に試し聴きしてください。

ピッチは変えられますか。

変えられません。話速はPlusとProで変えられますが、ピッチの調整はありません。地声から遠いピッチ変更は、良いヘッドホンで聴くとはっきり分かる雑味を生むからです。代わりに、その音域のキャラクターを選んでください。

数字や日付を正しく読みますか。

その声のロケールの習慣に従うので、アメリカ英語の声は日付をアメリカ式に読みます。表記の流儀が混ざっているところで間違いが出ます。混在している原稿なら、まず数字から確認してください。

いまはどのエンジンで音声を作っていますか。

本番用エンジンをつなぐまでのあいだの、仮のエンジンです。ライブラリのキャラクターの声が人物像の近似にとどまり、感情を話速とピッチで表現しているのはそのためです。エンジンはインターフェースの裏にあるので、切り替えのときにキャスティングや演出を変える必要はありません。

アクセシビリティ向けのナレーションに使えますか。

使えます。ただしアクセシビリティ用途では、個性のある声より聞き取りやすい声を選ぶべきですし、1.5倍以上でも試してください。スクリーンリーダーの利用者の多くは、実時間よりかなり速く聴いています。

今夜、最初の1シーンをキャスティング

台本を貼り付ければ、CastDubが登場人物一人ひとりに声を割り当てます。あとは完成したボイスドラマを書き出すだけです。

無料で作ってみる

クレジットカードは不要です。無料枠は一度きりの持ち分です。