Synthèse

Une synthèse vocale expressive pour n'importe quel script

La synthèse vocale ordinaire lit un bloc de texte avec une seule voix. C'est le bon outil pour de la narration et le mauvais outil pour une scène. Cette page traite de la couche de synthèse elle-même : ce qu'on peut lui demander, et où elle s'arrête.

Des voix pour l'essayer

Noor

Noor

Newsreader clarity for exposition-heavy scenes

féminineadulteanglais américaininfonet
Quill

Quill

YouTube explainer voice that never sounds bored

masculinejeune adulteanglais américainYouTubenet
Dorian

Dorian

Audiobook baritone for literary fiction and slow reveals

masculineadulteanglais britanniquelivre audiograve
Solène

Solène

Continental accent, unhurried, very expensive sounding

féminineadulteanglais britanniqueélégantaccent
Halcyon

Halcyon

Meditation-adjacent narrator for slow, quiet scenes

neutreadulteanglais américainposéapaisant
Indie

Indie

TikTok voiceover: fast, flat, faintly amused

fémininejeune adulteanglais américainréseaux sociauxrapide
Wren

Wren

Bedtime-story narrator, slow and warm, never wakes anyone up

féminineadulteanglais américainnarrationchaleureux
Hale

Hale

Documentary narrator with a hand on the listener's shoulder

masculineadulteanglais américainnarrationdocumentaire

Parcourir toute la bibliothèque →

Ce que ça fait

Sept registres émotionnels

Neutre, joyeux, triste, en colère, peur, chuchoté et enthousiaste, réglés par réplique et non par document. Avec le moteur actuel, chaque registre peut être réglé sur chaque voix, et il est rendu en jouant sur le débit, la hauteur et le volume plutôt que par un véritable modèle d'émotion — les étiquettes de la bibliothèque indiquent pour quels registres un personnage est écrit, pas lesquels seront rendus.

Contrôle du tempo

Un multiplicateur de vitesse par réplique, avec Plus et Pro. Le tempo fait plus de travail qu'on ne le croit : il porte l'âge, l'autorité et l'état émotionnel plus sûrement que la hauteur de voix.

Les didascalies restent muettes

Une réplique écrite entièrement entre parenthèses est traitée comme une note à l'interprète et n'est pas lue. Les en-têtes de scène et les lignes d'action, c'est autre chose : ils passent en narration, donc supprimez ceux que vous ne voulez pas entendre.

La ponctuation comme direction d'acteurs

Un point est une vraie pause, des points de suspension une pause plus longue, un point d'interrogation relève la fin de la phrase. Les sauts de ligne créent des silences. La mise en page de votre script est votre commande de minutage : c'est pour cela que cette page ne cesse de vous dire de découper vos répliques.

Indépendant du fournisseur

Le moteur de synthèse est derrière une interface. Aujourd'hui, un moteur provisoire assure le rendu, le temps que le moteur de production soit branché ; le même projet se rendra avec un autre moteur sans rien changer à votre distribution ni à votre direction.

Toutes les voix dans toutes les formules

La bibliothèque n'est pas un mur payant. Les formules diffèrent par la taille de la distribution, le contrôle de l'émotion et les minutes — pas par les voix auxquelles vous avez droit.

Comment s'en servir

  1. Collez le texte

    Un locuteur ou plusieurs. Pour une voix unique, l'outil se comporte comme n'importe quelle autre synthèse vocale.

  2. Choisissez le personnage

    Piochez parmi les quarante personnages de la bibliothèque, en filtrant par âge, genre et style plutôt que de faire défiler. Auditionnez sur votre propre texte, pas sur un texte d'exemple.

  3. Réglez le tempo et le registre

    Commencez en neutre et, avec Plus ou Pro, à un tempo un peu plus lent que ce qui vous semble juste. Presque toutes les premières tentatives sont trop rapides.

  4. Corrigez les prononciations

    Auditionnez chaque nom propre et chaque mot inventé avant de rendre quoi que ce soit de long, et réécrivez dans le texte — autre orthographe, trait d'union — ceux qui sortent mal : il n'y a pas de réglage de prononciation.

  5. Rendez et vérifiez sur du vrai matériel

    Écoutez au haut-parleur d'un téléphone autant qu'au casque. La plupart des auditeurs sont au téléphone.

Le contrôle de l'émotion, et pourquoi moins vaut mieux

Le réflexe, avec une émotion réglable réplique par réplique, est de s'en servir partout, et le résultat est une bouillie uniforme. Le public lit l'émotion par contraste : une scène avec deux répliques dirigées et vingt neutres frappe bien plus fort qu'une scène où tout est poussé.

Le parcours qui donne de bons résultats est celui-ci : fixer un registre au repos par personnage, rendre avec les valeurs par défaut seulement, écouter d'une traite, puis marquer les deux ou trois répliques où quelque chose change vraiment. Sur une scène de cinq minutes, diriger cinq répliques à la main est à peu près la bonne dose.

Écrire un texte qu'une voix de synthèse sait jouer

Quatre habitudes font l'essentiel de la différence. Une intention par réplique : une phrase qui passe du ravissement à l'horreur est rendue comme la moyenne des deux, donc coupez-la. Ponctuez délibérément, parce que la ponctuation est votre minutage. Mettez les interjections sur leur propre ligne, parce qu'un moteur lit du texte et non des didascalies. Et faites des phrases courtes pour les voix graves, qui perdent vite en intelligibilité sur les longues subordonnées.

Rien de tout cela n'est un contournement de limitation. Ce sont exactement les notes qu'un metteur en scène donne à un interprète humain, pour les mêmes raisons.

Les limites, dites franchement

La vocalisation physique — crier, sangloter, rire en parlant, souffler — est le domaine le plus faible et le restera un moment, parce que ce sont des événements de respiration et non de parole. Générez-les comme repères provisoires si vous en avez besoin, et prévoyez de les remplacer.

La deuxième limite est l'interprétation. Une lecture de synthèse est une interprétation propre, régulière et bien rythmée de ce que vous avez écrit. Ce n'est pas une série de décisions sur le sous-texte. Pour l'essentiel du travail, l'échange en vaut la peine ; il vaut la peine d'être fait en sachant clairement laquelle des deux moitiés est laquelle.

Questions fréquentes

En quoi est-ce différent des autres outils de synthèse vocale ?

Pour du travail à voix unique, pas beaucoup. La différence apparaît dès qu'un script a plus d'un locuteur : la distribution, une voix qui reste fixe pour chaque personnage au sein d'un projet et la direction réplique par réplique sont le produit, et la synthèse n'est qu'un composant en dessous.

Quelles émotions sont prises en charge ?

Neutre, joyeux, triste, en colère, peur, chuchoté et enthousiaste, sur toutes les voix. Avec le moteur provisoire actuel, ce sont des approximations construites à partir du débit, de la hauteur et du volume plutôt que de vraies interprétations : auditionnez une réplique dirigée avant de compter dessus.

Puis-je régler la hauteur de la voix ?

Non. Le tempo, oui, avec Plus et Pro ; la hauteur, non. Transposer une voix loin de sa tessiture naturelle produit des artefacts très audibles sur un bon casque. Choisissez plutôt un personnage dans la bonne tessiture.

L'outil lit-il correctement les nombres et les dates ?

Il applique les conventions de la langue de la voix : une voix française lit les dates à la française. C'est dans les textes qui mêlent deux conventions que les erreurs apparaissent ; si le vôtre en mélange, vérifiez d'abord les nombres, ou écrivez-les en toutes lettres quand leur lecture compte.

Quel moteur rend l'audio aujourd'hui ?

Un moteur provisoire, le temps que le moteur de production soit branché. C'est pour cela que la voix d'un personnage de la bibliothèque n'est qu'une approximation de son caractère, et que l'émotion est rendue par le débit et la hauteur. Grâce à l'interface fournisseur, le changement ne demandera aucune modification de votre distribution ni de votre direction.

Puis-je m'en servir pour de la narration d'accessibilité ?

Oui, même si, pour l'accessibilité, il vous faut la voix la plus claire plutôt que la plus caractérisée, et il faut tester à 1,5× ou plus : beaucoup d'utilisateurs de lecteurs d'écran écoutent bien au-dessus du temps réel.

Distribuez votre première scène ce soir

Collez un script, laissez CastDub donner sa voix à chaque personnage, et exportez une fiction sonore finie.

Créer gratuitement

Sans carte bancaire. Free vous donne une réserve unique de crédits.