
Noor
Newsreader clarity for exposition-heavy scenes
Synthèse
La synthèse vocale ordinaire lit un bloc de texte avec une seule voix. C'est le bon outil pour de la narration et le mauvais outil pour une scène. Cette page traite de la couche de synthèse elle-même : ce qu'on peut lui demander, et où elle s'arrête.

Noor
Newsreader clarity for exposition-heavy scenes

Quill
YouTube explainer voice that never sounds bored

Dorian
Audiobook baritone for literary fiction and slow reveals

Solène
Continental accent, unhurried, very expensive sounding

Halcyon
Meditation-adjacent narrator for slow, quiet scenes

Indie
TikTok voiceover: fast, flat, faintly amused

Wren
Bedtime-story narrator, slow and warm, never wakes anyone up

Hale
Documentary narrator with a hand on the listener's shoulder
Neutre, joyeux, triste, en colère, peur, chuchoté et enthousiaste, réglés par réplique et non par document. Avec le moteur actuel, chaque registre peut être réglé sur chaque voix, et il est rendu en jouant sur le débit, la hauteur et le volume plutôt que par un véritable modèle d'émotion — les étiquettes de la bibliothèque indiquent pour quels registres un personnage est écrit, pas lesquels seront rendus.
Un multiplicateur de vitesse par réplique, avec Plus et Pro. Le tempo fait plus de travail qu'on ne le croit : il porte l'âge, l'autorité et l'état émotionnel plus sûrement que la hauteur de voix.
Une réplique écrite entièrement entre parenthèses est traitée comme une note à l'interprète et n'est pas lue. Les en-têtes de scène et les lignes d'action, c'est autre chose : ils passent en narration, donc supprimez ceux que vous ne voulez pas entendre.
Un point est une vraie pause, des points de suspension une pause plus longue, un point d'interrogation relève la fin de la phrase. Les sauts de ligne créent des silences. La mise en page de votre script est votre commande de minutage : c'est pour cela que cette page ne cesse de vous dire de découper vos répliques.
Le moteur de synthèse est derrière une interface. Aujourd'hui, un moteur provisoire assure le rendu, le temps que le moteur de production soit branché ; le même projet se rendra avec un autre moteur sans rien changer à votre distribution ni à votre direction.
La bibliothèque n'est pas un mur payant. Les formules diffèrent par la taille de la distribution, le contrôle de l'émotion et les minutes — pas par les voix auxquelles vous avez droit.
Un locuteur ou plusieurs. Pour une voix unique, l'outil se comporte comme n'importe quelle autre synthèse vocale.
Piochez parmi les quarante personnages de la bibliothèque, en filtrant par âge, genre et style plutôt que de faire défiler. Auditionnez sur votre propre texte, pas sur un texte d'exemple.
Commencez en neutre et, avec Plus ou Pro, à un tempo un peu plus lent que ce qui vous semble juste. Presque toutes les premières tentatives sont trop rapides.
Auditionnez chaque nom propre et chaque mot inventé avant de rendre quoi que ce soit de long, et réécrivez dans le texte — autre orthographe, trait d'union — ceux qui sortent mal : il n'y a pas de réglage de prononciation.
Écoutez au haut-parleur d'un téléphone autant qu'au casque. La plupart des auditeurs sont au téléphone.
Le réflexe, avec une émotion réglable réplique par réplique, est de s'en servir partout, et le résultat est une bouillie uniforme. Le public lit l'émotion par contraste : une scène avec deux répliques dirigées et vingt neutres frappe bien plus fort qu'une scène où tout est poussé.
Le parcours qui donne de bons résultats est celui-ci : fixer un registre au repos par personnage, rendre avec les valeurs par défaut seulement, écouter d'une traite, puis marquer les deux ou trois répliques où quelque chose change vraiment. Sur une scène de cinq minutes, diriger cinq répliques à la main est à peu près la bonne dose.
Quatre habitudes font l'essentiel de la différence. Une intention par réplique : une phrase qui passe du ravissement à l'horreur est rendue comme la moyenne des deux, donc coupez-la. Ponctuez délibérément, parce que la ponctuation est votre minutage. Mettez les interjections sur leur propre ligne, parce qu'un moteur lit du texte et non des didascalies. Et faites des phrases courtes pour les voix graves, qui perdent vite en intelligibilité sur les longues subordonnées.
Rien de tout cela n'est un contournement de limitation. Ce sont exactement les notes qu'un metteur en scène donne à un interprète humain, pour les mêmes raisons.
La vocalisation physique — crier, sangloter, rire en parlant, souffler — est le domaine le plus faible et le restera un moment, parce que ce sont des événements de respiration et non de parole. Générez-les comme repères provisoires si vous en avez besoin, et prévoyez de les remplacer.
La deuxième limite est l'interprétation. Une lecture de synthèse est une interprétation propre, régulière et bien rythmée de ce que vous avez écrit. Ce n'est pas une série de décisions sur le sous-texte. Pour l'essentiel du travail, l'échange en vaut la peine ; il vaut la peine d'être fait en sachant clairement laquelle des deux moitiés est laquelle.
Pour du travail à voix unique, pas beaucoup. La différence apparaît dès qu'un script a plus d'un locuteur : la distribution, une voix qui reste fixe pour chaque personnage au sein d'un projet et la direction réplique par réplique sont le produit, et la synthèse n'est qu'un composant en dessous.
Neutre, joyeux, triste, en colère, peur, chuchoté et enthousiaste, sur toutes les voix. Avec le moteur provisoire actuel, ce sont des approximations construites à partir du débit, de la hauteur et du volume plutôt que de vraies interprétations : auditionnez une réplique dirigée avant de compter dessus.
Non. Le tempo, oui, avec Plus et Pro ; la hauteur, non. Transposer une voix loin de sa tessiture naturelle produit des artefacts très audibles sur un bon casque. Choisissez plutôt un personnage dans la bonne tessiture.
Il applique les conventions de la langue de la voix : une voix française lit les dates à la française. C'est dans les textes qui mêlent deux conventions que les erreurs apparaissent ; si le vôtre en mélange, vérifiez d'abord les nombres, ou écrivez-les en toutes lettres quand leur lecture compte.
Un moteur provisoire, le temps que le moteur de production soit branché. C'est pour cela que la voix d'un personnage de la bibliothèque n'est qu'une approximation de son caractère, et que l'émotion est rendue par le débit et la hauteur. Grâce à l'interface fournisseur, le changement ne demandera aucune modification de votre distribution ni de votre direction.
Oui, même si, pour l'accessibilité, il vous faut la voix la plus claire plutôt que la plus caractérisée, et il faut tester à 1,5× ou plus : beaucoup d'utilisateurs de lecteurs d'écran écoutent bien au-dessus du temps réel.
Collez un script, laissez CastDub donner sa voix à chaque personnage, et exportez une fiction sonore finie.
Créer gratuitementSans carte bancaire. Free vous donne une réserve unique de crédits.