Síntese

Texto para voz expressivo, para qualquer roteiro

O texto para voz comum converte um bloco de texto com uma voz só. É a ferramenta certa para narração e a errada para uma cena. Esta página cobre a camada de síntese em si — o que dá para mandar ela fazer, e onde ela para.

Vozes para testar

Noor

Noor

Newsreader clarity for exposition-heavy scenes

femininaadultoinglês americanojornalismoclara
Quill

Quill

YouTube explainer voice that never sounds bored

masculinajovem adultoinglês americanoYouTubeclara
Dorian

Dorian

Audiobook baritone for literary fiction and slow reveals

masculinaadultoinglês britânicoaudiolivrograve
Solène

Solène

Continental accent, unhurried, very expensive sounding

femininaadultoinglês britânicoelegantesotaque
Halcyon

Halcyon

Meditation-adjacent narrator for slow, quiet scenes

neutraadultoinglês americanocalmaacalentadora
Indie

Indie

TikTok voiceover: fast, flat, faintly amused

femininajovem adultoinglês americanoredes sociaisrápida
Wren

Wren

Bedtime-story narrator, slow and warm, never wakes anyone up

femininaadultoinglês americanonarraçãocalorosa
Hale

Hale

Documentary narrator with a hand on the listener's shoulder

masculinaadultoinglês americanonarraçãodocumentário

Ver a biblioteca inteira →

O que ela faz

Sete registros emocionais

Neutro, alegre, triste, raiva, medo, sussurro e empolgado, definidos por fala e não por documento. Com o motor de hoje, todo registro pode ser aplicado a qualquer voz, e ele é produzido variando velocidade, tom e volume, não por um modelo de emoção de verdade — as etiquetas da biblioteca dizem para quais registros um personagem foi escrito, não quais vão funcionar.

Controle de ritmo

Um multiplicador de velocidade por fala, no Plus e no Pro. O ritmo faz mais trabalho do que as pessoas esperam: ele carrega idade, autoridade e estado emocional com mais confiabilidade do que o tom.

Rubricas ficam em silêncio

Uma linha escrita inteira entre parênteses é tratada como indicação para o intérprete e não é lida em voz alta. Cabeçalhos de cena e descrições de ação são outra história: eles saem como narração, então apague os que você não quer ouvir.

Pontuação como direção

Um ponto final é uma pausa de verdade, reticências são uma pausa mais longa, a interrogação levanta o fim da frase. Quebras de linha criam intervalos. A diagramação do seu roteiro é o seu controle de tempo, e é por isso que esta página vive dizendo para você quebrar as falas.

Independente de fornecedor

O motor de síntese fica atrás de uma interface. Hoje um motor provisório faz a renderização enquanto o motor de produção é ligado; o mesmo projeto vai renderizar em outro motor sem nenhuma mudança na sua escalação ou na sua direção.

Todas as vozes em todos os planos

A biblioteca não é o paywall. Os planos diferem no tamanho do elenco, no controle de emoção e nos minutos — não em quais vozes você pode usar.

Como usar

  1. Cole o texto

    Uma voz ou várias. Para uma voz só, isto se comporta como qualquer outra ferramenta de texto para voz.

  2. Escolha o personagem

    Escolha entre os quarenta personagens da biblioteca — filtre por idade, gênero, sotaque e estilo em vez de rolar a lista. Faça o teste no seu próprio texto, não no texto de exemplo.

  3. Ajuste ritmo e registro

    Comece no neutro e, no Plus ou no Pro, num ritmo um pouco mais lento do que parece certo. Quase toda primeira tentativa está rápida demais.

  4. Acerte as pronúncias

    Teste cada nome e cada palavra inventada antes de renderizar qualquer coisa longa, e reescreva no próprio texto, ou separe com hífen, os que saírem errados — não existe ajuste de pronúncia.

  5. Renderize e teste no aparelho real

    Ouça no alto-falante do celular além do fone. A maior parte do público está no celular.

Controle de emoção, e por que menos é mais

O instinto, com emoção fala a fala, é usar em tudo, e o resultado é um mingau uniforme. O público lê emoção por contraste, então uma cena com duas falas dirigidas e vinte neutras bate muito mais forte do que uma cena em que tudo está empurrado.

O fluxo que dá bom resultado é: definir um registro de repouso por personagem, renderizar só com os padrões, ouvir de ponta a ponta e então marcar as duas ou três falas em que alguma coisa realmente muda. Numa cena de cinco minutos, dirigir cinco falas na mão é mais ou menos o certo.

Escrever de um jeito que uma voz sintética consiga interpretar

Quatro hábitos carregam quase toda a diferença. Uma intenção por fala — uma frase que vai do encanto ao horror é renderizada como a média dos dois, então quebre. Pontuar de propósito, porque a pontuação é o seu tempo. Interjeições em falas próprias, porque um renderizador fala o texto e não a rubrica. E frases curtas para vozes graves, que perdem inteligibilidade rápido em períodos longos.

Nada disso é gambiarra para contornar limitação. São as mesmas notas que um diretor dá a um intérprete humano, pelos mesmos motivos.

Os limites, ditos na lata

A vocalização física — gritar, chorar, rir enquanto fala, grunhir — é a área mais fraca e vai continuar assim por um tempo, porque são eventos de respiração e não de fala. Gere isso como marcação provisória se precisar, e já conte com substituir depois.

O segundo limite é a interpretação. Uma leitura sintética é uma interpretação limpa, consistente e bem ritmada do que você escreveu. Ela não é um conjunto de decisões sobre subtexto. Para a maior parte do trabalho essa troca compensa; e compensa fazer a troca de olhos abertos sobre qual metade é qual.

Perguntas frequentes

Qual a diferença disto para outras ferramentas de texto para voz?

Para trabalho de uma voz só, pouca. A diferença aparece no instante em que um roteiro tem mais de um interlocutor: escalar o elenco, uma voz que fica fixa para cada personagem dentro de um projeto e dirigir fala a fala são o produto, e a síntese é um componente por baixo disso.

Quais emoções são suportadas?

Neutro, alegre, triste, raiva, medo, sussurro e empolgado, em todas as vozes. Com o motor provisório de hoje, são aproximações feitas com velocidade, tom e volume, não interpretações de verdade, então teste uma fala dirigida antes de contar com ela.

Dá para controlar o tom?

Não — ritmo, sim, no Plus e no Pro; tom, não. Puxar uma voz para longe da faixa natural dela produz artefatos que ficam óbvios num fone bom. Escolha um personagem na faixa certa em vez disso.

Ele lê números e datas corretamente?

Ele aplica as convenções do idioma da voz, então uma voz americana lê datas do jeito americano. Textos que misturam convenções são onde os erros aparecem; se o seu texto mistura, confira os números primeiro.

Qual motor renderiza o áudio hoje?

Um motor provisório, enquanto o motor de produção é ligado. É por isso que a voz de um personagem da biblioteca é uma aproximação do perfil dele e a emoção é produzida com velocidade e tom. Graças à interface de fornecedor, a troca não vai exigir mudanças na sua escalação nem na sua direção.

Dá para usar em narração de acessibilidade?

Dá, mas para acessibilidade você quer a voz mais clara, não a mais marcante, e vale testar a 1,5× ou mais rápido, já que muita gente que usa leitor de tela escuta bem acima da velocidade real.

Escale a sua primeira cena hoje à noite

Cole um roteiro, deixe a CastDub dar uma voz a cada personagem e exporte um audiodrama pronto.

Criar de graça

Sem cartão de crédito. O Free dá um bolo único de créditos.