
Nova
IA de la nave que leyó tu expediente
Categoría de voz
Las voces de robot interesantes no son las que zumban. Son las que están a punto de ser humanas y fallan en un detalle: una regularidad perfecta, ninguna respiración, una pausa en el lugar equivocado. Eso es una decisión de interpretación, y es una que puedes dirigir.

Nova
IA de la nave que leyó tu expediente

Halcyon
Calmada hasta resultar inquietante

Noor
Claridad de sistema de anuncios

Vex
Algo que se puso un tono razonable
Las muestras son provisionales mientras se produce el audio de demostración público. Todas las voces están en todos los planes: la biblioteca no es el muro de pago.
El primero es la computadora retro: muy procesada, con sílabas medidas, obviamente mecánica. Es una señal de nostalgia más que un personaje, y se construye enteramente con efectos y no con interpretación. El segundo es el asistente contemporáneo: agradable, parejo, apenas cálido, indistinguible de una buena voz comercial de texto a voz, que es exactamente lo que es. El tercero es el androide: completamente humano en timbre y sutilmente no humano en comportamiento.
Solo el tercero es de verdad una decisión de reparto, y es en el que vale la pena invertir tiempo, porque es el único que puede sostener una escena dramática. Los otros dos son escenografía, y la escenografía es barata.
El habla de máquina en la ficción se señala casi por completo con la elección de palabras y la estructura. Ninguna muletilla. Ningún rodeo. Ninguna frase incompleta. Oraciones gramaticalmente completas incluso bajo presión. Números precisos donde una persona aproximaría: «en cuatro minutos y diez segundos» en lugar de «en un ratito». En español, además, el registro formal sostenido sin cambiar nunca de tratamiento hace la mitad del trabajo por sí solo.
La segunda herramienta es el desajuste de respuesta. Un personaje humano dice algo emocional; la máquina contesta con información. Ese intercambio establece la no humanidad más rápido que cualquier cantidad de procesamiento, y sobrevive a la traducción, a la compresión y a las bocinas malas.
Cada efecto que horneas es una decisión que no vas a poder revisar. Una modulación en anillo que sonaba perfecta en tus monitores va a ser ininteligible en un teléfono. Una voz doblada que funcionaba en una escena callada va a pelear con la música en una escena fuerte. Y si después necesitas cambiar una palabra, el nuevo renderizado no va a empatar con el original procesado.
Generar audio limpio y tratarlo en tu editor cuesta unos minutos y mantiene abierta cada una de esas decisiones. La exportación por pistas separadas existe en buena medida por esto.
Hay algo genuinamente divertido en usar una voz sintética para interpretar a una voz sintética, y vale la pena decirlo en voz alta: la razón por la que una voz de asistente moderno es fácil de producir aquí es que es la misma tecnología, sin modificar. El androide inquietante es más difícil, porque exige que el modelo sea lo bastante humano para resultar creíble y lo bastante controlado para estar mal.
En la práctica esto significa que los registros retro y de asistente salen casi gratis, y que el androide es donde debería ir tu tiempo de dirección. Que es lo contrario de donde casi todo el mundo lo gasta.
Fuera de la ciencia ficción, el uso más productivo de una voz emocionalmente plana es la comedia. Un sistema automatizado implacablemente amable explicando algo absurdo, un anuncio dentro de la historia dando una noticia catastrófica con el tono de un tablero de salidas, una voz de navegación con opiniones: todo eso funciona porque el registro está completamente fijo mientras el contenido escala.
La regla de escritura es que la máquina nunca debe reconocer el absurdo. En el momento en que comenta lo que está pasando se convierte en un personaje con sentido del humor, y el chiste se derrumba en una voz graciosa cualquiera. Mantén la entrega neutra, mantén el vocabulario de procedimiento y deja que reaccione todo lo demás en la escena.
Una computadora de los años sesenta, un asistente moderno y un androide inquietante son tres sonidos distintos. El primero está procesado, el segundo es plano y agradable, el tercero es humano con algo que falta.
Arranca desde una voz con poca variación emocional natural. Filtrar una voz cálida para que suene robótica suele sonar a voz cálida saliendo de una bocina mala.
En español el equivalente de esa regla es la formalidad absoluta: «no puedo hacer eso» en vez de «no puedo, perdón», nada de «pa'», ningún diminutivo, ninguna muletilla. Se lee como no humano al instante, sin ningún procesamiento. Es la edición de mayor valor de toda la página.
La cualidad inquietante de una voz de máquina viene de la planicie emocional en situaciones que exigen emoción. Resiste las ganas de dirigir.
Exporta limpio y aplica cualquier filtrado, doblado o modulación en anillo en tu editor. Una toma limpia siempre se puede degradar; una toma degradada no se puede recuperar.
No desde el renderizado, y es a propósito. Ese sonido es un efecto de procesamiento —modulación en anillo, vocoder, reducción de bits— aplicado después. Genera la interpretación limpia y agrega el efecto en tu editor, donde puedes bajarlo cuando resulte ininteligible.
Porque una voz procesada es obviamente una máquina y quien escucha se relaja. Una voz casi humana pero emocionalmente ausente se queda en el valle inquietante, y la incomodidad viene de no poder clasificarla.
Escribe frases completas y extremadamente correctas, deja la emoción en neutro y haz que responda a los momentos emocionales con información de procedimiento. El desajuste entre contenido y entrega hace todo el trabajo.
No dentro de un mismo renderizado. Genera las líneas limpias y aplica una degradación creciente a las últimas en tu editor. Hacerlo en posproducción además te deja ajustar la velocidad de la decadencia, que casi siempre sale mal a la primera.
Muchísimo. Los sistemas de anuncios, los menús telefónicos, las voces de navegación dentro de una historia y la mensajería corporativa satírica usan el mismo registro, y el valor cómico de una voz automatizada implacablemente amable es casi inagotable.
Sí, aunque para accesibilidad normalmente quieres la voz más clara y no la más plana. Filtra por la etiqueta de estilo clara y revísala acelerada, porque mucha gente que usa lectores de pantalla escucha muy por encima del tiempo real.
Pega un guion, deja que CastDub le dé una voz propia a cada personaje y exporta un audiodrama terminado.
Empieza gratisSin tarjeta. Free te da una bolsa única de créditos.