Categoría de voz

Generador de voces para personajes de videojuego

Los videojuegos no tienen escenas, tienen tablas: doscientas líneas repartidas entre cuarenta personajes que el mes que viene tienen que sonar igual cuando agregues cincuenta más. CastDub encaja con casi toda esa forma —repartes una vez por proyecto, el reparto se queda, y el lote se renderiza—, y esta página dice sin rodeos qué parte no hace.

Cuatro voces para empezar

Bram

Bram

Tabernero y dador de misiones sin querer

ásperocálido
Nova

Nova

IA de la nave que leyó tu expediente y no se impresionó

robotciencia ficción
Seraphine

Seraphine

Noble de la corte cuya cortesía es un arma

compuestafantasía
Grit

Grit

Algo muy grande que acaba de notarte

monstruograve

Las muestras son provisionales mientras se produce el audio de demostración público. Todas las voces están en todos los planes: la biblioteca no es el muro de pago.

El diálogo de videojuego es un problema de tubería, no de interpretación

Pregúntale a cualquier estudio pequeño qué hace caro el doblaje y no te va a decir primero el caché. Te va a decir las revisiones. Una línea cambia en la semana nueve, quien la grabó no está disponible, la nueva toma no empata con el tono de sala de la anterior y ahora hay que regrabar tres líneas en vez de una. Las voces sintéticas le resultan atractivas a los equipos independientes sobre todo porque comprimen ese ciclo a segundos.

Eso solo se sostiene si la herramienta respeta la tubería. Audio que llega como cuarenta archivos llamados export-1.mp3 no quitó trabajo, lo movió de lugar. CastDub no exporta un archivo por línea: exporta una mezcla, pistas por personaje en Pro y un SRT desde Plus, así que el paso que encaja con tu estructura de proyecto es cortar la mezcla con los tiempos del SRT, que es un script corto escrito una sola vez.

Consistencia a lo largo de una producción larga

El modo de fallar de las voces sintéticas en un juego no es la calidad, es la deriva. Quien juega te perdona una lectura un poco plana. Lo que nota de inmediato es que el herrero suena a otra persona en el segundo acto, porque el oído humano está afinado exactamente para eso.

Dentro de un proyecto, la deriva es estructuralmente improbable: cada personaje conserva su personaje de la biblioteca y su emoción por defecto, y dos personajes no comparten voz hasta que el idioma se queda sin voces distintas. Pero los personajes no pasan de un proyecto a otro, así que en una producción larga lleva una hoja de reparto: personaje de la biblioteca, perfil y la grafía del vocabulario de ese personaje. Cuando entra alguien nuevo a escribir en el mes seis, arma el reparto con esa hoja en vez de elegir una voz y escucha la primera línea antes de exportar, y nada del sonido queda librado a la memoria.

Dónde conviene gastar dinero de verdad

Sé honesto sobre lo que las voces sintéticas hacen mal, porque ahí es donde debería ir tu presupuesto. Son flojas en el esfuerzo físico —dolor, cansancio, risa, llanto— y en los monólogos emocionales largos, donde las decisiones de una persona que actúa sostienen la escena. Son fuertes en el enorme centro de un guion de juego: tenderos, tutoriales, texto de misiones, conversaciones de ambiente, frases de sistema.

Un reparto pragmático que usan varios equipos chicos: generar todo, publicar lo generado para los personajes menores y contratar intérpretes para los dos o tres papeles de los que depende la historia. Las versiones generadas sirven además de pista guía, así que quien actúa llega sabiendo el tiempo antes de entrar a grabar.

Reglas legales básicas

Dos reglas mantienen los proyectos fuera de problemas. No clones una voz para la que no tengas permiso por escrito, incluidas las de intérpretes de otros juegos. Y no describas una voz generada en tu material de prensa como la voz de un actor con nombre: eso es un problema de derechos de imagen independiente de cómo se hizo el audio.

Si trabajas con intérpretes humanos y quieres un clon como herramienta de retomas, el contrato tiene que decirlo de forma explícita, nombrar el alcance y decir qué pasa con el modelo cuando termina el proyecto. La clonación todavía no está abierta en CastDub, y la página de política de clonación describe el flujo de consentimiento que vamos a exigir antes de construir cualquier modelo.

Del guion al audio en pocos pasos

  1. Trae el diálogo en la forma que ya tiene

    Casi todos los equipos guardan el diálogo en una hoja de cálculo o en un archivo de Yarn o Ink. Pega una columna de pares «Nombre: línea» y CastDub la trata como una lista de reparto, no como prosa.

  2. Fija el reparto dentro del proyecto

    Cada NPC recibe un personaje de la biblioteca, un perfil y una emoción por defecto, definidos una vez en el proyecto, así que el guardia del tutorial y el guardia del tercer acto son el mismo guardia. Los personajes no pasan a otros proyectos: para esos, lleva una hoja de reparto.

  3. Renderiza por lotes

    Genera todas las líneas de un personaje de una pasada y revísalas juntas. Los problemas de consistencia aparecen cuando escuchas cuarenta líneas seguidas, nunca cuando revisas una.

  4. Corta los archivos con el SRT

    No hay exportación de un archivo por línea. Exporta la mezcla con su SRT (desde Plus): cada entrada es una línea con su inicio y su final, así que un script corto puede partir el MP3 y nombrar los clips con tus propios identificadores para Unity, Unreal o Godot.

  5. Vuelve a renderizar solo lo que cambió

    Cuando alguien reescribe ocho líneas, regeneras esas ocho. Todo lo demás conserva su audio y tu compilación no se mueve.

Preguntas frecuentes

¿Puedo usar voces generadas en un juego comercial?

Sí, en cualquier plan de pago: la licencia comercial cubre publicar el audio dentro de tu juego. Deja anotado con qué plan generaste cada cosa y no publiques audio del plan gratuito, que tiene licencia solo para uso personal y no comercial.

¿Cómo evito que un NPC se desvíe entre sesiones de trabajo?

Mantén a los NPC en el mismo proyecto cuando puedas, y lleva una hoja de reparto —personaje de la biblioteca y perfil por NPC— para cuando no puedas, en vez de volver a elegir de oído. La desviación casi siempre viene de que alguien eligió semanas después una voz parecida pero distinta, no del modelo; en un proyecto nuevo, escucha la primera línea de cada NPC antes de exportar.

¿Y los gritos de combate y los esfuerzos?

Las vocalizaciones cortas de combate son el punto más débil de las voces sintéticas: gruñidos, gritos y esfuerzos son ruidos físicos, no habla. Genéralos si necesitas material provisional, pero presupuesta reemplazarlos por grabaciones o por una biblioteca de sonido antes de publicar.

¿Me da marcas de tiempo para la sincronía labial?

La exportación de subtítulos, desde Plus, te da tiempos por línea, que alcanza para bocas simples y para mostrar subtítulos. Datos por fonema para sincronía labial completa no entran en esta versión.

¿Maneja nombres inventados de fantasía o ciencia ficción?

Los adivina, y se equivoca con cualquier cosa poco común. No hay forma de corregir la pronunciación aparte, así que decide una grafía que se lea bien —reescrita o separada con guiones— y úsala en todas las líneas del guion, que en un juego con un mundo con nombres propios es un cambio que conviene hacer el primer día.

¿Cuántas voces me tocan?

La biblioteca es la misma en todos los planes, así que ningún plan te da más voces. Lo que dan los planes de pago son más personajes por proyecto, exportación SRT desde Plus y, en Pro, emoción línea por línea y una pista por personaje. En español puedes usar hasta treinta y dos voces distintas en una misma escena, veinte de ellas nativas: es el mismo techo que en inglés. La lista de voces no es un muro de pago.

Reparte tu primera escena esta noche

Pega un guion, deja que CastDub le dé una voz propia a cada personaje y exporta un audiodrama terminado.

Empieza gratis

Sin tarjeta. Free te da una bolsa única de créditos.