Hay planos de vídeo con IA que da pena borrar: el movimiento, la luz y la composición funcionan, pero el personaje dice mal el diálogo. Cortar el audio de otro plano puede servir para salir del paso, aunque las pausas, la emoción y el sonido del espacio suelen delatar el arreglo. Es más estable conservar primero la imagen y rehacer el sonido por separado.
Primero: ¿fallan las palabras o solo la voz?
Si hay palabras equivocadas, omisiones o pausas extrañas, hace falta texto a voz para grabar el diálogo correcto. Marca el primer y el último fotograma en que habla el personaje, divide el texto por plano y anota pausas y énfasis. Los primeros planos de boca requieren cuidado. Cambiar el audio no corrige por sí solo el movimiento de los labios. Si la nueva frase dura mucho más o menos, habrá que regenerar ese plano o añadir una fase aparte de sincronización labial.
Cuando el diálogo y el ritmo ya son correctos, pero la voz no encaja con el personaje, conviene usar conversión de voz. Conserva la interpretación existente y cambia el timbre. No corrige palabras equivocadas, y una línea nueva de texto a voz tampoco se ajusta automáticamente a la boca del plano original.

Modelos abiertos que vale la pena probar
No hace falta apostar por un solo modelo. CosyVoice es una opción para rehacer diálogos y probar clonación de voz multilingüe. F5-TTS merece compararse con la misma muestra. IndexTTS2 destaca el control de duración y resulta útil cuando una frase debe encajar en un plano fijo. Si el contenido y el ritmo ya están bien y solo hay que unificar la voz, una solución de conversión como Seed-VC encaja mejor. Prueba todos con la misma referencia, el mismo texto y la misma exportación; luego compara dicción, emoción, duración y facilidad de edición.
La referencia de voz debe ser limpia, con poca música, reverberación o voces superpuestas. Guarda una ficha de voz y un guion por personaje. Los controles de velocidad, pausas, emoción y tono cambian según el modelo y la interfaz, así que conviene probar frases cortas antes de procesar un episodio entero.
Los efectos necesitan modelos de efectos
Pasos, puertas, ropa, armas y ambiente siguen otra cadena de trabajo. Woosh, publicado por Sony AI, genera efectos a partir de texto o vídeo. MMAudio también puede generar audio sincronizado desde vídeo y texto. Sirven para acciones y ambiente, no para el diálogo de los personajes. Alinea el sonido con el fotograma de la acción y ajusta volumen, distancia y relación con la música durante la mezcla.

Consentimiento y registros
Obtén autorización antes de clonar la voz de un actor o de una persona real. Conserva la versión del guion, el origen de la referencia, la versión del modelo, los resultados generados y el proyecto de mezcla. Que el código sea abierto no significa que todo uso comercial esté permitido: revisa por separado la licencia del modelo, la música, las tipografías y los materiales. Para coordinar personajes, doblaje, efectos y posproducción, los servicios de producción de short dramas con IA ayudan a encontrar equipos que manejan el flujo completo.