De un guion a un presentador que habla: primero la voz, después el lip-sync

Convertir un guion en presentador son dos generaciones: un modelo de voz lee el texto y un modelo de lip-sync pone ese audio en una cara. El paso de la voz es barato como para repetirlo diez veces; el de la cara no. Este es el orden que ahorra créditos, con cifras medidas.

Publicado:

Tres etapas sobre un escritorio oscuro unidas por líneas índigo delgadas: una tarjeta pequeña en blanco, una onda de sonido ámbar que sube desde una placa de bronce y un retrato enmarcado bastante más grande de una persona hablando.

Un presentador que habla son dos generaciones, no una. Primero un modelo de voz lee tu guion y produce un archivo de audio; después un modelo de lip-sync toma ese archivo y un retrato, y anima la cara. El orden importa menos que la economía: en LUVI el paso de la voz cuesta decenas de créditos y el de la cara, miles, así que todo el oficio de este flujo está en dejar la lectura bien antes de animar nada.

Paso uno: convertir el guion en voz

En el catálogo hay siete modelos de texto a voz, y se cobran por carácter y no por clip: por cada 1000 caracteres, de forma lineal y sin redondeo por bloques. Un párrafo de 600 caracteres cuesta alrededor de seis décimas de la tarifa de mil.

La escalera, verificada el 22 de septiembre de 2026:

Como el precio sigue al número de caracteres, este es el único paso de la cadena que puedes permitirte repetir. Reescribir una frase y volver a leer todo el guion cuesta muy poco en créditos, y es el lugar más barato posible para descubrir que una línea no suena a persona.

¿Qué modelo de voz y cómo se dirige?

ElevenLabs v3 es el que más control ofrece. Expone 21 voces con nombre, un control de stability de 0 a 1, un campo language_code que fuerza un idioma y un interruptor de normalización de texto con auto, on y off, que decide si los números se leen con letras. Conviene atender a su propia nota: las voces multilingües admiten todos los idiomas, mientras que las demás están afinadas a su idioma nativo y cambian el campo de idioma si las eliges.

Ese interruptor de normalización es el que pasa desapercibido. Un guion con "2026" o "1250 pesos" suena muy distinto según si el modelo lo deletrea o no, y auto no siempre elige lo que elegiría un presentador. Si tu guion está lleno de cifras, ajústalo a conciencia.

Paso dos: poner la voz en una cara

Ahora el audio es el reloj. Los modelos de lip-sync que parten de un retrato cobran por segundo de audio, así que el largo del archivo que acabas de hacer es el tamaño de la cuenta:

  • OmniHuman 1.5 toma un retrato y hasta 60 segundos de audio.
  • VEED Fabric 1.0 toma hasta 300 segundos.
  • InfiniteTalk toma hasta diez minutos, en 480p o 720p, y es la única opción cuando el guion se alarga.

El retrato quiere lo mismo que pide una buena foto de perfil: de frente, con luz pareja, sin sombra dura cruzando la boca y sin nada que corte la línea de la mandíbula.

¿Cuánto cuesta la cadena completa?

Un ejemplo medido, con estimaciones tomadas el 22 de septiembre de 2026. El guion es un solo párrafo de unos 600 caracteres, más o menos cuarenta segundos leídos a un ritmo natural.

  • Voz, con Gemini 2.5 Flash TTS: 49 créditos.
  • Cara, con OmniHuman 1.5 y esos cuarenta segundos de audio: 9600 créditos.

El paso de la cara cuesta unas doscientas veces el de la voz. Esa sola proporción es todo el argumento del orden que propone este artículo: genera la voz, escúchala, corrige el guion, vuelve a generarla, y recién cuando la lectura esté bien gasta algo en la imagen. Recortar dos segundos de silencio al inicio del audio rinde más aquí que cualquier prompt que puedas escribir.

Cómo lo verificamos

  • Modelos: los siete modos de texto a voz del catálogo de audio, más bytedance/avatar-omni-human-v1.5, veed/fabric-1.0/image-to-video y el modo InfiniteTalk.
  • Qué se leyó: los parámetros y las ranuras de referencia de cada modo, y su precio, tomados tanto del código de catálogo de la aplicación como de las páginas públicas de modelo en vivo; las dos fuentes coincidieron en todas las cifras de arriba.
  • Fecha y corridas: 22 de septiembre de 2026. Los dos números del ejemplo son estimaciones en vivo para un guion de 600 caracteres y una pista de audio de cuarenta segundos.
  • Resultados: 49 créditos para la voz, 9600 créditos para la cara animada, y la escalera por cada 1000 caracteres tal como se lista.
  • Limitaciones: No se generó ninguna salida para este artículo, así que no afirma nada sobre la calidad de la voz ni de la sincronización. Cuarenta segundos es una estimación de tiempo de lectura, no la medición de un archivo concreto: lo que cobrará el segundo paso es el largo de tu propio audio.

En LUVI

Puedes hacerlo en dos pasos dentro del espacio de trabajo, y para algo puntual es la vía más rápida: genera el audio, búscalo en tu biblioteca y abre el modelo de lip-sync para soltar el retrato y el audio en sus dos ranuras.

Para cualquier cosa que vayas a repetir, ármalo como flujo de trabajo. El lienzo de nodos conecta la salida de audio directo a la ranura de audio del modelo de lip-sync, de modo que un cambio en el guion vuelve a correr toda la cadena sin que andes moviendo archivos, y la estimación del grafo completo aparece antes de correrlo. Los flujos de trabajo funcionan solo en computadora.

La misma cadena se puede manejar desde Claude o ChatGPT con el conector de LUVI, y aquí sirve de verdad: el asistente puede guardar el guion, ajustar una línea y volver a correr solo el paso de la voz hasta que la lectura quede bien.

¿Recién llegas? Crea una cuenta de LUVI y gasta tus primeros créditos en dos o tres versiones de la voz antes de animar nada.

Fuentes

  • OmniHuman-1.5. OmniHuman Lab, página del proyecto (en inglés). Consultado el 22 de septiembre de 2026.
  • ElevenLabs. ElevenLabs, sitio del producto (en inglés). Consultado el 22 de septiembre de 2026.

Más de Flujos de trabajo