D'un script à un présentateur qui parle : d'abord la voix, ensuite le lip-sync

Transformer un script en présentateur demande deux générations : un modèle de voix lit le texte, puis un modèle de lip-sync pose cet audio sur un visage. L'étape voix est assez peu chère pour être refaite dix fois, l'étape visage non. Voici l'ordre qui économise les crédits.

Publié:

Trois étapes posées sur un bureau sombre et reliées par de fines lignes indigo : une petite carte vierge, une onde sonore ambrée qui s'élève d'une plaque de laiton, et un portrait encadré nettement plus grand d'une personne en train de parler.

Un présentateur qui parle, ce sont deux générations et non une. D'abord un modèle de voix lit votre script et produit un fichier audio ; ensuite un modèle de lip-sync prend ce fichier et un portrait, puis anime le visage. L'ordre compte moins que l'économie : sur LUVI l'étape voix coûte des dizaines de crédits et l'étape visage des milliers, si bien que tout le métier de ce workflow consiste à régler la lecture avant d'animer quoi que ce soit.

Première étape : transformer le script en voix

Sept modèles de synthèse vocale figurent au catalogue, et ils se facturent au caractère et non au clip : par tranche de 1 000 caractères, de façon linéaire et sans arrondi par blocs. Un paragraphe de 600 caractères coûte environ six dixièmes du tarif des mille.

L'échelle, vérifiée le 22 septembre 2026 :

Comme le prix suit le nombre de caractères, c'est la seule étape de la chaîne que vous pouvez vous permettre de refaire. Réécrire une phrase et relire tout le script coûte très peu en crédits, et c'est l'endroit le moins cher possible pour découvrir qu'une réplique ne sonne pas comme une personne.

Quel modèle de voix, et comment le diriger ?

ElevenLabs v3 est celui qui offre le plus de prise. Il expose 21 voix nommées, un réglage stability de 0 à 1, un champ language_code qui impose une langue, et un interrupteur de normalisation du texte avec auto, on et off, qui décide si les nombres sont épelés. Sa propre note mérite attention : les voix multilingues acceptent toutes les langues, tandis que les autres sont calées sur leur langue d'origine et modifient le champ de langue si vous les choisissez.

Cet interrupteur de normalisation est le piège discret. Un script contenant « 2026 » ou « 1 250 € » se lit très différemment selon que le modèle l'épelle ou non, et auto ne tranche pas toujours comme le ferait un présentateur. Si votre texte est plein de chiffres, réglez-le volontairement.

Deuxième étape : poser la voix sur un visage

L'audio devient alors l'horloge. Les modèles de lip-sync qui partent d'un portrait facturent à la seconde d'audio, donc la durée du fichier que vous venez de fabriquer est la taille de la facture :

  • OmniHuman 1.5 prend un portrait et jusqu'à 60 secondes d'audio.
  • VEED Fabric 1.0 va jusqu'à 300 secondes.
  • InfiniteTalk accepte jusqu'à dix minutes, en 480p ou 720p, et devient la seule option dès que le script s'allonge.

Le portrait demande ce que demande un bon portrait tout court : de face, éclairé régulièrement, sans ombre dure en travers de la bouche et sans rien qui coupe la ligne de la mâchoire.

Combien coûte la chaîne entière ?

Un exemple mesuré, en estimations relevées le 22 septembre 2026. Le script est un paragraphe d'environ 600 caractères, soit à peu près quarante secondes lues à un rythme naturel.

  • Voix, sur Gemini 2.5 Flash TTS : 49 crédits.
  • Visage, sur OmniHuman 1.5 avec ces quarante secondes d'audio : 9 600 crédits.

L'étape visage vaut environ deux cents fois l'étape voix. Ce seul rapport justifie entièrement l'ordre proposé ici : générez la voix, écoutez-la, corrigez le script, régénérez la voix, et ne dépensez pour l'image qu'une fois la lecture juste. Couper deux secondes de silence au début du fichier audio rapporte davantage ici que n'importe quel prompt.

Ce que nous avons vérifié

  • Modèles : les sept variantes de synthèse vocale du catalogue audio, plus bytedance/avatar-omni-human-v1.5, veed/fabric-1.0/image-to-video et la variante InfiniteTalk.
  • Sources lues : pour chaque variante, les paramètres, les emplacements de référence et le prix, relevés à la fois dans le code de catalogue de l'application et sur les pages publiques de modèle ; les deux concordaient sur tous les chiffres ci-dessus.
  • Date et exécutions : 22 septembre 2026. Les deux montants de l'exemple sont des estimations en direct pour un script de 600 caractères et une piste audio de quarante secondes.
  • Résultats : 49 crédits pour la voix, 9 600 crédits pour le visage animé, et l'échelle par 1 000 caractères telle que listée.
  • Limites : Aucune génération n'a été produite pour cet article, il n'avance donc rien sur la qualité de la voix ni de la synchronisation. Quarante secondes est une estimation de durée de lecture et non la mesure d'un fichier précis : c'est la durée de votre propre audio que facturera la deuxième étape.

Sur LUVI

Vous pouvez le faire en deux étapes dans l'espace de travail, et pour un coup unique c'est le plus rapide : générez l'audio, retrouvez-le dans votre bibliothèque, puis ouvrez le modèle de lip-sync et déposez le portrait et l'audio dans ses deux emplacements.

Pour tout ce que vous répéterez, montez-le plutôt en workflow. Le canevas de nœuds branche la sortie audio directement sur l'emplacement audio du modèle de lip-sync : une modification du script relance toute la chaîne sans que vous déplaciez de fichiers, et l'estimation du graphe entier s'affiche avant le lancement. Les workflows fonctionnent uniquement sur ordinateur.

La même chaîne se pilote depuis Claude ou ChatGPT avec le connecteur LUVI, et c'est ici réellement utile : l'assistant garde le script, ajuste une réplique et relance la seule étape voix jusqu'à ce que la lecture soit juste.

Vous débutez ? Créez un compte LUVI et consacrez vos premiers crédits à deux ou trois versions de la voix avant d'animer quoi que ce soit.

Sources

  • OmniHuman-1.5 – OmniHuman Lab, page du projet (en anglais). Consulté le 22 septembre 2026.
  • ElevenLabs – ElevenLabs, site produit (en anglais). Consulté le 22 septembre 2026.

À lire aussi dans Workflows