Six façons de faire parler un visage sur LUVI, et la différence qui fixe le prix
LUVI compte six familles de lip-sync, et elles font deux métiers : quatre animent un portrait fixe à partir d'une piste audio, deux resynchronisent la bouche d'une vidéo que vous avez déjà. Le métier décide aussi de l'horloge facturée, secondes d'audio ou secondes de vidéo.

Le catalogue LUVI compte six familles de lip-sync, et l'erreur la plus fréquente consiste à en choisir une pour un travail qu'elle ne fait pas. Quatre prennent un portrait fixe et une piste audio, puis animent le visage. Deux prennent une vidéo qui existe déjà et resynchronisent sa bouche sur un nouvel audio. L'un ne remplace pas l'autre, et le groupe dans lequel vous vous trouvez décide aussi de l'horloge sur laquelle vos crédits sont comptés.
Quel travail faites-vous ?
Regardez ce que vous avez en main. Une photographie mène au premier groupe, un plan de quelqu'un qui parle au second.
Un portrait plus de l'audio, transformé en vidéo parlante :
- OmniHuman 1.5 : le modèle de ByteDance, audio jusqu'à 60 secondes. Ses auteurs le décrivent au-delà du mouvement des lèvres : il interprète le contexte sémantique de l'audio, dépasse la simple synchronisation labiale et permet aux personnages de montrer de vrais glissements émotionnels et d'accorder leurs gestes à leurs mots et à leur intention.
- VEED Fabric 1.0 et sa variante rapide : audio d'une seconde à 300, avec des paliers de résolution.
- InfiniteTalk : l'option format long, qui accepte jusqu'à dix minutes d'audio, en 480p ou 720p.
- Kling Avatar, en palier standard et pro, visant les clips de profil, les génériques et les réseaux.
Une vidéo existante plus un nouvel audio, lèvres réentraînées :
- Sync Lipsync v3 : le modèle de sync.so, pour le doublage et la voix off, vidéo jusqu'à 60 secondes.
- VEED Lipsync : la voie de doublage économique, également plafonnée à 60 secondes de vidéo.
Quelle horloge payez-vous ?
C'est la partie qui surprend. Dans le premier groupe, le compteur tourne sur l'audio ; dans le second, sur la vidéo. Le même travail dans l'esprit, deux grandeurs mesurées différentes.
À cinq secondes, vérifié le 22 septembre 2026, l'écart est large :
- VEED Lipsync : à partir de 130 crédits.
- InfiniteTalk : à partir de 60 crédits par génération.
- OmniHuman 1.5 : à partir de 1 200 crédits.
- VEED Fabric 1.0 : à partir de 1 650 crédits, et 2 200 sur la variante rapide.
- Sync Lipsync v3 : à partir de 2 200 crédits.
Deux conséquences pratiques. D'abord, doubler un plan existant avec VEED Lipsync revient un ordre de grandeur moins cher que réanimer un portrait sur le même texte : si vous avez déjà les images, servez-vous-en. Ensuite, sur les modèles de portrait, la durée de votre piste de voix est la durée de votre facture, donc couper deux secondes de silence au début d'un fichier audio est une économie réelle, et sur OmniHuman c'est précisément ce que compte le compteur.
Quelle durée d'entrée est acceptée ?
Les plafonds diffèrent plus que les prix ne le laissent croire, et ce sont des limites strictes de l'emplacement, pas des conseils.
- 60 secondes : OmniHuman 1.5 (audio), Sync Lipsync v3 (vidéo), VEED Lipsync (vidéo).
- 300 secondes : VEED Fabric 1.0 et Fabric 1.0 Fast (audio).
- Dix minutes : InfiniteTalk (audio).
Si votre texte dépasse la minute, cette seule ligne fait passer six options à trois. Et s'il dépasse cinq minutes, elle les ramène à une.
Que leur donne-t-on exactement ?
Chacun prend exactement deux entrées, et les emplacements sont typés : celui de l'image n'accepte pas une vidéo, et celui de l'audio est obligatoire.
- Le groupe portrait veut un visage net et de face. La discipline qui aide une photo à devenir un maillage 3D aide ici aussi : lumière régulière, pas d'ombre dure en travers de la bouche, rien qui coupe la mâchoire.
- Le groupe vidéo veut une tête parlante déjà à peu près synchrone avec quelque chose. Resynchroniser les lèvres d'un plan où la personne est de dos ou à moitié hors champ est la cause habituelle d'un résultat qui paraît collé.
- OmniHuman accepte un prompt texte facultatif pour affiner ; InfiniteTalk aussi, et il ajoute un seed et un choix de résolution. Les deux modèles partant d'une vidéo n'acceptent aucun prompt : l'instruction, c'est l'audio.
Ce que nous avons vérifié
- Modèles :
bytedance/avatar-omni-human-v1.5,veed/fabric-1.0/image-to-videoet sa variante rapide,veed/lipsync,sync/lipsync-v3, la variante InfiniteTalk et les variantes avatar de Kling v2.6. - Sources lues : pour chaque variante, les emplacements de référence, les limites de durée d'entrée, les paramètres et le prix, relevés à la fois dans le code de catalogue de l'application et sur les pages publiques de modèle en ligne.
- Date : 22 septembre 2026.
- Résultats : les montants de départ ci-dessus étaient identiques dans les deux sources pour chaque famille. Les plafonds de durée viennent des définitions d'emplacement : 60 secondes sur OmniHuman, Sync et VEED Lipsync, 300 sur VEED Fabric, dix minutes sur InfiniteTalk.
- Limites : Aucune génération n'a été produite pour cet article, il n'avance donc rien sur la qualité de la synchronisation ni de la ressemblance. Les montants sont des planchers : sur les familles facturées à la seconde, un audio ou une vidéo plus longue coûte davantage, donc regardez l'estimation dans l'espace de travail avant une prise longue.
Lequel choisir ?
- Vous avez des images et il vous les faut dans une autre langue. VEED Lipsync d'abord, pour le coût ; Sync Lipsync v3 quand la bouche doit tenir en gros plan.
- Vous avez une photo et un texte court. OmniHuman 1.5, pour le travail de geste et d'expression que décrivent ses auteurs, et pas seulement pour le mouvement des lèvres.
- Vous avez une photo et un texte long. InfiniteTalk, parce que c'est le seul à accepter dix minutes d'audio en une passe.
- Il vous faut une série de clips courts pour les réseaux à partir d'un portrait. Kling Avatar ou VEED Fabric, en vérifiant l'estimation pour votre durée exacte avant de les lancer.
Sur LUVI, ils se trouvent dans l'espace de travail comme n'importe quel modèle : vous le choisissez, vous remplissez les deux emplacements, et l'estimation en crédits s'affiche avant le lancement. Si vous devez d'abord fabriquer la piste de voix, les modèles audio du même compte le font, et toute la chaîne peut être montée en workflow ou pilotée depuis Claude avec le connecteur LUVI.
Vous débutez ? Créez un compte LUVI et testez sur cinq secondes d'audio avant d'engager un texte entier.
Sources
- OmniHuman-1.5 – OmniHuman Lab, page du projet (en anglais). Consulté le 22 septembre 2026.
- sync.so – sync.so, site produit (en anglais). Consulté le 22 septembre 2026.
- VEED – VEED, site produit (en anglais). Consulté le 22 septembre 2026.
À lire aussi dans Comparatifs
- Le prompt négatif a presque disparu : comment exclure quelque chose sans luiQuatre des 224 modèles du catalogue LUVI exposent un champ de prompt négatif, et tous sont des Qwen Image. Le champ a disparu avec la méthode d'échantillonnage dont il dépendait. Voici ce qui le remplace dans chaque famille et les trois endroits où « no X » fonctionne encore.
- Higgsfield, Krea, OpenArt ou LUVI : quel connecteur MCP pour générer depuis Claude ou ChatGPT ?Higgsfield, Krea, OpenArt et LUVI Creator ont tous un connecteur MCP hébergé qui permet à Claude ou à ChatGPT de générer sur votre compte. Ce qui les distingue : le prix affiché ou non avant la génération, le nombre de modèles et l’accès de l’assistant au guide de prompt de chaque modèle.
- Quels modèles vidéo de LUVI génèrent du son, et la ligne dont chacun a besoinLa plupart des modèles vidéo de LUVI fabriquent désormais leur son en même temps que l'image, mais ils divergent sur tout le reste : interrupteur activé ou non, surcoût ou non, et façon d'écrire l'audio. Voici l'interrupteur et la syntaxe de chaque famille, vérifiés sur leurs schémas.