Quels modèles vidéo de LUVI génèrent du son, et la ligne dont chacun a besoin

La plupart des modèles vidéo de LUVI fabriquent désormais leur son en même temps que l'image, mais ils divergent sur tout le reste : interrupteur activé ou non, surcoût ou non, et façon d'écrire l'audio. Voici l'interrupteur et la syntaxe de chaque famille, vérifiés sur leurs schémas.

Publié:

Une rangée d'interrupteurs sur une console noire : trois brillent en ambre et une forme de son différente s'élève au-dessus de chacun, un quatrième reste éteint sans rien au-dessus, et la dernière place n'a pas d'interrupteur du tout, juste une plaque lisse.

La plupart des familles vidéo du catalogue LUVI fabriquent maintenant leur propre son : dialogue, effets, ambiance et musique sortent dans la même passe que l'image. Ce qu'elles ne partagent pas, c'est la manière de le demander. Certaines arrivent avec l'interrupteur audio activé, une arrive désactivée et facture davantage quand vous l'activez, et plusieurs n'ont aucun interrupteur, si bien que le prompt décide seul de ce que vous entendrez. Le guide Veo de Google DeepMind énonce la règle générale sans détour : « Explicitly define the sounds you want to hear, to match the audio to your visuals », autrement dit définissez explicitement les sons que vous voulez entendre. Cet article est la version famille par famille de cette phrase.

Quels modèles n'ont aucun interrupteur audio ?

Cinq familles n'exposent aucun paramètre audio sur LUVI : ce que vous entendez dépend donc entièrement du prompt. Il s'agit de MiniMax H3, Grok Imagine Video, Gemini Omni 1.1 Flash, HappyHorse et Veo 3.1 Lite. Quatre d'entre elles génèrent toujours du son. Veo 3.1 Lite fait exception dans l'autre sens : il n'a aucun paramètre audio à activer.

« Pas d'interrupteur » ne veut pas dire « même comportement », et l'écart apparaît précisément quand vous oubliez d'écrire la ligne audio :

  • HappyHorse renvoie un clip quasi muet. Il ne déduit pas le son de ce qu'il voit.
  • MiniMax H3 invente du son. Un champ audio omis est rempli, jamais laissé silencieux.
  • Grok Imagine Video donne du silence ou de l'audio aléatoire, sans moyen de demander l'un ou l'autre.

Trois familles, trois punitions différentes pour le même oubli.

L'audio est-il activé par défaut, et coûte-t-il plus cher ?

Six familles arrivent avec l'interrupteur activé et, sur celles que nous avons mesurées, cela ne change rien au prix. Seedance 2.5, Wan 3.0, FLUX 3 Video, Kling, PixVerse et Vidu Q3 activent l'audio par défaut. Deux le disent dans le paramètre lui-même : le generate_audio de Seedance 2.5 est documenté « Does not affect price », et le audio de Wan 3.0 « Same price either way ». Nous avons confronté les deux à des estimations en direct : un clip Seedance 2.5 de cinq secondes en 720p est estimé à 3 030 crédits avec l'audio activé et à 3 030 crédits une fois coupé, et un clip FLUX 3 Video de cinq secondes en 720p donne 1 870 crédits dans les deux cas.

Veo fait exception sur les deux points. Son paramètre generate_audio vaut false par défaut et sa propre description indique que l'audio « augmente le coût à la seconde ». Un clip Veo 3.1 Fast de huit secondes en 720p est estimé à 1 280 crédits sans son et à 1 536 crédits avec (vérifié le 22 septembre 2026). Le modèle qui arrive « déjà sonorisé » est donc le seul qui sorte muet et qui facture l'activation du son.

Il existe aussi un piège à l'intérieur d'une famille pourtant activée par défaut. Sur les variantes Omni O3 de Kling, sound vaut true pour texte vers vidéo et image vers vidéo, mais false pour référence vers vidéo, qui porte en plus un keep_original_sound distinct pour l'audio présent dans la référence. Si un plan de référence Kling est revenu muet, c'est de là que ça vient.

Une famille, enfin, ne fait que l'image : Hailuo ne produit ni dialogue, ni design sonore, ni musique, donc chaque mot consacré à l'audio dans un prompt Hailuo est perdu.

Comment chaque famille veut-elle que le son soit écrit ?

C'est ici que les dialectes divergent le plus. Tout ce qui suit vient des guides de prompt que LUVI applique à chaque famille.

  • Veo 3.1. L'audio s'écrit dans le plan, étiqueté : la réplique entre guillemets attribuée à quelqu'un, SFX: thunder cracks in the distance, Ambient noise: the quiet hum of a starship bridge, la musique nommée en prose. Le silence se dirige comme un contenu : « no music, only the wind ».
  • Seedance 2.5. Des canaux typés, avec les largeurs de caractères exactement telles quelles : musique entre parenthèses pleine chasse (…), effets en ASCII <…>, dialogue en ASCII {…}, sous-titres entre crochets lenticulaires 【…】. L'ambiance reste en prose ordinaire.
  • MiniMax H3. Un document à champs. Écrivez toujours overall_soundscape: et non_diegetic_music:, car un champ omis est rempli par du son inventé. Le dialogue est un bloc balisé : <d>[French] Je descends à la prochaine station.</d>.
  • Gemini Omni 1.1 Flash. Une seule phrase derrière l'étiquette Sound design: …, qui couvre effets, ambiance et dialogue. La musique doit être demandée à part, décrite par sa source et son traitement plutôt que par son genre : « a low tinny radio broadcast in the background, playing a song ».
  • FLUX 3 Video. Quatre couches : parole, ambiance, effets accrochés à une action visible, musique avec sa place dans le mixage. Une ou deux suffisent en général ; un mixage chargé est un défaut documenté.
  • HappyHorse. Une ligne de son nommée, sur trois niveaux : premier plan (dialogue, effet principal), couche intermédiaire (bruitage sur quelque chose de visible), arrière-plan (ambiance, son de salle, musique).
  • Wan 3.0. La clause sonore arrive en fin de formule additive et se répartit en voix, effet sonore et musique de fond, chacune décrite plutôt qu'énumérée.
  • Vidu Q3 et PixVerse. Le son s'écrit comme un contenu, à côté de l'image qui le justifie : audio includes soft room tone and faint spoon clink.

Pourquoi les guillemets font-ils l'inverse sur certains modèles ?

Parce que sur deux de ces familles, les guillemets sont une consigne pour mettre des mots à l'écran et non dans une bouche, et toutes deux sont assez douées en typographie pour que le risque soit réel.

Sur Gemini Omni 1.1 Flash, le dialogue s'écrit avec deux points et sans guillemets : In a crisp, thoughtful tone, Clara says: It has to be here. Les guillemets sont réservés au texte qui doit être visible, par exemple un panneau qui affiche quelque chose. Transporter l'habitude de Veo est exactement ce qui transforme une réplique en incrustation.

Sur FLUX 3 Video, les guillemets sont corrects, mais uniquement avec un locuteur visible. Une réplique entre guillemets sans personne à l'image pour la dire, et sans le mot « voiceover » ou « narration », peut ressortir en texte incrusté, ce qui découle directement du fait que Black Forest Labs met en avant la capacité de FLUX 3 à intégrer la typographie comme un élément naturel du décor.

Partout ailleurs, chez Veo, Kling, Wan, Vidu Q3 et HappyHorse, une réplique entre guillemets est de la parole. Kling veut d'abord le geste physique pour savoir quelle bouche animer, et Wan veut la voix décrite autour de la réplique. Deux modèles de Google avec deux conventions opposées : c'est l'erreur la plus coûteuse de toute cette liste.

Comment demander du silence ?

Chaque famille répond différemment, et écrire le mot « silence » est faux sur toutes.

  • Par un paramètre. Veo, Seedance 2.5, Wan 3.0, FLUX 3, Kling, PixVerse et Vidu Q3 ont un interrupteur. C'est la voie fiable.
  • En omettant le canal. Sur Seedance 2.5, vous n'écrivez pas « pas de musique » : vous laissez simplement le canal () de côté.
  • Par une valeur littérale. Sur MiniMax H3, le silence s'écrit N/A dans le champ musique. Laisser le champ de côté produit du son inventé.
  • Par une phrase. Wan supprime par une phrase finale (« No dialogue. » « No background music. ») et Gemini Omni place des fragments nus à la fin : « No dialogue. » « No music, just realistic real world sound. »
  • Pas du tout. Grok Imagine Video n'a pas de drapeau de silence. S'il vous faut un clip muet de sa part, vous retirez l'audio après coup.

Une règle vaut pour toutes : demander le silence en prose à un modèle qui possède un interrupteur produit souvent du souffle ou du vide, parce que vous continuez à demander à un modèle audio de fabriquer quelque chose. Le silence partiel, lui, s'écrit très bien partout comme un contenu : « for the final two seconds, only rain against the window. »

Ce que nous avons vérifié

  • Modèles : les variantes en service de texte vers vidéo, image vers vidéo et référence vers vidéo pour Veo 3.1, 3.1 Fast et Lite, Seedance 2.5, Wan 3.0, FLUX 3 Video, Kling v3.0 et Omni O3, PixVerse v6 et c1, Vidu Q3, MiniMax H3, Gemini Omni 1.1 Flash, HappyHorse 1.1 et Hailuo.
  • Sources lues : les schémas de paramètres et les valeurs par défaut de toutes ces variantes, les guides de prompt appliqués par LUVI à chaque famille, et les pages Google citées plus bas.
  • Date : 22 septembre 2026. Les montants en crédits proviennent d'estimations en direct sur LUVI, aux réglages indiqués dans le texte.
  • Résultats : Seedance 2.5 estimé à 3 030 crédits pour cinq secondes en 720p, son activé comme coupé ; FLUX 3 Video à 1 870 crédits dans les deux cas ; Veo 3.1 Fast à 1 280 crédits sans son et 1 536 avec, pour huit secondes en 720p.
  • Limites : Aucune génération n'a été produite pour cet article, il n'avance donc rien sur la qualité des résultats. Les valeurs par défaut et les prix ci-dessus sont un instantané : regardez l'estimation et le panneau de paramètres dans l'espace de travail avant de lancer, car un fournisseur peut changer une valeur par défaut.

Lequel choisir ?

Partez de ce que le son doit faire, pas de l'image.

  • Un personnage qui prononce des mots précis va vers la famille dont vous accepterez de suivre la convention à la lettre : Veo 3.1 pour des répliques entre guillemets avec effets et ambiance nommés, HappyHorse si la réplique est en mandarin, cantonais, japonais, coréen, allemand ou français et demande une synchronisation au phonème, MiniMax H3 si vous préférez séparer locuteurs, ambiance et musique dans des champs distincts.
  • Si la réplique est en français, vous êtes bien servi : le français figure à la fois dans les sept langues de HappyHorse et dans les langues de dialogue stables de MiniMax H3. Le choix se joue donc sur la syntaxe, pas sur la langue.
  • Un lit musical sous un plan sans parole demande une indication de musique et une place déclarée dans le mixage. Sur FLUX 3 Video ce n'est pas facultatif : un mixage fait uniquement d'ambiance et d'effets glisse vers l'inaudible.
  • Les effets accrochés à une action visible fonctionnent partout, et d'autant mieux que vous les rattachez à ce que la caméra voit au lieu de nommer le son seul.
  • Un clip que vous sonoriserez vous-même passe par l'interrupteur et non par une phrase du prompt, et gagne à éviter Grok Imagine Video, qui n'en a pas.

Dans l'espace de travail, le bouton plume applique le dialecte du modèle sélectionné : c'est le moyen le plus rapide d'arrêter de transporter la syntaxe audio d'une famille vers une autre. Voir à quoi sert le bouton plume et ce qu'est un guide de prompt. Vous pouvez aussi demander le manuel depuis Claude ou ChatGPT avec le connecteur LUVI.

Vous débutez ? Créez un compte LUVI et testez votre ligne de son sur le clip court le moins cher de la famille retenue.

Sources

À lire aussi dans Comparatifs