MiniMax H3, Gemini Omni 1.1 ou Wan 3.0 : trois modèles audio-vidéo, trois façons d’écrire le prompt
Les trois génèrent image et son en un seul passage, et aucun ne lit le prompt comme les autres : H3 attend un document à champs, Omni une légende avec une clause de continuité, Wan une formule additive. Les prix, les limites, et la règle qui fait échouer chacun d’eux.

Trois modèles vidéo sont arrivés sur LUVI à une semaine d’écart en septembre, avec la même promesse en titre : un son généré en même temps que l’image, dialogues compris. Ils ne partagent pas la même langue de prompt. Nous avons écrit un guide de prompt pour chacun à partir de la documentation de son éditeur, et cette comparaison est ce qui en est ressorti.
Les chiffres
- Prix de base sur LUVI. H3 à partir de 2 080 crédits pour 8 s (H3 Max : 1 216). Omni 1.1 Flash à partir de 2 200 crédits pour 10 s. Wan 3.0 à partir de 2 000 crédits pour 5 s (Prime : 2 800).
- Résolutions natives. H3 : 480P, 768P, 2K. Omni : 360p et 720p, le 1080p et le 4K passant par l’agrandisseur de Google. Wan : 480p, 720p, 1080p.
- Durée du clip. H3 : 4 à 15 s. Omni : 3 à 10 s, prolongeable jusqu’à 40 s. Wan : jusqu’à 30 s.
- Modes sur LUVI. H3 : texte, image, référence. Omni : texte, image, référence, retouche, prolongation. Wan : texte, image, référence.
- Langues de dialogue. H3 : 11 (le turc n’en fait pas partie). Omni : l’anglais est évalué, les autres langues peuvent fonctionner. Wan : chinois et anglais.
- Médias de référence. H3 : jusqu’à 9 images, 3 clips, 3 audios, 12 fichiers au total. Omni : des images et jusqu’à 3 clips courts, pas d’audio. Wan : jusqu’à 10 images, 5 clips, 5 audios, 20 fichiers.
MiniMax H3 : pourquoi le prompt est-il un document ?
Parce que H3 ne veut pas d’une légende. Il attend trois champs nommés, integrated_multimodal_description, overall_soundscape et non_diegetic_music, et il les attend tous les trois à chaque fois. Omettez un champ audio et le modèle ne se tait pas : il invente. La caméra s’écrit en prose à partir de douze verbes précis et de quatre modificateurs (« The camera pushes in with small amplitude at slow speed toward… »), les coupes sont datées à la milliseconde (« [Shot 2] At 00:03.500, the camera cuts to… »), et le dialogue se loge dans une balise avec sa langue : <d>[English] I get off at the next station.</d>. Un nom propre, qu’il s’agisse d’une célébrité, d’un film ou d’une marque, bloque toute la requête. Les commandes de caméra entre crochets de l’ancienne gamme Hailuo sont ici une syntaxe morte.
Son point fort : les séquences scénarisées à plusieurs plans avec dialogues, et les packs de références qui verrouillent un visage et une voix à la fois.
Gemini Omni 1.1 : pourquoi une légende doit-elle réclamer un plan unique ?
Parce qu’Omni coupe par défaut. Le modèle est d’un tempérament opposé : une légende de 45 mots en prose simple est le prompt idéal, et il complète le monde tout seul. Le piège, c’est que si vous demandez un plan au bord d’un lac, vous pouvez recevoir trois plans enchaînés au lieu d’un. Tout prompt à plan unique a besoin d’une clause de continuité dès la première phrase (« In a single unbroken scene… »). Le son va dans sa propre phrase derrière « Sound design: », la musique doit être demandée explicitement, et le dialogue s’écrit avec un deux-points et sans guillemets : des guillemets gravent les mots dans l’image sous forme de texte à l’écran. Il n’y a pas de champ négatif, les exclusions sont des fragments placés en fin de prompt (« No dialogue. No text overlay on screen. »). Une retouche tient en une proposition suivie de « Keep everything else the same. »
Son point fort : des clips rapides, peu coûteux et d’aspect naturel, des retouches conversationnelles, et la prolongation d’un clip que vous avez déjà.
Wan 3.0 : qu’est-ce que la formule additive ?
C’est l’ordre de lecture qu’Alibaba publie, et le modèle lit le prompt dans cet ordre : entité + décor + mouvement, puis contrôle esthétique + stylisation, puis son (voix = répliques + émotion + tonalité + vitesse + timbre + accent, effets = source + action + ambiance, musique = partition + style), puis l’enchaînement de plans sous la forme « Shot 1 [0–3 s] … Shot 2 [4–6 s] Hard cut transition, fixed camera… ». Les médias importés sont désignés par leur nom et employés comme des noms communs : « The cat in Image 1 plays in the room in Image 2. » Sa propre liste d’interdits est courte et mérite d’être apprise par cœur : pas de personne réelle nommée, pas de changements de scène rapides dans un même clip, pas de plan bâti sur un texte exact ni sur une synchronisation labiale au mot près.
Son point fort : les clips longs (30 s), les packs de références mixtes avec audio, et les dialogues en chinois.
La règle qui fait échouer chacun d’eux
- H3 : omettre un champ audio. Vous obtenez un son inventé, pas du silence.
- Omni : oublier la clause de continuité. Vous obtenez des coupes.
- Wan : nommer une personne réelle. La requête échoue.
Lequel choisir ?
Une scène de dialogue avec une distribution verrouillée : H3. Un brouillon rapide ou la retouche de quelque chose qui existe déjà : Omni. Un clip long ou un pack de références qui comprend une voix : Wan 3.0. Les trois guides sont sur les pages des modèles (MiniMax H3, Gemini Omni, Wan), et l’espace de travail les applique quand le guide de prompt est activé. Pour comprendre comment les prix en crédits ci-dessus se construisent, lisez comment fonctionnent les crédits.
Questions
Lequel est le moins cher ?
Pour un clip court à la résolution de base : Wan 3.0 à partir de 2 000 crédits (5 s), MiniMax H3 à partir de 2 080 crédits (8 s), Gemini Omni 1.1 à partir de 2 200 crédits (10 s). À la seconde, Omni est le moins cher des trois dans son réglage par défaut.
Lequel garde un personnage d’un plan à l’autre ?
Les trois acceptent des médias de référence. Wan 3.0 prend jusqu’à 20 fichiers, audio compris. H3 en prend jusqu’à 12, entre images, clips et voix. Omni accepte des images et de courts clips, mais pas d’audio.
Lequel peut être retouché après coup ?
Omni 1.1 dispose d’une variante de retouche vidéo sur LUVI, Wan 3.0 aussi (la gamme 2.7). H3 non : vous relancez la génération.
À lire aussi dans Comparatifs
- Six façons de faire parler un visage sur LUVI, et la différence qui fixe le prixLUVI compte six familles de lip-sync, et elles font deux métiers : quatre animent un portrait fixe à partir d'une piste audio, deux resynchronisent la bouche d'une vidéo que vous avez déjà. Le métier décide aussi de l'horloge facturée, secondes d'audio ou secondes de vidéo.
- Le prompt négatif a presque disparu : comment exclure quelque chose sans luiQuatre des 224 modèles du catalogue LUVI exposent un champ de prompt négatif, et tous sont des Qwen Image. Le champ a disparu avec la méthode d'échantillonnage dont il dépendait. Voici ce qui le remplace dans chaque famille et les trois endroits où « no X » fonctionne encore.
- Higgsfield, Krea, OpenArt ou LUVI : quel connecteur MCP pour générer depuis Claude ou ChatGPT ?Higgsfield, Krea, OpenArt et LUVI Creator ont tous un connecteur MCP hébergé qui permet à Claude ou à ChatGPT de générer sur votre compte. Ce qui les distingue : le prix affiché ou non avant la génération, le nombre de modèles et l’accès de l’assistant au guide de prompt de chaque modèle.