Qué modelos de video de LUVI generan sonido, y la línea que necesita cada uno
Casi todos los modelos de video de LUVI ya generan sonido en la misma pasada que la imagen, pero no se parecen en nada más: si el interruptor viene prendido, si cuesta más y cómo hay que escribir el audio. Aquí está el interruptor y la sintaxis de cada familia, verificados contra sus esquemas.

Casi todas las familias de video del catálogo de LUVI ya generan su propio sonido: diálogo, efectos, ambiente y música salen en la misma pasada que la imagen. Lo que no comparten es la forma de pedirlo. Algunas llegan con el interruptor de audio prendido, una llega apagada y cobra más cuando la prendes, y varias no tienen interruptor, así que lo único que decide si escuchas algo es el prompt. La propia guía de Veo de Google DeepMind enuncia la regla general: "Explicitly define the sounds you want to hear, to match the audio to your visuals", es decir, define explícitamente los sonidos que quieres escuchar. Este artículo es esa frase familia por familia.
¿Qué modelos no tienen interruptor de audio?
Cinco familias no exponen ningún parámetro de audio en LUVI, así que lo que escuchas lo decide por completo el prompt: MiniMax H3, Grok Imagine Video, Gemini Omni 1.1 Flash, HappyHorse y Veo 3.1 Lite. Cuatro de ellas siempre generan sonido. Veo 3.1 Lite es la excepción por el otro lado: no tiene ningún parámetro de audio que prender.
Que no haya interruptor no significa que se porten igual, y la diferencia aparece justo cuando te olvidas de escribir la línea de audio:
- HappyHorse devuelve un clip casi mudo. No deduce el sonido de lo que ve.
- MiniMax H3 inventa sonido. Un campo de audio vacío se rellena, nunca se deja en silencio.
- Grok Imagine Video te da silencio o audio aleatorio, y no hay manera de pedir ninguno de los dos.
Tres familias, tres castigos distintos para el mismo olvido.
¿El audio viene prendido y cuesta más?
Seis familias llegan con el interruptor prendido y, en las que medimos, eso no cambia el precio. Seedance 2.5, Wan 3.0, FLUX 3 Video, Kling, PixVerse y Vidu Q3 traen el audio activado por defecto. Dos lo dicen en el propio parámetro: el generate_audio de Seedance 2.5 está documentado como "Does not affect price", y el audio de Wan 3.0 como "Same price either way". Comprobamos las dos cosas contra estimaciones en vivo: un clip de cinco segundos de Seedance 2.5 en 720p se estima en 3030 créditos con el audio prendido y en 3030 créditos apagado, y un clip de cinco segundos de FLUX 3 Video en 720p da 1870 créditos en los dos casos.
Veo es la excepción en ambos puntos. Su parámetro generate_audio viene en falso y su propia descripción dice que el audio "aumenta el costo por segundo". Un clip de ocho segundos de Veo 3.1 Fast en 720p se estima en 1280 créditos con el audio apagado y en 1536 con el audio prendido (verificado el 22 de septiembre de 2026). O sea que el modelo que llega "ya musicalizado" es el único que sale mudo y te cobra por encenderle el sonido.
Dentro de una familia que por defecto viene prendida hay una trampa. En los modos Omni O3 de Kling, sound está en verdadero para texto a video e imagen a video, pero en falso para referencia a video, que además trae un keep_original_sound aparte para el audio que venga en la referencia. Si un plano de referencia de Kling salió mudo, por ahí va.
Y una familia es solo imagen: Hailuo no produce diálogo, ni diseño sonoro, ni música, así que cada palabra que le dediques al audio en un prompt de Hailuo se pierde.
¿Cómo quiere cada familia que escribas el sonido?
Aquí es donde más se separan los dialectos. Todo lo que sigue sale de las guías de prompts que LUVI aplica a cada familia.
- Veo 3.1. El audio va dentro de la toma, etiquetado: la línea hablada entre comillas y atribuida a alguien,
SFX: thunder cracks in the distance,Ambient noise: the quiet hum of a starship bridge, y la música nombrada en prosa. El silencio se dirige como contenido: "no music, only the wind". - Seedance 2.5. Canales tipados, con los anchos de carácter exactamente así: música entre paréntesis anchos
(…), efectos en ASCII<…>, diálogo en ASCII{…}, subtítulos en corchetes lenticulares【…】. El ambiente va en prosa normal. - MiniMax H3. Un documento con campos. Escribe siempre
overall_soundscape:ynon_diegetic_music:, porque un campo omitido se rellena con sonido inventado. El diálogo es un bloque etiquetado:<d>[Spanish] Me bajo en la próxima estación.</d>. - Gemini Omni 1.1 Flash. Una sola frase detrás de la etiqueta
Sound design: …, con efectos, ambiente y diálogo. La música hay que pedirla aparte, y descrita por su fuente y su tratamiento, no por su género: "a low tinny radio broadcast in the background, playing a song". - FLUX 3 Video. Cuatro capas: voz, ambiente, efectos atados a una acción visible, y música con su lugar en la mezcla. Una o dos suele ser lo correcto; una mezcla cargada es una falla documentada.
- HappyHorse. Una línea de audio con nombre, en tres niveles: primer plano (diálogo, efecto principal), capa media (Foley sobre algo visible) y fondo (ambiente, ruido de sala, música).
- Wan 3.0. La cláusula de sonido va al final de la fórmula aditiva y se parte en voz, efecto y música de fondo, cada una descrita en vez de enumerada.
- Vidu Q3 y PixVerse. El sonido se escribe como contenido junto a la imagen que lo justifica:
audio includes soft room tone and faint spoon clink.
¿Por qué las comillas significan lo contrario en unos modelos que en otros?
Porque en dos de estas familias las comillas son una instrucción para poner palabras en la pantalla y no en una boca, y las dos son lo bastante buenas con la tipografía como para que el riesgo sea real.
En Gemini Omni 1.1 Flash el diálogo lleva dos puntos y ninguna comilla: In a crisp, thoughtful tone, Clara says: It has to be here. Las comillas quedan reservadas para el texto que sí debe verse, como un letrero que dice algo. Traer la costumbre de Veo es exactamente lo que convierte una línea de diálogo en un rótulo.
En FLUX 3 Video las comillas son correctas, pero solo con alguien visible que hable. Una línea entrecomillada sin nadie en cuadro para decirla, y sin la palabra "voiceover" o "narration", puede salir como texto impreso sobre la imagen, algo que se desprende de que Black Forest Labs presuma de que FLUX 3 integra la tipografía como parte natural de la escena.
En el resto (Veo, Kling, Wan, Vidu Q3, HappyHorse) una línea entre comillas es habla. Kling quiere primero el gesto físico para saber a quién mover la boca, y Wan quiere la voz descrita alrededor de la línea. Dos modelos de Google con convenciones opuestas: es lo más caro de equivocar en toda esta lista.
¿Cómo se pide silencio?
Cada familia responde distinto, y escribir la palabra "silencio" está mal en todas.
- Con un parámetro. Veo, Seedance 2.5, Wan 3.0, FLUX 3, Kling, PixVerse y Vidu Q3 tienen interruptor. Ese es el camino confiable.
- Omitiendo el canal. En Seedance 2.5 no pides "sin música": simplemente no escribes el canal
(). - Con un valor literal. En MiniMax H3 el silencio se escribe como
N/Aen el campo de música. Dejar el campo afuera produce sonido inventado. - Con una frase. Wan suprime con una frase al final ("No dialogue." "No background music.") y Gemini Omni pone fragmentos sueltos al cierre: "No dialogue." "No music, just realistic real world sound."
- De ninguna manera. Grok Imagine Video no tiene bandera de silencio. Si necesitas un clip mudo de ahí, le quitas el audio después.
Hay una regla común a todas: pedir silencio en prosa a un modelo que tiene interruptor tiende a producir estática o aire muerto, porque le sigues pidiendo al modelo de audio que genere algo. El silencio parcial es otra cosa y funciona en todas partes como contenido: "for the final two seconds, only rain against the window."
Cómo lo verificamos
- Modelos: los modos en vivo de texto a video, imagen a video y referencia a video de Veo 3.1, 3.1 Fast y Lite, Seedance 2.5, Wan 3.0, FLUX 3 Video, Kling v3.0 y Omni O3, PixVerse v6 y c1, Vidu Q3, MiniMax H3, Gemini Omni 1.1 Flash, HappyHorse 1.1 y Hailuo.
- Qué se leyó: los esquemas de parámetros y los valores por defecto de todos esos modos, las guías de prompts que LUVI aplica a cada familia, y las páginas de Google enlazadas abajo.
- Fecha: 22 de septiembre de 2026. Las cifras en créditos salen de estimaciones en vivo en LUVI con los ajustes indicados en el texto.
- Resultados: Seedance 2.5 estimó 3030 créditos por cinco segundos en 720p con audio prendido y apagado; FLUX 3 Video, 1870 créditos en ambos casos; Veo 3.1 Fast, 1280 créditos con el audio apagado y 1536 con el audio prendido, por ocho segundos en 720p.
- Limitaciones: No se generó ninguna salida para este artículo, así que no afirma nada sobre la calidad del resultado. Los valores por defecto y los precios de arriba son una foto del momento: mira la estimación y el panel de parámetros en el espacio de trabajo antes de generar, porque un proveedor puede cambiar un valor por defecto.
¿Cuál conviene elegir?
Empieza por lo que tiene que hacer el sonido, no por la imagen.
- Un personaje que dice algo puntual va a la familia cuya convención de diálogo estés dispuesto a seguir al pie de la letra: Veo 3.1 para líneas entre comillas con efectos y ambiente con nombre, HappyHorse si la línea está en mandarín, cantonés, japonés, coreano, alemán o francés y necesita sincronía a nivel de fonema, y MiniMax H3 si prefieres tener hablantes, ambiente y música en campos separados.
- Si el personaje habla español, tienes más opciones de las que parece: el español está en la lista de idiomas estables de diálogo de MiniMax H3, y tanto Seedance 2.5 como FLUX 3 Video declaran audio multilingüe en su descripción de modelo. La decisión termina siendo de sintaxis, no de idioma.
- Una base musical bajo un plano sin palabras necesita una indicación de música y un lugar declarado en la mezcla. En FLUX 3 Video eso no es opcional: una mezcla hecha solo de ambiente y efectos se va hacia lo inaudible.
- Los efectos atados a una acción visible funcionan en todas partes, y funcionan mejor cuando los enganchas a lo que la cámara ve en lugar de nombrar el sonido solo.
- Un clip al que le vas a poner sonido tú se resuelve con el interruptor y no con una frase del prompt, y probablemente conviene evitar Grok Imagine Video, que no tiene interruptor.
En el espacio de trabajo, el botón de la pluma aplica el dialecto del modelo que tengas elegido, que es la forma más rápida de dejar de arrastrar la sintaxis de audio de una familia a otra: qué hace el botón de la pluma y qué es una guía de prompts. También puedes pedir el manual desde Claude o ChatGPT con el conector de LUVI.
¿Recién llegas? Crea una cuenta de LUVI y prueba tu línea de audio en el clip corto más barato de la familia que elegiste.
Fuentes
- How to create effective prompts with Veo 3. Google DeepMind, guía de prompts (en inglés). Consultado el 22 de septiembre de 2026.
- Ultimate prompting guide for Veo 3.1. Google Cloud, blog (en inglés). Consultado el 22 de septiembre de 2026.
- Generate videos with Veo 3.1 in Gemini API. Google AI for Developers, documentación de la API (en inglés). Consultado el 22 de septiembre de 2026.
Más de Comparativas
- Seis formas de hacer hablar una cara en LUVI, y la diferencia que define el precioLUVI tiene seis familias de lip-sync y hacen dos trabajos distintos: cuatro animan un retrato fijo a partir de un audio y dos vuelven a sincronizar la boca de un video que ya tienes. El trabajo que haces también decide qué reloj pagas: segundos de audio o segundos de video.
- El prompt negativo casi desapareció: cómo excluir algo sin élSolo cuatro de los 224 modelos del catálogo de LUVI tienen campo de prompt negativo, y los cuatro son de Qwen Image. El campo desapareció porque desapareció el método de muestreo del que dependía. Aquí está lo que lo reemplaza en cada familia y los tres lugares donde escribir “no X” todavía sirve.
- Higgsfield, Krea, OpenArt y LUVI: comparamos sus conectores MCP para crear desde Claude o ChatGPTHiggsfield, Krea, OpenArt y LUVI Creator tienen conectores MCP alojados para que Claude o ChatGPT generen con tu cuenta. Cambian en tres cosas: si ves el precio antes de generar, cuántos modelos ofrecen y si el asistente recibe la guía de prompts de cada modelo.