Cómo escribir prompts para FLUX 3 Video: por qué tu diálogo salió como texto en pantalla

FLUX 3 Video genera imagen y sonido en una sola pasada, así que el audio se escribe en el prompt en lugar de activarse con un botón. Pon cada línea entre comillas y dale a alguien visible que la diga, o puede salir como texto sobre la imagen. En LUVI cuesta desde 1870 créditos.

Publicado:

En un set oscuro, la silueta de una persona habla mientras anillos cálidos de sonido se expanden a su alrededor; frente a ella cuelga un panel de vidrio en blanco y, al fondo, dos cuadros panorámicos se unen en una costura turquesa brillante.

FLUX 3 Video es el modelo de Black Forest Labs que genera imagen y sonido en la misma pasada: diálogo con lip-sync, ambiente, efectos y música salen junto con los cuadros. El español está en la lista de idiomas con lip-sync que publica Black Forest Labs, así que puedes hacer hablar a un personaje en español. En LUVI funciona como texto a video, imagen a video, cuadros clave a video y extensión de video, en 720p o 1080p, de cinco a veinte segundos, desde 1870 créditos por un clip de cinco segundos en 720p. La página del proveedor te dice qué puede hacer el modelo. Aquí vas a leer cómo lee un prompt, empezando por el error que más generaciones cuesta.

¿Por qué mi diálogo salió como texto sobre la imagen?

Una línea entre comillas sin nadie visible que la diga puede aparecer como texto impreso sobre la imagen en vez de escucharse. Es la falla mejor documentada del modelo y viene justamente de algo que Black Forest Labs anuncia como virtud: FLUX 3 puede "render typography as a natural part of the scene", es decir, integrar tipografía como parte natural de la escena. El modelo es bueno poniendo palabras en pantalla, y por eso una cita sin dueño le queda ambigua: ¿es una línea para decir o una línea para mostrar?

El manual que LUVI aplica a esta familia lo deja claro: el diálogo va entre comillas y con alguien visible que lo diga. En la práctica son tres cosas.

  • Pon una cara en el encuadre. Alguien visible le da al modelo una boca que sincronizar. "Ella dice: …" funciona mucho mejor que una cita flotando sola.
  • Escribe la palabra "voiceover" o "narration" cuando la voz sea deliberadamente de fuera de cuadro. Sin esa palabra, la cita cae exactamente en el caso ambiguo.
  • Marca el idioma y deja la línea corta. Black Forest Labs enumera el lip-sync para "English (various dialects), Chinese, Spanish, French, German, Japanese, Portuguese, Russian, Italian, Indonesian, Turkish, Hindi, Punjabi and more". Una línea corta dentro de un clip largo aguanta mejor que un texto escrito para llenar cada segundo.

Si no quieres nada escrito en pantalla, aquí la negación sí sirve para los elementos gráficos: "No on-screen text, no subtitles."

¿Cómo se escribe el sonido?

En FLUX 3 Video el sonido es contenido que escribes, no un nivel que subes, y viene en cuatro capas: voz, ambiente, efectos atados a una acción visible, y música con una indicación de dónde queda en la mezcla. Pedir las cuatro suele ser un error, porque una mezcla cargada es una falla documentada. Con una o dos alcanza.

Hay una trampa medida. En diez clips que generamos con esta familia, toda mezcla hecha solo de ambiente y efectos quedó entre -36 y -61 LUFS, y el fondo de ese rango es silencio en la práctica. En cambio, cada clip con diálogo o con una base musical se mantuvo entre -18 y -32 LUFS. O sea: nombrar los sonidos es necesario pero no alcanza, porque una mezcla sin primer plano se va hacia lo inaudible. Si el audio importa y nadie habla en la escena, dale una indicación musical y di dónde queda esa música en la mezcla.

Medium shot of a barista in a green apron sliding a paper cup across the counter toward the customer in front of her, slow dolly in, warm morning light through the window. She says in English, "Careful, it's very hot." Ambience: low cafe chatter and the hiss of a steam wand. The cup clicks against the saucer when she sets it down. No on-screen text, no subtitles.

Conviene escribir el prompt en inglés, porque la documentación del proveedor está armada en ese idioma. Si la línea hablada va en español, déjala en español entre comillas y marca el idioma: She says in Spanish, "Cuidado, está muy caliente."

¿Se puede pedir un clip en silencio?

En el texto del prompt, no. Pedir "quiet room tone" o "complete silence" puede terminar en estática o en aire muerto, porque le sigues pidiendo al modelo de audio que genere algo. El silencio completo es el parámetro generate_audio, que apagas en el espacio de trabajo. El silencio parcial sí se escribe como contenido, porque describe una mezcla en vez de negarla: "for the final two seconds, only rain against the window."

En LUVI, apagar el audio no cambia lo que pagas. Un clip de cinco segundos en 720p se estima en 1870 créditos con generate_audio prendido y en 1870 créditos con el parámetro apagado (verificado el 22 de septiembre de 2026). Vale la pena saberlo porque no es la regla en todos lados: en Veo 3.1 ese mismo parámetro viene apagado y la propia descripción del modelo dice que el audio "aumenta el costo por segundo".

¿Cómo sacar varios planos de un solo clip?

Meter varios planos en una sola generación es lo más fuerte de este modelo, y el corte se escribe con HARD CUT. Escribes "SHOT ONE: … HARD CUT. SHOT TWO: …", repites la descripción del personaje palabra por palabra en cada plano y nombras una sola base sonora para todo el clip.

Esto pesa más de lo que parece. FLUX 3 Video no tiene seed ni modo borrador: mandar el mismo prompt dos veces devuelve dos resultados completamente distintos, y tampoco hay una referencia de estilo que traslade al personaje entre generaciones separadas. Una sola generación con varios planos es el único lugar donde la continuidad la sostiene el modelo y no tu prompt.

Los tiempos ordenan, no marcan. En nuestra prueba, un solo HARD CUT escrito en el segundo 5.0 de un clip de diez segundos salió como dos cortes, en 1.46 y en 7.71, mientras que el orden de los planos, la identidad y la ubicación del diálogo se mantuvieron. Escribe una línea de tiempo cuando el orden importe, pero no te prometas un corte exacto al cuadro.

SHOT ONE: A fisherman in a yellow oilskin coat hauls a dripping net over the rail of a small wooden boat, slow tracking shot, gray dawn light. HARD CUT. SHOT TWO: A fisherman in a yellow oilskin coat drinks from a steel flask in the wheelhouse, locked-on medium shot, gray dawn light. Music: a slow low cello bed under the whole clip. Ambience: gulls, wind, and water knocking against the hull.

¿Qué costumbres de los modelos de imagen no sirven aquí?

El vocabulario fotográfico que funciona en los modelos de imagen de FLUX no tiene efecto documentado en FLUX 3 Video, y los parámetros no son palabras.

  • Nada de diafragmas, películas fotográficas, cuerpos de cámara ni códigos hex. Describe la técnica: "shallow (sharp on subject, blurred background)", "fine grain adds gritty, tactile realism", "amber, cream, walnut".
  • No hay pesos ni cfg. (melancholy:1.4) no se lee; el paréntesis es ruido alrededor de una palabra que el modelo iba a tomar igual.
  • No hay campo de prompt negativo. Las exclusiones sí se permiten, pero solo para capas de audio y elementos en pantalla: "no music, no second voice", "No on-screen text, no subtitles." Nunca negocies el silencio negando.
  • Proporción, resolución y duración son parámetros. Escribir "16:9", "1080p" o "10 seconds" dentro del prompt no hace nada.
  • Usa los términos de cámara que el modelo conoce. "Dolly in", "push through", "dolly zoom", "trucking", "arc shot", "pedestal", "locked-on". "Zoom" a secas y "push-in" no son términos documentados. Un término de encuadre, un término de movimiento y una acción por oración: "low tracking shot" se entiende, "low aerial handheld orbit push-in" casi nunca.

Cómo lo verificamos

  • Modelos: black-forest-labs/flux-3/text-to-video y black-forest-labs/flux-3/image-to-video, más los modos de extensión y cuadros clave para los precios.
  • Ajustes: de cinco a veinte segundos, 720p y 1080p, generate_audio prendido y apagado.
  • Fecha y qué se leyó: 22 de septiembre de 2026. Los esquemas de los modelos y las estimaciones de créditos en LUVI, la guía de prompts que LUVI aplica a esta familia y las páginas de Black Forest Labs enlazadas abajo.
  • Resultados: 1870 créditos por cinco segundos en 720p, con audio prendido o apagado; 6380 créditos por diez segundos en 1080p; 7480 créditos por veinte segundos en 720p. El rango de LUFS y la medición del corte vienen de diez clips generados con esta familia mientras se escribía la guía.
  • Limitaciones: No se generó ninguna salida para este artículo, así que no afirma nada sobre la calidad del resultado. Los créditos cambian cuando el proveedor ajusta su precio: mira la estimación del espacio de trabajo antes de un clip largo.

En LUVI

Elige FLUX 3 Video en el espacio de trabajo, escribe el prompt y toca el botón de la pluma que está al lado antes de generar. Ese botón es LuviTransLex, la revisión gratuita que aplica la guía de prompts de este modelo y corrige lo que puede.

Vale la pena incluso con un prompt que se ve bien. Esta línea parece cuidada: A man sits alone at a kitchen table, 16:9, 1080p, shot on Kodak Portra at f/1.8, (melancholy:1.4), quiet room tone, #1a1a1a shadows, 10 seconds. La revisión devuelve una corrección y ocho advertencias: quita el peso y deja la palabra, marca la película y el diafragma como vocabulario de imagen, marca el código hex, marca la proporción, la resolución y la duración por ser parámetros, y marca el pedido de silencio. Revisar y corregir no gasta créditos.

FLUX 3 Video no tiene campo de prompt negativo, y por eso no aparece en su panel: cuándo lo hay y cuándo no depende del modelo, no de una configuración. También puedes manejar todo desde Claude o ChatGPT con el conector de LUVI.

¿Recién llegas? Crea una cuenta de LUVI: los créditos de bienvenida alcanzan para probar un clip corto.

Fuentes

Más de Guías