Cómo escribir prompts para Wan 3.0: si no nombras la cámara, corta por su cuenta
Wan 3.0 lee una fórmula que se va sumando: entidad, escena, movimiento, luego el look y al final el sonido. Genera el audio en la misma pasada. Si no nombras la cámara en cada plano, corta dentro del clip que querías en una sola toma. Cinco segundos arrancan en 400 créditos a 480p.

Wan 3.0 es el modelo de Alibaba que genera imagen y sonido juntos, y en LUVI encabeza la familia de modelos más numerosa del catálogo. Funciona como texto a video, imagen a video y referencia a video, entrega clips de 2 a 30 segundos y sale a 480p, 720p o 1080p. El 22 de septiembre de 2026 cotizamos cinco segundos en 400 créditos a 480p, 800 a 720p y 1600 a 1080p; los modelos Wan 3.0 Prime, de mayor fidelidad, cotizaron 2520 por cinco segundos a 1080p. Acá te contamos cómo lee el modelo un prompt (la instrucción que le escribes), empezando por la falla que más nos reportan.
¿Por qué se cortó mi clip a la mitad?
Wan corta porque nada en tu prompt le dijo cómo sostener el encuadre. La guía de Alibaba pide que nombres el tratamiento de cámara de cada plano, y la guía de prompts que LUVI escribió para esta familia lo dice sin rodeos: si no la nombras, Wan monta por su cuenta y corta dentro de un mismo clip. La solución es una frase por plano —"cámara fija", "acercamiento lento", "plano en seguimiento"— y un solo movimiento principal, nunca dos apretados en el mismo plano.
Esto importa porque Wan sí tiene una forma aceptada de darte varios planos, y esa forma no es el silencio. En su lista de "qué no pedir", Alibaba nombra los cambios rápidos de escena dentro de un mismo clip y explica el motivo: los cortes ocurren entre clips, no dentro de ellos, y un clip es una sola toma continua. Si quieres planos, los numeras.
¿Cómo escribo más de un plano?
Con la fórmula multiplano, y Wan 3.0 respeta los tiempos que pongas en ella. Alibaba da la forma así: descripción general, número de plano, marca de tiempo y contenido del plano, con el ejemplo Shot 1 [0–3 s] xxxx, Shot 2 [3–6 s] xxx. La descripción general carga una sola vez la historia y el aspecto del personaje, así no lo vuelves a describir en cada plano; cada plano dice entonces su encuadre, su movimiento de cámara y su transición.
Overall: a quiet winter morning in a mountain village, warm and unhurried, one woman throughout. Shot 1 [0–4 s] A woman in a thick grey wool coat unlatches a wooden gate with one gloved hand, her breath clouding; medium shot, soft overcast light from the left, fixed camera. Shot 2 [4–8 s] Hard cut transition. The same woman walks down a snow-dusted lane toward the camera; wide shot, slow push-in, low winter sun behind her. Sound effects: boots compressing fresh snow, the iron latch clicking open, distant crows calling. No dialogue. No background music.
El prompt va en inglés porque los idiomas que Wan admite son chino e inglés. De cuatro a seis segundos por plano es el rango que funciona, y las marcas de tiempo que se pasan de la duración del clip se desperdician: deja la última dentro de los segundos que configuraste.
¿Cómo es el resto del prompt?
Es una fórmula que se suma en orden, no una pila de palabras clave. Alibaba la publica como "entidad (descripción) + escena (descripción) + movimiento (descripción) + control estético + estilización", y es directa sobre lo que pasa cuando te detienes en los tres primeros: los prompts flojos cubren entidad y movimiento pero se saltan el control estético y la estilización, y el resultado es una cámara estática en un vacío sin definir.
- Entidad. Quién o qué, resuelto en su apariencia: "una joven de pelo castaño rojizo ondulado con un vestido floral vintage".
- Escena. El entorno, con su primer plano y su fondo.
- Movimiento. Qué se mueve, cuánto y a qué velocidad: "se agita con violencia", "avanza despacio".
- Control estético. Fuente de luz, iluminación, tamaño de plano, ángulo, lente y movimiento de cámara. Esta es justo la casilla que los prompts flojos dejan vacía.
- Estilización. Una sola palabra de estilo: cyberpunk, ilustración de línea, plastilina, fieltro, pixel. No las amontones.
¿Cómo escribo el sonido?
Lo describes como contenido, porque Wan 3.0 genera el audio en la misma pasada y su parámetro audio viene activado. Apagarlo no abarata el clip: el propio contrato del modelo dice que el precio es el mismo en ambos casos. Alibaba parte el sonido en tres fórmulas: la voz como diálogo más emoción, tono, velocidad, timbre y acento; el efecto como material de origen más acción y sonido ambiente; y la música como partitura más estilo. Las frases habladas van entre comillas dobles, igual que cualquier texto que deba verse en pantalla.
Los modelos de video de Wan no tienen prompt negativo, así que las exclusiones se escriben como frases al final: "No dialogue." "No background music." "No on-screen text, no subtitles." Si no sabes qué modelos del catálogo sí traen ese campo, el centro de ayuda explica cuándo aparece el prompt negativo.
¿Cómo señalo una imagen o un video que subí?
Por tipo y por número. La regla de Alibaba es literal: para imágenes se escribe "Image n" y para videos, "Video n". Imágenes y videos se cuentan por separado, en el orden en que los subiste, y el identificador se usa como sustantivo dentro de la frase: "The cat in Image 1 plays in the room in Image 2." En inglés la guía pide mayúscula inicial y un espacio entre la palabra y el número.
El espacio de trabajo de LUVI inserta su propia etiqueta, @Image 1, cuando adjuntas una referencia. Déjala y escribe al lado la forma de Wan la primera vez que aparezca. Un video de referencia presta apariencia, movimiento y timbre de voz a la vez, así que di en la frase cuál de los tres quieres de él.
¿Qué va en los parámetros y no en el prompt?
Cuatro cosas, y escribirlas en el texto es gastar palabras: duration (de 2 a 30 segundos, 5 por defecto), resolution (480p, 720p, 1080p), ratio ("adaptive" por defecto, o 16:9, 4:3, 1:1, 3:4, 9:16) y audio. Nunca escribas "16:9", "1080p" ni "10 segundos" dentro del prompt.
Dos de ellos mueven el precio. La duración se cobra por segundo y la resolución multiplica esa tarifa: nuestras tres cotizaciones para los mismos cinco segundos subieron a 400, 800 y 1600 créditos a medida que subía la resolución. El centro de ayuda explica cómo cambian el precio la resolución y la duración en todo el catálogo.
Cómo lo verificamos
- Modelos: Wan 3.0 Texto a Video, Imagen a Video y Referencia a Video, más Wan 3.0 Prime Texto a Video.
- Configuración: clips de cinco segundos a 480p, 720p y 1080p, en 16:9.
- Fecha y qué se leyó: 22 de septiembre de 2026. Los contratos de parámetros de cada modelo y las cotizaciones de créditos en vivo dentro de LUVI, la guía de prompts que LUVI escribió para la familia Wan y la guía de prompts de texto a video de Alibaba Cloud (última actualización: 4 de septiembre de 2026).
- Resultados: 400, 800 y 1600 créditos por cinco segundos a 480p, 720p y 1080p; 2520 créditos en Wan 3.0 Prime a 1080p. No se generó ninguna salida para este artículo, así que no afirma nada sobre la calidad de los resultados.
- Limitaciones: el rango de cuatro a seis segundos por plano y el comportamiento de la cámara sin nombrar vienen de la guía de prompts de LUVI, no de una prueba publicada.
En LUVI
Elige un modelo en la página de la familia Wan, escribe la fórmula en orden y revísala antes de gastar nada: el botón de la pluma, junto al cuadro del prompt, corre la guía de prompts del modelo que tengas seleccionado y reescribe el texto en su dialecto. Adjunta las referencias como describe la ayuda sobre cómo usar imágenes, videos y audio de referencia y después mira la estimación de créditos que aparece sobre el botón Generar: ese número es el techo, no un cálculo aproximado.
Si prefieres manejarlo desde una ventana de chat, el conector de LUVI abre los mismos modelos y las mismas guías de prompts a Claude y a ChatGPT; la documentación de MCP explica la configuración. Las cuentas nuevas arrancan con 1000 créditos, así que puedes crear una cuenta de LUVI y correr el ejemplo de arriba sin comprar nada.
Fuentes
- Guía de prompts de texto a video e imagen a video (en inglés). Alibaba Cloud Model Studio, documentación oficial, última actualización: 4 de septiembre de 2026. Consultado el 22 de septiembre de 2026.
Más de Guías
- Cómo escribir prompts para Hailuo: quince comandos de cámara entre corchetesHailuo recibe la dirección de cámara como un comando entre corchetes de una lista cerrada de quince, puesto donde ocurre el movimiento. Además es solo imagen, así que cada palabra dedicada al sonido se pierde. Seis segundos arrancan en 380 créditos.
- Hunyuan3D no lee tu prompt: en imagen a 3D, el brief completo es la fotoEn los modos de imagen a 3D de Hunyuan3D el campo de texto no se lee: el propio contrato del modelo dice que no acepta prompt. Todo el control que tienes está en cómo preparas la imagen de entrada. Las mallas parten desde 600 créditos en Rapid y 1000 en Pro.
- Seedream 5.0 Pro: por qué escribir “16:9” en el prompt no hace nadaSeedream 5.0 Pro no tiene parámetro de proporción. La forma de la imagen vive en size, que se escribe ANCHO*ALTO con asterisco, y una proporción escrita en el texto se ignora. Aquí están los trece tamaños válidos, el interruptor thinking y la estructura de frase que premia. Desde 144 créditos.