Hailuo recibe la dirección de cámara como un comando entre corchetes de una lista cerrada de quince, puesto donde ocurre el movimiento. Además es solo imagen, así que cada palabra dedicada al sonido se pierde. Seis segundos arrancan en 380 créditos.
Wan 3.0 lee una fórmula que se va sumando: entidad, escena, movimiento, luego el look y al final el sonido. Genera el audio en la misma pasada. Si no nombras la cámara en cada plano, corta dentro del clip que querías en una sola toma. Cinco segundos arrancan en 400 créditos a 480p.
En los modos de imagen a 3D de Hunyuan3D el campo de texto no se lee: el propio contrato del modelo dice que no acepta prompt. Todo el control que tienes está en cómo preparas la imagen de entrada. Las mallas parten desde 600 créditos en Rapid y 1000 en Pro.
Seedream 5.0 Pro no tiene parámetro de proporción. La forma de la imagen vive en size, que se escribe ANCHO*ALTO con asterisco, y una proporción escrita en el texto se ignora. Aquí están los trece tamaños válidos, el interruptor thinking y la estructura de frase que premia. Desde 144 créditos.
Una plataforma de IA multimodelo reúne modelos de video, imagen, audio y 3D de muchas empresas en un solo espacio de trabajo y con un solo saldo. Para elegirla, fíjate en las versiones exactas que ofrece, en si te dice el precio antes de generar y en si te ayuda a escribir el prompt de cada modelo.
Nano Banana Pro vuelve a generar toda la imagen en cada edición, así que una instrucción sin cláusula de preservación cambia cosas que nunca pediste. Di qué cambia y qué se queda, y nombra las referencias como Image 1. La edición parte desde 175 créditos en 1k.
HappyHorse genera imagen y sonido juntos, pero no deduce el sonido de lo que ve: un prompt sin una línea de audio devuelve un video casi mudo. También es de los pocos modelos de video que respeta los tiempos por toma, justo al revés que Seedance 2.5.
FLUX 3 Video genera imagen y sonido en una sola pasada, así que el audio se escribe en el prompt en lugar de activarse con un botón. Pon cada línea entre comillas y dale a alguien visible que la diga, o puede salir como texto sobre la imagen. En LUVI cuesta desde 1870 créditos.
Seedance 2.5 lee marcas de tiempo en segundos enteros, canales de audio tipados y un solo movimiento de cámara por plano. La mayoría de los malos resultados vienen de tratarlo como Seedance 2.0. Esta es la estructura que funciona, sacada de la guía que aplicamos dentro de LUVI.
En Kling 3 un plano se escribe en este orden: sujeto, movimiento, escenario y recién después cámara, luz y atmósfera. Entre 60 y 100 palabras, un solo movimiento de cámara y una sola acción. El prompt completo tiene un tope de 2,500 caracteres y pasarse cancela el envío.
Para usar Veo 3.1, arma el prompt empezando por la cámara: plano, sujeto, acción, contexto y estilo, con diálogos y efectos dentro de la escena. En LUVI activa la Generación de audio, que viene apagada; Veo 3.1 Lite no tiene sonido. Un clip de 8 segundos a 720p cuesta desde 800 créditos.