Wan 3.0 richtig prompten: ohne benannte Kamera schneidet das Modell selbst

Wan 3.0 liest eine Formel, die sich aufbaut: Motiv, Schauplatz, Bewegung, dann die Optik, dann der Ton. Den Ton generiert es im selben Durchgang. Benennst du die Kamera nicht in jeder Einstellung, schneidet das Modell mitten in den Clip, den du als eine Einstellung wolltest.

Veröffentlicht:

Über einer bernsteinfarbenen Zeitleiste in einem dunklen Studio schweben zwei Breitbildkader: der linke ganz und ruhig auf einem kleinen Messing-Stativkopf, der rechte in drei versetzte Scheiben zerfallen, weil ihn nichts hält.

Wan 3.0 ist das Modell von Alibaba, das Bild und Ton gemeinsam generiert, und auf LUVI führt es die größte Modellfamilie des Katalogs an. Es gibt es als Text zu Video, Bild zu Video und Referenz zu Video, liefert Clips von 2 bis 30 Sekunden und rechnet in 480p, 720p oder 1080p. Am 22. September 2026 kostete ein Clip von fünf Sekunden laut Angebot 400 Credits in 480p, 800 in 720p und 1600 in 1080p; die feineren Modelle von Wan 3.0 Prime lagen bei 2520 Credits für fünf Sekunden in 1080p. Hier geht es darum, wie das Modell einen Prompt liest – und zwar ab dem Fehler, den wir am häufigsten gemeldet bekommen.

Warum hat mein Clip mittendrin geschnitten?

Wan schneidet, weil in deinem Prompt nichts stand, das die Kadrage hält. Alibabas Leitfaden verlangt, die Kameraführung jeder Einstellung zu benennen, und der Prompt-Leitfaden, den LUVI für diese Familie geschrieben hat, zieht die Konsequenz offen: Bleibt die Kamera unbenannt, montiert Wan an deiner Stelle und schneidet innerhalb eines einzelnen Clips. Die Abhilfe ist eine Wendung pro Einstellung – „feste Kamera“, „langsame Fahrt nach vorn“, „mitziehende Kamera“ – und eine einzige Hauptbewegung, nie zwei in derselben Einstellung.

Das ist deshalb wichtig, weil Wan sehr wohl einen vorgesehenen Weg zu mehreren Einstellungen kennt, und dieser Weg ist nicht das Schweigen. In seiner Liste dessen, was man nicht verlangen soll, nennt Alibaba schnelle Szenenwechsel innerhalb eines Clips und begründet es: Schnitte liegen zwischen Clips, nicht in ihnen, und ein Clip ist eine einzige durchgehende Einstellung. Wer Einstellungen will, nummeriert sie.

Wie schreibe ich mehrere Einstellungen?

Mit der Mehr-Einstellungen-Formel, deren Zeitmarken Wan 3.0 tatsächlich einhält. Alibaba gibt die Form so an: Gesamtbeschreibung, Nummer der Einstellung, Zeitmarke, Inhalt der Einstellung, nach dem Muster Shot 1 [0–3 s] xxxx, Shot 2 [3–6 s] xxx. Die Gesamtbeschreibung trägt Handlung und Aussehen der Figur ein einziges Mal, sodass du die Person nicht in jeder Einstellung neu beschreiben musst; jede Einstellung nennt dann ihre eigene Kadrage, ihre eigene Kamerabewegung und ihren eigenen Übergang.

Overall: a quiet winter morning in a mountain village, warm and unhurried, one woman throughout. Shot 1 [0–4 s] A woman in a thick grey wool coat unlatches a wooden gate with one gloved hand, her breath clouding; medium shot, soft overcast light from the left, fixed camera. Shot 2 [4–8 s] Hard cut transition. The same woman walks down a snow-dusted lane toward the camera; wide shot, slow push-in, low winter sun behind her. Sound effects: boots compressing fresh snow, the iron latch clicking open, distant crows calling. No dialogue. No background music.

Der Prompt bleibt auf Englisch, denn Wan unterstützt Chinesisch und Englisch. Vier bis sechs Sekunden pro Einstellung sind die Spanne, die funktioniert, und Zeitmarken jenseits der Cliplänge verpuffen: Halte die letzte innerhalb der Sekunden, die du eingestellt hast.

Wie sieht der Rest des Prompts aus?

Wie eine Formel, die der Reihe nach aufgebaut wird, nicht wie ein Stapel Schlagwörter. Alibaba veröffentlicht sie als „Motiv (Beschreibung) + Schauplatz (Beschreibung) + Bewegung (Beschreibung) + ästhetische Steuerung + Stilisierung“ und sagt deutlich, was passiert, wenn man nach den ersten drei Teilen aufhört: Schwache Prompts decken Motiv und Bewegung ab, lassen ästhetische Steuerung und Stilisierung aber aus – heraus kommt eine statische Kamera in einer undefinierten Leere.

  • Motiv. Wer oder was, bis zum Aussehen aufgelöst: „eine junge Frau mit welligem kastanienrotem Haar in einem geblümten Vintage-Kleid“.
  • Schauplatz. Die Umgebung mit Vorder- und Hintergrund.
  • Bewegung. Was sich bewegt, wie weit, wie schnell: „schwankt heftig“, „bewegt sich langsam“.
  • Ästhetische Steuerung. Lichtquelle, Ausleuchtung, Einstellungsgröße, Kamerawinkel, Objektiv, Kamerabewegung. Genau dieses Feld lassen schwache Prompts leer.
  • Stilisierung. Ein einziges Stilwort: Cyberpunk, Strichillustration, Knetanimation, Filz, Pixel. Nicht stapeln.

Wie schreibe ich den Ton?

Du beschreibst ihn als Inhalt, denn Wan 3.0 generiert den Ton im selben Durchgang, und der Parameter audio ist voreingestellt aktiv. Ihn abzuschalten macht den Clip nicht billiger: Laut Parametervertrag des Modells kostet beides gleich viel. Alibaba teilt den Ton in drei Formeln auf. Die Stimme besteht aus Dialogzeile plus Emotion, Tonfall, Tempo, Klangfarbe und Akzent; der Effekt aus Ausgangsmaterial plus Handlung und Atmo; die Musik aus Score plus Stil. Was gesprochen wird, steht in doppelten Anführungszeichen, ebenso jeder Text, der im Bild erscheinen soll.

Die Videomodelle von Wan haben keinen negativen Prompt, deshalb schreibst du Ausschlüsse als Sätze ans Ende: „No dialogue.“ „No background music.“ „No on-screen text, no subtitles.“ Wenn du wissen willst, welche Modelle im Katalog dieses Feld überhaupt haben, erklärt das Hilfecenter, wann es einen negativen Prompt gibt.

Wie verweise ich auf ein hochgeladenes Bild oder Video?

Über Typ und Nummer. Alibabas Regel ist wörtlich: Für Bilder schreibt man „Image n“, für Videos „Video n“. Bilder und Videos werden getrennt gezählt, in der Reihenfolge des Uploads, und die Kennung steht als Substantiv im Satz: „The cat in Image 1 plays in the room in Image 2.“ Im Englischen verlangt der Leitfaden einen Großbuchstaben und ein Leerzeichen zwischen Wort und Ziffer.

Der Arbeitsbereich von LUVI setzt beim Anhängen einer Referenz seine eigene Kennung ein: @Image 1. Lass sie stehen und schreib die Wan-Form beim ersten Auftreten daneben. Ein Referenzvideo steuert Aussehen, Bewegung und Stimmfarbe zugleich bei – sag im Satz, welches der drei du davon willst.

Was gehört in die Parameter statt in den Prompt?

Vier Dinge, und sie in den Text zu schreiben kostet nur Wörter: duration (2 bis 30 Sekunden, 5 als Vorgabe), resolution (480p, 720p, 1080p), ratio (voreingestellt „adaptive“, sonst 16:9, 4:3, 1:1, 3:4, 9:16) und audio. Schreib niemals „16:9“, „1080p“ oder „10 Sekunden“ in den Prompt selbst.

Zwei davon bewegen den Preis. Die Länge wird pro Sekunde abgerechnet, und die Auflösung vervielfacht diesen Sekundensatz: Für dieselben fünf Sekunden stiegen unsere drei Angebote mit der Auflösung auf 400, 800 und 1600 Credits. Wie das im ganzen Katalog zusammenhängt, erklärt das Hilfecenter unter wie Auflösung und Dauer den Preis verändern.

Wie wir geprüft haben

  • Modelle: Wan 3.0 Text zu Video, Bild zu Video und Referenz zu Video sowie Wan 3.0 Prime Text zu Video.
  • Einstellungen: Clips von fünf Sekunden in 480p, 720p und 1080p, jeweils 16:9.
  • Datum und Gelesenes: 22. September 2026. Die Parameterverträge der Modelle und die Live-Angebote in Credits innerhalb von LUVI, der Prompt-Leitfaden, den LUVI für die Wan-Familie geschrieben hat, sowie Alibaba Clouds Leitfaden für Text-zu-Video-Prompts (zuletzt aktualisiert am 4. September 2026).
  • Ergebnisse: 400, 800 und 1600 Credits für fünf Sekunden in 480p, 720p und 1080p; 2520 Credits bei Wan 3.0 Prime in 1080p. Für diesen Beitrag wurden keine Ausgaben generiert, er trifft also keine Aussage über die Qualität der Ergebnisse.
  • Offen geblieben: Die Spanne von vier bis sechs Sekunden pro Einstellung und das Verhalten bei unbenannter Kamera stammen aus LUVIs Prompt-Leitfaden, nicht aus einem veröffentlichten Test.

In LUVI

Wähl auf der Seite der Wan-Familie ein Modell, schreib die Formel der Reihe nach und prüf sie, bevor du etwas ausgibst: Die Feder neben dem Prompt-Feld wendet den Prompt-Leitfaden des gewählten Modells an und schreibt den Text in dessen Dialekt um. Häng Referenzen so an, wie es die Hilfeseite wie nutze ich Referenzbilder, Videos und Audio beschreibt, und sieh dir dann die Credit-Schätzung über dem Generieren-Knopf an: Diese Zahl ist die Obergrenze, keine Näherung.

Wenn du lieber aus einem Chatfenster heraus arbeitest, öffnet der Connector von LUVI dieselben Modelle und dieselben Prompt-Leitfäden für Claude und ChatGPT; die MCP-Dokumentation beschreibt die Einrichtung. Neue Konten starten mit 1000 Credits, du kannst also ein LUVI-Konto anlegen und das Beispiel oben ausprobieren, ohne etwas zu kaufen.

Quellen

Mehr aus Guides