FLUX 3 Video: So schreibst du den Prompt – und warum dein Dialog als Text im Bild landet
FLUX 3 Video erzeugt Bild und Ton in einem Durchgang. Der Ton wird deshalb in den Prompt geschrieben und nicht per Schalter zugeschaltet. Setz jede Replik in Anführungszeichen und gib ihr jemanden im Bild, der sie sagt, sonst kann sie als Text im Bild erscheinen. Ab 1870 Credits auf LUVI.

FLUX 3 Video ist das Modell von Black Forest Labs, das Bild und Ton im selben Durchgang erzeugt: Dialog mit Lippensynchronität, Atmo, Effekte und Musik kommen zusammen mit den Bildern. Deutsch steht auf der Sprachliste, die Black Forest Labs für die Lippensynchronität nennt, du kannst eine Figur also deutsch sprechen lassen. Auf LUVI gibt es das Modell als Text zu Video, Bild zu Video, Keyframes zu Video und Video verlängern, in 720p oder 1080p, fünf bis zwanzig Sekunden lang, ab 1870 Credits für einen 5-Sekunden-Clip in 720p. Was das Modell kann, steht auf der Seite des Anbieters. Hier geht es darum, wie es einen Prompt liest – angefangen bei dem Fehler, der die meisten Generierungen kostet.
Warum ist mein Dialog als Text im Bild gelandet?
Eine Replik in Anführungszeichen, zu der niemand im Bild zu sehen ist, kann als Schrift im Bild erscheinen statt gesprochen zu werden. Das ist der am besten dokumentierte Fehler des Modells, und er folgt ausgerechnet aus einer Stärke, mit der Black Forest Labs wirbt: FLUX 3 kann Typografie „als natürlichen Teil der Szene“ rendern. Das Modell setzt Schrift wirklich gut ins Bild, und deshalb bleibt ein Zitat ohne Sprecher mehrdeutig – Satz zum Sagen oder Satz zum Zeigen?
Das Handbuch, das LUVI für diese Familie führt, formuliert die Regel eindeutig: Dialog steht in Anführungszeichen und gehört jemandem, der im Bild zu sehen ist. In der Praxis sind das drei Dinge.
- Hol ein Gesicht ins Bild. Eine sichtbare Person gibt dem Modell einen Mund zum Synchronisieren. „Die Frau sagt: …“ funktioniert deutlich besser als ein frei schwebendes Zitat.
- Schreib das Wort „voiceover“ oder „narration“, wenn die Stimme bewusst aus dem Off kommt. Ohne dieses Wort fällt das Zitat genau in den mehrdeutigen Fall.
- Nenn die Sprache und halt die Replik kurz. Black Forest Labs zählt für die Lippensynchronität auf: „English (various dialects), Chinese, Spanish, French, German, Japanese, Portuguese, Russian, Italian, Indonesian, Turkish, Hindi, Punjabi and more“. Eine kurze Replik in einem langen Clip hält besser als ein Text, der jede Sekunde füllen soll.
Wenn gar nichts geschrieben im Bild stehen soll, funktioniert die Verneinung hier für Bildelemente: „No on-screen text, no subtitles.“
Wie schreibt man den Ton?
Ton ist bei FLUX 3 Video Inhalt, den du schreibst, und kein Regler, den du aufziehst. Er hat vier Schichten: Sprache, Atmo, Effekte, die an einer sichtbaren Handlung hängen, und Musik samt ihrem Platz in der Mischung. Alle vier zu verlangen ist meistens falsch, denn eine überladene Mischung ist ein dokumentierter Fehler. Ein oder zwei Schichten reichen in der Regel.
Es gibt eine gemessene Falle. Über zehn Clips aus dieser Familie lag jede Mischung, die nur aus Atmo und Effekten bestand, zwischen -36 und -61 LUFS, und das untere Ende davon ist praktisch Stille. Jeder Clip mit Dialog oder einem Musikbett blieb dagegen zwischen -18 und -32 LUFS. Die Klänge zu benennen ist also nötig, reicht aber nicht: Eine Mischung ohne Vordergrund rutscht Richtung unhörbar. Wenn der Ton zählt und niemand spricht, gib dem Clip eine Musikangabe und sag, wo diese Musik in der Mischung sitzt.
Medium shot of a barista in a green apron sliding a paper cup across the counter toward the customer in front of her, slow dolly in, warm morning light through the window. She says in English, "Careful, it's very hot." Ambience: low cafe chatter and the hiss of a steam wand. The cup clicks against the saucer when she sets it down. No on-screen text, no subtitles.
Den Prompt schreibst du besser auf Englisch, weil die Dokumentation des Anbieters in dieser Sprache aufgebaut ist. Soll die Replik deutsch sein, lass sie deutsch in den Anführungszeichen stehen und nenn die Sprache: She says in German, "Vorsicht, das ist sehr heiß."
Kann man einen stummen Clip bestellen?
Im Prompt-Text nicht. „Quiet room tone“ oder „complete silence“ kann in Rauschen oder toter Luft enden, weil du das Tonmodell weiterhin um etwas bittest. Vollständige Stille ist der Parameter generate_audio, den du im Arbeitsbereich ausschaltest. Teilweise Stille lässt sich dagegen gut als Inhalt schreiben, denn sie beschreibt eine Mischung, statt sie zu verneinen: „for the final two seconds, only rain against the window.“
Auf LUVI ändert der ausgeschaltete Ton nichts am Preis. Ein 5-Sekunden-Clip in 720p wird mit eingeschaltetem generate_audio auf 1870 Credits geschätzt und ausgeschaltet ebenfalls auf 1870 Credits (geprüft am 22. September 2026). Das ist gut zu wissen, weil es nicht überall so läuft: Bei Veo 3.1 ist derselbe Parameter ab Werk aus, und die Beschreibung des Modells sagt, dass Ton die Kosten pro Sekunde erhöht.
Wie bekommt man mehrere Einstellungen in einen Clip?
Mehrere Einstellungen in einer einzigen Generierung sind die größte Stärke dieses Modells, und der Schnitt heißt HARD CUT. Du schreibst „SHOT ONE: … HARD CUT. SHOT TWO: …“, wiederholst die Figurenbeschreibung in jeder Einstellung wortgleich und nennst ein einziges Klangbett für den ganzen Clip.
Das wiegt schwerer, als es klingt. FLUX 3 Video hat keinen Seed und keine Entwurfsschleife: Zwei identische Anfragen liefern zwei völlig verschiedene Ergebnisse, und es gibt auch keine Stilreferenz, die eine Figur von einer Generierung in die nächste trägt. Eine einzige Generierung mit mehreren Einstellungen ist die einzige Stelle, an der das Modell die Anschlüsse hält, statt dass der Prompt darauf hofft.
Zeitmarken ordnen, sie setzen keine Marke. In unserem Test kam ein einzelner HARD CUT, der bei Sekunde 5,0 eines zehn Sekunden langen Clips stand, als zwei Schnitte heraus, bei 1,46 s und bei 7,71 s – während Reihenfolge, Figur und Position des Dialogs hielten. Schreib eine Zeitleiste, wenn die Reihenfolge zählt, aber versprich dir keinen framegenauen Schnittpunkt.
SHOT ONE: A fisherman in a yellow oilskin coat hauls a dripping net over the rail of a small wooden boat, slow tracking shot, gray dawn light. HARD CUT. SHOT TWO: A fisherman in a yellow oilskin coat drinks from a steel flask in the wheelhouse, locked-on medium shot, gray dawn light. Music: a slow low cello bed under the whole clip. Ambience: gulls, wind, and water knocking against the hull.
Welche Gewohnheiten aus den Bildmodellen greifen hier nicht?
Das Fotovokabular, das bei den Bildmodellen von FLUX wirkt, hat bei FLUX 3 Video keine dokumentierte Wirkung, und die Parameter sind keine Wörter.
- Keine Blendenwerte, keine Filmemulsionen, keine Kameragehäuse, keine Hex-Codes. Beschreib stattdessen die Technik: „shallow (sharp on subject, blurred background)“, „fine grain adds gritty, tactile realism“, „amber, cream, walnut“.
- Keine Gewichtungen, kein cfg.
(melancholy:1.4)wird nicht gelesen; die Klammer ist nur Rauschen um ein Wort, das das Modell ohnehin aufgenommen hätte. - Kein Feld für einen negativen Prompt. Ausschlüsse sind trotzdem erlaubt, aber nur für Tonschichten und Bildelemente: „no music, no second voice“, „No on-screen text, no subtitles.“ Verneine dich niemals in die Stille.
- Seitenverhältnis, Auflösung und Dauer sind Parameter. „16:9“, „1080p“ oder „10 seconds“ in den Prompt zu schreiben bewirkt nichts.
- Nimm die Kamerabegriffe, die das Modell kennt. „Dolly in“, „push through“, „dolly zoom“, „trucking“, „arc shot“, „pedestal“, „locked-on“. Bloßes „zoom“ und „push-in“ sind keine dokumentierten Begriffe. Pro Satz ein Bildausschnitt, eine Bewegung, eine Handlung: „low tracking shot“ ist klar, „low aerial handheld orbit push-in“ meistens nicht.
Was wir geprüft haben
- Modelle:
black-forest-labs/flux-3/text-to-videoundblack-forest-labs/flux-3/image-to-video, für die Preise zusätzlich die Varianten zum Verlängern und für Keyframes. - Einstellungen: fünf bis zwanzig Sekunden, 720p und 1080p,
generate_audioein- und ausgeschaltet. - Datum und Quellen: 22. September 2026. Die Modellschemata und Credit-Schätzungen auf LUVI, der Prompting Guide, den LUVI für diese Familie einsetzt, und die unten verlinkten Seiten von Black Forest Labs.
- Ergebnisse: 1870 Credits für fünf Sekunden in 720p, mit Ton oder ohne; 6380 Credits für zehn Sekunden in 1080p; 7480 Credits für zwanzig Sekunden in 720p. Der LUFS-Bereich und die Messung der Schnittpunkte stammen aus zehn Clips, die während der Arbeit am Guide in dieser Familie entstanden sind.
- Grenzen: Für diesen Beitrag wurde nichts generiert, er behauptet also nichts über die Qualität der Ergebnisse. Credits ändern sich, wenn der Anbieter neu bepreist – schau vor einem langen Clip auf die Schätzung im Arbeitsbereich.
Auf LUVI
Wähl FLUX 3 Video im Arbeitsbereich, schreib den Prompt und drück vor dem Generieren auf den Feder-Button daneben. Dieser Button ist LuviTransLex, die kostenlose Prüfung, die den Prompting Guide dieses Modells anwendet und korrigiert, was sie korrigieren kann.
Die Prüfung lohnt sich auch bei einem Prompt, der sauber aussieht. Diese Zeile wirkt sorgfältig gebaut: A man sits alone at a kitchen table, 16:9, 1080p, shot on Kodak Portra at f/1.8, (melancholy:1.4), quiet room tone, #1a1a1a shadows, 10 seconds. Die Prüfung gibt eine Korrektur und acht Warnungen zurück: Die Gewichtung fällt weg und das Wort bleibt, Filmemulsion und Blende werden als Bildvokabular markiert, der Hex-Code wird markiert, Seitenverhältnis, Auflösung und Dauer werden markiert, weil sie Parameter sind, und die Bitte um Stille wird markiert. Prüfen und Korrigieren kosten keine Credits.
FLUX 3 Video hat kein Feld für einen negativen Prompt, deshalb taucht es in seinem Panel nicht auf: Wann es dieses Feld gibt, hängt am Modell und nicht an einer Einstellung. Du kannst das Ganze auch aus Claude oder ChatGPT heraus steuern, über den LUVI-Connector.
Neu hier? Leg ein LUVI-Konto an – die Credits zur Anmeldung reichen für einen kurzen Testclip.
Quellen
- FLUX 3 Video, Part 1: Generation – Black Forest Labs, Produktblog, 4. August 2026 (auf Englisch). Abgerufen am 22. September 2026.
- FLUX 3 Dokumentation – Black Forest Labs, API-Dokumentation (auf Englisch). Abgerufen am 22. September 2026.
- FLUX 3: One Multimodal Model – Black Forest Labs, Modellseite (auf Englisch). Abgerufen am 22. September 2026.
Mehr aus Guides
- Hailuo richtig prompten: fünfzehn Kamerabefehle in eckigen KlammernHailuo nimmt die Kameraführung als Befehl in eckigen Klammern entgegen, aus einer geschlossenen Liste von fünfzehn, gesetzt an die Stelle, an der die Bewegung passiert. Das Modell erzeugt nur Bild: Jedes Wort über Ton ist verschenkt. Sechs Sekunden beginnen bei 380 Credits.
- Wan 3.0 richtig prompten: ohne benannte Kamera schneidet das Modell selbstWan 3.0 liest eine Formel, die sich aufbaut: Motiv, Schauplatz, Bewegung, dann die Optik, dann der Ton. Den Ton generiert es im selben Durchgang. Benennst du die Kamera nicht in jeder Einstellung, schneidet das Modell mitten in den Clip, den du als eine Einstellung wolltest.
- Hunyuan3D liest deinen Prompt nicht: Bei Bild zu 3D ist das Foto das ganze BriefingIn den Bild-zu-3D-Modi von Hunyuan3D wird das Textfeld gar nicht gelesen: Der Modellvertrag sagt, dass kein Prompt angenommen wird. Deine gesamte Kontrolle steckt darin, wie du das Eingabebild vorbereitest. Meshes starten bei 600 Credits auf Rapid und 1000 auf Pro.