HappyHorse prompten: ohne Tonangabe kommt der Clip stumm zurück

HappyHorse erzeugt Bild und Ton zusammen, leitet den Ton aber nicht aus dem Bild ab: Ein Prompt ohne Audiozeile liefert ein fast stummes Video. Außerdem gehört das Modell zu den wenigen, die Zeitmarken pro Einstellung einhalten – genau umgekehrt zu Seedance 2.5.

Veröffentlicht:

In einem dunklen Studio liegen vier Breitbildkader auf einer leuchtenden Zeitleiste, dazwischen kleine bernsteinfarbene Marken; aus dem zweiten Kader steigen warme Schallringe auf, die anderen drei tragen nur flache, matte Linien.

HappyHorse ist das Modell von Alibaba, das Bild und Ton in einem Durchgang erzeugt: Dialog, Effekte und Atmo kommen mit den Bildern, und die Lippensynchronität arbeitet auf Phonem-Ebene. Deutsch steht auf der Liste der sieben Sprachen, die unser Handbuch als synchronisiert führt – das ist längst nicht bei jedem Modell so. Auf LUVI gibt es Text zu Video, Bild zu Video, Referenz zu Video und Videobearbeitung, in 720P oder 1080P, drei bis fünfzehn Sekunden lang. Abgerechnet wird pro Sekunde, die Credit-Schätzung steht also vor dem Start im Arbeitsbereich, und eine Sekunde in 1080P kostet mehr als in 720P. Zwei Regeln dieses Modells stehen in keinem anderen unserer Handbücher, und genau an ihnen scheitern die meisten beim ersten Versuch.

Warum kam mein Clip fast stumm zurück?

HappyHorse leitet den Ton nicht aus dem Bild ab. Ein Prompt, der ein Gewitter tadellos beschreibt, aber keinen Satz über den Klang enthält, liefert ein fast stummes Video – denn der Ton entsteht aus Wörtern, nicht aus dem Bild. Überraschend ist das vor allem deshalb, weil die Dokumentation des Anbieters dabei nicht hilft: Die API-Referenz für Text zu Video enthält keinerlei Hinweise zum Ton, und ihr Beispiel-Prompt beschreibt nur Sichtbares, eine Stadt aus Pappe, durch die ein Zug fährt.

Deshalb verlangt das Handbuch, das wir für diese Familie führen, in jeder Korrektur eine Tonangabe – als Inhalt formuliert und nicht als Versprechen. Nimm die drei Ebenen, die die Szene wirklich braucht.

  • Vordergrund: der Dialog und der eine Effekt, um den es in der Szene geht.
  • Mittlere Ebene: Geräusche, die an etwas Sichtbarem hängen, also Schritte, Brutzeln, Wasser, Stoff.
  • Hintergrund: Atmo, Raumton, Musik.

Schreib das als eigenen Satz: Audio: rain on the awning, distant traffic, no music. Ausschlüsse kommen kurz und konkret ans Ende und wirken hier: „no music“, „no dialogue“, „no people in frame“.

Wie schreibt man einen Dialog, der synchron läuft?

Gib der Replik ein Sprach-Tag, setz sie in Anführungszeichen und schreib eine nicht englische Zeile in ihrer eigenen Schreibweise. Die Synchronität arbeitet auf Phonem-Ebene und ist auf echter Schrift trainiert, deshalb läuft eine lautschriftlich notierte Zeile schlechter als eine richtig geschriebene. Die Sprache des Prompts entscheidet nicht über die Sprache im Bild, das tun das Tag und der Text in den Anführungszeichen.

A young woman in a red coat stands under a shop awning at night and looks straight into the camera, neon reflections on the wet pavement, one slow push-in. She says in German, "Der letzte Bus ist schon weg." Audio: rain on the awning, distant traffic, no music.

Bei der genauen Sprachliste gehen die öffentlichen Quellen auseinander. Das Handbuch, das LUVI für diese Familie führt, nennt für 1.0 sieben Sprachen – Englisch, Mandarin, Kantonesisch, Japanisch, Koreanisch, Deutsch und Französisch – und vermerkt, dass 1.1 den Kreis erweitert. Die fal-Seite zu Happy Horse 1.1 nennt „English, French, Spanish, Turkish, Japanese, and more“. Beim Deutschen sind sich beide einig, für dich ist das also die gute Nachricht; bei jeder Sprache außerhalb der sieben hältst du die Replik sehr kurz oder transportierst den Sinn ohne Sprechen im Bild.

Sprechen mehrere, dann nummerier die Figuren und gib jedem Einsatz seinen Zeitbereich: 0-4s: character1 says in French, "..."; 4-8s: character2 laughs and replies, "...". Halt die sprechende Person frontal und die Sätze kurz.

Halten Zeitmarken auf HappyHorse?

Ja, und das ist die Regel, für die sich das Modell zu lernen lohnt. Einstellungen mit Zeitmarken werden hier eingehalten – anders als bei Seedance 2.5, das mit derselben Schreibweise das Gegenteil tut: Diese Familie richtet sich nach der Reihenfolge der Einstellungen, ihre Sekundenmarken sind instabil, wie wir in Seedance 2.5 richtig prompten beschrieben haben. Die Gewohnheit des einen Modells auf das andere zu übertragen ist der häufigste Weg, in beiden Richtungen eine Generierung zu verschenken.

Schreib die Einstellungen als Shot N (framing, start-end s):, halt jede bei ungefähr fünf Sekunden und achte darauf, dass die Figur über die Schnitte hinweg dieselbe bleibt.

Shot 1 (wide establishing, 0-5s): A fisherman in a yellow oilskin coat hauls a net over the rail of a small boat, overcast dawn light. Audio: gulls, wind, water against the hull. Shot 2 (medium, 5-10s): The same fisherman drinks from a steel flask in the wheelhouse, locked-off camera. Audio: engine hum under the cabin, the flask knocking against the console.

Halt die Einstellungen kurz und schreib die Physik mit. Lange Einstellungen verlieren die räumliche Konsistenz, nicht ausgeschriebene Physik bricht auf bekannte Weise – Türen, die von selbst zufallen, Wasser mit falscher Geschwindigkeit – und schnelle Bewegung verwischt feine Details an der Garderobe.

Wie lang darf der Prompt sein?

Die Grenze des Anbieters ist großzügig und meldet sich nicht. Die API-Referenz für Text zu Video von Alibaba Cloud schreibt: „Maximum 5,000 non-Chinese characters or 2,500 Chinese characters. Excess is truncated.“ Ein zu langer englischer Prompt wird also nicht abgelehnt, sondern hinten abgeschnitten – und das ist schlimmer, weil der Ton meistens am Ende steht.

Die Prüfung von LUVI warnt früher, bei 2500 Zeichen, also nach der vorsichtigen Lesart derselben Grenze. In der Praxis liegt die Obergrenze, auf die es ankommt, viel tiefer: Eine einzelne Einstellung will 20 bis 60 Wörter, denn ein längerer Prompt verdünnt seine eigene Kontrolle, Gesichter rutschen in einen generischen Durchschnitt und Hände verlieren ihre Geometrie.

Was macht einen HappyHorse-Prompt schlechter?

Vier Gewohnheiten, alle aus den Bildmodellen übernommen, und alle in der Prüfung messbar.

  • Lobende Adjektive. „Masterpiece“, „ultra-detailed“ und „hyperrealistic“ sind bei diesem Modell tote Wörter: bestenfalls wirkungslos, schlimmstenfalls schädlich. Ersetz sie durch Aufnahmesprache: „overcast daylight, wet asphalt, neon pink and cyan reflections in the puddles, 35mm telephoto, shallow depth of field“.
  • Gestapelte Kameraangaben. Eine pro Einstellung: ein Objektiv, oder ein Lichtrezept, oder eine Bewegung. Fünf auf einmal heben sich gegenseitig auf. Lass die Kamera in ihrem eigenen Satz, damit ihre Bewegung nicht als die der Figur gelesen wird.
  • Zu viel Choreografie. Eine Hauptbewegung, sauber beschrieben. „A child runs through a field“ liefert mehr als derselbe Satz, vollgestopft mit Haaren, Staub und schwingenden Armen.
  • Gewichtungen und Formate. Es gibt kein cfg und keine Gewichtungssyntax, und das Seitenverhältnis ist ein Parameter mit neun Werten: „16:9“ in den Prompt zu schreiben bewirkt nichts.

Was wir geprüft haben

  • Modelle: alibaba/happyhorse-1.1/text-to-video, /image-to-video und /reference-to-video sowie alibaba/happyhorse-1.0/video-edit.
  • Einstellungen: drei bis fünfzehn Sekunden, 720P und 1080P, die neun Seitenverhältnisse aus dem Schema, und der Referenzmodus mit bis zu neun Bildern.
  • Datum und Quellen: 22. September 2026. Die Modellschemata und Credit-Schätzungen auf LUVI, der Prompting Guide für diese Familie, die API-Referenz von Alibaba Cloud und die oben verlinkte fal-Seite.
  • Ergebnisse: Schema und Anbieterdokumentation stimmen bei der Dauer (3 bis 15 s, Standard 5) und bei allen neun Seitenverhältnissen überein. Die zitierte Prompt-Grenze ist der Wortlaut des Anbieters. Die Sprachlisten der beiden öffentlichen Quellen decken sich nicht, und der Beitrag sagt das, statt sich für eine zu entscheiden.
  • Grenzen: Für diesen Beitrag wurde nichts generiert, er behauptet also nichts über die Qualität der Ergebnisse. Credits ändern sich, wenn der Anbieter neu bepreist – schau vor einem langen Clip auf die Schätzung im Arbeitsbereich.

Auf LUVI

Wähl HappyHorse im Arbeitsbereich und drück vor dem Generieren auf den Feder-Button. Das ist LuviTransLex, die kostenlose Prüfung, die den Prompting Guide dieser Familie anwendet.

Bei diesem Modell greift sie hart durch, denn HappyHorse hat eine veröffentlichte Liste von Wörtern, die man meiden sollte. Schick ihr das hier: A beautiful woman walking in a stunning city, masterpiece, ultra-detailed, hyperrealistic, epic cinematic lighting, 16:9, (neon:1.3), slow motion handheld orbit push-in with a zoom and a shake. Zurück kommen zwei Korrekturen und vier Warnungen: „masterpiece“, „ultra-detailed“ und „hyperrealistic“ werden gelöscht, „beautiful“, „stunning“ und „epic“ als tote Qualitätsmarker gemeldet, das Seitenverhältnis als Parameter gemeldet, und die Gewichtung fällt weg, während neon bleibt. Was übrig bleibt, stapelt immer noch Kameraangaben – diesen Teil kürzt du selbst auf eine.

Der Referenzmodus nimmt bis zu neun Bilder, er ist also der richtige, wenn eine Figur wiedererkennbar bleiben soll: Sprich die übergebenen Personen als character1 und character2 an und binde die Identität in Worten. Steuern lässt sich das Ganze auch aus Claude oder ChatGPT, über den LUVI-Connector.

Neu hier? Leg ein LUVI-Konto an und fang mit einem Drei-Sekunden-Clip an – günstiger kannst du nicht hören, ob deine Tonangabe gegriffen hat.

Quellen

Mehr aus Guides