Vom Skript zur sprechenden Moderation: erst die Stimme, dann die Lippensynchronität

Aus einem Skript eine Moderation zu machen sind zwei Generierungen: Ein Stimmmodell liest den Text, ein Lipsync-Modell legt diesen Ton auf ein Gesicht. Der Stimmschritt ist billig genug für zehn Versuche, der Gesichtsschritt nicht. Hier steht die Reihenfolge, die Credits spart.

Veröffentlicht:

Drei Stationen auf einem dunklen Schreibtisch, verbunden durch dünne indigofarbene Linien: eine kleine leere Karte, eine bernsteinfarbene Klangwelle, die von einer Messingplatte aufsteigt, und ein deutlich größeres gerahmtes Porträt einer sprechenden Person.

Eine sprechende Moderation sind zwei Generierungen, nicht eine. Zuerst liest ein Stimmmodell dein Skript und erzeugt eine Audiodatei, dann nimmt ein Lipsync-Modell diese Datei plus ein Porträt und animiert das Gesicht. Die Reihenfolge zählt weniger als die Rechnung: Auf LUVI kostet der Stimmschritt Dutzende Credits und der Gesichtsschritt Tausende. Das ganze Handwerk dieses Workflows besteht also darin, die Lesung richtig zu bekommen, bevor überhaupt etwas animiert wird.

Schritt eins: das Skript in eine Stimme verwandeln

Sieben Text-zu-Sprache-Modelle stehen im Katalog, und sie rechnen nach Zeichen statt nach Clip ab: je 1000 Zeichen, linear und ohne Blockrundung. Ein Absatz mit 600 Zeichen kostet rund sechs Zehntel des Tausend-Zeichen-Satzes.

Die Staffel, geprüft am 22. September 2026:

Weil der Preis der Zeichenzahl folgt, ist das der eine Schritt in der Kette, den du dir mehrfach leisten kannst. Einen Satz umzuschreiben und das ganze Skript neu einlesen zu lassen kostet in Credits sehr wenig, und es ist der günstigste denkbare Ort, um zu merken, dass eine Zeile nicht nach einem Menschen klingt.

Welches Stimmmodell, und wie steuert man es?

ElevenLabs v3 bietet die meiste Steuerung. Es zeigt 21 benannte Stimmen, einen stability-Regler von 0 bis 1, ein Feld language_code, das eine Sprache erzwingt, und einen Schalter für Textnormalisierung mit auto, on und off, der entscheidet, ob Zahlen ausgeschrieben werden. Der eigene Hinweis des Modells lohnt Beachtung: Die mehrsprachigen Stimmen tragen alle Sprachen, die übrigen sind auf ihre Muttersprache abgestimmt und ändern das Sprachfeld, sobald du sie wählst.

Dieser Normalisierungsschalter ist die stille Falle. Ein Skript mit „2026“ oder „1250 Euro“ klingt völlig anders, je nachdem ob das Modell es ausschreibt, und auto entscheidet nicht immer so, wie es eine Moderation täte. Steckt dein Skript voller Zahlen, setz den Schalter bewusst.

Schritt zwei: die Stimme auf ein Gesicht legen

Jetzt ist der Ton die Uhr. Die Lipsync-Modelle, die von einem Porträt ausgehen, rechnen nach Tonsekunde ab – die Länge der eben erzeugten Datei ist also die Höhe der Rechnung:

  • OmniHuman 1.5 nimmt ein Porträt und bis zu 60 Sekunden Ton.
  • VEED Fabric 1.0 nimmt bis zu 300 Sekunden.
  • InfiniteTalk nimmt bis zu zehn Minuten, in 480p oder 720p, und ist die einzige Option, sobald ein Skript lang wird.

Das Porträt will dasselbe wie ein gutes Bewerbungsfoto: frontal, gleichmäßig beleuchtet, kein harter Schatten quer über dem Mund, nichts, was die Kieferlinie schneidet.

Was kostet die ganze Kette?

Ein gemessenes Beispiel, als Schätzungen am 22. September 2026 erhoben. Das Skript ist ein einzelner Absatz mit etwa 600 Zeichen, in natürlichem Tempo also ungefähr vierzig Sekunden.

  • Stimme, auf Gemini 2.5 Flash TTS: 49 Credits.
  • Gesicht, auf OmniHuman 1.5 mit diesen vierzig Sekunden Ton: 9600 Credits.

Der Gesichtsschritt kostet rund das Zweihundertfache des Stimmschritts. Dieses eine Verhältnis ist das ganze Argument für die Reihenfolge in diesem Beitrag: Stimme erzeugen, anhören, Skript korrigieren, Stimme neu erzeugen – und erst wenn die Lesung sitzt, überhaupt etwas ins Bild stecken. Zwei Sekunden Stille am Anfang der Audiodatei wegzuschneiden bringt hier mehr als jeder Prompt.

Was wir geprüft haben

  • Modelle: die sieben Text-zu-Sprache-Varianten im Audiokatalog, dazu bytedance/avatar-omni-human-v1.5, veed/fabric-1.0/image-to-video und die InfiniteTalk-Variante.
  • Gelesene Quellen: je Variante die Parameter, die Referenzplätze und der Preis, entnommen sowohl dem Katalog-Code der App als auch den öffentlichen Modellseiten; beide stimmten bei allen Zahlen oben überein.
  • Datum und Durchläufe: 22. September 2026. Die beiden Zahlen im Beispiel sind Live-Schätzungen für ein Skript mit 600 Zeichen und eine Tonspur von vierzig Sekunden.
  • Ergebnisse: 49 Credits für die Stimme, 9600 Credits für das animierte Gesicht, dazu die Staffel je 1000 Zeichen wie aufgeführt.
  • Grenzen: Für diesen Beitrag wurde nichts generiert, er behauptet also nichts über Stimm- oder Synchronqualität. Vierzig Sekunden ist eine geschätzte Lesedauer und nicht die Messung einer konkreten Datei – abgerechnet wird die Länge deines eigenen Tons.

Auf LUVI

Du kannst das als zwei Schritte im Arbeitsbereich machen, und für einen Einzelfall ist das der schnellste Weg: Ton erzeugen, in der Bibliothek suchen, dann das Lipsync-Modell öffnen und Porträt und Ton in seine beiden Plätze legen.

Für alles, was du wiederholen wirst, bau es lieber als Workflow. Der Node-Canvas hängt die Tonausgabe direkt an den Tonplatz des Lipsync-Modells, eine Skriptänderung lässt also die ganze Kette neu laufen, ohne dass du Dateien hin- und herschiebst, und die Schätzung für den ganzen Graphen erscheint vor dem Start. Workflows laufen nur am Rechner.

Dieselbe Kette lässt sich aus Claude oder ChatGPT über den LUVI-Connector steuern, was hier wirklich hilft: Der Assistent behält das Skript, ändert eine Zeile und lässt nur den Stimmschritt neu laufen, bis die Lesung sitzt.

Neu hier? Leg ein LUVI-Konto an und steck deine ersten Credits in zwei, drei Fassungen der Stimme, bevor du irgendetwas animierst.

Quellen

  • OmniHuman-1.5 – OmniHuman Lab, Projektseite (auf Englisch). Abgerufen am 22. September 2026.
  • ElevenLabs – ElevenLabs, Produktseite (auf Englisch). Abgerufen am 22. September 2026.

Mehr aus Workflows