← Zurück zum Blog

KI-Lippensynchronisation: Preis pro Modell 2026, Pruna Avatar, Hailuo H3 und OmniHuman auf 8frame

Was es auf 8frame kostet, ein Foto zu deiner Tonspur sprechen zu lassen, laut Preiscode: Pruna Avatar ab 17 Credits für 5 Sekunden, Hailuo H3 Max Lip Sync ab 34, OmniHuman 1.5 für 112 und Runway Act Two für 8 pro Sekunde Performance. Längen, Abrechnung und ein 30-Sekunden-Sprecher durchgerechnet.

Ein Standbild zu deiner eigenen Tonspur sprechen zu lassen, kostet auf 8frame von 17 Credits für 5 Sekunden (Pruna Avatar in 720p) bis 112 (OmniHuman 1.5), dazwischen Hailuo H3 Max Lip Sync mit 34 bis 216 je nach Auflösung. Ein Credit ist zum Paketpreis 0,01 US-Dollar wert. Diese Werkzeuge nehmen ein Porträt und eine Tonspur, und das Ergebnis ist so lang wie der Ton. Runway Act Two ist der andere Weg: Eine echte, auf Video aufgenommene Performance steuert eine Figur, für 8 Credits pro Sekunde. Die Preise stammen aus dem Preiscode von 8frame, gelesen am 2026-09-30.

Lip-Sync-Werkzeuge auf 8frame in einer Tabelle

Werkzeug Was du hineingibst Länge 5 Sekunden Credits pro Sekunde
Pruna Avatar ein Porträt und eine Tonspur folgt dem Ton, bis 35 s 17 in 720p, 31 in 1080p 3,4 / 6,1
Hailuo H3 Max Lip Sync ein Standbild und eine Tonspur folgt dem Ton, mindestens 5 s, bis etwa 15 s 34 / 54 / 108 / 216 in 480p / 768p / 1080p / 2K 6,75 / 10,8 / 21,6 / 43,2
OmniHuman 1.5 ein Bild und eine Tonspur 5 bis 35 s, abgerechnet in 5-Sekunden-Schritten 112 22,4
Runway Act Two eine Figur (Bild oder Video) und ein Performance-Video 3 bis 30 s Referenz 40 8

Keines dieser Werkzeuge hatte in den 30 Tagen bis 2026-09-30 Produktionsläufe auf 8frame, daher nennen wir den Preis, nicht die Qualität. Teste mit deinem eigenen Porträt und deiner Stimme, bevor du ein Projekt festlegst.

Wie jedes abrechnet

Pruna Avatar rechnet pro Sekunde erzeugtes Video ab, und das Video folgt deinem Ton, den 8frame misst und auf die nächste Sekunde aufrundet. In 720p sind es 3,375 Credits pro Sekunde, in 1080p 6,075. Tonspuren über 35 Sekunden werden vor der Abbuchung abgelehnt. Das Ergebnis behält das Format des Porträts.

Hailuo H3 Max Lip Sync rechnet ebenfalls die Länge des Tons ab, mit mindestens 5 Sekunden, in vier Auflösungsstufen; 768p ist Standard. Es nimmt etwa 15 Sekunden Ton pro Generierung, ein längeres Skript wird also auf mehrere Clips verteilt.

OmniHuman 1.5 rechnet in 5-Sekunden-Schritten von 5 bis 35 Sekunden ab: Eine 7-Sekunden-Spur wird als 10 Sekunden berechnet, 224 Credits.

Runway Act Two funktioniert anders: Statt einer Tonspur gibst du ein Video von jemandem, der spielt, und es überträgt die Performance (Gesicht und Timing) auf deine Figur, für 8 Credits pro Sekunde der Referenz.

Ein 30-Sekunden-Sprecher, durchgerechnet

Ein Porträt und ein 30-Sekunden-Skript, gelesen von einer synthetischen Stimme:

Weg Generierung Credits
Porträt Nano Banana 2, 1K 11
Sprachspur (unter 1.000 Zeichen) ElevenLabs Text zu Sprache 13
Pruna Avatar, 720p, 30 s ein Clip 102
Pruna Avatar, 1080p, 30 s ein Clip 183
Hailuo H3 Max Lip Sync, 768p zwei 15-Sekunden-Clips 324
OmniHuman 1.5, 30 s ein Clip 672

Ein 30-Sekunden-Sprecher kostet also von 126 Credits (Porträt, Stimme und Pruna Avatar in 720p) bis 696 (dasselbe mit OmniHuman). Mit deiner eigenen aufgenommenen Stimme statt Text zu Sprache fallen die 13 weg.

Welches nehmen

Am günstigsten und lang genug für ein ganzes Skript: Pruna Avatar, bis zu 35 Sekunden in einem Clip.

Höchste Auflösung: Hailuo H3 Max Lip Sync in 2K (216 für 5 Sekunden).

Wenn das Timing eines echten Schauspielers wichtiger ist als eine Sprachspur: Runway Act Two, gesteuert von einem Performance-Video.

Wenn du gar keine Tonspur hast: Modelle, die eine sprechende Person mit Ton in einem Durchgang erzeugen, etwa Veo 3.1 (448 Credits für 8 Sekunden mit Ton), liefern die Stimme des Modells, nicht deine. Für eine bestimmte Stimme erstellst du zuerst die Spur und nimmst dann ein Lip-Sync-Werkzeug.

Bevor du anfängst

Nimm ein Porträt, das du animieren darfst, und eine Stimme, die du nutzen darfst. Gesicht oder Stimme einer echten Person brauchen deren dokumentierte Einwilligung, und Plattformen haben Regeln zur Kennzeichnung realistischer synthetischer Personen.

Worauf achten: Mundformen bei harten Konsonanten, stabile Zähne, natürliches Blinzeln und dass der Kopf in einem langen Clip nicht aus dem Bildausschnitt des Porträts wandert.

Häufige Fragen

Was ist die günstigste KI-Lippensynchronisation? Auf 8frame Pruna Avatar in 720p: 17 Credits für 5 Sekunden, 102 für 30 Sekunden.

Was kostet OmniHuman? Auf 8frame 22,4 Credits pro Sekunde, abgerechnet in 5-Sekunden-Schritten von 5 bis 35: 112 für 5 Sekunden, 672 für 30.

Wie lang kann ein Lip-Sync-Clip sein? Bis 35 Sekunden mit Pruna Avatar oder OmniHuman, etwa 15 Sekunden pro Clip mit Hailuo H3 Max Lip Sync. Längere Skripte werden aufgeteilt und verbunden (Merge Videos kostet 10 Credits pro Verbindung).

Ist Lippensynchronisation dasselbe wie ein sprechender Avatar? Sie ist dessen Kern: ein Standbild einer Person, zu einer Tonspur animiert. Alle Sekundenpreise für Video stehen in KI-Video: Preis pro Sekunde.

Quellen


Sprachspur erstellen, Preisstufe wählen, Mund prüfen. Der 8frame-Canvas ist kostenlos und unbegrenzt; die Generierung ist kostenpflichtig ab 19 US-Dollar im Monat.

Verwandte Artikel

RatgeberKI-Video: Preis pro Sekunde 2026, jedes Modell auf 8frame von 0,7 bis 56 CreditsRatgeberCreatify Boreal nutzen: Video mit eigenem Ton ab 7 CreditsRatgeberKI-Bild-Auflösung pro Modell 2026: Welche Modelle 4K können und was es kostet

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates