← Zurück zum Blog

Welche KI-Videomodelle nutzen deinen eigenen Ton? Sprechertext, Musik und Dialog pro Modell

Alle Videomodelle auf 8frame, aus ihrem Code gelesen: welche eine Tonspur annehmen, die du mitbringst, und was jedes damit macht. Pruna p-video baut den Clip um deine Spur, Creatify Boreal kürzt sie auf die Längeneinstellung, Seedance nimmt sie als Referenz, drei Lip-Sync-Tools animieren damit ein Gesicht, und der Rest hat keinen Audioeingang. Preise für eine 10-Sekunden-Spur.

Auf 8frame nehmen acht Videomodelle eine Tonspur an, die du mitbringst (einen Sprechertext, ein Musikbett, eine Dialogzeile), und sie machen vier verschiedene Dinge damit. Pruna p-video und p-video Draft bauen den Clip um die Spur herum: Der Clip ist so lang wie die Spur, bis zu 20 Sekunden, und du bezahlst die Länge der Spur. Creatify Boreal behält deine Spur anstelle der Sprache, die es selbst erzeugt, nutzt davon aber nur so viele Sekunden, wie die Längeneinstellung vorgibt, und die startet bei 5. Seedance 2.5 und 2.0 nehmen sie als Referenz für die Generierung und schalten ihren eigenen Ton ab. Pruna Avatar, Hailuo H3 Max Lip Sync und OmniHuman 1.5 animieren damit ein Gesicht. Alle anderen Videomodelle, darunter Veo 3.1, jedes Kling, Wan, Gemini Omni Flash, Grok Imagine und das Basismodell Hailuo H3, haben keinen Audioeingang; bei ihnen legst du deine Spur im Video Editor unter den fertigen Clip. Alles Folgende wurde am 2026-10-01 aus dem Code von 8frame selbst gelesen.

Kurzfassung

Jedes Videomodell und dein Ton

Die Preise sind Credits für eine 10-Sekunden-Spur in den angegebenen Auflösungen; ein Credit ist zum Paketpreis etwa 0,01 US-Dollar wert. "Nicht möglich" heißt, dass der Node für dieses Modell keinen Audioeingang zeigt.

Modell auf 8frame Nimmt deinen Ton an? Was es damit macht Längenregel 10-s-Spur
Pruna p-video Ja, optional Richtet das Video an der Spur aus Clip = die Spur, auf die volle Sekunde aufgerundet, 1 bis 20 s; längere vor der Abrechnung abgelehnt 27 / 54 (720p / 1080p)
Pruna p-video Draft Ja, optional Wie p-video, im Entwurfsmodus Wie p-video 7 / 14 (720p / 1080p)
Pruna p-video 2 Pro (Speed, Quality) Nicht möglich Der Eingang ist ausgeblendet; eine Spur wird abgelehnt entfällt
Creatify Boreal Ja, optional Bleibt im Ergebnis anstelle der erzeugten Sprache (laut Anbieter) Clip = die Längeneinstellung, 1 bis 20 s, Standard 5; genutzt werden so viele erste Sekunden der Spur, eine kürzere Spur wird mit Stille aufgefüllt; Spuren bis 60 s werden angenommen 14 / 41 / 162 (720p / 1080p / 2K), mit der Länge auf 10
Seedance 2.5 Ja, optional, eine Spur Referenz für die Generierung; der eigene Ton von Seedance wird abgeschaltet Clip = die Längeneinstellung, 4 bis 30 s; eine Spur über 30 s wird auf ihre ersten 30 gekürzt 139 / 313 (480p / 720p); 1.307 in 720p mit einem Referenzvideo
Seedance 2.0 Ja, optional, eine Spur Wie 2.5 Clip = die Längeneinstellung, 4 bis 15 s; eine Spur über 15 s wird auf ihre ersten 15 gekürzt 96 / 216 (480p / 720p); 264 in 720p mit einem Referenzvideo
Pruna Avatar Pflicht Synchronisiert die Lippen eines Porträts mit der Spur Clip = die Spur, aufgerundet, bis 35 s; längere vor der Abrechnung abgelehnt 34 / 61 (720p / 1080p)
Hailuo H3 Max Lip Sync Pflicht, aus deiner 8frame-Bibliothek Synchronisiert die Lippen eines Standbilds mit der Spur Clip = die Spur, mindestens 5 s (kürzere abgelehnt); der Anbieter schneidet bei 14,8 s ab 68 / 108 / 216 / 432 (480p / 768p / 1080p / 2K)
OmniHuman 1.5 Pflicht Animiert ein Bild zur Spur Bis 35 s (längere abgelehnt), abgerechnet in 5-Sekunden-Schritten 224
Veo 3.1 (Lite, Fast, Standard), Kling v3, O3, 2.6 Pro und ältere, Wan 3.0, 3.0 Prime, 2.5, 2.2, Hailuo H3, Max Turbo, Max Camera Controls, Gemini Omni Flash, Grok Imagine, Happy Horse, Runway Gen-4 Turbo, Runway Act Two, ID-V2V Nicht möglich entfällt

Zwei der Modelle mit "nicht möglich" sind knapp dran. Die Anbieter-API von Wan 3.0 Prime hat ein Feld für Referenzton, aber 8frame sendet es nicht. Runway Act Two wird von einem Performance-Video gesteuert, nicht von einer Tonspur.

Pruna und Creatify Boreal sind neu auf 8frame, und keines der Lip-Sync-Tools hatte in den 30 Tagen bis 2026-09-30 Läufe in der Produktion; deshalb nennen wir hier Preise und Regeln, nicht Qualität.

Die Spur bestimmt die Länge: Pruna p-video

p-video und p-video Draft sind die einzigen Modelle auf 8frame, bei denen deine Spur entscheidet, wie lang der Clip wird. Das Schema von Pruna beschreibt den Eingang als "Input audio to condition video generation" und sagt, die Längeneinstellung sei "Ignored when audio is provided". 8frame hält sich daran: Mit angehängter Spur sendet es gar keine Länge und rechnet stattdessen die Spur ab.

Prunas eigene Seite nennt Musikvideos als Einsatz ("combine your own audio with generated visuals"). Wir haben kein 8frame-Ergebnis mit angehängter Spur geprüft; ob die Datei deine Spur unverändert abspielt, ist also nicht bestätigt. Einstellungen und die Tonfrage bei Draft stehen in Pruna p-video nutzen.

Die Längeneinstellung bestimmt die Länge: Creatify Boreal

Boreal arbeitet andersherum. Die API-Seite von fal sagt über deine Spur, sie "is preserved in the output instead of generated speech", und weiter: "the first duration seconds of the audio are used; shorter audio is padded with silence." Der Clip ist so lang wie die Längeneinstellung, egal wie lang die Spur ist.

8frame sendet diese Einstellung immer, und sie startet bei 5 Sekunden; ein 10-Sekunden-Sprechertext, den du anhängst, ohne sie zu ändern, kommt also als seine ersten 5 Sekunden zurück. Stell die Länge vor dem Generieren auf die Spur ein (bis 20 Sekunden). Boreal rechnet die Längeneinstellung ab, nicht die Spur: 10 Sekunden kosten 14 Credits in 720p, 41 in 1080p, 162 in 2K. 8frame nimmt für Boreal Spuren bis 60 Sekunden an, verwendet werden können aber immer nur die ersten 20. Die Prompt-Tags und die übrigen Einstellungen stehen in Creatify Boreal nutzen.

Die Spur führt, das Modell schweigt: Seedance

Seedance 2.5 und 2.0 nehmen deine Spur als Referenz. Das Schema von ByteDance auf Replicate beschreibt Referenzton als "for audio-driven generation and lip-sync" und sagt, du sollst im Prompt mit [Audio1] darauf verweisen; der Canvas-Node sendet eine Spur, das ist also der einzige Tag, den du brauchst. Drei Regeln ergeben sich aus dem Code von 8frame und diesem Schema:

  1. Der eigene Ton von Seedance geht aus. Sobald eine Referenzspur angehängt ist, sagt 8frame Seedance, keinen Ton zu erzeugen, egal wie der Ton-Schalter am Node steht. Ob deine Spur selbst in die Ausgabedatei übernommen wird, ist nicht bestätigt; wir haben keine geprüft.
  2. Die Längeneinstellung entscheidet weiter über den Clip. 8frame passt sie nicht an die Spur an, also stell sie selbst ein. Eine Spur, die länger ist, als die Version erlaubt (30 Sekunden bei 2.5, 15 bei 2.0), wird vor dem Senden auf ihre ersten 30 oder 15 Sekunden gekürzt.
  3. Ton allein reicht nicht. Laut Schema des Anbieters braucht eine Referenzspur mindestens ein Referenzbild oder ein Referenzvideo dazu, und bei 2.5 lässt sie sich nicht mit einem Endbild kombinieren.

Der Ton ändert den Preis nicht. Ein Referenzvideo schon: Es setzt Seedance auf seinen Tarif mit Videoeingabe, 1.307 Credits für 10 Sekunden in 720p bei 2.5, gegenüber 313 mit Referenzbildern. Der günstigere Weg, Seedance deine Spur zu geben, führt also über ein Referenzbild, nicht über ein Referenzvideo.

Die Spur bewegt ein Gesicht: Lip-Sync-Tools

Pruna Avatar, Hailuo H3 Max Lip Sync und OmniHuman 1.5 brauchen ein Porträt und eine Spur, und das Ergebnis folgt der Spur. Sie unterscheiden sich bei den Grenzen und darin, wie sie runden:

Der vollständige Preisvergleich, samt durchgerechnetem 30-Sekunden-Sprecherclip, steht in KI-Lippensynchronisation: Preis pro Modell.

Formate und Dateigrenzen

Modell Formate Dateigröße Längste Spur
Pruna p-video, Draft FLAC, MP3, WAV 10 MB 20 s (längere abgelehnt)
Creatify Boreal MP3, WAV 10 MB 60 s angenommen, die ersten 1 bis 20 s genutzt
Seedance 2.5 / 2.0 MP3, WAV 12 MB beliebig; gekürzt auf 30 s / 15 s
Pruna Avatar MP3, WAV 10 MB 35 s (längere abgelehnt)
Hailuo H3 Max Lip Sync MP3, WAV nicht bestätigt mindestens 5 s; abgeschnitten bei 14,8 s
OmniHuman 1.5 MP3, WAV 10 MB 35 s (längere abgelehnt)

Der Canvas lädt Ton als MP3 oder WAV hoch, FLAC ist hier also das einzige Format, das du nur bei p-video nutzen kannst. Eine Spur pro Node: Der Audioeingang fasst bei jedem Modell oben eine einzige Datei.

Wenn dein Ton schon in einem Video steckt

Einige Bearbeitungsmodi starten mit einem Clip statt mit einer Audiodatei und können dessen Ton behalten: Kling 2.6 Pro Motion Control behält standardmäßig den Originalton des Bewegungsvideos, Kling O1 Video hat einen Schalter zum Behalten des Tons (standardmäßig aus), die Videobearbeitung von Happy Horse hat einen Schalter zum Behalten des Originaltons, und auf 8frame fordert Wan 2.7 VideoEdit immer an, den Ton des Eingabeclips zu behalten. Sie behalten den Ton, den du mitgebracht hast; eine separate Spur nehmen sie nicht. Was jedes davon kostet, steht in welche KI-Videomodelle nur mit Text funktionieren.

Wenn du lieber generierten Ton willst

Wenn du keine Spur hast, erzeugt der Großteil des Katalogs eigenen Ton. Veo 3.1, Kling v3 und 2.6 Pro berechnen den Ton und lassen dich ihn abschalten, Seedance und Wan 3.0 Prime liefern ihn zum selben Preis mit, und Grok Imagine, Gemini Omni Flash, Creatify Boreal und die p-video-Modelle von Pruna fügen ihn immer hinzu. Welches Modell was macht und was Ton jeweils kostet, steht in welche KI-Videomodelle erzeugen Ton. Wenn ein Clip stumm zurückkam, geht warum hat mein KI-Video keinen Ton die Ursachen durch.

Du kannst die Spur auch auf 8frame erstellen und dann als deine eigene verwenden: ElevenLabs Text-to-Speech kostet 13 Credits pro angefangene 1.000 Zeichen, ein Soundeffekt 1 bis 6 Credits je nach Länge, und ein 30-Sekunden-Musikstück mit Lyria 2 kostet 13. Die Preise aller Stimm- und Musikmodelle stehen in KI-Musik, Stimme und Soundeffekte: Preise pro Modell.

Deinen eigenen Ton nachträglich unter jeden Clip legen

Für die Modelle ohne Audioeingang, und für eine Mischung, die du selbst steuern willst, fügst du den Ton nach der Generierung hinzu. 8frame hat neben dem Canvas einen eigenen Modus Video Editor mit einer Timeline: Zu seinen Ebenen gehören Video, Text, Untertitel und Ton. Lade deinen Sprechertext oder deine Musik hoch, leg Clip und Spur auf die Timeline, richte sie aneinander aus und rendere.

Dieser Weg funktioniert mit jedem Videomodell, und deine Spur wird nie einem Modell zum Neuinterpretieren übergeben. Zwei Tipps:

Zwei Hinweise für Leserinnen und Leser aus dem deutschsprachigen Raum: Die Preise von 8frame sind in US-Dollar, und die App-Oberfläche gibt es auf Deutsch. Ist dein Browser auf Deutsch eingestellt, öffnet sich die App auf Deutsch.

Häufige Fragen

Kann ich meinen eigenen Sprechertext in einem KI-Video verwenden? Auf 8frame ja, bei acht Modellen: Pruna p-video und Draft, Creatify Boreal, Seedance 2.5 und 2.0, Pruna Avatar, Hailuo H3 Max Lip Sync und OmniHuman 1.5. Bei jedem anderen Modell fügst du den Sprechertext nachträglich im Video Editor hinzu.

Welches KI-Videomodell macht den Clip so lang wie meinen Ton? Pruna p-video und p-video Draft, bis 20 Sekunden, und die Lip-Sync-Tools (Pruna Avatar und OmniHuman bis 35 Sekunden, Hailuo H3 Max Lip Sync bis etwa 15). Bei Creatify Boreal und Seedance entscheidet die Längeneinstellung über den Clip.

Warum wurde mein Sprechertext abgeschnitten? Bei Creatify Boreal entscheidet die Längeneinstellung, wie viel von der Spur genutzt wird, und sie startet bei 5 Sekunden. Bei Seedance wird eine Spur über 30 Sekunden (2.5) oder 15 Sekunden (2.0) gekürzt, und Hailuo H3 Max Lip Sync hört bei 14,8 Sekunden auf. Weitere Gründe stehen in warum ist mein KI-Video zu kurz.

Können Veo 3.1 oder Kling meine Audiodatei nutzen? Nein. Keines von beiden hat auf 8frame einen Audioeingang; beide erzeugen ihren eigenen Ton. Generiere den Clip und füge deine Spur dann im Video Editor hinzu.

Was ist der günstigste Weg zu einem Clip zu meiner eigenen Spur? Pruna p-video Draft: Eine 10-Sekunden-Spur kostet 7 Credits in 720p. Das volle p-video kostet 27, und Creatify Boreal mit der Länge auf 10 kostet 14.

Kostet mein eigener Ton extra? Nicht als Aufschlag. Bei p-video und den Lip-Sync-Tools bezahlst du die Länge der Spur; bei Creatify Boreal und Seedance bezahlst du die Längeneinstellung, mit oder ohne Spur.

Kann ich mehr als eine Spur anhängen? Nicht auf dem Canvas: Jeder Node nimmt eine. Der Anbieter von Seedance erlaubt mehrere Referenzspuren, aber der 8frame-Node sendet eine.

Kann ich meinen eigenen Ton über Claude oder Cursor nutzen? Nein. Der MCP-Connector von 8frame hat bei keinem Tool einen Audioeingang; die Lip-Sync-Tools und die tongesteuerten Modi (p-video mit einer Spur, Boreal oder Seedance mit deinem Ton) sind darüber also nicht verfügbar. Die Einrichtung steht in generate AI video from Claude (auf Englisch).

Quellen


Wähle das Modell danach, was deine Spur tun soll. Der 8frame-Canvas ist kostenlos und unbegrenzt; die Generierung ist kostenpflichtig ab 19 US-Dollar im Monat.

Verwandte Artikel

VergleichWelche KI-Videomodelle nur mit Text funktionieren und welche ein Startbild brauchenVergleichDie besten KI-Videogeneratoren für 4K 2026VergleichDie besten kostenlosen KI-Bild-zu-Video-Generatoren 2026

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates