Auf 8frame nehmen acht Videomodelle eine Tonspur an, die du mitbringst (einen Sprechertext, ein Musikbett, eine Dialogzeile), und sie machen vier verschiedene Dinge damit. Pruna p-video und p-video Draft bauen den Clip um die Spur herum: Der Clip ist so lang wie die Spur, bis zu 20 Sekunden, und du bezahlst die Länge der Spur. Creatify Boreal behält deine Spur anstelle der Sprache, die es selbst erzeugt, nutzt davon aber nur so viele Sekunden, wie die Längeneinstellung vorgibt, und die startet bei 5. Seedance 2.5 und 2.0 nehmen sie als Referenz für die Generierung und schalten ihren eigenen Ton ab. Pruna Avatar, Hailuo H3 Max Lip Sync und OmniHuman 1.5 animieren damit ein Gesicht. Alle anderen Videomodelle, darunter Veo 3.1, jedes Kling, Wan, Gemini Omni Flash, Grok Imagine und das Basismodell Hailuo H3, haben keinen Audioeingang; bei ihnen legst du deine Spur im Video Editor unter den fertigen Clip. Alles Folgende wurde am 2026-10-01 aus dem Code von 8frame selbst gelesen.
Kurzfassung
- Die Spur bestimmt die Länge: Pruna p-video und Draft. 1 bis 20 Sekunden, abgerechnet nach der Spur: Eine 10-Sekunden-Spur kostet 27 Credits in 720p, 7 bei Draft. Eine längere Spur wird abgelehnt, bevor dir etwas berechnet wird
- Die Längeneinstellung bestimmt die Länge: Creatify Boreal nutzt die ersten N Sekunden deiner Spur, wobei N die Längeneinstellung ist (Standard 5). Stell sie für eine 10-Sekunden-Spur auf 10: 14 Credits in 720p
- Die Spur führt, das Modell schweigt: Seedance 2.5 und 2.0 nehmen auf dem Canvas eine Referenzspur und schalten ihren eigenen Ton ab. Der Preis folgt der Längeneinstellung, nicht dem Ton: 313 für 10 Sekunden in 720p bei 2.5
- Die Spur bewegt ein Gesicht: Pruna Avatar (34 für 10 Sekunden in 720p), Hailuo H3 Max Lip Sync (108 in seinem Standard von 768p), OmniHuman 1.5 (224)
- Kein Audioeingang: alle anderen Videomodelle. Leg deine Spur nachträglich im Video Editor an
- Formate: MP3 oder WAV bei jedem Modell, das eine Spur annimmt; p-video nimmt auch FLAC
Jedes Videomodell und dein Ton
Die Preise sind Credits für eine 10-Sekunden-Spur in den angegebenen Auflösungen; ein Credit ist zum Paketpreis etwa 0,01 US-Dollar wert. "Nicht möglich" heißt, dass der Node für dieses Modell keinen Audioeingang zeigt.
| Modell auf 8frame | Nimmt deinen Ton an? | Was es damit macht | Längenregel | 10-s-Spur |
|---|---|---|---|---|
| Pruna p-video | Ja, optional | Richtet das Video an der Spur aus | Clip = die Spur, auf die volle Sekunde aufgerundet, 1 bis 20 s; längere vor der Abrechnung abgelehnt | 27 / 54 (720p / 1080p) |
| Pruna p-video Draft | Ja, optional | Wie p-video, im Entwurfsmodus | Wie p-video | 7 / 14 (720p / 1080p) |
| Pruna p-video 2 Pro (Speed, Quality) | Nicht möglich | Der Eingang ist ausgeblendet; eine Spur wird abgelehnt | entfällt | |
| Creatify Boreal | Ja, optional | Bleibt im Ergebnis anstelle der erzeugten Sprache (laut Anbieter) | Clip = die Längeneinstellung, 1 bis 20 s, Standard 5; genutzt werden so viele erste Sekunden der Spur, eine kürzere Spur wird mit Stille aufgefüllt; Spuren bis 60 s werden angenommen | 14 / 41 / 162 (720p / 1080p / 2K), mit der Länge auf 10 |
| Seedance 2.5 | Ja, optional, eine Spur | Referenz für die Generierung; der eigene Ton von Seedance wird abgeschaltet | Clip = die Längeneinstellung, 4 bis 30 s; eine Spur über 30 s wird auf ihre ersten 30 gekürzt | 139 / 313 (480p / 720p); 1.307 in 720p mit einem Referenzvideo |
| Seedance 2.0 | Ja, optional, eine Spur | Wie 2.5 | Clip = die Längeneinstellung, 4 bis 15 s; eine Spur über 15 s wird auf ihre ersten 15 gekürzt | 96 / 216 (480p / 720p); 264 in 720p mit einem Referenzvideo |
| Pruna Avatar | Pflicht | Synchronisiert die Lippen eines Porträts mit der Spur | Clip = die Spur, aufgerundet, bis 35 s; längere vor der Abrechnung abgelehnt | 34 / 61 (720p / 1080p) |
| Hailuo H3 Max Lip Sync | Pflicht, aus deiner 8frame-Bibliothek | Synchronisiert die Lippen eines Standbilds mit der Spur | Clip = die Spur, mindestens 5 s (kürzere abgelehnt); der Anbieter schneidet bei 14,8 s ab | 68 / 108 / 216 / 432 (480p / 768p / 1080p / 2K) |
| OmniHuman 1.5 | Pflicht | Animiert ein Bild zur Spur | Bis 35 s (längere abgelehnt), abgerechnet in 5-Sekunden-Schritten | 224 |
| Veo 3.1 (Lite, Fast, Standard), Kling v3, O3, 2.6 Pro und ältere, Wan 3.0, 3.0 Prime, 2.5, 2.2, Hailuo H3, Max Turbo, Max Camera Controls, Gemini Omni Flash, Grok Imagine, Happy Horse, Runway Gen-4 Turbo, Runway Act Two, ID-V2V | Nicht möglich | entfällt |
Zwei der Modelle mit "nicht möglich" sind knapp dran. Die Anbieter-API von Wan 3.0 Prime hat ein Feld für Referenzton, aber 8frame sendet es nicht. Runway Act Two wird von einem Performance-Video gesteuert, nicht von einer Tonspur.
Pruna und Creatify Boreal sind neu auf 8frame, und keines der Lip-Sync-Tools hatte in den 30 Tagen bis 2026-09-30 Läufe in der Produktion; deshalb nennen wir hier Preise und Regeln, nicht Qualität.
Die Spur bestimmt die Länge: Pruna p-video
p-video und p-video Draft sind die einzigen Modelle auf 8frame, bei denen deine Spur entscheidet, wie lang der Clip wird. Das Schema von Pruna beschreibt den Eingang als "Input audio to condition video generation" und sagt, die Längeneinstellung sei "Ignored when audio is provided". 8frame hält sich daran: Mit angehängter Spur sendet es gar keine Länge und rechnet stattdessen die Spur ab.
- Abrechnung: 8frame misst die Spur selbst und rechnet sie auf die volle Sekunde aufgerundet ab. Eine Spur, die es nicht messen kann, wird mit der Obergrenze von 20 Sekunden abgerechnet: 54 Credits bei p-video in 720p.
- Grenze: 20 Sekunden. Eine längere Spur wird abgelehnt, bevor dir etwas berechnet wird, nicht gekürzt; schneide sie also vorher.
- Prompt: bleibt Pflicht. Ein Startbild ist optional.
- p-video 2 Pro: hat kein Audiofeld. Der Node blendet den Eingang für diese Variante aus, und das Backend lehnt eine Spur ab.
Prunas eigene Seite nennt Musikvideos als Einsatz ("combine your own audio with generated visuals"). Wir haben kein 8frame-Ergebnis mit angehängter Spur geprüft; ob die Datei deine Spur unverändert abspielt, ist also nicht bestätigt. Einstellungen und die Tonfrage bei Draft stehen in Pruna p-video nutzen.
Die Längeneinstellung bestimmt die Länge: Creatify Boreal
Boreal arbeitet andersherum. Die API-Seite von fal sagt über deine Spur, sie "is preserved in the output instead of generated speech", und weiter: "the first duration seconds of the audio are used; shorter audio is padded with silence." Der Clip ist so lang wie die Längeneinstellung, egal wie lang die Spur ist.
8frame sendet diese Einstellung immer, und sie startet bei 5 Sekunden; ein 10-Sekunden-Sprechertext, den du anhängst, ohne sie zu ändern, kommt also als seine ersten 5 Sekunden zurück. Stell die Länge vor dem Generieren auf die Spur ein (bis 20 Sekunden). Boreal rechnet die Längeneinstellung ab, nicht die Spur: 10 Sekunden kosten 14 Credits in 720p, 41 in 1080p, 162 in 2K. 8frame nimmt für Boreal Spuren bis 60 Sekunden an, verwendet werden können aber immer nur die ersten 20. Die Prompt-Tags und die übrigen Einstellungen stehen in Creatify Boreal nutzen.
Die Spur führt, das Modell schweigt: Seedance
Seedance 2.5 und 2.0 nehmen deine Spur als Referenz. Das Schema von ByteDance auf Replicate beschreibt Referenzton als "for audio-driven generation and lip-sync" und sagt, du sollst im Prompt mit [Audio1] darauf verweisen; der Canvas-Node sendet eine Spur, das ist also der einzige Tag, den du brauchst. Drei Regeln ergeben sich aus dem Code von 8frame und diesem Schema:
- Der eigene Ton von Seedance geht aus. Sobald eine Referenzspur angehängt ist, sagt 8frame Seedance, keinen Ton zu erzeugen, egal wie der Ton-Schalter am Node steht. Ob deine Spur selbst in die Ausgabedatei übernommen wird, ist nicht bestätigt; wir haben keine geprüft.
- Die Längeneinstellung entscheidet weiter über den Clip. 8frame passt sie nicht an die Spur an, also stell sie selbst ein. Eine Spur, die länger ist, als die Version erlaubt (30 Sekunden bei 2.5, 15 bei 2.0), wird vor dem Senden auf ihre ersten 30 oder 15 Sekunden gekürzt.
- Ton allein reicht nicht. Laut Schema des Anbieters braucht eine Referenzspur mindestens ein Referenzbild oder ein Referenzvideo dazu, und bei 2.5 lässt sie sich nicht mit einem Endbild kombinieren.
Der Ton ändert den Preis nicht. Ein Referenzvideo schon: Es setzt Seedance auf seinen Tarif mit Videoeingabe, 1.307 Credits für 10 Sekunden in 720p bei 2.5, gegenüber 313 mit Referenzbildern. Der günstigere Weg, Seedance deine Spur zu geben, führt also über ein Referenzbild, nicht über ein Referenzvideo.
Die Spur bewegt ein Gesicht: Lip-Sync-Tools
Pruna Avatar, Hailuo H3 Max Lip Sync und OmniHuman 1.5 brauchen ein Porträt und eine Spur, und das Ergebnis folgt der Spur. Sie unterscheiden sich bei den Grenzen und darin, wie sie runden:
- Pruna Avatar: rundet auf die volle Sekunde auf, bis 35 Sekunden; längere Spuren werden vor der Abrechnung abgelehnt. Eine Spur, die 8frame nicht messen kann, wird mit der Obergrenze von 35 Sekunden abgerechnet (119 in 720p).
- Hailuo H3 Max Lip Sync: nimmt keinen Prompt. Die Spur muss eine Datei in deiner 8frame-Bibliothek sein (lade sie hoch oder wähl sie dort aus). Unter 5 Sekunden wird sie abgelehnt; über 14,8 schneidet der Anbieter sie ab, und die Abrechnung endet bei 15 Sekunden.
- OmniHuman 1.5: rechnet in 5-Sekunden-Schritten ab; eine 10,4-Sekunden-Spur wird also als 15 Sekunden berechnet, 336 Credits.
Der vollständige Preisvergleich, samt durchgerechnetem 30-Sekunden-Sprecherclip, steht in KI-Lippensynchronisation: Preis pro Modell.
Formate und Dateigrenzen
| Modell | Formate | Dateigröße | Längste Spur |
|---|---|---|---|
| Pruna p-video, Draft | FLAC, MP3, WAV | 10 MB | 20 s (längere abgelehnt) |
| Creatify Boreal | MP3, WAV | 10 MB | 60 s angenommen, die ersten 1 bis 20 s genutzt |
| Seedance 2.5 / 2.0 | MP3, WAV | 12 MB | beliebig; gekürzt auf 30 s / 15 s |
| Pruna Avatar | MP3, WAV | 10 MB | 35 s (längere abgelehnt) |
| Hailuo H3 Max Lip Sync | MP3, WAV | nicht bestätigt | mindestens 5 s; abgeschnitten bei 14,8 s |
| OmniHuman 1.5 | MP3, WAV | 10 MB | 35 s (längere abgelehnt) |
Der Canvas lädt Ton als MP3 oder WAV hoch, FLAC ist hier also das einzige Format, das du nur bei p-video nutzen kannst. Eine Spur pro Node: Der Audioeingang fasst bei jedem Modell oben eine einzige Datei.
Wenn dein Ton schon in einem Video steckt
Einige Bearbeitungsmodi starten mit einem Clip statt mit einer Audiodatei und können dessen Ton behalten: Kling 2.6 Pro Motion Control behält standardmäßig den Originalton des Bewegungsvideos, Kling O1 Video hat einen Schalter zum Behalten des Tons (standardmäßig aus), die Videobearbeitung von Happy Horse hat einen Schalter zum Behalten des Originaltons, und auf 8frame fordert Wan 2.7 VideoEdit immer an, den Ton des Eingabeclips zu behalten. Sie behalten den Ton, den du mitgebracht hast; eine separate Spur nehmen sie nicht. Was jedes davon kostet, steht in welche KI-Videomodelle nur mit Text funktionieren.
Wenn du lieber generierten Ton willst
Wenn du keine Spur hast, erzeugt der Großteil des Katalogs eigenen Ton. Veo 3.1, Kling v3 und 2.6 Pro berechnen den Ton und lassen dich ihn abschalten, Seedance und Wan 3.0 Prime liefern ihn zum selben Preis mit, und Grok Imagine, Gemini Omni Flash, Creatify Boreal und die p-video-Modelle von Pruna fügen ihn immer hinzu. Welches Modell was macht und was Ton jeweils kostet, steht in welche KI-Videomodelle erzeugen Ton. Wenn ein Clip stumm zurückkam, geht warum hat mein KI-Video keinen Ton die Ursachen durch.
Du kannst die Spur auch auf 8frame erstellen und dann als deine eigene verwenden: ElevenLabs Text-to-Speech kostet 13 Credits pro angefangene 1.000 Zeichen, ein Soundeffekt 1 bis 6 Credits je nach Länge, und ein 30-Sekunden-Musikstück mit Lyria 2 kostet 13. Die Preise aller Stimm- und Musikmodelle stehen in KI-Musik, Stimme und Soundeffekte: Preise pro Modell.
Deinen eigenen Ton nachträglich unter jeden Clip legen
Für die Modelle ohne Audioeingang, und für eine Mischung, die du selbst steuern willst, fügst du den Ton nach der Generierung hinzu. 8frame hat neben dem Canvas einen eigenen Modus Video Editor mit einer Timeline: Zu seinen Ebenen gehören Video, Text, Untertitel und Ton. Lade deinen Sprechertext oder deine Musik hoch, leg Clip und Spur auf die Timeline, richte sie aneinander aus und rendere.
Dieser Weg funktioniert mit jedem Videomodell, und deine Spur wird nie einem Modell zum Neuinterpretieren übergeben. Zwei Tipps:
- Generiere stumm, wo es geht. Bei Veo 3.1 und bei Kling v3, 2.6 Pro und O3 senkt das Abschalten des Tons den Preis, und du ersetzt ihn ohnehin. Grok Imagine, Gemini Omni Flash, Creatify Boreal und die p-video-Modelle von Pruna fügen immer Ton hinzu, ihr eigener Ton kommt also ebenfalls im Clip an.
- Der Canvas hat keine Timeline. Sein Montage-Node fügt 2 bis 10 Clips mit Übergängen für 10 Credits zusammen, nimmt aber keine Tonspur; Ton gehört in den Video Editor. Die Längengrenzen der Clips für die Schnittplanung stehen in maximale KI-Videolänge pro Modell.
Zwei Hinweise für Leserinnen und Leser aus dem deutschsprachigen Raum: Die Preise von 8frame sind in US-Dollar, und die App-Oberfläche gibt es auf Deutsch. Ist dein Browser auf Deutsch eingestellt, öffnet sich die App auf Deutsch.
Häufige Fragen
Kann ich meinen eigenen Sprechertext in einem KI-Video verwenden? Auf 8frame ja, bei acht Modellen: Pruna p-video und Draft, Creatify Boreal, Seedance 2.5 und 2.0, Pruna Avatar, Hailuo H3 Max Lip Sync und OmniHuman 1.5. Bei jedem anderen Modell fügst du den Sprechertext nachträglich im Video Editor hinzu.
Welches KI-Videomodell macht den Clip so lang wie meinen Ton? Pruna p-video und p-video Draft, bis 20 Sekunden, und die Lip-Sync-Tools (Pruna Avatar und OmniHuman bis 35 Sekunden, Hailuo H3 Max Lip Sync bis etwa 15). Bei Creatify Boreal und Seedance entscheidet die Längeneinstellung über den Clip.
Warum wurde mein Sprechertext abgeschnitten? Bei Creatify Boreal entscheidet die Längeneinstellung, wie viel von der Spur genutzt wird, und sie startet bei 5 Sekunden. Bei Seedance wird eine Spur über 30 Sekunden (2.5) oder 15 Sekunden (2.0) gekürzt, und Hailuo H3 Max Lip Sync hört bei 14,8 Sekunden auf. Weitere Gründe stehen in warum ist mein KI-Video zu kurz.
Können Veo 3.1 oder Kling meine Audiodatei nutzen? Nein. Keines von beiden hat auf 8frame einen Audioeingang; beide erzeugen ihren eigenen Ton. Generiere den Clip und füge deine Spur dann im Video Editor hinzu.
Was ist der günstigste Weg zu einem Clip zu meiner eigenen Spur? Pruna p-video Draft: Eine 10-Sekunden-Spur kostet 7 Credits in 720p. Das volle p-video kostet 27, und Creatify Boreal mit der Länge auf 10 kostet 14.
Kostet mein eigener Ton extra? Nicht als Aufschlag. Bei p-video und den Lip-Sync-Tools bezahlst du die Länge der Spur; bei Creatify Boreal und Seedance bezahlst du die Längeneinstellung, mit oder ohne Spur.
Kann ich mehr als eine Spur anhängen? Nicht auf dem Canvas: Jeder Node nimmt eine. Der Anbieter von Seedance erlaubt mehrere Referenzspuren, aber der 8frame-Node sendet eine.
Kann ich meinen eigenen Ton über Claude oder Cursor nutzen? Nein. Der MCP-Connector von 8frame hat bei keinem Tool einen Audioeingang; die Lip-Sync-Tools und die tongesteuerten Modi (p-video mit einer Spur, Boreal oder Seedance mit deinem Ton) sind darüber also nicht verfügbar. Die Einrichtung steht in generate AI video from Claude (auf Englisch).
Quellen
- Welche Video-Nodes pro Modell einen Audioeingang zeigen und was sie senden: Tool-Register des 8frame-Frontends und Modell-Kompatibilitätstabelle, gelesen am 2026-10-01
- Was jedes Modell mit einer Spur macht, Formate, Dateigrößen, Längengrenzen, Kürzungen und Ablehnungen vor der Abrechnung: Generierungscode von 8frame für Pruna Video, Creatify Boreal, Seedance, Hailuo H3, Pruna Avatar, OmniHuman und Wan, die gemeinsamen Audio-Validatoren und der Schritt zum Kürzen von Ton, gelesen am 2026-10-01
- Preise: Credit-Kostenfunktionen im Tool-Register von 8frame, gelesen am 2026-10-01
- Eingänge des MCP-Connectors: MCP-Tool-Definitionen von 8frame, gelesen am 2026-10-01
- Der Modus Video Editor und seine Ton-Ebenen: Frontend-Code von 8frame, gelesen am 2026-10-01
- Audioeingang und Längenregel von Pruna p-video (auf Englisch): das Eingabeschema und die Modellseite von prunaai/p-video, abgerufen am 2026-10-01
- Audioregel von Creatify Boreal (auf Englisch): fal.ai/models/creatify/boreal/api, abgerufen am 2026-10-01
- Regeln für Referenzton bei Seedance (auf Englisch): die Eingabeschemas von bytedance/seedance-2.5 und bytedance/seedance-2.0, abgerufen am 2026-10-01
Wähle das Modell danach, was deine Spur tun soll. Der 8frame-Canvas ist kostenlos und unbegrenzt; die Generierung ist kostenpflichtig ab 19 US-Dollar im Monat.