Text-zu-Video-KI ist eine Klasse generativer Modelle, die aus einem geschriebenen Prompt einen Videoclip macht. Kamerabewegung, Licht und Timing entstehen dabei ohne Dreh und ohne Schnitt.
Der Ablauf ist bei den großen Modellen gleich: Du beschreibst eine Szene, das Modell erzeugt Frames, die an diese Beschreibung gebunden sind, und du bekommst einen fertig gerenderten Clip. Auf 8frame dauert eine einzelne Generierung zwischen 1 Sekunde (Grok Imagine) und 30 Sekunden (Wan 3.0 und Seedance 2.5). Die Modelle unterscheiden sich darin, wie sie mit Bewegungsphysik, Prompt-Treue und Konsistenz über die Frames umgehen: Ein Modell, das bei einer ruhigen Einstellung scharf aussieht, kann bei einer gehenden Figur oder einem Kameraschwenk trotzdem auseinanderfallen. Teste deshalb deinen eigenen Prompt auf dem Modell, bevor du dich festlegst.
Wie Text-zu-Video-KI funktioniert
Viele aktuelle Videomodelle sind Diffusionsmodelle, die mit großen Videodatensätzen trainiert wurden. Das Modell lernt, wie Text mit visuellen Mustern zusammenhängt, und entrauscht beim Generieren ein Zufallssignal schrittweise zu einer Folge von Frames, die zu deiner Beschreibung passt. Nichts wird aufgenommen oder montiert; jedes Pixel ist synthetisch.
Was du steuerst:
- Prompt. "Slow dolly toward a coffee cup on a marble counter, soft morning light" (langsame Dolly-Fahrt auf eine Kaffeetasse auf einer Marmortheke zu, weiches Morgenlicht) liefert ein ganz anderes Ergebnis als "coffee cup, table" (Kaffeetasse, Tisch).
- Format. Veo 3.1 macht nur 16:9 und 9:16. Aus Text bieten Kling 2.6 Pro und Wan 3.0 16:9, 9:16 und 1:1; Seedance bietet 16:9, 9:16, 1:1, 4:3, 3:4 und "Auto"; Hailuo H3 bietet 21:9, 16:9, 4:3, 1:1, 3:4 und 9:16. Jedes Modell, Format für Format: KI-Video-Seitenverhältnisse pro Modell.
- Auflösung. Auf 8frame: Veo 3.1 in 1080p (Lite in 720p), Wan 3.0 in 480p, 720p oder 1080p, Seedance in 480p oder 720p, Hailuo H3 in 2K. Googles eigene API bietet Veo 3.1 in 4K; 8frame nicht.
- Länge. Veo 3.1 4, 6 oder 8 Sekunden; Kling 2.6 Pro 5 oder 10; Seedance 2.5 4 bis 30; Wan 3.0 2 bis 30; Grok Imagine 1 bis 15. Längere Stücke werden aus mehreren Generierungen geschnitten.
- Ton. Manche Modelle erzeugen Audio zusammen mit dem Bild. Bei Veo 3.1 und Kling 2.6 Pro ist das eine Einstellung, die den Preis ändert (Veo 3.1: 448 Credits für 8 Sekunden mit Audio, 224 ohne; Kling 2.6 Pro: 95 für 5 Sekunden mit Audio, 47 ohne). Bei Seedance ist der Ton standardmäßig an und kostet mit oder ohne gleich viel. Grok Imagine und Gemini Omni Flash fügen immer Ton hinzu.
- Referenz-Eingaben. Die meisten Modelle nehmen auch ein Startbild an. Dann wird daraus Bild-zu-Video, ein verwandter, aber eigener Modus.
Welche Modelle nur mit Text laufen
Nicht jedes Videomodell auf 8frame nimmt einen Prompt allein an. Kling 2.6 Pro, Wan 3.0, Veo 3.1, Seedance, Hailuo H3 und Gemini Omni Flash laufen nur mit Text. Kling v3 (Standard und Pro), Kling O3 und Wan 2.2 brauchen ein Startbild. Das Kling-Tool startet mit Kling v3 Standard; für einen reinen Text-Prompt mit Kling stellst du den Node also auf Kling 2.6 Pro um. Die vollständige Liste, mit dem, was jedes Modell braucht: welche KI-Videomodelle nur mit Text funktionieren.
Wann du Text-zu-Video-KI nutzt
Nutze sie, wenn du bewegte Bilder ohne Dreh brauchst. Typische Aufgaben:
- Anzeigenmotive. Ein Produkt in Bewegung mit einer leichten Kamerafahrt nach vorn, in mehreren Varianten zum Testen.
- Markenfilme und Stimmungsstücke. Weite Landschaften, Atmosphäre und Licht; Veo 3.1 rendert sie in 1080p und 16:9.
- Storyboard-Prototypen. Grobe Bewegungsentwürfe, bevor du ein Team auf ein Konzept festlegst; Veo 3.1 Lite (17 Credits für 4 Sekunden ohne Ton) und Wan 3.0 in 480p (24 für 5 Sekunden) sind günstig genug, um viele auszuprobieren.
- Inhalte im UGC-Stil. Kling 2.6 Pro in 9:16 mit einem Lifestyle-Prompt.
Reiner Text ist das falsche Werkzeug, wenn du ein bestimmtes Gesicht, einen echten Ort oder eine exakte Produktplatzierung brauchst. Dafür brauchst du ein Referenzbild oder eine Kombination mit echtem Filmmaterial.
Beispiele zum Ausprobieren
Veo 3.1:
Aerial view of a coastal city at golden hour, slow push forward, shallow depth of field
Stell am Node 16:9 und 8 Sekunden ein. Das Veo-Tool startet mit Veo 3.1 Fast, 168 Credits für 8 Sekunden mit Ton; Veo 3.1 selbst kostet 448. Worauf achten: wie sich das Licht auf dem Wasser streut und ob die Fahrt nach vorn ruhig bleibt, ohne die Gebäude zu verzerren.
Kling 2.6 Pro:
Young woman unpacking a skincare product, natural window light, lifestyle feel
Das Kling-Tool startet mit Kling v3, das auf 8frame ein Startbild animiert. Für einen reinen Text-Prompt stellst du das Modell deshalb auf Kling 2.6 Pro um. Stell 9:16 ein. Kling 2.6 Pro kostet 47 Credits für 5 Sekunden ohne Ton, 95 mit Audio. Worauf achten: die Hände an der Verpackung und ein Produkt, das seine Form behält.
Sora 2 (eingestellt): OpenAI hat die Sora-2-Modelle und seine Videos API am 2026-09-24 abgeschaltet, und 8frame bietet Sora 2 für neue Generierungen nicht mehr an. In Sora 2 vs Veo 3.1 (auf Englisch) steht, wohin Arbeit im Sora-Stil wandern kann.
Häufige Fragen
Wie lang ist der längste Clip, den Text-zu-Video-KI machen kann?
Auf 8frame 30 Sekunden in einer Generierung (Wan 3.0 und Seedance 2.5). Längere Videos werden aus mehreren Clips zusammengesetzt.
Funktioniert jedes KI-Videomodell nur mit Text?
Nein. Auf 8frame brauchen Kling v3 Standard und Pro, Kling O3 und Wan 2.2 ein Startbild. Kling 2.6 Pro, Wan 3.0, Veo 3.1, Seedance, Hailuo H3 und Gemini Omni Flash laufen mit einem Prompt allein.
Kann Text-zu-Video-KI 4K?
Nicht auf 8frame, wo Video bei 1080p endet (2K bei Hailuo H3 und Creatify Boreal). Googles Gemini API bietet Veo 3.1 in 4K für 0,60 US-Dollar pro Sekunde.
Erzeugt Text-zu-Video-KI Ton?
Manche Modelle ja. Veo 3.1 und Kling 2.6 Pro haben eine Audio-Einstellung, die den Preis ändert; bei Seedance ist der Ton standardmäßig an und kostet in beiden Fällen gleich viel; Grok Imagine und Gemini Omni Flash fügen ihn immer hinzu.
Verwandte Begriffe
- Bild-zu-Video: Ein Standbild ist der Startframe statt eines Text-Prompts. Die meisten Modelle können beides, einige (Kling v3, Kling O3, Wan 2.2) nur das.
- Kamerabewegung: Dolly, Schwenk, Orbit, festgelegt im Prompt oder über modellspezifische Steuerungen.
- Preise der Modelle im Vergleich: KI-Video: Preis pro Sekunde.
- Welche Modelle Ton ins Ergebnis legen: welche KI-Videomodelle Ton erzeugen.
- Veo 3.1, Kling v3 und Sora 2 im Vergleich: Veo 3.1 vs Sora 2 vs Kling v3 (auf Englisch).
Quellen
- OpenAI-Deprecations (Abschaltung von Sora 2 und der Videos API am 2026-09-24): developers.openai.com/api/docs/deprecations, geprüft am 2026-10-01
- Preise der Gemini API für Veo 3.1 (Standard: 0,40 US-Dollar pro Sekunde in 720p und 1080p, 0,60 in 4K): ai.google.dev/gemini-api/docs/pricing, geprüft am 2026-10-01
- Videopreise, Längen, Formate und Auflösungen auf 8frame: Tool-Register von 8frame (Längen-, Format- und Auflösungsoptionen pro Tool) und Seitenverhältnis-Konfiguration, gelesen am 2026-10-01
- Welche Modelle ein Startbild brauchen, die Startbild-Pflicht von Kling v3, die Standardmodelle der Kling- und Veo-Tools: Videogenerierungscode und Tool-Register von 8frame, gelesen am 2026-10-01
- Preise: Credit-Funktionen im Tool-Register von 8frame (calculateVeo31Cost, calculateKling26Cost, Wan-3.0-Tarife), gelesen am 2026-10-01
- Audio-Einstellung und Preis bei Seedance: Tool-Register von 8frame (der Audio-Schalter am Seedance-Node; calculateSeedance2Cost nimmt kein Audio als Eingabe), gelesen am 2026-10-01
Generiere Text-zu-Video mit Veo 3.1, Kling 2.6 Pro, Seedance, Wan und mehr auf einem Board.
Probier es ohne Anmeldung aus: Du landest direkt auf einem echten Board. Der 8frame-Canvas ist kostenlos und unbegrenzt; die Generierung ist kostenpflichtig ab 19 US-Dollar im Monat.