Ein generiertes Produktfoto kommt mit deinem Markennamen fast richtig zurück: ein Buchstabe verrutscht, die Abstände stimmen nicht, ein Wort, das beinahe das Wort ist. Auf den ersten Blick wirkt es in Ordnung, und für alle, die die Marke kennen, falsch. Das ist schlimmer als gar kein Etikett.
Kein Modell hält ein Etikett von sich aus exakt, und kein Prompt garantiert es. Was funktioniert: vom echten Produkt ausgehen, jeden Frame prüfen und das echte Etikett überall dort wieder einsetzen, wo die Wörter exakt stimmen müssen.
Kurz gesagt
- Bild- und Videomodelle schreiben Wörter nicht zuverlässig. Ein Paper von Google Research führt einen Teil des Problems darauf zurück, dass Modelle die einzelnen Buchstaben der Wörter im Prompt nicht sehen
- Kein Prompt garantiert das Etikett. Schreib den genauen Text trotzdem in Anführungszeichen und lies danach jedes Ergebnis Buchstabe für Buchstabe
- Geh vom echten Produktfoto aus: Stell das Produkt frei (Hintergrundentfernung, 12 Credits) und nutze es in der Szene oder als Referenz, statt ein Modell das Produkt erfinden zu lassen
- Korrigiere, was abweicht: neu generieren, mit einem Bildbearbeitungstool korrigieren (Flux Edit, etwa 7 Credits bei 1 MP, oder Kontext Max, 13) oder das echte Etikett im Modus Video Editor von 8frame oder in deinem eigenen Editor einsetzen
- Bei Bewegung prüfst du jeden Frame, nicht nur den ersten: Kein Videomodell hält ein Etikett exakt
Warum das passiert
Bildmodelle lernen aus riesigen Mengen von Bildern, die Text enthalten. Sie lernen also, wie Schrift aussieht: Strichstärke, Abstände, wie ein Wort auf einer Verpackung sitzt. Genau eine bestimmte Buchstabenfolge zu erzeugen, und nur diese, ist ein anderes Problem.
Ein Paper von Google Research, verfasst von Rosanne Liu und Kollegen, "Character-Aware Models Improve Visual Text Rendering" (Modelle, die Zeichen sehen, stellen Text besser dar), beginnt mit: "Current image generation models struggle to reliably produce well-formed visual text" (aktuelle Bildgenerierungsmodelle tun sich schwer, zuverlässig sauber geformten Text im Bild zu erzeugen). Es nennt einen beitragenden Faktor: Verbreitete Text-zu-Bild-Modelle "lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs" (haben keine Eingabemerkmale auf Zeichenebene, was es viel schwerer macht, das Schriftbild eines Wortes als Folge von Glyphen vorherzusagen). In den Tests der Autoren stellten Modelle, die einzelne Zeichen sehen konnten, Text besser dar als Modelle, die das nicht konnten. Das Paper stammt von 2022 (überarbeitet 2023). Egal, welches Modell du heute nutzt: Behandle Etikettentext als etwas, das du prüfst, nicht als etwas, dem du vertraust.
Auf einem dekorativen Schild im Hintergrund ist ein Beinahe-Treffer verkraftbar. Auf deinem Produkt ist es dein Markenname, ungefähr.
Im Video ist es noch schwieriger. Ein Videomodell generiert jeden Frame, das Etikett eingeschlossen, und das Etikett muss in allen stimmen. Eine Abweichung von einem Frame zum nächsten fällt stärker auf als ein statischer Fehler.
Geh vom echten Produkt aus
Lass kein Modell dein Produkt erfinden. Geh von einem Foto des echten Produkts aus.
- Fotografiere es. Fensterlicht, eine schlichte Fläche, das Handy leicht darüber und davor, das Etikett zur Kamera gedreht. Mach mehrere Aufnahmen und nimm die schärfste.
- Notier dir die Lichtrichtung und wie hart das Licht ist. Dasselbe Licht verlangst du später in der Szene.
- Stell es frei. Hintergrundentfernung, 12 Credits.
- Bau die Szene. Es gibt zwei Wege:
- Composite: Generiere eine leere Umgebung mit dem notierten Licht, zum Beispiel mit Seedream 5 Lite für 6 Credits (der Seedream-Node startet auf 5 Pro, also stell auf 5 Lite um), und setz dein freigestelltes Produkt dann in deinem eigenen Bildeditor ein, passend zu Licht und Farbtemperatur. Das Etikett bleibt dein fotografiertes Etikett.
- Neu inszenieren: Gib das freigestellte Produkt einem Bildmodell als Referenzbild, zum Beispiel Nano Banana Pro für 21 Credits bei 1K oder 2K, mit bis zu 10 Referenzbildern (der Nano-Banana-Node startet auf Nano Banana 2, also stell auf Pro um). Das Modell zeichnet das Produkt neu, Etikett eingeschlossen, also lies das Etikett Buchstabe für Buchstabe. Prompts dafür findest du unter Nano Banana Pro Prompts für Produktfotografie.
- Gleich die Farben an, wenn Produkt und Szene nicht zusammenpassen. Flux Edit kostet etwa 7 Credits für ein 1-MP-Bild und mehr für größere. Ein Bearbeitungsmodell liefert ein neues Bild, also lies das Etikett danach noch einmal.
- Animiere das fertige Standbild, wenn du Bewegung brauchst: Schick es als Startbild an ein Videomodell.
Animieren, ohne das Etikett zu verlieren
Schick das fertige Standbild als Startbild an ein Videomodell. Auf 8frame:
- Kling v3 Standard braucht ein Startbild und übernimmt dessen Format, in 720p: 57 Credits für 5 Sekunden ohne Ton, 86 mit Ton. Der Kling-Node startet mit eingeschaltetem Ton.
- Seedance geht bis 720p. Der Node startet auf Seedance 2.5 mit 157 Credits für 5 Sekunden (70 bei 480p); Seedance 2.0 kostet 108 bei 720p und 48 bei 480p.
- Veo 3.1 Fast ist die 1080p-Option. Mit einem Startbild erzeugt es immer 8 Sekunden, in 16:9 oder 9:16, für 168 Credits mit Ton.
Wir haben nicht gemessen, welches dieser Modelle ein bestimmtes Etikett am stabilsten hält, und keines hält es exakt. Zum Auswählen schickst du dasselbe Standbild mit einer günstigen Einstellung durch zwei Modelle, zum Beispiel Seedance 2.0 bei 480p (48 Credits) und Kling v3 Standard ohne Ton (57), und hältst dann jeden Clip an mehreren Stellen auf dem Etikett an: am Anfang, in der Mitte und am Ende. Halte das Etikett zur Kamera gedreht, die Drehung klein und die Bewegung langsam.
Wenn ein Frame das Etikett trotzdem falsch zeigt:
- Generiere neu. Ein fertiger Clip, den du verwirfst, kostet trotzdem seine Credits; nur ein fehlgeschlagener Lauf wird automatisch erstattet (kosten fehlgeschlagene KI-Generierungen Credits?).
- Setz das echte Etikett über den Clip. Im Modus Video Editor von 8frame kannst du dein eigenes Bild hochladen und es auf der Timeline als Bildebene über den Clip legen. Eine statische Ebene passt zu einer Einstellung, in der das Produkt stillsteht. Bewegt sich das Produkt, setz das Etikett in deinem eigenen Editor ein oder dreh es in dieser Einstellung von der Kamera weg.
Was du bei einem Standbild versuchen und prüfen solltest
Nenn den Text im Prompt. Setz die genauen Wörter in Anführungszeichen und sag, wo sie stehen. Das garantiert die Schreibweise nicht, also lies jedes Ergebnis Buchstabe für Buchstabe.
Nutze dein Foto als Referenz. Bei Nano Banana Pro (21 Credits bei 1K oder 2K) kann das echte Produktfoto als Referenzbild hinein. Das Modell zeichnet das Etikett trotzdem neu, und wir haben nicht gemessen, wie oft irgendein Modell es richtig schreibt.
Bearbeite den Text. Du kannst ein Bildbearbeitungstool bitten, ein Wort zu korrigieren: Flux Edit (etwa 7 Credits bei 1 MP) oder Kontext Max (13). Prüf das korrigierte Wort und den Rest des Etiketts, denn die Bearbeitung kann mehr verändern als das Wort, um das du gebeten hast.
Generiere neu. Lass es noch einmal laufen und vergleiche. Ein fertiges Bild, das du verwirfst, kostet trotzdem seine Credits.
Setz das echte Etikett ein. Wenn die Wörter exakt stimmen müssen, leg das echte Etikett aus deinem Produktfoto in deinem Editor über das generierte. Das ist hier der einzige Weg, bei dem das Etikett im Bild dein eigenes Foto ist.
Erwarte nicht, dass Hochskalieren die Schreibweise repariert. Auf 8frame gibt es keinen Video-Upscaler. Bei einem Standbild vergrößert ein Upscaler, was da ist, und kann deinen Markennamen nicht kennen. Clarity (13 Credits) arbeitet diffusionsbasiert und kann kleinen Text deshalb neu zeichnen; BRIA Increase Resolution (6 Credits, 2x oder 4x) ist die andere Option im Upscale-Tool. Lies das Etikett nach jedem Hochskalieren.
Was ein Produktset kostet
Preise auf 8frame; ein Credit entspricht zum Paketpreis etwa 0,01 US-Dollar.
| Schritt | Weg | Credits |
|---|---|---|
| Produkt freistellen | Hintergrundentfernung | 12 |
| Zwanzig Umgebungsvarianten | Seedream 5 Lite, je 6 | 120 |
| Farben angleichen | Flux Edit, 1-MP-Bild | etwa 7 |
| Zwei Testclips aus demselben Standbild | Seedance 2.0 bei 480p (48) und Kling v3 Standard, ohne Ton, 720p (57) | 105 |
| Finaler Clip, 5 s bei 720p | Seedance 2.0 (108; der Node startet auf 2.5 mit 157) oder den Kling-Clip behalten | 0 bis 108 |
| Standbild vergrößern | BRIA Increase Resolution, 2x oder 4x | 6 |
Ein komplettes Produktset kommt auf etwa 250 bis 360 Credits, rund 2,50 bis 3,60 US-Dollar zum Paketpreis, ohne Wiederholungen. Das Etikett im Standbild ist dein fotografiertes Etikett; in den Clips prüfst du es Frame für Frame.
Die übergeordnete Regel
Lass kein Modell etwas erfinden, dem Kunden in der Realität begegnen: dein Produkt, dein Essen, deine Räume. Zeigt die Anzeige etwas, das der Kunde nicht bekommt, hast du ein Retourenproblem, ein Bewertungsproblem und eine rechtliche Frage: In den USA sagt die FTC, dass "claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based" (Werbeaussagen müssen wahr sein, dürfen nicht irreführend oder unlauter sein und müssen belegt sein).
Generiere die Welt. Fotografiere das Produkt.
Häufige Fragen
Warum ist der Text auf meinem generierten Produkt falsch? Das Modell generiert das Etikett als Teil des Bildes, und Bild- und Videomodelle schreiben Wörter nicht zuverlässig. Ein Paper von Google Research führt einen Teil davon auf Modelle zurück, die die einzelnen Buchstaben der Wörter im Prompt nicht sehen. Kein Prompt garantiert die Schreibweise.
Welches Modell hält ein Produktetikett exakt? Keines, von sich aus. Geh vom echten Produktfoto aus, prüf jeden Frame und setz das echte Etikett ein, wo die Wörter exakt stimmen müssen. Um ein Videomodell auszuwählen, schick dasselbe Standbild mit einer günstigen Einstellung durch zwei Modelle und vergleiche das Etikett Frame für Frame.
Kann ich ein verunstaltetes Etikett per Bearbeitung reparieren? Manchmal. Versuch es mit Flux Edit (etwa 7 Credits bei 1 MP) oder Kontext Max (13) und lies das Ergebnis Buchstabe für Buchstabe. Wenn die Wörter exakt stimmen müssen, setz stattdessen das echte Etikett aus deinem Foto ein.
Repariert Hochskalieren ein verunstaltetes Etikett? Nein. Ein Upscaler vergrößert, was da ist, und ein diffusionsbasierter wie Clarity kann kleinen Text neu zeichnen. Auf 8frame gibt es keinen Video-Upscaler.
Kann ich mein Produkt überhaupt generieren? Inszenier es aus deinem echten Produktfoto neu, nicht aus einer Textbeschreibung, und vergleich das Ergebnis mit dem echten Produkt, bevor es jemand sieht: Etikett, Form und Farbe.
Quellen
- Rosanne Liu und Kollegen, Google Research, "Character-Aware Models Improve Visual Text Rendering" ("Current image generation models struggle to reliably produce well-formed visual text", aktuelle Bildgenerierungsmodelle tun sich schwer, zuverlässig sauber geformten Text im Bild zu erzeugen; verbreitete Text-zu-Bild-Modelle "lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs", haben keine Eingabemerkmale auf Zeichenebene; Modelle, die Zeichen sehen, stellten Text besser dar als Modelle ohne diese Fähigkeit; erstmals veröffentlicht im Dezember 2022, überarbeitet im Mai 2023): arxiv.org/abs/2212.10562, geprüft am 2026-10-02
- US Federal Trade Commission (FTC), Advertising and Marketing ("Under the law, claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based", nach dem Gesetz müssen Werbeaussagen wahr sein, dürfen nicht irreführend oder unlauter sein und müssen belegt sein): ftc.gov/business-guidance/advertising-marketing, geprüft am 2026-10-02
- Preise, Auflösungen und Einstellungen auf 8frame (Hintergrundentfernung, Seedream 5 Lite und 5 Pro als Startmodell des Seedream-Nodes, Nano Banana Pro mit bis zu 10 Referenzbildern und Nano Banana 2 als Startmodell des Nodes, Flux Edit mit Preis nach Bildgröße und Kontext Max, Kling v3 Standard und seine Startbild-Pflicht, Seedance 2.0 und 2.5, Veo 3.1 Fast und seine 8-Sekunden-Sperre mit Startbild, Clarity und BRIA Increase Resolution, kein Video-Upscaler, automatische Erstattung fehlgeschlagener Läufe): Tool-Registry und Kostenfunktionen von 8frame, gelesen am 2026-10-02
- Bildebenen aus eigenen Uploads im Modus Video Editor: Frontend-Code von 8frame, gelesen am 2026-10-02
Fotografiere das Etikett, generiere den Raum.
Probier es ohne Anmeldung aus: Du landest direkt auf einem echten Board. Der 8frame-Canvas ist kostenlos und unbegrenzt; die Generierung ist kostenpflichtig ab 19 US-Dollar im Monat.