← Zurück zum Blog

Warum verändert KI mein Produktetikett?

KI-Bild- und Videomodelle schreiben Wörter nicht zuverlässig, deshalb weicht ein generiertes Etikett ab. Warum das passiert, was du in jedem Frame prüfen solltest und die Lösungen auf 8frame: vom echten Produktfoto ausgehen, bearbeiten, neu generieren oder das echte Etikett einsetzen.

Ein generiertes Produktfoto kommt mit deinem Markennamen fast richtig zurück: ein Buchstabe verrutscht, die Abstände stimmen nicht, ein Wort, das beinahe das Wort ist. Auf den ersten Blick wirkt es in Ordnung, und für alle, die die Marke kennen, falsch. Das ist schlimmer als gar kein Etikett.

Kein Modell hält ein Etikett von sich aus exakt, und kein Prompt garantiert es. Was funktioniert: vom echten Produkt ausgehen, jeden Frame prüfen und das echte Etikett überall dort wieder einsetzen, wo die Wörter exakt stimmen müssen.

Kurz gesagt

Warum das passiert

Bildmodelle lernen aus riesigen Mengen von Bildern, die Text enthalten. Sie lernen also, wie Schrift aussieht: Strichstärke, Abstände, wie ein Wort auf einer Verpackung sitzt. Genau eine bestimmte Buchstabenfolge zu erzeugen, und nur diese, ist ein anderes Problem.

Ein Paper von Google Research, verfasst von Rosanne Liu und Kollegen, "Character-Aware Models Improve Visual Text Rendering" (Modelle, die Zeichen sehen, stellen Text besser dar), beginnt mit: "Current image generation models struggle to reliably produce well-formed visual text" (aktuelle Bildgenerierungsmodelle tun sich schwer, zuverlässig sauber geformten Text im Bild zu erzeugen). Es nennt einen beitragenden Faktor: Verbreitete Text-zu-Bild-Modelle "lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs" (haben keine Eingabemerkmale auf Zeichenebene, was es viel schwerer macht, das Schriftbild eines Wortes als Folge von Glyphen vorherzusagen). In den Tests der Autoren stellten Modelle, die einzelne Zeichen sehen konnten, Text besser dar als Modelle, die das nicht konnten. Das Paper stammt von 2022 (überarbeitet 2023). Egal, welches Modell du heute nutzt: Behandle Etikettentext als etwas, das du prüfst, nicht als etwas, dem du vertraust.

Auf einem dekorativen Schild im Hintergrund ist ein Beinahe-Treffer verkraftbar. Auf deinem Produkt ist es dein Markenname, ungefähr.

Im Video ist es noch schwieriger. Ein Videomodell generiert jeden Frame, das Etikett eingeschlossen, und das Etikett muss in allen stimmen. Eine Abweichung von einem Frame zum nächsten fällt stärker auf als ein statischer Fehler.

Geh vom echten Produkt aus

Lass kein Modell dein Produkt erfinden. Geh von einem Foto des echten Produkts aus.

  1. Fotografiere es. Fensterlicht, eine schlichte Fläche, das Handy leicht darüber und davor, das Etikett zur Kamera gedreht. Mach mehrere Aufnahmen und nimm die schärfste.
  2. Notier dir die Lichtrichtung und wie hart das Licht ist. Dasselbe Licht verlangst du später in der Szene.
  3. Stell es frei. Hintergrundentfernung, 12 Credits.
  4. Bau die Szene. Es gibt zwei Wege:
    • Composite: Generiere eine leere Umgebung mit dem notierten Licht, zum Beispiel mit Seedream 5 Lite für 6 Credits (der Seedream-Node startet auf 5 Pro, also stell auf 5 Lite um), und setz dein freigestelltes Produkt dann in deinem eigenen Bildeditor ein, passend zu Licht und Farbtemperatur. Das Etikett bleibt dein fotografiertes Etikett.
    • Neu inszenieren: Gib das freigestellte Produkt einem Bildmodell als Referenzbild, zum Beispiel Nano Banana Pro für 21 Credits bei 1K oder 2K, mit bis zu 10 Referenzbildern (der Nano-Banana-Node startet auf Nano Banana 2, also stell auf Pro um). Das Modell zeichnet das Produkt neu, Etikett eingeschlossen, also lies das Etikett Buchstabe für Buchstabe. Prompts dafür findest du unter Nano Banana Pro Prompts für Produktfotografie.
  5. Gleich die Farben an, wenn Produkt und Szene nicht zusammenpassen. Flux Edit kostet etwa 7 Credits für ein 1-MP-Bild und mehr für größere. Ein Bearbeitungsmodell liefert ein neues Bild, also lies das Etikett danach noch einmal.
  6. Animiere das fertige Standbild, wenn du Bewegung brauchst: Schick es als Startbild an ein Videomodell.

Animieren, ohne das Etikett zu verlieren

Schick das fertige Standbild als Startbild an ein Videomodell. Auf 8frame:

Wir haben nicht gemessen, welches dieser Modelle ein bestimmtes Etikett am stabilsten hält, und keines hält es exakt. Zum Auswählen schickst du dasselbe Standbild mit einer günstigen Einstellung durch zwei Modelle, zum Beispiel Seedance 2.0 bei 480p (48 Credits) und Kling v3 Standard ohne Ton (57), und hältst dann jeden Clip an mehreren Stellen auf dem Etikett an: am Anfang, in der Mitte und am Ende. Halte das Etikett zur Kamera gedreht, die Drehung klein und die Bewegung langsam.

Wenn ein Frame das Etikett trotzdem falsch zeigt:

Was du bei einem Standbild versuchen und prüfen solltest

Nenn den Text im Prompt. Setz die genauen Wörter in Anführungszeichen und sag, wo sie stehen. Das garantiert die Schreibweise nicht, also lies jedes Ergebnis Buchstabe für Buchstabe.

Nutze dein Foto als Referenz. Bei Nano Banana Pro (21 Credits bei 1K oder 2K) kann das echte Produktfoto als Referenzbild hinein. Das Modell zeichnet das Etikett trotzdem neu, und wir haben nicht gemessen, wie oft irgendein Modell es richtig schreibt.

Bearbeite den Text. Du kannst ein Bildbearbeitungstool bitten, ein Wort zu korrigieren: Flux Edit (etwa 7 Credits bei 1 MP) oder Kontext Max (13). Prüf das korrigierte Wort und den Rest des Etiketts, denn die Bearbeitung kann mehr verändern als das Wort, um das du gebeten hast.

Generiere neu. Lass es noch einmal laufen und vergleiche. Ein fertiges Bild, das du verwirfst, kostet trotzdem seine Credits.

Setz das echte Etikett ein. Wenn die Wörter exakt stimmen müssen, leg das echte Etikett aus deinem Produktfoto in deinem Editor über das generierte. Das ist hier der einzige Weg, bei dem das Etikett im Bild dein eigenes Foto ist.

Erwarte nicht, dass Hochskalieren die Schreibweise repariert. Auf 8frame gibt es keinen Video-Upscaler. Bei einem Standbild vergrößert ein Upscaler, was da ist, und kann deinen Markennamen nicht kennen. Clarity (13 Credits) arbeitet diffusionsbasiert und kann kleinen Text deshalb neu zeichnen; BRIA Increase Resolution (6 Credits, 2x oder 4x) ist die andere Option im Upscale-Tool. Lies das Etikett nach jedem Hochskalieren.

Was ein Produktset kostet

Preise auf 8frame; ein Credit entspricht zum Paketpreis etwa 0,01 US-Dollar.

Schritt Weg Credits
Produkt freistellen Hintergrundentfernung 12
Zwanzig Umgebungsvarianten Seedream 5 Lite, je 6 120
Farben angleichen Flux Edit, 1-MP-Bild etwa 7
Zwei Testclips aus demselben Standbild Seedance 2.0 bei 480p (48) und Kling v3 Standard, ohne Ton, 720p (57) 105
Finaler Clip, 5 s bei 720p Seedance 2.0 (108; der Node startet auf 2.5 mit 157) oder den Kling-Clip behalten 0 bis 108
Standbild vergrößern BRIA Increase Resolution, 2x oder 4x 6

Ein komplettes Produktset kommt auf etwa 250 bis 360 Credits, rund 2,50 bis 3,60 US-Dollar zum Paketpreis, ohne Wiederholungen. Das Etikett im Standbild ist dein fotografiertes Etikett; in den Clips prüfst du es Frame für Frame.

Die übergeordnete Regel

Lass kein Modell etwas erfinden, dem Kunden in der Realität begegnen: dein Produkt, dein Essen, deine Räume. Zeigt die Anzeige etwas, das der Kunde nicht bekommt, hast du ein Retourenproblem, ein Bewertungsproblem und eine rechtliche Frage: In den USA sagt die FTC, dass "claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based" (Werbeaussagen müssen wahr sein, dürfen nicht irreführend oder unlauter sein und müssen belegt sein).

Generiere die Welt. Fotografiere das Produkt.

Häufige Fragen

Warum ist der Text auf meinem generierten Produkt falsch? Das Modell generiert das Etikett als Teil des Bildes, und Bild- und Videomodelle schreiben Wörter nicht zuverlässig. Ein Paper von Google Research führt einen Teil davon auf Modelle zurück, die die einzelnen Buchstaben der Wörter im Prompt nicht sehen. Kein Prompt garantiert die Schreibweise.

Welches Modell hält ein Produktetikett exakt? Keines, von sich aus. Geh vom echten Produktfoto aus, prüf jeden Frame und setz das echte Etikett ein, wo die Wörter exakt stimmen müssen. Um ein Videomodell auszuwählen, schick dasselbe Standbild mit einer günstigen Einstellung durch zwei Modelle und vergleiche das Etikett Frame für Frame.

Kann ich ein verunstaltetes Etikett per Bearbeitung reparieren? Manchmal. Versuch es mit Flux Edit (etwa 7 Credits bei 1 MP) oder Kontext Max (13) und lies das Ergebnis Buchstabe für Buchstabe. Wenn die Wörter exakt stimmen müssen, setz stattdessen das echte Etikett aus deinem Foto ein.

Repariert Hochskalieren ein verunstaltetes Etikett? Nein. Ein Upscaler vergrößert, was da ist, und ein diffusionsbasierter wie Clarity kann kleinen Text neu zeichnen. Auf 8frame gibt es keinen Video-Upscaler.

Kann ich mein Produkt überhaupt generieren? Inszenier es aus deinem echten Produktfoto neu, nicht aus einer Textbeschreibung, und vergleich das Ergebnis mit dem echten Produkt, bevor es jemand sieht: Etikett, Form und Farbe.

Quellen


Fotografiere das Etikett, generiere den Raum.

Probier es ohne Anmeldung aus: Du landest direkt auf einem echten Board. Der 8frame-Canvas ist kostenlos und unbegrenzt; die Generierung ist kostenpflichtig ab 19 US-Dollar im Monat.

Verwandte Artikel

RatgeberAnforderungen an Facebook-Videoanzeigen 2026: 4:5 mit 1440 x 1800, bis 4 GBRatgeberAnforderungen an Videoanzeigen im Instagram-Feed und in Stories 2026: 9:16 für beide, 4:5 per ZuschnittRatgeberKling v3 Pro nutzen: wann sich 114 Credits lohnen

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates