Une photo produit générée revient avec le nom de votre marque presque juste : une lettre décalée, un espacement bizarre, un mot qui est presque le bon. Au premier coup d'œil, ça passe ; pour quiconque connaît la marque, c'est faux, et c'est pire que pas d'étiquette du tout.
Aucun modèle ne garde une étiquette exacte à lui seul, et aucun prompt ne le garantit. Ce qui marche : partir du vrai produit, vérifier chaque image et remettre la vraie étiquette partout où les mots doivent être exacts.
En bref
- Les modèles d'image et de vidéo n'écrivent pas les mots de façon fiable. Un article de Google Research attribue une partie du problème à des modèles qui ne voient pas les lettres une à une dans les mots du prompt
- Aucun prompt ne garantit l'étiquette. Écrivez quand même le texte exact entre guillemets, puis lisez chaque résultat lettre par lettre
- Partez de la vraie photo du produit : détourez-la (suppression d'arrière-plan, 12 crédits) et utilisez-la dans la scène ou comme référence, au lieu de laisser un modèle inventer le produit
- Corrigez ce qui dérive : régénérez, corrigez avec un outil de retouche d'image (Flux Edit, environ 7 crédits à 1 MP, ou Kontext Max, 13) ou incrustez la vraie étiquette dans le mode Video Editor de 8frame ou dans votre propre logiciel de montage
- En mouvement, vérifiez chaque image, pas seulement la première : aucun modèle vidéo ne garde une étiquette exacte
Pourquoi cela arrive
Les modèles d'image apprennent sur d'immenses quantités d'images qui contiennent du texte : ils apprennent donc à quoi ressemble l'écriture, l'épaisseur du trait, l'espacement, la façon dont un mot se pose sur un emballage. Produire une suite exacte de lettres, et celle-là seulement, est un autre problème.
Un article de Google Research signé Rosanne Liu et ses collègues, « Character-Aware Models Improve Visual Text Rendering » (les modèles qui voient les caractères rendent mieux le texte), commence ainsi : « Current image generation models struggle to reliably produce well-formed visual text » (les modèles actuels de génération d'images peinent à produire de façon fiable un texte visuel bien formé). Il désigne un facteur qui y contribue : les modèles texte-image courants « lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs » (n'ont pas de caractéristiques d'entrée au niveau du caractère, ce qui rend beaucoup plus difficile de prédire l'aspect visuel d'un mot comme une suite de glyphes). Dans les tests des auteurs, les modèles capables de voir les caractères un à un ont mieux rendu le texte que ceux qui ne le pouvaient pas. L'article date de 2022 (révisé en 2023). Quel que soit le modèle que vous utilisez aujourd'hui, traitez le texte de l'étiquette comme quelque chose à vérifier, pas comme quelque chose à croire sur parole.
Sur une enseigne décorative à l'arrière-plan, un à-peu-près se tolère. Sur votre produit, c'est le nom de votre marque, à peu près.
En vidéo, c'est encore plus difficile. Un modèle vidéo génère chaque image, étiquette comprise, et l'étiquette doit être juste dans toutes. Une dérive d'une image à l'autre attire davantage l'œil qu'une erreur fixe.
Partez du vrai produit
Ne demandez pas à un modèle d'inventer votre produit. Partez d'une photo du vrai.
- Photographiez-le. Lumière de fenêtre, surface unie, téléphone légèrement au-dessus et devant, étiquette face à l'objectif. Prenez plusieurs photos et gardez la plus nette.
- Notez la direction de la lumière et sa dureté. Vous demanderez la même lumière dans la scène.
- Détourez-le. Suppression d'arrière-plan, 12 crédits.
- Construisez la scène. Deux voies :
- Composite : générez un décor vide avec la lumière notée, par exemple avec Seedream 5 Lite à 6 crédits (le nœud Seedream s'ouvre sur 5 Pro, passez donc sur 5 Lite), puis placez votre détourage dedans dans votre propre logiciel de retouche, en accordant la lumière et la température de couleur. L'étiquette reste celle de votre photo.
- Nouvelle mise en scène : donnez le détourage à un modèle d'image comme image de référence, par exemple Nano Banana Pro à 21 crédits en 1K ou 2K, avec jusqu'à 10 images de référence (le nœud Nano Banana s'ouvre sur Nano Banana 2, passez donc sur Pro). Le modèle redessine le produit, étiquette comprise : lisez l'étiquette lettre par lettre. Vous trouverez des prompts pour cela dans prompts Nano Banana Pro pour la photo produit.
- Harmonisez l'étalonnage si le produit et la scène ne s'accordent pas. Flux Edit coûte environ 7 crédits pour une image de 1 MP, et davantage pour une image plus grande. Un modèle de retouche renvoie une nouvelle image : relisez l'étiquette ensuite.
- Animez à partir de l'image fixe finie si vous avez besoin de mouvement : envoyez-la à un modèle vidéo comme image de départ.
Animer sans perdre l'étiquette
Envoyez l'image fixe finie à un modèle vidéo comme image de départ. Sur 8frame :
- Kling v3 Standard a besoin d'une image de départ et reprend son format, en 720p : 57 crédits pour 5 secondes sans son, 86 avec le son. Le nœud Kling s'ouvre avec le son activé.
- Seedance monte jusqu'à 720p. Le nœud s'ouvre sur Seedance 2.5, à 157 crédits pour 5 secondes (70 en 480p) ; Seedance 2.0 coûte 108 en 720p et 48 en 480p.
- Veo 3.1 Fast est l'option 1080p. Avec une image de départ, il produit toujours 8 secondes, en 16:9 ou 9:16, pour 168 crédits avec le son.
Nous n'avons pas mesuré lequel garde le plus stable une étiquette donnée, et aucun ne la garde exacte. Pour choisir, passez la même image dans deux modèles avec un réglage bon marché, par exemple Seedance 2.0 en 480p (48 crédits) et Kling v3 Standard sans son (57), puis faites un arrêt sur image sur l'étiquette à plusieurs moments de chaque clip : au début, au milieu et à la fin. Gardez l'étiquette face à l'objectif, la rotation faible et le mouvement lent.
Si une image a encore l'étiquette fausse :
- Régénérez. Un clip fini que vous rejetez coûte quand même ses crédits ; seule une exécution qui échoue est remboursée automatiquement (les générations IA échouées coûtent-elles des crédits ?).
- Incrustez la vraie étiquette sur le clip. Dans le mode Video Editor de 8frame, vous pouvez importer votre propre image et la placer sur la timeline comme calque image au-dessus du clip. Un calque fixe convient à un plan où le produit ne bouge pas. Si le produit bouge, faites l'incrustation dans votre propre logiciel de montage, ou tournez l'étiquette dos à la caméra dans ce plan.
Ce qu'il faut essayer sur une image fixe, et ce qu'il faut vérifier
Écrivez le texte dans le prompt. Mettez les mots exacts entre guillemets et dites où ils se placent. Cela ne garantit pas l'orthographe : lisez chaque résultat lettre par lettre.
Utilisez votre photo comme référence. Sur Nano Banana Pro (21 crédits en 1K ou 2K), la vraie photo du produit peut servir d'image de référence. Le modèle redessine quand même l'étiquette, et nous n'avons pas mesuré à quelle fréquence un modèle, quel qu'il soit, l'écrit correctement.
Retouchez le texte. Vous pouvez demander à un outil de retouche d'image de corriger un mot : Flux Edit (environ 7 crédits à 1 MP) ou Kontext Max (13). Vérifiez le mot corrigé et le reste de l'étiquette, car la retouche peut modifier plus que le mot demandé.
Régénérez. Relancez et comparez. Une image finie que vous rejetez coûte quand même ses crédits.
Incrustez la vraie étiquette. Quand les mots doivent être exacts, placez la vraie étiquette, tirée de la photo de votre produit, par-dessus celle qui a été générée, dans votre logiciel. C'est la seule voie de cette liste où l'étiquette à l'écran est votre propre photo.
N'attendez pas d'un agrandissement qu'il corrige l'orthographe. Il n'y a pas d'upscaler vidéo sur 8frame. Sur une image fixe, un upscaler agrandit ce qui est là et ne peut pas connaître le nom de votre marque. Clarity (13 crédits) repose sur la diffusion et peut donc redessiner un petit texte ; BRIA Increase Resolution (6 crédits, 2x ou 4x) est l'autre option de l'outil d'agrandissement. Relisez l'étiquette après tout agrandissement.
Combien coûte un ensemble produit
Prix sur 8frame ; un crédit vaut environ 0,01 dollar au prix des packs.
| Étape | Voie | Crédits |
|---|---|---|
| Détourer le produit | Suppression d'arrière-plan | 12 |
| Vingt variantes de décor | Seedream 5 Lite, 6 chacune | 120 |
| Harmoniser l'étalonnage | Flux Edit, image de 1 MP | environ 7 |
| Deux clips de test à partir de la même image | Seedance 2.0 en 480p (48) et Kling v3 Standard, sans son, 720p (57) | 105 |
| Clip final, 5 s en 720p | Seedance 2.0 (108 ; le nœud s'ouvre sur 2.5, à 157), ou garder le clip Kling | 0 à 108 |
| Agrandir l'image fixe | BRIA Increase Resolution, 2x ou 4x | 6 |
Un ensemble produit complet revient à environ 250 à 360 crédits, soit à peu près 2,50 à 3,60 dollars au prix des packs, hors relances. L'étiquette de l'image fixe est celle de votre photo ; dans les clips, vérifiez-la image par image.
La règle générale
Ne laissez pas un modèle inventer quoi que ce soit qu'un client rencontrera dans la réalité : votre produit, vos plats, vos locaux. Si la publicité montre quelque chose que le client ne reçoit pas, c'est un problème de retours, un problème d'avis clients et une question juridique : aux États-Unis, la FTC indique que « claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based » (les allégations publicitaires doivent être véridiques, ne peuvent être ni trompeuses ni déloyales et doivent reposer sur des preuves).
Générez le monde. Photographiez le produit.
Questions fréquentes
Pourquoi le texte de mon produit généré est-il faux ? Le modèle génère l'étiquette comme une partie de l'image, et les modèles d'image et de vidéo n'écrivent pas les mots de façon fiable. Un article de Google Research relie une partie du problème à des modèles qui ne voient pas les lettres une à une dans les mots du prompt. Aucun prompt ne garantit l'orthographe.
Quel modèle garde l'étiquette d'un produit exacte ? Aucun, à lui seul. Partez de la vraie photo du produit, vérifiez chaque image et incrustez la vraie étiquette là où les mots doivent être exacts. Pour choisir un modèle vidéo, passez la même image dans deux d'entre eux avec un réglage bon marché et comparez l'étiquette image par image.
Peut-on corriger une étiquette déformée par retouche ? Parfois. Essayez Flux Edit (environ 7 crédits à 1 MP) ou Kontext Max (13) et lisez le résultat lettre par lettre. Quand les mots doivent être exacts, incrustez plutôt la vraie étiquette tirée de votre photo.
Un agrandissement corrige-t-il une étiquette déformée ? Non. Un upscaler agrandit ce qui est là, et un upscaler à diffusion comme Clarity peut redessiner un petit texte. Il n'y a pas d'upscaler vidéo sur 8frame.
Puis-je générer mon produit ? Remettez-le en scène à partir de la vraie photo du produit plutôt qu'à partir d'une description textuelle, et comparez le résultat au vrai produit avant que quiconque le voie : l'étiquette, la forme et la couleur.
Sources
- Rosanne Liu et ses collègues, Google Research, « Character-Aware Models Improve Visual Text Rendering » (« Current image generation models struggle to reliably produce well-formed visual text », les modèles actuels de génération d'images peinent à produire de façon fiable un texte visuel bien formé ; les modèles texte-image courants « lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs », n'ont pas de caractéristiques d'entrée au niveau du caractère ; les modèles qui voient les caractères ont fait mieux que les autres pour le rendu du texte ; mis en ligne en décembre 2022, révisé en mai 2023) : arxiv.org/abs/2212.10562, consultée le 2026-10-02
- Federal Trade Commission des États-Unis (FTC), Advertising and Marketing (« Under the law, claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based », selon la loi, les allégations publicitaires doivent être véridiques, ne peuvent être ni trompeuses ni déloyales et doivent reposer sur des preuves) : ftc.gov/business-guidance/advertising-marketing, consultée le 2026-10-02
- Prix, résolutions et réglages sur 8frame (suppression d'arrière-plan, Seedream 5 Lite et 5 Pro comme modèle d'ouverture du nœud Seedream, Nano Banana Pro avec jusqu'à 10 images de référence et Nano Banana 2 comme modèle d'ouverture de son nœud, Flux Edit facturé selon la taille de l'image et Kontext Max, Kling v3 Standard et son image de départ obligatoire, Seedance 2.0 et 2.5, Veo 3.1 Fast et son verrouillage à 8 secondes avec une image de départ, Clarity et BRIA Increase Resolution, absence d'upscaler vidéo, remboursement automatique des exécutions échouées) : registre des outils et fonctions de coût de 8frame, lus le 2026-10-02
- Calques image à partir de vos propres imports dans le mode Video Editor : code front-end de 8frame, lu le 2026-10-02
Photographiez l'étiquette, générez le décor.
Essayez sans inscription : vous arrivez directement sur un vrai tableau. Le canvas de 8frame est gratuit et illimité ; la génération est payante à partir de 19 dollars par mois.