Uma foto de produto gerada volta com o nome da sua marca quase certo: uma letra fora do lugar, o espaçamento estranho, uma palavra que é quase a palavra. Num relance passa, mas quem conhece a marca percebe na hora, e isso é pior do que não ter rótulo nenhum.
Nenhum modelo mantém um rótulo exato sozinho, e nenhum prompt garante isso. O que funciona é partir do produto real, conferir cada quadro e colocar o rótulo real de volta onde as palavras precisam ser exatas.
Resumo
- Modelos de imagem e de vídeo não escrevem palavras de forma confiável. Um artigo do Google Research atribui parte do problema a modelos que não enxergam as letras individuais das palavras do prompt
- Nenhum prompt garante o rótulo. Escreva mesmo assim o texto exato entre aspas e depois leia cada resultado letra por letra
- Parta da foto real do produto: recorte (remoção de fundo, 12 créditos) e use o recorte na cena ou como referência, em vez de deixar um modelo inventar o produto
- Corrija o que sair errado: gere de novo, corrija com uma ferramenta de edição de imagem (Flux Edit, cerca de 7 créditos a 1 MP, ou Kontext Max, 13) ou componha o rótulo real no modo Video Editor do 8frame ou no seu próprio editor
- Em movimento, confira cada quadro, não só o primeiro: nenhum modelo de vídeo mantém um rótulo exato
Por que isso acontece
Modelos de imagem aprendem com quantidades enormes de imagens que contêm texto, então aprendem como a escrita parece: a espessura do traço, o espaçamento, como uma palavra fica numa embalagem. Produzir uma sequência exata de letras, e só essa, é outro problema.
Um artigo do Google Research assinado por Rosanne Liu e colegas, "Character-Aware Models Improve Visual Text Rendering" (modelos que enxergam os caracteres renderizam melhor o texto), começa assim: "Current image generation models struggle to reliably produce well-formed visual text" (os modelos atuais de geração de imagens têm dificuldade para produzir texto visual bem formado de forma confiável). E aponta um fator que contribui: os modelos populares de texto para imagem "lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs" (não têm atributos de entrada no nível do caractere, o que torna muito mais difícil prever a forma visual de uma palavra como uma série de glifos). Nos testes dos autores, os modelos que enxergavam os caracteres individuais renderizaram o texto melhor do que os que não enxergavam. O artigo é de 2022 (revisado em 2023). Seja qual for o modelo que você usa hoje, trate o texto do rótulo como algo a conferir, não como algo em que confiar.
Numa placa decorativa ao fundo, um quase acerto passa. No seu produto, é o nome da sua marca, mais ou menos.
Em vídeo é ainda mais difícil. Um modelo de vídeo gera cada quadro, rótulo incluído, e o rótulo precisa estar certo em todos. Uma variação de um quadro para o outro chama mais atenção do que um erro estático.
Parta do produto real
Não peça a um modelo para inventar o seu produto. Parta de uma foto do produto de verdade.
- Fotografe. Luz de janela, uma superfície lisa, o celular um pouco acima e à frente, o rótulo virado para a câmera. Tire várias fotos e fique com a mais nítida.
- Anote a direção da luz e o quanto ela é dura. Você vai pedir a mesma luz na cena.
- Recorte. Remoção de fundo, 12 créditos.
- Monte a cena. Há dois caminhos:
- Composição: gere um ambiente vazio com a luz que você anotou, por exemplo no Seedream 5 Lite por 6 créditos (o nó do Seedream abre no 5 Pro, então troque para o 5 Lite), e depois coloque o recorte nele no seu próprio editor de imagens, igualando a luz e a temperatura de cor. O rótulo continua sendo o da sua foto.
- Nova encenação: entregue o recorte a um modelo de imagem como imagem de referência, por exemplo o Nano Banana Pro por 21 créditos em 1K ou 2K, com até 10 imagens de referência (o nó do Nano Banana abre no Nano Banana 2, então troque para o Pro). O modelo redesenha o produto, rótulo incluído, então leia o rótulo letra por letra. Há prompts para isso em prompts de Nano Banana Pro para fotografia de produto.
- Unifique a cor se o produto e a cena não combinarem. O Flux Edit custa cerca de 7 créditos para uma imagem de 1 MP, e mais para imagens maiores. Um modelo de edição devolve uma imagem nova, então leia o rótulo de novo depois.
- Anime a partir da imagem estática pronta se precisar de movimento: envie a imagem a um modelo de vídeo como imagem inicial.
Animar sem perder o rótulo
Envie a imagem estática pronta a um modelo de vídeo como imagem inicial. No 8frame:
- Kling v3 Standard precisa de uma imagem inicial e segue o formato dela, em 720p: 57 créditos por 5 segundos sem som, 86 com som. O nó do Kling abre com o som ligado.
- Seedance vai até 720p. O nó abre no Seedance 2.5, a 157 créditos por 5 segundos (70 em 480p); o Seedance 2.0 custa 108 em 720p e 48 em 480p.
- Veo 3.1 Fast é a opção em 1080p. Com uma imagem inicial, ele sempre gera 8 segundos, em 16:9 ou 9:16, por 168 créditos com som.
Não medimos qual deles mantém um rótulo específico mais estável, e nenhum o mantém exato. Para escolher, passe a mesma imagem por dois modelos numa configuração barata, por exemplo o Seedance 2.0 em 480p (48 créditos) e o Kling v3 Standard sem som (57), e depois congele a imagem no rótulo em vários pontos de cada clipe: no começo, no meio e no fim. Mantenha o rótulo virado para a câmera, a rotação pequena e o movimento lento.
Quando um quadro ainda erra o rótulo:
- Gere de novo. Um clipe pronto que você descarta continua custando os créditos; só uma execução que falha é reembolsada automaticamente (gerações de IA que falham custam créditos?).
- Componha o rótulo real sobre o clipe. No modo Video Editor do 8frame, você pode enviar a sua própria imagem e colocá-la na linha do tempo como camada de imagem sobre o clipe. Uma camada estática serve para um plano em que o produto fica parado. Se o produto se move, componha no seu próprio editor ou deixe o rótulo virado para longe da câmera nesse plano.
O que tentar numa imagem estática e o que conferir
Escreva o texto no prompt. Coloque as palavras exatas entre aspas e diga onde elas ficam. Isso não garante a grafia, então leia cada resultado letra por letra.
Use a sua foto como referência. No Nano Banana Pro (21 créditos em 1K ou 2K), a foto real do produto pode entrar como imagem de referência. O modelo ainda redesenha o rótulo, e não medimos com que frequência algum modelo acerta a grafia.
Edite o texto. Você pode pedir a uma ferramenta de edição de imagem que corrija uma palavra: Flux Edit (cerca de 7 créditos a 1 MP) ou Kontext Max (13). Confira a palavra corrigida e o resto do rótulo, porque a edição pode mudar mais do que a palavra que você pediu.
Gere de novo. Rode outra vez e compare. Uma imagem pronta que você descarta continua custando os créditos.
Componha o rótulo real. Quando as palavras precisam ser exatas, coloque o rótulo real da foto do seu produto sobre o gerado no seu editor. É o único caminho desta lista em que o rótulo na tela é a sua própria fotografia.
Não espere que o upscale corrija a grafia. O 8frame não tem upscaler de vídeo. Numa imagem estática, um upscaler amplia o que já está ali e não tem como saber o nome da sua marca. O Clarity (13 créditos) é baseado em difusão, então pode redesenhar texto pequeno; o BRIA Increase Resolution (6 créditos, 2x ou 4x) é a outra opção da ferramenta de upscale. Leia o rótulo depois de qualquer upscale.
Quanto custa um conjunto de produto
Preços no 8frame; um crédito vale cerca de US$ 0,01 no preço de pacote.
| Passo | Caminho | Créditos |
|---|---|---|
| Recortar o produto | Remoção de fundo | 12 |
| Vinte variações de ambiente | Seedream 5 Lite, 6 cada | 120 |
| Unificar a cor | Flux Edit, imagem de 1 MP | cerca de 7 |
| Dois clipes de teste com a mesma imagem | Seedance 2.0 em 480p (48) e Kling v3 Standard, sem som, 720p (57) | 105 |
| Clipe final, 5 s em 720p | Seedance 2.0 (108; o nó abre no 2.5, a 157), ou ficar com o clipe do Kling | 0 a 108 |
| Ampliar a imagem estática | BRIA Increase Resolution, 2x ou 4x | 6 |
Um conjunto completo de produto fica em cerca de 250 a 360 créditos, algo entre US$ 2,50 e US$ 3,60 no preço de pacote, sem contar as repetições. O rótulo na imagem estática é o da sua foto; nos clipes, confira quadro a quadro.
A regra geral
Não deixe um modelo inventar nada que o cliente vá encontrar na vida real: o seu produto, a sua comida, o seu espaço. Se o anúncio mostra algo que o cliente não recebe, você tem um problema de devoluções, um problema de avaliações e uma questão legal: nos Estados Unidos, a FTC diz que "claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based" (as alegações em anúncios devem ser verdadeiras, não podem ser enganosas nem abusivas e devem ser baseadas em evidências).
Gere o mundo. Fotografe o produto.
Perguntas frequentes
Por que o texto do meu produto gerado sai errado? O modelo gera o rótulo como parte da imagem, e modelos de imagem e de vídeo não escrevem palavras de forma confiável. Um artigo do Google Research liga parte disso a modelos que não enxergam as letras individuais das palavras do prompt. Nenhum prompt garante a grafia.
Qual modelo mantém o rótulo do produto exato? Nenhum, sozinho. Parta da foto real do produto, confira cada quadro e componha o rótulo real onde as palavras precisam ser exatas. Para escolher um modelo de vídeo, passe a mesma imagem por dois deles numa configuração barata e compare o rótulo quadro a quadro.
Dá para consertar um rótulo deformado com uma edição? Às vezes. Tente o Flux Edit (cerca de 7 créditos a 1 MP) ou o Kontext Max (13) e leia o resultado letra por letra. Quando as palavras precisam ser exatas, componha o rótulo real da sua foto.
O upscale conserta um rótulo deformado? Não. Um upscaler amplia o que já está ali, e um baseado em difusão, como o Clarity, pode redesenhar texto pequeno. O 8frame não tem upscaler de vídeo.
Posso gerar o meu produto? Faça uma nova encenação a partir da foto real do produto, não de uma descrição em texto, e compare o resultado com o produto real antes que alguém veja: o rótulo, a forma e a cor.
Fontes
- Rosanne Liu e colegas, Google Research, "Character-Aware Models Improve Visual Text Rendering" ("Current image generation models struggle to reliably produce well-formed visual text", os modelos atuais de geração de imagens têm dificuldade para produzir texto visual bem formado de forma confiável; os modelos populares de texto para imagem "lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs", não têm atributos de entrada no nível do caractere; modelos que enxergam os caracteres superaram os que não enxergam na renderização de texto; publicado em dezembro de 2022, revisado em maio de 2023): arxiv.org/abs/2212.10562, consultada em 2026-10-02
- Comissão Federal de Comércio dos Estados Unidos (FTC), Advertising and Marketing ("Under the law, claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based", segundo a lei, as alegações em anúncios devem ser verdadeiras, não podem ser enganosas nem abusivas e devem ser baseadas em evidências): ftc.gov/business-guidance/advertising-marketing, consultada em 2026-10-02
- Preços, resoluções e ajustes do 8frame (remoção de fundo, Seedream 5 Lite e 5 Pro como modelo com que o nó do Seedream abre, Nano Banana Pro com até 10 imagens de referência e Nano Banana 2 como modelo com que o nó abre, Flux Edit com preço conforme o tamanho da imagem e Kontext Max, Kling v3 Standard e a exigência de imagem inicial, Seedance 2.0 e 2.5, Veo 3.1 Fast e a trava de 8 segundos com imagem inicial, Clarity e BRIA Increase Resolution, ausência de upscaler de vídeo, reembolso automático das execuções que falham): registro de ferramentas e funções de custo do 8frame, lidos em 2026-10-02
- Camadas de imagem com os seus próprios envios no modo Video Editor: código do front-end do 8frame, lido em 2026-10-02
Fotografe o rótulo, gere o ambiente.
Experimente sem cadastro: você cai direto num quadro real. O canvas do 8frame é gratuito e ilimitado; a geração é paga a partir de US$ 19 por mês.