← Volver al blog

¿Por qué la IA cambia la etiqueta de mi producto?

Los modelos de imagen y video con IA no escriben las palabras de forma fiable, así que la etiqueta generada se desvía. Por qué pasa, qué revisar en cada fotograma y las soluciones en 8frame: partir de la foto real del producto, editar, regenerar o componer la etiqueta real.

Una toma de producto generada vuelve con el nombre de tu marca casi bien: una letra corrida, el espaciado raro, una palabra que es casi la palabra. A simple vista pasa, pero cualquiera que conozca la marca nota que está mal, y eso es peor que no tener etiqueta.

Ningún modelo mantiene una etiqueta exacta por sí solo, y ningún prompt lo garantiza. Lo que funciona es partir del producto real, revisar cada fotograma y volver a poner la etiqueta real donde las palabras tengan que ser exactas.

En resumen

Por qué pasa

Los modelos de imagen aprenden de enormes cantidades de imágenes que contienen texto, así que aprenden cómo se ve la escritura: el grosor del trazo, el espaciado, cómo se asienta una palabra sobre un envase. Producir una secuencia exacta de letras, y solo esa, es otro problema.

Un artículo de Google Research firmado por Rosanne Liu y sus colegas, "Character-Aware Models Improve Visual Text Rendering" (los modelos que ven los caracteres representan mejor el texto), empieza así: "Current image generation models struggle to reliably produce well-formed visual text" (a los modelos actuales de generación de imágenes les cuesta producir de forma fiable texto visual bien formado). Y señala un factor que contribuye: los modelos populares de texto a imagen "lack character-level input features, making it much harder to predict a word's visual makeup as a series of glyphs" (carecen de rasgos de entrada a nivel de carácter, lo que hace mucho más difícil predecir la forma visual de una palabra como una serie de glifos). En las pruebas de los autores, los modelos que podían ver los caracteres individuales representaron el texto mejor que los que no. El artículo es de 2022 (revisado en 2023). Uses el modelo que uses hoy, trata el texto de la etiqueta como algo que se revisa, no como algo en lo que se confía.

En un cartel decorativo del fondo, un casi acierto se tolera. En tu producto es el nombre de tu marca, más o menos.

En video es todavía más difícil. Un modelo de video genera cada fotograma, etiqueta incluida, y la etiqueta tiene que estar bien en todos. Un desvío de un fotograma al siguiente llama más la atención que un error estático.

Parte del producto real

No le pidas a un modelo que invente tu producto. Parte de una foto del producto real.

  1. Fotografíalo. Luz de ventana, una superficie lisa, el celular un poco por encima y por delante, la etiqueta de frente a la cámara. Toma varias fotos y quédate con la más nítida.
  2. Anota la dirección de la luz y qué tan dura es. Vas a pedir la misma luz en la escena.
  3. Recórtalo. Eliminación de fondo, 12 créditos.
  4. Arma la escena. Hay dos caminos:
    • Composición: genera un entorno vacío con la luz que anotaste, por ejemplo con Seedream 5 Lite a 6 créditos (el nodo de Seedream se abre en 5 Pro, así que cámbialo a 5 Lite), y luego coloca tu recorte en tu propio editor de imágenes, igualando la luz y la temperatura de color. La etiqueta sigue siendo la de tu foto.
    • Nueva puesta en escena: dale el recorte a un modelo de imagen como imagen de referencia, por ejemplo Nano Banana Pro a 21 créditos en 1K o 2K, con hasta 10 imágenes de referencia (el nodo de Nano Banana se abre en Nano Banana 2, así que cambia a Pro). El modelo vuelve a dibujar el producto, etiqueta incluida, así que lee la etiqueta letra por letra. Tienes prompts para esto en prompts de Nano Banana Pro para fotografía de producto.
  5. Unifica el color si el producto y la escena no combinan. Flux Edit cuesta unos 7 créditos por una imagen de 1 MP, y más por las más grandes. Un modelo de edición devuelve una imagen nueva, así que vuelve a leer la etiqueta después.
  6. Anima a partir de la imagen fija terminada si necesitas movimiento: envíala a un modelo de video como imagen inicial.

Animar sin perder la etiqueta

Envía la imagen fija terminada a un modelo de video como imagen inicial. En 8frame:

No hemos medido cuál de ellos mantiene más estable una etiqueta concreta, y ninguno la mantiene exacta. Para elegir, pasa la misma imagen por dos modelos en una configuración barata, por ejemplo Seedance 2.0 en 480p (48 créditos) y Kling v3 Standard sin sonido (57), y luego congela la imagen sobre la etiqueta en varios puntos de cada clip: el inicio, la mitad y el final. Mantén la etiqueta de frente a la cámara, la rotación pequeña y el movimiento lento.

Si un fotograma sigue con la etiqueta mal:

Qué probar en una imagen fija y qué revisar

Nombra el texto en el prompt. Pon las palabras exactas entre comillas y di dónde van. Eso no garantiza la ortografía, así que lee cada resultado letra por letra.

Usa tu foto como referencia. En Nano Banana Pro (21 créditos en 1K o 2K), la foto real del producto puede entrar como imagen de referencia. El modelo igual vuelve a dibujar la etiqueta, y no hemos medido con qué frecuencia algún modelo la escribe bien.

Edita el texto. Puedes pedirle a una herramienta de edición de imagen que corrija una palabra: Flux Edit (unos 7 créditos a 1 MP) o Kontext Max (13). Revisa la palabra corregida y el resto de la etiqueta, porque la edición puede cambiar más que la palabra que pediste.

Regenera. Vuelve a ejecutarlo y compara. Una imagen terminada que descartas igual cuesta sus créditos.

Compón la etiqueta real. Cuando las palabras tienen que ser exactas, coloca la etiqueta real de la foto de tu producto sobre la generada en tu editor. Es el único camino de esta lista en el que la etiqueta que se ve es tu propia fotografía.

No esperes que el escalado corrija la ortografía. 8frame no tiene escalador de video. En una imagen fija, un escalador agranda lo que ya está y no puede saber cómo se llama tu marca. Clarity (13 créditos) se basa en difusión, así que puede volver a dibujar el texto pequeño; BRIA Increase Resolution (6 créditos, 2x o 4x) es la otra opción de la herramienta de escalado. Lee la etiqueta después de cualquier escalado.

Cuánto cuesta un set de producto

Precios en 8frame; un crédito cuesta unos US$ 0.01 en paquete.

Paso Ruta Créditos
Recortar el producto Eliminación de fondo 12
Veinte variantes de entorno Seedream 5 Lite, 6 cada una 120
Unificar el color Flux Edit, imagen de 1 MP unos 7
Dos clips de prueba con la misma imagen Seedance 2.0 en 480p (48) y Kling v3 Standard, sin sonido, 720p (57) 105
Clip final, 5 s en 720p Seedance 2.0 (108; el nodo se abre en 2.5, a 157), o quedarte con el clip de Kling 0 a 108
Agrandar la imagen fija BRIA Increase Resolution, 2x o 4x 6

Un set de producto completo sale en unos 250 a 360 créditos, aproximadamente de US$ 2.50 a US$ 3.60 en paquete, sin contar las repeticiones. La etiqueta de la imagen fija es la de tu foto; en los clips, revísala fotograma por fotograma.

La regla general

No dejes que un modelo invente nada que un cliente vaya a encontrarse en la realidad: tu producto, tu comida, tu local. Si el anuncio muestra algo que el cliente no recibe, tienes un problema de devoluciones, un problema de reseñas y una cuestión legal: en Estados Unidos, la FTC dice que "claims in advertisements must be truthful, cannot be deceptive or unfair, and must be evidence-based" (las afirmaciones publicitarias deben ser veraces, no pueden ser engañosas ni desleales y deben estar respaldadas por pruebas).

Genera el mundo. Fotografía el producto.

Preguntas frecuentes

¿Por qué sale mal el texto de mi producto generado? El modelo genera la etiqueta como parte de la imagen, y los modelos de imagen y de video no escriben las palabras de forma fiable. Un artículo de Google Research vincula parte de esto con modelos que no ven las letras individuales de las palabras del prompt. Ningún prompt garantiza la ortografía.

¿Qué modelo mantiene exacta la etiqueta de un producto? Ninguno, por sí solo. Parte de la foto real del producto, revisa cada fotograma y compón la etiqueta real donde las palabras tengan que ser exactas. Para elegir un modelo de video, pasa la misma imagen por dos de ellos en una configuración barata y compara la etiqueta fotograma por fotograma.

¿Puedo arreglar una etiqueta deformada con una edición? A veces. Prueba Flux Edit (unos 7 créditos a 1 MP) o Kontext Max (13) y lee el resultado letra por letra. Cuando las palabras tienen que ser exactas, compón la etiqueta real de tu foto.

¿El escalado arregla una etiqueta deformada? No. Un escalador agranda lo que ya está, y uno basado en difusión, como Clarity, puede volver a dibujar el texto pequeño. 8frame no tiene escalador de video.

¿Puedo generar mi producto? Hazle una nueva puesta en escena a partir de la foto real del producto, no de una descripción en texto, y compara el resultado con el producto real antes de que nadie lo vea: la etiqueta, la forma y el color.

Fuentes


Fotografía la etiqueta, genera la habitación.

Pruébalo sin registrarte: llegas directamente a un tablero real. El canvas de 8frame es gratuito e ilimitado; la generación es de pago desde US$ 19 al mes.

Artículos relacionados

guíaCómo usar Kling v3 Pro: cuándo compensan los 114 créditosguíaRequisitos de video para anuncios de Facebook en 2026: 4:5 a 1440 x 1800, hasta 4 GBguíaRequisitos de video para anuncios en el feed y las historias de Instagram en 2026: 9:16 para ambos, 4:5 recortando

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates