← Volver al blog

¿Qué modelos de video con IA aceptan tu propio audio? Locución, música y diálogo por modelo

Todos los modelos de video de 8frame, leídos de su código: cuáles aceptan una pista de audio que tú aportas y qué hace cada uno con ella. Pruna p-video construye el clip alrededor de tu pista, Creatify Boreal la corta al ajuste de duración, Seedance la toma como referencia, tres herramientas de lip sync animan una cara con ella y el resto no tiene entrada de audio. Precios para una pista de 10 segundos.

En 8frame, ocho modelos de video aceptan una pista de audio que tú aportas (una locución, una base musical, una línea de diálogo), y hacen cuatro cosas distintas con ella. Pruna p-video y p-video Draft construyen el clip alrededor de la pista: el clip dura lo que dura la pista, hasta 20 segundos, y pagas la duración de la pista. Creatify Boreal conserva tu pista en lugar de la voz que genera, pero solo usa tantos segundos como marca el ajuste de duración, que empieza en 5. Seedance 2.5 y 2.0 la toman como referencia para la generación y desactivan su propio sonido. Pruna Avatar, Hailuo H3 Max Lip Sync y OmniHuman 1.5 animan una cara con ella. Todos los demás modelos de video, incluidos Veo 3.1, todos los Kling, Wan, Gemini Omni Flash, Grok Imagine y el Hailuo H3 base, no tienen entrada de audio; con ellos, pon tu pista bajo el clip terminado en el Video Editor. Todo lo que sigue se leyó del propio código de 8frame el 2026-10-01.

Resumen

Cada modelo de video y tu audio

Los precios son créditos por una pista de 10 segundos en las resoluciones indicadas; un crédito vale unos US$ 0.01 al precio de los paquetes. "No se acepta" significa que el nodo no muestra entrada de audio para ese modelo.

Modelo en 8frame ¿Acepta tu audio? Qué hace con él Regla de duración Pista de 10 s
Pruna p-video Sí, opcional Condiciona el video a la pista Clip = la pista, redondeada al segundo hacia arriba, de 1 a 20 s; una más larga se rechaza antes de cobrar 27 / 54 (720p / 1080p)
Pruna p-video Draft Sí, opcional Igual que p-video, en modo borrador Igual que p-video 7 / 14 (720p / 1080p)
Pruna p-video 2 Pro (Speed, Quality) No se acepta La entrada está oculta; una pista se rechaza no aplica
Creatify Boreal Sí, opcional Se conserva en el resultado en lugar de la voz generada (según el proveedor) Clip = el ajuste de duración, de 1 a 20 s, 5 por defecto; se usan esos primeros segundos de la pista, y una pista más corta se rellena con silencio; acepta pistas de hasta 60 s 14 / 41 / 162 (720p / 1080p / 2K), con la duración en 10
Seedance 2.5 Sí, opcional, una pista Referencia para la generación; el sonido propio de Seedance se desactiva Clip = el ajuste de duración, de 4 a 30 s; una pista de más de 30 s se corta a sus primeros 30 139 / 313 (480p / 720p); 1,307 en 720p con un video de referencia
Seedance 2.0 Sí, opcional, una pista Igual que 2.5 Clip = el ajuste de duración, de 4 a 15 s; una pista de más de 15 s se corta a sus primeros 15 96 / 216 (480p / 720p); 264 en 720p con un video de referencia
Pruna Avatar Obligatorio Sincroniza los labios de un retrato con la pista Clip = la pista, redondeada hacia arriba, hasta 35 s; una más larga se rechaza antes de cobrar 34 / 61 (720p / 1080p)
Hailuo H3 Max Lip Sync Obligatorio, desde tu biblioteca de 8frame Sincroniza los labios de una imagen fija con la pista Clip = la pista, 5 s como mínimo (una más corta se rechaza); el proveedor la corta en 14.8 s 68 / 108 / 216 / 432 (480p / 768p / 1080p / 2K)
OmniHuman 1.5 Obligatorio Anima una imagen con la pista Hasta 35 s (una más larga se rechaza), cobrado en tramos de 5 segundos 224
Veo 3.1 (Lite, Fast, Standard), Kling v3, O3, 2.6 Pro y anteriores, Wan 3.0, 3.0 Prime, 2.5, 2.2, Hailuo H3, Max Turbo, Max Camera Controls, Gemini Omni Flash, Grok Imagine, Happy Horse, Runway Gen-4 Turbo, Runway Act Two, ID-V2V No se acepta no aplica

Dos de los modelos marcados como "no se acepta" se quedan a un paso. La API del proveedor de Wan 3.0 Prime tiene un campo de audio de referencia, pero 8frame no lo envía. Runway Act Two se mueve a partir de un video de actuación, no de una pista de audio.

Pruna y Creatify Boreal son nuevos en 8frame, y ninguna de las herramientas de lip sync tuvo ejecuciones en producción en los 30 días hasta el 2026-09-30, así que aquí citamos precios y reglas, no calidad.

La pista fija la duración: Pruna p-video

p-video y p-video Draft son los únicos modelos de 8frame en los que tu pista decide cuánto dura el clip. El esquema de Pruna describe la entrada como "Input audio to condition video generation" y dice que el ajuste de duración queda "Ignored when audio is provided". 8frame lo respeta: con una pista adjunta no envía ninguna duración y, en su lugar, cobra la pista.

La propia página de Pruna menciona los videos musicales como uso ("combine your own audio with generated visuals"). No hemos revisado un resultado de 8frame con una pista adjunta, así que no está confirmado que el archivo reproduzca tu pista sin cambios. Los ajustes y la cuestión del sonido en Draft están en cómo usar Pruna p-video.

El ajuste de duración fija la duración: Creatify Boreal

Boreal funciona al revés. Según la página de la API de fal, tu pista "is preserved in the output instead of generated speech", y "the first duration seconds of the audio are used; shorter audio is padded with silence." El clip dura lo que marca el ajuste de duración, sea cual sea la pista.

8frame siempre envía ese ajuste, y empieza en 5 segundos, así que una locución de 10 segundos adjuntada sin cambiarlo vuelve con solo sus primeros 5 segundos. Ajusta la duración a la pista (hasta 20 segundos) antes de generar. Boreal cobra el ajuste de duración, no la pista: 10 segundos cuestan 14 créditos en 720p, 41 en 1080p y 162 en 2K. 8frame acepta pistas de hasta 60 segundos para Boreal, pero nunca se pueden usar más que los primeros 20. Las etiquetas del prompt y el resto de los ajustes están en cómo usar Creatify Boreal.

La pista guía y el modelo se calla: Seedance

Seedance 2.5 y 2.0 toman tu pista como referencia. El esquema de ByteDance en Replicate describe el audio de referencia como "for audio-driven generation and lip-sync" e indica que lo menciones en el prompt como [Audio1]; el nodo del canvas envía una pista, así que es la única etiqueta que necesitas. Del código de 8frame y de ese esquema salen tres reglas:

  1. El sonido propio de Seedance se desactiva. Siempre que hay una pista de referencia adjunta, 8frame le indica a Seedance que no genere audio, diga lo que diga el interruptor de sonido del nodo. No está confirmado que tu propia pista pase al archivo de salida; no lo hemos revisado.
  2. El ajuste de duración sigue decidiendo el clip. 8frame no lo cambia para que coincida con la pista, así que ajústalo tú. Una pista más larga de lo que permite la versión (30 segundos en 2.5, 15 en 2.0) se corta a sus primeros 30 o 15 segundos antes de enviarse.
  3. El audio solo no basta. Según el esquema del proveedor, una pista de referencia necesita al menos una imagen de referencia o un video de referencia, y en 2.5 no se puede combinar con un fotograma final.

El audio no cambia el precio. Un video de referencia sí: pasa Seedance a su tarifa con entrada de video, 1,307 créditos por 10 segundos en 720p en 2.5, frente a 313 con imágenes de referencia. Así que la forma más barata de darle tu pista a Seedance es con una imagen de referencia, no con un video de referencia.

La pista mueve una cara: herramientas de lip sync

Pruna Avatar, Hailuo H3 Max Lip Sync y OmniHuman 1.5 necesitan un retrato y una pista, y el resultado sigue a la pista. Se diferencian en los límites y en cómo redondean:

La comparación completa de precios, con el costo calculado de una cabeza parlante de 30 segundos, está en precio del lip sync con IA por modelo.

Formatos y límites de archivo

Modelo Formatos Tamaño de archivo Pista más larga
Pruna p-video, Draft FLAC, MP3, WAV 10 MB 20 s (una más larga se rechaza)
Creatify Boreal MP3, WAV 10 MB se aceptan 60 s, se usan los primeros de 1 a 20 s
Seedance 2.5 / 2.0 MP3, WAV 12 MB cualquiera; se corta a 30 s / 15 s
Pruna Avatar MP3, WAV 10 MB 35 s (una más larga se rechaza)
Hailuo H3 Max Lip Sync MP3, WAV no confirmado 5 s como mínimo; se corta en 14.8 s
OmniHuman 1.5 MP3, WAV 10 MB 35 s (una más larga se rechaza)

El canvas sube audio como MP3 o WAV, así que FLAC es el único formato de esta tabla que solo te sirve en p-video. Una pista por nodo: la entrada de audio admite un solo archivo en todos los modelos de arriba.

Si tu sonido ya está en un video

Algunos modos de edición parten de un clip en lugar de un archivo de audio, y pueden conservar el sonido de ese clip: Kling 2.6 Pro Motion Control conserva por defecto el sonido original del video de movimiento, Kling O1 Video tiene un interruptor para conservar el audio (desactivado por defecto), la edición de video de Happy Horse tiene un interruptor para conservar el sonido original, y en 8frame Wan 2.7 VideoEdit siempre pide conservar el sonido del clip de entrada. Conservan el sonido que trajiste; no aceptan una pista aparte. Lo que cuesta cada uno está en qué modelos de video con IA funcionan solo con texto.

Si prefieres sonido generado

Si no tienes una pista, la mayor parte del catálogo genera la suya. Veo 3.1, Kling v3 y Kling 2.6 Pro cobran el sonido y te dejan desactivarlo, Seedance y Wan 3.0 Prime lo incluyen al mismo precio, y Grok Imagine, Gemini Omni Flash, Creatify Boreal y los modelos p-video de Pruna siempre lo añaden. Qué hace cada modelo y cuánto cuesta el sonido en cada uno está en qué modelos de video con IA generan sonido. Si un clip salió en silencio, por qué mi video con IA no tiene sonido repasa las causas.

También puedes crear la pista en 8frame y luego usarla como tuya: ElevenLabs texto a voz cuesta 13 créditos por cada 1,000 caracteres iniciados, un efecto de sonido cuesta de 1 a 6 créditos según la duración, y una pieza musical de 30 segundos de Lyria 2 cuesta 13. Los precios de cada modelo de voz y de música están en precio de la música y la voz con IA por modelo.

Poner tu propio audio bajo cualquier clip después

Para los modelos sin entrada de audio, y para una mezcla que quieras controlar, añade el sonido después de generar. 8frame tiene un modo Video Editor aparte, junto al canvas, con una línea de tiempo: sus capas incluyen video, texto, subtítulos y sonido. Sube tu locución o tu música, pon el clip y la pista en la línea de tiempo, alinéalos y renderiza.

Esta vía funciona con cualquier modelo de video, y tu pista nunca pasa por un modelo que la reinterprete. Dos consejos:

Dos notas para quien lee desde Latinoamérica o España: los precios de 8frame están en dólares estadounidenses, y la interfaz de la aplicación todavía no tiene versión en español; se abre en inglés.

Preguntas frecuentes

¿Puedo usar mi propia locución en un video con IA? En 8frame, sí, en ocho modelos: Pruna p-video y Draft, Creatify Boreal, Seedance 2.5 y 2.0, Pruna Avatar, Hailuo H3 Max Lip Sync y OmniHuman 1.5. En cualquier otro modelo, añade la locución después en el Video Editor.

¿Qué modelo de video con IA hace el clip tan largo como mi audio? Pruna p-video y p-video Draft, hasta 20 segundos, y las herramientas de lip sync (Pruna Avatar y OmniHuman hasta 35 segundos, Hailuo H3 Max Lip Sync hasta unos 15). En Creatify Boreal y Seedance, el ajuste de duración decide el clip.

¿Por qué se cortó mi locución? En Creatify Boreal, el ajuste de duración decide cuánto de la pista se usa, y empieza en 5 segundos. En Seedance, una pista de más de 30 segundos (2.5) o 15 segundos (2.0) se corta, y Hailuo H3 Max Lip Sync se detiene en 14.8 segundos. Más causas en por qué mi video con IA sale más corto de lo que pedí.

¿Veo 3.1 o Kling pueden usar mi archivo de audio? No. Ninguno de los dos tiene entrada de audio en 8frame; ambos generan su propio sonido. Genera el clip y luego añade tu pista en el Video Editor.

¿Cuál es la forma más barata de hacer un clip con mi propia pista? Pruna p-video Draft: una pista de 10 segundos cuesta 7 créditos en 720p. p-video completo cuesta 27, y Creatify Boreal con la duración en 10 cuesta 14.

¿Añadir mi audio cuesta extra? No como recargo. En p-video y en las herramientas de lip sync pagas la duración de la pista; en Creatify Boreal y Seedance pagas el ajuste de duración, con o sin pista.

¿Puedo adjuntar más de una pista? No en el canvas: cada nodo acepta una. El proveedor de Seedance permite varias pistas de referencia, pero el nodo de 8frame envía una.

¿Puedo usar mi propio audio a través de Claude o Cursor? No. El conector MCP de 8frame no tiene entrada de audio en ninguna herramienta, así que las herramientas de lip sync y los modos guiados por audio (p-video con una pista, Boreal o Seedance con tu audio) no están disponibles a través de él. La configuración está en generate AI video from Claude (en inglés).

Fuentes


Elige el modelo según lo que tiene que hacer tu pista. El canvas de 8frame es gratuito e ilimitado; la generación es de pago desde US$ 19 al mes.

Artículos relacionados

comparativaQué modelos de video con IA funcionan solo con texto y cuáles necesitan una imagen inicialcomparativa¿Cuánto puede durar un video con IA? Duración máxima por modelo en 2026comparativaFormatos de video con IA por modelo en 2026: quién ofrece 9:16, 4:3, 21:9 y 4:5

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates