← Voltar ao blog

Preço do lip sync com IA por modelo em 2026: Pruna Avatar, Hailuo H3 e OmniHuman no 8frame

Quanto custa fazer uma foto falar com a sua faixa de áudio no 8frame, pelo código de preços: Pruna Avatar a partir de 17 créditos por 5 segundos, Hailuo H3 Max Lip Sync a partir de 34, OmniHuman 1.5 a 112 e Runway Act Two a 8 por segundo de atuação. Durações, como cada um cobra e o custo de uma cabeça falante de 30 segundos.

Fazer uma imagem fixa falar com a sua própria faixa de áudio custa no 8frame de 17 créditos por 5 segundos (Pruna Avatar em 720p) a 112 (OmniHuman 1.5), com o Hailuo H3 Max Lip Sync no meio, de 34 a 216 conforme a resolução. Um crédito vale US$ 0,01 no preço dos pacotes. Essas ferramentas recebem um retrato e uma faixa de áudio, e o resultado dura o mesmo que o áudio. O Runway Act Two é o outro caminho: uma atuação real gravada em vídeo move um personagem, a 8 créditos por segundo. Os preços foram lidos do código de preços do 8frame em 2026-09-30.

Ferramentas de lip sync no 8frame, numa tabela

Ferramenta O que você envia Duração 5 segundos Créditos por segundo
Pruna Avatar um retrato e uma faixa de áudio a do áudio, até 35 s 17 em 720p, 31 em 1080p 3,4 / 6,1
Hailuo H3 Max Lip Sync uma imagem fixa e uma faixa de áudio a do áudio, mínimo de 5 s, até cerca de 15 s 34 / 54 / 108 / 216 em 480p / 768p / 1080p / 2K 6,75 / 10,8 / 21,6 / 43,2
OmniHuman 1.5 uma imagem e uma faixa de áudio de 5 a 35 s, cobrado em blocos de 5 segundos 112 22,4
Runway Act Two um personagem (imagem ou vídeo) e um vídeo de atuação de 3 a 30 s de referência 40 8

Nenhuma dessas ferramentas teve gerações em produção no 8frame nos 30 dias até 2026-09-30, então citamos o preço, não a qualidade. Teste com o seu próprio retrato e a sua voz antes de fechar um projeto.

Como cada uma cobra

O Pruna Avatar cobra por segundo de vídeo gerado, e o vídeo acompanha o seu áudio, que o 8frame mede e arredonda para o segundo seguinte. Em 720p são 3,375 créditos por segundo; em 1080p, 6,075. Faixas com mais de 35 segundos são recusadas antes da cobrança. O resultado mantém o formato do retrato.

O Hailuo H3 Max Lip Sync também cobra a duração do áudio, com mínimo de 5 segundos, em quatro níveis de resolução; 768p é o padrão. Ele aceita cerca de 15 segundos de áudio por geração, então um roteiro mais longo vira vários clipes.

O OmniHuman 1.5 cobra em blocos de 5 segundos, de 5 a 35: uma faixa de 7 segundos é cobrada como 10 segundos, 224 créditos.

O Runway Act Two é de outro tipo: em vez de uma faixa de áudio, você envia um vídeo de alguém atuando, e ele transfere a atuação (rosto e ritmo) para o seu personagem, a 8 créditos por segundo da referência.

Uma cabeça falante de 30 segundos, com custos

Um retrato e um roteiro de 30 segundos lido por uma voz sintética:

Caminho Geração Créditos
Retrato Nano Banana 2, 1K 11
Faixa de voz (menos de 1.000 caracteres) ElevenLabs texto para fala 13
Pruna Avatar, 720p, 30 s um clipe 102
Pruna Avatar, 1080p, 30 s um clipe 183
Hailuo H3 Max Lip Sync, 768p dois clipes de 15 segundos 324
OmniHuman 1.5, 30 s um clipe 672

Ou seja, uma cabeça falante de 30 segundos custa de 126 créditos (retrato, voz e Pruna Avatar em 720p) a 696 (o mesmo com OmniHuman). Com a sua própria voz gravada em vez de texto para fala, tire os 13.

Qual usar

O mais barato, e com duração para um roteiro inteiro: Pruna Avatar, até 35 segundos num clipe só.

A maior resolução: Hailuo H3 Max Lip Sync em 2K (216 por 5 segundos).

Quando o ritmo de um ator real importa mais que uma faixa de voz: Runway Act Two, a partir de um vídeo de atuação.

Quando você não tem faixa de áudio: os modelos que geram uma pessoa falando com som numa só passada, como o Veo 3.1 (448 créditos por 8 segundos com áudio), produzem a voz do modelo, não a sua. Para uma voz específica, crie a faixa primeiro e use uma ferramenta de lip sync.

Antes de começar

Use um retrato que você tenha o direito de animar e uma voz que você tenha o direito de usar. O rosto ou a voz de uma pessoa real exige o consentimento documentado dela, e as plataformas têm regras para identificar pessoas sintéticas realistas.

O que conferir: o formato da boca nas consoantes fortes, dentes estáveis, piscadas naturais e se a cabeça não se afasta do enquadramento do retrato num clipe longo.

Perguntas frequentes

Qual é o lip sync com IA mais barato? No 8frame, o Pruna Avatar em 720p: 17 créditos por 5 segundos, 102 por 30 segundos.

Quanto custa o OmniHuman? No 8frame, 22,4 créditos por segundo, cobrados em blocos de 5 segundos de 5 a 35: 112 por 5 segundos, 672 por 30.

Quanto tempo pode ter um clipe de lip sync? Até 35 segundos com Pruna Avatar ou OmniHuman, e cerca de 15 segundos por clipe com o Hailuo H3 Max Lip Sync. Roteiros mais longos são divididos e unidos (o Merge Videos custa 10 créditos por junção).

Lip sync é o mesmo que avatar falante? É o núcleo dele: uma imagem fixa de uma pessoa animada sobre uma faixa de áudio. Todos os preços de vídeo por segundo estão em preço por segundo do vídeo com IA.

Fontes


Crie a faixa de voz, escolha o preço e confira a boca. O canvas do 8frame é gratuito e ilimitado; a geração é paga a partir de US$ 19 por mês.

Artigos relacionados

guiaPreço por segundo do vídeo com IA em 2026: cada modelo no 8frame, de 0,7 a 56 créditosguiaComo usar o Creatify Boreal: vídeo com som próprio a partir de 7 créditosguiaComo usar o Kling v3 de graça: os limites reais em 2026

Make it
move.

Stay in the loop

Be the first to hear about our launch and get product updates