MiniMax H3 Image-to-Video · 5 Testes no fal.ai
Brian, do Creative AI Show, colocou o MiniMax H3, também apresentado como Hailuo 3.0, à prova com retratos, um gráfico de cliente, ficção científica, uma imagem de grupo e movimento de artes marciais. Os resultados mostram emoção, detalhe e movimento corporal convincentes, mas também revelam uma falha clara de aderência ao prompt e instabilidade no fundo. Este guia separa os cinco testes próprios do exemplo promocional, confirma as especificações, compara o preço do fal.ai com a API direta e propõe um benchmark mais rigoroso.
Video credit: Creative AI Show. Source video: MiniMax H3 Image-to-Video Tested · Is This the Next AI Video Breakthrough?.
Quick Summary
- Crédito: o teste incorporado foi publicado pelo Creative AI Show e apresentado por Brian. O vídeo contém cinco gerações feitas pelo criador no fal.ai e começa com um sexto clip, dos cavalos na água, que já era um exemplo selecionado pelo fornecedor.
- O retrato com riso, o gráfico com fundo subtil, a fotografia de grupo e a pose de karaté mostram resultados visualmente fortes. O H3 preserva bastante detalhe, produz microexpressões credíveis e consegue movimento corporal complexo em exemplos selecionados.
- O teste do portal é a evidência mais útil sobre o limite do modelo. A personagem deveria entrar no portal, mas o resultado aproxima ou materializa o portal à sua frente. A imagem é apelativa, porém a ação pedida não foi cumprida.
- O vídeo não testa áudio, apesar de áudio estéreo nativo ser uma das principais capacidades do H3. Também não revela todos os prompts, duração, seeds, número de tentativas, clips rejeitados, latência ou custo por resultado aprovado.
- A reprodução comprimida do YouTube não permite confirmar a frase 2K ou melhor. O endpoint usado no fal.ai oferece 2K, mas resolução configurada, detalhe percebido e resolução efetiva são medidas diferentes.
- Conclusão: este é um primeiro teste promissor, não um benchmark capaz de declarar o H3 melhor do que Kling, Veo ou outros modelos. O avanço está na combinação de movimento, detalhe e contexto multimodal, enquanto aderência a ações, fundos e repetibilidade ainda precisam de avaliação controlada.
--what to try first
- Dê crédito a Brian e ao Creative AI Show pelo teste e à MiniMax pelo modelo.
- Separe sempre exemplos fornecidos pela plataforma de gerações feitas pelo reviewer.
- Leia o clip dos cavalos como demonstração curada do fal.ai, não como resultado independente do vídeo.
- O retrato sugere bom controlo de microexpressão, mas um único rosto bem sucedido não mede consistência de identidade.
- Para gráficos, peça movimento apenas no fundo e bloqueie texto, logótipos, números, layout e cores.
- Compare o frame inicial e o final com OCR e diferença de píxeis quando a informação precisa de permanecer intacta.
- No teste do portal, qualidade visual e aderência ao prompt apontam em direções diferentes. Avalie ambas separadamente.
- Movimento corporal convincente não elimina artefactos no cenário. Inspecione mãos, pés, roupa, sombras e objetos do fundo frame a frame.
- O vídeo não testa áudio nativo. Não use este review como prova de qualidade de voz, efeitos, música ou sincronização labial.
- No fal.ai, H3 image-to-video custa 0,26 dólares por segundo em 2K. Um clip de 5 segundos custa 1,30 dólares antes de repetições.
- Na API direta da MiniMax, a tabela consultada indica 0,13 dólares por segundo em 2K. O mesmo clip de 5 segundos custa 0,65 dólares.
- Registe tentativas e clips rejeitados. O custo útil é o custo total dividido pelo número de shots aprovados.
- Não confirme 2K apenas pela nitidez vista no YouTube. Descarregue o ficheiro original e verifique dimensões, bitrate e detalhe temporal.
- Obtenha autorização para usar fotografias de clientes, familiares e menores, sobretudo em serviços externos de IA.
- Evite usar a semelhança de celebridades em campanhas sem direitos, consentimento e revisão jurídica adequada.
- Para comparar H3 com Kling ou Veo, use os mesmos inputs, prompt, duração, resolução, número de tentativas e grelha de avaliação.
Crédito e método desta análise
O vídeo incorporado foi publicado pelo Creative AI Show a 31 de julho de 2026 e é apresentado por Brian, que se descreve como metade do canal. Todo o mérito pelos exemplos e comentários do teste pertence a Brian e ao Creative AI Show.
A análise abaixo cruza a transcrição fornecida com a página oficial do MiniMax H3, a API V2 e a tabela de preços da MiniMax, além da página e documentação do endpoint image-to-video do fal.ai. A pesquisa foi atualizada em 3 de agosto de 2026.
O objetivo não é transformar uma impressão visual numa pontuação científica. É identificar o que os clips realmente demonstram, o que permanece por medir e como repetir o teste com critérios úteis para produção.
A resposta curta: é o próximo grande salto?
Talvez seja um salto importante, mas este vídeo, por si só, não prova isso. Os cinco resultados escolhidos mostram emoção facial, detalhe, movimento atmosférico e ação corporal acima do que muitos workflows aceitavam há poucos meses. Há material suficiente para justificar um teste no seu próprio pipeline.
Ao mesmo tempo, a personagem não atravessa o portal como pedido, o cenário do karaté apresenta problemas e não vemos as gerações rejeitadas. Sem uma taxa de sucesso, não sabemos se cada clip apareceu à primeira tentativa ou depois de muitas repetições.
A formulação mais honesta é esta: H3 parece competitivo e merece um lugar na shortlist de image-to-video. A palavra breakthrough deve ficar reservada para um teste repetível de movimento, identidade, texto, áudio, custo e aderência ao prompt.
Como Brian testou MiniMax H3 no fal.ai
Brian abre o MiniMax H3 no fal.ai, carrega uma imagem e escreve uma instrução de movimento. O vídeo percorre cinco casos próprios: um retrato, um gráfico de cliente, uma cena de ficção científica, uma imagem de grupo e uma fotografia de karaté.
O endpoint atual do fal.ai exige uma imagem inicial e um prompt. Pode receber opcionalmente uma imagem final, herda a proporção da imagem, oferece 768P ou 2K e usa cinco segundos por defeito. A página comercial anuncia clips entre cinco e 15 segundos a 24 fps.
A API direta da MiniMax aceita H3 entre quatro e 15 segundos. Esta diferença de duração mínima depende do fornecedor e da interface, por isso confirme o endpoint que efetivamente vai pagar.
Antes dos testes: os cavalos são um exemplo do fornecedor
O primeiro clip mostra dois cavalos em água rasa, com movimento lento, contacto entre as cabeças, reflexos e ondulação. É uma demonstração bonita de movimento subtil e física de superfície.
Contudo, Brian identifica esse resultado como o exemplo apresentado no fal.ai. Não foi gerado por ele durante o teste mostrado. Exemplos de produto tendem a ser selecionados entre outputs fortes e não revelam a taxa de falha.
Use esse clip para perceber a ambição visual do modelo. Use os cinco testes seguintes para avaliar a evidência produzida pelo criador.
Teste 1: retrato, riso e microexpressão
Brian usa um retrato de uma jovem Angelina Jolie e pede que o rosto ganhe vida e ria. O output preserva a aparência geral, introduz movimento nos olhos e na boca e produz linhas de expressão que ele considera realistas.
O ponto forte é a passagem de uma fotografia estática para uma expressão com pequenas mudanças faciais, sem uma transformação óbvia da identidade no excerto mostrado. O detalhe percebido também se mantém elevado.
Há duas reservas. Primeiro, não existe comparação biométrica nem repetição com várias seeds. Segundo, semelhanças de figuras públicas levantam questões de consentimento, publicidade e direitos de imagem. Um resultado tecnicamente convincente não concede autorização para o publicar ou comercializar.
Teste 2: animar um gráfico sem destruir a informação
O segundo input é um gráfico criado para um cliente. A instrução pede movimento subtil no fundo e preservação da informação. Brian observa que o fundo ganha vida enquanto texto e elementos principais parecem permanecer no lugar.
Este é um caso de uso valioso para marcas porque a geração não precisa de reinventar a composição. Precisa de respeitar uma zona bloqueada. Ainda assim, o vídeo não faz OCR antes e depois, não sobrepõe os frames e não amplia números ou letras pequenas.
Para trabalho real, exporte o primeiro e o último frame, confirme cada palavra e número e use uma diferença visual para localizar drift. Se a informação tiver valor legal, comercial ou médico, reconstrua o texto como camada editável depois da geração.
Teste 3: um bom clip que falha a ação pedida
Na cena de ficção científica, a personagem deveria entrar num portal. O H3 cria vento, tecido em movimento, atmosfera e uma presença luminosa forte. Brian gosta do resultado visual.
Mas a ação semântica muda. Em vez de vermos a personagem atravessar o portal, o portal aproxima-se, cresce ou aparece diante dela. Isto é uma falha de aderência ao prompt, mesmo que o clip continue interessante.
Este exemplo ensina uma distinção essencial: qualidade estética mede se gostamos do que aconteceu. Aderência mede se aconteceu o que foi pedido. Em publicidade, previs, continuidade narrativa e VFX, uma nota alta numa dimensão não compensa automaticamente uma nota baixa na outra.
Teste 4: transformar um gráfico de aniversário numa cena viva
Brian parte de uma composição de aniversário criada com ChatGPT Image 2.0 a partir de fotografias de membros da equipa do cliente. O objetivo é fazer as pessoas parecerem naturais e presentes no mesmo momento.
No resultado mostrado, a imagem ganha movimento sem perder imediatamente a definição dos rostos. Isso sugere utilidade para posts comemorativos, comunicação interna e peças sociais que começam numa composição aprovada.
O teste não inclui uma auditoria de identidade, mãos, contacto entre pessoas ou continuidade ao longo de várias gerações. Como envolve fotografias reais de clientes, a equipa deve confirmar consentimento, política de retenção do fornecedor e permissão para processamento por IA antes do upload.
Teste 5: corpo inteiro, pontapé e instabilidade no cenário
O último input é uma fotografia do filho de Brian numa pose de karaté. O prompt pede golpes convincentes no saco. O clip mostra socos, pontapés e mudanças rápidas de pose que Brian considera bem executadas.
Movimento corporal é um stress test mais difícil do que uma animação facial subtil. Pernas, braços, equilíbrio, roupa, contacto e reação do saco precisam de permanecer coerentes entre frames. O exemplo indica progresso real nesta área.
Brian também nota problemas em elementos do fundo. Isso impede uma conclusão limpa sobre consistência total. Num teste profissional, o cenário deve ser analisado separadamente do sujeito. E, quando o input inclui um menor, consentimento parental, minimização de dados e controlo de publicação deixam de ser opcionais.
O que estes cinco testes realmente demonstram
Os exemplos sugerem que H3 consegue extrair movimento plausível de imagens muito diferentes: retrato fotográfico, layout gráfico, concept art, colagem de pessoas e ação desportiva. Essa amplitude é mais relevante do que um único shot cinematográfico perfeito.
Também mostram que a preservação da intenção varia por tarefa. Em movimento subtil, o modelo parece conservador. Numa ação espacial complexa, como entrar num portal, substitui a coreografia pedida por outra solução visual.
A evidência suporta uma conclusão de viabilidade: vale a pena prototipar. Não suporta uma conclusão de liderança absoluta, porque não existe comparação com inputs equivalentes, pontuação cega ou divulgação das tentativas falhadas.
O que o vídeo não mede
Não são mostrados todos os prompts completos, duração escolhida, resolução confirmada no ficheiro, seeds, latência, fila, número de tentativas ou custo acumulado. Também não vemos os outputs que o criador decidiu não incluir.
O vídeo não mede consistência da mesma personagem em vários shots, continuidade entre cenas, texto com OCR, sincronização labial, fidelidade de cor, direitos de uso, segurança ou performance em lotes grandes.
Brian menciona Kling e Google Veo, mas não executa um teste lado a lado. As observações sobre concorrentes são opinião contextual, não resultado de um benchmark controlado neste vídeo.
A maior capacidade ausente: áudio nativo
MiniMax apresenta H3 como um modelo audiovisual capaz de gerar áudio estéreo nativo. Brian afirma explicitamente que não está a testar som e que não incluiu instruções de áudio.
Por isso, este review não informa sobre diálogo, voz, efeitos, música, ambiente, sincronização labial ou coerência entre som e movimento. É um teste image-to-video visual, não uma avaliação completa do H3.
Um segundo round deveria usar o mesmo conjunto de imagens com prompts sonoros específicos e avaliar separadamente inteligibilidade, timing, ruído, mistura, direitos musicais e necessidade de pós-produção.
2K configurado não é o mesmo que 2K comprovado
Brian descreve um resultado como definitivamente 2K ou melhor. Essa impressão de detalhe é válida como reação, mas não é uma medição técnica. O YouTube volta a comprimir o vídeo, e a captura do ecrã pode ter escalado o ficheiro.
A documentação confirma que o endpoint do fal.ai oferece 2K. Para confirmar o output, descarregue o MP4 original e verifique largura, altura, bitrate, frame rate e detalhe em movimento. Compare também com 768P usando o mesmo input e seed quando possível.
Uma imagem pode ter 2K de dimensões e ainda conter detalhe instável, blur temporal ou informação inventada. Resolução é apenas uma das dimensões da qualidade.
Quanto custa no fal.ai e na API direta
Em 3 de agosto de 2026, a página do fal.ai para MiniMax H3 image-to-video indica 0,26 dólares por segundo em 2K. Isso corresponde a 1,30 dólares por cinco segundos, 2,60 dólares por dez segundos e 3,90 dólares por 15 segundos. A imagem de entrada não acrescenta custo nessa página.
A tabela direta da MiniMax indica 0,13 dólares por segundo em 2K e 0,08 dólares por segundo em 768P. Na API direta, cinco segundos em 2K custam 0,65 dólares, dez custam 1,30 dólares e 15 custam 1,95 dólares, antes de inputs adicionais aplicáveis.
O fal.ai pode compensar a diferença com integração, infraestrutura, fila e experiência de desenvolvimento. Compare o custo do serviço completo, não apenas a tarifa por segundo. Para calcular custo por shot aprovado, some todas as tentativas e divida apenas pelos resultados que chegaram à montagem.
Realista não significa real, nem autorizado
Os testes incluem uma celebridade, rostos de clientes e uma criança. São precisamente os casos em que qualidade visual e responsabilidade precisam de ser avaliadas em conjunto.
Obtenha consentimento informado, confirme os termos do fornecedor, limite os dados carregados e defina quem pode guardar, editar e publicar o resultado. Para uma figura pública, não transforme reconhecimento numa alegação de apoio, atuação real ou uso comercial sem direitos.
Identifique conteúdo gerado ou alterado por IA quando o contexto puder induzir o público em erro. Guarde o input, prompt, output, versão do modelo e autorizações como parte do registo de produção.
Como transformar esta experiência num benchmark útil
Escolha seis inputs com dificuldades distintas: rosto, corpo inteiro, grupo, texto, movimento de câmara e interação física. Escreva um requisito observável por clip e não mude o prompt entre modelos.
Gere quatro tentativas por condição, com a mesma duração e resolução. Oculte o nome do modelo durante a avaliação. Pontue identidade, anatomia, fundo, física, aderência ao prompt, câmara, áudio, artefactos e possibilidade de uso sem correção.
Registe custo, latência, falhas, tentativas e tempo de pós-produção. O vencedor não é necessariamente o clip mais bonito. É o sistema que entrega mais shots aprovados por euro e por hora dentro do risco aceitável.
Workflow recomendado para usar H3 em produção
Comece com um frame limpo e suficientemente grande. Remova texto que deve permanecer editável, corrija mãos e objetos críticos e escolha uma composição que já conte a história antes do movimento.
Escreva o prompt em blocos: sujeito, ação, câmara, ambiente, elementos bloqueados e áudio. Para preservar uma peça gráfica, diga explicitamente que texto, logótipo, números e layout permanecem imóveis e idênticos.
Gere uma versão curta, faça revisão frame a frame e só depois aumente duração ou resolução. Guarde cada tentativa numa folha simples com prompt, configuração, custo, falhas e decisão. Se o output falhar a ação, corrija a coreografia em vez de premiar apenas a estética.
Veredito final
O MiniMax H3 sai deste teste como uma opção séria para image-to-video. O retrato, o gráfico e a ação de karaté mostram uma combinação convincente de detalhe e movimento, enquanto o portal expõe um limite de compreensão espacial que pode ser decisivo numa narrativa.
Brian tem razão em ficar entusiasmado e em considerar H3 para o seu workflow. A conclusão prudente é experimentar com materiais próprios, orçamento fechado e uma grelha de avaliação. Cinco clips escolhidos são um sinal, não uma taxa de sucesso.
Veja o vídeo completo incorporado para acompanhar as comparações visuais e dê crédito ao Creative AI Show. Depois use o pack de prompts abaixo para repetir o teste de forma mais mensurável.
Pack de prompts para testar MiniMax H3 image-to-video
Estes prompts transformam os cinco casos do vídeo num teste mais controlado. Substitua os campos entre parênteses, mantenha duração e resolução iguais entre modelos e guarde todas as tentativas, incluindo falhas.
Prompt pack credit: Creative AI Show.
Microexpressão num retrato
Testa emoção facial, estabilidade de identidade, dentes, olhos e textura da pele sem movimento excessivo de câmara.
Animate the supplied portrait into one continuous natural performance. The subject notices a close friend just off camera, smiles gently, then gives a short authentic laugh. Preserve facial identity, age, hairstyle, wardrobe, skin texture and background exactly. Natural eye blinks, subtle cheek and shoulder movement, realistic laugh lines, stable teeth and eyes. Locked camera, no zoom, no face morphing, no new objects, no text, no audio.
Fundo animado com informação bloqueada
Testa se o modelo consegue animar ambiente sem alterar texto, números, logótipo ou composição.
Create subtle premium motion only in the background of this graphic: slow light drift, restrained particles and gentle depth. Keep every letter, number, logo, icon, colour, line break, alignment and foreground object completely fixed and pixel-identical to the source image. No camera movement, no crop, no added text, no rewritten words, no object deformation, no audio.
Ação espacial através de um portal
Isola aderência ao verbo principal e impede o modelo de substituir a travessia por um portal que se aproxima.
One continuous wide shot. The character takes three clear steps forward, physically crosses through the centre of the stationary portal, disappears completely on the far side, and leaves the empty foreground visible for the final second. The portal remains fixed in the original position and size throughout. Wind moves the coat and dust naturally. Camera locked, no push-in, no portal moving toward the character, no cuts, no teleport before crossing, no new characters.
Retrato de grupo com identidade preservada
Testa múltiplos rostos, interação natural e estabilidade de mãos numa composição aprovada.
Animate this group portrait as a candid five-second celebration. Each person keeps the exact face, age, hairstyle, body position and clothing from the reference. They exchange small glances, smile naturally and make one restrained celebratory gesture. Preserve the number of people, hand anatomy, background, decorations, logos and composition. Locked camera, no face swapping, no duplicated limbs, no extra people, no text changes, no audio.
Stress test de artes marciais
Avalia anatomia, contacto, equilíbrio, roupa, objeto reativo e estabilidade do cenário.
Animate the athlete performing one controlled jab followed by one clean roundhouse kick to the existing punching bag. Maintain exact identity, clothing and body proportions. The bag reacts only after each impact and swings with believable weight. Feet maintain ground contact, joints bend naturally and the athlete returns to a balanced stance. Keep every background object fixed and unchanged. Locked camera, no cuts, no extra limbs, no warped hands or feet, no moving walls, no audio.
Scorecard cego para comparar modelos
Não é um prompt de geração, mas um guião pronto para avaliar H3, Kling, Veo ou outro modelo sem favorecer o nome.
Evaluate this anonymized clip from 1 to 10 on: prompt adherence, subject identity, facial stability, anatomy, background stability, physical plausibility, camera compliance, temporal detail, visible artifacts and readiness for use without correction. Cite one observable frame range for every deduction. Do not infer the model. Finish with PASS or FAIL against this requirement: (insert the single measurable action requested). Then estimate the minimum editing work required in minutes.
Video Timestamps
FAQ
O que é MiniMax H3?
É um modelo generativo multimodal da MiniMax para criar vídeo com contexto de texto, imagem, vídeo e áudio. A API oficial oferece 768P e 2K, clips de quatro a 15 segundos e áudio estéreo nativo.
MiniMax H3 e Hailuo 3.0 são o mesmo produto?
O vídeo e alguns fornecedores usam Hailuo 3.0 ao referir-se ao H3. Para integração técnica e preços, confirme sempre o identificador exato do modelo e do endpoint, porque a marca da interface pode diferir da API.
Onde Brian testou o modelo?
No fal.ai, através do endpoint MiniMax H3 image-to-video. A experiência e o preço desse fornecedor não são necessariamente iguais aos da API direta da MiniMax.
Quantos testes próprios aparecem no vídeo?
Cinco: retrato com riso, gráfico de cliente, cena com portal, composição de aniversário e fotografia de karaté. O clip inicial dos cavalos é um exemplo disponibilizado pelo fal.ai.
O teste prova que H3 é melhor do que Kling ou Veo?
Não. O vídeo contém uma comparação verbal, mas não usa os mesmos inputs, prompts, duração, resolução e número de tentativas em vários modelos.
Qual foi a falha mais clara?
Na cena de ficção científica, a personagem deveria entrar no portal. O resultado move ou materializa o portal diante da personagem, produzindo uma imagem interessante sem cumprir a ação solicitada.
O texto do gráfico ficou intacto?
Visualmente parece estável na reprodução mostrada, mas o vídeo não executa OCR, comparação de píxeis nem inspeção ampliada. Para publicação, confirme cada letra e número ou reconstrua o texto como camada editável.
O vídeo testa o áudio nativo do H3?
Não. Brian afirma que não incluiu prompts de áudio. O review não permite avaliar voz, música, efeitos, ambiente ou sincronização labial.
Os resultados estão realmente em 2K?
O endpoint suporta 2K, mas a reprodução comprimida do YouTube não comprova a resolução efetiva nem a preservação de detalhe. É necessário inspecionar o MP4 original e os seus metadados.
Quanto custa H3 image-to-video no fal.ai?
A 3 de agosto de 2026, a página indica 0,26 dólares por segundo em 2K. São 1,30 dólares por cinco segundos, 2,60 por dez e 3,90 por 15, antes de contar repetições.
Quanto custa na API direta da MiniMax?
A tabela oficial consultada indica 0,13 dólares por segundo em 2K e 0,08 em 768P. Um clip de cinco segundos em 2K custa 0,65 dólares, antes de referências adicionais aplicáveis.
Porque o fal.ai custa mais do que a API direta?
Um fornecedor pode acrescentar infraestrutura, integração, fila, observabilidade e conveniência. A diferença de tarifa deve ser comparada com o custo total de desenvolvimento e operação do workflow.
É seguro animar fotografias de clientes?
Só depois de confirmar consentimento, finalidade, termos do fornecedor, retenção, acesso e autorização de publicação. Evite carregar material que não tem permissão para processar em serviços externos.
Posso usar a imagem de uma celebridade?
Um teste privado não cria direitos de publicação ou exploração comercial. Semelhança, voz, publicidade e contexto podem exigir consentimento e revisão jurídica, sobretudo quando o resultado parece uma atuação real.
Como devo comparar H3 com outros geradores?
Use os mesmos inputs e prompts, quatro tentativas por condição, duração e resolução equivalentes, avaliação cega e uma grelha que separe estética, aderência, identidade, anatomia, fundo, áudio, custo e latência.
Qual é o veredito deste artigo?
H3 é uma opção promissora e suficientemente forte para entrar num workflow de testes. Os cinco exemplos não demonstram uma liderança absoluta, mas mostram capacidades úteis e um limite concreto de aderência ao prompt.
--sources and credits
- Creative AI Show: vídeo original no YouTube
- Creative AI Show: canal no YouTube
- MiniMax: anúncio oficial do H3
- MiniMax API V2: criar vídeo com H3
- MiniMax: preços pay-as-you-go
- fal.ai: visão geral do MiniMax H3
- fal.ai: MiniMax H3 image-to-video
- fal.ai: documentação da API image-to-video
- MiniMax H3: model card oficial no Hugging Face
- MiniMax H3 Community License
- ComfyUI: workflows MiniMax H3
- JQ VISIONS: guia técnico MiniMax H3