Black Forest Labs Lança Flux 3, Gerando Vídeos com Áudio Nativo de Até 20 Segundos

Black Forest Labs Lança Flux 3, Gerando Vídeos com Áudio Nativo de Até 20 Segundos
A empresa alemã Black Forest Labs (BFL) lançou o Flux 3, um modelo multimodal que gera vídeos de até 20 segundos com áudio nativo, uma novidade para a companhia. O modelo, que aprende com imagens, vídeos e áudio simultaneamente, demonstrou desempenho superior em testes iniciais contra concorrentes, sendo preferido em 93% das comparações com Luma Ray 3.2. Além da geração de vídeo, o Flux 3 também está sendo aplicado em tarefas de robótica e promete melhorias na geração de imagens.
Flux 3 Lidera em Geração de Vídeo com Áudio Nativo
A empresa alemã de inteligência artificial Black Forest Labs (BFL) acaba de lançar o Flux 3, um modelo de fundação multimodal que estabelece um novo patamar ao gerar vídeos de até 20 segundos de duração com áudio nativo. Esta é uma capacidade inédita para a BFL, que promete integrar de forma mais coesa os elementos visuais e sonoros, resultando em produções mais realistas e imersivas.
Em avaliações preliminares conduzidas pela própria BFL, utilizando clipes de 10 segundos em resolução 720p, o Flux 3 demonstrou superioridade sobre diversos concorrentes. Foi preferido em 93% das comparações com o Luma Ray 3.2, em 77% contra o Runway Gen-4.5 e em 69% em relação ao Grok Imagine Video. A vantagem se manteve em testes mais acirrados, sendo preferido em 60% das vezes contra o Kling v3 Pro, 59% contra o Happy Horse v1, 57% contra o Happy Horse 1.1, e 52% tanto contra o Seedance 2.0 quanto contra o Gemini Omni Flash. A BFL ressalta que esses resultados são preliminares e aguardam validação independente, mas o desempenho sugere que o Flux 3 pode se posicionar entre os principais modelos de vídeo do mercado.
A Abordagem Multimodal e Suas Vantagens
O Flux 3 é descrito pela BFL como um passo em direção à “inteligência visual do mundo real”, que a empresa define como modelos capazes de “perceber, prever e agir em ambientes físicos e digitais”. A BFL argumenta que nenhuma modalidade isolada é capaz de capturar a realidade por completo: imagens revelam a estrutura espacial, vídeos mostram como ela muda ao longo do tempo, e o áudio pode expor conexões entre eventos mecânicos e os sons que produzem. Treinar o modelo simultaneamente em todas as três modalidades permite que elas preencham lacunas umas para as outras, fornecendo ao modelo mais informações do que o treinamento em cada modalidade separadamente.
Além da inovação do áudio nativo, o Flux 3 oferece funcionalidades abrangentes, incluindo texto para vídeo, imagem para vídeo, vídeo para vídeo, transições baseadas em keyframes, diálogo multilíngue e links guiados por agentes para sequências mais longas de múltiplos planos. A BFL destaca a capacidade do modelo em gerar expressões faciais humanas com alta qualidade e de corresponder sons a eventos físicos de maneira precisa.
Expansão para Robótica e Geração de Imagens
As ambições da BFL com o Flux 3 vão além da geração de vídeo. A empresa também está desenvolvendo o Flux-mimic, um modelo de ação de vídeo para aplicações em robótica, que já está sendo testado em tarefas de produção na Audi. Esta colaboração com a Mimic Robotics busca explorar como a compreensão do mundo pelo modelo pode prever e executar ações complexas em ambientes físicos.
No campo da geração de imagens, a BFL espera que o Flux 3 também traga melhorias significativas, especialmente para prompts mais complexos e para a renderização precisa de texto em vários idiomas. O lançamento do Flux 3 Image em acesso antecipado está previsto para as próximas semanas.
Tecnologia e Acesso Futuro
O Flux 3 é construído com base no Self-Flow, a abordagem da BFL que ensina um modelo a gerar e compreender conteúdo simultaneamente. Um transformador multimodal utiliza componentes dedicados para converter imagens, vídeos e áudio em uma representação interna compartilhada, que depois é convertida de volta em saídas. Um componente específico para ações forma a base para as aplicações em robótica. A BFL afirma que esse processo de aprendizado unificado entrega resultados superiores ao método de correspondência de fluxo anteriormente padrão, tanto na qualidade da geração quanto na compreensão do mundo físico pelo modelo.
A BFL planeja um lançamento faseado de todas as capacidades do Flux 3, com fases de acesso antecipado para feedback e testes de segurança. Enquanto o Flux 3 Video já está disponível, o Flux 3 Image chegará em breve, e a previsão de ações será inicialmente oferecida através de parceiros selecionados. A empresa também pretende liberar o acesso de peso aberto (open-weight) ao 'backbone' multimodal sob o nome de “Flux 3 Dev”. A longo prazo, a BFL está desenvolvendo modelos de próxima geração que visam combinar percepção, ação e previsão de linguagem em um único modelo, consolidando sua visão de inteligência artificial para o mundo real.Fonte: The Decoder (https://the-decoder.com/flux-3-generates-videos-with-native-audio-up-to-20-seconds-long-a-first-for-black-forest-labs/)



Comentarios
Troque ideia com outros leitores, responda em contexto e mantenha a conversa útil.
Faça login para comentar
Entre com sua conta Google para participar da discussão com nome e avatar.
Os comentários já publicados continuam visíveis mesmo sem login.