Deepseek Lança Modelo de Visão Flash Experimental que RIVALIZA com Opus 4.8 em Benchmarks de Agentes
A Deepseek lançou o Deepseek-V4-Flash-Vision-Exp, um modelo experimental multimodal que adiciona compreensão de imagem às capacidades de texto do V4-Flash. Em seus benchmarks internos, o modelo se aproxima e, por vezes, supera o desempenho do Opus 4.8 em tarefas de agente.

Deepseek Impulsiona Capacidades Multimodais com Novo Modelo Flash Vision
A Deepseek, uma proeminente empresa chinesa de inteligência artificial, anunciou o lançamento do Deepseek-V4-Flash-Vision-Exp, um modelo experimental multimodal que expande as capacidades de texto do seu V4-Flash com a adição de uma sofisticada compreensão de imagens. Segundo informações divulgadas pela própria companhia, em seus benchmarks internos projetados para avaliar tarefas de agentes, o novo modelo não apenas se aproxima, mas em alguns cenários, chega a superar o desempenho do renomado Opus 4.8.
Esta nova iteração representa uma evolução significativa, estendendo o Deepseek-V4-Flash com poderosos recursos de processamento de imagem. Conforme destacado pela Deepseek, essa integração é feita enquanto se mantém intacta a performance exemplar do modelo base em raciocínio lógico e no vasto conhecimento do mundo. O portal The Decoder, que cobriu o lançamento, apurou que nos testes internos da Deepseek, a variante de visão obteve pontuações consistentemente próximas às do Opus 4.8, um dos modelos mais avançados do mercado.
A estratégia da Deepseek é posicionar o V4-Flash-Vision-Exp para fluxos de trabalho de agentes visuais, um segmento em crescente demanda no universo da IA. O modelo foi meticulosamente desenvolvido para se integrar de forma fluida a diferentes frameworks de agentes, facilitando a combinação da compreensão visual com o uso eficiente de ferramentas. Na prática, essa capacidade multimodal se traduz em funcionalidades robustas: o modelo pode descrever imagens com precisão, extrair texto de capturas de tela e até analisar diagramas complexos. Sua versatilidade se estende ao suporte de múltiplos formatos de imagem, incluindo JPEG, PNG, GIF e WebP, com uma inteligência notável para determinar o tipo de arquivo a partir do seu conteúdo real, e não apenas pelo nome ou tipo MIME declarado, conforme detalhado nas documentações da API.
O lançamento foi acompanhado de uma comunicação ativa nas redes sociais. Um post no X, publicado pela conta oficial da DeepSeek, detalhou as capacidades e o desempenho do novo modelo, gerando burburinho na comunidade de IA.
A compatibilidade é um ponto forte da nova ferramenta, que funciona perfeitamente com as APIs de Chat Completions e Responses da OpenAI, além do endpoint Messages da Anthropic. Para complementar essa interoperabilidade, a Deepseek também liberou a versão 0.1.1 de seu framework Harness, que já oferece suporte completo e nativo ao Deepseek-V4-Flash-Vision-Exp, simplificando a implementação para os desenvolvedores.
No que tange à forma de interação, desenvolvedores têm flexibilidade para enviar imagens ao modelo de três maneiras distintas. A primeira opção é incorporá-las diretamente, utilizando a codificação Base64. Alternativamente, é possível apontar para URLs publicamente acessíveis, com um limite de tamanho de até 32 MiB. Uma terceira e inovadora alternativa é a nova e gratuita API de Arquivos, que permite o upload de um arquivo uma única vez e seu referenciamento por um ID exclusivo em múltiplas requisições, suportando arquivos de até 64 MiB.
Para otimizar o consumo de tokens e, consequentemente, os custos, um campo opcional denominado "detail" permite que as imagens sejam redimensionadas para 512 x 512 pixels. Essa funcionalidade é particularmente útil em cenários onde detalhes visuais finos não são cruciais, resultando em uma significativa economia de recursos. Independentemente disso, o modelo realiza uma normalização automática das imagens para aproximadamente 800 x 800 pixels, ajustando-se à proporção original antes do processamento. É importante ressaltar que, independentemente da resolução inicial, cada imagem processada custa no máximo 384 tokens, e a precificação geral segue as mesmas taxas já estabelecidas para o modelo V4-Flash.
A robustez do sistema de processamento de imagens é evidenciada pela capacidade de uma única requisição incluir até 600 imagens. O comprimento máximo da borda para cada imagem é de 8.192 pixels por lado; contudo, esse limite é ajustado para 4.096 pixels quando uma requisição engloba 15 ou mais imagens. Uma restrição importante a ser observada é que as imagens podem ser incluídas exclusivamente em mensagens de usuário, garantindo um fluxo de interação claro e otimizado para as aplicações de agente.
Achou um erro nesta matéria? Avise a redação — corrigimos e registramos a data da correção.



Comentarios
Troque ideia com outros leitores, responda em contexto e mantenha a conversa útil.
Faça login para comentar
Entre com sua conta Google para participar da discussão com nome e avatar.
Os comentários já publicados continuam visíveis mesmo sem login.