OCTO+

DeepSeek libera primeiro modelo de visão V4 com licença MIT

Modelo open-source aceita imagens, tem desempenho de agente multimodal próximo ao Opus-4.8 e está disponível no Hugging Face.

31 de ago., 16:09 10 fontes · 8 países Modelos Pesquisa
ModelosDeepSeekHugging FaceMiniMax
Servidor de inteligência artificial em sala de dados Foto: panumas nikhomkhai / Pexels

DeepSeek lançou em 31 de agosto de 2026 o modelo V4-Flash-Vision-Exp, primeiro de sua linha com entrada de imagem, disponibilizado sob licença MIT no Hugging Face.

O anúncio foi feito pela publicação chinesa IT Home em 31 de agosto de 2026. Segundo a nota, o código-fonte do modelo, o tokenizer, a referência de implementação de codificação de prompt e uma versão mínima de inferência em PyTorch foram publicados. Esses arquivos abrangem componentes como o codificador de visão, o Aligner, o DFlash Attention, a arquitetura MoE, os Hyper‑Connections e o módulo DSpark.

Licença e disponibilidade

O modelo foi liberado sob a Licença MIT, que permite uso, modificação e distribuição comercial e não comercial sem restrições significativas. Todos os recursos mencionados estão acessíveis no repositório oficial do Hugging Face, facilitando a integração por desenvolvedores e pesquisadores.

Capacidades de visão

O V4-Flash-Vision-Exp aceita imagens nos formatos JPEG, PNG, GIF e WebP. Com essas entradas ele pode gerar descrições textuais de cenas, identificar e transcrever texto presente em capturas de tela e realizar análise simples de gráficos e diagramas. Essas funções são possíveis graças ao codificador de visão e ao Aligner incluídos no pacote liberado.

Desempenho em agente multimodal

Em tarefas que envolvem apenas texto — como raciocínio lógico, agente baseado em prompts e recuperação de conhecimento mundial — o modelo apresenta desempenho equivalente ao do V4‑Flash formal, segundo a IT Home. Já em benchmarks específicos de compreensão visual para agentes, o V4‑Flash‑Vision‑Exp mostrou melhoria significativa em relação ao V4‑Flash, aproximando‑se da capacidade de agente multimodal do modelo Opus‑4.8 citado pela mesma fonte.

Ilustração de análise de visão computacional em tela
Foto: Rahul Pandit / Pexels

Comparação com modelos de trabalho chineses

Uma análise publicada no Habr pela BotHub avaliou quatro modelos considerados de baixo custo: MiniMax M3, LongCat 2.0, MiMo‑v2.5‑Pro e DeepSeek V4 Pro. A seleção desses modelos foi feita com base no preço por token, de modo que todos ficassem dentro da mesma faixa de custos, típica de sistemas que processam cerca de cem mil tokens por mês. Nesse contexto, apenas um dos quatro modelos aceita entrada de imagem, identificado como o DeepSeek V4 Pro.

Metodologia dos testes

Os testes realizados pela BotHub consistiram em doze tarefas cotidianas: programação, contexto longo, estilo, sumarização, comparação de documentos, atenção intermediária, análise de dados, análise de esquemas, lógica, padronização, alucinações e segurança. Os prompts foram mantidos idênticos em todas as rodadas, a temperatura foi fixada em 0,7 e a busca na internet foi desativada. O custo computacional foi medido em CAPS, a moeda interna do BotHub, onde um rublo corresponde a 6 370 CAPS. O vencedor de cada comparação foi escolhido de forma subjetiva pelos avaliadores, conforme afirmado no artigo.

O que ainda não foi divulgado

Alguns detalhes específicos não foram divulgados nas fontes analisadas.

Apurado em 10 fontes

IT之家 (IT Home) (China) · Habr (Rússia) · The New Stack (Estados Unidos)

ver as 10 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)