A DeepSeek anunciou o V4 Flash 0731, um novo modelo de pesos abertos que supera a performance do seu antecessor, o V4 Pro Preview, em tarefas específicas de agentes. O modelo mantém a mesma arquitetura de 284 bilhões de parâmetros, com 13 bilhões ativados por token, focando em melhorias via pós-treinamento em vez de expansão de escala.
Eficiência operacional e custo
Segundo o portal Dev.to, a principal inovação deste lançamento não está na arquitetura, mas no processo de treinamento. Ao utilizar apenas 13 bilhões de parâmetros ativados, o V4 Flash exige um custo computacional significativamente menor que o V4 Pro, que opera com 49 bilhões de parâmetros ativados. Essa configuração permite que empresas reduzam gastos operacionais ao executar agentes de IA em escala, mantendo capacidade de resposta compatível com fluxos de trabalho avançados.
O modelo utiliza licença MIT, permitindo auto-hospedagem e integração simplificada via APIs compatíveis com o formato da OpenAI. A DeepSeek também incluiu suporte ao DSpark para decodificação especulativa, funcionalidade que promete elevar a velocidade de inferência em até 85% em ambientes autohospedados.
Resultados e verificações
Os números reportados pela desenvolvedora indicam pontuações de 82,7 no Terminal-Bench 2.1, 54,4 no DeepSWE e 70,3 no Toolathlon-Verified. Entretanto, o cenário de testes ainda passa por validação externa. O Reddit aponta que uma avaliação independente realizada com 445 testes no Terminal-Bench 2.1 registrou uma pontuação de 82,7%, enquanto análises do Artificial Analysis, citadas pelo Dev.to, encontraram uma diferença de 3 pontos em relação aos dados internos da DeepSeek.
O que ainda não foi divulgado
- A metodologia completa do "DeepSeek Harness minimal mode" utilizado nos testes internos não foi publicada.
- A precisão final dos resultados em benchmarks de agentes após processos de verificação independente por terceiros ainda aguarda confirmação definitiva.
- Detalhes sobre o impacto específico do desempenho em tarefas de latência crítica em produção em larga escala não foram detalhados.


