O Google anunciou o Gemini 3.7 Flash em 14 de agosto de 2026, apenas três semanas após o lançamento do 3.6 Flash. O novo modelo traz melhorias declaradas em benchmarks de codificação e agentes, mas uma avaliação independente em ambiente do tipo SWE-bench mostrou que o 3.7 Flash falhou na primeira tentativa de uma tarefa complexa de múltiplos arquivos, enquanto o 3.6 Flash a resolveu de primeira.
Especificações e acesso
Segundo o blog oficial citado pela publicação técnica japonesa Qiita, o Gemini 3.7 Flash foca em engenharia de software, trabalho de conhecimento e desenvolvimento web. Os benchmarks divulgados mostram avanços: FrontierCode 1.1 Main subiu de 34,4% para 43,6%; DeepSWE v1.1, de 49,0% para 65,3%; WebDev Arena Elo foi de 1538 para 1588. Em processamento de documentos complexos (GDP.pdf), a precisão dobrou de 22,0% para 34,0%, e no AutomationBench saltou de 17,0% para 30,4%.
O preço promocional vale até 31 de dezembro de 2026: US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de saída. A partir de 1º de janeiro de 2027, aplicam-se os valores padrão de US$ 1,50 e US$ 7,50. O acesso empresarial ocorre via Gemini Enterprise Agent Platform e Gemini Enterprise app; desenvolvedores usam Google Antigravity, AI Studio e Android Studio Gemini API; usuários Pro e Ultra acessam pelo Gemini Spark.
Teste prático com issues reais de open source
O autor da Qiita construiu um sandbox no Google Cloud inspirado no SWE-bench da Universidade de Princeton, usando issues reais do projeto sqlfluff. Foram aplicadas medidas contra vazamento de dados: checkout no commit base via GitHub API, instância única no Cloud Run, remoção do histórico .git e validação final com testes do PR oficial (Golden Commit).

Na primeira tarefa (criação de arquivo único, issue #2392), ambos os modelos passaram: 3.6 Flash em 10 turnos e ~12 minutos; 3.7 Flash em 10 turnos e ~18 minutos, com abordagens diferentes do PR oficial.
Na segunda tarefa (correção de bug em três arquivos, issue #478), o 3.6 Flash resolveu em 15 turnos (~14 min). O 3.7 Flash na primeira execução gastou todos os 15 turnos apenas explorando, sem editar código, e falhou. Na segunda execução, com limite estendido a 25 turnos, completou a implementação nos turnos 22-23 e passou (~21 min). Ambos chegaram à mesma solução: implementar regras de aritmética ausentes no parser e conectá-las à cláusula BETWEEN.
O que ainda não foi divulgado
- Resultados em mais tarefas ou repositórios além do sqlfluff
- Comparação com modelos concorrentes (Claude, GPT-4o) no mesmo ambiente
- Detalhes da arquitetura ou mudanças de treinamento do 3.7 Flash
- Disponibilidade geral (GA) e SLA para uso em produção


