OCTO+

Google lança Gemini 3.7 Flash; teste de agente mostra desempenho misto frente ao 3.6

Novo modelo chega três semanas após o 3.6 com ganhos em benchmarks de código, mas avaliação prática com SWE-bench revela comportamento mais cauteloso e falha na

14 de ago., 12:18 6 fontes · 2 países Modelos
ModelosGoogle
Logotipo do Gemini em fundo escuro com elementos de código Foto: Markus Winkler / Pexels

O Google anunciou o Gemini 3.7 Flash em 14 de agosto de 2026, apenas três semanas após o lançamento do 3.6 Flash. O novo modelo traz melhorias declaradas em benchmarks de codificação e agentes, mas uma avaliação independente em ambiente do tipo SWE-bench mostrou que o 3.7 Flash falhou na primeira tentativa de uma tarefa complexa de múltiplos arquivos, enquanto o 3.6 Flash a resolveu de primeira.

Especificações e acesso

Segundo o blog oficial citado pela publicação técnica japonesa Qiita, o Gemini 3.7 Flash foca em engenharia de software, trabalho de conhecimento e desenvolvimento web. Os benchmarks divulgados mostram avanços: FrontierCode 1.1 Main subiu de 34,4% para 43,6%; DeepSWE v1.1, de 49,0% para 65,3%; WebDev Arena Elo foi de 1538 para 1588. Em processamento de documentos complexos (GDP.pdf), a precisão dobrou de 22,0% para 34,0%, e no AutomationBench saltou de 17,0% para 30,4%.

O preço promocional vale até 31 de dezembro de 2026: US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de saída. A partir de 1º de janeiro de 2027, aplicam-se os valores padrão de US$ 1,50 e US$ 7,50. O acesso empresarial ocorre via Gemini Enterprise Agent Platform e Gemini Enterprise app; desenvolvedores usam Google Antigravity, AI Studio e Android Studio Gemini API; usuários Pro e Ultra acessam pelo Gemini Spark.

Teste prático com issues reais de open source

O autor da Qiita construiu um sandbox no Google Cloud inspirado no SWE-bench da Universidade de Princeton, usando issues reais do projeto sqlfluff. Foram aplicadas medidas contra vazamento de dados: checkout no commit base via GitHub API, instância única no Cloud Run, remoção do histórico .git e validação final com testes do PR oficial (Golden Commit).

Gráfico comparativo de desempenho entre modelos de IA em tarefas de programação
Foto: Lukas Blazek / Pexels

Na primeira tarefa (criação de arquivo único, issue #2392), ambos os modelos passaram: 3.6 Flash em 10 turnos e ~12 minutos; 3.7 Flash em 10 turnos e ~18 minutos, com abordagens diferentes do PR oficial.

Na segunda tarefa (correção de bug em três arquivos, issue #478), o 3.6 Flash resolveu em 15 turnos (~14 min). O 3.7 Flash na primeira execução gastou todos os 15 turnos apenas explorando, sem editar código, e falhou. Na segunda execução, com limite estendido a 25 turnos, completou a implementação nos turnos 22-23 e passou (~21 min). Ambos chegaram à mesma solução: implementar regras de aritmética ausentes no parser e conectá-las à cláusula BETWEEN.

O que ainda não foi divulgado

Apurado em 6 fontes

Ars Technica (Estados Unidos) · Tecnoblog (60) · AI News Minute (Estados Unidos) · Digit (Índia) · SiliconANGLE (Estados Unidos) · #ai

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)