Pesquisadores demonstraram que modelos de linguagem de código aberto e baixo custo conseguem avaliar provas matemáticas com precisão similar a sistemas de ponta. O estudo, publicado na base arXiv, aponta que o uso dessas ferramentas reduz em até 100 vezes os gastos operacionais em comparação a modelos avançados como Claude Opus 4.7 e Gemini 3.1 Pro.
Eficiência em modelos de menor porte
A pesquisa testou os modelos GPT-OSS 120B, DeepSeek-V4 Flash e Gemma-4 31B utilizando uma amostra de 200 instâncias do IMO-GradingBench. Os resultados indicam que a performance desses sistemas em decisões de aprovação ou reprovação é estatisticamente indistinguível das opções de mercado mais caras. A avaliação considerou critérios como a prova do candidato, a resposta correta e a rubrica de correção humana.
Consenso e validação dos resultados
Ao ampliar a análise para um banco de dados completo de 1000 instâncias, os autores avaliaram diferentes regras de consenso para melhorar a confiabilidade. A adoção do critério de concordância unânime, no qual todos os três modelos precisam aprovar a prova, apresentou a maior precisão e estabilidade nos testes realizados. A descoberta foi detalhada em um documento de 7 páginas que inclui 5 figuras e 4 tabelas.
O que ainda não foi divulgado
- A regra de concordância unânime foi identificada post-hoc, o que exige testes independentes para confirmação.
- A notícia sobre o método apareceu em 1 fonte identificada até o momento, totalizando registros na base arXiv nos Estados Unidos.