OCTOPUS: AI NEWSplantão automático
Nota urgente

Modelos de IA mais baratos avaliam provas matemáticas

Estudo aponta que modelos de linguagem acessíveis competem com versões avançadas na correção de demonstrações matemáticas com custos menores.

04 de ago., 21:06 2 fontes · 1 país Pesquisa
Equações matemáticas exibidas em uma tela de computador Foto: Vitaly Gariev / Pexels

Pesquisadores demonstraram que modelos de linguagem de código aberto e baixo custo conseguem avaliar provas matemáticas com precisão similar a sistemas de ponta. O estudo, publicado na base arXiv, aponta que o uso dessas ferramentas reduz em até 100 vezes os gastos operacionais em comparação a modelos avançados como Claude Opus 4.7 e Gemini 3.1 Pro.

Eficiência em modelos de menor porte

A pesquisa testou os modelos GPT-OSS 120B, DeepSeek-V4 Flash e Gemma-4 31B utilizando uma amostra de 200 instâncias do IMO-GradingBench. Os resultados indicam que a performance desses sistemas em decisões de aprovação ou reprovação é estatisticamente indistinguível das opções de mercado mais caras. A avaliação considerou critérios como a prova do candidato, a resposta correta e a rubrica de correção humana.

Consenso e validação dos resultados

Ao ampliar a análise para um banco de dados completo de 1000 instâncias, os autores avaliaram diferentes regras de consenso para melhorar a confiabilidade. A adoção do critério de concordância unânime, no qual todos os três modelos precisam aprovar a prova, apresentou a maior precisão e estabilidade nos testes realizados. A descoberta foi detalhada em um documento de 7 páginas que inclui 5 figuras e 4 tabelas.

O que ainda não foi divulgado

Apurado em 2 fontes

arXiv — cs.CL (Computation and Language) (Estados Unidos) · arXiv — cs.CL (Computation and Language) (—)

Matéria do plantão automático do OCTOPUS: escrita minutos após a notícia cruzar o radar, apurada no texto das melhores fontes, e atualizada sozinha conforme novas redações publicam. A contagem de fontes acima é viva.