O FrontierFinance, um novo benchmark de código aberto, foi apresentado para medir a inteligência de agentes de IA em fluxos de trabalho reais de análise de investimentos. A ferramenta utiliza 220 consultas elaboradas por especialistas e 11.543 rubricas com atribuição de fontes para cobrir seis casos de uso cruciais no setor.
Limitações dos benchmarks atuais
Segundo os autores do estudo publicado no arXiv em 12 de agosto de 2026, os benchmarks existentes falham ao focar apenas na extração de dados financeiros, uma tarefa considerada saturada para os modelos atuais. O FrontierFinance busca capturar a complexidade do trabalho de um investidor, oferecendo um teste mais amplo e difícil para avaliar sistemas de IA que exigem respostas abertas e detalhadas.
Desempenho dos modelos testados
A avaliação dos modelos revelou que a infraestrutura das ferramentas tem um impacto superior ao do modelo isolado na qualidade e eficiência. Os resultados apontam os seguintes desempenhos:

- O sistema interno da Samaya lidera a avaliação com 56,0% de precisão.
- O modelo Claude Fable 5 alcançou 49,2%, com um custo aproximadamente 2,2 vezes maior que o sistema da Samaya.
- O Kimi K3, classificado como o melhor modelo de pesos abertos, obteve 46,4%, apresentando um custo 4,5 vezes menor que o melhor modelo proprietário.
O estudo indica que as áreas de "Screening Discovery" e "Sector/Industry Macro" permanecem como os casos de uso mais desafiadores, com os melhores sistemas atingindo taxas de sucesso limitadas a 33% e 39%, respectivamente.
O que ainda não foi divulgado
O material apresenta os dados, o conjunto de testes e o código de avaliação como públicos, mas não detalhou futuras atualizações ou a incorporação de novos casos de uso específicos para além dos seis já estabelecidos pelos pesquisadores.


