Estudo acadêmico publicado no arXiv revela que grandes modelos de linguagem (LLMs) demonstram políticas extremas quando submetidos a simulações de corridas de desenvolvimento de IA. A pesquisa, que circulou em 7 campos distintos de submissão na plataforma, aponta que o comportamento estratégico desses modelos é inconsistente e diverge das respostas humanas observadas em dilemas de segurança.
Limitações na tomada de decisão estratégica
Para avaliar a performance dos agentes, os pesquisadores implementaram um sistema de auditoria que testou a compreensão de regras, o rastreamento de estados e o cálculo de recompensas. O experimento revelou que, embora os modelos consigam recordar as diretrizes do jogo, eles falham em realizar cálculos de recompensa esperada ou no rastreamento consistente do cenário de competição. Mudanças simples na forma como os dados são apresentados alteram drasticamente as ações futuras das máquinas, mesmo sem qualquer modificação nas regras do jogo.
Diferenças entre modelos e comportamento humano
A análise comparativa entre 7 modelos diferentes mostrou que as taxas agregadas de comportamento escondem disparidades profundas na sequência de ações e na resposta aos oponentes. Diferente dos humanos, que demonstram maior diversidade de estratégias, os LLMs tendem a adotar políticas extremas. Os autores do trabalho destacam que o desempenho em competições com três a cinco participantes varia conforme o modelo, sem seguir um padrão único de resposta ao aumento do número de concorrentes.
O que ainda não foi divulgado
- Os nomes específicos dos 7 modelos de fronteira testados no estudo não foram listados.
- Não foram detalhados os prompts ou configurações exatas de decodificação que levaram a cada resultado.
- O material não apresenta um plano de correção para as falhas de cálculo identificadas nos modelos.