O modelo Grok 4.6, desenvolvido pela SpaceXAI, atingiu 61 pontos no Artificial Analysis Intelligence Index, consolidando a empresa no nível de desempenho de modelos como o GPT-5.6 Sol. O resultado marca um avanço de 5 pontos em relação à versão anterior, o Grok 4.5, e reforça o retorno da companhia ao patamar competitivo dos principais modelos de inteligência artificial do mercado.
Desempenho e capacidades técnicas
Segundo a Artificial Analysis, o Grok 4.6 apresenta um desempenho especialmente robusto em tarefas agenticas. No benchmark GDPval-AA v2, o modelo obteve um Elo de 1753, resultado superado apenas pelo Claude Opus 5. Em testes específicos, a ferramenta demonstrou eficácia comparável aos líderes de mercado:
- 50,7% de aproveitamento em atendimento ao cliente via 𝜏³-Banking, situando-se entre os dois melhores modelos;
- 88,4% em tarefas de software via Terminal-Bench v2.1;
- Elo de 1577 no teste AA-Briefcase, que avalia trabalho de conhecimento de longo prazo.
O modelo mantém a janela de contexto de 500 mil tokens, inalterada em relação à iteração anterior.
Eficiência de custos e mercado
A estrutura de preços do Grok 4.6 permanece em US$ 2 para cada 1 milhão de tokens de entrada e US$ 6 para a mesma quantidade de saída. De acordo com a análise, manter o custo inalterado enquanto se obtém ganhos de inteligência é uma prática atípica no cenário atual, onde melhorias costumam ser acompanhadas de aumentos nos valores. Comparativamente, o custo por tarefa do Grok 4.6 foi mensurado em US$ 0,84, valor significativamente inferior ao de concorrentes diretos que ocupam faixas de inteligência similares, como o Claude Opus 5 e o GPT-5.6 Sol. Além disso, o modelo se destaca pela eficiência operacional, concluindo tarefas complexas de conhecimento com um número menor de turnos e processamento de tokens em relação a outros modelos de fronteira.


