OCTO+

SpaceXAI lança Grok 4.6 focado em agentes de longa duração

SpaceXAI apresenta Grok 4.6, empatando com GPT-5.6 Sol Max no ranking global e introduzindo métricas de eficiência para agentes autônomos.

13 de ago., 04:47 4 fontes · 2 países Modelos Produto
ModelosxAIMoonshot
Linhas de código de programação em uma tela escura simbolizando o desenvolvimento de software por IA Foto: Markus Spiske / Pexels

A SpaceXAI lançou o Grok 4.6, seu novo modelo de inteligência artificial de fronteira, que atingiu 61 pontos no Intelligence Index da Artificial Analysis. O desempenho coloca o sistema empatado com o GPT-5.6 Sol Max na terceira posição do ranking global, superando o Kimi K3 da Moonshot AI. A atualização prioriza agentes de longa duração, desenvolvimento de software e uma reestruturação na eficiência de custos para fluxos de trabalho complexos.

Arquitetura de treinamento e benchmarks técnicos

De acordo com a DigitalToday, o Grok 4.6 foi desenvolvido a partir de um treinamento preliminar mais longo que o da versão 4.5. A SpaceXAI utilizou ajuste fino supervisionado (SFT) com dados regenerados pelo Grok 4.5 e aplicou aprendizado por reforço em domínios específicos, incluindo otimização de kernel, desenvolvimento web e design assistido por computador (CAD). O modelo demonstrou avanços em engenharia de software, atingindo 65,9% no DeepSWE v1.1 e 26% no Terminal Bench v3.0, superando o Grok 4.5 High neste último quesito.

O TechOrange destacou que a inteligência do modelo é medida por uma métrica composta de nove indicadores. Embora tenha empatado com o GPT-5.6 Sol Max, o Grok 4.6 ainda permanece atrás do Claude Opus 5 e do Fable 5 no índice geral. Em tarefas que exigem o uso de navegadores e ferramentas de busca, como o teste APEX-Agents, o modelo subiu de 47,1% para 57,5%, superando ligeiramente os 56,7% do GPT-5.6 Sol Max, conforme os dados divulgados pela empresa.

O que cada mercado destacou

A cobertura internacional divergiu nos ângulos de análise sobre o impacto do novo modelo. A VentureBeat, dos Estados Unidos, focou na mudança de comportamento dos agentes, que agora realizam verificações autônomas de seus próprios resultados antes de avançar para etapas seguintes em tarefas longas. A publicação ressaltou que a evidência atual comprova o progresso do Grok 4.6 em relação à sua versão anterior, mas não garante superioridade total sobre todos os modelos de topo em todas as categorias.

A imprensa sul-coreana, representada pela DigitalToday, enfatizou a estratégia de distribuição e infraestrutura, mencionando que o Grok 4.6 está disponível via API e parceiros como OpenRouter, Vercel e Cloudflare. Já o TechOrange, de Taiwan, analisou o lançamento sob a ótica da viabilidade corporativa, apontando que a SpaceXAI está forçando o mercado a olhar para o custo total de uma tarefa em vez do preço isolado por milhão de tokens.

Representação de infraestrutura de nuvem moderna com luzes e conexões de dados
Foto: Sergei Starostin / Pexels

Eficiência de custos e agentes autônomos

A análise da Artificial Analysis, citada pela VentureBeat e pelo TechOrange, introduziu a métrica de custo por tarefa para comparar os modelos. Em testes práticos de fluxos de trabalho profissionais (AA-Briefcase), o Grok 4.6 completou as missões com uma média de 53 rodadas de interação e 500 milhões de tokens de entrada. Em comparação, o Claude Opus 5 Max exigiu 103 rodadas e 2 bilhões de tokens para concluir as mesmas atividades. Esse desempenho resultou em um custo estimado de 0,84 dólar por tarefa para o Grok 4.6.

A estrutura de preços oficial começa em 2 dólares por milhão de tokens de entrada e 6 dólares para saída. Contudo, o TechOrange alertou que esse valor dobra para 4 e 12 dólares, respectivamente, quando a janela de contexto ultrapassa 200 mil tokens. A SpaceXAI também disponibilizou o Grok Bot beta, um agente que opera em computadores virtuais na nuvem para usuários de iPhone e Mac, integrando a tecnologia adquirida com a plataforma Cursor em junho.

O que ainda não foi divulgado

Apesar do avanço em codificação e tarefas terminais, os dados da DigitalToday mostram que o Grok 4.6 ainda não superou o GPT-5.6 Sol Max em benchmarks de conhecimento jurídico, como o Harvey Lab, onde o modelo da OpenAI mantém a liderança. Não foram publicados detalhes sobre o desempenho do modelo em idiomas que não o inglês em todos os benchmarks citados, nem o limite máximo de tokens para tarefas de agentes em larga escala além dos 500 mil suportados pela janela de contexto padrão.

Apurado em 4 fontes

VentureBeat (Estados Unidos) · 디지털투데이 (DigitalToday) (Coreia do Sul) · 科技報橘 (TechOrange) (Taiwan) · Lapaas Voice (Índia)

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)