NVIDIA Groq 3 LPX em produção completa com 3.400 tokens por segundo para IA agente, extensão da plataforma Vera Rubin. Nebius é a primeira nuvem a adotar a tecnologia que acelera tasks de código e workloads sensíveis a latência, demonstrando velocidade de classe mundial em benchmarks da Artificial Analysis.
Desempenho em benchmarking
Em benchmarking da Artificial Analysis, Groq 3 LPX demonstrou velocidade de classe mundial para coding agente e outras cargas de trabalho sensíveis a latência, alcançando 3.400 output tokens por segundo com modelo Gemma 4 31B e contexto de 100.000 tokens, marca recorde ever registrado para o modelo segundo a NVIDIA Newsroom. A plataforma estende o performance de inferência da Vera Rubin NVL72 dramaticamente aumentando as taxas de geração de tokens, fornecendo experiências premium para workloads pesados de contexto para que agentes possam agir a velocidades extremas segundo o comunicado oficial. A velocidade aprimorada dá aos agentes mais tempo para inspecionar arquivos, escrever e testar código, chamar ferramentas, verificar resultados e iterar mantendo uma experiência de usuário responsiva.
Primeiros adotantes e operação no mercado
Nebius planeja integrar Groq 3 LPX ao seu Token Factory, sua produção de tokens em escala segundo a NVIDIA Newsroom. Microsoft recebeu os primeiros sistemas da série Vera Rubin em 22 de agosto de 2026 segundo Born's Tech and Windows World; cada rack NVL72 combina 72 GPUs Rubin e 36 CPUs Vera, entregando 3,6 Exaflops de inferência, com instalação em apenas cinco minutos contra duas horas de gerações anteriores. Para o quarto trimestre de 2026, a Microsoft projeta um estoque de 250.000 a 300.000 GPUs dessa geração, indicando adotação em larga escala no mercado corporativo.
Especificações técnicas e implicações comerciais
A arquitetura LPX foi desenvolvida especificamente para os dois desafios da IA agente: processar enormes volumes de contexto e gerar tokens com latência extremamente baixa segundo a NVIDIA Newsroom. Segundo a empresa, agentes podem executar tasks de coding em minutos em vez de horas, com 4x mais responsividade comparado à plataforma alternativa mais próxima. A plataforma atinge 50 PFLOPS em inferência FP4, equivalente a 5x o desempenho da geração Blackwell segundo Born's Tech and Windows World. Technical specs: GPU Rubin fabricada em 3nm pela TSMC com 33,6 bilhões de transistores, 288 GB HBM4 e largura de banda de 22 TB/s. CPU Vera entrega 3,21x mais throughput que processadores x86 comuns em tasks de compressão e criptografia segundo Born's Tech and Windows World. A Rubin-GPU contém 33,6 bilhões de transistores fabricados em processo de 3nm da TSMC, oferecendo capacidade computacional significativa para workloads de IA de próxima geração.
- NVIDIA informou clientes em 22 de agosto de 2026 sobre aumentos de mais de 15% em preços de servidores de IA para entrega início 2027, afetando tanto sistemas Vera Rubin quanto Grace Blackwell segundo Born's Tech and Windows World. O aumento afeta toda a linha de produtos da fabricante.
- Custos de tokens deverão diminuir em fator 35 com a nova arquitetura segundo Born's Tech and Windows World. Essa redução de custos torna aplicações de agente de IA economicamente viáveis para deploy em larga escala.
- O modelo agente consome cerca de 15x mais tokens que aplicações de chat tradicionais segundo Born's Tech and Windows World. Esse alto consumo de tokens é o que torna necessária a aceleração de geração proporcionada pelo Groq 3 LPX.
- Analistas do mercado esperam forte crescimento de receita apesar da pressão de custos segundo Born's Tech and Windows World. O ritmo de adotação de plataformas como Groq 3 LPX é visto como driver chave para o próximo ciclo de crescimento de receita da NVIDIA.
- SpaceXAI integra a hardware massivamente em sua infraestrutura, usando CPUs Vera com 88 núcleos Olympus para processes de agente de IA e planejando deploy otimizado de Vera Rubin NVL72 em satélites Starmind para computing orbital, com poder computacional para modelo Grok expandido para escala de gigawatt segundo Born's Tech and Windows World. A empresa também utiliza a hardware para processos de treinamento e inferência em larga escala.
- Outros parceiros como CoreWeave e Oracle também preparam deploy da nova hardware segundo Born's Tech and Windows World. A adotação por múltiplas clouds indica validação cruzada da performance da plataforma.
- Como principal motivo para aumentos de preço, especialistas da indústria apontam a escassez contínua de memória High Bandwidth Memory (HBM) segundo Born's Tech and Windows World. A escassez de HBM tem pressionado custos em toda a indústria de IA, afetando tanto projetos de startup quanto enterprises.
- Um rack Vera Rubin 200 custa aproximadamente 8 milhões de dólares segundo cálculos da indústria segundo Born's Tech and Windows World. O investimento reflete a alta performance e a capacidade de processamento de contexto extremo da plataforma.


