OCTO+

NVIDIA Groq 3 LPX em produção completa com 3.400 tokens por segundo

NVIDIA Groq 3 LPX atinge 3.400 tokens/s; Nebius primeira nuvem a adotar; custos de tokens devem cair 35x

24 de ago., 16:46 22 fontes · 4 países Modelos Produto
ModelosNVIDIA
Sala de servidores escura Foto: Brett Sayles / Pexels

NVIDIA Groq 3 LPX em produção completa com 3.400 tokens por segundo para IA agente, extensão da plataforma Vera Rubin. Nebius é a primeira nuvem a adotar a tecnologia que acelera tasks de código e workloads sensíveis a latência, demonstrando velocidade de classe mundial em benchmarks da Artificial Analysis.

Desempenho em benchmarking

Em benchmarking da Artificial Analysis, Groq 3 LPX demonstrou velocidade de classe mundial para coding agente e outras cargas de trabalho sensíveis a latência, alcançando 3.400 output tokens por segundo com modelo Gemma 4 31B e contexto de 100.000 tokens, marca recorde ever registrado para o modelo segundo a NVIDIA Newsroom. A plataforma estende o performance de inferência da Vera Rubin NVL72 dramaticamente aumentando as taxas de geração de tokens, fornecendo experiências premium para workloads pesados de contexto para que agentes possam agir a velocidades extremas segundo o comunicado oficial. A velocidade aprimorada dá aos agentes mais tempo para inspecionar arquivos, escrever e testar código, chamar ferramentas, verificar resultados e iterar mantendo uma experiência de usuário responsiva.

Primeiros adotantes e operação no mercado

Nebius planeja integrar Groq 3 LPX ao seu Token Factory, sua produção de tokens em escala segundo a NVIDIA Newsroom. Microsoft recebeu os primeiros sistemas da série Vera Rubin em 22 de agosto de 2026 segundo Born's Tech and Windows World; cada rack NVL72 combina 72 GPUs Rubin e 36 CPUs Vera, entregando 3,6 Exaflops de inferência, com instalação em apenas cinco minutos contra duas horas de gerações anteriores. Para o quarto trimestre de 2026, a Microsoft projeta um estoque de 250.000 a 300.000 GPUs dessa geração, indicando adotação em larga escala no mercado corporativo.

Especificações técnicas e implicações comerciais

A arquitetura LPX foi desenvolvida especificamente para os dois desafios da IA agente: processar enormes volumes de contexto e gerar tokens com latência extremamente baixa segundo a NVIDIA Newsroom. Segundo a empresa, agentes podem executar tasks de coding em minutos em vez de horas, com 4x mais responsividade comparado à plataforma alternativa mais próxima. A plataforma atinge 50 PFLOPS em inferência FP4, equivalente a 5x o desempenho da geração Blackwell segundo Born's Tech and Windows World. Technical specs: GPU Rubin fabricada em 3nm pela TSMC com 33,6 bilhões de transistores, 288 GB HBM4 e largura de banda de 22 TB/s. CPU Vera entrega 3,21x mais throughput que processadores x86 comuns em tasks de compressão e criptografia segundo Born's Tech and Windows World. A Rubin-GPU contém 33,6 bilhões de transistores fabricados em processo de 3nm da TSMC, oferecendo capacidade computacional significativa para workloads de IA de próxima geração.

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)