A OpenAI lançou o modelo GPT-6 Astra Ultrafast, executado em GPUs NVIDIA Blackwell, disponível agora na API e para usuários autorizados de ChatGPT Work e Codex, com promessa de até oito vezes mais velocidade na geração de tokens comparado ao modo padrão Astra.
Desempenho e otimizações de hardware
O Blog da NVIDIA explica que a arquitetura Blackwell, combinada com otimizações de inferência desenvolvidas pelos próprios modelos da OpenAI, pode oferecer até 8× mais velocidade na geração de tokens. Mas essa proporção é um teto teórico. O ganho real depende do tipo de tarefa, do tamanho do contexto e da carga no sistema.
O Born's Tech and Windows World complementa: a aceleração vem de um ajuste fino entre hardware especializado e software de inferência adaptado. A OpenAI usa seus próprios modelos para refinar diretamente o código que roda nas GPUs NVIDIA, em vez de depender de bibliotecas prontas.
- Redução dos ciclos de edição‑teste‑depuração de agentes de codificação.
- Diminuição da latência entre chamadas de ferramentas.
- Experiência mais responsiva em aplicações interativas.
Disponibilidade na nuvem
O Blog da NVIDIA também detalha que a AWS anunciou, em 30 de setembro de 2026, que o GPT-6 Astra Ultrafast está disponível no Amazon Bedrock como uma camada premium. A promessa é de até seis vezes mais rapidez na inferência de API, com picos de 300 tokens por segundo. O acesso é feito pelo console Bedrock ou por APIs compatíveis.
Fora a AWS, o modelo já pode ser acessado diretamente pela API OpenAI e pelos planos ChatGPT Work e Codex, segundo o mesmo comunicado do Blog da NVIDIA.

Declarações de executivos
Philippe Tillet, líder de inferência da OpenAI, falou ao Blog da NVIDIA: o investimento da NVIDIA em ferramentas e documentação permitiu que os modelos da própria OpenAI se tornassem muito bons em programar as GPUs Blackwell e Rubin. Isso vira kernels de alto desempenho, tornando o hardware competitivo em latência, throughput e custo.
Uday Ruddarraju, CTO de computação da OpenAI, disse à mesma fonte que a parceria com a NVIDIA está tornando a IA mais rápida e útil. Ele destacou que usar os modelos internos da OpenAI para otimizar a inferência nas GPUs, aliado à programabilidade da plataforma NVIDIA, foi fundamental para entregar a aceleração por trás do Astra Ultrafast.
Considerações sobre benchmarks e custos
Ambas as fontes ressaltam que detalhes sobre preços e benchmarks independentes ainda não foram divulgados. As alegações de redução de custos por token não têm números oficiais da OpenAI ou da NVIDIA para confirmar.
Próximos passos
Desenvolvedores já podem usar o GPT-6 Astra Ultrafast pela API OpenAI. O guia Ultrafast traz informações sobre acesso, preços e implementação.


