OpenAI anuncia modo Ultrafast para GPT-5.6 Sol, com velocidade até 14 vezes maior que o modo padrão e geração máxima de 750 tokens por segundo, usando infraestrutura da Cerebras. O novo serviço chega em preview limitado à API para clientes selecionados.
Desempenho e velocidade
Segundo a iThome, Ultrafast pode gerar até 750 tokens por segundo, o que representa aumento de até 14 vezes em relação ao processamento padrão da mesma modelo. A mesma fonte informa que processos que antes exigiam uma noite inteira agora podem ser concluídos em um único dia útil. Conforme a Lapaas Voice, o novo modo foi criado para atender empresas e desenvolvedores que necessitam de raciocínio avançado de IA com tempos de resposta muito menores. A fonte destaca que a OpenAI afirma que o Ultrafast pode rodar o GPT-5.6 Sol até 14 vezes mais rápido que o processamento padrão, embora o número de 14 vezes represente a melhoria máxima reivindicada, e não uma garantia de que todas as cargas de trabalho rodem exatamente 14 vezes mais rápidas.
Infraestrutura da Cerebras
Conforme a Lapaas Voice, o modo Ultrafast utiliza hardware da Cerebras, empresa especializada em processadores waffer-scale que mantêm dados de modelo próximos às unidades de cálculo, reduzindo gargalos de movimentação de dados comuns em infraestruturas baseadas em GPU tradicionais. A fonte explica que os processadores waffer-scale da Cerebras armazenam pesos de modelo na memória on-chip SRAM, próximo às unidades de computação, o que acelera o processamento de inferência. A Cerebras afirma que sua arquitetura de pipeline mantém tokens fluindo pelas camadas do modelo, direcionando cargas de trabalho de grande inferência de IA. Além disso, a fonte destaca que a abordagem da empresa difere das GPUs convencionais ao manter grandes quantidades de dados do modelo próximas às unidades de processamento, o que reduz gargalos típicos de movimentação de dados.
O que cada mercado destacou
Conforme a iThome, a cobertura em Taiwan detalha aplicações práticas, incluindo uso por equipes de resposta a eventos, análise financeira, pesquisa de segurança, suporte ao cliente e comércio eletrônico, além de pesquisa e experimentação em tempo real. A Lapaas Voice, da Índia, enfatiza o compromisso entre inteligência e velocidade do modelo, destacando a taxa de 750 tokens por segundo e a parceria com a Cerebras, além de posicionar o modo como mudança significativa na competição de IA, onde provedores de modelo buscam melhorar não apenas inteligência e precisão, mas também rapidez na produção de resultados úteis. As coberturas do Showmetech (Brasil) e do Punto Informatico (Itália) repercutem o lançamento como destaque principal, sem análise aprofundada sobre os casos de uso. A nova camada de serviço pode interessar a empresas brasileiras que operam com análise financeira em tempo real ou atendimento ao cliente, segundo as aplicações suportadas pelo modelo.


