OCTO+

Ultrafast: OpenAI lança modo 14 vezes mais rápido para GPT-5.6 Sol

OpenAI anuncia modo Ultrafast para GPT-5.6 Sol, com até 14 vezes mais velocidade e 750 tokens por segundo, usando infraestrutura da Cerebras. Preview limitado a

15 de ago., 05:09 75 fontes · 4 países Modelos Produto
ModelosOpenAI
sala de servidores escura Foto: Christina Morillo / Pexels

OpenAI anuncia modo Ultrafast para GPT-5.6 Sol, com velocidade até 14 vezes maior que o modo padrão e geração máxima de 750 tokens por segundo, usando infraestrutura da Cerebras. O novo serviço chega em preview limitado à API para clientes selecionados.

Desempenho e velocidade

Segundo a iThome, Ultrafast pode gerar até 750 tokens por segundo, o que representa aumento de até 14 vezes em relação ao processamento padrão da mesma modelo. A mesma fonte informa que processos que antes exigiam uma noite inteira agora podem ser concluídos em um único dia útil. Conforme a Lapaas Voice, o novo modo foi criado para atender empresas e desenvolvedores que necessitam de raciocínio avançado de IA com tempos de resposta muito menores. A fonte destaca que a OpenAI afirma que o Ultrafast pode rodar o GPT-5.6 Sol até 14 vezes mais rápido que o processamento padrão, embora o número de 14 vezes represente a melhoria máxima reivindicada, e não uma garantia de que todas as cargas de trabalho rodem exatamente 14 vezes mais rápidas.

Infraestrutura da Cerebras

Conforme a Lapaas Voice, o modo Ultrafast utiliza hardware da Cerebras, empresa especializada em processadores waffer-scale que mantêm dados de modelo próximos às unidades de cálculo, reduzindo gargalos de movimentação de dados comuns em infraestruturas baseadas em GPU tradicionais. A fonte explica que os processadores waffer-scale da Cerebras armazenam pesos de modelo na memória on-chip SRAM, próximo às unidades de computação, o que acelera o processamento de inferência. A Cerebras afirma que sua arquitetura de pipeline mantém tokens fluindo pelas camadas do modelo, direcionando cargas de trabalho de grande inferência de IA. Além disso, a fonte destaca que a abordagem da empresa difere das GPUs convencionais ao manter grandes quantidades de dados do modelo próximas às unidades de processamento, o que reduz gargalos típicos de movimentação de dados.

O que cada mercado destacou

Conforme a iThome, a cobertura em Taiwan detalha aplicações práticas, incluindo uso por equipes de resposta a eventos, análise financeira, pesquisa de segurança, suporte ao cliente e comércio eletrônico, além de pesquisa e experimentação em tempo real. A Lapaas Voice, da Índia, enfatiza o compromisso entre inteligência e velocidade do modelo, destacando a taxa de 750 tokens por segundo e a parceria com a Cerebras, além de posicionar o modo como mudança significativa na competição de IA, onde provedores de modelo buscam melhorar não apenas inteligência e precisão, mas também rapidez na produção de resultados úteis. As coberturas do Showmetech (Brasil) e do Punto Informatico (Itália) repercutem o lançamento como destaque principal, sem análise aprofundada sobre os casos de uso. A nova camada de serviço pode interessar a empresas brasileiras que operam com análise financeira em tempo real ou atendimento ao cliente, segundo as aplicações suportadas pelo modelo.

Apurado em 7 fontes

Unite.AI · Showmetech (Brasil) · ai0.news — Daily AI News (Estados Unidos) · MarkTechPost (Estados Unidos) · Semana (Colômbia) · TugaTech (Portugal) · AI News Minute (Estados Unidos)

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)