Em 3 de setembro de 2026 a OpenAI anunciou que seu modelo Astra chegou ao nível “Critical” do Preparedness Framework após mostrar que identifica e explora falhas zero‑dia sem intervenção humana, e que passou a reforçar as salvaguardas do sistema.
Medidas de segurança adotadas pela OpenAI
Segundo a Bloomberg Businessweek, a OpenAI lançou a versão GPT‑6 do modelo Astra acrescentando os chamados cyber guardrails.
A WION informou que, depois que o Astra exibiu habilidades avançadas de cibersegurança, a empresa apertou as salvaguardas ao redor do lançamento.
De acordo com o Telangana Today, a companhia adiou partes da disponibilização do Astra por várias semanas a fim de construir e testar proteções mais fortes.
O acesso às funções avançadas de segurança foi inicialmente limitado a usuários vetted, enquanto o uso defensivo mais amplo ficou disponível através do programa Daybreak Blue.
Capacidades cibernéticas demonstradas pelo Astra
O Telangana Today relata que, nos testes públicos do benchmark ExploitBench, o Astra obteve pontuação perfeita nas vulnerabilidades conhecidas.
Em uma avaliação interna projetada para evitar contaminação do conjunto de treinamento, o modelo descobriu duas falhas zero‑dia previamente desconhecidas, que a OpenAI disse estar repassando aos responsáveis pelo software afetado.
A empresa afirmou que, com as ferramentas corretas, o Astra consegue localizar falhas de segurança desconhecidas em sistemas bem protegidos e desenvolver métodos de exploração sem que um operador oriente cada passo.

O recurso que traz essa habilidade é chamado de recurrent depth; ele desloca parte do raciocínio do modelo para ativações internas, que não produzem saída legível, dificultando a verificação da cadeia de pensamento tradicional.
Ryan Greenblatt, cientista‑chefe da Redwood Research, descreveu o uso do recurrent depth como o pior desenvolvimento para segurança de IA até o momento e alertou que sua expansão pode prejudicar a utilidade da cadeia de pensamento para monitoramento e supervisão.
Lançamentos de concorrentes e posicionamento da OpenAI
O mesmo artigo do Telangana Today menciona que a Anthropic apresentou dois novos modelos, Claude Fable 5.1 e Claude Mythos 5.1, alegando liderar benchmarks de codificação e pesquisa científica e reduzir o preço das cargas de trabalho típicas em cerca de 25 por cento.
Google, por sua vez, revelou os modelos Gemini 3.8 Flash e Gemini 3.8 Flash Cyber, acompanhados de capacidades de vídeo agente e da ferramenta Google Pics para criação e edição de imagens.
Sam Altman, CEO da OpenAI, declarou em postagem na plataforma X que o Astra representa um avanço significativo em capacidade e alinhamento e que, para os modelos posteriores, a empresa está reduzindo o ritmo de lançamento sempre que necessário para reservar mais tempo ao trabalho de segurança.


