OpenAI desestra cronizada de extração de raciocínio
A OpenAI identificou e interrompeu uma campanha coordenada de adversarial distillation destinada a extrair raciocínio protegido de seus modelos de IA. Segundo The Hacker News, a atividade começou no dia 1º de julho de 2026, atingiu um pico de 16 mil tentativas entre 24 e 25 de julho envolvendo mais de 4 mil usuários e foi totalmente encerrada em 28 de julho de 2026.
Como a campanha funcionou
Os operadores não quebraram criptografia nem acessaram bancos de dados. Em vez disso, manipularam interações com os modelos para reproduzir o raciocínio protegido de forma visível ao solicitante, em escala coordenada que violava os termos de serviço da empresa. A OpenAI atribuiu o núcleo da atividade a indivíduos associados à Moonshot AI, empresa chinesa com sede em Pequim, mas não apresentou evidências técnicas dessa ligação por razões de segurança.
- Início: 1º de julho de 2026;
- Pico: 24 e 25 de julho de 2026, com 16 mil tentativas de mais de 4 mil usuários;
- Atividade relacionada identificada em mais de 15 mil usuários;
- Encerramento total: 28 de julho de 2026.
Medidas adotadas pela OpenAI
A empresa implantou mitigações adicionais, baniu as contas fraudulentas envolvidas na campanha e fechou um caminho que permitia reproduzir raciocínio criptografado de outros usuários. Também adicionou verificações para detectar e reter saídas de streaming que pudessem expor o raciocínio interno dos modelos.

Riscos e contexto
A OpenAI classificou a atividade como adversarial distillation, um método que pode ser usado para treinar outro modelo sem preservar as salvaguardas do modelo original. Isso acelera a transferência de capacidades avançadas sem o mesmo investimento em segurança.
Um estudo de agosto de 2026, realizado por pesquisadores do MATS Research, ELLIS Institute Tübingen e Synk, revelou uma vulnerabilidade arquitetônica que torna os rastros de raciocínio criptografado totalmente compatíveis e intercambiáveis entre sessões, usuários e modelos dentro do ecossistema do provedor. Isso permite ataques de decifração escalonável: ao injetar um rastro criptografado em um modelo mais fraco e menos protegido, o sistema decodifica e devolve o conteúdo original em texto plano, sem atingir diretamente o modelo mais avançado.
Pelo lado de fora, isso permite extração em larga escala de dados privados, injeção invisível de comandos maliciosos em blocos criptografados e exposição acidental de informações sensíveis contidas no raciocínio interno — mesmo quando a resposta final do modelo rejeita uma solicitação perigosa. Para a OpenAI, o adversarial distillation representa riscos de segurança e nacional, especialmente à medida que os modelos ganham aplicação em domínios de uso duplo.


