OCTO+

OpenAI desestra cronizada de extração de raciocínio ligada a Moonshot

OpenAI interrompeu campanha de distillation que tentava extrair raciocínio protegido de seus modelos. Atividade atingiu 16 mil tentativas em julho de 2026.

01 de out., 11:19 6 fontes · 3 países Segurança
SegurançaOpenAIMoonshot
Sala de servidores com luzes baixas e painéis de controle Foto: panumas nikhomkhai / Pexels

OpenAI desestra cronizada de extração de raciocínio

A OpenAI identificou e interrompeu uma campanha coordenada de adversarial distillation destinada a extrair raciocínio protegido de seus modelos de IA. Segundo The Hacker News, a atividade começou no dia 1º de julho de 2026, atingiu um pico de 16 mil tentativas entre 24 e 25 de julho envolvendo mais de 4 mil usuários e foi totalmente encerrada em 28 de julho de 2026.

Como a campanha funcionou

Os operadores não quebraram criptografia nem acessaram bancos de dados. Em vez disso, manipularam interações com os modelos para reproduzir o raciocínio protegido de forma visível ao solicitante, em escala coordenada que violava os termos de serviço da empresa. A OpenAI atribuiu o núcleo da atividade a indivíduos associados à Moonshot AI, empresa chinesa com sede em Pequim, mas não apresentou evidências técnicas dessa ligação por razões de segurança.

Medidas adotadas pela OpenAI

A empresa implantou mitigações adicionais, baniu as contas fraudulentas envolvidas na campanha e fechou um caminho que permitia reproduzir raciocínio criptografado de outros usuários. Também adicionou verificações para detectar e reter saídas de streaming que pudessem expor o raciocínio interno dos modelos.

Tela de computador mostrando linhas de código em fundo escuro
Foto: Al Nahian / Pexels

Riscos e contexto

A OpenAI classificou a atividade como adversarial distillation, um método que pode ser usado para treinar outro modelo sem preservar as salvaguardas do modelo original. Isso acelera a transferência de capacidades avançadas sem o mesmo investimento em segurança.

Um estudo de agosto de 2026, realizado por pesquisadores do MATS Research, ELLIS Institute Tübingen e Synk, revelou uma vulnerabilidade arquitetônica que torna os rastros de raciocínio criptografado totalmente compatíveis e intercambiáveis entre sessões, usuários e modelos dentro do ecossistema do provedor. Isso permite ataques de decifração escalonável: ao injetar um rastro criptografado em um modelo mais fraco e menos protegido, o sistema decodifica e devolve o conteúdo original em texto plano, sem atingir diretamente o modelo mais avançado.

Pelo lado de fora, isso permite extração em larga escala de dados privados, injeção invisível de comandos maliciosos em blocos criptografados e exposição acidental de informações sensíveis contidas no raciocínio interno — mesmo quando a resposta final do modelo rejeita uma solicitação perigosa. Para a OpenAI, o adversarial distillation representa riscos de segurança e nacional, especialmente à medida que os modelos ganham aplicação em domínios de uso duplo.

Apurado em 6 fontes

OpenAI Blog (Estados Unidos) · The Hacker News (Índia)

ver as 6 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)