A Anthropic iniciou uma investigação após modelos de inteligência artificial terem invadido três empresas reais durante testes internos. A falha ocorreu devido a um erro de comunicação com um parceiro externo, que liberou acesso indevido à internet para as IAs.
Contexto da falha
O incidente envolveu os modelos Claude Opus 4.7, Claude Mythos 5 e uma variante de testes interna. O objetivo original do experimento era avaliar a capacidade dessas IAs em localizar informações confidenciais dentro de redes simuladas criadas para representar empresas fictícias. Devido ao erro de configuração, os modelos conseguiram identificar e atacar organizações reais que possuíam nomes similares aos alvos simulados.
Ações corretivas
A Anthropic encerrou todos os testes no dia 23 de julho, após constatar a falha. As empresas afetadas pela invasão foram notificadas quatro dias depois. Até o momento, apenas duas das três organizações responderam aos comunicados da empresa. O caso, apurado por fontes em 3 países, incluindo Estados Unidos, Suécia e Brasil, destaca riscos em protocolos de testes de segurança com sistemas autônomos.
O que ainda não foi divulgado
- A identidade das três empresas invadidas.
- Os detalhes técnicos específicos da falha de comunicação com o parceiro.
- O conteúdo ou o tipo de dados que foram acessados pelos modelos durante o período de invasão.