OCTO+

3 em 5 modelos de IA falham em testes antiterrorismo

O estudo da Tech Against Terrorism testou mais de 130 modelos de IA e mostrou que, após remoção de salvaguardas

10 de out., 22:33 3 fontes · 2 países Segurança Pesquisa
Segurança
Tela mostrando resultados de teste de segurança em modelos de IA Foto: MedPoint 24 / Pexels

Segundo a The Express Tribune e o The Nation, um estudo da organização britânica Tech Against Terrorism avaliou mais de 130 modelos de IA e constatou que três em cinco deles falharam nos testes de segurança antiterrorismo.

Como o teste foi conduzido

O The Express Tribune relata que o estudo foi divulgado pela CBC News na sexta‑feira e utilizou centenas de solicitações simuladas que imitariam os pedidos de um terrorista planejando um ataque.

Segundo o mesmo veículo, os modelos foram submetidos a um processo chamado abliteration, que remove as salvaguardas de segurança.

O The Express Tribune acrescenta que o modelo Llama 3.1 8B da Meta obteve 97 pontos de 100 no benchmark de segurança antes da modificação, mas após a abliteration sua pontuação caiu para cerca de três.

O The Nation também destaca essa queda drástica de desempenho.

Os pesquisadores observaram que as versões modificadas forneciam respostas detalhadas sobre ataques, financiamento ao terrorismo e radicalização, enquanto as versões originais recusavam responder a tais solicitações, segundo ambas as publicações.

O relatório não encontrou evidências de que grupos terroristas ou extremistas tenham usado os modelos testados, exceto por um chatbot extremista identificado pelos pesquisadores, informam o The Express Tribune e o The Nation.

Além disso, a Tech Against Terrorism localizou mais de 29 mil repositórios no Hugging Face que promovem modelos de IA sem censuras ou proteções, conforme relatado pelas duas fontes.

Recomendações e reações

Adam Hadley, fundador e diretor executivo da Tech Against Terrorism, afirmou que há preocupação com perda de controle e risco existencial da IA, mas acredita que segurança e progresso não são mutuamente exclusivos, segundo o The Express Tribune e o The Nation.

Mão de robô digitando em um laptop simbolizando IA
Foto: Tara Winstead / Pexels

Hadley recomendou a criação de benchmarks de segurança independentes, proteções mais fortes contra a remoção de salvaguardas e restrições à distribuição de modelos modificados, conforme citado pelas fontes.

Em resposta, a Meta declarou que seus modelos passam por avaliações de segurança e que suas políticas proíbem usos ilegais ou prejudiciais, segundo o The Express Tribune e o The Nation.

O Hugging Face informou que modera regularmente conteúdo que viola suas políticas, mas alertou que algumas das recomendações do relatório podem prejudicar a pesquisa aberta, conforme registrado pelas fontes.

O que ainda não foi divulgado

As matérias não especificaram quantos dos 130 modelos exatamente passaram nos testes, nem quais outros modelos além do Llama 3.1 8B foram incluídos na análise.

Também não foi detalhado o funcionamento do chatbot extremista encontrado nem os critérios usados para considerar um repositório como “uncensurado” no Hugging Face.

Essa informação não foi divulgada nas fontes consultadas.

Apurado em 3 fontes

The Express Tribune (Paquistão) · The Nation (Paquistão)

ver as 3 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)