OCTO+

Pesquisadores criam framework ToolHazard para segurança de LLMs

Framework ToolHazard automatiza a criação de ambientes adversários para testar vulnerabilidades em agentes de IA integrados a ferramentas externas.

13 de ago., 05:18 1 fonte · 1 país Segurança Pesquisa
Segurança
Representação digital de um ambiente de rede cibernética com camadas de segurança. Foto: Tima Miroshnichenko / Pexels

Pesquisadores apresentaram o ToolHazard, um framework voltado à avaliação de segurança e alinhamento de agentes baseados em Large Language Models (LLMs) que operam com ferramentas externas. A ferramenta aborda a vulnerabilidade desses sistemas a injeções indiretas de prompts contidas em estados ambientais.

Superando limitações de testes manuais

Estudos atuais de segurança em agentes de IA dependem, em grande parte, de ambientes de teste criados manualmente ou de simulações estocásticas baseadas nos próprios modelos. Essa abordagem limita a escalabilidade da pesquisa em diferentes domínios. O ToolHazard propõe uma síntese automatizada de ambientes adversários, reduzindo a necessidade de engenharia humana e permitindo a expansão por meio de novos domínios semente e maior capacidade computacional.

O framework é composto por três pilares fundamentais:

Diagrama abstrato de nós interconectados representando fluxos de dados em agentes de IA.
Foto: Maxim Landolfi / Pexels

Benchmarking e alinhamento de agentes

A partir do ToolHazard, foi desenvolvido o ToolHazard-Bench, um conjunto de testes voltado a submeter agentes de IA a fluxos de trabalho complexos e ataques ambientais diversificados. Os experimentos indicam que a eficácia desses ataques é sensível ao tempo e à localização da injeção de comandos maliciosos.

Além da função de avaliação, o framework é capaz de gerar dados de alinhamento. Segundo os autores, a utilização desse material melhora a segurança tanto no ToolHazard-Bench quanto no AgentDojo, sem comprometer o desempenho dos modelos em tarefas benignas.

O que ainda não foi divulgado

Apurado em 1 fonte

arXiv — cs.CR (Cryptography and Security) (—)

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)