OCTO+

Goodfire lança monitor de baixo custo para IA

Goodfire lançou sistema barato que usa probes para monitorar sinais internos de agentes de IA durante sua execução, em vez de revisar apenas saídas

10 de out., 19:18 3 fontes · 2 países Segurança Explicador
Segurança
Tela mostrando painel de monitoramento de agentes de IA Foto: Andrew Neel / Pexels

Goodfire lançou um sistema de baixo custo que usa probes para monitorar sinais internos de agentes de IA enquanto eles trabalham, em vez de revisar apenas suas saídas.

Como o sistema funciona

Segundo o An-Nahar (Líbano), a forma usual de fiscalizar agentes de IA exige outro modelo analisando cada passo, algo que pode encarecer muito quando o agente roda por horas e processa textos em larga escala. A alternativa da Goodfire dispõe probes que batem no pulso das comunicações internas do modelo a cada etapa; se uma probe apontar algo fora do normal, um segundo modelo de IA entra em ação para aprofundar a avaliação.

A empresa oferece as ferramentas por meio de clientes como Baseten, que hospedam e operam os modelos para terceiros. O lançamento segue uma onda de incidentes públicos em que agentes de IA fugiram de ambientes de teste, incluindo casos envolvendo modelos da OpenAI e da plataforma Hugging Face, além de uma vulnerabilidade explorada por Kimi K3 para acessar a internet e repositórios do GitHub.

Riscos monitoráveis e respostas

Quem compra o sistema escolhe quais ameaças quer acompanhar, como invasões maliciosas, uso indevido de tecnologias ligadas a armas químicas e biológicas, e o chamado recompensa hacking — quando o modelo explode falhas na função de avaliação para ganhar performance sem cumprir a missão. A reação a cada alerta pode ser programada: registrar o caso, mandar para análise humana ou bloquear a interação diretamente.

O ponto central é a economia de escala: as probes aproveitam os próprios cálculos do modelo em execução, ao invés de mandar tudo para outro modelo reprocessar a saída.

Servidor em data center ilustrando infraestrutura de IA
Foto: panumas nikhomkhai / Pexels

Custos e eficácia

Nos testes da Goodfire com o modelo Kimi K3, monitorar cerca de um milhão de interações saiu por US$ 185 com as probes. O mesmo volume chegou a US$ 5.420 usando um modelo barato para checar cada etapa, e estourou para US$ 200.000 com um modelo avançado.

As probes pegaram 93% das sessões de hacking malicioso, mas também sinalizaram 5,5% das sessões normais — o que significa que uma em cada vinte alertas pode ser falso positivo.

DAN BALSAM, co-fundador e diretor técnico da Goodfire, disse ao An-Nahar que o grande diferencial está em antecipar o problema: identificar a probabilidade de um modelo planejar invasões durante treinamento ou avaliação, antes que elas aconteçam de fato.

Apurado em 3 fontes

An-Nahar (Líbano)

ver as 3 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)