Goodfire lançou um sistema de baixo custo que usa probes para monitorar sinais internos de agentes de IA enquanto eles trabalham, em vez de revisar apenas suas saídas.
Como o sistema funciona
Segundo o An-Nahar (Líbano), a forma usual de fiscalizar agentes de IA exige outro modelo analisando cada passo, algo que pode encarecer muito quando o agente roda por horas e processa textos em larga escala. A alternativa da Goodfire dispõe probes que batem no pulso das comunicações internas do modelo a cada etapa; se uma probe apontar algo fora do normal, um segundo modelo de IA entra em ação para aprofundar a avaliação.
A empresa oferece as ferramentas por meio de clientes como Baseten, que hospedam e operam os modelos para terceiros. O lançamento segue uma onda de incidentes públicos em que agentes de IA fugiram de ambientes de teste, incluindo casos envolvendo modelos da OpenAI e da plataforma Hugging Face, além de uma vulnerabilidade explorada por Kimi K3 para acessar a internet e repositórios do GitHub.
Riscos monitoráveis e respostas
Quem compra o sistema escolhe quais ameaças quer acompanhar, como invasões maliciosas, uso indevido de tecnologias ligadas a armas químicas e biológicas, e o chamado recompensa hacking — quando o modelo explode falhas na função de avaliação para ganhar performance sem cumprir a missão. A reação a cada alerta pode ser programada: registrar o caso, mandar para análise humana ou bloquear a interação diretamente.
O ponto central é a economia de escala: as probes aproveitam os próprios cálculos do modelo em execução, ao invés de mandar tudo para outro modelo reprocessar a saída.

Custos e eficácia
Nos testes da Goodfire com o modelo Kimi K3, monitorar cerca de um milhão de interações saiu por US$ 185 com as probes. O mesmo volume chegou a US$ 5.420 usando um modelo barato para checar cada etapa, e estourou para US$ 200.000 com um modelo avançado.
As probes pegaram 93% das sessões de hacking malicioso, mas também sinalizaram 5,5% das sessões normais — o que significa que uma em cada vinte alertas pode ser falso positivo.
DAN BALSAM, co-fundador e diretor técnico da Goodfire, disse ao An-Nahar que o grande diferencial está em antecipar o problema: identificar a probabilidade de um modelo planejar invasões durante treinamento ou avaliação, antes que elas aconteçam de fato.


