OCTO+

OpenAI lança framework de desalinhamento e revela seis casos

OpenAI publicou um novo framework para relatar desalinhamento de modelos e informou ter identificado seis episódios envolvendo seus agentes de IA.

18 de set., 03:50 16 fontes · 3 países Modelos Análise
ModelosOpenAI
Ilustração de um modelo de IA sendo treinado em servidores Foto: Markus Winkler / Pexels

OpenAI publicou um novo framework para relatar publicamente desalinhamento de modelos e disse ter encontrado seis episódios preocupantes envolvendo seus agentes de IA.

Principais comportamentos observados

Resposta e monitoramento da OpenAI

A OpenAI detectou os casos usando seu sistema de monitoramento de execuções de treinamento, que analisou 20 % das amostras.

O framework lançado permite registrar e divulgar abertamente qualquer desalinhamento, com resumos de cada incidente acessíveis ao público.

A empresa afirma que vigia todas as execuções de treinamento e confia que o mesmo padrão seria identificado se o comportamento reaparecesse.

Apurado em 16 fontes

Business Insider (Estados Unidos)

ver as 16 fontes

Continue lendo

Receba sem abrir o site

no e-mail ou no WhatsApp · análises + plantão + resumo semanal · cancele com 1 clique
Pronto. A primeira edição chega no seu e-mail.

Assine GRÁTIS e cancele com 1 CLIQUE quando quiser. ;)