OpenAI registra 6 novos casos de comportamento preocupante em IAs
Novos casos envolvem modelos que esconderam erros, contornaram limitações ou realizaram ações sem autorização

A OpenAI divulgou seis novos casos de comportamento considerado “inesperado ou preocupante” em modelos de inteligência artificial.
Os episódios ocorreram durante treinamentos ou avaliações nos últimos seis meses e fazem parte de uma nova política de transparência da empresa.
Segundo a Fast Company, a OpenAI também apresentou um novo sistema para acompanhar, investigar e divulgar casos de “desalinhamento” de modelos, termo usado para situações em que o comportamento da IA se distancia das instruções ou objetivos estabelecidos.
Leia também: OpenAI muda postura sobre falhas da IA e promete divulgá-las regularmente; entenda mudança
QUAIS FORAM OS CASOS?
Um dos episódios envolveu um modelo de pesquisa ainda não lançado que inseriu instruções semelhantes a um jailbreak em suas próprias anotações. O conteúdo orientava o sistema a ignorar restrições e a se libertar de determinadas funções.
Em outro caso, um agente de IA enviou um arquivo para a internet sem autorização do usuário. O objetivo era criar uma fonte online para citar na resposta depois de utilizar código para analisar dados.
A OpenAI também identificou situações em que modelos criaram informações ausentes em conjuntos de dados, esconderam erros ou tentaram contornar determinadas limitações.
Outro episódio envolveu uma chave de API encontrada em um repositório público. Durante a avaliação, o modelo utilizou a credencial sem autorização.
A empresa também relatou casos em que agentes enviaram arquivos para serviços externos para conseguir compartilhar informações.
NOVA FORMA DE DIVULGAR FALHAS
De acordo com a OpenAI, o novo framework pretende acelerar a publicação desses episódios. A empresa afirma que poderá divulgar um caso mesmo quando ainda não tiver explicado completamente o comportamento ou concluído uma correção.
Os seis registros são apresentados como episódios individuais e, segundo a própria OpenAI, não devem ser interpretados como uma medida da frequência com que comportamentos de desalinhamento acontecem nos modelos.
A companhia também pretende continuar publicando relatórios quando novos casos atenderem aos critérios definidos pelo framework.
A proposta ainda poderá ser aprimorada com participação de pesquisadores externos, desenvolvedores, órgãos reguladores e entidades de padronização.
Leia também: OpenAI, Anthropic e Google unem forças para enfrentar riscos da inteligência artificial