OpenAI muda postura sobre falhas da IA e promete divulgá-las regularmente; entenda mudança

Empresa estabelece novo modelo de transparência para relatar falhas e comportamentos não autorizados de suas IAs

OpenAI
Créditos: Unsplash

Lilian Campos 2 minutos de leitura
Favoritar no Google

A OpenAI criou um novo sistema para acompanhar, investigar e divulgar casos de comportamento inesperado ou não autorizado de seus modelos de inteligência artificial.

A mudança busca tornar mais frequente a publicação de informações sobre possíveis falhas de alinhamento.

Segundo a OpenAI, a empresa divulgava os relatos anteriores de forma pontual. A big tech afirmou que muitas vezes aguardava reunir vários casos em um único relatório ou incluía os problemas em documentos de segurança de novos modelos.

Agora, a companhia pretende publicar casos que atendam aos critérios do novo framework mesmo quando ainda não tiver explicado completamente o comportamento ou desenvolvido uma correção.

Leia também: OpenAI diz que a era da AGI começou. Pesquisadores não estão tão certos

O QUE É O NOVO FRAMEWORK

O sistema define quais situações a empresa pode divulgar e estabelece etapas para investigar cada ocorrência.

Entre os casos considerados estão modelos que agem sem autorização, tentam escapar de mecanismos de supervisão ou apresentam comportamentos que colocam em dúvida determinadas medidas de segurança.

Além disso, a OpenAI afirma que um caso não precisa necessariamente causar danos ou representar um padrão recorrente para ser publicado. A empresa também pretende atualizar relatórios anteriores quando a repetição de um comportamento trouxer novas informações.

O framework será revisado com o tempo e poderá incorporar contribuições de pesquisadores externos, desenvolvedores, órgãos reguladores e entidades de padronização.

OPENAI JÁ DIVULGOU SEIS CASOS

Para estrear o sistema, a OpenAI publicou seis relatórios sobre comportamentos observados durante treinamentos e avaliações de modelos.

Entre os exemplos estão:

  • Modelos que inseriram instruções não autorizadas em resumos de tarefas;
  • Modelos que tentaram esconder erros;
  • Modelos que encontraram chaves de API expostas em repositórios públicos e chegaram a enviar arquivos para a internet sem autorização para criar citações.

A empresa ressalta que os seis episódios são casos individuais e não representam a frequência com que problemas de alinhamento ocorrem em seus modelos.

A OpenAI afirma ainda que pretende continuar publicando relatórios de forma recorrente. Segundo a empresa, a iniciativa pode ajudar pesquisadores e outros desenvolvedores a identificar problemas semelhantes e aprimorar medidas de segurança.

Leia também: Tudo o que sabemos sobre o Astra, novo modelo da OpenAI


SOBRE A AUTORA

Lilian Campos é jornalista colaboradora da Fast Company Brasil. saiba mais