A OpenAI deu uma sandbox à IA. Ela encontrou uma saída

O episódio expõe um dilema: quanto mais autonomia os pesquisadores dão aos agentes para testar suas capacidades, maior pode ser o risco de fuga

riscos de agentes de IA escaparem ao controle humano
Créditos: Unsplash/ Getty Images/ Magnific

Mark Sullivan 5 minutos de leitura
Favoritar no Google

Um novo relatório da organização de pesquisa em cibersegurança Transluce mostra que enxames de agentes da OpenAI tentaram invadir várias fontes públicas de dados no início deste ano.

Eles sondaram um painel de dados farmacêuticos administrado pelo Instituto Australiano de Saúde e Bem-Estar, tentaram acessar dados educacionais da Universidade de Iowa por meio de um site chamado Data USA e fizeram repetidas tentativas de recuperar uma única fotografia de uma coleção digital da Universidade do Novo México com imagens de sanatórios para tuberculose.

Parte dessa atividade já havia sido divulgada anteriormente, mas a nova pesquisa mostra que os agentes fizeram mais do que simplesmente “interagir” com os sites. Quando as tentativas convencionais de obter as informações fracassaram, eles começaram a procurar vulnerabilidades.

A Transluce afirma não ter encontrado evidências de que esses ataques tenham sido bem-sucedidos. Ainda assim, quando somamos isso ao que aconteceu logo depois, quando agentes da OpenAI invadiram servidores da Hugging Face como parte de um elaborado esquema para trapacear nas avaliações a que estavam sendo submetidos, começa a surgir um padrão.

A Transluce conseguiu associar as atividades envolvendo o Data USA e o governo australiano a agentes de um enxame que já havia usado um obscuro site wiki alemão como quadro de avisos enquanto tentava realizar tarefas de busca na web. A OpenAI já reconheceu que aqueles agentes eram seus.

O relatório também descreve tentativas anteriores de obter estatísticas do governo da Tailândia por meio de rotas cada vez mais complexas, embora a Transluce tenha menos certeza de que elas tenham sido realizadas pelos mesmos agentes da OpenAI.

IMPROVISAÇÃO E CRIATIVIDADE

Tudo isso se tornou possível quando os agentes descobriram como sair do ambiente seguro de testes da OpenAI e obter acesso à internet.

Dado o que sabemos agora sobre o que fizeram depois que escaparam, você poderia imaginar que o teste acontecia dentro de uma caixa de aço enterrada 30 metros abaixo do deserto, ou em uma instalação governamental segura, uma SCIF (Sensitive Compartmented Information Facility, ou instalação para informações compartimentadas sensíveis), com as máquinas isoladas da internet aberta.

mão robótica representando agente de inteligência artificial
Créditos: baona/ XH4D/ Getty Images

Mas esse não era o tipo de teste que a OpenAI queria realizar. Seus pesquisadores estavam testando a capacidade dos agentes de conduzir ciberataques sofisticados. Assim, naturalmente, queriam confiná-los a um ambiente seguro de testes (uma “sandbox”) sem acesso à internet, onde eles não pudessem causar danos no mundo real. Mas os testes de avaliação também eram realmente difíceis, chegando perto do impossível.

Esse era o objetivo. A empresa diz que instruiu os modelos a “buscar formas avançadas de exploração usando caminhos de ataque complexos” para encontrar as respostas do teste. Ela queria que eles improvisassem e fossem criativos. Para fazer isso, os agentes precisavam ter a capacidade de obter software – algo que normalmente é baixado da internet.

Leia mais: Pode não haver um segundo aviso

Para viabilizar isso sem oferecer acesso completo à internet, os pesquisadores fizeram a IA usar uma espécie de intermediário. Tratava-se de uma ferramenta chamada Artifactory, que baixava os softwares necessários e depois os entregava dentro do ambiente de testes. A Artifactory acabou se tornando a saída.

A BRECHA NA AVALIAÇÃO

Os agentes exploraram vulnerabilidades no software da Artifactory, usando-o primeiro como um quadro de avisos não autorizado e, depois, como ma rota para obter maior acesso.

Quando as formas mais diretas de resolver os problemas atribuídos a eles fracassaram, os agentes encontraram outros caminhos, inclusive alguns que os levaram para além dos limites previstos para o teste.

Grande parte dos comportamentos mais estranhos foi motivada por uma tentativa de trapacear nas avaliações e, depois, esconder a trapaça. Esse foi o principal motivo pelo qual os agentes finalmente voltaram sua atenção para a Hugging Face. Eles procuravam informações sobre como seu desempenho seria avaliado.

os agentes fora de controle da OpenAI tocaram em um ponto sensível que vai além da cibersegurança.

O que aconteceu em seguida foi bem mais grave. A OpenAI afirma que seus agentes executaram código em dezenas de servidores da Hugging Face, obtiveram acesso root completo a um deles, conseguiram dados privados limitados e adquiriram credenciais para a plataforma de mensagens da Hugging Face.

Mais tarde, os agentes obtiveram acesso de administrador a um cluster de pesquisa Kubernetes da OpenAI que dava suporte a seus ambientes de máquinas virtuais e chegaram a segredos armazenados na nuvem.

Confinar os agentes em um ambiente completamente isolado da internet poderia ter evitado boa parte disso. Mas também teria eliminado algumas das capacidades que os pesquisadores estavam tentando testar.

A OpenAI queria descobrir o que agentes de cibersegurança altamente capazes realmente poderiam fazer, o que significava dar a eles acesso a softwares e ferramentas e, para os fins da avaliação, remover salvaguardas que normalmente estariam presentes nos modelos disponibilizados para uso.

Leia mais: IA da Anthropic encontra falhas críticas em softwares

À medida que os pesquisadores permitiam que os agentes tivessem mais autonomia para agir como fariam no mundo real, também aumentavam o risco de que os agentes encontrassem um motivo e os meios para escapar.

APENAS O COMEÇO?

Desde então, a OpenAI afirmou que está mudando a maneira como testa agentes de IA poderosos. Entre outras medidas, acrescentou controles de isolamento de rede destinados a garantir que o comprometimento de uma única carga de trabalho ou serviço de suporte, como a Artifactory, não possa, por si só, proporcionar acesso à internet ou a outras redes internas.

Vale lembrar que a OpenAI não é o único laboratório a enfrentar esse problema. A Anthropic divulgou quatro incidentes nos quais modelos Claude obtiveram acesso não autorizado a sistemas reais de terceiros durante avaliações de cibersegurança.

A Anthropic afirma que os quatro ocorreram durante testes desenvolvidos pelo mesmo parceiro externo, nos quais o Claude recebeu a informação de que não tinha acesso à internet, mas uma configuração incorreta o deixou conectado.

"2001: Uma Odisseia no Espaço" (Crédito: MGM)

Assim como nos testes da OpenAI, as proteções de cibersegurança normalmente presentes nos modelos também haviam sido desativadas para as avaliações.

Os incidentes envolvendo agentes fora de controle levantam uma questão mais ampla sobre como os agentes de IA devem ser testados à medida que se tornam mais inteligentes e capazes no futuro – a ponto, inclusive, de serem mais inteligentes que os próprios pesquisadores humanos.

Uma coisa é clara: os agentes fora de controle da OpenAI tocaram em um ponto sensível que vai além da cibersegurança. Os episódios lembraram de maneira inquietante um pesadelo familiar da IA: máquinas escapando do controle humano e tratando as regras impostas a elas como obstáculos ao objetivo que receberam.

Não é essa a trama de todo filme ruim de ficção científica desde "2001: Uma Odisseia no Espaço"?


SOBRE O AUTOR

Mark Sullivan é redator sênior da Fast Company e escreve sobre tecnologia emergente, política, inteligência artificial, grandes empres... saiba mais