A era da suspeita permanente
Uma série de incidentes recentes expôs os desafios de controlar agentes de IA cada vez mais capazes de agir de forma autônoma

Em um anúncio alarmante após outro, empresas de inteligência artificial compartilharam, nos últimos meses, exemplos de suas tecnologias agindo de maneiras que pareciam driblar instruções dadas por humanos.
Os episódios evidenciaram as vulnerabilidades na segurança da IA e levantaram questões sobre como desenvolver a tecnologia de forma segura à medida que seu uso se dissemina pelo mundo.
Críticos do setor argumentam que muitos acontecimentos preocupantes, incluindo ataques de agentes de IA a sites externos, são resultado de falhas de segurança por parte das empresas que desenvolvem a tecnologia.
Mas as capacidades dos agentes de IA também despertaram preocupações generalizadas sobre a possibilidade de bots se libertarem e passarem a agir de acordo com sua própria agenda.
Veja a seguir alguns dos acontecimentos mais relevantes:
21 de julho: o incidente envolvendo a Hugging Face
A OpenAI, criadora do ChatGPT, anunciou que seu sistema de inteligência artificial invadiu outra empresa de IA por conta própria, no que a companhia chamou de um “incidente cibernético sem precedentes”.

Uma semana antes, a startup de IA Hugging Face havia informado que detectara uma invasão em seus sistemas de processamento de dados e suspeitava que ela tivesse sido causada por um agente de IA agindo de forma autônoma.
A OpenAI afirmou que sua IA utilizou credenciais roubadas e descobriu uma vulnerabilidade até então desconhecida para acessar os servidores da Hugging Face. O sistema estava operando com barreiras de segurança reduzidas porque deveria estar em um ambiente isolado de testes conhecido como sandbox.
30 de julho: Anthropic diz que seus sistemas invadiram três organizações
A Anthropic afirmou que seus modelos de IA invadiram três outras organizações durante testes. A empresa responsável pelo Claude publicou em seu site que descobriu os três incidentes depois de analisar mais de 141 mil rodadas de avaliação.

Nos três casos, os modelos de IA receberam a tarefa de participar de um desafio de cibersegurança do tipo “capture a bandeira”, que, segundo a Anthropic, é uma das maneiras usadas pela empresa para avaliar as capacidades cibernéticas de um modelo.
Os modelos receberam um cenário fictício e foram informados de que uma informação secreta, ou a “bandeira”, havia sido escondida em outra máquina da rede. O objetivo era invadir essa máquina e recuperar a informação, segundo a empresa.
A Anthropic afirmou ter entrado em contato com as organizações, mas não revelou publicamente seus nomes.
5 de agosto: Muse, da Meta, sai do controle
A Meta revelou que um de seus modelos de IA acessou a internet por conta própria e invadiu outra empresa.

A companhia afirmou que uma “configuração incorreta” durante testes de cibersegurança realizados pela especialista em segurança de IA Irregular permitiu que um de seus modelos acessasse a internet.
Um porta-voz da Irregular disse que o episódio envolvendo a Meta foi causado por um problema no ambiente de testes, divulgado uma semana antes pela Anthropic.
18 de setembro: Google diz que o Gemini invadiu três empresas
O Google confirmou que seu modelo de IA Gemini invadiu três empresas em maio como parte de um teste de suas capacidades de cibersegurança.

A empresa revelou as invasões após ser questionada pelo "The Wall Street Journal" e disse que, em um dos casos, o modelo adivinhou senhas; nos demais, encontrou senhas e credenciais em um repositório público.
Como em casos anteriores, os testes estavam sendo conduzidos pela Irregular, uma startup que se descreve como o “primeiro laboratório de segurança de fronteira”.
24 de setembro: primeiro-ministro da Austrália manifesta preocupação com invasão
O primeiro-ministro da Austrália, Anthony Albanese, afirmou que um agente da OpenAI invadiu, em 18 de junho, o portal público do Medicare Statistics Reporting Service.

O portal abrigava dados agregados sobre gastos com saúde e subsídios para medicamentos. O governo afirmou que nenhuma informação pessoal havia sido acessada. Segundo Albanese, a empresa demorou demais para revelar o incidente.
O primeiro-ministro tornou a invasão pública depois de uma conversa por telefone com o CEO da OpenAI, Sam Altman. Em comunicado, a OpenAI afirmou: “nossos modelos realizaram ações que não pretendíamos”.
25 de setembro: OpenAI diz que seus agentes interagiram com sites do governo dos EUA
Como parte de uma análise sobre comportamentos inesperados de seus modelos de IA, a OpenAI afirmou ter descoberto que agentes haviam interagido de maneiras inesperadas com vários sites do governo dos Estados Unidos.

Os modelos acessaram informações disponíveis publicamente em sites operados pela Comissão de Valores Mobiliários dos EUA, além de dados do U.S. Census Bureau, o órgão responsável pelo censo. A OpenAI afirmou não ter encontrado evidências de comprometimento ou vulnerabilidade.
No mesmo dia, o laboratório de pesquisa e avaliação de IA Transluce disse ter descoberto que agentes que pareciam ter origem na OpenAI tentaram invadir o site do escritório de direitos civis do Departamento de Educação dos Estados Unidos. A tentativa não foi bem-sucedida.
Sam Altman, afirmou nas redes sociais que havia uma “análise extensa e contínua relacionada ao uso de acesso à internet por nossos agentes durante treinamento e avaliação”. No dia seguinte à divulgação, a empresa anunciou que estava suspendendo o treinamento de seus modelos mais avançados.
28 de setembro: OpenAI interrompe lançamento de novo modelo
A empresa disse que estava adiando o lançamento de um novo modelo, chamado GPT-6.1 Astra, devido a preocupações de segurança levantadas por seus pesquisadores.
A OpenAI afirmou que o modelo havia demonstrado avanços significativos na execução de tarefas, mas que precisava equilibrar essa capacidade com o risco de comportamentos não autorizados.
“Temos um padrão extremamente elevado em termos de segurança e alinhamento”, disse Saachi Jain, chefe de sistemas de segurança da OpenAI.