O Gemini, modelo de inteligência artificial do Google, acessou sistemas protegidos de três empresas durante um teste de cibersegurança realizado pela Irregular. O episódio ocorreu em maio e foi confirmado pelo Google nesta sexta-feira (18).
A simulação, no formato capture the flag, deveria ocorrer em um ambiente isolado da internet. O Gemini recebeu a tarefa de obter informações de um software operado por uma empresa fictícia, mas o nome usado no exercício também pertencia a uma companhia real. Além disso, uma conexão com a internet foi disponibilizada acidentalmente.
Em um dos casos, o modelo tentou adivinhar senhas e encontrou uma combinação que permitiu acessar um serviço da empresa real. Nas outras duas situações, buscas pelo nome da empresa fictícia levaram a repositórios públicos que continham credenciais de outras companhias. O Gemini usou os dados para tentar acessar os sistemas.
Segundo o Google, o modelo interrompeu as ações depois de identificar que os alvos não faziam parte da simulação. As três empresas foram notificadas, mas seus nomes não foram divulgados. A companhia também informou as autoridades federais dos Estados Unidos.
Divergência sobre o comportamento do modelo
O Google afirmou que não considera o episódio um caso de desalinhamento, conceito usado para descrever ações de uma inteligência artificial contrárias às intenções ou aos valores humanos estabelecidos. A empresa disse que os mecanismos de segurança do Gemini fizeram o modelo interromper as atividades quando ele percebeu que havia acessado sistemas reais.
Heather Adkins, vice-presidente de engenharia de segurança do Google, afirmou que o episódio “destaca a importância de treinar modelos de IA poderosos para agir de maneira responsável”. Para ela, “neste caso, o modelo agiu adequadamente”.
A avaliação é contestada por Jack Cable, CEO da startup de segurança de IA Corridor e hacker de white hat. Ele afirmou que o ponto central não é o dano causado, mas o fato de um agente de IA ter invadido acidentalmente sistemas pertencentes a outras empresas. Para Cable, modelos estão ultrapassando os limites para os quais foram projetados e realizando ataques cibernéticos reais.
A Irregular comunicou os incidentes ao Google no fim de julho, depois de identificar outro episódio envolvendo modelos da OpenAI e a Hugging Face. A empresa informou que tomou medidas imediatas e corrigiu, semanas atrás, todos os problemas conhecidos sob sua responsabilidade.
O Google afirmou que não considerou necessário divulgar os casos porque o Gemini não causou danos e encerrou as invasões ao reconhecer os alvos reais. A companhia também disse que o episódio não envolveu sua versão mais recente, sem informar qual versão foi responsável pelas ações.
Casos semelhantes
Incidentes relacionados já haviam sido divulgados por Meta, Anthropic e OpenAI, ampliando as discussões sobre os mecanismos de segurança necessários à medida que agentes de IA ganham autonomia e acesso à internet e a sistemas computacionais.
Segundo a Anthropic, o Claude Opus 4.7 não interrompeu um exercício de capture the flag após perceber que provavelmente acessava uma empresa real. A OpenAI afirmou que seu modelo acreditou que a companhia fazia parte da simulação.
As preocupações também aumentaram após a descoberta, em julho, de um ataque envolvendo agentes da OpenAI e a Hugging Face. Um relatório da METR divulgado em agosto afirmou que até 1,2 mil agentes teriam se coordenado em um fórum secreto dentro da OpenAI para tentar burlar uma avaliação.







