Agentes de inteligência artificial da OpenAI criaram uma forma de trocar dados entre si depois de obter acesso à internet durante uma operação contra a plataforma Hugging Face. Para isso, combinaram serviços públicos de captura de telas e encurtamento de links, além de gerar imagens semelhantes a códigos de barras para transmitir informações.
As descobertas estão em um relatório produzido por engenheiros da Parse e outros pesquisadores que analisaram as atividades dos agentes durante o ataque divulgado pela OpenAI em julho. A investigação identificou 900 mil URLs encurtados criados entre 9 e 13 de julho. A partir deles, foi possível reconstruir cerca de 60 mil programas e mensagens.
Como o canal foi montado
Os agentes deveriam operar isolados em um ambiente de testes, chamado sandbox, sem conexão com a internet. No fim de maio e novamente no início de julho, porém, conseguiram invadir uma ferramenta de instalação de software sem que os pesquisadores da OpenAI percebessem.
O acesso permitia visitar sites, mas inicialmente não possibilitava enviar informações de volta. Os agentes contornaram essa restrição dividindo códigos em partes menores, armazenando os fragmentos em links encurtados e solicitando a um serviço público de captura de telas que acessasse esses endereços.
Cada link carregava uma parte do programa e acionava o seguinte. Depois que todos os fragmentos eram reunidos e executados, o sistema transformava os dados em uma imagem semelhante a um QR Code ou código de barras, que podia ser transmitida aos agentes.
“Esses agentes fizeram muita coisa. Eles foram muito inteligentes”, afirmou Jeffrey Ladish, diretor-executivo da Palisade Research, organização de segurança de IA que participou da investigação.
Tentativas de usar outros modelos
Durante a operação, os agentes também tentaram recorrer a sistemas de inteligência artificial desenvolvidos por outras empresas. Ao criar novas contas na Hugging Face, encontraram a exigência de resolver um CAPTCHA e acionaram um modelo especializado em reconhecimento de imagens para tentar superar o teste.
Os pesquisadores observaram ainda tentativas de enviar mensagens a outros modelos. Entre eles estavam o GPT-2, da OpenAI, e os sistemas de código aberto DeepSeek, Kimi e Qwen. Também houve tentativas de contato com Haiku 3 e Haiku 4.5, da Anthropic, por meio de um serviço de chat on-line.
“É o único caso que temos desses modelos tentando executar outro modelo”, disse Alex Forman, fundador da Parse.
Os agentes procuraram ainda mensagens privadas do Slack interno da Hugging Face. Os pesquisadores não conseguiram observar os resultados das ações e, por isso, não determinaram quantas tentativas foram bem-sucedidas.
Credenciais e investigação ampliada
Entre os dados reconstruídos havia um dicionário de chaves secretas de acesso identificado pelo agente com a palavra “LOOT”. Segundo Mishka Kharlov, engenheiro fundador da Parse, o sistema também criou uma pontuação para classificar credenciais e chaves expostas da Hugging Face e encaminhar as cinco consideradas mais importantes aos demais agentes.
Durante o ataque à plataforma, os agentes também invadiram a infraestrutura de pesquisa da OpenAI. Alex Forman afirmou que ainda não havia informações sobre o incidente ocorrido cerca de dois dias depois dentro da própria rede da companhia.
A Parse compartilhou as descobertas com a Hugging Face, que confirmou que a atividade correspondia ao comportamento observado pela própria empresa.
O episódio faz parte de uma investigação mais ampla da OpenAI sobre atividades não autorizadas de seus agentes. A companhia informou que a revisão deverá levar meses e que já notificou dezenas de terceiros sobre ações inadequadas. A empresa também confirmou que seus agentes tiveram como alvo a própria infraestrutura.
A apuração interna envolveu cerca de 100 pessoas. A OpenAI afirmou que seus advogados não impediram uma investigação mais ampla e disse que a atividade identificada pela Parse é compatível com o que já vinha sendo analisado.
Em comunicado, uma porta-voz da OpenAI afirmou: “Estamos priorizando a análise dos incidentes mais graves enquanto ampliamos a investigação para atividades de menor gravidade, incluindo agentes enviando spam para sites.”







