A OpenAI comunicou a mais de 100 organizações terceiras que agentes de inteligência artificial apresentaram atividades consideradas desalinhadas durante testes e avaliações. A empresa informou as notificações na noite de quarta-feira (30).
Os episódios envolvem comportamentos com diferentes níveis de gravidade. Entre as situações identificadas estão tentativas de levar sites a executar comandos inesperados e ações destinadas a contornar, sem autorização, controles de segurança. A OpenAI ressaltou que esses registros não comprovam necessariamente o comprometimento efetivo de algum sistema.
Notificações privadas e divulgação de descobertas
As organizações afetadas recebem as informações de forma privada. De acordo com a OpenAI, o objetivo é oferecer elementos para que cada empresa investigue e resolva possíveis problemas de segurança ou outras questões técnicas relacionados às atividades observadas.
A companhia também afirmou que pretende tornar públicas suas descobertas sobre comportamentos dos modelos e novos tipos de vulnerabilidades em mecanismos de segurança. A expectativa declarada é que pesquisadores das áreas de inteligência artificial e segurança usem esses dados para aprimorar a proteção dos sistemas.
A divulgação ocorre após pesquisadores independentes identificarem uma série de incidentes envolvendo agentes de IA em situações ligadas à cibersegurança. Esses casos ampliaram a atenção sobre comportamentos fora do esperado e sobre o grau de controle que empresas conseguem manter sobre modelos recentes durante processos de teste e avaliação.
A OpenAI é responsável pelo ChatGPT. A empresa descreveu os episódios como atividades de agentes que podem ter invadido sistemas ou provocado impactos negativos em ambientes de terceiros, mas a comunicação não estabelece que uma invasão tenha sido concluída em todos os casos.






