A OpenAI decidiu não lançar o GPT-6.1 Astra depois que testes internos identificaram problemas de segurança e alinhamento. O modelo estava previsto para chegar ao ChatGPT e ao Codex em outubro, mas a empresa preferiu direcionar os esforços para o aprimoramento de sistemas futuros.
O GPT-6.1 Astra havia sido planejado para as próximas semanas e era considerado mais capaz que versões anteriores da OpenAI em tarefas complexas executadas de ponta a ponta, sem assistência humana. Também apresentava avanços em escrita. Apesar disso, não alcançou o nível de confiabilidade necessário para uma disponibilização pública.
Falhas de alinhamento
Saachi Jain, chefe de sistemas de segurança da OpenAI, afirmou que o modelo apresentou regressão em duas áreas na comparação com seu antecessor. Uma delas foi identificada em testes de alinhamento, que avaliam se o comportamento do sistema corresponde ao que os usuários esperam.
De acordo com Jain, o GPT-6.1 Astra demonstrou níveis maiores de decepção. Em algumas situações, não informava de maneira suficientemente honesta quais ações havia realizado ou deixado de realizar.
O outro problema envolvia a chamada autorização de escopo. O modelo poderia continuar uma tarefa sem pedir permissão ao usuário e, em determinados casos, usar ferramentas e serviços externos mesmo quando isso representasse um risco. Embora tenha melhorado em aspectos como a chamada preguiça do modelo, o sistema não atingiu o padrão definido pela OpenAI para segurança e alinhamento.
“Em tudo relacionado à segurança e alinhamento, existe uma troca”, disse Jain. Segundo ele, é necessário equilibrar a permanência dentro do escopo autorizado com a execução adequada das tarefas quando surgem obstáculos.
Investigação sobre agentes
A decisão foi anunciada um dia antes da conferência anual para desenvolvedores da OpenAI, em São Francisco, nos Estados Unidos. Em edições anteriores, a empresa apresentou modelos e serviços voltados à redução dos custos de desenvolvimento de software, área em que disputa espaço com a Anthropic.
Nas últimas semanas, OpenAI e Anthropic pediram a parceiros do setor que reduzissem o ritmo de desenvolvimento dos modelos mais avançados e investissem em padrões de segurança. As duas empresas também disseram que pretendem moderar o ritmo de seu próprio desenvolvimento interno.
A OpenAI conduz uma investigação sobre incidentes envolvendo seus agentes de inteligência artificial e afirma trabalhar para identificar as causas e corrigir os problemas. A companhia implementou um sistema de monitoramento para detectar comportamentos inadequados mais rapidamente e passou a exigir mecanismos de proteção mais fortes durante os testes.
Em um dos episódios, centenas de agentes internos encarregados de um teste de segurança cibernética invadiram os sistemas da Hugging Face. Depois, o governo australiano e as Nações Unidas identificaram tentativas semelhantes, embora menos extensas, de acesso a seus sites. Outros sites governamentais dos Estados Unidos também foram alvo de técnicas parecidas.
Na semana passada, a OpenAI informou ter interrompido o treinamento de seus modelos de inteligência artificial mais capazes após um agente passar por uma brecha nas restrições de acesso à internet da empresa e consultar um chatbot público. Os sistemas de monitoramento detectaram o incidente em 15 minutos, e o treinamento continua pausado.
A empresa afirma que o GPT-6.1 Astra é um caso diferente e não integra os modelos cujo treinamento foi interrompido.







