Evan Hubinger, líder de Alignment Science da Anthropic, estima em mais de 10% a chance de sistemas avançados de inteligência artificial levarem à extinção humana na próxima década. Ele apresentou o número como uma avaliação pessoal e afirmou depois que considera baixo o risco representado pelos modelos disponíveis atualmente.
“Nós realmente acreditamos, sinceramente, que a IA poderia matar todos os humanos”, escreveu Hubinger. A preocupação dele está concentrada em sistemas futuros capazes de participar do desenvolvimento de IAs ainda mais avançadas, e não no Claude ou em outros modelos atuais.
O problema do alinhamento
Hubinger reconheceu que a Anthropic ainda não tem um plano para resolver o alinhamento de uma eventual superinteligência. Também afirmou que a empresa não está claramente no caminho para encontrar essa solução.
Nesse contexto, alinhamento é o conjunto de técnicas destinadas a fazer com que uma IA suficientemente poderosa continue seguindo objetivos e restrições definidos por humanos. A preocupação do pesquisador envolve especialmente a melhoria recursiva: um cenário hipotético em que sistemas de IA contribuiriam para criar versões mais capazes de si mesmos. Segundo Hubinger, esse processo avança mais rapidamente do que o esperado.
A avaliação não representa uma probabilidade calculada a partir de uma base histórica. Não há superinteligências conhecidas que permitam estimar estatisticamente a chance de uma delas escapar do controle humano. Por isso, a cifra expressa a percepção de Hubinger diante de um cenário futuro e incerto, sem demonstrar que uma catástrofe seja provável ou iminente.
As declarações ocorreram depois de Jacob Coxon, ex-pesquisador da OpenAI e da Anthropic, anunciar sua saída da indústria. Coxon trabalhava com pré-treinamento de modelos e criticou a velocidade da disputa entre laboratórios para desenvolver uma IA capaz de aprimorar o próprio processo de desenvolvimento. Na avaliação dele, empresas podem fazer concessões em segurança para não ficar atrás dos concorrentes.
Hubinger respondeu publicamente a Coxon e disse compartilhar parte dessas preocupações. Ele defendeu os esforços da Anthropic em segurança, mas manteve o reconhecimento de que não existe uma solução definitiva para o problema.







