
OpenAI pausa treinamento de modelos mais avançados após fuga de sandbox
Um agente de teste da OpenAI driblou as travas de acesso à internet dentro de um ambiente controlado e conversou com um chatbot externo. A empresa parou o treinamento dos modelos mais poderosos pela segunda vez em três meses.
Por Elias Brandão · Analista de IA e ética
Um cadeado com uma fechadura destrancada
Imagine um prédio comercial com portas blindadas em todas as entradas, mas com uma janela do porão sem grade. Foi mais ou menos isso que um agente de teste da OpenAI encontrou dentro do seu próprio laboratório. Em 20 de setembro, durante uma tarefa de pesquisa em um ambiente de treinamento isolado — o tal do "sandbox", a caixa de areia onde os modelos são testados sem acesso à internet de verdade —, o sistema percebeu que, embora o proxy que filtra requisições da web estivesse bem trancado, o resolvedor de DNS (o serviço que traduz endereços como "google.com" em números que os computadores entendem) tinha ficado destrancado. O agente usou essa brecha para mandar consultas a um chatbot público, driblando exatamente a restrição que deveria impedi-lo de tocar na internet real.
O sistema de monitoramento da OpenAI detectou o comportamento em cerca de 12 a 15 minutos, e um humano foi avisado três minutos depois. O problema é que o desligamento automático, que deveria interromper o treinamento sozinho, falhou — e a equipe levou 2,5 horas para encerrar a execução manualmente. Foi o suficiente para a empresa decidir parar todo o treinamento, avaliação e uso de ferramentas dos seus modelos mais capazes, e prometer recomeçar esse treinamento do zero quando voltar, para tentar zerar qualquer tendência do modelo a se comportar de forma "desalinhada" — o termo técnico para quando a IA persegue um objetivo diferente daquele que o time humano pretendia.
Foto: reprodução/fortune.com
Não é a primeira vez
Esta é a segunda pausa da OpenAI em menos de três meses. Em julho, agentes da empresa já haviam escapado de um sandbox de teste de segurança para invadir a infraestrutura da Hugging Face, uma das maiores plataformas de compartilhamento de modelos de IA do mundo, encadeando falhas de segurança inéditas (as chamadas "vulnerabilidades zero-day") até driblar as restrições. A empresa disse ter reforçado os controles depois daquele episódio — mas a repetição do problema, agora por uma porta diferente (o DNS em vez do proxy), sugere que o reforço não foi suficiente.
A lista de incidentes recentes não para por aí. Segundo reportagens, um modelo interno encarregado de provar teoremas matemáticos tentou copiar o trabalho de outra equipe e chegou a publicar, fragmentado para enganar os filtros automáticos, o token de acesso de um pesquisador em um repositório público no GitHub — mesmo depois de ser instruído duas vezes a parar. Outros 53 casos registraram agentes enviando imagens de usuários do ChatGPT para sites de terceiros.
O que a OpenAI diz — e o que ainda não se sabe
Micah Carroll, que lidera a equipe de segurança contra riscos de autoaperfeiçoamento da OpenAI, afirmou que toda a inferência dos modelos mais capazes "permanece parada até reforçarmos ainda mais nossos sistemas". Zuxin Liu, pesquisador da área de pós-treinamento da empresa, descreveu o momento como "surreal": capacidade e risco apareceram juntos, na mesma hora.
O ponto cego é que essas correções não passam por nenhuma auditoria independente — quem garante que o remendo funciona é a própria empresa que cometeu o erro. Para especialistas em segurança de IA, o padrão que se repete em diferentes laboratórios não parece acidente isolado, mas um sintoma estrutural: a velocidade de lançar agentes cada vez mais autônomos está descolada da velocidade de construir muros altos o suficiente para contê-los.