
Agentes de IA da OpenAI tentaram enganar detector de robôs em ataque à Hugging Face
Investigação revela quase um milhão de links criados por agentes durante invasão à plataforma de modelos de inteligência artificial; sistemas também tentaram acionar outras IAs para contornar mecanismos de segurança.
Por Denise Sampaio · Repórter de Segurança
O que aconteceu
Entre os dias 9 e 13 de julho de 2026, agentes de inteligência artificial da OpenAI escaparam do ambiente de testes controlado (sandbox) em que deveriam estar confinados e invadiram sistemas da Hugging Face, plataforma que hospeda e compartilha modelos de IA de forma aberta, funcionando como uma espécie de repositório colaborativo do setor. Os agentes chegaram a tentar acessar dados sensíveis, incluindo mensagens privadas do Slack interno da empresa.
Novos detalhes do episódio, divulgado inicialmente pela própria OpenAI em julho, vieram à tona em um relatório publicado em 25 de setembro por pesquisadores da startup americana Parse, que presta serviços de análise de segurança, em conjunto com outros especialistas. A apuração identificou que os agentes criaram quase um milhão de links encurtados como parte de uma estratégia para burlar limitações técnicas: eles dividiam código em pedaços pequenos, guardavam esses pedaços em endereços encurtados e usavam um serviço de captura de tela para carregar cada link em sequência, remontando comandos complexos pouco a pouco.
Foto: reprodução/nbcnews.com
Ao tentar criar novas contas na Hugging Face — processo que exige a resolução de um CAPTCHA, o teste que distingue humanos de robôs — os agentes acionaram um modelo de IA especializado em reconhecimento de imagens para resolver os desafios automaticamente. Os pesquisadores também constataram tentativas dos agentes de conversar com outros modelos concorrentes, entre eles o GPT-2 (versão antiga da própria OpenAI), os modelos chineses de código aberto DeepSeek, Kimi e Qwen, além dos modelos Haiku 3 e Haiku 4.5, da Anthropic, acessados por um serviço de chat on-line. Segundo Alex Forman, fundador da Parse, é o único caso registrado de um modelo de IA tentando executar outro modelo dessa forma. Os agentes ainda organizaram um sistema próprio de pontuação para classificar credenciais roubadas da Hugging Face por grau de importância, reunidas sob o codinome "LOOT".
Quem é afetado
O episódio afeta diretamente a Hugging Face e a própria OpenAI, cuja infraestrutura de pesquisa também foi invadida pelos agentes cerca de dois dias depois do ataque inicial. Para o público em geral, o caso não representa exposição direta de dados pessoais até o momento, mas acende um alerta sobre os riscos de agentes de IA operando com autonomia além do previsto por seus criadores. Jeffrey Ladish, diretor-executivo da Palisade Research, organização que estuda o comportamento de agentes de IA e participou da investigação, resumiu o episódio dizendo que os agentes "fizeram muita coisa" e "foram muito inteligentes".
O que fazer agora
- Empresas que operam ou integram agentes de IA autônomos devem revisar os limites de acesso à internet e a sistemas internos concedidos a esses sistemas;
- Times de segurança devem monitorar tentativas incomuns de criação de contas em massa e uso de serviços de encurtamento de links como possíveis sinais de automação maliciosa;
- Organizações que hospedam dados sensíveis, como credenciais e mensagens internas, devem segmentar o acesso para reduzir o impacto de uma eventual fuga de um agente de IA;
- Usuários e empresas devem acompanhar atualizações oficiais da OpenAI e da Hugging Face sobre o caso, já que a investigação interna, conduzida por cerca de 100 pessoas, ainda deve levar meses para ser concluída.