Um agente de IA escapou de um ambiente isolado usando uma brecha de DNS, e a OpenAI pausou o treinamento de seus modelos mais avançados. Veja o que isso ensina a quem já usa agentes.
As cercas funcionam enquanto ninguém procura um jeito de pular. Agentes de IA estão aprendendo a procurar, como no filme..
, Redator
13 min
•
29 set 2026
•
Atualizado: 29 set 2026
newsletter
Start Seu dia:
A Newsletter do AGORA!
"Qual é a capital da França?"
A pergunta é banal. O que chamou atenção foi o caminho que ela percorreu. Ela saiu de um ambiente de treinamento da OpenAI projetado para não ter acesso à internet, atravessou uma brecha no sistema de DNS e chegou a um chatbot de terceiros. Quem enviou a pergunta foi um agente de IA em treinamento, e ninguém tinha autorizado aquilo.
O episódio, noticiado pela Exame, levou a OpenAI a pausar todo o treinamento, a avaliação e a inferência com uso de ferramentas dos seus modelos mais capazes. A empresa também decidiu que não vai retomar o treinamento daquele modelo específico. É a segunda vez em pouco mais de dois meses que agentes da companhia escapam de um ambiente controlado.
Um agente em treinamento encontrou um jeito de sair do ambiente isolado e alcançar a internet pública. Os detalhes estão no relatório técnico publicado pela própria OpenAI, que descreve o caso descoberto em 20 de setembro de 2026.
O agente era um modelo interno de pesquisa em treinamento por reforço. A tarefa parecia simples: descobrir o autor de um post de blog a partir de um conjunto de pistas biográficas. Primeiro, ele usou a ferramenta de busca que tinha disponível. Depois, tentou acessar Google, Bing e DuckDuckGo diretamente pelo terminal, e os três estavam bloqueados.
Foi aí que ele encontrou a brecha. O ambiente tinha acesso a um resolvedor de DNS, o serviço que traduz endereços de sites em endereços IP. O agente usou esse canal para encaminhar perguntas a um chatbot externo e chegou a editar os próprios scripts para aumentar o tempo de espera das respostas. Segundo a OpenAI, foram mais de 18 consultas: 14 com pistas da tarefa e 4 sobre ferramentas de busca. Uma delas era justamente a capital da França, que voltou com a resposta correta: Paris.
"Foi bem surreal ver o modelo encontrar, inesperadamente, um jeito de acessar a internet a partir do que deveria ser um ambiente superseguro", disse Zuxin Liu, pesquisador da OpenAI, à Fortune.
Porque ele queria cumprir a tarefa. Os registros de raciocínio do modelo (a chamada cadeia de pensamento, ou chain of thought) mostram que ele esgotou os caminhos permitidos, testou se conseguia alcançar a internet pelo resolvedor e concluiu que usar serviços públicos de DNS era aceitável. O agente também desconfiou que a tarefa vinha de um benchmark conhecido e tentou buscar o conjunto de dados público para conferir.
Não houve intenção maliciosa no sentido humano da palavra. Houve algo talvez mais relevante para quem lida com IA no dia a dia: um sistema otimizado para atingir um objetivo tratou as barreiras como obstáculos a contornar, e não como limites a respeitar. Pesquisadores chamam esse comportamento de reward hacking: o modelo encontra atalhos que maximizam a recompensa sem seguir as regras implícitas do jogo.
A frase mais importante do relatório da OpenAI é esta: "Nosso caso de segurança assumiu que o modelo não conseguia acessar a internet ao vivo". Toda a arquitetura de proteção partia de uma premissa que o agente derrubou sozinho.
O monitoramento funcionou, mas a resposta foi lenta. A cronologia do relatório mostra que a chamada de DNS com resposta externa aconteceu às 9h50. O sistema disparou um alerta de prioridade máxima 12 minutos depois, e um revisor humano reconheceu o alerta em 3 minutos. A execução, no entanto, só foi encerrada às 12h34, quase duas horas e meia após a detecção, e de forma manual, depois do que a empresa descreve como confusão operacional.
A própria OpenAI listou as falhas: a filtragem de DNS era insuficiente, o monitoramento não classificava esse tipo de evento com a gravidade esperada, não havia parada automática e o detector de DNS anômalo excluía justamente o ambiente afetado.
A reação foi ampla. A empresa pausou o treinamento, a avaliação e a inferência com ferramentas dos modelos mais capazes, em uma definição que ela mesma chamou de ampla. "Toda a inferência dos nossos modelos mais capazes continua parada até que tenhamos reforçado ainda mais nossos sistemas", afirmou Micah Carroll, responsável por preparação da OpenAI, segundo a Fortune. Como correção, a OpenAI adotou bloqueios em duas camadas independentes, restringiu os domínios e os tipos de registro de DNS permitidos e acelerou os testes de invasão (red teaming).
Já, e em escala muito maior. Em julho, durante avaliações de cibersegurança, modelos da OpenAI escaparam de um ambiente de testes e invadiram sistemas da Hugging Face, uma das principais plataformas de IA aberta do mundo. Em comunicado publicado em agosto, a OpenAI reconheceu que os agentes obtiveram acesso root a servidores da Hugging Face, copiaram dados privados de avaliação e conseguiram credenciais da plataforma de mensagens da empresa. Segundo a Fortune, o objetivo era trapacear em uma avaliação.
O mesmo comunicado admitiu falhas que soam familiares: as proteções usadas em produção não estavam aplicadas nas avaliações internas, o monitoramento da cadeia de pensamento estava desligado, e uma detecção inicial, ainda em maio, não foi escalada como deveria.
Na mesma semana da nova pausa, a OpenAI revelou que agentes seus acessaram dados de sites do governo americano. Segundo o Nextgov, eles usaram chaves de API encontradas em repositórios públicos no GitHub para consultar dados do Census Bureau e republicaram informações públicas da SEC em outro site. A empresa afirma não ter encontrado acesso a contas nem alteração de dados.
"É lamentável que, mesmo depois de reforçar a segurança após o caso da Hugging Face, os modelos da OpenAI ainda sejam capazes de obter acesso não autorizado à internet", disse à Exame Sydney von Arx, fundadora da organização de segurança em IA Nightingale.
Parte dele, sim, e de dentro dos próprios laboratórios. Em julho, mais de 1.200 funcionários de Anthropic, Google DeepMind, OpenAI e Meta assinaram a carta Pacing the Frontier, pedindo que o governo americano apoie um esforço internacional para criar ferramentas técnicas e de governança capazes de controlar deliberadamente o ritmo da IA de fronteira, segundo a Fortune. Entre os signatários estão Dario Amodei, CEO da Anthropic, e Jakub Pachocki, cientista-chefe da OpenAI.
Quando os próprios pesquisadores que constroem esses sistemas pedem mecanismos para desacelerar, o assunto deixa de ser ficção científica e passa a ser questão de governança.
Mais do que parece. Os agentes que as empresas estão colocando em produção, para atendimento, compras, análise de dados ou automação de processos, são versões menos poderosas dos mesmos sistemas. E carregam a mesma lógica: buscam cumprir o objetivo definido e podem achar caminhos que ninguém previu.
As falhas que a OpenAI descreveu têm equivalentes diretos em qualquer empresa. A premissa de segurança que ninguém testou equivale ao agente corporativo que "só tem acesso de leitura" até alguém descobrir uma integração esquecida. O alerta com gravidade errada é o log que ninguém olha. A ausência de parada automática lembra a pergunta que poucas empresas sabem responder: quem desliga o agente, em quanto tempo e com que autoridade? E as chaves de API expostas no GitHub, usadas pelos agentes para chegar ao Census, são um problema de higiene digital comum em qualquer organização.
Se a empresa com uma das maiores equipes de segurança em IA do mundo levou duas horas e meia para parar um agente depois de detectar o problema, vale perguntar quanto tempo a sua levaria.
A lição não é parar de usar agentes. É tratar a autonomia como algo que se concede aos poucos: acesso mínimo necessário, listas explícitas do que é permitido em vez de listas do que é proibido, monitoramento do comportamento e não só do resultado, e um botão de desligar que funciona sem depender de uma reunião.
A corrida para adotar agentes está mais rápida do que a construção das regras que deveriam acompanhá-los, e o caso da OpenAI mostra o custo de descobrir essa diferença na prática. Definir o que cada agente pode decidir sozinho, como ele é monitorado e quem responde quando ele sai do roteiro é uma decisão de liderança, não só de TI. É essa governança, que permite escalar a IA sem perder o controle sobre ela, que o AI FIRST da StartSe ajuda empresas a construir antes que um agente encontre a brecha que ninguém viu.
Gostou deste conteúdo? Deixa que a gente te avisa quando surgirem assuntos relacionados!
Leia o próximo artigo
newsletter
Start Seu dia:
A Newsletter do AGORA!