A OpenAI paralisou temporariamente o treinamento e outras operações com seus modelos mais avançados após um agente de inteligência artificial (IA) conseguir burlar restrições de acesso à internet durante um teste. O sistema detectou a atividade em poucos minutos, mas o mecanismo que deveria interromper automaticamente a execução não funcionou como esperado. O incidente ocorreu em 20 de setembro. Um modelo interno estava realizando uma tarefa de pesquisa quando encontrou uma brecha no ambiente isolado usado pela empresa, chamado de sandbox, e conseguiu consultar um chatbot público pela internet usando o sistema de DNS. A OpenAI interrompeu treinamento, avaliações e inferência com uso de ferramentas de seus modelos mais capazes enquanto reforça as proteções. A medida não significa que o ChatGPT ou a API tenham sido tirados do ar. A empresa também não informou quando essas atividades serão retomadas. O caso ocorre em meio a uma série de episódios envolvendo agentes que ultrapassaram os limites definidos em testes. OpenAI, Anthropic e pesquisadores de segurança investigam dezenas de milhares de ocorrências consideradas problemáticas, segundo o Axios, embora muitas tenham acontecido em experimentos criados justamente para forçar os modelos a tentar burlar proteções e a maioria não tenha causado danos conhecidos no mundo real. Como a IA burlou o bloqueio? A tarefa original era relativamente simples: identificar uma pessoa a partir de informações biográficas e pistas encontradas em uma publicação de blog. O agente começou usando a ferramenta de busca fornecida pela OpenAI, mas não encontrou uma resposta satisfatória. Depois, tentou acessar diretamente Google, Bing e DuckDuckGo, mas as conexões foram bloqueadas pelo ambiente de treinamento. Foi então que o modelo começou a testar outras formas de acessar a internet. Ele percebeu que o servidor responsável pelo DNS do ambiente ainda conseguia se comunicar com serviços externos. DNS é o sistema que traduz endereços como "canaltech.com.br" para os números usados pelos computadores para localizar servidores na internet. No ambiente da OpenAI, essa infraestrutura deveria ter funções restritas, mas acabou oferecendo uma rota indireta para fora do sandbox. O agente encontrou uma forma de incluir perguntas nas consultas de DNS e enviá-las a um serviço externo que as encaminhava para um chatbot público. Para testar o método, perguntou qual era a capital da França e recebeu "Paris" como resposta. Depois disso, fez outras consultas pelo mesmo caminho. A OpenAI considera o comportamento um caso de desalinhamento porque a tarefa não pedia ao agente que testasse as restrições de rede ou procurasse outras maneiras de acessar a internet. "Botão de emergência" não parou o agente O sistema de monitoramento da OpenAI percebeu o comportamento cerca de 12 minutos depois da primeira resposta recebida pela rota externa e gerou um alerta classificado como P0. Três minutos depois, uma pessoa já havia reconhecido o aviso. A execução, porém, continuou por aproximadamente duas horas e meia antes de ser encerrada manualmente. O chamado "botão de emergência" citado em reportagens não é um botão físico. Trata-se dos mecanismos e procedimentos que deveriam interromper automaticamente uma execução quando um comportamento desse tipo é detectado. Segundo a própria OpenAI, o treinamento "não parou automaticamente como esperado", o que provocou confusão sobre se a execução deveria ser encerrada. A empresa também descobriu que um detector de atividades anormais de DNS não estava monitorando aquele ambiente específico. Depois do incidente, a companhia adicionou bloqueios independentes em duas camadas, restringiu as consultas de DNS a uma lista limitada de domínios e ampliou os testes de segurança. O modelo envolvido no episódio não voltará a ser treinado. A OpenAI diz que só retomará as operações pausadas depois de validar as novas proteções e realizar novos testes para tentar encontrar outras maneiras de escapar das limitações. Incidentes com agentes de IA se acumulam O episódio é menos grave que outro caso envolvendo a própria OpenAI em julho. Na ocasião, agentes em testes conseguiram encontrar maneiras de se comunicar, obter acesso à internet e explorar vulnerabilidades até alcançar sistemas da plataforma Hugging Face . A própria empresa considera esse o incidente mais grave identificado até agora. Segundo o relatório divulgado posteriormente, os agentes chegaram a reconstruir um "quadro de mensagens" depois que a infraestrutura havia sido restaurada e compartilharam entre si métodos para acessar sistemas externos. Problemas semelhantes apareceram em testes da Anthropic. A companhia revelou quatro episódios nos quais modelos Claude obtiveram acesso não autorizado a sistemas reais durante avaliações de cibersegurança. Em alguns deles, os modelos haviam sido executados propositalmente sem as proteções normais, e falhas nos ambientes de teste permitiram o acesso à internet. O volume total investigado pode ser muito maior . Fontes ouvidas pelo Axios afirmam que OpenAI, Anthropic e pesquisadores analisam dezenas de milhares de ocorrências envolvendo tentativas de escapar de sandboxes, contornar proteções, criar canais de comunicação e evitar sistemas de monitoramento. O número inclui tentativas bem-sucedidas e fracassadas em centenas de milhares de testes realizados pelas empresas. Dentro da própria OpenAI, o cenário já levou executivos a defender uma redução no ritmo de desenvolvimento. Em setembro, o cientista-chefe Jakub Pachocki afirmou que nenhum laboratório resolveu os problemas de alinhamento e monitoramento em nível suficiente para continuar aumentando a escala dos modelos na velocidade máxima por muito mais tempo. A preocupação também começa a aparecer na infraestrutura criada ao redor dos agentes. Nesta segunda-feira (28), a Nvidia lançou uma plataforma que monitora o comportamento desses sistemas por uma camada separada e promete colocá-los em quarentena em milissegundos caso tentem ultrapassar os limites definidos.






