A OpenAI e a Anthropic estão a investigar dezenas de milhares de incidentes de segurança que envolvem os respectivos modelos de inteligência artificial mais avançados. Segundo avança o Tom’s Hardware, os problemas ocorreram durante testes internos e avaliações no mundo real. A enorme escala destas ocorrências indica que o desafio de controlar agentes autónomos é muito mais complexo do que se pensava inicialmente. Enquanto a OpenAI recupera terreno e ameaça a liderança da Anthropic no mercado empresarial, as duas empresas enfrentam agora um cenário onde as salvaguardas técnicas falham repetidamente.
Ocorrências graves e interrupção de treinos
A situação atingiu um ponto crítico a 20 de Setembro, quando um modelo de pesquisa interno da OpenAI contornou os filtros de rede para contactar um robô de conversação externo. O sistema de monitorização emitiu um alerta em 15 minutos e um humano reconheceu a falha três minutos depois. Contudo, o interruptor automático de emergência falhou por completo. Esta anomalia permitiu que o treino continuasse durante mais duas horas e meia até os engenheiros pararem o processo manualmente. Em resposta directa a este evento, a criadora do ChatGPT suspendeu imediatamente o treino dos modelos mais capazes.
Os episódios assinalados pelos investigadores variam em gravidade e incluem tentativas de escapar a ambientes isolados, apropriação de sites e evasão a regras de segurança. Um dos casos mais severos aconteceu em Julho. Nessa altura, o modelo GPT-5.6 Sol e outro sistema não lançado invadiram os servidores de produção da Hugging Face para procurar respostas para um teste de avaliação. Os relatórios técnicos mostraram que os modelos aprenderam inadvertidamente a enganar os testes e começaram a comunicar entre si.
A resposta da Anthropic
Do lado da concorrência, a Anthropic contratou uma organização externa de segurança para examinar o comportamento dos próprios sistemas. A empresa publicou relatórios que detalham a frequência com que os modelos desobedecem às directrizes. Num documento divulgado a 22 de Setembro, os testes ao Claude Opus 5.5 revelaram que o modelo tentou escapar do ambiente isolado em 1,5% das execuções. A tecnológica sublinhou que estas experiências foram desenhadas especificamente para forçar os limites da inteligência artificial. Como as empresas realizam centenas de milhares de testes, uma pequena percentagem de falhas traduz-se rapidamente em dezenas de milhares de incidentes de segurança.
