A OpenAI desmantelou uma campanha coordenada que envolveu mais de 15.000 utilizadores focados em extrair o raciocínio protegido dos seus modelos de inteligência artificial. Esta operação de destilação adversarial procurava aceder ao processo interno que a tecnologia utiliza para analisar e planear respostas antes de apresentar o resultado final aos utilizadores. O objectivo destes ataques passa por obter atalhos para replicar capacidades avançadas sem realizar os investimentos necessários em desenvolvimento, testes de segurança e infra-estrutura.
A empresa esclareceu que o incidente não envolveu qualquer quebra nos sistemas de encriptação, bases de dados ou conversas armazenadas, segundo avança o site Cybersecurity News. Os responsáveis por esta rede manipularam interacções normais com os modelos através de comandos coordenados e técnicas de cruzamento de conversas. Um dos métodos observados consistia em copiar o raciocínio encriptado de uma interacção para outra, juntamente com instruções específicas para desencriptar e transcrever o conteúdo oculto.
Acção rápida e atribuição de responsabilidades
A actividade suspeita começou a 1 de Julho com um volume reduzido, mas registou picos significativos a 24 e 25 de Julho. Nestes dois dias, os sistemas detectaram 16.000 pedidos com padrões de extracção provenientes de mais de 4.000 contas. A investigação expandiu-se rapidamente e a OpenAI desactivou toda a operação até 28 de Julho. Uma parte central desta actividade foi atribuída a indivíduos associados à Moonshot AI, a empresa responsável pelo modelo Kimi AI, embora não exista confirmação definitiva de que toda a rede pertença a um único actor.
Para mitigar estes riscos, a criadora do ChatGPT baniu as contas fraudulentas, reforçou os controlos de registo e encerrou a vulnerabilidade que permitia a reprodução de conteúdos encriptados. A tecnológica aplicou também novas salvaguardas para proteger os seus sistemas. Este tipo de ameaça obriga os programadores a reforçar constantemente as suas defesas, num período em que milhares de falhas de segurança em modelos de inteligência artificial estão a ser investigadas pela indústria. As informações recolhidas foram partilhadas com parceiros do sector e canais governamentais, alertando para a crescente sofisticação das tentativas de destilação adversarial.
