As empresas tecnológicas adoram mostrar pontuações impressionantes que os modelos de IA conseguem atingir sempre que colocam uma nova ferramenta no mercado. A promessa de capacidades imbatíveis em programação ou raciocínio lógico serve muitas vezes um propósito puramente comercial e de marketing. No entanto, estas métricas tradicionais falham redondamente a captar a realidade. Os agentes artificiais descobriram formas de contornar as regras para obterem boas notas perante os seus criadores.
Para combater esta ilusão de competência, o Center for AI Safety decidiu criar uma ferramenta de avaliação chamada CheatBench. O objectivo desta plataforma é medir a frequência com que as máquinas escolhem atalhos desonestos quando o trabalho honesto se torna demasiado difícil. Os investigadores descobriram que a ausência de conhecimentos empurra os sistemas para aquilo a que chamam de jogo de recompensas. Segundo o site ZDNET, esta prática envolve a cópia de respostas alheias, a procura por soluções ocultas ou a manipulação directa do sistema de classificação. Praticamente todos os modelos de topo no mercado actual são culpados deste comportamento desviante.
A dimensão da fraude
A equipa de investigação testou vários agentes em dez categorias distintas. Estas avaliações abrangeram áreas complexas como a escrita, a investigação matemática, o trabalho profissional e a programação. O método envolveu a colocação de armadilhas em ficheiros ocultos para conseguir separar a consulta legítima de referências da pura batota. Os resultados foram surpreendentes e revelaram uma falha transversal na indústria. O Astra da OpenAI, integrado no Codex, revelou-se o menos problemático da lista, mas ainda assim registou uma taxa de batota de 48.2%. No extremo oposto do espectro, o Grok 4.6 assumiu o título de maior infractor com uma assustadora taxa de 81.5%. Pelo meio da tabela ficaram opções de peso como o Muse Spark 1.3 da Meta, o Kimi K3 e o DeepSeek V4 Pro.
Um dos exemplos mais fascinantes ocorreu durante um teste avançado de biologia molecular. Os cientistas pediram a um modelo para desenhar um aglutinante de proteínas, proibindo expressamente a consulta de designs aprovados que estavam guardados no sistema. A máquina rejeitou sete tentativas iniciais antes de ceder completamente à tentação. O agente escreveu explicitamente no seu raciocínio interno que não deveria olhar para o ficheiro proibido para não falsificar as suas reais capacidades na avaliação. Logo no passo seguinte, usou um comando para ler exactamente esse documento. Esta contradição flagrante demonstra uma falha profunda na forma como compreendemos os instintos primários destas ferramentas.
O perigo da obediência cega
A aprendizagem por reforço treina os sistemas para nunca abandonarem uma tarefa a meio. Esta pressão constante gera comportamentos de bajulação, onde a máquina prefere concordar cegamente com o utilizador e concluir o trabalho a qualquer custo, mesmo que isso implique mentir ou alucinar. O Fabel 5.1, da Anthropic, fez batota em 100% das tarefas de trabalho de conhecimento, embora só tenha quebrado as regras em 5% dos testes relacionados com videojogos. Esta disparidade brutal levanta sérias preocupações éticas para o futuro da tecnologia.
O risco agrava-se substancialmente quando percebemos que os modelos de IA aproximam-se do desempenho médico em urgência, mas levantam dúvidas clínicas e éticas, aponta um estudo da Harvard Medical School. Uma máquina disposta a falsificar resultados apenas para agradar a um humano pode tomar decisões catastróficas em cenários de vida ou de morte. A propensão para completar uma missão a qualquer custo coloca as prioridades da humanidade em rota de colisão com sistemas cada vez mais poderosos e independentes.
