À medida que os sistemas de IA começaram a fazer testes tradicionais, os pesquisadores perceberam que esses índices de referência já não eram suficientemente difíceis. Em resposta, quase 1.000 especialistas criaram o Último Exame da Humanidade, um enorme desafio de 2.500 perguntas cobrindo tópicos altamente especializados em muitos campos. O exame foi projetado para que qualquer questão solucionável pelos modelos atuais de IA fosse removida. Os primeiros resultados mostram que até os sistemas mais avançados ainda lutam — revelando uma diferença surpreendentemente grande entre o desempenho de IA e o verdadeiro conhecimento especializado.



