Pourquoi les IA échouent-elles encore aux tests d’intelligence humaine ? Le cas des puzzles ARC-AGI


En 2019, François Chollet, ingénieur chez Google et créateur de Keras, lance l’ARC-AGI (Abstraction and Reasoning Corpus – Artificial General Intelligence). Son objectif ? Évaluer la capacité des modèles à généraliser à partir de quelques exemples, une compétence clé de l’intelligence humaine. Contrairement aux benchmarks classiques (comme les tests de QI ou les jeux vidéo), ARC-AGI se concentre sur des grilles de couleurs où le modèle doit déduire une règle à partir de 1 à 3 exemples, puis l’appliquer à une nouvelle grille.
Les règles sont simples en apparence : transformer une grille en une autre, en appliquant des opérations comme l’inversion des couleurs, le déplacement de blocs ou la duplication de motifs. Pourtant, même les modèles les plus avancés, comme ceux d’OpenAI ou de Google, peinent à dépasser 10 % de réussite sur ARC-AGI-1, alors que les humains atteignent 80 à 100 %.
Les puzzles ARC-AGI sont conçus pour être découplés de toute connaissance préalable : pas de texte, pas de contexte culturel, juste des motifs visuels. Pourtant, les modèles actuels, même multimodaux, ne perçoivent pas les règles comme des entités abstraites, mais comme des motifs statistiques à reproduire. Comme l’explique Melanie Mitchell, chercheuse à l’Institute for Advanced Study de Santa Fe :
> « Les tests conçus pour les humains ne mesurent pas la même chose pour les machines. Une IA peut exceller à résoudre des équations différentielles, mais échouer à comprendre qu’un objet ne peut pas traverser un mur. »
Les humains excellent dans ce que les chercheurs appellent la sample efficiency : avec un ou deux exemples, nous inférons une règle et l’appliquons à des cas inédits. Les IA, en revanche, nécessitent des millions d’exemples pour apprendre une tâche, même basique. Comme le souligne Franck Ramus, directeur de recherche au CNRS en sciences cognitives :
> « Les modèles actuels sont des machines à pattern matching. Ils ne comprennent pas pourquoi une règle s’applique, ils la reproduisent parce qu’ils l’ont vue avant. »
Les benchmarks traditionnels (comme les tests de langage ou les jeux vidéo) mesurent souvent la compétence, pas l’intelligence. Un modèle peut gagner à Go ou générer du texte cohérent, mais cela ne signifie pas qu’il comprend le jeu ou le langage. Les puzzles ARC-AGI exposent cette faille : les modèles apprennent par cœur des solutions, sans pouvoir les adapter à des variations même mineures.
En août 2026, la ARC Prize Foundation (créée par Chollet) lance ARC-AGI-3, une version radicalement différente. Exit les grilles statiques : place aux jeux vidéo interactifs en 2D, où l’IA doit explorer un environnement inconnu, apprendre des règles en temps réel et planifier des actions. L’objectif ? Évaluer des compétences comme la planification, l’exploration et l’adaptation, bien au-delà du simple pattern matching.
Pourtant, selon les premiers tests internes, aucun modèle n’a encore réussi à terminer un niveau de ces jeux. Comme le résume Chollet :
> « Nous ne mesurons pas l’AGI avec ces tests, mais nous mesurons la capacité à apprendre dans un domaine restreint. Et même cela, les IA ne le maîtrisent pas encore. »
Les puzzles ARC-AGI ne sont pas qu’un exercice académique. Ils révèlent les angles morts des modèles actuels, utiles pour :