Physical Artificial Intelligence newsPAI news
← Retour aux actualités
26 Août 2026Niveau : Essentiel

Pourquoi les IA échouent-elles encore aux tests d’intelligence humaine ? Le cas des puzzles ARC-AGI

📑 Sommaire
💡 En 3 points clés
  • Les modèles actuels sont des spécialistes, pas des généralistes : Ils excellent dans des tâches bien définies (traduction, génération de texte), mais échouent dès que le contexte change.
  • L’abstraction reste hors de portée : Comprendre qu’une règle s’applique à une situation nouvelle, sans l’avoir vue pendant l’entraînement, reste un défi majeur.
  • Les benchmarks doivent évoluer : Les tests comme ARC-AGI-3 montrent que l’IA a encore besoin de progrès en raisonnement causal et en apprentissage incrémental.

Un benchmark conçu pour mesurer l’abstraction, pas la mémoire

En 2019, François Chollet, ingénieur chez Google et créateur de Keras, lance l’ARC-AGI (Abstraction and Reasoning Corpus – Artificial General Intelligence). Son objectif ? Évaluer la capacité des modèles à généraliser à partir de quelques exemples, une compétence clé de l’intelligence humaine. Contrairement aux benchmarks classiques (comme les tests de QI ou les jeux vidéo), ARC-AGI se concentre sur des grilles de couleurs où le modèle doit déduire une règle à partir de 1 à 3 exemples, puis l’appliquer à une nouvelle grille.

Les règles sont simples en apparence : transformer une grille en une autre, en appliquant des opérations comme l’inversion des couleurs, le déplacement de blocs ou la duplication de motifs. Pourtant, même les modèles les plus avancés, comme ceux d’OpenAI ou de Google, peinent à dépasser 10 % de réussite sur ARC-AGI-1, alors que les humains atteignent 80 à 100 %.

Pourquoi les IA échouent-elles ?

1. L’absence de compréhension du monde physique

Les puzzles ARC-AGI sont conçus pour être découplés de toute connaissance préalable : pas de texte, pas de contexte culturel, juste des motifs visuels. Pourtant, les modèles actuels, même multimodaux, ne perçoivent pas les règles comme des entités abstraites, mais comme des motifs statistiques à reproduire. Comme l’explique Melanie Mitchell, chercheuse à l’Institute for Advanced Study de Santa Fe :

> « Les tests conçus pour les humains ne mesurent pas la même chose pour les machines. Une IA peut exceller à résoudre des équations différentielles, mais échouer à comprendre qu’un objet ne peut pas traverser un mur. »

2. L’incapacité à généraliser à partir de peu d’exemples

Les humains excellent dans ce que les chercheurs appellent la sample efficiency : avec un ou deux exemples, nous inférons une règle et l’appliquons à des cas inédits. Les IA, en revanche, nécessitent des millions d’exemples pour apprendre une tâche, même basique. Comme le souligne Franck Ramus, directeur de recherche au CNRS en sciences cognitives :

> « Les modèles actuels sont des machines à pattern matching. Ils ne comprennent pas pourquoi une règle s’applique, ils la reproduisent parce qu’ils l’ont vue avant. »

3. L’illusion de la compétence

Les benchmarks traditionnels (comme les tests de langage ou les jeux vidéo) mesurent souvent la compétence, pas l’intelligence. Un modèle peut gagner à Go ou générer du texte cohérent, mais cela ne signifie pas qu’il comprend le jeu ou le langage. Les puzzles ARC-AGI exposent cette faille : les modèles apprennent par cœur des solutions, sans pouvoir les adapter à des variations même mineures.

ARC-AGI-3 : vers des benchmarks plus réalistes ?

En août 2026, la ARC Prize Foundation (créée par Chollet) lance ARC-AGI-3, une version radicalement différente. Exit les grilles statiques : place aux jeux vidéo interactifs en 2D, où l’IA doit explorer un environnement inconnu, apprendre des règles en temps réel et planifier des actions. L’objectif ? Évaluer des compétences comme la planification, l’exploration et l’adaptation, bien au-delà du simple pattern matching.

Pourtant, selon les premiers tests internes, aucun modèle n’a encore réussi à terminer un niveau de ces jeux. Comme le résume Chollet :

> « Nous ne mesurons pas l’AGI avec ces tests, mais nous mesurons la capacité à apprendre dans un domaine restreint. Et même cela, les IA ne le maîtrisent pas encore. »

Que nous apprend ARC-AGI sur l’état de l’IA ?

  • Les modèles actuels sont des spécialistes, pas des généralistes : Ils excellent dans des tâches bien définies (traduction, génération de texte), mais échouent dès que le contexte change.
  • L’abstraction reste hors de portée : Comprendre qu’une règle s’applique à une situation nouvelle, sans l’avoir vue pendant l’entraînement, reste un défi majeur.
  • Les benchmarks doivent évoluer : Les tests comme ARC-AGI-3 montrent que l’IA a encore besoin de progrès en raisonnement causal et en apprentissage incrémental.
  • En pratique : à quoi servent ces tests ?

    Les puzzles ARC-AGI ne sont pas qu’un exercice académique. Ils révèlent les angles morts des modèles actuels, utiles pour :

  • La robotique : Un robot capable de manipuler des objets doit généraliser à partir de quelques démonstrations, pas d’un dataset de millions d’images.
  • Les systèmes autonomes : Une voiture autonome doit comprendre les règles de la route, pas juste les reproduire.
  • L’éducation : Les modèles pourraient un jour assister des enseignants en adaptant leurs explications à des élèves aux profils variés.
  • Le mot de la fin : une IA