Page d'accueilCentre d'actualités LBank
L'AGI est-elle là ? Loin s'en faut, suggère une nouvelle référence en IA
is-agi-here-not-even-close-ai-benchmark
L'AGI est-elle là ? Loin s'en faut, suggère une nouvelle référence en IA
ARC-AGI-3 est sorti la même semaine où Jensen Huang a déclaré que l'AGI était atteint. Gemini a obtenu 0,37 %. GPT-5.4 a obtenu 0,26 %. Les humains ont atteint 100 %.
2026-03-26 Source:decrypt.co

En bref

  • ARC-AGI-3 révèle un fossé béant entre les affirmations sur l'AGI et la réalité, les meilleurs modèles d'IA obtenant moins de 1 % tandis que les humains atteignent une performance parfaite.
  • Le benchmark teste la vraie généralisation — exigeant des agents qu'ils explorent, planifient et apprennent de zéro dans des environnements inconnus plutôt que de se contenter de rappeler des schémas entraînés.
  • Malgré le battage médiatique de l'industrie, les systèmes d'IA actuels restent loin de l'AGI, manquant de la capacité de raisonnement et d'adaptabilité que même les jeunes humains affichent naturellement.

Le PDG de Nvidia, Jensen Huang, a participé au podcast de Lex Fridman la semaine dernière et a déclaré, clairement : « Je pense que nous avons atteint l'AGI. » Deux jours plus tard, le test le plus rigoureux de la recherche en IA a dévoilé son nouveau benchmark d'intelligence artificielle générale – et chaque modèle de pointe a obtenu un score inférieur à 1 %.

La Fondation ARC Prize a publié ARC-AGI-3 cette semaine, et les résultats sont brutaux. Gemini 3.1 Pro de Google a mené le peloton avec 0,37 %. GPT-5.4 d'OpenAI a obtenu 0,26 %. Claude Opus 4.6 d'Anthropic a atteint 0,25 %, tandis que Grok-4.20 de xAI a obtenu exactement zéro. Les humains, quant à eux, ont résolu 100 % des environnements.

Il ne s'agit pas d'un quiz, d'un examen de codage, ni même de questions ultra-difficiles de niveau doctorat. ARC-AGI-3 est quelque chose d'entièrement différent de tout ce que l'industrie de l'IA a rencontré auparavant.

Ce benchmark a été créé par la fondation de François Chollet et Mike Knoop, qui a mis en place un studio de jeux interne et a créé 135 environnements interactifs originaux de toutes pièces. L'idée est de placer un agent d'IA dans un monde inconnu, semblable à un jeu, sans aucune instruction, aucun objectif défini et aucune description des règles. L'agent doit explorer, comprendre ce qu'il est censé faire, élaborer un plan et l'exécuter.

Si cela ressemble à quelque chose qu'un enfant de cinq ans peut faire, vous commencez à comprendre le problème. Si vous voulez voir si vous êtes meilleur que l'IA, vous pouvez jouer aux mêmes jeux présentés dans le test en cliquant sur ce lien. Nous en avons essayé un ; c'était étrange au début, mais après quelques secondes, on s'y habitue facilement.

C'est aussi l'exemple le plus clair de ce que représente le « G » dans AGI. Lorsque vous généralisez, vous êtes capable de créer de nouvelles connaissances (comment fonctionne un jeu étrange) sans y avoir été entraîné au préalable.

Les versions précédentes d'ARC testaient des puzzles visuels statiques — montrer un motif, prédire le suivant. Ils étaient difficiles au début. Puis les laboratoires ont mis à disposition de la puissance de calcul et de l'entraînement jusqu'à ce que les benchmarks soient effectivement saturés. ARC-AGI-1, introduit en 2019, a succombé aux modèles d'entraînement et de raisonnement à l'heure du test. ARC-AGI-2 a duré environ un an avant que Gemini 3.1 Pro n'atteigne 77,1 %. Les laboratoires sont très doués pour saturer les benchmarks contre lesquels ils peuvent s'entraîner.

La version 3 a été conçue spécifiquement pour empêcher cela. Avec 110 des 135 environnements gardés privés — 55 semi-privés pour les tests d'API, 55 entièrement verrouillés pour la compétition — il n'y a pas de jeu de données à mémoriser. On ne peut pas forcer son chemin à travers une logique de jeu inédite que l'on n'a jamais vue.

Le score n'est pas non plus un simple succès/échec. ARC-AGI-3 utilise ce que la fondation appelle le RHAE — Efficacité Relative de l'Action Humaine. La référence est la deuxième meilleure performance humaine à la première tentative. Une IA qui effectue dix fois plus d'actions qu'un humain obtient 1 % pour ce niveau, et non 10 %. La formule pénalise l'inefficacité au carré. Errer, revenir en arrière et deviner la réponse est sévèrement sanctionné.

Le meilleur agent d'IA lors de l'aperçu développeur d'un mois a obtenu 12,58 %. Les LLM de pointe testés via l'API officielle, sans outils personnalisés, n'ont pas pu dépasser 1 %. Des humains ordinaires ont résolu les 135 environnements sans entraînement préalable ni instructions. Si c'est la barre, alors la génération actuelle de modèles ne la franchit pas.

Il y a un véritable débat méthodologique ici. Le rapport d'ARC indique qu'un harnais personnalisé construit par Duke a poussé Claude Opus 4.6 de 0,25 % à 97,1 % sur une variante d'environnement unique appelée TR87. Cela ne signifie pas que Claude a obtenu 97,1 % sur ARC-AGI-3 globalement ; son score de référence officiel est resté à 0,25 %, mais le changement mérite d'être noté.

Le benchmark officiel alimente les agents avec du code JSON, pas des visuels. C'est soit une lacune méthodologique, soit une démonstration que les modèles actuels sont meilleurs pour traiter des informations conviviales pour l'homme que des données structurées brutes. La fondation de Chollet a reconnu le débat, mais ne change pas le format.

« La perception du contenu des cadres et le format de l'API ne sont pas des facteurs limitants pour la performance des modèles de pointe sur ARC-AGI-3 », indique le document. En d'autres termes, ils semblent rejeter l'idée que les modèles échouent parce qu'ils ne « voient pas » correctement les tâches, arguant plutôt que la perception est déjà suffisante — et que le véritable écart réside dans le raisonnement et la généralisation.

La mise à l'épreuve de l'AGI est arrivée au cours d'une semaine où la machine à buzz tournait à plein régime. Outre le commentaire de Huang, Arm a nommé sa nouvelle puce de centre de données le « AGI CPU ». Sam Altman d'OpenAI a déclaré qu'ils avaient « fondamentalement construit l'AGI », et Microsoft commercialise déjà un laboratoire axé sur la construction d'ASI : une évolution de ce qui vient après l'atteinte de l'AGI. Le terme semble être étiré jusqu'à ce qu'il signifie ce qui est commercialement pratique.

La position de Chollet est plus simple. Si un humain normal sans instructions peut le faire, et que votre système ne le peut pas, alors vous n'avez pas d'AGI — vous avez une fonction d'autocomplétion très coûteuse qui a besoin de beaucoup d'aide.

ARC Prize 2026 offre 2 millions de dollars répartis sur trois pistes de compétition, toutes hébergées sur Kaggle. Chaque solution gagnante doit être open-source. Le temps passe, et pour l'instant, les machines n'y sont même pas proches.