NE LAISSER PAS LE 5G DETRUIRE VOTRE ADN Protéger toute votre famille avec les appareils Quantiques Orgo-Life® Publicité par Adpathway
Le 21 août 2026, NVIDIA a publié un résultat qui change la manière dont les entreprises devraient évaluer les systèmes d’intelligence artificielle. Le même modèle d’IA, Claude Opus 5 d’Anthropic, obtenait 30% sur un benchmark de raisonnement interactif appelé ARC-AGI-3 lorsqu’il était utilisé seul. Enveloppé dans un système d’agent conçu par NVIDIA, le même modèle a obtenu un score parfait de 100%. Le modèle n’a pas changé. Le cadre dans lequel il opère, si.
Ce résultat, publié par l’équipe de recherche AVO (Agentic Variation Operators) de NVIDIA, marque un tournant dans la manière dont l’industrie conçoit le progrès en IA. Pendant des années, la course a porté sur la taille des modèles, le nombre de paramètres, la puissance brute. Ce que montre AVO, c’est que l’architecture logicielle qui entoure le modèle mérite autant d’attention que le modèle lui-même.
ARC-AGI-3 : un test de raisonnement sans filet
Pour comprendre la portée du résultat, il faut d’abord comprendre ce qu’est ARC-AGI-3. Il s’agit d’un benchmark de raisonnement interactif où un agent d’IA est placé dans des environnements de type jeu, sans instructions, sans règles écrites, sans objectifs déclarés. L’agent doit explorer par essais et erreurs, déduire les mécanismes de l’environnement, découvrir les objectifs, et planifier des actions efficaces à travers des niveaux de difficulté croissante.
La performance est mesurée par le RHAE (Relative Human Action Efficiency), qui combine la complétion des tâches avec l’efficacité des actions par rapport à un humain débutant. En avril 2026, les meilleurs modèles d’IA obtenaient moins de 1% sur ce benchmark. Les humains atteignent en moyenne 80%. Aujourd’hui, un système d’agent bien conçu atteint 100%.
Le benchmark comporte 183 niveaux répartis dans 25 environnements de jeu différents. AVO les a tous résolus en 6 624 actions. Un système concurrent, VISTA, avait utilisé 7 542 actions avec le même modèle pour accomplir les mêmes niveaux. AVO a donc été environ 12% plus efficace.
Comment fonctionne AVO ?
AVO n’est pas un modèle d’IA. C’est un système d’agent, un cadre logiciel qui orchestre la manière dont le modèle interagit avec son environnement. L’architecture repose sur deux mécanismes principaux.
Le premier est la mémoire persistante. AVO conserve l’historique complet des tentatives précédentes, des résultats d’évaluation, et du raisonnement accumulé. Contrairement à un modèle standard qui doit reconstruire son contexte à chaque appel, AVO reprend là où il s’est arrêté. Cette capacité à ne pas repartir de zéro est cruciale pour les tâches longues qui nécessitent des centaines d’itérations.
Le second mécanisme est un superviseur. Un agent séparé surveille la trajectoire globale du système principal. Il n’effectue pas le travail lui-même, mais détecte quand l’agent principal stagne ou boucle sur une stratégie qui ne fonctionne plus. À ce moment-là, il intervient pour rediriger l’agent vers des approches alternatives. Cette division du travail entre exécution et supervision est ce qui a permis à AVO de fonctionner de manière autonome pendant sept jours d’affilée sur une tâche d’optimisation de noyaux GPU, explorant plus de 500 directions d’optimisation et produisant 40 versions de noyaux validés.
Le résultat le plus parlant est peut-être celui de l’optimisation GPU. Les noyaux d’attention produits par AVO ont surpassé cuDNN (la bibliothèque officielle de NVIDIA) de 3,5% et FlashAttention-4 (la référence open source) de 10,5% sur les systèmes DGX B200. Le même système, sans modification architecturale, est passé de l’optimisation de code GPU à la résolution de puzzles de raisonnement. Seules l’interface et la méthode d’évaluation ont changé. La boucle centrale est restée identique.
Le modèle seul ne suffit pas
Ce résultat porte une implication pratique majeure pour les entreprises qui déploient l’IA. Jusqu’à présent, la stratégie dominante consistait à attendre le prochain modèle plus performant. Si un modèle obtient 30% sur une tâche et que le système d’agent qui l’entoure le porte à 100%, alors le goulot d’étranglement n’est plus le modèle. C’est l’architecture logicielle.
Comme le résume une analogie désormais courante dans le secteur : le modèle est le moteur, mais le système d’agent est la transmission, la suspension et le volant. Un moteur parfait sans transmission n’avance pas. Et un moteur moyen avec une excellente transmission peut battre un moteur puissant mal conçu.
Cette leçon a déjà été démontrée par d’autres équipes. Tycho a atteint un score parfait sur ARC-AGI-3 fin juillet 2026, VISTA début août, et AVO fin août. Trois équipes indépendantes, trois architectures différentes, mais le même constat : aucun des trois systèmes n’a atteint le score parfait avec un modèle nu. Chaque fois, c’est le cadre d’agent qui a fait la différence.
Open source : Prime Agent démocratise l’approche
Parallèlement aux travaux de NVIDIA, le projet open source Prime Agent, publié par Prime Intellect, montre que cette approche n’est pas réservée aux géants de la tech. Prime Agent est un système d’agent open source qui atteint 95,5% sur ARC-AGI-3, contre 30% pour le modèle seul. Il utilise une architecture similaire : mémoire persistante, exécution REPL continue, sous-agents récursifs, et historique complet des sessions.
Sur plusieurs benchmarks de codage longue durée, Prime Agent surpasse ou égale les systèmes propriétaires comme Claude Code et Codex, tout en utilisant moins de tokens. Le code source est disponible sur GitHub, ce qui permet à toute équipe de l’étudier, de l’adapter et de le déployer.
Un résultat frappant de l’article de recherche est que l’entraînement du planificateur dans le flux d’exécution (avec une méthode appelée Flow-GRPO) ajoute 17,2% de performance, alors que l’entraînement hors ligne conventionnel (supervised fine-tuning) dégrade la performance de 19%. Le même modèle, des résultats opposés, simplement par la manière dont l’agent est entraîné à planifier ses actions.
Ce que cela signifie pour vous
Si vous utilisez des modèles d’IA dans votre entreprise, ce résultat devrait vous interpeller. La question n’est plus seulement “quel modèle est le plus performant ?” mais “comment construisons-nous le système d’agent qui permettra à ce modèle de donner le meilleur de lui-même ?”
Les implications sont concrètes : mémoire persistante, détection de stagnation, boucle itérative d’hypothèse-action-observation-révision, capacité à récupérer après une erreur. Ce sont des éléments logiciels, pas des améliorations de modèle. Ils peuvent être implémentés avec les frameworks existants, sans attendre la prochaine version du modèle.
Plusieurs frameworks open source permettent déjà de construire de tels systèmes : LangChain, CrewAI, AutoGen, et maintenant Prime Agent. La différence cruciale est que ces frameworks doivent être configurés non pas comme des pipelines linéaires, mais comme des systèmes avec mémoire, supervision et récupération d’erreur.
La limite du benchmark
Un score parfait sur le set public d’ARC-AGI-3 ne signifie pas que l’AGI est arrivée. Le set privé, qui contient des environnements jamais vus par les systèmes, reste non résolu. Les benchmarks sont des outils de mesure, pas des destinations. Mais la leçon structurelle est claire : l’architecture d’agent est devenue un levier de performance au moins aussi important que la puissance du modèle.
Le secteur de l’IA entre dans une nouvelle phase. Après la course aux paramètres et aux données d’entraînement, la prochaine frontière est celle de l’architecture d’agent. Les entreprises qui investiront dans la qualité de leurs systèmes d’agent, et pas seulement dans le choix de leur modèle, disposeront d’un avantage compétitif significatif.
Sources
- NVIDIA Developer Blog. AVO Reaches 100% on ARC-AGI-3. Août 2026.
- The New Stack. Claude Opus 5 scored 30% on ARC-AGI-3. Wrapped in Nvidia’s AVO, it hit 100%. Août 2026.
- ARC Prize Foundation. Claude Opus 5 Results – ARC-AGI-3 Leaderboard. 2026.
- Prime Intellect. Prime Agent: A Self-Improving RLM Harness. arXiv:2608.23552. Août 2026.
- Singularity.Kiwi. NVIDIA’s Agent Architecture Saturates ARC-AGI-3 With a Perfect Score. Août 2026.


4 hour_ago
6






















.jpg)






French (CA)