Sol d’OpenAI atteint 38,3 % hors du test officielImage — générée par IAEn cours

ARC Prize verified Sol at 7.78%, while OpenAI separately reported 38.3% on the public set; the latter has not been independently reproduced under the same configuration.

Tech & IAHistoire en cours

Sol d’OpenAI atteint 38,3 % hors du test officiel

ARC-AGI-3 maintient Claude Opus 5 en tête à 30,16 % ; le score vérifié de Sol reste de 7,78 %.

Publié
NRB — News Republic Brigade

Qui est impliqué

  • OpenAI

    L’entreprise d’intelligence artificielle qui a conçu GPT-5.6 Sol et exploite l’API Responses utilisée lors de l’essai au score plus élevé

    veut → Montrer que le faible résultat standardisé de Sol tenait au protocole de test plutôt qu’à une limite de raisonnement immuable

  • Fondation ARC Prize (ARC Prize Foundation)

    L’organisme à but non lucratif qui conçoit les tests de raisonnement ARC et évalue de manière indépendante les modèles les plus avancés

    veut → Préserver la comparabilité des scores et leur résistance aux fuites de données d’entraînement, tout en déterminant quels réglages proposés par les fournisseurs peuvent être admis

  • Anthropic

    Le laboratoire rival d’OpenAI qui développe Claude Opus 5, modèle en tête du classement vérifié d’ARC-AGI-3

    veut → Conserver l’avance d’Opus 5 lorsque tous les modèles sont soumis aux mêmes conditions standardisées

  • Thibault « Tibo » Sottiaux

    Un responsable produit d’OpenAI à l’origine de la plus ancienne publication publique horodatée retrouvée sur le nouvel essai à 38,3 %

    veut → Défendre l’idée d’OpenAI selon laquelle des réglages de mémoire proches des conditions réelles d’utilisation révèlent davantage les capacités du modèle

  • François Chollet

    Cofondateur d’ARC Prize et créateur du test de raisonnement ARC d’origine

    veut → Distinguer les outils généralistes acceptables des logiciels conçus spécialement pour battre ARC-AGI-3

  • Chercheurs indépendants sur ARC

    Des chercheurs, parmi lesquels Sergueï Rodionov (Sergey Rodionov), Jens Lehmann, Andrei Aioanei et Sahar Vahdati, qui ont évalué les modèles dans des systèmes d’agents plus élaborés

    veut → Mesurer la part des performances imputable au modèle et celle provenant des logiciels de mémoire, de vérification et de modélisation du monde

En bref

Le résultat montre que, sur ARC-AGI-3, les performances d’un modèle d’intelligence artificielle peuvent dépendre autant de la mémoire et de la couche logicielle qui l’entourent que du modèle lui-même.

L’étape la plus probable serait un nouvel essai de GPT-5.6 Sol, supervisé par ARC Prize, au moyen de l’API Responses (Responses API) d’OpenAI — le service utilisé par les développeurs pour exécuter ses modèles — avec les mêmes réglages de mémoire.

Cette perspective reste incertaine : aucun acteur extérieur à OpenAI n’a reproduit le protocole exact ni appliqué ces paramètres aux environnements cachés d’ARC Prize. Une nouvelle exécution encadrée, accompagnée du détail des réglages, des coûts et de plusieurs séries de résultats, permettrait de trancher.

Comment tout s’est déroulé

01

ARC-AGI-3 évalue l’apprentissage dans des jeux inconnus

2026-03-23 – 2026-03-23

La Fondation ARC Prize a déposé l’article technique consacré à ARC-AGI-3 sur arXiv, une archive de recherche en ligne, le 24 mars à 21 h 58 UTC, soit un jour avant le lancement public. Le test place des agents d’intelligence artificielle dans des jeux bidimensionnels inconnus, sans aucune instruction, puis mesure leur capacité à explorer, à découvrir un objectif, à mémoriser et à planifier. Les humains ont pu résoudre tous les environnements, tandis que les modèles de pointe évalués sont restés sous 1 %, établissant le point de départ des progrès ultérieurs de Sol.

1 source
02

L’architecture des agents bouleverse les premiers résultats

2026-03-24 – 2026-05-05

ARC Prize a lancé ARC-AGI-3 le 25 mars avec 25 jeux publics de démonstration, 55 environnements semi-privés et 55 environnements entièrement privés réservés à la compétition. Les modèles de pointe standard n’ont presque pas progressé. Dans une analyse ultérieure, ARC a attribué à GPT-5.5 un score semi-privé de 0,43 % et constaté que le modèle ne conservait souvent pas les idées utiles. Des chercheurs extérieurs ont ensuite utilisé un agent de programmation capable de construire puis de vérifier un modèle exécutable de chaque univers de jeu. Leur système a atteint un RHAE moyen de 32,58 %, un indicateur qui compare les récompenses et l’efficacité des actions à celles de joueurs humains découvrant le jeu. Ce résultat a montré très tôt que le système entourant le modèle pouvait transformer ses performances, mais aucun essai privé n’avait encore été réalisé.

3 sources
03

Sol franchit le plancher du test officiel

2026-07-08 – 2026-07-15

OpenAI a lancé la gamme GPT-5.6 le 9 juillet, avec Sol comme modèle disposant de la plus grande puissance de calcul. L’évaluation indépendante d’ARC Prize a révélé de forts écarts au sein de la gamme : Sol a obtenu 13,33 % sur les jeux publics et 7,78 % sur l’ensemble semi-privé, contre respectivement 0,80 % et 0,18 % sur le semi-privé pour Terra et Luna. Sol est aussi devenu le premier modèle de pointe vérifié à remporter un jeu public d’ARC-AGI-3, avec 87,1 % sur FT09. Une étude indépendante publiée le 16 juillet l’a ensuite intégré à un agent de programmation reposant sur des vérifications répétées et a annoncé un RHAE public d’environ 99 %. Ses auteurs ont averti que les jeux publics étaient antérieurs au modèle et que ses performances sur des jeux cachés demeuraient inconnues.

3 sources
04

Opus prend la tête, OpenAI modifie le protocole

2026-07-23 – 2026-07-28

ARC Prize a ensuite vérifié Claude Opus 5 à 30,16 %, soit près de quatre fois le score semi-privé de Sol. Opus a terminé plusieurs environnements publics qu’aucun modèle précédent n’avait résolus avec le dispositif standard. OpenAI a alors cherché à comprendre pourquoi Sol y obtenait de faibles résultats malgré de meilleures performances sur d’autres tâches longues. La première publication publique horodatée retrouvée est celle de Thibault « Tibo » Sottiaux, responsable chez OpenAI, à 23 h 30 UTC le 29 juillet. Le compte officiel de l’entreprise et son article de recherche ont suivi 27 minutes plus tard.

4 sources
05

ARC encadre les logiciels d’assistance jugés équitables

2026-07-29 – 2026-07-29

ARC Prize a précisé que son classement vérifié reposait sur une interface minimale et standardisée afin de préserver l’équité des comparaisons et de limiter les systèmes construits autour du test. François Chollet a admis une règle plus large : un logiciel conçu spécialement pour ARC-AGI-3 n’est pas acceptable, mais des fonctions généralistes d’API accessibles aux utilisateurs ordinaires peuvent l’être si leurs réglages et leurs coûts sont rendus publics. L’expérience d’OpenAI apporte donc un élément utile, sans être directement comparable au classement officiel. Plus tard dans la journée, l’article Tycho a indiqué que Sol et Opus 5 avaient tous deux atteint un RHAE de 100 et terminé les 183 niveaux publics dans un agent pratiquant l’abstraction active. Là encore, le résultat a confirmé le poids du dispositif d’exécution, sans reproduire exactement le protocole d’OpenAI.

4 sources
06

Deux classements restent valables

2026-07-30 – 2026-08-02

Deux affirmations différentes coexistent désormais. OpenAI peut déclarer que son système Sol configuré pour un usage en production a obtenu 38,3 % sur les jeux publics, davantage que les 30,16 % d’Opus 5 sur l’ensemble semi-privé standardisé, mais ces deux évaluations ne sont pas identiques. ARC Prize et les sites qui répliquent son classement placent toujours Opus 5 en tête à 30,16 %, devant Sol à 7,78 %, dans les conditions vérifiées. Parmi les travaux publiés examinés ici, aucune équipe extérieure n’a reproduit exactement l’essai fondé sur la conservation du raisonnement et la compression du contexte, ni confirmé le passage de 13,3 % à 38,3 %.

3 sources

Où en sont les choses

Le test confirmé est ARC-AGI-3. ARC Prize a vérifié Sol à 7,78 % sur l’évaluation semi-privée et à 13,33 % sur l’ensemble public avec son dispositif officiel. OpenAI a annoncé séparément un résultat de 38,3 % sur l’ensemble public au moyen de son API Responses, après avoir conservé le raisonnement interne entre les actions et remplacé la suppression de l’historique ancien par une compression du contexte.

Le résultat de 38,3 % ne constitue pas le record officiel d’ARC-AGI-3. Des articles indépendants étayent fortement l’idée qu’une meilleure mémoire, des vérifications répétées et des modèles du monde peuvent débloquer des performances bien supérieures sur l’ensemble public. Aucun n’a cependant reproduit exactement la comparaison d’OpenAI fondée sur ces deux réglages ni évalué le dispositif dans les environnements cachés d’ARC. Pour obtenir une réponse décisive, il faudrait une nouvelle exécution de l’API Responses sous la supervision d’ARC, la publication complète des paramètres et des coûts, une mesure des variations entre plusieurs essais et un score semi-privé obtenu avec les mêmes réglages de conservation du raisonnement et de compression du contexte.

Sources

  • OpenAItwo-setting experiment · 2026-07-29
  • ARC Prizestandardized-harness response · 2026-07-30
  • BenchLMleaderboard mirror · 2026-08-02