Le texte de la tâche est passé dans un classifieur lexical déterministe qui produit une pondération sur treize axes de capacité. Chaque axe est ensuite noté à partir des benchmarks qui le mesurent réellement : les valeurs brutes sont ramenées sur une échelle 0-100 par un min-max robuste aux percentiles 5 et 95, puis pondérées par la crédibilité de la source — un score exécuté par un tiers indépendant compte davantage qu’un score publié par le laboratoire qui vend le modèle, et un classement figé depuis un an voit son poids réduit de moitié.
Quand un modèle n’a aucune mesure sur un axe, son score n’est pas laissé vide : il est ramené vers ce que l’on sait de lui par ailleurs, en proportion inverse de la couverture disponible. La couverture est affichée sur chaque fiche, et une pénalité douce de dix pour cent au maximum s’applique aux modèles les moins documentés, afin qu’un modèle jamais évalué ne dépasse pas un modèle mesuré à qualité apparente égale.
Le coût n’est pas le tarif affiché. Il est calculé sur les tokens réellement facturés, en appliquant un multiplicateur de verbosité aux modèles de raisonnement — c’est le seul paramètre calibré plutôt que relevé, dérivé du temps de décodage par tâche et de la vitesse publiés par Artificial Analysis. Kimi K3 consomme deux fois et demie plus de tokens que Claude Opus 5 pour un score inférieur : son coût réel dépasse celui de modèles au tarif nominal plus élevé, et c’est exactement ce que ce multiplicateur capture.
Le score final est la combinaison barycentrique des trois scores selon la position du curseur. L’efficience est présentée à part : c’est la qualité obtenue par dollar dépensé, sur échelle logarithmique, normalisée sur le meilleur du classement.
Il ne remplace pas une évaluation sur vos propres données. Les benchmarks publics mesurent des capacités générales sur des jeux de tests partagés ; votre tâche a ses propres distributions, ses propres formats et ses propres cas limites. Traitez ce classement comme une présélection de trois à cinq candidats à tester, pas comme un verdict. Notez aussi que sur les axes multilingue et contexte long, aucun classement indépendant vivant n’existe : les scores affichés y sont des auto-déclarations agrégées, et l’interface les signale comme telles.
Terminal-Bench 2.1
Tâches agentiques bout-en-bout dans un terminal conteneurisé (89 tâches). Mesure la capacité à finir un travail réel, pas à écrire un extrait.
Le harness pèse autant que le modèle : Anthropic republie Opus 4.8 à 74,6 % sous Terminus-2 et 82,7 % sous mini-SWE-agent. Ne comparez pas deux lignes de harness différents.
SWE-bench Pro (Scale)
Résolution de 731 tickets GitHub réels avec tests cachés. C'est le benchmark SWE que les laboratoires publient réellement depuis fin 2025.
OpenAI note en bas de page que des « signes de mémorisation » ont été observés sur cet eval. Les scores laboratoires sont ~17 points au-dessus du classement public.
Artificial Analysis Coding Agent Index v1.1
Moyenne pass@1 sur DeepSWE, Terminal-Bench v2 et SWE-Atlas-QnA, mesurée par un tiers sur des paires harness+modèle.
Arena.ai — Frontend Code
Elo de préférence humaine en aveugle sur du code front-end exécutable. Capte l'utilisabilité du code produit, pas seulement sa justesse.
Le classement de Claude Fable 5 a été recalibré le 2026-07-12 sur les votes postérieurs au 1er juillet : sa fenêtre est plus courte que celle de ses concurrents.
Arena.ai — catégorie Coding
Elo de préférence humaine sur les requêtes de programmation, toutes langues confondues.
Humanity's Last Exam (sans outils)
2 500 questions expertes en limite de connaissance. Le seul benchmark de raisonnement encore loin de la saturation.
L'écart avec outils est de 8 à 13 points : ne mélangez jamais les deux colonnes. Tous les modèles du classement affichent 38 à 89 % d'erreur de calibration.
Humanity's Last Exam (avec outils)
Même jeu de 2 500 questions, mais le modèle dispose de recherche et d’exécution de code.
La configuration d'outils n'est pas publiée ligne par ligne : les scores ne sont pas strictement comparables entre eux.
GPQA Diamond
198 QCM scientifiques de niveau doctorat, conçus pour résister à la recherche web.
Saturé. Une question vaut 0,5 point : tout écart inférieur à 2 points est du bruit. Le poids attribué ici est volontairement réduit.
FrontierMath (Epoch, tiers 1-3)
Problèmes inédits écrits par des mathématiciens, réponse exacte auto-vérifiée, Python autorisé.
Epoch signale une revue en cours ayant relevé « des erreurs fatales sur environ un tiers des problèmes ». Chiffres provisoires.
MathArena — AIME 2026
30 problèmes à réponse entière, évalués dans les jours suivant le concours réel, 4 passes par modèle.
Saturé : deux modèles à 100 %, un modèle ouvert de 9 B à 92,5 %. Utile pour éliminer les faibles, inutile pour départager le haut du panier.
τ³-Bench Banking
Agent de service client devant respecter une politique documentaire, avec un utilisateur simulé qui détient l'information manquante.
Le pass^4 (4 essais réussis sur 4) chute de moitié partout : aucun modèle n’est fiable de façon répétable.
τ²-Bench (retail / airline / telecom)
Interaction agent-outils-utilisateur sous politique écrite, moyenne des trois domaines.
Plusieurs scores publiés utilisent le modèle testé comme simulateur d'utilisateur, ce qui gonfle le résultat. Les entrées concernées sont marquées.
Berkeley Function Calling Leaderboard V4
Justesse des appels de fonction : AST, live, multi-tours, recherche web, mémoire.
Figé depuis avril 2026 : la génération actuelle (GPT-5.5+, Opus 4.6+, Gemini 3.1) en est absente. Poids réduit dans le moteur.
Artificial Analysis — Agentic Index
Sous-index GDPval-AA v2 + τ³-Banking, exécuté par un tiers sur 44 métiers avec shell et navigateur.
MRCR 8-aiguilles, moyenne 128k
Retrouver et restituer exactement l'un de plusieurs tours d'assistant quasi identiques dans une longue conversation.
Il n'existe aucun classement central : chaque laboratoire agrège différemment. Seule la colonne « 128k moyenne » du harness Google est comparable entre marques.
Fiction.liveBench @192k
Compréhension de récits longs à 192 000 tokens de profondeur — la source de contexte long la mieux entretenue.
Trois modèles Anthropic affichent 0,0 à 192k alors qu’ils sont à 75-94 % à 120k : ce sont très probablement des échecs de harness, pas un effondrement de compréhension. Ces valeurs sont exclues du dataset.
MMMU-Pro
Questions multimodales de niveau universitaire sur 30 disciplines, purgées de celles répondables sans regarder l’image.
Environ 90 % des entrées sont des auto-déclarations : MMMU ne réexécute pas les modèles.
MMMLU (14 langues)
MMLU traduit professionnellement en 14 langues — le seul agrégat multilingue encore alimenté.
Axe le plus faible du panorama : aucun classement indépendant vivant, couverture très incomplète, top 13 tenant en 4 points. À lire comme un signal de présence, pas de rang.
AA-Omniscience Index
6 000 questions sur 42 sujets. L'index récompense les bonnes réponses, pénalise les hallucinations et ne pénalise pas l'abstention.
C'est la table la plus décisive du panorama : la famille GPT-5.6 Sol a la meilleure exactitude brute du classement (56-59 %) avec un taux d'hallucination de 85-89 %, parce qu'elle ne s'abstient presque jamais.
AA-Omniscience — taux d’hallucination
Part de réponses fausses parmi les réponses non correctes. Bas = le modèle sait dire qu'il ne sait pas.
Vectara HHEM-2.1
Fidélité en résumé : le modèle résume un document source, un classifieur détecte le contenu non ancré dans la source.
Lire en parallèle le taux de réponse : un modèle qui s'abstient souvent paraît fidèle à tort. Les petits modèles dominent car un résumé court et prudent est facile à garder ancré.
IFBench (exécuté par Artificial Analysis)
58 contraintes vérifiables appliquées à des prompts réels, traces de raisonnement retirées. Successeur non saturé d’IFEval.
Inversion notable : plus d'effort de raisonnement dégrade le respect des contraintes. Grok 4.3 medium (83,3) devance Grok 4.3 high (81,3).
Arena.ai — Creative Writing
Elo de préférence humaine en aveugle sur les tâches d’écriture créative.
Arena.ai — Text (global)
7,4 M de votes humains en aveugle sur 378 modèles. Mesure la satisfaction perçue, pas la justesse.
Les rangs dont les intervalles de confiance se recouvrent doivent être lus comme des bandes, pas comme un ordre strict.
Arena.ai — Longer Query
Elo sur les requêtes longues et détaillées, plus proches d’un usage professionnel que du chat court.
Artificial Analysis Intelligence Index v4.1
Agrégat de 9 évaluations pondérées : agents 34 %, code 24 %, raisonnement scientifique 24 %, généraliste 18 %.
MMLU-Pro
MMLU durci à 10 options sur 14 disciplines. Base aléatoire à 10 %.
Soumissions ouvertes non vérifiées : un modèle de 2024 y égale les modèles frontière 2026, ce qui n'est pas crédible. Poids fortement réduit.
La moitié des classements de référence de 2025 ne sont plus alimentés. Les réutiliser donnerait un classement d’apparence rigoureuse mais mesurant une génération de modèles qui n’est plus en service. Ils sont listés ici pour éviter qu’on les réintroduise par inadvertance.