Mis à jour automatiquement

Observatoire IA

Modèles de langage (chatbots, raisonnement, code). Mis à jour quotidiennement.

Dernière mise à jour : 23 juillet 2026 · 16 modèles · 131 snapshots

16 modèles

Distribution des performances

Score Global70%75%80%85%90%95%100%5.2G3.5FOp4.6MS1.1G3.1PG5.6LG4.5G5.4CO4.7CS5KKG5.5G5.6TCO4.8G5.6SCF5
Google
Anthropic
OpenAI
xAI
Moonshot AI
Provider
1
GPT-5.6 Sol
reasoning
OpenAI5982.491.783.996.2$1.04
2
Claude Fable 5
reasoning
Anthropic6080.889.786.096.0$2.75
3
Claude Opus 4.8
reasoning
Anthropic5678.989.779.395.3$1.80
4
GPT-5.6 Terra
reasoning
OpenAI5579.890.678.294.9$0.82
5
GPT-5.5
reasoning
OpenAI79.989.782.195.9
6
Kimi K3
open-source
Moonshot AI5778.590.781.484.4$0.95
7
Claude Sonnet 5
reasoning
Anthropic5374.888.780.792.9$1.53
8
Claude Opus 4.7
reasoning
Anthropic76.587.282.192.9
9
GPT-5.4
reasoning
OpenAI78.088.177.594.1
10
Grok 4.5
frontier
xAI5476.387.268.690.8$0.31
11
GPT-5.6 Luna
reasoning
OpenAI74.385.682.987.2
12
Gemini 3.1 Pro
frontier
Google77.184.076.591.0
13
Muse Spark 1.1
reasoning
Thinking Machines76.287.777.287.1
14
Claude Opus 4.6
reasoning
Anthropic74.588.778.289.375.6
15
Gemini 3.5 Flash
frontier
Google74.682.078.288.2
16
GPT-5.2
frontier
OpenAI74.683.276.193.272.8

Comprendre les benchmarks

🏟️

Quality Index

Index de qualité composite basé sur 10 évaluations indépendantes. Score synthétique 0-60.

Plage : 0 — 60 ptsArtificial Analysis
📊

LiveBench

Benchmark continuellement mis à jour — moyenne globale couvrant raisonnement, code, mathématiques, analyse et langage.

Plage : 0 — 100%LiveBench.ai
📊

Raisonnement

Score de raisonnement — logique, déduction et résolution de problèmes complexes.

Plage : 0 — 100%LiveBench.ai
📊

Code

Score de coding — génération, compréhension et debug de code.

Plage : 0 — 100%LiveBench.ai
📊

Mathématiques

Score de mathématiques — résolution de problèmes, algèbre, calcul et statistiques.

Plage : 0 — 100%LiveBench.ai
🐛

SWE-bench

Résolution autonome de vrais bugs GitHub. Mesure la capacité de développement réelle.

Plage : 0 — 100%SWE-bench.com
🧠

L'onglet « Equiv. QI » — une analogie, pas une mesure

Le score QI affiché dans le graphique est une analogie simplifiée pour rendre les écarts de performance entre modèles plus intuitifs. On applique une normalisation z-score (moyenne = QI 100, écart-type = 15 points) sur le score global de chaque modèle, exactement comme le font les tests de QI humains sur une population.

Pour situer — l'échelle du QI humain :

< 70 — Déficience70–85 — Inférieur à la moyenne85–115 — Moyenne (68% de la pop.)115–130 — Supérieur130–145 — Doué / HPI> 145 — Exceptionnellement doué

Les meilleurs LLM actuels se situent entre QI ~85 et ~125 sur cette échelle. Un modèle « frontier » à QI 120 se rapprocherait d'un humain « supérieur » en raisonnement pur sur les tâches mesurées — mais attention, la comparaison a ses limites (voir ci-dessous).

Ce n'est pas un vrai QI. Le QI humain mesure un ensemble de capacités cognitives (logique, mémoire de travail, vitesse de traitement, raisonnement spatial…) qui ne se comparent pas directement aux benchmarks d'un LLM. D'ailleurs, le test de QI lui-même a ses limites chez les humains : il ne capture ni la créativité, ni l'intelligence émotionnelle, ni la capacité d'adaptation au contexte social.

Mais un LLM « moyen » n'est pas un humain moyen. Même un modèle classé à QI 80 dans ce baromètre a été entraîné sur des centaines de milliards de tokens — l'équivalent de millions de livres. En pratique, il peut synthétiser, résumer, coder, traduire, expliquer des concepts complexes, et rédiger mieux qu'un humain moyen dans la majorité des domaines. Là où un humain à QI 80 aurait du mal avec un texte juridique ou un problème de maths, le LLM à QI 80 le traite sans difficulté — simplement parce qu'il l'a déjà « vu » des milliers de fois pendant son entraînement.

L'écart entre QI 80 et QI 120 ici reflète surtout la différence sur les benchmarks les plus difficiles (raisonnement, coding agentique) — des tâches de logique complexe ou de développement où même les experts humains peinent. Ce n'est pas un indicateur d'utilité quotidienne : tous les modèles de ce classement sont déjà remarquablement capables.

En résumé : utilise ce score pour comparer les modèles entre eux, pas pour les comparer à des humains. Un QI de 85 ici ne veut pas dire « peu intelligent » — ça veut dire « légèrement en dessous de la moyenne des meilleurs LLM du monde ».

Méthodologie

Ce baromètre agrège les résultats de benchmarks de référence reconnus par la communauté IA. Les données sont collectées quotidiennement depuis plusieurs sources publiques, puis croisées et consolidées automatiquement pour produire un classement à jour.

Sources des données :

Le score global est une moyenne des benchmarks disponibles, normalisés sur 100. Le classement est recalculé chaque jour à 07h00 (heure de Paris).

Questions fréquentes