Mis à jour automatiquement

Observatoire IA

Modèles de langage (chatbots, raisonnement, code). Mis à jour quotidiennement.

Dernière mise à jour : 6 septembre 2026 · 16 modèles · 173 snapshots

16 modèles

Distribution des performances

Score Global50%60%70%80%90%G4.5G3.7FCS5G5.3FG3.8FQMG5.6TG5.3KKG5.6SG4.6CF5MS1.3CO5G6ACF5.1
Google
Anthropic
OpenAI
Z AI
Kimi
Meta
Alibaba
Provider
1
Claude Fable 5.1
frontier
Anthropic5783.491.786.497.0$6.12
2
GPT-6 Astra
frontier
OpenAI5582.292.780.496.8$2.57
3
Claude Opus 5
frontier
Anthropic5480.191.281.495.7$4.21
4
Claude Fable 5
frontier
Anthropic5383.089.786.096.0$5.62
5
Muse Spark 1.3
frontier
Meta5381.689.781.195.9$0.96
6
GPT-5.6 Sol
reasoning
OpenAI5181.091.783.996.2$1.25
7
Grok 4.6
frontier
SpaceXAI5178.090.576.892.6$1.25
8
Kimi K3
open-source
Kimi5079.290.781.484.4$1.58
9
GLM-5.3
open-source
Z AI4976.185.879.087.9$1.26
10
Gemini 3.8 Flash
frontier
Google4775.889.372.591.6$0.74
11
Qwen3.8 Max
open-source
Alibaba4778.588.272.991.3$1.19
12
GPT-5.6 Terra
reasoning
OpenAI4777.990.678.294.9$0.81
13
GLM-5.3-Flash
open-source
Z AI4671.677.679.081.2$0.18
14
Grok 4.5
frontier
SpaceXAI4575.887.268.690.8$0.43
15
Gemini 3.7 Flash
frontier
Google4578.887.878.993.5$0.55
16
Claude Sonnet 5
frontier
Anthropic4576.088.780.792.9$3.31

Comprendre les mesures

Le rang général s'appuie sur la mesure de qualité primaire. Les autres colonnes donnent du contexte, sans favoriser un modèle dont des données seraient manquantes.

🏟️

Intelligence Index

Indice composite indépendant couvrant raisonnement, expertise, code et tâches agentiques. Il sert de métrique primaire au classement.

Plage : 0 — 70 ptsArtificial Analysis
📈

LiveBench

Benchmark continuellement mis à jour — moyenne globale couvrant raisonnement, code, mathématiques, analyse et langage.

Plage : 0 — 100%LiveBench.ai
🧠

Raisonnement

Score de raisonnement — logique, déduction et résolution de problèmes complexes.

Plage : 0 — 100%LiveBench.ai
💻

Code

Score de coding — génération, compréhension et debug de code.

Plage : 0 — 100%LiveBench.ai
🧮

Mathématiques

Score de mathématiques — résolution de problèmes, algèbre, calcul et statistiques.

Plage : 0 — 100%LiveBench.ai
🐛

SWE-bench

Résolution autonome de vrais bugs GitHub. Mesure la capacité de développement réelle.

Plage : 0 — 100%SWE-bench.com

Méthodologie

Les données sont collectées chaque jour depuis les classements publics ci-dessous. Un lot n'est publié que s'il contient assez de modèles valides et la mesure primaire attendue ; sinon, le dernier snapshot vérifié reste affiché.

Sources des données :

  • Artificial Analysis — Intelligence Index et arènes Image, Vidéo, Voix et Musique
  • LiveBench — raisonnement, code, mathématiques et moyenne globale
  • SWE-bench — résolution autonome de bugs open-source

Le rang général suit l'Intelligence Index pour les LLM, l'Elo de l'arène pour Image/Vidéo/Voix, et la moyenne des deux Elo pour Musique. Les métriques secondaires restent informatives et ne compensent jamais une donnée primaire manquante.

Questions fréquentes