Mis à jour automatiquement
Observatoire IA
Modèles de langage (chatbots, raisonnement, code). Mis à jour quotidiennement.
Dernière mise à jour : 6 septembre 2026 · 16 modèles · 173 snapshots
Distribution des performances
| Provider | |||||||||
|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 frontier | Anthropic | 57 | 83.4 | 91.7 | 86.4 | 97.0 | — | $6.12 |
| 2 | GPT-6 Astra frontier | OpenAI | 55 | 82.2 | 92.7 | 80.4 | 96.8 | — | $2.57 |
| 3 | Claude Opus 5 frontier | Anthropic | 54 | 80.1 | 91.2 | 81.4 | 95.7 | — | $4.21 |
| 4 | Claude Fable 5 frontier | Anthropic | 53 | 83.0 | 89.7 | 86.0 | 96.0 | — | $5.62 |
| 5 | Muse Spark 1.3 frontier | Meta | 53 | 81.6 | 89.7 | 81.1 | 95.9 | — | $0.96 |
| 6 | GPT-5.6 Sol reasoning | OpenAI | 51 | 81.0 | 91.7 | 83.9 | 96.2 | — | $1.25 |
| 7 | Grok 4.6 frontier | SpaceXAI | 51 | 78.0 | 90.5 | 76.8 | 92.6 | — | $1.25 |
| 8 | Kimi K3 open-source | Kimi | 50 | 79.2 | 90.7 | 81.4 | 84.4 | — | $1.58 |
| 9 | GLM-5.3 open-source | Z AI | 49 | 76.1 | 85.8 | 79.0 | 87.9 | — | $1.26 |
| 10 | Gemini 3.8 Flash frontier | 47 | 75.8 | 89.3 | 72.5 | 91.6 | — | $0.74 | |
| 11 | Qwen3.8 Max open-source | Alibaba | 47 | 78.5 | 88.2 | 72.9 | 91.3 | — | $1.19 |
| 12 | GPT-5.6 Terra reasoning | OpenAI | 47 | 77.9 | 90.6 | 78.2 | 94.9 | — | $0.81 |
| 13 | GLM-5.3-Flash open-source | Z AI | 46 | 71.6 | 77.6 | 79.0 | 81.2 | — | $0.18 |
| 14 | Grok 4.5 frontier | SpaceXAI | 45 | 75.8 | 87.2 | 68.6 | 90.8 | — | $0.43 |
| 15 | Gemini 3.7 Flash frontier | 45 | 78.8 | 87.8 | 78.9 | 93.5 | — | $0.55 | |
| 16 | Claude Sonnet 5 frontier | Anthropic | 45 | 76.0 | 88.7 | 80.7 | 92.9 | — | $3.31 |
Comprendre les mesures
Le rang général s'appuie sur la mesure de qualité primaire. Les autres colonnes donnent du contexte, sans favoriser un modèle dont des données seraient manquantes.
Intelligence Index
Indice composite indépendant couvrant raisonnement, expertise, code et tâches agentiques. Il sert de métrique primaire au classement.
LiveBench
Benchmark continuellement mis à jour — moyenne globale couvrant raisonnement, code, mathématiques, analyse et langage.
Raisonnement
Score de raisonnement — logique, déduction et résolution de problèmes complexes.
Code
Score de coding — génération, compréhension et debug de code.
Mathématiques
Score de mathématiques — résolution de problèmes, algèbre, calcul et statistiques.
SWE-bench
Résolution autonome de vrais bugs GitHub. Mesure la capacité de développement réelle.
Méthodologie
Les données sont collectées chaque jour depuis les classements publics ci-dessous. Un lot n'est publié que s'il contient assez de modèles valides et la mesure primaire attendue ; sinon, le dernier snapshot vérifié reste affiché.
Sources des données :
- Artificial Analysis — Intelligence Index et arènes Image, Vidéo, Voix et Musique
- LiveBench — raisonnement, code, mathématiques et moyenne globale
- SWE-bench — résolution autonome de bugs open-source
Le rang général suit l'Intelligence Index pour les LLM, l'Elo de l'arène pour Image/Vidéo/Voix, et la moyenne des deux Elo pour Musique. Les métriques secondaires restent informatives et ne compensent jamais une donnée primaire manquante.