GLM
Des modèles pour le code, les agents et la compréhension visuelle
Presentation
Fiche actualisée le 22 septembre 2026. Versions, accès et tarifs vérifiés dans les sources officielles citées. Cette mise à jour documentaire ne constitue pas un nouveau benchmark NXUS.
GLM est la famille de modèles proposée par Z.ai. Elle s’utilise dans un chat, dans les outils ZCode et AutoClaw, ou directement par API. La nouveauté du 22 septembre 2026 est GLM-5.3-Flash : son nom évoque l’efficacité, mais cette nouvelle référence possède sa propre grille payante.
GLM-5.3 et GLM-5.3-Flash
GLM-5.3 est un modèle textuel avec un contexte d’un million de tokens et jusqu’à 128 000 tokens de sortie. GLM-5.3-Flash ajoute une compréhension multimodale native et un contexte d’un million de tokens. L’annonce décrit une architecture de 320 milliards de paramètres au total, dont 18 milliards activés, combinant attention parcimonieuse et linéaire. Z.ai annonce la diffusion des poids de Flash sous licence MIT. Ces chiffres d’architecture ne constituent pas une mesure de vitesse sur ton matériel.
Sources : GLM-5.3 GLM-5.3-Flash : documentation Annonce GLM-5.3-Flash du 22 septembre.
FlashX : une variante d’inférence distincte
GLM-5.3-FlashX est la variante orientée vitesse de service. Son tarif est plus élevé que celui de Flash. Les débits présentés par l’éditeur dépendent de son infrastructure et des conditions de mesure ; ils ne prédisent pas le temps d’une mission complète avec outils. La documentation indique que FlashX n’est pas encore inclus dans le Coding Plan au moment de cette vérification. Il faut donc vérifier le canal disponible avant de l’intégrer à un agent de code.
Sources : GLM-5.3-Flash : documentation Tarifs API Z.ai.
Tarifs API actuels
Par million de tokens entrée/sortie : GLM-5.3 : 1,40 $ / 4,40 $ ; GLM-5.3-Flash : 0,15 $ / 0,50 $ ; FlashX : 0,37 $ / 1,25 $. Le cache en entrée est respectivement à 0,26 $, 0,03 $ et 0,075 $. Ces tarifs concernent l’API. Le nom Flash ne signifie pas gratuit : les anciennes offres gratuites d’autres références ne s’appliquent pas automatiquement à GLM-5.3-Flash.
Sources : Tarifs API Z.ai.
Coding Plan, chat et déploiement local
Le Coding Plan affiche des prix de référence de 18 $/mois pour Lite, 80 $ pour Pro et 168 $ pour Max. Des promotions peuvent réduire ces montants ; elles ne sont pas présentées ici comme un tarif permanent. L’usage dépend de crédits et de fenêtres de quota, notamment cinq heures et une semaine. Le plan de code et l’API générale ne sont pas interchangeables. Les poids ouverts permettent un autre mode d’hébergement, avec ses propres besoins en mémoire, calcul et exploitation.
Sources : ZCode et Coding Plan GLM-5.3-Flash : documentation.
Où utiliser cet outil ?
Pour discuter, ouvre Z.ai Chat. Pour le développement, consulte ZCode. Pour l’API, pars de la documentation Z.ai. Les liens de téléchargement et la licence de Flash sont référencés dans son annonce officielle.
Sources officielles et documentation
Comment utiliser
Parcours conseillé pour une première utilisation :
- Commence dans le chat ou la console correspondant à ton besoin, sans confondre abonnement de code et crédit API.
- Choisis GLM-5.3 pour une tâche textuelle ou Flash pour un contenu visuel pris en charge.
- Teste un cas connu, puis compare le temps complet et la qualité avec la variante envisagée.
- Pour un agent, définis les outils et les formats de sortie ; prévois la gestion des erreurs et des quotas.
- Avant un hébergement local, vérifie les fichiers officiels, la licence et les exigences du moteur d’inférence choisi.
Pour comparer deux modèles, conserve le même document et les mêmes critères : exactitude, temps de réponse, qualité du livrable et coût réel. Une réponse plus longue ou un raisonnement plus intense ne garantissent pas un meilleur résultat.
Astuces & conseils
Contrôler le nom complet
GLM-5.3-Flash et GLM-4.7-Flash ne partagent pas automatiquement le même tarif.
Comparer un workflow entier
Mesure aussi le nombre d’appels d’outils et de corrections nécessaires.
Fonctionnalites cles
GLM-5.3 textuel
Contexte long pour le code et le raisonnement.
Flash multimodal
Compréhension visuelle et poids annoncés sous MIT.
FlashX
Variante API orientée vitesse.
Outils de code
ZCode et offres Coding Plan avec quotas.
Modeles IA
GLM-5.3
1 M
1,40 $ entrée / 4,40 $ sortie par MTok
Texte, raisonnement et code
GLM-5.3-Flash
Recommande1 M
0,15 $ / 0,50 $ par MTok
Oui
Vision et agents à budget réduit
GLM-5.3-FlashX
1 M
0,37 $ / 1,25 $ par MTok
Oui
Variante API privilégiant la vitesse
Tarifs & plans
Z.ai Chat
Selon accès et quotas
- Conditions du compte
Coding Plan Lite
18 $/mois hors promotion
- Crédits et fenêtres de quota
Coding Plan Pro
80 $/mois hors promotion
- Capacité supérieure selon offre
Coding Plan Max
168 $/mois hors promotion
- Capacité supérieure selon offre
API Flash
0,15 $ entrée / 0,50 $ sortie par MTok
- Cache : 0,03 $/MTok
- FlashX facturé autrement
Questions frequentes
Non. Son tarif API publié est de 0,15 $/MTok en entrée et 0,50 $ en sortie, avec un prix de cache distinct.
GLM-5.3 est la référence textuelle. GLM-5.3-Flash est une nouvelle référence multimodale avec une autre architecture et un autre tarif.
La documentation consultée indique que ce n’est pas encore le cas au 22 septembre 2026.
L’annonce officielle présente GLM-5.3-Flash avec des poids sous licence MIT. Un déploiement local nécessite néanmoins une infrastructure adaptée.
Outils similaires

Claude
L’assistant Anthropic pour les documents, le raisonnement et le code
DeepSeek
Chat et API de raisonnement, avec vision native sur V4.1 Flash
Kimi
Un assistant pour les dossiers longs et le travail avec agents
MiniMax
Le modèle M3 et l’agent MiniMax Code pour des tâches avec outils

Qwen
Des modèles de texte, vision et temps réel dans la gamme Qwen
Glossaire associe
Modèle et application
Le modèle traite les données. L’application ajoute interface, fichiers, recherche et outils ; ses quotas ne sont pas nécessairement ceux de l’API.
Contexte
Quantité de tokens traitée dans une requête, avec des limites distinctes pour l’entrée et la sortie. Une fenêtre longue ne garantit pas une lecture parfaite.
MTok
Un million de tokens. Les tarifs API distinguent généralement entrée, entrée réutilisée en cache et sortie, auxquels peuvent s’ajouter des outils.
Agent
Logiciel qui utilise un modèle pour enchaîner des actions et des appels à des outils afin d’accomplir une tâche.
Ressources connexes
Prompts ChatGPT
+500 prompts IA gratuits classés en 21 catégories
Agent IA : le guide
C'est quoi un agent IA ? Définition, exemples et comment démarrer
Cas d'usage agents IA
+800 scénarios concrets par métier et par agent (Claude Code, Codex…)
Skills IA
Compétences à brancher sur Claude, Codex et tes agents
Blog IA
Actualités, tutoriels et analyses sur l'intelligence artificielle
Passer à l’IA
Agent IA, formation des équipes et conduite du changement