Logo GLM

GLM

Des modèles pour le code, les agents et la compréhension visuelle

FreemiumChineTop Pick NXUS

Presentation

Fiche actualisée le 22 septembre 2026. Versions, accès et tarifs vérifiés dans les sources officielles citées. Cette mise à jour documentaire ne constitue pas un nouveau benchmark NXUS.

GLM est la famille de modèles proposée par Z.ai. Elle s’utilise dans un chat, dans les outils ZCode et AutoClaw, ou directement par API. La nouveauté du 22 septembre 2026 est GLM-5.3-Flash : son nom évoque l’efficacité, mais cette nouvelle référence possède sa propre grille payante.

GLM-5.3 et GLM-5.3-Flash

GLM-5.3 est un modèle textuel avec un contexte d’un million de tokens et jusqu’à 128 000 tokens de sortie. GLM-5.3-Flash ajoute une compréhension multimodale native et un contexte d’un million de tokens. L’annonce décrit une architecture de 320 milliards de paramètres au total, dont 18 milliards activés, combinant attention parcimonieuse et linéaire. Z.ai annonce la diffusion des poids de Flash sous licence MIT. Ces chiffres d’architecture ne constituent pas une mesure de vitesse sur ton matériel.

Sources : GLM-5.3 GLM-5.3-Flash : documentation Annonce GLM-5.3-Flash du 22 septembre.

FlashX : une variante d’inférence distincte

GLM-5.3-FlashX est la variante orientée vitesse de service. Son tarif est plus élevé que celui de Flash. Les débits présentés par l’éditeur dépendent de son infrastructure et des conditions de mesure ; ils ne prédisent pas le temps d’une mission complète avec outils. La documentation indique que FlashX n’est pas encore inclus dans le Coding Plan au moment de cette vérification. Il faut donc vérifier le canal disponible avant de l’intégrer à un agent de code.

Sources : GLM-5.3-Flash : documentation Tarifs API Z.ai.

Tarifs API actuels

Par million de tokens entrée/sortie : GLM-5.3 : 1,40 $ / 4,40 $ ; GLM-5.3-Flash : 0,15 $ / 0,50 $ ; FlashX : 0,37 $ / 1,25 $. Le cache en entrée est respectivement à 0,26 $, 0,03 $ et 0,075 $. Ces tarifs concernent l’API. Le nom Flash ne signifie pas gratuit : les anciennes offres gratuites d’autres références ne s’appliquent pas automatiquement à GLM-5.3-Flash.

Sources : Tarifs API Z.ai.

Coding Plan, chat et déploiement local

Le Coding Plan affiche des prix de référence de 18 $/mois pour Lite, 80 $ pour Pro et 168 $ pour Max. Des promotions peuvent réduire ces montants ; elles ne sont pas présentées ici comme un tarif permanent. L’usage dépend de crédits et de fenêtres de quota, notamment cinq heures et une semaine. Le plan de code et l’API générale ne sont pas interchangeables. Les poids ouverts permettent un autre mode d’hébergement, avec ses propres besoins en mémoire, calcul et exploitation.

Sources : ZCode et Coding Plan GLM-5.3-Flash : documentation.

Où utiliser cet outil ?

Pour discuter, ouvre Z.ai Chat. Pour le développement, consulte ZCode. Pour l’API, pars de la documentation Z.ai. Les liens de téléchargement et la licence de Flash sont référencés dans son annonce officielle.

Sources officielles et documentation

Comment utiliser

Parcours conseillé pour une première utilisation :

  1. Commence dans le chat ou la console correspondant à ton besoin, sans confondre abonnement de code et crédit API.
  2. Choisis GLM-5.3 pour une tâche textuelle ou Flash pour un contenu visuel pris en charge.
  3. Teste un cas connu, puis compare le temps complet et la qualité avec la variante envisagée.
  4. Pour un agent, définis les outils et les formats de sortie ; prévois la gestion des erreurs et des quotas.
  5. Avant un hébergement local, vérifie les fichiers officiels, la licence et les exigences du moteur d’inférence choisi.

Pour comparer deux modèles, conserve le même document et les mêmes critères : exactitude, temps de réponse, qualité du livrable et coût réel. Une réponse plus longue ou un raisonnement plus intense ne garantissent pas un meilleur résultat.

Astuces & conseils

Contrôler le nom complet

GLM-5.3-Flash et GLM-4.7-Flash ne partagent pas automatiquement le même tarif.

Comparer un workflow entier

Mesure aussi le nombre d’appels d’outils et de corrections nécessaires.

Fonctionnalites cles

GLM-5.3 textuel

Contexte long pour le code et le raisonnement.

Flash multimodal

Compréhension visuelle et poids annoncés sous MIT.

FlashX

Variante API orientée vitesse.

Outils de code

ZCode et offres Coding Plan avec quotas.

Modeles IA

GLM-5.3

Contexte

1 M

Cout

1,40 $ entrée / 4,40 $ sortie par MTok

Texte, raisonnement et code

GLM-5.3-Flash

Recommande
Contexte

1 M

Cout

0,15 $ / 0,50 $ par MTok

Multimodal

Oui

Vision et agents à budget réduit

GLM-5.3-FlashX

Contexte

1 M

Cout

0,37 $ / 1,25 $ par MTok

Multimodal

Oui

Variante API privilégiant la vitesse

Tarifs & plans

Populaire

Z.ai Chat

Selon accès et quotas

  • Conditions du compte

Coding Plan Lite

18 $/mois hors promotion

  • Crédits et fenêtres de quota

Coding Plan Pro

80 $/mois hors promotion

  • Capacité supérieure selon offre

Coding Plan Max

168 $/mois hors promotion

  • Capacité supérieure selon offre

API Flash

0,15 $ entrée / 0,50 $ sortie par MTok

  • Cache : 0,03 $/MTok
  • FlashX facturé autrement

Questions frequentes

Non. Son tarif API publié est de 0,15 $/MTok en entrée et 0,50 $ en sortie, avec un prix de cache distinct.

GLM-5.3 est la référence textuelle. GLM-5.3-Flash est une nouvelle référence multimodale avec une autre architecture et un autre tarif.

La documentation consultée indique que ce n’est pas encore le cas au 22 septembre 2026.

L’annonce officielle présente GLM-5.3-Flash avec des poids sous licence MIT. Un déploiement local nécessite néanmoins une infrastructure adaptée.

Outils similaires

Glossaire associe

Modèle et application

Le modèle traite les données. L’application ajoute interface, fichiers, recherche et outils ; ses quotas ne sont pas nécessairement ceux de l’API.

Contexte

Quantité de tokens traitée dans une requête, avec des limites distinctes pour l’entrée et la sortie. Une fenêtre longue ne garantit pas une lecture parfaite.

MTok

Un million de tokens. Les tarifs API distinguent généralement entrée, entrée réutilisée en cache et sortie, auxquels peuvent s’ajouter des outils.

Agent

Logiciel qui utilise un modèle pour enchaîner des actions et des appels à des outils afin d’accomplir une tâche.

5/5
MAJ : 22 septembre 2026
Fonde en 2019
273 vues

Ressources connexes