Chat Z.AI (GLM-5) en 2026 : le modèle chinois qui se fait passer pour Claude

17 min de lecture
Stanislav Belyaev
Stanislav Belyaev Engineering Leader chez Microsoft
Chat Z.AI (GLM-5) en 2026 : le modèle chinois qui se fait passer pour Claude

AI-модели в этой статье

Le 6 février 2026, un modèle anonyme baptisé « Pony Alpha » est apparu sur la plateforme OpenRouter – gratuit, sans aucune indication sur ses créateurs. La communauté IA s’est immédiatement lancée dans son identification. Ses capacités en programmation rivalisaient avec Claude Opus 4.5. À la question « qui es-tu ? », le modèle répondait : « Je suis GLM ». Mais lorsqu’on lui a demandé de rédiger une page web se présentant – il a écrit : « I am Claude, created by Anthropic ».

Ce comportement était reproductible à 100 %. Et c’est précisément ce détail qui définit tout ce qu’il faut savoir sur GLM-5 avant de passer aux benchmarks et aux tarifs.

Essayez par vous-même : GLM-5 vs GigaChat vs Claude

Avant de plonger dans l’histoire, les benchmarks et les tarifs – lancez le prompt directement ici et comparez trois modèles sur une même tâche : GLM-5 (Z.ai), GigaChat-2-Max (Sber) et Claude Sonnet 4.6 (Anthropic). Trois approches radicalement différentes : le challenger chinois à bas coût, le modèle russe « maison » avec une connaissance fine du contexte local, et le flagship premium occidental.

Exemple 1. Une lettre délicate à un fournisseur

Essayez vous-même
Communication professionnelle en France
Vous
Tu es directeur ou directrice des achats dans une enseigne de distribution française. Rédige une lettre (180 mots maximum) à un fournisseur d'emballages avec qui vous travaillez depuis 6 ans, pour lui annoncer qu'à l'issue d'un appel d'offres, vous passez temporairement à un autre prestataire en raison du prix. La lettre doit : préserver la relation, nommer honnêtement la raison sans jargon administratif, laisser la porte ouverte à une collaboration future et ne pas froisser le partenaire. Le ton doit être respectueux, humain, sans « nous vous informons par la présente ».
Comparaison :
glm-5 · GigaChat-2-Max · claude-sonnet-4-6

Cette tâche teste à la fois la maîtrise du français, le sens du ton et l’étiquette professionnelle. GigaChat est généralement plus solide sur les tournures administratives et la stylistique russophone, Claude excelle dans l’équilibre entre empathie et clarté, et GLM-5 est intéressant comme indicateur de la capacité d’un modèle chinois à produire une lettre d’affaires convaincante en français. Plus bas dans l’article – un second prompt sur une tâche analytique, où les forces de chaque modèle se répartissent différemment.

Qu’est-ce que GLM-5 et qui est derrière ?

Zhipu AI GLM 5.1 Comprend les tâches simples балл 7.4 #29 из 47 $0.016 за задачу доступен из РФ
протестировано: May 2026 · бенчмарк mysummit.school О модели → Сравнить →

Zhipu AI – spin-off de l’Université Tsinghua, fondée en 2019, renommée Z.ai en 2025 et entrée en bourse à Hong Kong en janvier 2026. L’introduction en bourse a été remarquable : dans les trois jours suivant l’annonce officielle de GLM-5, l’action a bondi de 60 %.

Interface GLM

GLM-5 est sorti le 11 février 2026 et prétend d’emblée au titre de modèle open source le plus performant au monde. Pour un manager, trois points essentiels :

  • Le modèle est gratuit et ouvert – le code est disponible sous licence MIT, n’importe quelle entreprise peut le télécharger et l’exécuter sur ses propres serveurs
  • Il traite jusqu’à ~400 pages de texte par requête – idéal pour les documents longs, rapports, contrats
  • Il a été entraîné entièrement sur des puces chinoises Huawei – sans aucun composant NVIDIA

Ce dernier point n’est pas qu’un détail technique. Dans le contexte des restrictions américaines à l’exportation, c’est une déclaration politique : la Chine est capable de créer des modèles IA compétitifs sans accès aux puces occidentales. Pour les entreprises, cela signifie que le fournisseur n’est pas soumis aux sanctions occidentales – contrairement à OpenAI ou Anthropic.

GLM-5.2 : une nouvelle génération (13 juin 2026)

Zhipu AI GLM 5.2 Comprend les tâches simples балл 7.3 #31 из 47 $0.012 за задачу доступен из РФ
протестировано: July 2026 · бенчмарк mysummit.school О модели → Сравнить →

Pendant que nous décortiquions GLM-5, Z.ai a sorti la version suivante. GLM-5.2 est sortie le 13 juin 2026, taillée pour la programmation.

  • Contexte d'1 million de tokens (contre 200K auparavant) – le modèle garde en mémoire un dépôt entier sans perdre le fil.
  • Architecture MoE de 744 milliards de paramètres, dont seulement 40 milliards actifs par token – d’où l’alliance de la puissance et d’un coût modéré.
  • Poids ouverts sous licence MIT et deux niveaux de raisonnement – High et Max (Max pour les tâches complexes en plusieurs étapes).
  • Distribuée via les forfaits GLM Coding Plan (à partir de ~18 $/mois), une API dédiée et le chat web.

Fidèle à l’histoire de GLM, Z.ai n’a publié aucun benchmark au lancement. Dans un secteur où les modèles arrivent d’ordinaire avec leur tableau de victoires, c’est inhabituel. Les tests indépendants sont apparus quelques jours plus tard, et ils sont solides sur le code : sur SWE-bench Pro, GLM-5.2 obtient 62,1 % contre 58,6 % pour GPT-5.5, se classe 2e parmi les modèles de code sur le classement à l’aveugle Code Arena et talonne Claude Opus 4.8 sur Terminal-Bench – pour un coût environ 6 fois inférieur à GPT-5.5.

Cette force a un prix en tokens. Sur le propre graphique de Z.ai consacré à la programmation agentique, au niveau de raisonnement Max, GLM-5.2 rattrape presque Opus 4.8, mais consomme environ deux fois plus de tokens de sortie et reste malgré tout légèrement derrière au sommet. Moins cher par token – mais plus de tokens consommés.

Performance en programmation agentique selon le niveau d’effort
Programmation agentique : score et coût en tokens selon le niveau d’effort. Source : Z.ai

Un mot sur sa façon de planifier. Dans nos tests de planification, elle tranchait elle-même les questions laissées ouvertes et expliquait ses choix, au lieu de les renvoyer au développeur. Exemple : non seulement elle mettait en cache la requête concernant un flag inexistant, mais elle repérait aussi le piège peu évident – ce cache devra être vidé si le flag est créé plus tard. La valeur d’un plan se mesure au nombre de questions réglées avant le début du travail, et sur ce point GLM-5.2 est forte.

Pour les managers : GLM-5.2 est avant tout un outil de développement et de planification d’ingénierie. Sur les tâches de code et la conception de solutions techniques, elle rivalise avec les flagships à un coût nettement moindre. Son comportement sur les tâches métier est une autre histoire – juste en dessous.

L’affaire Pony Alpha : une enquête sans conclusion

« Pony » fait référence à l’année du Cheval dans le calendrier chinois. Le 11 février, Zhipu a officiellement confirmé que Pony Alpha était GLM-5. L’action de l’entreprise a bondi de 60 % en trois jours.

Évolution du cours de l’action depuis le lancement

La question de ce qui s’est réellement passé n’a jamais reçu de réponse officielle. Zhipu n’a pas commenté la confusion d’identité.

Ce n’est pas un cas isolé. En décembre 2025, des chercheurs du MIT ont constaté que dans environ 50 % des cas, les modèles de la série GLM s’identifiaient comme Claude lorsqu’on utilisait des méthodes de requête non standard. DeepSeek V3 présentait une particularité similaire – sous certains prompts, il se présentait comme ChatGPT ou GPT-4. OpenAI a directement accusé DeepSeek de distillation à partir de ses modèles et a mis à jour ses conditions d’utilisation. Anthropic, Mistral et xAI ont suivi avec des clauses anti-distillation similaires.

La distillation – entraîner un modèle plus petit sur les résultats d’un modèle plus grand – est, de toute évidence, un secret de Polichinelle dans l’industrie. Confirmer son utilisation dans GLM-5 est impossible : nous ne disposons d’aucun audit technique. L’infirmer aussi : les schémas de comportement sont trop spécifiques.

Cela soulève une question : si le modèle « se faisait passer » pour Claude lors de requêtes détournées – qu’a-t-il exactement assimilé durant son entraînement ? Et dans quelle mesure cela importe-t-il pour un manager qui cherche un outil opérationnel ?

Ce que montrent les tests

Sur les benchmarks industriels standard, GLM-5 rivalise avec les meilleurs modèles propriétaires – et pour un modèle gratuit et open source, c’est loin d’être anodin. Voici ce qui compte pour un manager :

Programmation – résout 77,8 % des tâches réelles issues de GitHub. À titre de comparaison : Claude Opus 4.5 – 80,9 %, GPT-5.2 – 75,4 %. L’écart avec les leaders est minimal.

Interface de GLM semblable à Claude

Simulation d’entreprise (Vending Bench 2 – un test où le modèle « gère une entreprise » pendant un an) – GLM-5 a terminé avec un solde de 4 432 $, Claude Opus 4.5 – 4 967 $. Le modèle prend des décisions stratégiques à un niveau comparable aux meilleurs concurrents occidentaux.

Recherche web – première place parmi tous les modèles testés, y compris GPT-5.2 et Claude.

Hallucinations – meilleur résultat de l’industrie. GLM-5 préfère dire « je ne sais pas » plutôt qu’inventer une réponse. Pour le travail avec des faits et des chiffres, c’est crucial.

GLM-5 sur les tests GPQA Diamond

Comme toujours, les tests et l’utilisation réelle sont deux choses différentes. Mais la tendance est claire : GLM-5 joue dans la même ligue que ChatGPT et Claude.

Les benchmarks paraissent convaincants – mais entre « le modèle répond bien aux tests » et « le modèle résout ma tâche de façon fiable » se cache toute une couche de compétences : comment formuler la requête, comment vérifier la réponse, comment ne pas se faire piéger par une hallucination assurée. C’est précisément cette couche qui détermine si vous tirerez un bénéfice réel de GLM-5 – ou seulement de belles réponses.

GLM-5 réduit les hallucinations – mais vous les laisserez quand même passer sans une approche systématique. 9 tâches pratiques dans le module gratuit montrent exactement où.

Sans paiement requis • Notification au lancement

Rejoindre la liste

Résultats de notre benchmark

Dans notre benchmark, nous testons les modèles sur des tâches managériales réelles réparties en 8 catégories – de la planification et l’analyse à la communication et à la gestion d’équipe.

GLM-5 se situe dans la partie supérieure du milieu de tableau – un concurrent solide qui devance la plupart des modèles occidentaux de milieu de gamme, mais reste derrière des leaders comme Kimi K2.5 et MiniMax M2.7.

GLM 5.1 в 8 категориях задач

Шкала 0–10. Чем выше — тем лучше модель справилась с задачами

chart

Le profil sur les huit catégories est sans ambiguïté. GLM-5 est le plus fort en planification, en analyse et en gestion d’équipe – il s’approche des leaders sur ces points. Il s’effondre là où un contexte local est nécessaire : formation et développement, connaissance régionale (le contexte des pays de la CEI et les pratiques commerciales locales sont moins bien maîtrisés que par YandexGPT et GigaChat). La recherche d’information et la communication se situent dans une moyenne honnête.

Pour un manager, la conclusion est pragmatique : GLM-5 est un outil puissant pour la planification et l’analyse. Si vous décomposez un projet, évaluez des risques ou analysez des données – le modèle se comportera bien. Si vous devez comprendre les spécificités du marché russe ou construire un programme de formation – le résultat sera plus faible. Et l’atout principal de GLM-5, en plus de la qualité : il est accessible depuis la Russie sans VPN.

Et GLM-5.2 ? Dans notre benchmark, la nouvelle version se situe au même niveau que la première sur les tâches métier, mais à un coût nettement inférieur – et reste l’une des options les plus abordables dans sa gamme de qualité (le rang, le score et le prix actuels figurent dans l’encart sous le titre de la section sur GLM-5.2 ci-dessus). Pour un modèle ouvert d’environ 750 milliards de paramètres, c’est un résultat notable – l’offre open source est restée clairsemée dans cette gamme de taille.

Mais un paradoxe apparaît. Sur les tests de code purs, GLM-5.2 est en tête, alors que sur les tâches métier liées au code, à l’analyse et au marketing (qui exigent un bon anglais) – elle faiblit. Le plus difficile reste les tâches « de réflexion » : le modèle laisse systématiquement passer des détails du texte ou en tire des conclusions injustifiées. Elle respecte le format proprement, donc elle s’intègre sans surprise à d’autres systèmes – mais il faut surveiller ses conclusions. Sa force : le raisonnement d’ingénierie – code, plans techniques, décomposition. Sa faiblesse : le raisonnement « sur papier », où il faut saisir un sens subtil dans un texte ordinaire.

Les résultats détaillés pour toutes les catégories sont sur la page du benchmark.

Interface de réflexion amusante, qui suggère qu’il a été conçu d’abord pour les développeurs

Vous hésitez entre GLM-5, DeepSeek et Claude ? Le module gratuit contient 9 tâches qui montrent où chaque modèle craque. Testez votre approche gratuitement.

Sans paiement requis • Notification au lancement

Rejoindre la liste

Comment utiliser Chat Z.AI (GLM-5) dès maintenant

chat.z.ai – l’interface web officielle, fonctionne en Russie sans VPN. Connexion via un compte Google. L’interface est en anglais et en chinois, il n’y a pas d’interface en français, mais le modèle comprend le français et peut y répondre.

Deux modes de fonctionnement :

Chat Mode – le format de dialogue classique. Convient à la plupart des tâches : rédaction de textes, analyse de documents, réponses aux questions.

Agent Mode – c’est ici que GLM-5 révèle tout son potentiel. Le modèle peut utiliser des outils : générer des fichiers .docx, .pdf, .xlsx, effectuer des recherches web, exécuter des tâches en plusieurs étapes. Si vous demandez un rapport avec des tableaux – c’est le mode qu’il vous faut.

Recommandation pratique concernant la langue : la qualité des réponses en anglais est nettement supérieure à celle en russe. Si la tâche le permet, formulez vos prompts en anglais, en particulier pour les requêtes analytiques complexes. C’est la même situation qu’avec Qwen : les modèles chinois fonctionnent mieux dans les langues sur lesquelles ils ont été le plus entraînés.

La semaine suivant le lancement de GLM-5 a été mouvementée : le trafic a été multiplié par 10, le service a connu des instabilités pendant plusieurs jours, et Zhipu a présenté des excuses publiques. À la mi-mars, la situation s’est normalisée, mais il faut garder à l’esprit que c’est un service jeune avec une charge en croissance rapide.

Exemple 2. Pré-mortem avant le lancement d’un nouveau produit

Deuxième tâche : analytique. C’est traditionnellement le terrain de Claude, et pour GLM-5 c’est un test honnête : un modèle chinois à bas coût est-il capable de produire un raisonnement structuré au niveau d’un flagship ? Pour GigaChat, c’est l’occasion de montrer comment il travaille avec le contexte du marché russe.

Essayez vous-même
Analyse : pré-mortem avant un lancement
Vous
Tu es product manager. L'équipe prépare le lancement d'une application mobile pour les auto-entrepreneurs en France : suivi des revenus, calcul automatique des cotisations URSSAF et de l'impôt, intégration avec les comptes bancaires. Le lancement est prévu dans 6 semaines. Conduis un pré-mortem : imagine que 3 mois après le lancement, le produit a échoué. Identifie 6 à 8 causes d'échec les plus probables, regroupe-les par catégories (produit, marché, opérations, risques juridiques), et pour chaque cause, indique un signal précoce permettant de la repérer avant le lancement ainsi qu'une action concrète pour réduire le risque.
Comparaison :
glm-5 · GigaChat-2-Max · claude-sonnet-4-6

Observez non seulement le contenu, mais aussi la structure de la réponse : la capacité du modèle à respecter toutes les exigences du prompt (6 à 8 causes, catégories, signaux, actions) – c’est précisément ce qui distingue un outil opérationnel d’une belle démonstration.

Limites et risques

La censure chinoise fonctionne de manière prévisible : les sujets politiquement sensibles, la critique historique de l’État, certains événements – tout cela est bloqué. Pour un manager, c’est rarement un problème en pratique, mais il est utile de le savoir.

La qualité en russe est l’une des faiblesses majeures du modèle. Contrairement à DeepSeek, qui travaille nettement mieux avec le contexte russe, GLM-5 perd sensiblement en précision et en nuance sur des tâches en russe. Nos tests l’ont confirmé.

Langue estonienne dans le modèle

Vitesse de réponse en mode d’analyse approfondie nettement inférieure à Claude et GPT – environ 30 à 40 % plus lente. Pas critique pour des tâches ponctuelles, mais perceptible lors d’un travail intensif.

La question de la distillation reste ouverte. Cela ne signifie pas que le modèle est techniquement peu fiable – il fonctionne. Mais pour les organisations qui utilisent Claude et se soucient de l’éthique de l’utilisation de l’IA, ce fait mérite d’être pris en compte.

Déploiement sur ses propres serveurs – techniquement possible (le code est ouvert), mais nécessite du matériel serveur coûtant plusieurs millions de roubles. Contrairement aux modèles compacts de Qwen, GLM-5 ne peut pas être déployé par un simple département informatique.

Pas d’application mobile – uniquement le web.

Tarifs

OptionCoûtPour qui
chat.z.aiGratuit (avec limites)Essayer sans engagement
API via OpenRouter~0,15 $ pour l’analyse d’un rapport de 100 pagesIntégration dans les processus de travail

À titre de comparaison : la même analyse via Claude Opus 4.5 coûterait environ 3 $, via GPT-5.2 – environ 1,50 $. GLM-5 est 20 fois moins cher pour des capacités comparables sur de nombreuses tâches.

Cela dit, parmi les modèles chinois open source, GLM-5 est le plus cher. DeepSeek et Qwen coûtent encore 3 à 5 fois moins cher. Pourquoi payer plus ? Pour ses solides résultats en planification et en analyse – si ce sont vos priorités, la différence se justifie.

Un détail important : après le lancement de GLM-5, Zhipu a augmenté les prix du plan Pro d’environ 30 %, ce qui a provoqué le mécontentement des utilisateurs.

Faut-il l’essayer ?

GLM-5 est un modèle avec des forces réelles et des faiblesses réelles, enveloppé dans une histoire qui n’a toujours pas reçu de réponse définitive.

Les bons résultats en planification et en analyse sont réels et reproductibles. Si vous décomposez un projet, évaluez des décisions stratégiques ou analysez des données – GLM-5 mérite d’être essayé. Son accès depuis la Russie sans VPN en fait l’une des options les plus pratiques parmi les modèles de ce niveau.

Si vous avez besoin d’un modèle pour travailler avec le contexte russe, former une équipe ou traiter des tâches à forte spécificité régionale – GLM-5 est en retrait par rapport à la concurrence. Pour ces besoins, DeepSeek ou Claude feront mieux le travail.

L’affaire Pony Alpha et l’identification comme Claude ne sont pas une raison de rejeter l’outil, mais une raison de garder une distance analytique. L’industrie évolue depuis longtemps dans une zone grise où la frontière entre « inspiration » et « distillation » est volontairement floue. Ce n’est pas une exception pour GLM-5 – c’est le tableau d’ensemble qu’il est honnête de garder en tête.

L’accès est simple : chat.z.ai fonctionne en Russie sans VPN, connexion via Google, un niveau gratuit existe. Cela vaut la peine de consacrer une heure aux tests – et de se forger sa propre opinion.

Spécialisation

Commencez à utiliser les outils IA de façon méthodique

Programme complet : des bases du prompt engineering aux spécialisations en gestion de projet et en analyse. Choisissez n'importe quel modèle – GLM-5, Claude, DeepSeek – et testez votre approche sur des scénarios managériaux réels.

От pre-mortem до антикризисного плана
Переиспользуемые промпт-шаблоны
Сквозной кейс на реальном проекте
~300 часов экономии в год
Stanislav Belyaev

Stanislav Belyaev

Engineering Leader chez Microsoft

18 ans a diriger des equipes d'ingenieurs. Fondateur de mysummit.school. 700+ diplomes chez Yandex Practicum et Stratoplan.