Chat Z.AI (GLM-5) en 2026: el modelo chino que finge ser Claude

17 min de lectura
Stanislav Belyaev
Stanislav Belyaev Engineering Leader en Microsoft
Chat Z.AI (GLM-5) en 2026: el modelo chino que finge ser Claude

AI-модели в этой статье

El 6 de febrero de 2026, en la plataforma OpenRouter apareció un modelo anónimo llamado «Pony Alpha» – gratuito, sin ningún detalle sobre sus creadores. La comunidad de IA comenzó a identificarlo de inmediato. Sus capacidades de programación se acercaban a las de Claude Opus 4.5. Al preguntarle «¿quién eres?», el modelo respondía: «Soy GLM». Pero cuando le pidieron crear una página web describiéndose a sí mismo, escribió: «I am Claude, created by Anthropic».

Esto era reproducible al cien por ciento. Y precisamente este momento define todo lo que necesitas saber sobre GLM-5 antes de pasar a los benchmarks y las tarifas.

Pruébalo tú mismo: GLM-5 vs GigaChat vs Claude

Antes de entrar en la historia, los benchmarks y los precios – lanza un prompt aquí mismo y compara tres modelos en la misma tarea: GLM-5 (Z.ai), GigaChat-2-Max (Sber) y Claude Sonnet 4.6 (Anthropic). Son tres enfoques radicalmente distintos: el retador chino barato, el modelo doméstico ruso fuerte en contexto local y el buque insignia occidental premium.

Ejemplo 1. Una carta delicada a un proveedor

Pruébalo tú mismo
Деловая коммуникация по-русски
Eres director/a de compras en una cadena de retail en España. Escribe una carta (máximo 180 palabras) a un proveedor de embalaje con el que trabajáis desde hace 6 años, explicando que, tras el resultado de una licitación, cambiáis temporalmente a otro proveedor por motivos de precio. La carta debe: preservar la relación, explicar el motivo con honestidad y sin lenguaje burocrático, dejar la puerta abierta a una futura colaboración y no herir al socio. El tono debe ser respetuoso y cercano, sin fórmulas rígidas del tipo «por la presente le informamos».
Comparamos:
glm-5 · GigaChat-2-Max · claude-sonnet-4-6

Esta tarea evalúa a la vez el idioma, la sensibilidad al tono y la etiqueta empresarial. GigaChat suele destacar en el registro formal y el estilo local, Claude en el equilibrio entre empatía y claridad, y GLM-5 resulta interesante como indicador de hasta qué punto un modelo chino «da la talla» en una carta de negocios fuera de su idioma nativo. Más abajo en el artículo hay un segundo prompt sobre una tarea analítica, donde los puntos fuertes de cada modelo se reparten de otra manera.

Qué es GLM-5 y quién está detrás

Zhipu AI GLM 5.1 Entiende tareas simples балл 7.4 #29 из 47 $0.016 за задачу доступен из РФ
протестировано: May 2026 · бенчмарк mysummit.school О модели → Сравнить →

Zhipu AI – un spin-off de la Universidad de Tsinghua, fundado en 2019, que en 2025 cambió su nombre a Z.ai y salió a la Bolsa de Hong Kong en enero de 2026. La salida a bolsa fue impresionante: en los tres días posteriores al anuncio oficial de GLM-5, las acciones subieron un 60%.

Interfaz de GLM

GLM-5 se lanzó el 11 de febrero de 2026 y aspira directamente al título del modelo abierto más potente del mundo. Para un manager, hay tres cosas importantes:

  • El modelo es gratuito y abierto – el código está disponible bajo licencia MIT, cualquier empresa puede descargarlo y ejecutarlo en sus propios servidores
  • Con una sola consulta «lee» hasta ~400 páginas de texto – ideal para trabajar con documentos extensos, informes, contratos
  • Fue entrenado completamente con chips chinos de Huawei – sin un solo componente de NVIDIA

Este último punto no es un simple detalle técnico. En el contexto de las restricciones de exportación estadounidenses, es una declaración política: China puede crear modelos de IA competitivos sin acceso a chips occidentales. Para el negocio, esto significa que el proveedor no depende de sanciones occidentales – a diferencia de OpenAI o Anthropic.

GLM-5.2: nueva generación (13 de junio de 2026)

Zhipu AI GLM 5.2 Entiende tareas simples балл 7.3 #31 из 47 $0.012 за задачу доступен из РФ
протестировано: July 2026 · бенчмарк mysummit.school О модели → Сравнить →

Mientras se preparaba este análisis de GLM-5, Z.ai lanzó la siguiente versión. GLM-5.2 salió el 13 de junio de 2026 y está orientada a la programación.

  • Contexto de 1 millón de tokens (frente a 200K de la versión anterior) – el modelo mantiene en memoria un repositorio entero sin perder el hilo.
  • Arquitectura MoE de 744 mil millones de parámetros, de los que solo 40 mil millones están activos por token – de ahí la combinación de potencia y precio contenido.
  • Pesos abiertos bajo licencia MIT y dos niveles de razonamiento – High y Max (Max está pensado para tareas complejas de varios pasos).
  • Se distribuye a través de los planes GLM Coding Plan (desde ~$18/mes), una API independiente y el chat web.

Fiel a toda la historia de GLM, en el lanzamiento Z.ai no publicó ni un solo benchmark. En un sector donde los modelos suelen llegar con su tabla de victorias lista, resulta inusual. Los tests independientes aparecieron unos días después, y en código son sólidos: en SWE-bench Pro GLM-5.2 obtuvo un 62,1% frente al 58,6% de GPT-5.5, quedó 2.ª entre los modelos de programación en el ranking ciego Code Arena y se acercó a Claude Opus 4.8 en Terminal-Bench – a un coste unas 6 veces menor que GPT-5.5.

Esa fuerza tiene un precio en tokens. En el propio gráfico de Z.ai sobre programación agéntica, en el nivel máximo de razonamiento GLM-5.2 casi alcanza a Opus 4.8, pero gasta alrededor del doble de tokens de salida y en el punto más alto se queda algo por detrás. Más barata por token – pero consume más tokens.

Rendimiento en programación agéntica por nivel de esfuerzo
Programación agéntica: puntuación frente al gasto de tokens por nivel de esfuerzo. Fuente: Z.ai

Merece mención aparte cómo planifica GLM-5.2. En nuestras pruebas de planificación cerraba ella misma las decisiones abiertas y explicaba sus elecciones, en lugar de dejárselas a quien implementa. Ejemplo: no solo cacheó la consulta de una feature flag inexistente, sino que detectó la trampa nada obvia – esa caché habrá que limpiarla si la flag se crea más adelante. El valor de un plan se mide por la cantidad de preguntas resueltas antes de empezar a construir, y en eso GLM-5.2 es fuerte.

Para los managers: GLM-5.2 es ante todo una herramienta para desarrollo y planificación de ingeniería. En tareas de código y en el diseño de soluciones técnicas compite con los buques insignia a un coste mucho menor. Cómo se comporta en tareas de negocio es otra conversación, y está más abajo.

La historia de Pony Alpha: un misterio sin resolver

«Pony» – una referencia al año del Caballo en el calendario chino. El 11 de febrero, Zhipu confirmó oficialmente: Pony Alpha es GLM-5. Las acciones de la empresa subieron un 60% en tres días.

Crecimiento del valor de las acciones desde el lanzamiento

La pregunta sobre qué ocurrió exactamente nunca recibió una respuesta oficial. Zhipu no comentó la confusión de identidad.

No es un caso aislado. En diciembre de 2025, investigadores del MIT documentaron que en aproximadamente el 50% de los casos, los modelos de la serie GLM se identifican como Claude cuando se emplean métodos no convencionales de consulta. DeepSeek V3 tenía una peculiaridad similar – con ciertos prompts se presentaba como ChatGPT o GPT-4. OpenAI respondió acusando directamente a DeepSeek de destilar sus modelos y actualizó sus términos de uso. Anthropic, Mistral y xAI siguieron con cláusulas similares contra la destilación.

La destilación – entrenar un modelo más pequeño con las salidas de uno más grande – es, aparentemente, un secreto a voces de la industria. Confirmar su uso en GLM-5 es imposible: no tenemos una auditoría técnica. Negarlo también: los patrones de comportamiento son demasiado específicos.

Esto lleva a una reflexión: si el modelo «fingía» ser Claude con métodos indirectos de consulta – ¿qué exactamente estaba asimilando durante su entrenamiento? ¿Y cuánto importa esto para un manager que necesita una herramienta funcional?

Qué muestran los tests

En los benchmarks estándar de la industria, GLM-5 compite con los mejores modelos cerrados – y esto, para un modelo abierto y gratuito, no es trivial. Lo que importa para un manager:

Programación – resuelve el 77,8% de las tareas reales de GitHub. Para comparar: Claude Opus 4.5 – 80,9%, GPT-5.2 – 75,4%. La brecha con los líderes es mínima.

Interfaz de GLM similar a Claude

Simulación empresarial (Vending Bench 2 – un test donde el modelo «gestiona un negocio» durante un año) – GLM-5 terminó con un balance de $4 432, Claude Opus 4.5 – $4 967. El modelo toma decisiones estratégicas aproximadamente al nivel de los mejores competidores occidentales.

Búsqueda de información en la web – primer lugar entre todos los modelos evaluados, incluyendo GPT-5.2 y Claude.

Alucinaciones – el mejor resultado de la industria. GLM-5 prefiere decir «no lo sé» antes que inventar una respuesta. Para trabajar con datos y cifras, esto es crítico.

GLM-5 en los tests GPQA Diamond

Como siempre, los tests y el uso real son cosas distintas. Pero la dirección está clara: GLM-5 juega en la misma liga que ChatGPT y Claude.

Los benchmarks resultan convincentes – pero entre «el modelo responde bien a los tests» y «el modelo resuelve mi tarea de forma fiable» hay toda una capa de habilidades: cómo formular la consulta, cómo verificar la respuesta, cómo no caer en una alucinación dicha con total seguridad. Precisamente esa capa determina si obtienes un beneficio real de GLM-5 – o simplemente respuestas que suenan bien.

GLM-5 reduce las alucinaciones, pero sin un enfoque sistemático te las perderás igualmente. 9 tareas prácticas del módulo abierto muestran exactamente dónde.

Sin pago requerido • Notificación al lanzamiento

Unirse a la lista

Resultados en nuestro benchmark

En nuestro benchmark evaluamos los modelos en tareas reales de gestión en 8 categorías – desde planificación y análisis hasta comunicación y trabajo en equipo.

GLM-5 se sitúa en la parte alta de la zona media – un competidor sólido que supera a la mayoría de los modelos occidentales de nivel medio, pero queda por detrás de los líderes como Kimi K2.5 y MiniMax M2.7.

GLM 5.1 в 8 категориях задач

Шкала 0–10. Чем выше — тем лучше модель справилась с задачами

chart

El perfil por las ocho categorías se lee con claridad. GLM-5 es más fuerte en planificación, análisis y gestión de equipos – aquí se acerca mucho a los líderes. Se hunde donde hace falta contexto local: formación y desarrollo, y conocimiento regional (el contexto de la CEI y las prácticas empresariales locales le cuestan más que a YandexGPT y GigaChat). Búsqueda de información y comunicación quedan en un término medio sólido.

Para un manager la conclusión es pragmática: GLM-5 es una herramienta sólida para tareas de planificación y análisis. Si estás descomponiendo un proyecto, evaluando riesgos o analizando datos, el modelo rinde bien. Si necesitas entender la especificidad empresarial rusa o diseñar un programa de formación, el resultado será más débil. Y la gran ventaja de GLM-5, sumada a su calidad, es que es accesible desde Rusia sin VPN.

¿Y GLM-5.2? En nuestro benchmark, la nueva versión va a la par de la primera en tareas de negocio, pero es notablemente más barata – y sigue siendo una de las opciones más económicas en su rango de calidad (el puesto, la puntuación y el precio actuales están en la tarjeta bajo el título de la sección sobre GLM-5.2, más arriba). Para un modelo abierto de unos 750 mil millones de parámetros es un resultado notable – en ese rango de peso, la oferta de modelos abiertos había sido escasa hasta ahora.

Pero surge una paradoja. En los tests de código puro GLM-5.2 lidera, mientras que en tareas de negocio ligadas a código, análisis y marketing (donde hace falta un buen inglés) flaquea. Lo más flojo son las tareas «de pensar»: el modelo se deja detalles del texto de forma sistemática o saca de él conclusiones de más. El formato, eso sí, lo mantiene con limpieza, así que se integra con otros sistemas sin sorpresas – pero conviene vigilar sus conclusiones. El punto fuerte de GLM-5.2 es el razonamiento de ingeniería: código, planes técnicos, descomposición. Le cuesta más el razonamiento «de papel», donde hay que captar un matiz sutil en un texto corriente.

Los resultados detallados de todas las categorías están en la página del benchmark.

Interfaz curiosa de «pensamiento», que sugiere que fue diseñado para desarrolladores ante todo

¿Dudas entre GLM-5, DeepSeek y Claude? El módulo abierto tiene 9 tareas que muestran dónde falla cada modelo. Prueba tu enfoque gratis.

Sin pago requerido • Notificación al lanzamiento

Unirse a la lista

Cómo usar Chat Z.AI (GLM-5) ahora mismo

chat.z.ai – la interfaz web oficial, funciona en Rusia sin VPN. Inicio de sesión mediante cuenta de Google. La interfaz está en inglés y chino; no hay UI en ruso, pero el modelo entiende ruso y responde en él.

Dos modos de trabajo:

Chat Mode – el formato de diálogo habitual. Sirve para la mayoría de tareas: redacción de textos, análisis de documentos, respuestas a preguntas.

Agent Mode – aquí GLM-5 se despliega por completo. El modelo puede usar herramientas: generar archivos en formato .docx, .pdf, .xlsx, realizar búsquedas web, ejecutar tareas de múltiples pasos. Si necesitas preparar un informe con tablas – este es el modo indicado.

Recomendación práctica sobre el idioma: la calidad de las respuestas en inglés es notablemente superior a la del ruso. Si la tarea lo permite, formula los prompts en inglés, especialmente para consultas analíticas complejas. Es la misma situación que con Qwen: los modelos chinos funcionan mejor en los idiomas en los que fueron entrenados más intensamente.

La semana posterior al lanzamiento de GLM-5 fue turbulenta: el tráfico se multiplicó por 10, el servicio funcionó de forma inestable durante varios días, y Zhipu publicó una disculpa oficial. A mediados de marzo la situación se normalizó, pero conviene tenerlo en cuenta: es un servicio joven con una carga en rápido crecimiento.

Ejemplo 2. Pre-mortem antes de lanzar un nuevo producto

La segunda tarea es analítica. Aquí Claude suele ser tradicionalmente el más fuerte, y para GLM-5 es una prueba honesta: ¿es capaz un modelo chino barato de producir un pensamiento estructurado al nivel de un buque insignia? Para GigaChat, es la oportunidad de mostrar cómo maneja el contexto del mercado ruso.

Pruébalo tú mismo
Аналитика: пре-мортем запуска
Eres product manager. Tu equipo prepara el lanzamiento de una app móvil para autónomos en España: registro de ingresos, cálculo automático de impuestos (IRPF, IVA) e integración con bancos. El lanzamiento es en 6 semanas. Realiza un pre-mortem: imagina que 3 meses después del lanzamiento el producto ha fracasado. Indica de 6 a 8 causas más probables del fracaso, agrúpalas por categorías (producto, mercado, operaciones, riesgos legales), y para cada causa señala una alerta temprana que permitiría detectarla antes del lanzamiento, además de una acción concreta para reducir el riesgo.
Comparamos:
glm-5 · GigaChat-2-Max · claude-sonnet-4-6

Fíjate no solo en el contenido, sino también en la estructura de la respuesta: la capacidad del modelo de retener todos los requisitos del prompt (6–8 causas, categorías, señales, acciones) es precisamente lo que distingue una herramienta de trabajo real de una demo vistosa.

Limitaciones y riesgos

La censura china funciona de forma predecible: temas políticamente sensibles, críticas históricas al Estado, ciertos eventos – todo esto queda bloqueado. Para un manager, esto rara vez supone un problema en la práctica, pero conviene saberlo.

La calidad en ruso – una de las principales debilidades. A diferencia de DeepSeek, que funciona notablemente mejor con el contexto ruso, GLM-5 pierde precisión y matices de forma notoria en tareas en ruso. Nuestras pruebas lo confirmaron.

Idioma estonio en el modelo

Velocidad de respuesta en el modo de análisis profundo es notablemente inferior a Claude y GPT – aproximadamente un 30–40% más lenta. No es crítico para tareas puntuales, pero se nota en sesiones de trabajo intensivas.

La cuestión de la destilación sigue abierta. Esto no significa que el modelo sea técnicamente poco fiable – funciona. Pero para organizaciones que usan Claude y reflexionan sobre la ética del uso de IA, este dato merece consideración.

Ejecución en servidores propios – técnicamente posible (el código es abierto), pero requiere equipamiento de servidor con un coste de varios millones de rublos. A diferencia de los modelos compactos de Qwen, GLM-5 no se puede desplegar con los recursos de un departamento de TI estándar.

No hay aplicación móvil – solo web.

Precios

OpciónCostePara quién
chat.z.aiGratis (con límites)Probar sin compromiso
API a través de OpenRouter~$0,15 por análisis de un informe de 100 páginasIntegración en flujos de trabajo

Para comparar: el mismo análisis a través de Claude Opus 4.5 costaría aproximadamente $3, a través de GPT-5.2 – alrededor de $1,50. GLM-5 es 20 veces más barato con capacidades comparables en muchas tareas.

Dicho esto, entre los modelos abiertos chinos, GLM-5 es el más caro. DeepSeek y Qwen cuestan entre 3 y 5 veces menos. ¿Por qué pagar más? Por los sólidos resultados en planificación y análisis – si esas son tus prioridades, la diferencia está justificada.

Un matiz importante: tras el lanzamiento de GLM-5, Zhipu subió los precios del plan Pro aproximadamente un 30%, lo que generó malestar entre los usuarios.

¿Merece la pena probarlo?

GLM-5 es un modelo con fortalezas honestas y debilidades honestas, envuelto en una historia que todavía no tiene una respuesta definitiva.

Los sólidos resultados en planificación y análisis son reales y reproducibles. Si estás descomponiendo un proyecto, evaluando decisiones estratégicas o analizando datos, GLM-5 merece que lo pruebes. Su accesibilidad desde Rusia sin VPN lo convierte en una de las opciones más cómodas entre los modelos de este nivel.

Si necesitas un modelo para trabajar con el contexto ruso, formar a un equipo o abordar tareas con una fuerte especificidad regional, aquí GLM-5 queda por detrás de sus competidores. Para esos fines, DeepSeek o Claude funcionarán mejor.

La historia de Pony Alpha y la identificación como Claude no es motivo para descartar la herramienta, pero sí para mantener distancia analítica. La industria lleva tiempo operando en una zona gris donde la frontera entre «inspiración» y «destilación» se difumina de forma intencionada. Esto no es una excepción de GLM-5 – es el panorama general, que conviene tener presente.

La comodidad de acceso no ofrece dudas: chat.z.ai funciona en Rusia sin VPN, el inicio de sesión es con Google, y existe un nivel gratuito. Vale la pena dedicar una hora a probarlo – y formar tu propia opinión.

Especialización

Empieza a aplicar las herramientas de IA de forma sistemática

Programa completo: desde los fundamentos del prompt engineering hasta especializaciones en gestión de proyectos y análisis. Elige cualquier modelo – GLM-5, Claude, DeepSeek – y pon a prueba tu enfoque en escenarios de gestión reales.

От pre-mortem до антикризисного плана
Переиспользуемые промпт-шаблоны
Сквозной кейс на реальном проекте
~300 часов экономии в год
Stanislav Belyaev

Stanislav Belyaev

Engineering Leader en Microsoft

18 anos liderando equipos de ingenieria. Fundador de mysummit.school. 700+ graduados en Yandex Practicum y Stratoplan.