Chat Z.AI (GLM-5) en 2026: el modelo chino que finge ser Claude

AI-модели в этой статье
El 6 de febrero de 2026, en la plataforma OpenRouter apareció un modelo anónimo llamado «Pony Alpha» – gratuito, sin ningún detalle sobre sus creadores. La comunidad de IA comenzó a identificarlo de inmediato. Sus capacidades de programación se acercaban a las de Claude Opus 4.5. Al preguntarle «¿quién eres?», el modelo respondía: «Soy GLM». Pero cuando le pidieron crear una página web describiéndose a sí mismo, escribió: «I am Claude, created by Anthropic».
Esto era reproducible al cien por ciento. Y precisamente este momento define todo lo que necesitas saber sobre GLM-5 antes de pasar a los benchmarks y las tarifas.
Pruébalo tú mismo: GLM-5 vs GigaChat vs Claude
Antes de entrar en la historia, los benchmarks y los precios – lanza un prompt aquí mismo y compara tres modelos en la misma tarea: GLM-5 (Z.ai), GigaChat-2-Max (Sber) y Claude Sonnet 4.6 (Anthropic). Son tres enfoques radicalmente distintos: el retador chino barato, el modelo doméstico ruso fuerte en contexto local y el buque insignia occidental premium.
Ejemplo 1. Una carta delicada a un proveedor
Esta tarea evalúa a la vez el idioma, la sensibilidad al tono y la etiqueta empresarial. GigaChat suele destacar en el registro formal y el estilo local, Claude en el equilibrio entre empatía y claridad, y GLM-5 resulta interesante como indicador de hasta qué punto un modelo chino «da la talla» en una carta de negocios fuera de su idioma nativo. Más abajo en el artículo hay un segundo prompt sobre una tarea analítica, donde los puntos fuertes de cada modelo se reparten de otra manera.
Qué es GLM-5 y quién está detrás
Zhipu AI – un spin-off de la Universidad de Tsinghua, fundado en 2019, que en 2025 cambió su nombre a Z.ai y salió a la Bolsa de Hong Kong en enero de 2026. La salida a bolsa fue impresionante: en los tres días posteriores al anuncio oficial de GLM-5, las acciones subieron un 60%.

GLM-5 se lanzó el 11 de febrero de 2026 y aspira directamente al título del modelo abierto más potente del mundo. Para un manager, hay tres cosas importantes:
- El modelo es gratuito y abierto – el código está disponible bajo licencia MIT, cualquier empresa puede descargarlo y ejecutarlo en sus propios servidores
- Con una sola consulta «lee» hasta ~400 páginas de texto – ideal para trabajar con documentos extensos, informes, contratos
- Fue entrenado completamente con chips chinos de Huawei – sin un solo componente de NVIDIA
Este último punto no es un simple detalle técnico. En el contexto de las restricciones de exportación estadounidenses, es una declaración política: China puede crear modelos de IA competitivos sin acceso a chips occidentales. Para el negocio, esto significa que el proveedor no depende de sanciones occidentales – a diferencia de OpenAI o Anthropic.
GLM-5.2: nueva generación (13 de junio de 2026)
Mientras se preparaba este análisis de GLM-5, Z.ai lanzó la siguiente versión. GLM-5.2 salió el 13 de junio de 2026 y está orientada a la programación.
- Contexto de 1 millón de tokens (frente a 200K de la versión anterior) – el modelo mantiene en memoria un repositorio entero sin perder el hilo.
- Arquitectura MoE de 744 mil millones de parámetros, de los que solo 40 mil millones están activos por token – de ahí la combinación de potencia y precio contenido.
- Pesos abiertos bajo licencia MIT y dos niveles de razonamiento – High y Max (Max está pensado para tareas complejas de varios pasos).
- Se distribuye a través de los planes GLM Coding Plan (desde ~$18/mes), una API independiente y el chat web.
Fiel a toda la historia de GLM, en el lanzamiento Z.ai no publicó ni un solo benchmark. En un sector donde los modelos suelen llegar con su tabla de victorias lista, resulta inusual. Los tests independientes aparecieron unos días después, y en código son sólidos: en SWE-bench Pro GLM-5.2 obtuvo un 62,1% frente al 58,6% de GPT-5.5, quedó 2.ª entre los modelos de programación en el ranking ciego Code Arena y se acercó a Claude Opus 4.8 en Terminal-Bench – a un coste unas 6 veces menor que GPT-5.5.
Esa fuerza tiene un precio en tokens. En el propio gráfico de Z.ai sobre programación agéntica, en el nivel máximo de razonamiento GLM-5.2 casi alcanza a Opus 4.8, pero gasta alrededor del doble de tokens de salida y en el punto más alto se queda algo por detrás. Más barata por token – pero consume más tokens.

Merece mención aparte cómo planifica GLM-5.2. En nuestras pruebas de planificación cerraba ella misma las decisiones abiertas y explicaba sus elecciones, en lugar de dejárselas a quien implementa. Ejemplo: no solo cacheó la consulta de una feature flag inexistente, sino que detectó la trampa nada obvia – esa caché habrá que limpiarla si la flag se crea más adelante. El valor de un plan se mide por la cantidad de preguntas resueltas antes de empezar a construir, y en eso GLM-5.2 es fuerte.
Para los managers: GLM-5.2 es ante todo una herramienta para desarrollo y planificación de ingeniería. En tareas de código y en el diseño de soluciones técnicas compite con los buques insignia a un coste mucho menor. Cómo se comporta en tareas de negocio es otra conversación, y está más abajo.
La historia de Pony Alpha: un misterio sin resolver
«Pony» – una referencia al año del Caballo en el calendario chino. El 11 de febrero, Zhipu confirmó oficialmente: Pony Alpha es GLM-5. Las acciones de la empresa subieron un 60% en tres días.

La pregunta sobre qué ocurrió exactamente nunca recibió una respuesta oficial. Zhipu no comentó la confusión de identidad.
No es un caso aislado. En diciembre de 2025, investigadores del MIT documentaron que en aproximadamente el 50% de los casos, los modelos de la serie GLM se identifican como Claude cuando se emplean métodos no convencionales de consulta. DeepSeek V3 tenía una peculiaridad similar – con ciertos prompts se presentaba como ChatGPT o GPT-4. OpenAI respondió acusando directamente a DeepSeek de destilar sus modelos y actualizó sus términos de uso. Anthropic, Mistral y xAI siguieron con cláusulas similares contra la destilación.
La destilación – entrenar un modelo más pequeño con las salidas de uno más grande – es, aparentemente, un secreto a voces de la industria. Confirmar su uso en GLM-5 es imposible: no tenemos una auditoría técnica. Negarlo también: los patrones de comportamiento son demasiado específicos.
Esto lleva a una reflexión: si el modelo «fingía» ser Claude con métodos indirectos de consulta – ¿qué exactamente estaba asimilando durante su entrenamiento? ¿Y cuánto importa esto para un manager que necesita una herramienta funcional?
Qué muestran los tests
En los benchmarks estándar de la industria, GLM-5 compite con los mejores modelos cerrados – y esto, para un modelo abierto y gratuito, no es trivial. Lo que importa para un manager:
Programación – resuelve el 77,8% de las tareas reales de GitHub. Para comparar: Claude Opus 4.5 – 80,9%, GPT-5.2 – 75,4%. La brecha con los líderes es mínima.

Simulación empresarial (Vending Bench 2 – un test donde el modelo «gestiona un negocio» durante un año) – GLM-5 terminó con un balance de $4 432, Claude Opus 4.5 – $4 967. El modelo toma decisiones estratégicas aproximadamente al nivel de los mejores competidores occidentales.
Búsqueda de información en la web – primer lugar entre todos los modelos evaluados, incluyendo GPT-5.2 y Claude.
Alucinaciones – el mejor resultado de la industria. GLM-5 prefiere decir «no lo sé» antes que inventar una respuesta. Para trabajar con datos y cifras, esto es crítico.

Como siempre, los tests y el uso real son cosas distintas. Pero la dirección está clara: GLM-5 juega en la misma liga que ChatGPT y Claude.
Los benchmarks resultan convincentes – pero entre «el modelo responde bien a los tests» y «el modelo resuelve mi tarea de forma fiable» hay toda una capa de habilidades: cómo formular la consulta, cómo verificar la respuesta, cómo no caer en una alucinación dicha con total seguridad. Precisamente esa capa determina si obtienes un beneficio real de GLM-5 – o simplemente respuestas que suenan bien.
GLM-5 reduce las alucinaciones, pero sin un enfoque sistemático te las perderás igualmente. 9 tareas prácticas del módulo abierto muestran exactamente dónde.
Sin pago requerido • Notificación al lanzamiento
Resultados en nuestro benchmark
En nuestro benchmark evaluamos los modelos en tareas reales de gestión en 8 categorías – desde planificación y análisis hasta comunicación y trabajo en equipo.
GLM-5 se sitúa en la parte alta de la zona media – un competidor sólido que supera a la mayoría de los modelos occidentales de nivel medio, pero queda por detrás de los líderes como Kimi K2.5 y MiniMax M2.7.
El perfil por las ocho categorías se lee con claridad. GLM-5 es más fuerte en planificación, análisis y gestión de equipos – aquí se acerca mucho a los líderes. Se hunde donde hace falta contexto local: formación y desarrollo, y conocimiento regional (el contexto de la CEI y las prácticas empresariales locales le cuestan más que a YandexGPT y GigaChat). Búsqueda de información y comunicación quedan en un término medio sólido.
Para un manager la conclusión es pragmática: GLM-5 es una herramienta sólida para tareas de planificación y análisis. Si estás descomponiendo un proyecto, evaluando riesgos o analizando datos, el modelo rinde bien. Si necesitas entender la especificidad empresarial rusa o diseñar un programa de formación, el resultado será más débil. Y la gran ventaja de GLM-5, sumada a su calidad, es que es accesible desde Rusia sin VPN.
¿Y GLM-5.2? En nuestro benchmark, la nueva versión va a la par de la primera en tareas de negocio, pero es notablemente más barata – y sigue siendo una de las opciones más económicas en su rango de calidad (el puesto, la puntuación y el precio actuales están en la tarjeta bajo el título de la sección sobre GLM-5.2, más arriba). Para un modelo abierto de unos 750 mil millones de parámetros es un resultado notable – en ese rango de peso, la oferta de modelos abiertos había sido escasa hasta ahora.
Pero surge una paradoja. En los tests de código puro GLM-5.2 lidera, mientras que en tareas de negocio ligadas a código, análisis y marketing (donde hace falta un buen inglés) flaquea. Lo más flojo son las tareas «de pensar»: el modelo se deja detalles del texto de forma sistemática o saca de él conclusiones de más. El formato, eso sí, lo mantiene con limpieza, así que se integra con otros sistemas sin sorpresas – pero conviene vigilar sus conclusiones. El punto fuerte de GLM-5.2 es el razonamiento de ingeniería: código, planes técnicos, descomposición. Le cuesta más el razonamiento «de papel», donde hay que captar un matiz sutil en un texto corriente.
Los resultados detallados de todas las categorías están en la página del benchmark.

¿Dudas entre GLM-5, DeepSeek y Claude? El módulo abierto tiene 9 tareas que muestran dónde falla cada modelo. Prueba tu enfoque gratis.
Sin pago requerido • Notificación al lanzamiento
Cómo usar Chat Z.AI (GLM-5) ahora mismo
chat.z.ai – la interfaz web oficial, funciona en Rusia sin VPN. Inicio de sesión mediante cuenta de Google. La interfaz está en inglés y chino; no hay UI en ruso, pero el modelo entiende ruso y responde en él.
Dos modos de trabajo:
Chat Mode – el formato de diálogo habitual. Sirve para la mayoría de tareas: redacción de textos, análisis de documentos, respuestas a preguntas.
Agent Mode – aquí GLM-5 se despliega por completo. El modelo puede usar herramientas: generar archivos en formato .docx, .pdf, .xlsx, realizar búsquedas web, ejecutar tareas de múltiples pasos. Si necesitas preparar un informe con tablas – este es el modo indicado.
Recomendación práctica sobre el idioma: la calidad de las respuestas en inglés es notablemente superior a la del ruso. Si la tarea lo permite, formula los prompts en inglés, especialmente para consultas analíticas complejas. Es la misma situación que con Qwen: los modelos chinos funcionan mejor en los idiomas en los que fueron entrenados más intensamente.
La semana posterior al lanzamiento de GLM-5 fue turbulenta: el tráfico se multiplicó por 10, el servicio funcionó de forma inestable durante varios días, y Zhipu publicó una disculpa oficial. A mediados de marzo la situación se normalizó, pero conviene tenerlo en cuenta: es un servicio joven con una carga en rápido crecimiento.
Ejemplo 2. Pre-mortem antes de lanzar un nuevo producto
La segunda tarea es analítica. Aquí Claude suele ser tradicionalmente el más fuerte, y para GLM-5 es una prueba honesta: ¿es capaz un modelo chino barato de producir un pensamiento estructurado al nivel de un buque insignia? Para GigaChat, es la oportunidad de mostrar cómo maneja el contexto del mercado ruso.
Fíjate no solo en el contenido, sino también en la estructura de la respuesta: la capacidad del modelo de retener todos los requisitos del prompt (6–8 causas, categorías, señales, acciones) es precisamente lo que distingue una herramienta de trabajo real de una demo vistosa.
Limitaciones y riesgos
La censura china funciona de forma predecible: temas políticamente sensibles, críticas históricas al Estado, ciertos eventos – todo esto queda bloqueado. Para un manager, esto rara vez supone un problema en la práctica, pero conviene saberlo.
La calidad en ruso – una de las principales debilidades. A diferencia de DeepSeek, que funciona notablemente mejor con el contexto ruso, GLM-5 pierde precisión y matices de forma notoria en tareas en ruso. Nuestras pruebas lo confirmaron.

Velocidad de respuesta en el modo de análisis profundo es notablemente inferior a Claude y GPT – aproximadamente un 30–40% más lenta. No es crítico para tareas puntuales, pero se nota en sesiones de trabajo intensivas.
La cuestión de la destilación sigue abierta. Esto no significa que el modelo sea técnicamente poco fiable – funciona. Pero para organizaciones que usan Claude y reflexionan sobre la ética del uso de IA, este dato merece consideración.
Ejecución en servidores propios – técnicamente posible (el código es abierto), pero requiere equipamiento de servidor con un coste de varios millones de rublos. A diferencia de los modelos compactos de Qwen, GLM-5 no se puede desplegar con los recursos de un departamento de TI estándar.
No hay aplicación móvil – solo web.
Precios
| Opción | Coste | Para quién |
|---|---|---|
| chat.z.ai | Gratis (con límites) | Probar sin compromiso |
| API a través de OpenRouter | ~$0,15 por análisis de un informe de 100 páginas | Integración en flujos de trabajo |
Para comparar: el mismo análisis a través de Claude Opus 4.5 costaría aproximadamente $3, a través de GPT-5.2 – alrededor de $1,50. GLM-5 es 20 veces más barato con capacidades comparables en muchas tareas.
Dicho esto, entre los modelos abiertos chinos, GLM-5 es el más caro. DeepSeek y Qwen cuestan entre 3 y 5 veces menos. ¿Por qué pagar más? Por los sólidos resultados en planificación y análisis – si esas son tus prioridades, la diferencia está justificada.
Un matiz importante: tras el lanzamiento de GLM-5, Zhipu subió los precios del plan Pro aproximadamente un 30%, lo que generó malestar entre los usuarios.
¿Merece la pena probarlo?
GLM-5 es un modelo con fortalezas honestas y debilidades honestas, envuelto en una historia que todavía no tiene una respuesta definitiva.
Los sólidos resultados en planificación y análisis son reales y reproducibles. Si estás descomponiendo un proyecto, evaluando decisiones estratégicas o analizando datos, GLM-5 merece que lo pruebes. Su accesibilidad desde Rusia sin VPN lo convierte en una de las opciones más cómodas entre los modelos de este nivel.
Si necesitas un modelo para trabajar con el contexto ruso, formar a un equipo o abordar tareas con una fuerte especificidad regional, aquí GLM-5 queda por detrás de sus competidores. Para esos fines, DeepSeek o Claude funcionarán mejor.
La historia de Pony Alpha y la identificación como Claude no es motivo para descartar la herramienta, pero sí para mantener distancia analítica. La industria lleva tiempo operando en una zona gris donde la frontera entre «inspiración» y «destilación» se difumina de forma intencionada. Esto no es una excepción de GLM-5 – es el panorama general, que conviene tener presente.
La comodidad de acceso no ofrece dudas: chat.z.ai funciona en Rusia sin VPN, el inicio de sesión es con Google, y existe un nivel gratuito. Vale la pena dedicar una hora a probarlo – y formar tu propia opinión.
Empieza a aplicar las herramientas de IA de forma sistemática
Programa completo: desde los fundamentos del prompt engineering hasta especializaciones en gestión de proyectos y análisis. Elige cualquier modelo – GLM-5, Claude, DeepSeek – y pon a prueba tu enfoque en escenarios de gestión reales.

Stanislav Belyaev
Engineering Leader en Microsoft18 anos liderando equipos de ingenieria. Fundador de mysummit.school. 700+ graduados en Yandex Practicum y Stratoplan.







