bencorde.IMPERIO
AGÉNTICO

Claude Code

GLM 5.2 en Claude Code: qué pasó al compararlo con Opus 4.8

Un mismo encargo produjo diferencias de calidad, tiempo y consumo. La investigación larga muestra por qué una tarifa menor no garantiza una tarea más barata.

Por Benjamín Cordero · Publicado:
Video original: · 7 min de lectura
Revisión editorial:

Puedes usar Claude Code como entorno de trabajo con un modelo de otro proveedor. En esta prueba utilicé GLM 5.2 a través de Z.ai y lo comparé con Opus 4.8 en cinco encargos. El resultado más útil fue comprobar que precio por token, rapidez y calidad del trabajo pueden apuntar en direcciones diferentes.

En el video del 20 de junio de 2026 preparé carpetas separadas, repetí los encargos y revisé los resultados en pantalla. Es una comparación práctica de esas ejecuciones, con preferencias explicadas durante la grabación.

Video completo y las cinco pruebas

Ver todas las comparaciones en YouTube. Los ejemplos propios empiezan aproximadamente en el minuto 5; la configuración se explica desde el minuto 24.

Qué cambia al poner GLM dentro de Claude Code

Claude Code organiza archivos, herramientas, instrucciones y turnos de trabajo. El modelo interpreta el encargo y decide las acciones dentro de ese entorno. Esta separación es la base del harness engineering: cambiar el modelo conserva parte del entorno, pero puede cambiar cómo lo utiliza.

GLM 5.2 tiene pesos publicados por Z.ai bajo licencia MIT en su repositorio oficial de Hugging Face. Eso permite estudiar opciones de despliegue propio. La demostración, sin embargo, utiliza una API: la inferencia ocurre en servidores del proveedor.

Que el terminal esté en tu computador no convierte esa llamada en procesamiento local. El tamaño del modelo, la memoria y el hardware necesarios también importan antes de intentar ejecutarlo por cuenta propia.

En la grabación ajusté el esfuerzo y mantuve los prompts iguales. Eso ayuda a comparar, pero los controles no aseguran que dos modelos utilicen exactamente los mismos tokens de razonamiento, estrategias o submodelos. Una prueba más formal también registraría versiones del entorno, herramientas, configuración y repeticiones.

Los resultados: cuatro construcciones y una investigación

Encargo Lo que observé en el video Qué conviene comprobar
Landing de Imperio Agéntico Preferí ligeramente Opus por el resultado y la procedencia de testimonios Veracidad del contenido, enlaces y diseño
Juego HTML Preferí la jugabilidad de GLM Controles, colisiones, sonido y reinicio
Calculadora de consumo Ambos funcionaron; preferí el acabado de Opus Fórmulas, distribución y adaptación de pantalla
Explicador interactivo Preferí algunos detalles visuales de Opus Interacción, legibilidad y utilidad del movimiento
Investigación extensa El consumo reportado de GLM fue mayor Fuentes, cobertura, coste completo y calidad de conclusiones

Landing: un detalle de contenido pesa más que una animación

Los dos modelos recibieron el encargo de investigar Imperio Agéntico y construir una página. Encontré resultados utilizables en ambos. Opus incorporó referencias que reconocí como testimonios reales; en la versión de GLM detecté testimonios inventados.

Esa diferencia cambia la evaluación. Una página que se ve bien todavía puede necesitar una revisión importante antes de publicarse. No basta con que el botón abra Skool: precios, cifras, testimonios y promesas deben corresponder a fuentes verificadas.

Para repetir la prueba, entrega primero una ficha con los hechos que sí se pueden publicar. Después revisa qué añadió el modelo por iniciativa propia. Puedes pedir creatividad visual sin permitir que invente evidencia comercial.

Juego: el resultado se evalúa jugando

Comparación de los juegos HTML generados con GLM 5.2 y Opus 4.8
Los dos juegos se abren y prueban en pantalla. Mi preferencia se basa en esa experiencia de uso.

El encargo fue un juego de avanzar y esquivar obstáculos, construido en un archivo HTML. En esta prueba me resultó más agradable jugar la versión de GLM. Durante la revisión también comprobé el sonido: inicialmente estaba silenciado y lo activé.

Es un buen ejemplo de por qué una captura no alcanza para evaluar software. Hay que pulsar controles, perder, reiniciar y comprobar que la lógica acompaña a los gráficos. El resultado que más te gusta visualmente puede ser menos cómodo al usarlo.

Calculadora y presentación: revisar el acabado

Dos calculadoras interactivas de consumo creadas durante la comparación
Los importes de estas calculadoras son simulaciones de las tarifas introducidas durante la grabación.

En la calculadora probé barras para cambiar el volumen de tokens y la mezcla de modelos. Ambas versiones respondieron a la interacción. Mi preferencia por Opus fue leve y estuvo relacionada con el acabado de la interfaz.

Una calculadora de consumo necesita distinguir entrada, salida y caché. Si introduces tarifas antiguas o sumas categorías de forma incorrecta, puede producir un número convincente que no represente tu factura. Para usarla de verdad, fecha las tarifas y contrasta una consulta con el registro del proveedor.

El explicador de niveles de uso de IA también produjo dos resultados interesantes. Preferí ciertos detalles de movimiento en Opus. Para un recurso interno, el resultado de GLM podía ser suficiente; para una pieza pública, quizá querría invertir otra ronda de revisión.

Investigación: el caso que cambia la lectura del precio

En la investigación larga mostré aproximadamente 26 dólares de consumo para GLM frente a 7 para Opus. Son los valores reportados en esa ejecución, no una auditoría independiente de facturas.

Este caso demuestra por qué una tarifa menor por millón de tokens no garantiza un encargo más barato. La cantidad de pasos, las búsquedas, los reintentos y la coordinación de agentes pueden compensar o superar la diferencia de tarifa.

Durante el video envié ambos informes a otro modelo para compararlos. La grabación no muestra un veredicto final suficiente para declarar un ganador de calidad en esa investigación. Sí permite observar el consumo y discutir cómo diseñar una evaluación más completa.

Cómo configurar un proyecto con Z.ai

La guía oficial de Z.ai para Claude Code mantiene el procedimiento actual. Utiliza una credencial de Z.ai y un endpoint compatible con el protocolo de Anthropic, https://api.z.ai/api/anthropic.

En el video trabajo con configuraciones por carpeta para conservar proyectos distintos. Antes de cambiar nada, identifica si editas una configuración global o local. Conserva las opciones existentes y guarda la credencial fuera de archivos que vayas a publicar o compartir.

El proceso práctico es:

  1. Crear la credencial en la cuenta del proveedor y confirmar qué modalidad de consumo tienes.
  2. Configurar el endpoint y los modelos admitidos en ese proyecto.
  3. Abrir una sesión nueva para que tome los cambios.
  4. Hacer una tarea pequeña y comprobar el modelo efectivo y su consumo.
  5. Repetir la comprobación en otro proyecto para confirmar que no cambiaste todo el entorno.

La documentación ya incluye modelos posteriores a GLM 5.2. Si quieres reproducir esta comparación, verifica su disponibilidad y selecciona esa versión explícitamente. No copies un mapeo actual suponiendo que seguirá utilizando el modelo del video.

Cómo decidir qué modelo usar

Elige un encargo habitual y define cuándo está terminado antes de comparar. Usa el mismo material, registra el tiempo, revisa el resultado y cuenta el coste de todas las correcciones. Si una respuesta barata necesita varias vueltas adicionales, inclúyelas.

Para una landing, la prueba incluye hechos y enlaces. Para una investigación, incluye fuentes y cobertura. Para un juego, incluye la experiencia al jugar. La unidad que interesa es el resultado aceptado, no solamente la primera respuesta.

El Motor Agéntico puede ayudar a visualizar actividad, siempre separando consumo estimado, tarifas API y pagos reales. Para tareas recurrentes, la guía de loops con /goal y /loop explica cómo definir un final y conservar el avance.

Revisa las cinco pruebas completas en YouTube y compara los detalles que para ti hacen que un resultado sea utilizable. Los recursos de implementación de la comunidad están en Imperio Agéntico en Skool.

Preguntas frecuentes

¿Puedo usar GLM 5.2 dentro de Claude Code?

El video muestra GLM 5.2 conectado a Claude Code mediante Z.ai. Necesitas una credencial y configuración compatibles con el proveedor. Comprueba el modelo efectivo al abrir una sesión, porque los valores predeterminados pueden cambiar.

¿GLM se ejecuta localmente en esta demostración?

No. Claude Code corre en el computador, pero las llamadas de GLM se procesan mediante una API de Z.ai. Ejecutar los pesos por cuenta propia requiere una infraestructura diferente.

¿GLM fue más barato en todas las pruebas?

No. En varias construcciones el consumo reportado fue menor, pero en la investigación extensa se mostraron aproximadamente 26 dólares para GLM y 7 para Opus. Una tarifa menor por token no garantiza una tarea más barata.

¿Qué modelo ganó la comparación?

No hubo un ganador universal. Preferí GLM para el juego y ligeramente Opus en la landing, calculadora y presentación. La grabación no muestra un veredicto final de calidad para los dos informes de investigación.

¿Por qué importaron los testimonios de la landing?

Detecté testimonios inventados en la versión de GLM. El contenido comercial debe verificarse antes de publicarlo, aunque el diseño y los botones funcionen correctamente.

¿Cómo comparo modelos en mi propio proyecto?

Repite un encargo real con los mismos materiales, define criterios de aceptación y registra tiempo, consumo y correcciones. Evalúa el coste del resultado terminado y repite la prueba para reducir el peso de una ejecución aislada.