Puedes usar Claude Code como entorno de trabajo con un modelo de otro proveedor. En esta prueba utilicé GLM 5.2 a través de Z.ai y lo comparé con Opus 4.8 en cinco encargos. El resultado más útil fue comprobar que precio por token, rapidez y calidad del trabajo pueden apuntar en direcciones diferentes.
En el video del 20 de junio de 2026 preparé carpetas separadas, repetí los encargos y revisé los resultados en pantalla. Es una comparación práctica de esas ejecuciones, con preferencias explicadas durante la grabación.
Video completo y las cinco pruebas
Ver todas las comparaciones en YouTube. Los ejemplos propios empiezan aproximadamente en el minuto 5; la configuración se explica desde el minuto 24.
Qué cambia al poner GLM dentro de Claude Code
Claude Code organiza archivos, herramientas, instrucciones y turnos de trabajo. El modelo interpreta el encargo y decide las acciones dentro de ese entorno. Esta separación es la base del harness engineering: cambiar el modelo conserva parte del entorno, pero puede cambiar cómo lo utiliza.
GLM 5.2 tiene pesos publicados por Z.ai bajo licencia MIT en su repositorio oficial de Hugging Face. Eso permite estudiar opciones de despliegue propio. La demostración, sin embargo, utiliza una API: la inferencia ocurre en servidores del proveedor.
Que el terminal esté en tu computador no convierte esa llamada en procesamiento local. El tamaño del modelo, la memoria y el hardware necesarios también importan antes de intentar ejecutarlo por cuenta propia.
En la grabación ajusté el esfuerzo y mantuve los prompts iguales. Eso ayuda a comparar, pero los controles no aseguran que dos modelos utilicen exactamente los mismos tokens de razonamiento, estrategias o submodelos. Una prueba más formal también registraría versiones del entorno, herramientas, configuración y repeticiones.
Los resultados: cuatro construcciones y una investigación
| Encargo | Lo que observé en el video | Qué conviene comprobar |
|---|---|---|
| Landing de Imperio Agéntico | Preferí ligeramente Opus por el resultado y la procedencia de testimonios | Veracidad del contenido, enlaces y diseño |
| Juego HTML | Preferí la jugabilidad de GLM | Controles, colisiones, sonido y reinicio |
| Calculadora de consumo | Ambos funcionaron; preferí el acabado de Opus | Fórmulas, distribución y adaptación de pantalla |
| Explicador interactivo | Preferí algunos detalles visuales de Opus | Interacción, legibilidad y utilidad del movimiento |
| Investigación extensa | El consumo reportado de GLM fue mayor | Fuentes, cobertura, coste completo y calidad de conclusiones |
Landing: un detalle de contenido pesa más que una animación
Los dos modelos recibieron el encargo de investigar Imperio Agéntico y construir una página. Encontré resultados utilizables en ambos. Opus incorporó referencias que reconocí como testimonios reales; en la versión de GLM detecté testimonios inventados.
Esa diferencia cambia la evaluación. Una página que se ve bien todavía puede necesitar una revisión importante antes de publicarse. No basta con que el botón abra Skool: precios, cifras, testimonios y promesas deben corresponder a fuentes verificadas.
Para repetir la prueba, entrega primero una ficha con los hechos que sí se pueden publicar. Después revisa qué añadió el modelo por iniciativa propia. Puedes pedir creatividad visual sin permitir que invente evidencia comercial.
Juego: el resultado se evalúa jugando

El encargo fue un juego de avanzar y esquivar obstáculos, construido en un archivo HTML. En esta prueba me resultó más agradable jugar la versión de GLM. Durante la revisión también comprobé el sonido: inicialmente estaba silenciado y lo activé.
Es un buen ejemplo de por qué una captura no alcanza para evaluar software. Hay que pulsar controles, perder, reiniciar y comprobar que la lógica acompaña a los gráficos. El resultado que más te gusta visualmente puede ser menos cómodo al usarlo.
Calculadora y presentación: revisar el acabado

En la calculadora probé barras para cambiar el volumen de tokens y la mezcla de modelos. Ambas versiones respondieron a la interacción. Mi preferencia por Opus fue leve y estuvo relacionada con el acabado de la interfaz.
Una calculadora de consumo necesita distinguir entrada, salida y caché. Si introduces tarifas antiguas o sumas categorías de forma incorrecta, puede producir un número convincente que no represente tu factura. Para usarla de verdad, fecha las tarifas y contrasta una consulta con el registro del proveedor.
El explicador de niveles de uso de IA también produjo dos resultados interesantes. Preferí ciertos detalles de movimiento en Opus. Para un recurso interno, el resultado de GLM podía ser suficiente; para una pieza pública, quizá querría invertir otra ronda de revisión.
Investigación: el caso que cambia la lectura del precio
En la investigación larga mostré aproximadamente 26 dólares de consumo para GLM frente a 7 para Opus. Son los valores reportados en esa ejecución, no una auditoría independiente de facturas.
Este caso demuestra por qué una tarifa menor por millón de tokens no garantiza un encargo más barato. La cantidad de pasos, las búsquedas, los reintentos y la coordinación de agentes pueden compensar o superar la diferencia de tarifa.
Durante el video envié ambos informes a otro modelo para compararlos. La grabación no muestra un veredicto final suficiente para declarar un ganador de calidad en esa investigación. Sí permite observar el consumo y discutir cómo diseñar una evaluación más completa.
Cómo configurar un proyecto con Z.ai
La guía oficial de Z.ai para Claude Code mantiene el procedimiento actual. Utiliza una credencial de Z.ai y un endpoint compatible con el protocolo de Anthropic, https://api.z.ai/api/anthropic.
En el video trabajo con configuraciones por carpeta para conservar proyectos distintos. Antes de cambiar nada, identifica si editas una configuración global o local. Conserva las opciones existentes y guarda la credencial fuera de archivos que vayas a publicar o compartir.
El proceso práctico es:
- Crear la credencial en la cuenta del proveedor y confirmar qué modalidad de consumo tienes.
- Configurar el endpoint y los modelos admitidos en ese proyecto.
- Abrir una sesión nueva para que tome los cambios.
- Hacer una tarea pequeña y comprobar el modelo efectivo y su consumo.
- Repetir la comprobación en otro proyecto para confirmar que no cambiaste todo el entorno.
La documentación ya incluye modelos posteriores a GLM 5.2. Si quieres reproducir esta comparación, verifica su disponibilidad y selecciona esa versión explícitamente. No copies un mapeo actual suponiendo que seguirá utilizando el modelo del video.
Cómo decidir qué modelo usar
Elige un encargo habitual y define cuándo está terminado antes de comparar. Usa el mismo material, registra el tiempo, revisa el resultado y cuenta el coste de todas las correcciones. Si una respuesta barata necesita varias vueltas adicionales, inclúyelas.
Para una landing, la prueba incluye hechos y enlaces. Para una investigación, incluye fuentes y cobertura. Para un juego, incluye la experiencia al jugar. La unidad que interesa es el resultado aceptado, no solamente la primera respuesta.
El Motor Agéntico puede ayudar a visualizar actividad, siempre separando consumo estimado, tarifas API y pagos reales. Para tareas recurrentes, la guía de loops con /goal y /loop explica cómo definir un final y conservar el avance.
Revisa las cinco pruebas completas en YouTube y compara los detalles que para ti hacen que un resultado sea utilizable. Los recursos de implementación de la comunidad están en Imperio Agéntico en Skool.
Preguntas frecuentes
¿Puedo usar GLM 5.2 dentro de Claude Code?
El video muestra GLM 5.2 conectado a Claude Code mediante Z.ai. Necesitas una credencial y configuración compatibles con el proveedor. Comprueba el modelo efectivo al abrir una sesión, porque los valores predeterminados pueden cambiar.
¿GLM se ejecuta localmente en esta demostración?
No. Claude Code corre en el computador, pero las llamadas de GLM se procesan mediante una API de Z.ai. Ejecutar los pesos por cuenta propia requiere una infraestructura diferente.
¿GLM fue más barato en todas las pruebas?
No. En varias construcciones el consumo reportado fue menor, pero en la investigación extensa se mostraron aproximadamente 26 dólares para GLM y 7 para Opus. Una tarifa menor por token no garantiza una tarea más barata.
¿Qué modelo ganó la comparación?
No hubo un ganador universal. Preferí GLM para el juego y ligeramente Opus en la landing, calculadora y presentación. La grabación no muestra un veredicto final de calidad para los dos informes de investigación.
¿Por qué importaron los testimonios de la landing?
Detecté testimonios inventados en la versión de GLM. El contenido comercial debe verificarse antes de publicarlo, aunque el diseño y los botones funcionen correctamente.
¿Cómo comparo modelos en mi propio proyecto?
Repite un encargo real con los mismos materiales, define criterios de aceptación y registra tiempo, consumo y correcciones. Evalúa el coste del resultado terminado y repite la prueba para reducir el peso de una ejecución aislada.
