
Le di los mismos 12 trabajos a Claude Opus 5.5 y a GPT-6 Astra. Quería ver qué pasaba cuando los ponía a hacer cosas de mi semana: crear una landing, escribir una carta de ventas, revisar suscripciones o investigar miniaturas.
También hubo espacio para llevarlos al límite. Max propuso un Pac-Man en 3D con mi cara. Yo estaba en Torres del Paine y quería una forma de entender cómo se vería el macizo con distintos niveles de nubosidad. Y terminamos con una isla de dinosaurios, un segundo cerebro en 3D y una animación hecha con código.
Mi marcador final fue 9 para Opus, 2 para Astra y una prueba abierta a la audiencia. Pero al sumar tiempos y estimar costos, Astra tenía una ventaja importante. Elegir con cuál trabajar requiere mirar las dos cosas.
Cómo hice la comparación
Usé el mismo prompt inicial, palabra por palabra, y el nivel máximo de razonamiento en ambos. Opus 5.5 trabajó en Claude Code; Astra, en Codex. A los dos les conecté Higgsfield para generar los recursos visuales de los casos que lo requerían.
La intención inicial era resolver cada trabajo en un intento y sin preguntas. Hay una excepción que conviene dejar clara: en la auditoría de suscripciones tuve que pedir reintentos a ambos. También advertí durante la carta de ventas que el contexto previo de Claude podía haber influido en el resultado.
Por eso leo esta comparación como una prueba de mis flujos reales, con sus herramientas y condiciones. Los puntos reflejan mi valoración de los resultados mostrados. No prueban que un modelo gane cualquier tarea ni aíslan por completo el efecto del modelo, el contexto y la aplicación donde corre.
La idea de hacer una batería de trabajos está inspirada en Nate Herk. La adapté a mis propios proyectos y al trabajo en español.
Los 12 trabajos y mi resultado
| Trabajo | Mi elección | Qué hizo la diferencia |
|---|---|---|
| Isla prehistórica en 3D | Opus 5.5 | Volví a probarla y cambié mi voto por la experiencia de juego. |
| Landing 3D de audífonos | Opus 5.5 | Modelado, composición y recorrido visual de la página. |
| Carta de ventas en español | Opus 5.5 | Uso del contexto y desarrollo del copy, con la salvedad del contexto previo. |
| Pac-Man 3D con mi cara | Opus 5.5 | Incorporó mejor mi cara al personaje y resolvió mejor el conjunto visual. |
| Informe nivel consultora | GPT-6 Astra | Preferí su presentación y branding; no validé toda la investigación. |
| Visor de las Torres del Paine | Opus 5.5 | Las imágenes hicieron más fácil entender la nubosidad. |
| Auditoría de suscripciones | Opus 5.5 | Consiguió completar el trabajo; Astra dejó importes sin calcular. |
| Análisis y recreación de un tráiler | GPT-6 Astra | Preferí el resultado audiovisual; Opus incorporó más imágenes estáticas. |
| Visualización del segundo cerebro | Opus 5.5 | Organizó el grafo con forma de cerebro y una presentación que me gustó más. |
| Contador de días sin un modelo nuevo | Opus 5.5 | Resolvió mejor los datos mostrados y la reacción ante un lanzamiento. |
| Animación dibujada en JavaScript | Opus 5.5 | Preferí la animación y la música de su resultado. |
| Miniaturas con computer use | Abierta a la audiencia | Ambas propuestas me gustaron; falta comprobar cómo rinden. |
Dónde Opus me sorprendió más
Una landing que se siente terminada
En la landing de audífonos, Astra construyó una página que respondía al scroll y tenía un modelo 3D interactivo. Al abrir la de Opus, me llamó la atención el acabado: los planos del producto, el fondo y la manera de recorrer la página.
No era solo tener cada elemento pedido. El conjunto se veía mejor. También revisé cómo se adaptaba al tamaño de pantalla. En este caso, le di el punto a Opus con bastante claridad.

Traducir porcentajes de nubes a algo que puedo entender
Para el visor de Torres del Paine, yo tenía un problema bastante concreto: veía datos de nubosidad, pero me costaba imaginar qué significaban para la vista de las torres.
Opus recurrió a imágenes generadas con Higgsfield y fue variando la cobertura de nubes. Me resultó más fácil interpretar la visualización que había armado. Esa fue la razón de mi voto: la claridad de la representación. La prueba no evaluó la exactitud del pronóstico ni convierte las imágenes en fotografías de las condiciones futuras.

Mi segundo cerebro ya existía
En este caso no les pedí construir una base de conocimiento desde cero. Mi segundo cerebro ya estaba en Obsidian; el trabajo era visualizarlo de una manera más atractiva.
Los dos construyeron grafos navegables. Opus, además, les dio forma de cerebro. Me gustó cómo resolvió la representación y la posibilidad de explorar conexiones. Es un ejemplo de mejorar la interfaz de algo que ya tienes, sin tener que rehacer todo el sistema.

Las dos pruebas donde preferí Astra
La primera fue el informe sobre agéntica en pymes de Latinoamérica. Astra presentó el material con un branding que encontré más profesional. Ojo con el alcance de ese punto: evalué la presentación. En el video aclaro que habría que revisar las fuentes y el contenido en detalle antes de dar por buena la investigación.
La segunda fue el análisis y la recreación de un tráiler con Higgsfield. Preferí el resultado de Astra porque se acercaba más a lo que buscaba como pieza audiovisual. En el de Opus vi más imágenes estáticas y detecté que había considerado dos tráileres. Eso también limita la comparación: los insumos que terminó usando cada flujo no fueron idénticos.
Estos dos resultados me importan porque muestran por qué no elegiría una herramienta solo por el marcador total. Una tarea que haces todos los días puede pesar más que varias que no forman parte de tu trabajo.
Tiempo y costo: el otro lado del 9 a 2
La descripción del video recoge los totales de las 12 sesiones:
| Medida de esta prueba | Opus 5.5 | GPT-6 Astra |
|---|---|---|
| Tiempo acumulado de sesiones | 14 h 45 min | 6 h 11 min |
| Estimación a precio de API, más créditos de Higgsfield | US$296,86 | US$130,44 |
| Pruebas que elegí como ganadoras | 9 | 2 |
Los montos son una estimación equivalente, no una factura que pagué por ejecutar estas pruebas. Usé mis suscripciones de Claude y ChatGPT, de US$200 cada una, para las ejecuciones de los modelos. La estimación incorpora también el consumo de Higgsfield.
El tiempo es la suma de las sesiones, no el tiempo transcurrido de una sola jornada. Además, durante la grabación tuve problemas de conexión. Mi sospecha es que afectaron parte de la diferencia, pero no medí cuánto. Estos números describen esta ejecución; no son una promesa de velocidad ni un presupuesto para repetir cualquier proyecto.
Con cuál me quedo para trabajar
En esta batería, Opus me entregó más resultados que preferí, especialmente en varias de las piezas visuales y aplicaciones. Astra fue más eficiente en el tiempo acumulado y en la estimación de costo, y ganó dos trabajos por mérito propio.
Para decidir, partiría por una tarea concreta de mi semana. Le daría a los dos el mismo material y evaluaría si el resultado adicional justifica la espera y el consumo. También comprobaría que los datos, permisos y contexto estén disponibles: la auditoría dejó claro cuánto puede afectar eso a la ejecución.
Y en las miniaturas dejé la decisión abierta. Que una me guste más no demuestra que consiga más clics. En el video puedes ver las dos y elegir la tuya.
Video completo y capítulos
- 03:07 · Isla prehistórica
- 06:31 · Landing de audífonos
- 08:42 · Carta de ventas
- 10:57 · Pac-Man 3D
- 12:31 · Informe nivel consultora
- 14:08 · Visor de las Torres del Paine
- 16:13 · Auditoría de suscripciones
- 18:25 · Análisis y recreación del tráiler
- 20:45 · Segundo cerebro en 3D
- 22:26 · Contador de modelos
- 23:51 · Animación en JavaScript
- 26:26 · Miniaturas con computer use
- 29:30 · Marcador, tiempo y tokens
Los prompts de las pruebas están compartidos dentro de Imperio Agéntico. Si quieres entender mejor los entornos de trabajo, puedes seguir con la comparación entre Codex y Claude Code.
Por Benjamín Cordero, creador del canal y cofundador de Imperio Agéntico junto a Maximiliano Cordero.
Preguntas frecuentes
¿Quién ganó la comparación entre Opus 5.5 y GPT-6 Astra?
En la valoración de Benjamín Cordero, Opus ganó 9 pruebas, Astra ganó 2 y la prueba de miniaturas quedó abierta a la audiencia. Es el resultado de esta batería de trabajos, no una clasificación universal.
¿Los US$296,86 y US$130,44 fueron gastos reales?
Son estimaciones a precio de API más créditos de Higgsfield. Las ejecuciones de los modelos se realizaron con las suscripciones de Claude y ChatGPT que Benjamín ya pagaba.
¿Todas las pruebas se resolvieron en un solo intento?
Esa era la intención inicial, pero la auditoría de suscripciones requirió reintentos. También hubo posibles diferencias de contexto previo y problemas de conexión, descritos en el artículo.
¿Dónde están los prompts y los resultados completos?
Los resultados se muestran en el video enlazado en esta guía. Los 12 prompts están compartidos dentro de Imperio Agéntico, según la descripción del video.
