bencorde.IMPERIO
AGÉNTICO

Agentes de IA

Probé Opus 5.5 vs GPT-6 Astra en 12 trabajos reales

Los mismos 12 trabajos, dos modelos y un resultado con matices: Opus ganó 9 pruebas, mientras Astra usó menos tiempo y tuvo menor costo estimado por API.

Por Benjamín Cordero · Publicado:
Video original: · 7 min de lectura
Revisión editorial:

Ilustración editorial de dos sistemas de IA frente a una mesa de proyectos
Ilustración editorial generada para esta comparación. Las capturas de las pruebas aparecen dentro del artículo.

Le di los mismos 12 trabajos a Claude Opus 5.5 y a GPT-6 Astra. Quería ver qué pasaba cuando los ponía a hacer cosas de mi semana: crear una landing, escribir una carta de ventas, revisar suscripciones o investigar miniaturas.

También hubo espacio para llevarlos al límite. Max propuso un Pac-Man en 3D con mi cara. Yo estaba en Torres del Paine y quería una forma de entender cómo se vería el macizo con distintos niveles de nubosidad. Y terminamos con una isla de dinosaurios, un segundo cerebro en 3D y una animación hecha con código.

Mi marcador final fue 9 para Opus, 2 para Astra y una prueba abierta a la audiencia. Pero al sumar tiempos y estimar costos, Astra tenía una ventaja importante. Elegir con cuál trabajar requiere mirar las dos cosas.

Cómo hice la comparación

Usé el mismo prompt inicial, palabra por palabra, y el nivel máximo de razonamiento en ambos. Opus 5.5 trabajó en Claude Code; Astra, en Codex. A los dos les conecté Higgsfield para generar los recursos visuales de los casos que lo requerían.

La intención inicial era resolver cada trabajo en un intento y sin preguntas. Hay una excepción que conviene dejar clara: en la auditoría de suscripciones tuve que pedir reintentos a ambos. También advertí durante la carta de ventas que el contexto previo de Claude podía haber influido en el resultado.

Por eso leo esta comparación como una prueba de mis flujos reales, con sus herramientas y condiciones. Los puntos reflejan mi valoración de los resultados mostrados. No prueban que un modelo gane cualquier tarea ni aíslan por completo el efecto del modelo, el contexto y la aplicación donde corre.

La idea de hacer una batería de trabajos está inspirada en Nate Herk. La adapté a mis propios proyectos y al trabajo en español.

Los 12 trabajos y mi resultado

Trabajo Mi elección Qué hizo la diferencia
Isla prehistórica en 3D Opus 5.5 Volví a probarla y cambié mi voto por la experiencia de juego.
Landing 3D de audífonos Opus 5.5 Modelado, composición y recorrido visual de la página.
Carta de ventas en español Opus 5.5 Uso del contexto y desarrollo del copy, con la salvedad del contexto previo.
Pac-Man 3D con mi cara Opus 5.5 Incorporó mejor mi cara al personaje y resolvió mejor el conjunto visual.
Informe nivel consultora GPT-6 Astra Preferí su presentación y branding; no validé toda la investigación.
Visor de las Torres del Paine Opus 5.5 Las imágenes hicieron más fácil entender la nubosidad.
Auditoría de suscripciones Opus 5.5 Consiguió completar el trabajo; Astra dejó importes sin calcular.
Análisis y recreación de un tráiler GPT-6 Astra Preferí el resultado audiovisual; Opus incorporó más imágenes estáticas.
Visualización del segundo cerebro Opus 5.5 Organizó el grafo con forma de cerebro y una presentación que me gustó más.
Contador de días sin un modelo nuevo Opus 5.5 Resolvió mejor los datos mostrados y la reacción ante un lanzamiento.
Animación dibujada en JavaScript Opus 5.5 Preferí la animación y la música de su resultado.
Miniaturas con computer use Abierta a la audiencia Ambas propuestas me gustaron; falta comprobar cómo rinden.

Dónde Opus me sorprendió más

Una landing que se siente terminada

En la landing de audífonos, Astra construyó una página que respondía al scroll y tenía un modelo 3D interactivo. Al abrir la de Opus, me llamó la atención el acabado: los planos del producto, el fondo y la manera de recorrer la página.

No era solo tener cada elemento pedido. El conjunto se veía mejor. También revisé cómo se adaptaba al tamaño de pantalla. En este caso, le di el punto a Opus con bastante claridad.

Landing de audífonos creada por Opus 5.5 en la demostración
Captura del video original, 08:00. Resultado de la landing de audífonos de Opus 5.5.

Traducir porcentajes de nubes a algo que puedo entender

Para el visor de Torres del Paine, yo tenía un problema bastante concreto: veía datos de nubosidad, pero me costaba imaginar qué significaban para la vista de las torres.

Opus recurrió a imágenes generadas con Higgsfield y fue variando la cobertura de nubes. Me resultó más fácil interpretar la visualización que había armado. Esa fue la razón de mi voto: la claridad de la representación. La prueba no evaluó la exactitud del pronóstico ni convierte las imágenes en fotografías de las condiciones futuras.

Visor de las Torres del Paine con la visualización creada por Opus
Captura del video original, 15:27. Visualización de nubosidad mostrada durante la comparación.

Mi segundo cerebro ya existía

En este caso no les pedí construir una base de conocimiento desde cero. Mi segundo cerebro ya estaba en Obsidian; el trabajo era visualizarlo de una manera más atractiva.

Los dos construyeron grafos navegables. Opus, además, les dio forma de cerebro. Me gustó cómo resolvió la representación y la posibilidad de explorar conexiones. Es un ejemplo de mejorar la interfaz de algo que ya tienes, sin tener que rehacer todo el sistema.

Grafo con forma de cerebro creado por Opus a partir del sistema existente
Captura del video original, 21:48. La tarea consistía en visualizar el segundo cerebro existente.

Las dos pruebas donde preferí Astra

La primera fue el informe sobre agéntica en pymes de Latinoamérica. Astra presentó el material con un branding que encontré más profesional. Ojo con el alcance de ese punto: evalué la presentación. En el video aclaro que habría que revisar las fuentes y el contenido en detalle antes de dar por buena la investigación.

La segunda fue el análisis y la recreación de un tráiler con Higgsfield. Preferí el resultado de Astra porque se acercaba más a lo que buscaba como pieza audiovisual. En el de Opus vi más imágenes estáticas y detecté que había considerado dos tráileres. Eso también limita la comparación: los insumos que terminó usando cada flujo no fueron idénticos.

Estos dos resultados me importan porque muestran por qué no elegiría una herramienta solo por el marcador total. Una tarea que haces todos los días puede pesar más que varias que no forman parte de tu trabajo.

Tiempo y costo: el otro lado del 9 a 2

La descripción del video recoge los totales de las 12 sesiones:

Medida de esta prueba Opus 5.5 GPT-6 Astra
Tiempo acumulado de sesiones 14 h 45 min 6 h 11 min
Estimación a precio de API, más créditos de Higgsfield US$296,86 US$130,44
Pruebas que elegí como ganadoras 9 2

Los montos son una estimación equivalente, no una factura que pagué por ejecutar estas pruebas. Usé mis suscripciones de Claude y ChatGPT, de US$200 cada una, para las ejecuciones de los modelos. La estimación incorpora también el consumo de Higgsfield.

El tiempo es la suma de las sesiones, no el tiempo transcurrido de una sola jornada. Además, durante la grabación tuve problemas de conexión. Mi sospecha es que afectaron parte de la diferencia, pero no medí cuánto. Estos números describen esta ejecución; no son una promesa de velocidad ni un presupuesto para repetir cualquier proyecto.

Con cuál me quedo para trabajar

En esta batería, Opus me entregó más resultados que preferí, especialmente en varias de las piezas visuales y aplicaciones. Astra fue más eficiente en el tiempo acumulado y en la estimación de costo, y ganó dos trabajos por mérito propio.

Para decidir, partiría por una tarea concreta de mi semana. Le daría a los dos el mismo material y evaluaría si el resultado adicional justifica la espera y el consumo. También comprobaría que los datos, permisos y contexto estén disponibles: la auditoría dejó claro cuánto puede afectar eso a la ejecución.

Y en las miniaturas dejé la decisión abierta. Que una me guste más no demuestra que consiga más clics. En el video puedes ver las dos y elegir la tuya.

Video completo y capítulos

Ver las 12 pruebas completas.

Los prompts de las pruebas están compartidos dentro de Imperio Agéntico. Si quieres entender mejor los entornos de trabajo, puedes seguir con la comparación entre Codex y Claude Code.

Por Benjamín Cordero, creador del canal y cofundador de Imperio Agéntico junto a Maximiliano Cordero.

Preguntas frecuentes

¿Quién ganó la comparación entre Opus 5.5 y GPT-6 Astra?

En la valoración de Benjamín Cordero, Opus ganó 9 pruebas, Astra ganó 2 y la prueba de miniaturas quedó abierta a la audiencia. Es el resultado de esta batería de trabajos, no una clasificación universal.

¿Los US$296,86 y US$130,44 fueron gastos reales?

Son estimaciones a precio de API más créditos de Higgsfield. Las ejecuciones de los modelos se realizaron con las suscripciones de Claude y ChatGPT que Benjamín ya pagaba.

¿Todas las pruebas se resolvieron en un solo intento?

Esa era la intención inicial, pero la auditoría de suscripciones requirió reintentos. También hubo posibles diferencias de contexto previo y problemas de conexión, descritos en el artículo.

¿Dónde están los prompts y los resultados completos?

Los resultados se muestran en el video enlazado en esta guía. Los 12 prompts están compartidos dentro de Imperio Agéntico, según la descripción del video.