bencorde.IMPERIO
AGÉNTICO

Agentes IA

GPT-6 Astra: cómo evaluar sus benchmarks y el trabajo con aplicaciones

Qué muestran las pruebas de Astra y cómo llevarlas a un proyecto: uso del computador, calidad por coste, condiciones de evaluación y comparación con Claude.

Por Benjamín Cordero · Publicado:
Video original: · 8 min de lectura
Revisión editorial:

El análisis de GPT-6 Astra me interesa por una razón práctica: un agente útil necesita completar trabajo entre aplicaciones, archivos y herramientas. Responder bien una pregunta es solo una parte del recorrido.

En este video reviso el anuncio de OpenAI, sus gráficos de calidad y coste y varias demostraciones de trabajo profesional. La guía reúne los criterios para interpretarlos y preparar una comparación propia con modelos como Claude Fable 5.1.

Demostración de una casa recorrible en Unreal Engine mostrada en el anuncio de Astra
Una demostración de OpenAI que comento en el video; no es un proyecto que yo haya construido. Ver el recorrido, 23:30.

Qué muestra el video y qué falta comprobar en un proyecto

La grabación corresponde al 3 de septiembre de 2026. Analizo material del lanzamiento, no una batería de tareas propias ejecutadas con Astra. Algunos problemas de acceso a la página que comento pertenecen a ese momento y no describen el estado actual del servicio.

El anuncio oficial de GPT-6 Astra presenta avances en uso del computador, programación y trabajo profesional. Mi lectura del anuncio es que la competencia se concentra cada vez más en completar encargos largos con una combinación de calidad, velocidad y criterio.

Esa lectura es una interpretación. Para decidir qué usar en tu negocio, conserva una tarea de referencia y mide su resultado real. Mi comparación de proyectos con Sol y Fable ofrece un ejemplo de cómo observar entregables, además de mirar tablas.

Cómo leer un gráfico de calidad y coste

En varios gráficos del video, el eje horizontal representa coste API y el vertical una puntuación de resolución. Cada punto puede corresponder a un nivel de esfuerzo distinto.

Esto permite hacer dos preguntas: cuánto cuesta llegar a un resultado suficiente y qué mejora obtienes al aumentar el consumo. El punto situado más arriba no siempre es el que necesitas para tu trabajo.

Curva de calidad y coste de Astra en AutomationBench
La posición horizontal representa coste en esta vista del gráfico. Ver cómo la leo, 14:10.

Si una curva empieza a aplanarse, observa cuánto mejora la tarea al mover el ajuste. No conviertas esa observación en una regla universal: otra tarea puede responder de otra manera al esfuerzo.

Los tokens de salida, el tiempo y los dólares tampoco son medidas intercambiables. Un flujo puede generar menos texto y esperar más por una herramienta, o completar antes una tarea con un coste mayor. Registra cada dimensión por separado.

Los benchmarks que conectan con trabajo real

Familia Qué pregunta ayuda a responder Qué no demuestra por sí sola
AutomationBench ¿Completa un flujo entre aplicaciones? Que tu automatización concreta quede resuelta sin configuración
Terminal-Bench ¿Resuelve tareas con herramientas de terminal? Que cualquier repositorio funcione al primer intento
OSWorld ¿Completa recorridos de uso del computador? Que un porcentaje parcial equivalga a tareas terminadas
ScreenSpot-Pro ¿Identifica el elemento visual solicitado? Que después ejecute todo el proceso correctamente
Pruebas de documentos y diseño ¿Produce un entregable bajo ciertas condiciones? Que el contenido, los cálculos y las fuentes estén siempre correctos

En AutomationBench de Zapier, la comparación comentada incluye un 41,4% para Astra con esfuerzo máximo y un 31,4% para Fable 5.1 con fallback a Opus 5. Es importante conservar esa segunda condición. La tabla también aclara qué consumo está incluido en su coste.

No mezcles resultados de distintas versiones o configuraciones para construir una clasificación única. Si un laboratorio cambia el conjunto de tareas, la herramienta disponible o el criterio de puntuación, cambia también la interpretación.

Una corrección importante sobre OSWorld

En la tabla de OpenAI, el 72,6% de Astra se compara con 70,2% de Claude Opus 5. No corresponde a Fable 5.1. Además, esa evaluación utiliza una versión offline y puntuación parcial.

Gráfico de OSWorld Offline comparando Astra, Sol y Opus 5
Los nombres y la versión del conjunto importan para interpretar la comparación. Ver el gráfico, 18:10.

El proyecto OSWorld 2.0 permite consultar su metodología. Las cifras de otro anuncio que use tareas o evaluación modificadas no se pueden trasladar directamente a esta gráfica.

Un ejemplo sencillo: localizar el archivo correcto, editarlo y fallar al exportar puede recibir reconocimiento parcial por el avance. Para el usuario que necesita el archivo final, todavía falta una condición esencial. Evalúa tus sistemas con criterios que representen el trabajo completo que prometes entregar.

Qué significa llegar cerca del 100%

En el anuncio aparecen resultados cercanos a la saturación de algunas pruebas, como FrontierMath y ARC-AGI-3. Es una señal de que ese conjunto de tareas puede diferenciar menos a los modelos en su extremo superior. No es una medida de que un sistema pueda resolver cualquier problema.

La nota de ARC-AGI-3 especifica el entorno de ejecución utilizado por OpenAI. Ese detalle debe acompañar la cifra cuando se compara con otros resultados. “Obtuvo esta puntuación bajo estas condiciones” es una afirmación más precisa que convertirla en una conclusión general sobre inteligencia humana.

En seguridad ocurre algo similar. El 100% de ExploitBench citado en el video corresponde a una evaluación sin los controles de producción. No describe lo que una cuenta corriente puede o debe ejecutar. OpenAI explica las diferencias de acceso y controles en Path to Astra.

Alineación: respetar el encargo también forma parte del resultado

Otra prueba comentada plantea una tarea imposible y observa si el modelo se sale del alcance para intentar resolverla. El interés práctico es claro: una automatización no debería considerar éxito haber conseguido algo por un camino que el usuario no autorizó.

Un resultado sin incidentes en una evaluación no garantiza que nunca haya fallos. En un flujo propio, conserva límites de acceso, evidencias de ejecución y una forma de detener o revisar acciones que cambian sistemas externos.

Puedes aplicar el mismo criterio al diseño del encargo: objetivo, condiciones y evidencia de término. Lo desarrollo en la guía para revisar skills y simplificar instrucciones. Un resultado correcto incluye respetar esas condiciones.

De una referencia visual a un entregable

El video recorre ejemplos de presentaciones, hojas de cálculo, diseño y modelado. Lo que más me interesa es la capacidad de tomar una referencia, conservar lo relevante y producir un archivo que otra persona pueda continuar utilizando.

Referencia de una presentación y versión generada en la demostración oficial
El ejemplo permite comparar la estructura visual con su referencia. Ver este tramo, 29:00.

Para revisar una presentación, comprueba narrativa, cortes de texto y legibilidad. Para una hoja de cálculo, abre fórmulas, unidades y totales. Para un modelo 3D, inspecciona el archivo y las condiciones del uso previsto. La vista previa es una parte de la evidencia, no todo el control de calidad.

Un render de una casa puede ayudar a explorar una propuesta. No sustituye planos constructivos ni la comprobación técnica que necesita una obra. Del mismo modo, una demostración de formulario no acredita por sí sola que todos sus datos sean correctos.

Coste por token y coste por tarea

La ficha de GPT-6 Astra en la API publica tarifas diferenciadas para entrada, salida y caché, además de condiciones para contextos largos y modos de procesamiento. En el nivel estándar de referencia, entrada y salida base son 10 y 50 dólares por millón de tokens.

Que esas dos cifras coincidan con las de Fable 5.1 no produce facturas idénticas. Las lecturas de caché tienen otras tarifas y cada modelo puede consumir una cantidad diferente para terminar el mismo trabajo. También pueden existir costes de herramientas o correcciones fuera de la primera respuesta.

La guía de caché y costes de Fable 5.1 explica cómo hacer esa separación. Para comparar, suma el proceso completo y utiliza las tarifas vigentes de cada entorno, no solo el precio que aparece en el título de una tabla.

Cómo preparar tu primera comparación

Selecciona un encargo que puedas juzgar sin depender de lo que el modelo diga de sí mismo. Dale a ambos sistemas el mismo material, acceso equivalente y un criterio de aceptación escrito antes de ejecutar.

Una comparación útil puede incluir un documento con fuentes, una corrección sobre un proyecto o un recorrido entre aplicaciones de prueba. Anota qué quedó terminado, qué corregiste, cuánto tardó y qué consumo registró cada entorno. Repite cuando la variabilidad del resultado impida una conclusión clara.

El acceso al modelo depende del producto y de la cuenta. Comprueba su disponibilidad en el entorno que vas a utilizar y las condiciones de tu organización, sin interpretar la restricción inicial del lanzamiento como una limitación permanente.

Video completo y recursos

En el análisis de GPT-6 Astra en YouTube puedes seguir los gráficos y las demostraciones con sus comentarios. Para aprender a organizar proyectos con agentes, tienes el curso de Claude Code y los recursos de Imperio Agéntico en Skool.

Suscríbete al canal de Benjamín Cordero para ver las comparaciones prácticas completas.

Preguntas frecuentes

¿El video contiene pruebas propias de Benjamín Cordero con Astra?

La grabación analiza el anuncio de OpenAI, sus benchmarks y demostraciones. No presenta una batería propia de tareas ejecutadas con Astra. La guía propone criterios para hacer esa comparación en proyectos reales.

¿Qué significa computer use?

Es la capacidad de un agente para trabajar con interfaces de aplicaciones, interpretar lo que aparece y realizar acciones. Encontrar un botón y completar un recorrido son capacidades distintas que deben comprobarse por separado.

¿Qué se compara en el gráfico de OSWorld del video?

La tabla de OpenAI muestra Astra con 72,6% y Claude Opus 5 con 70,2% en una evaluación offline con puntuación parcial. El segundo valor no corresponde a Fable 5.1. No debe mezclarse con otras versiones o criterios de evaluación.

¿Un 99,9% en ARC-AGI-3 demuestra inteligencia general?

Demuestra un resultado en ese benchmark bajo las condiciones de ejecución indicadas. No prueba que el sistema resuelva cualquier problema. El anuncio especifica el entorno de OpenAI utilizado para esa evaluación.

¿El 100% en ExploitBench describe las capacidades disponibles para cualquier usuario?

No. El resultado citado corresponde a una evaluación sin los controles de producción. El acceso y las acciones disponibles en productos públicos tienen condiciones y salvaguardas propias.

¿Astra y Fable 5.1 cuestan lo mismo?

Coinciden en las tarifas base de entrada y salida comentadas, pero difieren en partidas como caché y pueden consumir cantidades distintas. Compara el coste total del trabajo, incluyendo herramientas, fallback y correcciones necesarias.

¿Conviene elegir siempre el esfuerzo máximo?

No necesariamente. Prueba qué nivel alcanza el resultado que necesitas y registra consumo, tiempo e intervenciones. Una mejora pequeña en un benchmark no asegura que un ajuste mayor aporte valor a cualquier tarea.

¿La restricción inicial del lanzamiento sigue describiendo todas las cuentas?

El video refleja el despliegue inicial del 3 de septiembre de 2026. Comprueba la disponibilidad actual en tu producto y cuenta, junto con las condiciones de tu organización y la documentación vigente.