Para evaluar Opus 5, compara cuánto cuesta completar una tarea correctamente y qué esfuerzo necesita para lograrlo. La tarifa por token y una tabla de benchmarks aportan información, pero no describen por sí solas el resultado de tu proyecto.
En el video del 24 de julio de 2026 analicé su presentación, las comparaciones con Fable 5 y Opus 4.8, y las curvas que relacionan rendimiento y coste. Esta guía recoge ese análisis con una pauta para llevarlo a un entorno de trabajo real.
La grabación revisa resultados publicados por el fabricante. No contiene una batería propia de pruebas que demuestre un ganador universal. Es útil para decidir qué conviene probar y qué mediciones pedir antes de cambiar de modelo.
Video completo y análisis de las gráficas
Ver el análisis de Opus 5 en YouTube. La tabla comparativa aparece alrededor del minuto 6 y las curvas de coste se revisan desde el minuto 13.
Qué pregunta responde cada benchmark
La tabla reúne pruebas diferentes. Algunas evalúan programación, otras uso de herramientas, búsqueda o resolución de problemas. Que un modelo destaque en una fila no demuestra que también sea mejor en una tarea de otra categoría.

Una precisión respecto del comentario oral: la primera fila de la tabla corresponde a Frontier-Bench v0.1, no a Terminal-Bench. También hay puntuaciones que no son porcentajes, como GDPval. Interpretarlas todas como porcentaje de acierto produce comparaciones incorrectas.
En el anuncio oficial de Opus 5, Anthropic describe mejoras en programación y trabajo con herramientas, además de una relación entre coste y resultado favorable en las evaluaciones presentadas. La nota de Frontier-Bench especifica un entorno y una media de cinco intentos por tarea. Ese detalle importa al comparar con una ejecución propia.
Mi lectura práctica de la tabla es buscar las filas que se parecen al trabajo que necesito hacer. Si quiero construir una web, además de un resultado de programación necesito abrir la página, probar sus acciones y revisar cómo se ve en celular.
El esfuerzo cambia la relación entre tiempo, coste y resultado
Un modelo puede dedicar más o menos razonamiento a una tarea. En las gráficas del video, cada punto representa una configuración de esfuerzo. Al conectar esos puntos aparece una curva, no un único resultado fijo del modelo.
La dirección deseable es conseguir un resultado mejor con un coste menor. En términos visuales, interesa acercarse a la parte superior izquierda de la gráfica. Pero hay que leer las etiquetas: el eje horizontal de las capturas usa una escala logarítmica.

Subir el esfuerzo puede mejorar un resultado, pero no implica que cada dólar adicional genere la misma mejora. Tampoco convierte una buena curva en una garantía para todos los proyectos.
Para una modificación pequeña con requisitos claros, prueba primero una configuración que resuelva la tarea de forma suficiente. Para un diagnóstico difícil, una revisión de arquitectura o un problema con varios pasos, puede tener sentido dedicar más razonamiento. La decisión se confirma con el trabajo terminado.
La guía sobre esfuerzo, contexto y Opus 4.8 desarrolla esa separación entre modelo, configuración y sistema de trabajo.
Fable y Opus no se comparan con un único ganador
En la presentación hay categorías donde Fable mantiene ventaja y otras donde Opus 5 muestra mejores resultados. La comparación útil depende del tipo de tarea y del coste aceptable.
Una tarea difícil que solo un modelo consigue completar puede justificar un coste superior. En cambio, si dos modelos alcanzan el criterio de aceptación, interesa revisar cuánto tardaron, cuántas correcciones necesitaron y qué consumo produjo el recorrido completo.
Esto se ve con más claridad al comparar proyectos concretos. En mi prueba de Sol frente a Fable, las preferencias cambiaron entre una landing, un juego y una aplicación de dictado. Es un recordatorio de que el nombre del modelo no reemplaza la revisión del entregable.
Mide el coste de terminar, incluidas las correcciones
Una tarifa de entrada o salida sirve para calcular una parte del consumo. El agente también puede recuperar archivos, llamar herramientas, repetir pruebas y corregir errores. Esos pasos influyen en el coste total.
Registra la ejecución completa y distingue gasto facturado de equivalencia API. Si trabajas con una suscripción, el valor estimado de los tokens no necesariamente coincide con un cobro adicional.
Esta tabla es una pauta editorial para repetir una comparación:
| Dato | Qué registrar |
|---|---|
| Encargo | Mismo objetivo, archivos y criterio de aceptación |
| Configuración | Modelo, esfuerzo, herramientas y fecha |
| Resultado | Evidencia de que la tarea funciona |
| Intervenciones | Correcciones humanas y decisiones pendientes |
| Consumo | Total de la ejecución y forma de calcular su coste |
| Tiempo | Duración hasta el resultado aceptado |
Repite las tareas que influyen de verdad en tu operación. Una sola ejecución puede descubrir un problema, pero no describe la variabilidad de un modelo.
Fast mode cambia la velocidad y el precio
El video también revisa Fast mode. Es una modalidad para obtener respuestas con menor latencia; no debe interpretarse como un modelo distinto con más inteligencia.
La disponibilidad y el cobro dependen del producto y del modelo compatible. Consulta la documentación de Fast mode en Claude Code antes de activarlo. Para decidir si te sirve, mide el tiempo ahorrado en la tarea completa y el gasto adicional correspondiente.
Si el trabajo pasa gran parte del tiempo esperando una herramienta externa, acelerar la generación del modelo puede tener menos impacto del esperado. El cuello de botella se descubre midiendo el recorrido.

Herramientas durante la conversación y fallback
Para quienes construyen agentes mediante API, la presentación incluye dos funciones relacionadas con sesiones largas.
Los cambios de herramientas durante una conversación permiten cambiar cuáles se ofrecen al modelo conservando el prefijo de caché. La documentación mantiene esta parte en beta: las herramientas se declaran de antemano y después se ofrecen o retiran mediante bloques específicos. No significa que editar cualquier parte del historial conserve automáticamente la caché.
El fallback ante rechazos aborda solicitudes marcadas por determinados clasificadores. No es un reemplazo general de los reintentos ante cualquier error ni una forma de eliminar permisos, presupuestos o controles de tu aplicación.
Si solo usas Claude desde su interfaz, no necesitas implementar estas funciones para comparar modelos. Si construyes un producto, conviene evaluar compatibilidad y comportamiento con ejemplos controlados antes de cambiar la integración.
Una prueba práctica antes de cambiar todo tu flujo
Elige tres encargos frecuentes: uno sencillo, uno que suela necesitar correcciones y uno que dependa de herramientas. Guarda el estado inicial y define qué evidencia demostrará que cada uno está terminado.
Ejecuta la comparación con contexto equivalente. No atribuyas al modelo una diferencia causada por un archivo que uno recibió y el otro no, una herramienta desconectada o un criterio de evaluación cambiado a mitad de camino.
En un buscador, revisa las fuentes recuperadas y lo que quedó fuera. En una aplicación, abre la interfaz y prueba las acciones. En una automatización, comprueba el resultado en el sistema de destino. La comparativa de Sonnet 5 en un RAG real muestra por qué evaluar una respuesta completa aporta más que mirar solo la tarifa.
Puedes volver a las gráficas y al análisis completo en YouTube. Para seguir las implementaciones y recursos de la comunidad, visita Imperio Agéntico en Skool.
Preguntas frecuentes
¿La guía contiene un benchmark propio de Opus 5?
La grabación analiza los resultados publicados por Anthropic al presentar Opus 5. No es una batería propia de pruebas controladas. La guía propone cómo contrastar esos resultados con tareas y datos de tu trabajo.
¿Opus 5 es mejor que Fable 5 en todo?
La comparación depende de la tarea y de su coste. En la tabla presentada hay categorías favorables a cada modelo. Conviene comprobar el resultado completo de tus proyectos antes de elegir un modelo para todo el flujo.
¿Qué significa el esfuerzo de un modelo?
Es una configuración que influye en el razonamiento dedicado a la tarea y puede cambiar calidad, tiempo y consumo. Subirlo no garantiza una mejora proporcional ni elimina la necesidad de verificar el resultado.
¿Cómo se leen las curvas de coste del video?
Compara el resultado obtenido con el coste por tarea y revisa las etiquetas de los ejes. Las capturas utilizan una escala logarítmica para el coste, por lo que una misma distancia visual no equivale a una cantidad fija de dinero.
¿Fast mode hace más inteligente a Opus?
Fast mode busca reducir la latencia con un cobro diferente. No representa por sí mismo un aumento de inteligencia del modelo. Evalúa su disponibilidad y el ahorro de tiempo en el recorrido completo.
¿El fallback de la API resuelve cualquier error?
No. El fallback tratado en el análisis está relacionado con solicitudes marcadas por determinados clasificadores. No reemplaza el manejo general de errores, los controles de permisos ni los límites de gasto de una aplicación.
¿Qué conviene medir al comparar dos modelos?
Usa el mismo objetivo, contexto y criterio de aceptación. Registra funcionamiento del entregable, correcciones, tiempo y consumo total. Distingue el gasto facturado de una estimación equivalente basada en tarifas API.
