bencorde.IMPERIO
AGÉNTICO

Agentes IA

Claude Fable 5.1: cómo interpretar sus benchmarks y el ahorro de caché

Por qué una lectura de caché más barata puede reducir el costo de una tarea larga, y qué comprobar antes de trasladar un benchmark a tu negocio.

Por Benjamín Cordero · Publicado:
Video original: · 8 min de lectura
Revisión editorial:

Fable 5.1 plantea dos preguntas prácticas para quien trabaja con agentes: qué tareas puede resolver mejor y cuánto cuesta completar un trabajo largo. En este video analizo el anuncio, las pruebas publicadas y el cambio de precio de las lecturas de caché.

La distinción central es esta: reducir el precio de una lectura de caché no reduce en la misma proporción toda la factura. El efecto depende de cuánto contexto reutiliza tu flujo, cuánto genera y qué otras operaciones necesita.

Presentación oficial de Fable 5.1 y Mythos 5.1 revisada por Benjamín Cordero
El análisis parte del anuncio del laboratorio. Ver la presentación, 3:30.

Qué analiza esta guía

La grabación es una lectura crítica del lanzamiento del 1 de septiembre de 2026. No es una batería propia de proyectos ejecutados con Fable 5.1. Los resultados del laboratorio, los casos de terceros y mis criterios de evaluación cumplen funciones diferentes y conviene distinguirlos.

El anuncio de Anthropic presenta Fable 5.1 y Mythos 5.1 como el mismo modelo base con distintos controles y vías de acceso. Fable es la opción de disponibilidad general; Mythos se ofrece mediante programas de acceso evaluado. Los ejemplos científicos de uno no deben atribuirse automáticamente al otro.

Para el contexto anterior tienes mi análisis de Fable 5 y Mythos 5 y la guía de Opus 5, coste y esfuerzo.

Qué significa cada familia de benchmarks

Durante el video recorro siete familias de pruebas. Antes de mirar una cifra, identifica qué trabajo representa y cómo se decide si la tarea terminó.

Prueba comentada Qué observar al leerla
Terminal-Bench-Science Investigación realizada mediante herramientas y terminal
Terminal-Bench Resolución de tareas de programación en un entorno de ejecución
GDPval-AA Calidad comparada de entregables profesionales; su puntuación no es un porcentaje de empleos reemplazados
OSWorld Recorridos de uso del computador y criterios de finalización
Humanity's Last Exam Problemas especializados, distinguiendo uso con herramientas y sin ellas
AutomationBench Ejecución de flujos de negocio que conectan aplicaciones
CursorBench Tareas de programación en el entorno y conjunto de pruebas de Cursor
Tabla de benchmarks de Fable 5.1 anotada durante el video
La captura conserva la comparación analizada en la grabación. Ver la lectura de la tabla, 13:20.

Una mejora en una de estas pruebas puede justificar un experimento propio, pero no describe todas las tareas posibles. Tampoco es válido rellenar una celda sin datos con un cero o trasladar un puesto de una tabla histórica al ranking actual.

En las curvas de calidad y coste, revisa el nivel de esfuerzo y los ejes. Un punto con un resultado alto puede tener un coste mayor, y un esfuerzo menor puede ser suficiente para tu encargo. La comparación útil es la del trabajo completo que necesitas resolver.

OSWorld: progreso parcial y tarea completada

En el video me detengo en la diferencia entre puntuación parcial y estricta. La documentación de OSWorld 2.0 distingue el cumplimiento de partes del recorrido de la finalización completa evaluada.

Puedes entenderlo con un ejemplo editorial: un agente abre la aplicación correcta, encuentra un documento y lo modifica, pero lo guarda en otro destino. Ha completado parte del trabajo y todavía incumple una condición del encargo. Una métrica parcial puede reconocer ese avance; una evaluación estricta de la tarea completa no lo daría por terminado.

Por eso, un porcentaje alto en una métrica parcial no significa que el agente complete ese mismo porcentaje de encargos de extremo a extremo. Llegar a un resultado concreto en un benchmark tampoco prueba una equivalencia general con todas las capacidades de una persona.

AutomationBench: comprobar el sistema que produjo el resultado

Esta prueba me interesa porque conecta con automatizaciones reales: localizar datos, interpretar una política y actuar en varias aplicaciones. Zapier describe AutomationBench como una evaluación de ejecución completa con un estado final verificable.

Hay un detalle relevante al consultar su tabla oficial: el resultado de 31,4% para Fable 5.1 se identifica como una combinación con fallback a Opus 5. La tabla aclara que el coste indicado no incorpora los tokens de ese fallback. No debe interpretarse como el coste total de un flujo resuelto exclusivamente por Fable.

La lección se puede aplicar a cualquier comparativa. Registra qué modelo inició el trabajo, si intervino otro, qué herramientas había disponibles y qué parte del consumo está incluida. En tu negocio, una corrección humana posterior también forma parte del esfuerzo necesario para completar la tarea.

Qué cambia en el precio de la caché

La tabla de precios de Claude diferencia entrada, salida y operaciones de caché. En la comparación del video, Fable 5.1 mantiene 10 dólares por millón de tokens de entrada base y 50 de salida. La lectura de caché pasa de 1 dólar en Fable 5 a 0,25 en Fable 5.1 por millón de tokens.

Ese cambio equivale a una reducción del 75% en esa partida. No significa que genere cuatro veces menos tokens, que todas las entradas sean cacheadas ni que una suscripción baje de precio.

El prompt caching de Anthropic reutiliza prefijos de contexto compatibles con las condiciones de caché. La creación de una entrada de caché también tiene un coste y una duración. Releer un archivo o tener una conversación larga no garantiza por sí solo un acierto de caché en todas las solicitudes.

Gráfico de coste relativo y lecturas de caché en Fable
El peso de la caché modifica el ahorro total. Ver la explicación de costes, 24:50.

Un ejemplo sencillo del ahorro

Supongamos, solo para ilustrar la cuenta, que una tarea acumula cuatro millones de tokens facturados como lecturas de caché. Esa partida costaría cuatro dólares a un dólar por millón, y un dólar a 0,25 por millón. La diferencia sería de tres dólares.

Para obtener la factura de la tarea faltaría sumar las entradas que no fueron lecturas, las escrituras de caché, las salidas y otros cargos aplicables. Si esos importes dominan el trabajo, el ahorro porcentual total será menor. Si la lectura reutilizada pesa mucho, la reducción puede ser más relevante.

Las estimaciones de ahorro del anuncio describen mezclas de uso, no un descuento garantizado para cualquier conversación. En un flujo propio, compara los contadores de consumo y el resultado obtenido con el mismo criterio de aceptación.

Esfuerzo: revisa el ajuste de tu entorno

En la grabación aparece la duda entre esfuerzo medio y alto. La documentación del lanzamiento distingue el valor predeterminado alto en Claude Code del medio en Claude.ai y Cowork. Una selección visible en una sesión concreta no demuestra que todos los productos compartan el mismo ajuste.

Para elegir, prueba una tarea representativa con un nivel menor y aumenta solo si el resultado o la verificación lo justifican. Registra también las vueltas necesarias: un intento barato que obliga a rehacer el trabajo puede costar más que uno inicialmente más exigente.

Si necesitas entender cómo se combinan contexto, cuota y concurrencia, tienes la guía de límites de Claude Code.

Los ejemplos científicos, con la atribución correcta

El anuncio muestra un mapa de elevación de parte de Venus producido con Fable 5.1 a partir de datos históricos. Los ejemplos de diseño molecular y optimización para biología computacional se atribuyen a Mythos 5.1. Son casos publicados por Anthropic, no experimentos que yo haya reproducido.

Comparación del mapa de Venus mostrado durante el análisis
Uno de los casos de investigación revisados en el video. Ver el ejemplo de Venus, 28:20.

Para mi trabajo cotidiano, lo útil de estos ejemplos es la forma del encargo: datos de partida, herramientas y una comprobación externa del resultado. Una imagen atractiva o un relato del modelo no sustituyen esa validación.

Cómo decidir si probarlo en tu sistema

Elige un trabajo que ya conozcas: una revisión de código, un documento con fuentes o una automatización con un estado final fácil de comprobar. Conserva las entradas y anota cuatro cosas: resultado, intervenciones, tiempo y consumo total.

Si tu flujo depende de un fallback, inclúyelo. Si requiere permisos que no están disponibles, registra esa limitación. Si el entregable falla una condición importante, no lo cuentes como terminado por haber producido muchos archivos.

Video completo y recursos

Puedes seguir el análisis completo de Fable 5.1 en YouTube. Para llevar estas comparaciones a proyectos, empieza por el curso de Claude Code y comparte tus pruebas en Imperio Agéntico en Skool.

Suscríbete al canal de Benjamín Cordero para ver las demostraciones y su contexto completo.

Preguntas frecuentes

¿Fable 5.1 reduce todos los precios un 75%?

No. La reducción comentada corresponde a las lecturas de caché frente a Fable 5. La entrada base y la salida mantienen sus tarifas en la comparación del video. El ahorro total depende de la composición del consumo.

¿Qué es una lectura de caché?

Es la reutilización de un prefijo de contexto previamente procesado que cumple las condiciones de caché del proveedor. No toda lectura de archivos ni todo turno de una conversación se factura automáticamente como un acierto de caché.

¿El ahorro de la API baja el precio de mi suscripción?

Son conceptos diferentes. El cálculo de la guía trata partidas de uso facturadas por tokens. No demuestra una rebaja del precio de una suscripción ni un aumento garantizado de su cuota.

¿Fable 5.1 y Mythos 5.1 son el mismo producto?

Comparten el modelo base según Anthropic, pero tienen controles y vías de acceso diferentes. Mythos se ofrece mediante programas evaluados. No todos los casos publicados con Mythos corresponden a capacidades accesibles en Fable.

¿Qué diferencia hay entre OSWorld parcial y estricto?

La puntuación parcial reconoce partes completadas del recorrido; la estricta evalúa si se cumple la tarea completa. Un avance alto no demuestra que todos los requisitos del encargo se hayan resuelto.

¿El 31,4% de AutomationBench corresponde solo a Fable?

La tabla oficial de Zapier consultada identifica ese resultado como Fable 5.1 con fallback a Opus 5. También indica que el coste mostrado excluye los tokens del fallback. Conviene evaluar el sistema completo que produjo el resultado.

¿Qué nivel de esfuerzo utiliza por defecto?

El anuncio distingue alto en Claude Code y medio en Claude.ai y Cowork. Comprueba el ajuste real de tu sesión y compara niveles con una tarea representativa, registrando calidad, correcciones y consumo.

¿Los casos científicos fueron experimentos de Benjamín Cordero?

No. El video analiza ejemplos publicados por Anthropic. El mapa de Venus se atribuye a Fable 5.1; los casos de diseño molecular y optimización para biología computacional, a Mythos 5.1.