bencorde.IMPERIO
AGÉNTICO

Agentes de IA

Claude Fable 5 y Mythos: cómo evaluar tareas largas, visión y límites

El análisis del lanzamiento de junio sirve para entender trabajo prolongado, salvaguardas y por qué una tabla de benchmarks necesita sus notas de metodología.

Por Benjamín Cordero · Publicado:
Video original: · 7 min de lectura
Revisión editorial:

Fable 5 permite analizar una pregunta central del trabajo agéntico: qué necesita un modelo para sostener una tarea larga sin perder el objetivo. La respuesta incluye capacidad de razonamiento, herramientas, notas y verificación. También exige entender qué muestran realmente los ejemplos de un lanzamiento.

En el video del 9 de junio de 2026 revisé el anuncio de Fable 5 y Mythos 5, sus benchmarks y las demostraciones publicadas. Aquí organizo esa revisión alrededor de decisiones prácticas. Las condiciones promocionales que se mencionaban en junio ya no sirven como instrucciones de acceso actual.

Video completo y lectura de la evidencia

Puedes seguir la revisión de benchmarks desde el minuto 6, la lectura de las notas de metodología y el gráfico de coste y rendimiento. El video analiza material del proveedor; las demostraciones de juegos, simulación y migración no son experimentos propios ejecutados en esa grabación.

Qué diferencia a Fable 5 de Mythos 5

En el anuncio de Anthropic, ambos comparten el modelo subyacente. Fable se presentó para uso general con salvaguardas que podían derivar determinadas consultas a Opus 4.8. Mythos se distribuyó mediante acceso restringido con algunas salvaguardas retiradas para usos autorizados. No significa que exista una versión pública sin ningún límite.

Esa diferencia importa al interpretar resultados. Dos sistemas que comparten una base pueden responder de forma distinta si cambian sus controles y condiciones de acceso. Para un proyecto concreto, importa el comportamiento del servicio que realmente puedes utilizar.

Mi recomendación es formular la tarea legítima con claridad y comprobar qué modelo respondió. Si el producto informa una derivación, conserva ese dato al evaluar la salida. No atribuyas automáticamente todas las respuestas al nombre que seleccionaste al comenzar.

Por qué los asteriscos de los benchmarks importan

Una de las partes centrales del video es leer la nota bajo la tabla. El lanzamiento agrupaba Fable y Mythos; ciertos resultados reflejaban diferencias relacionadas con las salvaguardas. La nota explicaba cómo se seleccionaban las puntuaciones y qué casos no eran equivalentes.

Notas de metodología bajo la tabla conjunta de Fable 5 y Mythos revisada en el video
La metodología aparece en el minuto 12:30. Esta captura histórica conserva el contexto de la tabla conjunta.

No leería una puntuación como una promesa para cualquier cuenta. Tampoco mezclaría resultados obtenidos con herramientas distintas. Una prueba de terminal, una de uso visual del computador y una de razonamiento sin herramientas evalúan capacidades relacionadas, pero diferentes.

Para hacer una comparación útil, guarda junto al número el nombre del modelo, la fecha, la configuración y el entorno. Si falta una de esas piezas, limita la conclusión. La guía de Opus 4.8 explica con más detalle esfuerzo, contexto y condiciones de evaluación.

Tareas largas: mantener el rumbo y recuperar estado

En el análisis me interesó especialmente la continuidad: poder encargar un trabajo que requiere varios pasos, volver y encontrar un resultado comprensible. Eso exige algo más que una respuesta extensa.

Un agente necesita conservar qué intenta conseguir, qué ya probó y qué falta. Si un intento falla, debería registrar el motivo y elegir un siguiente paso pertinente. Si cambia de sesión, necesita una forma de recuperar el estado del trabajo.

En la práctica, prepararía una carpeta con requisitos, fuentes y un registro breve de decisiones. Cada etapa dejaría un entregable verificable. Para una investigación, una tabla de hallazgos con referencias. Para software, cambios concretos y comprobaciones. Para contenido, archivos finales y notas de revisión.

La guía de harness engineering desarrolla esa estructura. El sistema de memoria con Obsidian muestra otra forma de conservar conocimiento del proyecto. Un volumen grande de tokens procesados a lo largo de una tarea no significa que todo haya estado simultáneamente dentro de una sola ventana de contexto.

Cómo leer el gráfico de coste y rendimiento

En el video aparece un gráfico de FrontierCode con configuraciones de esfuerzo y coste medio por tarea. La curva permite observar los resultados de esa evaluación bajo distintos presupuestos.

Gráfico histórico de FrontierCode que relaciona coste medio y puntuación de Fable 5
Gráfico revisado en el minuto 15:20. El eje de coste está en escala logarítmica: la forma de la línea no demuestra una mejora lineal universal por cada dólar invertido.

La conclusión práctica es probar cuánto esfuerzo ayuda en tu caso. Puede haber tareas donde dedicar más cómputo permita explorar una hipótesis adicional. También puede haber tareas bloqueadas por datos ausentes o por un acceso que el modelo no tiene. Gastar más no resuelve automáticamente esas condiciones.

Separaría tres costes: ejecución del modelo, servicios externos y tiempo de revisión. Si el agente genera muchas variantes que luego tienes que descartar, el resultado puede ser menos eficiente aunque cada llamada individual parezca barata.

Qué enseñan las demostraciones del lanzamiento

El anuncio recogió una migración realizada dentro de una base Ruby de Stripe de 50 millones de líneas y una partida de Pokémon FireRed operada con capturas de pantalla. Son casos del proveedor y sus colaboradores, con condiciones propias. La migración no equivale a afirmar que se reescribieron 50 millones de líneas.

El interés de estos ejemplos está en la secuencia de decisiones: observar un estado, actuar, revisar y continuar. Para llevar esa idea a un negocio, hay que definir qué información puede observar el agente y qué acciones están autorizadas.

Un tablero visual puede servir para explorar una tarea, pero todavía necesita comprobación. Si el agente interpreta un gráfico, guarda el gráfico y los datos que pudo leer. Si opera una interfaz, verifica el estado final. La demostración de navegador con Playwright permite ver ese tipo de control en un caso del canal.

Acceso y costes: usa la información vigente

Fable 5 figura como activo en la tabla de estado de modelos de Claude. Eso no determina por sí solo qué cuota incluye una suscripción o qué opciones muestra cada producto.

Las ventanas promocionales y los cambios temporales de disponibilidad del lanzamiento quedan fuera de esta guía práctica. Consulta las condiciones de tu cuenta y la información de precios de Claude Platform antes de presupuestar. Pagar consumo adicional dentro de un producto tampoco es lo mismo que usar únicamente la API.

Si una ejecución se interrumpe, identifica si falta cuota, si se alcanzó una velocidad de solicitudes o si existe otro error. La guía de límites de Claude Code y API ayuda a separar esos diagnósticos.

Una prueba útil para tu propio proyecto

Escoge un trabajo que ya conozcas y define el resultado antes de empezar. Mantén los mismos archivos de entrada y pide evidencia de las comprobaciones. Anota qué partes resolvió, dónde necesitó correcciones y qué no pudo verificar.

Empieza por un fragmento representativo. Si una auditoría encuentra problemas reales y los explica bien, puedes ampliar su alcance. La guía de Ultracode con una auditoría de contenido muestra cómo conectar el modelo con un flujo de varios agentes.

Para seguir el análisis original, vuelve al video de Fable 5. Puedes suscribirte a YouTube y encontrar recursos de implementación en Imperio Agéntico en Skool.

Preguntas frecuentes

¿Fable 5 y Mythos 5 son exactamente el mismo servicio?

Comparten el modelo subyacente descrito en el lanzamiento, pero tienen diferencias de salvaguardas y acceso. Eso puede cambiar la respuesta disponible para una tarea. No equivale a ofrecer una versión pública sin ninguna restricción.

¿Por qué importan las notas de la tabla de benchmarks?

Explican condiciones de evaluación y diferencias entre Fable y Mythos que pueden quedar ocultas en una puntuación conjunta. Conserva modelo, configuración y entorno al comparar resultados; no asumas que cada cifra representa lo que obtendrá cualquier cuenta.

¿Benjamín ejecutó las demos de Stripe y Pokémon en ese video?

No. La grabación revisa demostraciones y resultados publicados por Anthropic y sus colaboradores. La guía los distingue de una prueba propia y no afirma que una migración dentro de una gran base de código reescribiera todas sus líneas.

¿Más presupuesto garantiza una mejor respuesta de Fable?

No. El gráfico comentado corresponde a una evaluación concreta y utiliza un eje de coste logarítmico. Más cómputo puede ayudar en algunos problemas, pero no reemplaza datos ausentes, permisos o criterios claros de aceptación.

¿Procesar millones de tokens significa tenerlos todos en contexto?

No. Una tarea prolongada puede acumular uso a través de muchas solicitudes y apoyarse en archivos y notas. El consumo total y la información presente simultáneamente en una ventana de contexto son conceptos diferentes.

¿Sirven las promociones de junio para saber cómo acceder ahora?

No. Las ventanas de uso incluidas y otras condiciones del lanzamiento fueron temporales. Revisa el estado del modelo y las condiciones actuales de tu cuenta. La guía conserva el análisis técnico sin presentar esas promociones como vigentes.