Elegir un modelo no consiste solo en buscar el número más alto de una tabla. También importa cuánto contexto recibe, qué esfuerzo dedica, con qué herramientas trabaja y cómo se comprueba el resultado. El análisis de Opus 4.8 permite separar esas decisiones y entender mejor el trabajo con Claude Code.
En el video del 28 de mayo de 2026 revisé el anuncio, las evaluaciones publicadas y el selector de Claude Code. Esta guía conserva las conclusiones útiles de aquella revisión. Opus 4.8 se presenta por su nombre y fecha, sin convertir un lanzamiento de mayo en una novedad permanente.
Video completo y puntos para seguir el análisis
Puedes revisar la tabla de evaluaciones en el minuto 4:10 y la selección de modelo, contexto y esfuerzo en el minuto 17:10. La grabación analiza información del proveedor; no incluye una batería propia de pruebas comparativas ejecutada de principio a fin.
Qué conviene mirar en una evaluación de modelos
El anuncio oficial de Opus 4.8 describió avances en trabajo agéntico y en la comunicación de problemas encontrados al programar. Son resultados del proveedor en sus evaluaciones. No significan que cualquier implementación vaya a quedar libre de errores ni que una respuesta segura de sí misma sea suficiente evidencia.

Para interpretar una tabla, empezaría por cuatro preguntas:
- ¿Qué tarea mide: programación, uso del computador, investigación o conocimiento?
- ¿Qué herramientas y entorno tuvo disponibles cada modelo?
- ¿Cuánto tiempo, razonamiento o intentos se permitieron?
- ¿Ese problema se parece al trabajo que necesito resolver?
Un modelo puede destacar en una prueba y quedar por detrás en otra. Incluso dos puntuaciones con el mismo nombre de benchmark pueden proceder de configuraciones distintas. Antes de compararlas, revisa la metodología y las notas de la evaluación.
En el video aparecen precisamente diferencias entre entornos de prueba. La lección es conservar la comparación que utiliza condiciones compatibles. Sustituir una cifra por otra obtenida con un sistema diferente puede cambiar la conclusión sin haber cambiado el modelo.
Modelo, contexto, esfuerzo y velocidad son decisiones distintas
El menú puede reunir opciones que parecen equivalentes, pero cada una responde a una necesidad diferente:
| Decisión | Qué estás eligiendo | Qué debes observar |
|---|---|---|
| Modelo | La familia y versión que realiza el trabajo | Calidad en tu caso, compatibilidad y disponibilidad |
| Contexto | El material que puede considerar la ejecución | Relevancia, organización y cantidad de información |
| Esfuerzo | Cuánto razonamiento dedica a la tarea | Calidad obtenida frente a tiempo y consumo |
| Modo rápido | Una forma de reducir la latencia | Coste adicional y beneficio real para la tarea |
| Flujo de agentes | Cómo se reparte y comprueba el trabajo | Coordinación, evidencia y consumo total |
Por ejemplo, resumir un documento conocido y resolver un fallo intermitente son trabajos diferentes. En el primero, aumentar al máximo todas las opciones puede aportar poco. En el segundo, entender las condiciones del error y comprobar una hipótesis puede justificar más investigación.
Qué significa el contexto de un millón de tokens
En la grabación mostré entradas de Opus 4.8 con opciones de contexto distintas. Eso no implica dos modelos con dos inteligencias independientes. La ventana de contexto se refiere a la cantidad de información que puede considerar una ejecución dentro de la configuración disponible.

Una ventana más grande puede ayudar cuando hay muchos archivos o documentos pertinentes. No convierte todo lo que cabe en material útil. Un historial lleno de intentos descartados puede dificultar encontrar el requisito que realmente importa.
Para una investigación extensa, mantendría un resumen de decisiones y referencias a los archivos originales. Para un cambio de software, identificaría los módulos relacionados antes de cargar el repositorio completo. Si necesitas continuidad entre sesiones, consulta la guía de memoria con Obsidian.
Tampoco usaría un porcentaje fijo como frontera universal a partir de la cual todos los modelos fallan. La calidad depende del tipo de información, de cómo se distribuye y de la tarea. El indicador práctico es si el agente conserva los requisitos y entrega resultados comprobables.
Cómo decidir el esfuerzo sin poner todo al máximo
En el análisis del video, el nivel de esfuerzo aparece como una variable que puedes ajustar. La decisión útil parte de la dificultad de la tarea y del coste de equivocarse.
Una corrección de redacción con instrucciones claras permite una revisión breve. Un problema que atraviesa varios servicios necesita localizar dependencias, proponer causas y probarlas. Subir el esfuerzo puede ayudar, pero no reemplaza datos que faltan o un objetivo mal definido.
Esta sería una instrucción editorial para comparar dos configuraciones:
Resuelve este mismo caso con los mismos archivos y requisitos. Guarda el resultado, las comprobaciones realizadas, el tiempo y el consumo que puedas observar. Explica cualquier parte que no pudiste validar. No cambies el alcance para mejorar la comparación.
Después revisa el entregable sin basarte solo en lo convincente que suena la explicación. Si una configuración tarda más pero no mejora el resultado de forma relevante, tienes un dato para elegir. Si la más rápida omite una condición importante, también.
Modo rápido: menor latencia no equivale a menor coste
Conviene corregir una posible confusión del anuncio: una reducción de precio respecto de un modo rápido anterior no significa que activar ese modo sea más barato que la ejecución estándar.
La documentación de fast mode de Claude Code lo describe como una opción con coste adicional para reducir latencia, conservando los mismos pesos del modelo compatible. Se diferencia de bajar el esfuerzo, que modifica cuánto razonamiento dedica la ejecución. Consulta compatibilidad y condiciones vigentes antes de usarlo de forma continua.
No lo elegiría solo porque una tarea sea larga. Si la mayor parte del tiempo depende de esperar una API o una renderización, acelerar la respuesta del modelo puede tener un efecto limitado. Primero identifica qué parte del proceso está tardando.
Flujos dinámicos: una capacidad del entorno de Claude Code
El video también aborda la coordinación de agentes. Los flujos dinámicos documentados por Anthropic organizan subtareas y verificaciones para trabajos amplios. Esa coordinación pertenece al entorno que opera el modelo; no significa que cada llamada a Opus cree automáticamente un equipo de cien agentes.
La documentación advierte que este trabajo puede consumir bastante más que una sesión habitual. La decisión práctica es empezar con un alcance concreto, observar el consumo y comprobar si la división produce resultados útiles.
Para profundizar en esa separación, revisa qué es un harness y cómo organizarlo. Un buen encargo para un revisor define qué debe comprobar y qué evidencia devolver. “Mira si está bien” deja demasiadas decisiones abiertas.
Una prueba propia vale más que una preferencia abstracta
Elige tres tareas habituales: una corta, una ambigua y una que requiera herramientas. Mantén las entradas y evalúa cada salida con criterios escritos antes de ejecutar. Anota errores, correcciones necesarias y resultados que sí pudiste verificar.
No hace falta inventar un ranking general. Basta con saber qué configuración funciona mejor para tu trabajo y dónde necesita supervisión. La guía de límites, uso y concurrencia ayuda a interpretar interrupciones sin confundir contexto con cuota de uso.
Puedes ver el análisis original en YouTube, suscribirte al canal y seguir construyendo con la comunidad de Imperio Agéntico.
Preguntas frecuentes
¿Opus 4.8 con contexto de 1M es otro modelo distinto?
La opción de contexto describe la capacidad de información disponible para la ejecución, no una inteligencia independiente por sí sola. En el video aparece el selector histórico de mayo; las opciones concretas dependen de la versión y configuración de Claude Code.
¿Conviene usar siempre el esfuerzo máximo en Claude Code?
No necesariamente. Evalúa si el razonamiento adicional mejora el resultado de tu tarea y cuánto tiempo y uso consume. Una tarea clara y pequeña puede requerir menos esfuerzo que una investigación ambigua con varias herramientas.
¿El modo rápido de Claude es más barato?
El modo rápido de Claude Code tiene un coste adicional frente al modo estándar. Reducir latencia y bajar el esfuerzo son decisiones distintas. Una comparación de precio con una versión anterior del modo rápido no significa que sea la opción más económica.
¿Los benchmarks del video son pruebas propias de Benjamín Cordero?
No. En esta grabación Benjamín Cordero analiza el anuncio del proveedor, sus evaluaciones y la interfaz de Claude Code. La guía distingue ese análisis de una prueba propia y propone cómo evaluar configuraciones con tareas de tu proyecto.
¿Llamar a Opus crea automáticamente cientos de agentes?
No. La coordinación de subtareas depende del entorno y del flujo que se activa, como los flujos dinámicos de Claude Code. No es una consecuencia automática de cada llamada al modelo y puede aumentar considerablemente el consumo.
¿Qué comparación sirve para elegir un modelo?
Usa las mismas entradas, alcance y criterios de aceptación en tareas que realmente realizas. Conserva resultados, errores, comprobaciones y consumo observable. Revisa el entorno de cada benchmark antes de comparar cifras publicadas con configuraciones diferentes.
