bencorde.IMPERIO
AGÉNTICO

Agentes de IA

Claude Sonnet 5 frente a Opus 4.8: coste y calidad en un RAG real

Tres preguntas sobre el archivo de la comunidad permiten comparar rapidez, cobertura y consumo. Sonnet 5 encontró más resultados en una de las pruebas.

Por Benjamín Cordero · Publicado:
Video original: · 7 min de lectura
Revisión editorial:

Para elegir un modelo de un buscador con IA, compara la respuesta completa: qué encuentra, qué deja fuera, cómo cita y cuánto consume. Una tarifa más baja interesa cuando el resultado conserva la calidad que necesita el usuario.

En el video del 30 de junio de 2026 comparé Sonnet 5 y Opus 4.8 dentro de Community OS, el buscador del conocimiento de Imperio Agéntico. Hice tres preguntas sobre publicaciones y recursos reales de la comunidad y abrí enlaces para comprobar los resultados.

Video completo y prueba en Community OS

Ver el análisis y la demostración en YouTube. La prueba con el buscador comienza aproximadamente en el minuto 17 y la revisión de consumo aparece desde el minuto 23.

Qué lugar ocupa Sonnet 5

Sonnet 5 permite plantear una combinación de coste y capacidad diferente a Opus 4.8. En esta guía interesa su uso en un producto que busca información y redacta una respuesta, porque ahí es donde se hizo la prueba propia.

El anuncio oficial de Anthropic describe mejoras frente a Sonnet 4.6 en herramientas, razonamiento, programación y trabajo con conocimiento. Los resultados publicados por el fabricante orientan, pero no reemplazan una evaluación con tus datos.

Sonnet 5 también sirve para programar. La interpretación de la grabación, centrada en trabajo cotidiano, no debe leerse como una limitación que lo excluya del desarrollo de software.

Selector de modelos mostrado durante el análisis de Sonnet 5
La elección de modelo es una parte de la configuración. El esfuerzo, las herramientas y la recuperación de información también influyen.

El sistema de prueba: recuperar información antes de responder

Community OS reúne información de la comunidad para consultar publicaciones y localizar recursos. El buscador recupera material relevante y el modelo utiliza ese contexto para construir la respuesta. Es el patrón conocido como RAG, generación aumentada por recuperación.

En un sistema así, un resultado incompleto puede venir del modelo, del índice o de cómo se realizó la búsqueda. Conviene registrar qué documentos recibió cada ejecución antes de concluir que una diferencia depende exclusivamente del modelo.

En la grabación utilicé el mismo producto y repetí las preguntas con los dos modelos. No es un benchmark controlado con muchas repeticiones. Sí permite observar resultados reales y detectar dónde vale la pena investigar más.

El tamaño exacto del archivo no es la lección principal. Lo relevante es si las fuentes correctas están disponibles, si tienen fecha y si el enlace permite comprobar cada respuesta.

Primera pregunta: encontrar una publicación concreta

El primer encargo describe un caso de un miembro que había puesto en marcha y vendido un agente de WhatsApp. Los dos modelos encontraron la publicación buscada y los enlaces abrieron el contenido correspondiente.

Opus respondió antes en esa ejecución. Eso contradice una simplificación frecuente: un modelo más económico no tiene por qué ser siempre el más rápido en un producto real.

Para repetir este tipo de prueba, prepara una pregunta cuya respuesta ya conozcas y guarda el enlace esperado. Evalúa si el sistema encuentra esa fuente y si la respuesta la representa correctamente. Una respuesta extensa con el enlace equivocado no supera la prueba.

Respuestas del buscador Community OS con los dos modelos
La comparación se realiza dentro del mismo producto, con preguntas sobre su archivo de contenido.

Segunda pregunta: reunir publicaciones de un periodo

Después pedí publicaciones de miembros que habían vendido algo en los últimos siete días. Opus devolvió tres y Sonnet nueve. Durante la revisión abrí enlaces y preferí la cobertura que consiguió Sonnet en esa ejecución.

Ese resultado no demuestra que nueve sea el total completo del periodo. Para asegurar exhaustividad necesitaríamos una lista de referencia, una definición de qué cuenta como venta, fechas normalizadas y una revisión de duplicados.

Es una diferencia importante entre encontrar una respuesta y enumerar todas las respuestas. La primera tarea puede resolverse recuperando un buen documento. La segunda necesita comprobar qué parte del conjunto quedó fuera.

Si tu producto tiene filtros por fecha, úsalos de forma explícita. “Últimos siete días” debe referirse a un intervalo definido y a una zona horaria, no a una impresión del modelo sobre qué parece reciente.

Tercera pregunta: recomendar una ruta de aprendizaje

La tercera consulta pidió por dónde empezar con una agencia de marketing. Ambos modelos recomendaron recursos de la comunidad y abrieron rutas relacionadas con GoHighLevel y marketing. Me gustó más cómo Sonnet organizó algunas de las referencias.

Aquí la evaluación cambia. No hay necesariamente un único enlace correcto: importa si la ruta tiene sentido para la necesidad, si los recursos existen y si la secuencia resulta útil.

Una buena respuesta explica por qué empezar por un recurso y qué hacer después. No necesita listar todo el catálogo. Puede orientar a un primer paso y utilizar un segundo enlace para ampliar cuando el usuario lo necesite.

En el blog puedes seguir esa ruta con la guía de GoHighLevel conectado a Claude Code y el framework VIBE de marketing. Los recursos internos mencionados en el video se consultan en Skool.

Qué mostró el registro de consumo

Registro de llamadas y consumo utilizado durante la prueba del buscador
Los valores corresponden a las consultas revisadas en la grabación; no representan una tarifa fija por pregunta.

En una de las consultas mostré aproximadamente nueve centavos para Opus y cuatro para Sonnet. Las otras llamadas revisadas también favorecieron a Sonnet en coste, con cantidades de tokens de entrada bastante próximas en los ejemplos comentados.

Eso apoya una conclusión acotada: Sonnet resolvió esas preguntas con un coste menor y resultados que me parecieron útiles. No permite afirmar que cualquier consulta costará la mitad ni que el cambio ya produjo un ahorro mensual determinado.

Para estimar un ahorro real hay que repetir la comparación sobre una muestra representativa del producto. Incluye consultas fáciles, búsquedas ambiguas, respuestas largas y errores que requieren reintentar. Después pondera cada tipo según su frecuencia.

Precios y tokens: la corrección respecto al video

La subida de precio anunciada inicialmente para septiembre no se aplicó. Anthropic actualizó su anuncio el 10 de agosto: Sonnet 5 mantiene 2 dólares por millón de tokens de entrada y 10 por millón de salida. Consulta el anuncio actualizado y la tabla oficial de precios para las modalidades de caché y procesamiento.

El tokenizador también afecta las comparaciones. Si un texto genera más tokens con un modelo, no basta con comparar el precio de un millón. Tampoco se puede concluir automáticamente que un aumento aproximado de tokens hace que dos modelos cuesten lo mismo: hay que hacer la cuenta con entrada, salida, caché y número de llamadas.

El coste por respuesta útil combina todas esas piezas. Puedes registrarlo en una tabla con fecha, modelo, esfuerzo, fuentes recuperadas, resultado de revisión y consumo total. La guía del Motor Agéntico explica cómo separar consumo, estimaciones y pagos reales.

Cómo llevar esta comparación a tu propio buscador

Empieza por preguntas con respuestas verificables. Después añade consultas que exijan cobertura y otras que necesiten una recomendación razonada. Así evitas evaluar todo el producto con una única pregunta fácil.

Tipo de consulta Evidencia útil
Encontrar una publicación Coincidencia con el enlace esperado
Reunir un conjunto Cobertura, fechas y ausencia de duplicados
Recomendar un recurso Pertinencia, secuencia y enlaces válidos
Responder sin información suficiente Reconocer qué falta y evitar inventar

Mantén una opción de cambiar de modelo si la tarea lo justifica. Puedes empezar con un modelo más económico para el uso habitual y escalar cuando las pruebas muestren que otro resuelve mejor una dificultad concreta.

Si todavía estás organizando las fuentes, revisa la guía de Obsidian y memoria para Claude Code. Un modelo no arregla por sí solo un archivo desactualizado o una recuperación que no encuentra el documento necesario.

Abre la comparación completa en YouTube para ver las preguntas, respuestas y enlaces revisados. Para acceder a los recursos del ecosistema, visita Imperio Agéntico en Skool.

Preguntas frecuentes

¿Qué modelos se comparan en esta guía?

La demostración del 30 de junio de 2026 compara Sonnet 5 con Opus 4.8 dentro de Community OS. Utiliza tres preguntas sobre publicaciones y recursos de Imperio Agéntico.

¿Qué es el RAG de Community OS?

Es el sistema que recupera publicaciones y recursos del archivo de Imperio Agéntico para responder consultas con contexto y enlaces. La calidad depende tanto de esa recuperación como del modelo que redacta la respuesta.

¿Sonnet 5 respondió más rápido que Opus?

No en todas las pruebas. Opus respondió antes en varios ejemplos de la grabación. Rapidez, coste y calidad deben medirse por separado.

¿Sonnet encontró más publicaciones?

En la consulta de ventas de los últimos siete días devolvió nueve resultados frente a tres de Opus. Eso mostró mejor cobertura en esa ejecución, pero no demuestra que se hubiera encontrado todo el conjunto existente.

¿El cambio a Sonnet garantiza ahorrar la mitad?

No. Las llamadas revisadas consumieron menos con Sonnet, pero una estimación del producto completo necesita una muestra representativa, reintentos, caché y todas las consultas que se ejecutan.

¿Sonnet 5 sirve para programar?

Sí. Aunque esta prueba se centra en búsqueda y trabajo con conocimiento, Sonnet 5 también contempla programación y uso de herramientas. Su utilidad debe comprobarse en la tarea concreta.

¿Cómo compruebo que las citas de un buscador son correctas?

Abre los enlaces y revisa que sostengan la respuesta. Para consultas de un periodo, comprueba fechas; para enumeraciones, revisa también duplicados y elementos que podrían faltar.