bencorde.IMPERIO
AGÉNTICO

Claude Code

GPT 5.6 Sol frente a Fable 5: diseño, funcionalidad y coste por tarea

Fable destacó en la landing y el juego; Sol en el rebranding de una app de dictado. El registro de consumo añadió una diferencia que las tarifas no anticipaban.

Por Benjamín Cordero · Publicado:
Video original: · 8 min de lectura
Revisión editorial:

Una comparación útil de modelos termina probando lo que construyeron y sumando el consumo del trabajo completo. En este video repetí tres encargos con GPT 5.6 Sol y Fable 5: una landing, un juego de navegador y una adaptación de Handy, una aplicación de dictado.

En el video del 10 de julio de 2026 preferí Fable en la landing y el juego, y Sol en la adaptación de la aplicación. El registro de consumo añadió otra diferencia: Sol utilizó más tokens y terminó con un equivalente API superior en el conjunto de esas pruebas.

Video completo y las tres misiones

Ver la comparación completa en YouTube. La landing empieza aproximadamente en el minuto 3, el juego en el minuto 8 y la aplicación de dictado desde el minuto 17.

Cómo se hizo la comparación

Los resultados se muestran en Cursor, con los mismos encargos para cada modelo y un esfuerzo alto. El objetivo era reducir las diferencias del entorno y observar cómo resolvían tareas concretas.

Compartir herramienta y prompt ayuda, pero no aísla perfectamente el modelo. La configuración del proveedor, las herramientas disponibles, el contexto y las decisiones que toma cada agente siguen influyendo. Tampoco se trata de una evaluación con suficientes repeticiones para establecer un ranking general.

Durante la grabación utilizo tres preguntas: ¿funciona?, ¿me convence el resultado? y ¿cuánto consumió? Las preferencias de diseño son mías; los comportamientos mostrados en pantalla permiten revisar cómo llegué a ellas.

La guía de harness engineering explica por qué el entorno importa. No conviene atribuir automáticamente toda diferencia a la inteligencia del modelo.

Primera misión: una landing para el canal

El encargo consistió en investigar mi presencia pública y construir una página con libertad de dirección visual, estructura y texto. La web de origen era material para esta prueba, no el hub que estás leyendo ahora.

Sol mantuvo bastante continuidad con el branding de referencia. Fable desarrolló una estructura que me pareció más cercana a una página de newsletter. Revisé ambas versiones con anchos distintos, incluido formato móvil y tablet.

En el resultado de Sol, uno de los enlaces que esperaba que abriera YouTube no llevaba al video. En Fable me gustaron la navegación y ciertos detalles de interacción. Mi preferencia final fue Fable, aunque ambos produjeron propuestas aprovechables.

Esta prueba deja un criterio concreto: revisar botones y destinos importa tanto como la composición visual. Si una página pretende llevar gente a YouTube, el enlace debe abrir el video correcto.

También hay que revisar hechos, fotos y permisos de uso del material encontrado. La demostración muestra interfaces y navegación; no confirma por sí sola una integración de newsletter operativa o una mejora de conversión.

Segunda misión: un juego de navegador

El encargo fue un juego en dos dimensiones con humor sobre gurús de internet y ofertas exageradas. Los dos modelos construyeron resultados jugables, y durante la grabación probé movimiento, obstáculos, progresión y pantallas de derrota.

Juego de navegador creado con Fable 5 durante la comparación
La evaluación incluye jugar y recorrer niveles, además de observar los gráficos.

En la versión de Sol encontré detalles creativos que me gustaron. En Fable preferí la dirección visual del personaje, algunas interacciones y cómo se presentaba la progresión. La diferencia fue más ajustada de lo que sugiere elegir un ganador.

Un juego permite comprobar cosas que una captura oculta: si las teclas responden, si se puede perder y volver a empezar, si la salida se desbloquea y si los obstáculos se comportan de forma consistente.

Para repetir esta prueba, define esos criterios antes de jugar. Así puedes distinguir una preferencia estética de un fallo funcional. También puedes pedir una segunda iteración para corregir dificultad o controles sin rehacer el proyecto completo.

Tercera misión: adaptar Handy con una identidad propia

Handy es una aplicación de dictado que utilicé como base para una adaptación. El encargo incluía un nombre, identidad visual, interfaz y landing orientados a personas que usan la voz para trabajar con herramientas de desarrollo.

La licencia MIT de Handy permite modificar y distribuir el software, conservando los avisos de copyright y permiso correspondientes. Su repositorio distingue esa licencia del nombre, logo y otros recursos de marca: una distribución no oficial debe usar identidad propia y no sugerir una afiliación inexistente.

No basta con cambiar el nombre y borrar los créditos. Conserva las atribuciones del software y revisa también las condiciones de los componentes o modelos que distribuyas con tu versión.

Háblale, la propuesta de Sol

Landing de Háblale preparada con GPT 5.6 Sol
Una identidad y una página propias para la adaptación de Handy utilizada en la prueba.

Sol entregó una propuesta llamada Háblale. Me gustaron tanto la página como el trabajo de presentación de la aplicación. Abrí el flujo inicial, concedí los permisos necesarios para la prueba y configuré un atajo de dictado.

La adaptación conservaba la base de reconocimiento de voz. El modelo de programación no estaba creando desde cero un sistema de transcripción: estaba modificando el producto alrededor de una tecnología que ya existía.

Aplicación Háblale durante la configuración del dictado
El recorrido prueba permisos, selección de modelo, micrófono y atajo, además del cambio visual.

Habla, la propuesta de Fable

La versión de Fable se llamó Habla. También permitió descargar y abrir la aplicación, configurar permisos y probar dictado. En el video utilicé el mismo modelo de transcripción para comparar la adaptación de la aplicación.

Mi preferencia en esta misión fue Sol, por el trabajo de identidad y acabado de la landing y de la interfaz. Ambas versiones conservaron funciones de la base, pero la propuesta de Sol me pareció más completa como presentación de un producto.

Esto no equivale a validar una aplicación lista para distribuir a cualquier cliente. Una entrega de escritorio todavía necesita revisar instalación en otra máquina, actualizaciones, permisos, errores y compatibilidad. El caso demuestra un proceso de adaptación y una prueba local.

El consumo cambió la lectura de las tarifas

Registro histórico de consumo equivalente API de los modelos comparados
El panel de la grabación compara estimaciones equivalentes de API a partir de las ejecuciones, no pagos adicionales confirmados.

El resumen mostrado en pantalla indicaba aproximadamente 106,31 dólares para Sol y 81,91 para Fable, como equivalente API de esas tareas. El registro también mostraba más tokens acumulados en Sol.

Esos tokens son consumo agregado de llamadas, no la cantidad de información única que cabe en una conversación. Lecturas repetidas, salidas, caché, herramientas y reintentos pueden alterar mucho el total.

La comparación adicional con Grok quedó fuera del concurso principal. Sus resultados fueron más económicos en ese registro, pero varias propuestas me convencieron menos. Un coste bajo interesa cuando el resultado cumple el encargo.

Las tarifas del video son históricas. OpenAI ha actualizado posteriormente el precio de Sol; utiliza su ficha oficial del modelo para consultar las condiciones actuales y la tabla de Anthropic para la otra parte de la comparación.

La lección no es que Sol siempre cueste más. Es que una tarifa inferior puede terminar en un gasto mayor si el recorrido utiliza más recursos. Eso también aparece, con otros modelos y tareas, en la comparativa de GLM 5.2 y Opus.

Una tabla para repetir la prueba en tu trabajo

Qué registrar Para qué sirve
Encargo y materiales iniciales Mantener una base comparable
Modelo, versión y configuración Saber qué ejecución estás evaluando
Criterios de aceptación Distinguir terminado de simplemente generado
Fallos y correcciones necesarias Incluir el trabajo posterior a la primera respuesta
Consumo y tarifa fechada Calcular el coste completo sin mezclar precios históricos
Preferencia visual o editorial Separar criterio personal de funcionamiento

Usa una tarea frecuente y otra que normalmente te cuesta resolver. Repite cuando una diferencia vaya a decidir cómo construyes tu producto: una sola ejecución puede salir especialmente bien o mal.

Para consultas sobre una base de conocimiento, la guía de Sonnet 5 y Opus en Community OS presenta otro conjunto de criterios: cobertura, enlaces y recomendaciones. Para mantener un registro de actividad, puedes revisar el Motor Agéntico.

Ve los tres proyectos funcionando en YouTube antes de decidir qué detalles valorarías tú. En Imperio Agéntico compartimos recursos y experiencias para llevar estas pruebas a proyectos propios.

Preguntas frecuentes

¿Qué proyectos se compararon?

Una landing para el canal, un juego de navegador y una adaptación de Handy con identidad propia. Se revisaron funcionamiento, diseño y consumo de las ejecuciones.

¿Las pruebas se muestran en Cursor?

Sí. Los recorridos y resultados se muestran en Cursor. Compartir herramienta y encargo ayuda a comparar, aunque no elimina todas las diferencias de configuración o ejecución.

¿Qué modelo preferí en cada tarea?

En esas ejecuciones preferí Fable 5 para la landing y el juego, y GPT 5.6 Sol para la adaptación de Handy y su landing. Son preferencias sobre los resultados mostrados, no un ranking universal.

¿Háblale se construyó completamente desde cero?

No. Es la adaptación de Handy utilizada en la prueba. El trabajo incluye identidad, interfaz y presentación del producto, conservando la base de dictado existente.

¿Puedo quitar los créditos de Handy al cambiar su nombre?

No. La licencia MIT exige conservar los avisos correspondientes de copyright y permiso. Además, la marca y otros recursos de identidad tienen condiciones distintas a la licencia del código.

¿El panel muestra facturas pagadas?

Muestra un cálculo de consumo equivalente API para las ejecuciones de la grabación. No debe confundirse automáticamente con pagos adicionales ni con las tarifas actuales.

¿Una tarifa por token menor garantiza una tarea más barata?

No. El número de llamadas, las lecturas repetidas, la salida, la caché y las correcciones influyen en el consumo total. Compara el coste de llegar a un resultado aceptado.