Wonk

Fable 5 vs. GPT-5.6 Sol: por qué el benchmark no cuenta toda la historia

Por el equipo de Wonk ·

Comparamos Claude Fable 5 y GPT-5.6 Sol en rendimiento, costos y autonomía, separando los datos técnicos del discurso comercial.

Imagen de portada: Fable 5 vs. GPT-5.6 Sol: por qué el benchmark no cuenta toda la historia

Anthropic y OpenAI presentan sus nuevos modelos como sistemas capaces de trabajar durante horas o días. Pero cuando se revisan los resultados, el precio y las condiciones de evaluación, la comparación deja de tener un ganador evidente.

1. ¿Todos los nuevos modelos son realmente “los mejores”?

¿Te ha pasado que lees el anuncio de un nuevo modelo de inteligencia artificial y, al terminar, parece ser el más inteligente, rápido, autónomo, seguro y económico de la historia?

Es normal terminar confundido. El problema no necesariamente es que las cifras sean falsas, sino que cada proveedor puede elegir el examen, las herramientas disponibles, el tiempo permitido y el nivel de razonamiento utilizado. Dos modelos pueden enfrentarse al mismo benchmark y obtener resultados diferentes dependiendo de cómo se ejecutó la prueba.

Por eso, la pregunta útil no es simplemente “¿cuál modelo gana?”, sino “¿cuál resuelve mejor el trabajo que realmente necesito hacer?”.

2. Detrás de cámaras: qué están comparando Anthropic y OpenAI

Un benchmark puede entenderse como una pista de obstáculos para modelos de IA. Sin embargo, no basta con saber quién llegó primero: también importa si uno corrió solo, si otro recibió herramientas, cuántos intentos tuvo y cuánto dinero consumió durante el recorrido.

Anthropic presentó Claude Fable 5 el 9 de junio de 2026 como su modelo más avanzado disponible públicamente. Después de una suspensión temporal, la compañía restauró su disponibilidad global el 1 de julio. OpenAI, por su parte, lanzó públicamente la familia GPT-5.6 —Sol, Terra y Luna— el 9 de julio, después de una etapa de acceso limitado.

Fable no es exactamente lo mismo que Mythos

Claude Fable 5 y Claude Mythos 5 utilizan el mismo modelo base. La diferencia está en la capa de seguridad: Fable incorpora clasificadores que revisan solicitudes relacionadas con áreas de mayor riesgo. Cuando estos sistemas se activan, la solicitud puede ser redirigida y procesada por Claude Opus 4.8 en lugar de Fable. Anthropic indicó que, en sus datos iniciales, más del 95 % de las sesiones no activaban este cambio.

GPT-5.6 Sol adopta otra lógica. Permite seleccionar diferentes niveles de razonamiento y agrega max, que dedica más tiempo a explorar y verificar una respuesta. Su modalidad ultra no es solamente “pensar durante más tiempo”: coordina cuatro agentes paralelos por defecto y después combina sus resultados. Por esa razón, una prueba con Sol Ultra no debería compararse directamente con una ejecución de un solo agente sin explicar esa diferencia.

Comparación de especificaciones oficiales

Característica Claude Fable 5 GPT-5.6 Sol
Contexto máximo 1 millón de tokens 1,05 millones de tokens
Salida máxima 128.000 tokens 128.000 tokens
Corte de conocimiento Enero de 2026 16 de febrero de 2026
Precio de entrada USD 10 por millón USD 5 por millón
Precio de salida USD 50 por millón USD 30 por millón
Razonamiento Adaptativo, siempre activo Configurable, incluyendo max
Modalidad multiagente Mediante entornos de agentes Ultra, con agentes paralelos

Ambos modelos tienen ventanas de contexto cercanas al millón de tokens, suficientes para recibir grandes repositorios, colecciones documentales o historiales extensos. Sin embargo, tener espacio para un millón de tokens no demuestra automáticamente que el modelo utilizará cada fragmento con la misma precisión. Esa capacidad debe probarse con documentos y procesos reales.

3. El hallazgo: no existe un ganador universal

La comparación revela algo menos llamativo que un titular de lanzamiento, pero mucho más útil: Fable 5 y GPT-5.6 Sol ganan en tipos de trabajo diferentes.

En la tabla publicada por OpenAI, Claude Fable 5 obtuvo 80 % en SWE-Bench Pro, frente a 64,6 % de GPT-5.6 Sol. Esta prueba evalúa la capacidad de resolver problemas complejos dentro de repositorios de software reales.

Pero el resultado cambia en otros escenarios. Sol obtuvo 72,7 % en DeepSWE, frente a 69,7 % de Fable, y alcanzó 88,8 % en Terminal-Bench 2.1, frente a 83,1 % de Fable. Estos benchmarks dan mayor importancia al uso de terminal, herramientas y secuencias prolongadas de acciones.

Fable parece más fuerte en algunas tareas profundas; Sol, en ejecución y eficiencia

La misma división aparece en el trabajo profesional. En la evaluación Agents’ Last Exam publicada por OpenAI, Sol registró 52,7 %, mientras Fable alcanzó 40,5 %. Sin embargo, Fable quedó ligeramente por encima en GDPval-AA v2, con 1.759,6 puntos Elo, frente a 1.747,8 de Sol. También superó por un punto a Sol en el Artificial Analysis Intelligence Index: 59,9 frente a 58,9.

La medición independiente de Artificial Analysis mantiene prácticamente el mismo empate: aproximadamente 60 puntos para Fable y 59 para Sol. La diferencia aparece en el costo combinado estimado por esa plataforma: USD 7,70 por millón de tokens para Fable, frente a USD 4,35 para Sol, utilizando una mezcla de caché, entrada y salida definida por Artificial Analysis.

Esto no significa que Sol sea “44 % mejor”. Significa que, en esa medición concreta, obtiene un nivel de desempeño muy cercano con un costo combinado considerablemente menor.

Fable conserva ventajas en determinadas tareas de ingeniería y conocimiento profundo, mientras Sol desplaza la competencia hacia el rendimiento obtenido por cada dólar, cada token y cada minuto de ejecución.

4. La alerta: el modelo anunciado no siempre es el modelo evaluado

Aquí aparece el punto que más fácilmente se pierde entre las gráficas promocionales.

La tabla principal del lanzamiento de Anthropic no presenta una columna exclusivamente llamada “Fable 5”. La etiqueta utilizada es “Claude Mythos 5 / Fable 5”, y la nota metodológica explica que se muestra el resultado más alto de los dos modelos. Anthropic señala que normalmente la diferencia es de entre uno y tres puntos, pero reconoce variaciones mayores en evaluaciones relacionadas con biología y ciberseguridad debido a los clasificadores y cambios de modelo de Fable.

Por lo tanto, leer esa columna como si todos los resultados correspondieran exclusivamente al producto público Fable 5 sería incorrecto.

También existe una diferencia llamativa en Terminal-Bench 2.1. Anthropic publicó un resultado de 88 % para Mythos 5/Fable 5, mientras que OpenAI reportó posteriormente 83,1 % para Fable 5 y 88,8 % para Sol. Esto no demuestra por sí solo que alguna empresa esté manipulando la información. La explicación más prudente es que cambiaron el entorno, el nivel de esfuerzo, el agente, la versión del benchmark o alguna otra condición de ejecución.

El costo también debe medirse por tarea terminada

Las tarifas oficiales dejan una ventaja directa para OpenAI. Procesar un millón de tokens de entrada y producir un millón de salida costaría, con las tarifas base:

  • GPT-5.6 Sol: USD 35.

  • Claude Fable 5: USD 60.

Eso convierte a Sol en aproximadamente un 42 % más económico en ese ejemplo. Sin embargo, la tarifa por token no cuenta toda la historia. Un modelo barato puede terminar costando más cuando necesita repetir acciones, corregir errores o recibir más instrucciones humanas.

La métrica correcta es el costo total de obtener un resultado aprobado, no el costo aislado por token.

El segmento crítico: empresas con datos sensibles

Fable 5 exige una retención de datos de 30 días para supervisión de seguridad y no admite la modalidad de retención cero (Zero Data Retention). Además, una integración debe estar preparada para recibir respuestas marcadas como rechazo o para que ciertas solicitudes sean procesadas por un modelo de respaldo.

OpenAI afirma que Programmatic Tool Calling dentro de Responses API puede utilizarse en configuraciones compatibles con Zero Data Retention. Esto no significa que cualquier utilización de GPT-5.6 sea automáticamente de retención cero: la organización debe verificar la configuración concreta, sus herramientas y su contrato.

Para una empresa regulada, estas condiciones pueden ser más importantes que una diferencia de cinco puntos en un benchmark.

5. Conclusión: elegir un modelo es diseñar una evaluación

Claude Fable 5 parece especialmente competitivo cuando el trabajo exige comprender repositorios grandes, mantener coherencia durante procesos prolongados y resolver tareas complejas con poca supervisión. Su costo es mayor y su sistema de seguridad puede cambiar el comportamiento de ciertas solicitudes.

GPT-5.6 Sol aparece como una alternativa más eficiente para agentes que utilizan terminales, herramientas, documentos y flujos paralelos. Sus resultados públicos muestran una relación costo-rendimiento fuerte, aunque sus modalidades max y ultra pueden consumir más razonamiento y deben evaluarse por separado.

La decisión no debería tomarse a partir de una sola tabla. Una prueba empresarial razonable puede utilizar entre 20 y 50 tareas reales y medir cinco variables: porcentaje de trabajos aprobados, correcciones humanas necesarias, tiempo total, costo completo y frecuencia de rechazos o cambios de modelo.

Antes de aceptar que un proveedor alcanzó el “estado del arte”, conviene preguntar:

  • ¿Quién ejecutó la evaluación?

  • ¿Qué herramientas recibió el modelo?

  • ¿Qué nivel de razonamiento utilizó?

  • ¿Hubo agentes paralelos o modelos de respaldo?

  • ¿Cuánto costó alcanzar el resultado?

La carrera entre Fable 5 y GPT-5.6 Sol no demuestra que exista un campeón definitivo. Demuestra que la frontera de la inteligencia artificial ya no se mide solamente por responder bien una pregunta, sino por completar procesos extensos de forma correcta, verificable y económicamente sostenible.

Temas: Inteligencia Artificial, Benchmarks, Claude Fable 5, GPT-5.6 Sol, LLMs, Modelos de Lenguaje, Wonk