Artículo
Fable 5 vs Opus 4.8: ganó el modelo más barato
La misma tarea. Dos modelos. Fable 5 contra Opus 4.8.
¿Quién ganó? Opus. Resolvió la tarea con una sola ronda de control por 721.000 tokens, mientras que Fable necesitó nueve rondas y quemó 2,78 millones de tokens.
Sobre el papel, Fable 5 es el mejor modelo. ¿Por qué perdió entonces?
"It's not the plane, it's the pilot." No es el avión, es el piloto.
Ganó el mejor prompt. Y lo sé porque lo medí.
Fable 5 dio vueltas en círculo y quemó casi 4 veces más tokens.
Nueve rondas
Encargué una auditoría detallada de cómo se procesan los datos en un proyecto. Era un documento lleno de datos duros: cuántas veces por hora se ejecuta algo, cuándo se ejecuta, en qué línea de código está. Más de cien afirmaciones así.
Y aquí está el truco. Ninguno de esos números se puede adivinar. O se abre el archivo correcto y se lee lo que hay de verdad, o no se sabe. Un dato inventado parece sobre el papel tan convincente como uno verdadero. La diferencia solo se ve cuando alguien lo comprueba de verdad.
Una versión del informe la preparó Fable 5. Para cazar los errores, le puse controladores. No personas, más IA. Tenían una sola tarea: encontrar un error en el informe. Cuando encontraban uno, se corregía y los controladores volvían a trabajar. Y otra vez. La regla era: repite hasta que una ronda entera no encuentre ni un solo error.
Hicieron falta nueve rondas hasta que entregaron un resultado sin errores. Treinta y seis agentes en total.
¿Por qué nueve?
Si tengo el mejor modelo del mercado, ¿por qué hicieron falta nueve rondas?
La respuesta tiene tres partes.
Primera: la mayoría de esas rondas no corregía errores de la auditoría. Corregía errores de los controladores. La IA que debía encontrar fallos cometió ella misma más de los que encontró. Dos veces informó de que cierto proceso se ejecuta cada cinco minutos. En realidad corría mucho menos. Dos veces calculó mal el tamaño de los datos. Una vez informó de un error en un archivo que buscaba en el lugar equivocado.
Cuando la regla es "repite hasta que esté impecable" y quienes buscan se equivocan a menudo, las últimas rondas no se dedican a corregir. Se dedican a demostrar que la alarma era falsa.
Fable 5 no fue disciplinado, tomó atajos
Segunda: esta tarea no iba de inteligencia. Iba de disciplina al comprobar. Las respuestas no estaban en la cabeza del modelo, estaban en los archivos. Y ni el modelo más listo te dice qué hay en un archivo hasta que lo abre y lo lee. El modelo no fue disciplinado.
Tercera. Por la habilidad al escribir el prompt.
Comprueba antes de escribir
El núcleo es una frase. La comprobación de los datos va en la entrada, no en la salida.
Fable 5 lo hacía así: un subagente encuentra un dato, Fable lo toma y lo escribe en el documento. La verificación llegaba solo al final, sobre el texto ya terminado. Debía ser al revés. Un dato se verifica en el archivo antes de que llegue siquiera al documento.
Faltaba también una tabla sencilla: cada afirmación, su fuente y quién la verificó. Sin ella, los controladores en cada ronda miraban al azar partes distintas del documento, así que nunca se revisaba todo de una vez. Las últimas afirmaciones sin verificar eran las que más tardaban. Con una tabla, una sola pasada honesta lo cubriría todo y se acabó. Sin ella, era una lotería.
Es una regla que falta sobre dónde y cuándo se comprueba. Y esa regla la puede fijar cualquiera cuando escribe el prompt.
Cuánto costaron de verdad esas nueve rondas
Tengo cifras exactas de cada ronda.
Únete a la Biblioteca
Acceso completo a mis pensamientos, historias personales, hallazgos y lo que me cuentan las personas con las que me encuentro.
Únete a la Biblioteca · €29,99 al añoResumen
Preguntas frecuentes sobre el tema del artículo
¿Qué modelo de IA es mejor, Fable 5 u Opus 4.8?
¿Por qué una IA comete tantos errores al verificar datos?
¿Cómo escribir un mejor prompt para una auditoría o un control con IA?
¿Importa más el modelo o el prompt con la IA?
¿Cuántos tokens consume una auditoría con IA?
¿Qué significa comprobar los datos en la entrada y no en la salida?
Más artículos
Tengo a Heidegger y mi cuaderno al lado. Me pregunto hacia dónde se dirige todo esto, hacia dónde nos lleva la inteligencia artificial.
Setenta por ciento. Ahí empieza el primer resultado de la IA, incluso cuando le das todo el contexto de la empresa y los mejores ejemplos del pasado. Hablamos del tipo de resultado que no se puede definir de forma programática. Es más complejo. A menudo se trata de trabajo creativo. Con un tipo de resultado repetido llegué al ochenta por ciento en una semana. Cada punto porcentual adicional es más difícil que el anterior.
Durante mucho tiempo tratamos internet como el camino principal. El lugar donde ocurren el trabajo y las relaciones. Pero la mayoría de lo que vemos en él hoy ya es, o pronto será, generado por IA: texto, imágenes, perfiles y comentarios. Internet se está convirtiendo en un juego online lleno de bots, donde no puedes estar seguro de que al otro lado haya una persona. Así que me pregunto: ¿fue el mundo online el camino principal, o solo un desvío temporal del que parte de la gente regresará, de vuelta al offline?
Hace unos días entrevisté a un sénior del marketing. Un hombre con experiencia, años de práctica. Le pregunté por la IA. Me dijo que apenas la usa. Tuvo una mala experiencia con un resultado y decidió que era demasiado sénior para que le aportara algo cuando no es perfecta. Conozco también la otra cara: profesionales que automatizan todo lo que se puede automatizar.
Europa no tiene capacidad para hacer frente a una guerra de drones masiva y a gran escala como la que vemos en Ucrania. La debilitan tres dependencias: China suministra el material físico de los sistemas de defensa, Estados Unidos aporta las capacidades que Europa no tiene, y veintisiete Estados no logran ponerse de acuerdo sobre con qué rapidez, ni quién paga. Existen planes de rearme, pero se ejecutan con lentitud.
La IA crea el gráfico, el newsletter y la página de producto más rápido que una persona. A quien antes lo hacía le queda una sola cosa: el criterio, saber si el resultado es bueno. Pero la mayoría tiene peor criterio que la IA. Y quien no sabe juzgar la calidad tampoco sabe delegar. ¿Cómo saber si el tuyo es el criterio en el que una empresa se apoya, o el que puede reemplazar?
En abril, en la primera parte de esta serie, escribí sobre un sistema predictivo de IA que empecé a desarrollar en mi propio ordenador. Entonces el software tenía unas pocas horas y el registro de predicciones estaba vacío. Desde entonces, los registros del sistema mostraron una cosa: el sistema todavía no entiende el mercado que se le pide predecir. Sabe encontrar el contexto macro, el valor contable de las empresas, las ganancias. Pero no sabe juntar esas cosas en algo que le ayude a entender el precio.
Praga, 13 de mayo de 2026. De camino al trabajo empecé a pensar en algo que se me quedó dentro durante días. Si en los próximos diez años desaparece la mayor parte del trabajo rutinario delante de un ordenador, y con ella desaparece buena parte del trabajo manual repetitivo, ¿qué pasa con el flujo del dinero? ¿Quién paga a quién y por qué? ¿Qué capas económicas existirán, qué tamaño tendrán y qué relaciones se establecerán entre ellas? Este es el mapa de seis capas que esbocé como respuesta.
Estoy construyendo un sistema de IA para predecir el S&P 500. Corre en mi propia máquina, usa datos públicos gratuitos (yfinance, FRED, el dataset de Shiller) y evalúa cada pronóstico contra la realidad. Esta serie documenta la construcción en sí: las decisiones, la metodología, los errores. Lo que finalmente comparta del sistema en funcionamiento es una pregunta separada, y honesta.
Cuatro días en Cataluña. Sin ordenador, sin IA, casi sin redes sociales. Me compré este cuaderno para anotar lo que pensaría y lo que encontraría y aprendería durante el viaje.
