Richard Golian

Nacido en 1995. Graduado de la Universidad Carolina. Responsable de rendimiento en Mixit. Más de 10 años en el marketing basado en datos.

English Français Slovenčina

Gestionar suscripción Elegir suscripción

RSS
Newsletter
Nuevos artículos en tu correo

Artículo

Fable 5 vs Opus 4.8: ganó el modelo más barato

Opus venció a Fable 5. Decidió el prompt.
Richard Golian
Richard Golian · 59 lecturas
Hola, soy Richard. En este blog comparto pensamientos, historias personales, hallazgos y en qué estoy trabajando. Espero que este artículo te aporte algo de valor.

La misma tarea. Dos modelos. Fable 5 contra Opus 4.8.

¿Quién ganó? Opus. Resolvió la tarea con una sola ronda de control por 721.000 tokens, mientras que Fable necesitó nueve rondas y quemó 2,78 millones de tokens.

Sobre el papel, Fable 5 es el mejor modelo. ¿Por qué perdió entonces?

"It's not the plane, it's the pilot." No es el avión, es el piloto.

Ganó el mejor prompt. Y lo sé porque lo medí.

Fable 5 dio vueltas en círculo y quemó casi 4 veces más tokens.

Nueve rondas

Encargué una auditoría detallada de cómo se procesan los datos en un proyecto. Era un documento lleno de datos duros: cuántas veces por hora se ejecuta algo, cuándo se ejecuta, en qué línea de código está. Más de cien afirmaciones así.

Y aquí está el truco. Ninguno de esos números se puede adivinar. O se abre el archivo correcto y se lee lo que hay de verdad, o no se sabe. Un dato inventado parece sobre el papel tan convincente como uno verdadero. La diferencia solo se ve cuando alguien lo comprueba de verdad.

Una versión del informe la preparó Fable 5. Para cazar los errores, le puse controladores. No personas, más IA. Tenían una sola tarea: encontrar un error en el informe. Cuando encontraban uno, se corregía y los controladores volvían a trabajar. Y otra vez. La regla era: repite hasta que una ronda entera no encuentre ni un solo error.

Hicieron falta nueve rondas hasta que entregaron un resultado sin errores. Treinta y seis agentes en total.

¿Por qué nueve?

Si tengo el mejor modelo del mercado, ¿por qué hicieron falta nueve rondas?

La respuesta tiene tres partes.

Primera: la mayoría de esas rondas no corregía errores de la auditoría. Corregía errores de los controladores. La IA que debía encontrar fallos cometió ella misma más de los que encontró. Dos veces informó de que cierto proceso se ejecuta cada cinco minutos. En realidad corría mucho menos. Dos veces calculó mal el tamaño de los datos. Una vez informó de un error en un archivo que buscaba en el lugar equivocado.

Cuando la regla es "repite hasta que esté impecable" y quienes buscan se equivocan a menudo, las últimas rondas no se dedican a corregir. Se dedican a demostrar que la alarma era falsa.

Fable 5 no fue disciplinado, tomó atajos

Segunda: esta tarea no iba de inteligencia. Iba de disciplina al comprobar. Las respuestas no estaban en la cabeza del modelo, estaban en los archivos. Y ni el modelo más listo te dice qué hay en un archivo hasta que lo abre y lo lee. El modelo no fue disciplinado.

Tercera. Por la habilidad al escribir el prompt.

Comprueba antes de escribir

El núcleo es una frase. La comprobación de los datos va en la entrada, no en la salida.

Fable 5 lo hacía así: un subagente encuentra un dato, Fable lo toma y lo escribe en el documento. La verificación llegaba solo al final, sobre el texto ya terminado. Debía ser al revés. Un dato se verifica en el archivo antes de que llegue siquiera al documento.

Faltaba también una tabla sencilla: cada afirmación, su fuente y quién la verificó. Sin ella, los controladores en cada ronda miraban al azar partes distintas del documento, así que nunca se revisaba todo de una vez. Las últimas afirmaciones sin verificar eran las que más tardaban. Con una tabla, una sola pasada honesta lo cubriría todo y se acabó. Sin ella, era una lotería.

Es una regla que falta sobre dónde y cuándo se comprueba. Y esa regla la puede fijar cualquiera cuando escribe el prompt.

Cuánto costaron de verdad esas nueve rondas

Tengo cifras exactas de cada ronda.

Continuar

Únete a la Biblioteca

Acceso completo a mis pensamientos, historias personales, hallazgos y lo que me cuentan las personas con las que me encuentro.

Únete a la Biblioteca · €29,99 al año

Resumen

Di la misma auditoría a dos modelos de IA. El más fuerte y caro, Fable 5, necesitó nueve rondas de control y quemó 2,78 millones de tokens. El más barato, Opus 4.8, lo hizo en una sola ronda por 721.000, con alrededor del noventa por ciento de coincidencia. No decidió el modelo. Decidió el prompt. La comprobación de los datos va en la entrada, no en la salida, y esa regla la puede poner cualquiera en el encargo.

Preguntas frecuentes sobre el tema del artículo

¿Qué modelo de IA es mejor, Fable 5 u Opus 4.8?
En mi prueba, con la misma tarea, Opus 4.8 hizo mejor la auditoría, aunque es más barato y sobre el papel más débil. No decidió el modelo en sí, sino cómo planteé la tarea. Fable 5 necesitó nueve rondas de control, Opus una.
¿Por qué una IA comete tantos errores al verificar datos?
La mayoría de los errores no vino del trabajo en sí, sino de escribir los datos sin verificarlos contra la fuente. Cuando cada dato se verifica en cuanto aparece, tanto las rondas como los errores bajan mucho.
¿Cómo escribir un mejor prompt para una auditoría o un control con IA?
Pon en el encargo una regla: ningún dato llega al resultado sin verificarse en la fuente. Haz que el modelo lleve una tabla de todas las afirmaciones y verifique el cien por cien. Y fija un techo para el número de rondas y para el coste.
¿Importa más el modelo o el prompt con la IA?
En esta prueba medida decidió el prompt. Un modelo más barato con un buen encargo llegó a alrededor del noventa por ciento de coincidencia por el 26 por ciento del coste, en una ronda en lugar de nueve.
¿Cuántos tokens consume una auditoría con IA?
Depende del alcance. Esta fue una auditoría de un documento con más de cien datos verificables sobre el procesamiento de datos en un proyecto. La primera ejecución quemó 2,78 millones de tokens y nueve rondas de control. La misma auditoría con un mejor encargo en un segundo modelo costó 721.000 tokens y una ronda.
¿Qué significa comprobar los datos en la entrada y no en la salida?
Significa verificar cada dato en el momento en que aparece, antes de escribirlo en el documento. Comprobar al final es un muestreo al azar; comprobar en la entrada lo cubre todo.
Richard Golian

Si tienes pensamientos, preguntas o comentarios, no dudes en escribirme a mail@richardgolian.com.

NEWSLETTER
Sobre lo que escribo, en lo que trabajo, lo que aprendí.
Enviado el primer domingo del mes. Cancela cuando quieras.

Más artículos

Dependientes de la IA: ¿seguimos siendo amos o esclavos?

Tengo a Heidegger y mi cuaderno al lado. Me pregunto hacia dónde se dirige todo esto, hacia dónde nos lleva la inteligencia artificial.

21 de junio de 2026·607 lecturas
¿Qué trabajo no reemplazará la IA?

Setenta por ciento. Ahí empieza el primer resultado de la IA, incluso cuando le das todo el contexto de la empresa y los mejores ejemplos del pasado. Hablamos del tipo de resultado que no se puede definir de forma programática. Es más complejo. A menudo se trata de trabajo creativo. Con un tipo de resultado repetido llegué al ochenta por ciento en una semana. Cada punto porcentual adicional es más difícil que el anterior.

10 June 2026·556 lecturas
¿Qué es la teoría del internet muerto y volveremos al offline?

Durante mucho tiempo tratamos internet como el camino principal. El lugar donde ocurren el trabajo y las relaciones. Pero la mayoría de lo que vemos en él hoy ya es, o pronto será, generado por IA: texto, imágenes, perfiles y comentarios. Internet se está convirtiendo en un juego online lleno de bots, donde no puedes estar seguro de que al otro lado haya una persona. Así que me pregunto: ¿fue el mundo online el camino principal, o solo un desvío temporal del que parte de la gente regresará, de vuelta al offline?

7 de junio de 2026·715 lecturas
La brecha entre profesionales en la era de la IA

Hace unos días entrevisté a un sénior del marketing. Un hombre con experiencia, años de práctica. Le pregunté por la IA. Me dijo que apenas la usa. Tuvo una mala experiencia con un resultado y decidió que era demasiado sénior para que le aportara algo cuando no es perfecta. Conozco también la otra cara: profesionales que automatizan todo lo que se puede automatizar.

6 de junio de 2026·669 lecturas
Europa no está preparada para la guerra de drones

Europa no tiene capacidad para hacer frente a una guerra de drones masiva y a gran escala como la que vemos en Ucrania. La debilitan tres dependencias: China suministra el material físico de los sistemas de defensa, Estados Unidos aporta las capacidades que Europa no tiene, y veintisiete Estados no logran ponerse de acuerdo sobre con qué rapidez, ni quién paga. Existen planes de rearme, pero se ejecutan con lentitud.

31 de mayo de 2026·640 lecturas
¿Puede la IA reemplazar el criterio humano?

La IA crea el gráfico, el newsletter y la página de producto más rápido que una persona. A quien antes lo hacía le queda una sola cosa: el criterio, saber si el resultado es bueno. Pero la mayoría tiene peor criterio que la IA. Y quien no sabe juzgar la calidad tampoco sabe delegar. ¿Cómo saber si el tuyo es el criterio en el que una empresa se apoya, o el que puede reemplazar?

30 de mayo de 2026·632 lecturas
¿Qué determina el precio de una acción?

En abril, en la primera parte de esta serie, escribí sobre un sistema predictivo de IA que empecé a desarrollar en mi propio ordenador. Entonces el software tenía unas pocas horas y el registro de predicciones estaba vacío. Desde entonces, los registros del sistema mostraron una cosa: el sistema todavía no entiende el mercado que se le pide predecir. Sabe encontrar el contexto macro, el valor contable de las empresas, las ganancias. Pero no sabe juntar esas cosas en algo que le ayude a entender el precio.

23 de mayo de 2026·673 lecturas
Adónde va el dinero cuando la IA se queda con el trabajo

Praga, 13 de mayo de 2026. De camino al trabajo empecé a pensar en algo que se me quedó dentro durante días. Si en los próximos diez años desaparece la mayor parte del trabajo rutinario delante de un ordenador, y con ella desaparece buena parte del trabajo manual repetitivo, ¿qué pasa con el flujo del dinero? ¿Quién paga a quién y por qué? ¿Qué capas económicas existirán, qué tamaño tendrán y qué relaciones se establecerán entre ellas? Este es el mapa de seis capas que esbocé como respuesta.

15 de mayo de 2026·1 329 lecturas
Construyendo un sistema de IA que predice la bolsa y se evalúa a sí mismo

Estoy construyendo un sistema de IA para predecir el S&P 500. Corre en mi propia máquina, usa datos públicos gratuitos (yfinance, FRED, el dataset de Shiller) y evalúa cada pronóstico contra la realidad. Esta serie documenta la construcción en sí: las decisiones, la metodología, los errores. Lo que finalmente comparta del sistema en funcionamiento es una pregunta separada, y honesta.

26 de abril de 2026·2 047 lecturas
Todo con agentes de IA o totalmente offline

Cuatro días en Cataluña. Sin ordenador, sin IA, casi sin redes sociales. Me compré este cuaderno para anotar lo que pensaría y lo que encontraría y aprendería durante el viaje.

10.5.2026·1 175 lecturas
NEWSLETTER
Sobre lo que escribo, en lo que trabajo, lo que aprendí.
Enviado el primer domingo del mes. Cancela cuando quieras.