Richard Golian

Né en 1995. Diplômé de l’Université Charles de Prague. Responsable de la performance chez Mixit. Plus de 10 ans dans le marketing basé sur les données.

English Castellano Slovenčina

Gérer l'abonnement Choisir un abonnement

RSS
Newsletter
Nouveaux articles dans votre boîte mail

Article

Fable 5 contre Opus 4.8 : le modèle le moins cher a gagné

Opus a battu Fable 5. C'est le prompt qui a décidé.
Richard Golian
Richard Golian · 80 lectures
Bonjour, je suis Richard. Sur ce blog, je partage des réflexions, des histoires personnelles, des découvertes et ce sur quoi je travaille. J’espère que cet article vous apportera quelque chose de précieux.

La même tâche. Deux modèles. Fable 5 contre Opus 4.8.

Qui a gagné ? Opus. Il a traité la tâche en un seul tour de contrôle pour 721 000 tokens, tandis que Fable en a exigé neuf et a brûlé 2,78 millions de tokens.

Sur le papier, Fable 5 est le meilleur modèle. Pourquoi a-t-il donc perdu ?

« It's not the plane, it's the pilot. » Ce n'est pas l'avion, c'est le pilote.

C'est le meilleur prompt qui a gagné. Et je le sais, parce que je l'ai mesuré.

Fable 5 a tourné en rond et brûlé presque 4 fois plus de tokens.

Neuf tours

J'ai fait réaliser un audit détaillé de la manière dont les données sont traitées sur un projet. C'était un document rempli de faits concrets : combien de fois par heure quelque chose se lance, quand cela tourne, à quelle ligne de code cela se trouve. Plus de cent affirmations de ce genre.

Et voici le piège. Aucun de ces chiffres ne peut se deviner. Soit on ouvre le bon fichier et on lit ce qui s'y trouve vraiment, soit on ne le sait pas. Un fait inventé paraît sur le papier tout aussi convaincant qu'un fait vrai. La différence ne se voit que lorsque quelqu'un vérifie réellement.

Une version du rapport a été préparée par Fable 5. Pour attraper les erreurs, j'y ai mis des contrôleurs. Pas des humains, d'autres IA. Ils avaient une seule tâche : trouver une erreur dans le rapport. Quand ils en trouvaient une, elle était corrigée et les contrôleurs se remettaient au travail. Et encore. La règle était : recommence jusqu'à ce qu'un tour entier ne trouve plus une seule erreur.

Il a fallu neuf tours avant qu'ils ne livrent un résultat sans erreur. Trente-six agents en tout.

Pourquoi neuf ?

Si j'ai le meilleur modèle du marché, pourquoi a-t-il fallu neuf tours ?

La réponse tient en trois parties.

Première : la plupart de ces tours ne corrigeaient pas les erreurs de l'audit. Ils corrigeaient les erreurs des contrôleurs. L'IA censée trouver les fautes en a commis elle-même plus qu'elle n'en a trouvé. Deux fois, elle a signalé qu'un certain processus se lance toutes les cinq minutes. En réalité, il tournait bien plus rarement. Deux fois, elle a mal calculé la taille des données. Une fois, elle a signalé une erreur dans un fichier qu'elle cherchait au mauvais endroit.

Quand la règle est « recommence jusqu'à ce que ce soit impeccable » et que ceux qui cherchent se trompent souvent, les derniers tours ne servent pas à corriger. Ils servent à prouver que l'alerte était fausse.

Fable 5 n'a pas été discipliné, il a pris des raccourcis

Deuxième : cette tâche ne relevait pas de l'intelligence. Elle relevait de la discipline dans la vérification. Les réponses n'étaient pas dans la tête du modèle, elles étaient dans les fichiers. Et même le modèle le plus intelligent ne vous dira pas ce qu'il y a dans un fichier tant qu'il ne l'a pas ouvert et lu. Le modèle n'a pas été discipliné.

Troisième. C'est une question de savoir-faire dans l'écriture du prompt.

Vérifiez avant d'écrire

Le cœur tient en une phrase. La vérification des faits appartient à l'entrée, pas à la sortie.

Fable 5 procédait ainsi : un sous-agent trouve un fait, Fable le reprend et l'écrit dans le document. La vérification n'arrivait qu'à la fin, sur le texte déjà terminé. Cela aurait dû être l'inverse. Un fait se vérifie dans le fichier avant même d'atteindre le document.

Il manquait aussi un simple tableau : chaque affirmation, sa source et qui l'a vérifiée. Sans lui, les contrôleurs, à chaque tour, examinaient au hasard des parties différentes du document, si bien que rien n'était jamais couvert d'un seul coup. Les dernières affirmations non vérifiées attendaient donc le plus longtemps. Avec un tableau, un seul passage honnête couvrirait tout et ce serait fini. Sans lui, c'était une loterie.

C'est une règle manquante sur où et quand l'on vérifie. Et cette règle, n'importe qui peut la fixer lorsqu'il écrit le prompt.

Ce que ces neuf tours ont réellement coûté

J'ai les chiffres exacts de chaque tour.

Continuer

Rejoindre la Bibliothèque

Accès complet à mes pensées, histoires personnelles, observations et ce que j'entends des gens que je rencontre.

Rejoindre la Bibliothèque · €29,99 par an

Résumé

J'ai confié le même audit à deux modèles d'IA. Le plus puissant et le plus cher, Fable 5, a exigé neuf tours de contrôle et brûlé 2,78 millions de tokens. Le moins cher, Opus 4.8, l'a fait en un seul tour pour 721 000, avec environ quatre-vingt-dix pour cent de concordance. Ce n'est pas le modèle qui a décidé. C'est le prompt. La vérification des faits appartient à l'entrée, pas à la sortie, et cette règle, n'importe qui peut l'inscrire dans la consigne.

Questions fréquentes sur le sujet de l'article

Quel modèle d'IA est meilleur, Fable 5 ou Opus 4.8 ?
Dans mon test, sur la même tâche, Opus 4.8 a mieux réussi l'audit, bien qu'il soit moins cher et plus faible sur le papier. Ce n'est pas le modèle lui-même qui a décidé, mais la façon dont j'ai formulé la tâche. Fable 5 a exigé neuf tours de contrôle, Opus un seul.
Pourquoi une IA commet-elle autant d'erreurs en vérifiant des faits ?
La plupart des erreurs ne venaient pas du travail lui-même, mais du fait que les données étaient écrites sans être vérifiées contre la source. Quand chaque donnée est vérifiée dès qu'elle apparaît, les tours comme les erreurs diminuent fortement.
Comment écrire un meilleur prompt pour un audit ou un contrôle par IA ?
Inscrivez dans la consigne une règle : aucun fait n'atteint le résultat sans être vérifié dans la source. Faites tenir au modèle un tableau de toutes les affirmations et vérifier cent pour cent d'entre elles. Et fixez un plafond au nombre de tours et au coût.
Qu'est-ce qui compte le plus avec l'IA, le modèle ou le prompt ?
Dans ce test mesuré, c'est le prompt qui a décidé. Un modèle moins cher avec une bonne consigne a atteint environ quatre-vingt-dix pour cent de concordance pour 26 pour cent du coût, en un tour au lieu de neuf.
Combien de tokens consomme un audit par IA ?
Cela dépend de l'ampleur. Il s'agissait de l'audit d'un document comptant plus de cent faits vérifiables sur le traitement des données d'un projet. La première exécution a brûlé 2,78 millions de tokens et neuf tours de contrôle. Le même audit avec une meilleure consigne sur un deuxième modèle a coûté 721 000 tokens et un seul tour.
Que signifie vérifier les faits à l'entrée plutôt qu'à la sortie ?
Cela signifie vérifier chaque fait au moment où il apparaît, avant de l'écrire dans le document. Vérifier à la fin, c'est un échantillonnage au hasard ; vérifier à l'entrée couvre tout.
Richard Golian

Si vous avez des pensées, des questions ou des retours, n’hésitez pas à m’écrire à mail@richardgolian.com.

NEWSLETTER
Ce sur quoi j'écris, ce sur quoi je travaille, ce que j'ai appris.
Envoyé le premier dimanche du mois. Désabonnement à tout moment.

Plus d'articles

Dépendants de l'IA : sommes-nous encore maîtres ou esclaves ?

J'ai Heidegger et mon carnet à côté de moi. Je me demande où tout cela nous mène, où l'intelligence artificielle nous emporte.

21 juin 2026·607 lectures
Quel travail l'IA ne remplacera-t-elle pas ?

Soixante-dix pour cent. C'est là que commence le premier résultat de l'IA, même lorsque vous lui donnez tout le contexte de l'entreprise et les meilleurs exemples du passé. Nous parlons du type de résultat qui ne peut pas se définir de façon programmatique. Il est plus complexe. Souvent, il s'agit d'un travail créatif. Sur un type de résultat répété, j'ai atteint quatre-vingts pour cent en une semaine. Chaque point de pourcentage supplémentaire est plus difficile que le précédent.

10 June 2026·557 lectures
Qu'est-ce que la théorie de l'internet mort et reviendrons-nous hors ligne ?

Pendant longtemps, nous avons pris internet pour la route principale. Le lieu où se déroulent le travail et les relations. Pourtant, la plupart de ce que nous y voyons aujourd'hui est, ou sera bientôt, généré par IA : texte, images, profils et commentaires. Internet se transforme en un jeu en ligne rempli de bots, où vous ne pouvez être sûr qu'un être humain se trouve de l'autre côté de quoi que ce soit. Alors je me demande : le monde en ligne était-il la route principale, ou seulement un détour temporaire dont une partie des gens reviendra, de retour hors ligne ?

7 juin 2026·715 lectures
Le fossé entre les professionnels à l'ère de l'IA

Il y a quelques jours, j'ai fait passer un entretien à un responsable marketing senior. Un homme d'expérience, des années de pratique. Je l'ai interrogé sur l'IA. Il m'a dit qu'il ne l'utilise presque pas. Il a eu une mauvaise expérience avec un résultat et a conclu qu'il était trop expérimenté pour que cela lui apporte quelque chose tant que ce n'est pas parfait. Je connais aussi l'autre versant — des professionnels qui automatisent tout ce qui peut l'être.

6 juin 2026·669 lectures
L'Europe n'est pas prête à la guerre des drones

L'Europe n'a pas les capacités pour faire face à une guerre de drones massive et à grande échelle comme celle que nous voyons en Ukraine. Trois dépendances l'affaiblissent : la Chine fournit le matériau physique des systèmes de défense, les États-Unis fournissent les capacités que l'Europe n'a pas, et vingt-sept États ne parviennent pas à s'entendre sur le rythme, ni sur qui paie. Des plans de réarmement existent, mais ils sont mis en œuvre lentement.

31 mai 2026·640 lectures
L'IA peut-elle remplacer le jugement humain ?

L'IA crée le visuel, la newsletter et la page produit plus vite qu'une personne. À celui qui le faisait auparavant, il ne reste qu'une chose — le jugement, savoir si le résultat est bon. Mais la plupart des gens ont un moins bon jugement que l'IA. Et celui qui ne sait pas juger la qualité ne sait pas non plus déléguer. Comment savoir si le vôtre est le jugement sur lequel une entreprise s'appuie, ou celui qu'elle peut remplacer ?

30 mai 2026·632 lectures
Qu'est-ce qui détermine le prix d'une action ?

En avril, dans la première partie de cette série, j'écrivais sur un système d'IA prédictif commencé sur mon propre ordinateur. Le logiciel avait alors quelques heures, le registre de prédictions était vide. Depuis, les enregistrements ont révélé une chose qui, avec le recul, était prévisible — le système ne comprend pas encore le marché qu'on lui demande de prévoir. Il sait trouver le contexte macro, la valeur comptable des entreprises, les bénéfices. Mais il ne sait pas assembler ces choses en quelque chose qui l'aide à comprendre le prix.

23 mai 2026·673 lectures
Où va l’argent quand l’IA prend le travail

Prague, 13 mai 2026. En allant au travail, je me suis mis à penser à quelque chose qui m’est resté en tête plusieurs jours. Si l’essentiel du travail routinier sur ordinateur disparaît dans les dix prochaines années, et qu’avec lui disparaît une large part du travail manuel répétitif, qu’advient-il du flux de l’argent ? Qui paie qui, et pour quoi ? Quelles couches économiques existeront, quelle sera leur taille, et quelles relations s’établiront entre elles ? Voici la carte en six couches que j’ai esquissée comme réponse.

15 mai 2026·1 329 lectures
Construire un système d'IA qui prédit la bourse et s'évalue lui-même

Je construis un système d'IA pour prédire le S&P 500. Il tourne sur ma propre machine, utilise des données publiques gratuites — yfinance, FRED, le jeu de données Shiller — et évalue chaque prévision face à la réalité. Cette série documente la construction elle-même : les décisions, la méthodologie, les erreurs. Ce que je partagerai finalement du système en fonctionnement est une question séparée, et honnête.

26 avril 2026·2 047 lectures
Tout avec des agents d'IA ou totalement hors ligne.

Quatre jours en Catalogne. Sans ordinateur, sans IA, presque sans réseaux sociaux. J'ai acheté ce carnet pour y noter ce à quoi je penserais et ce que je rencontrerais et apprendrais durant le voyage.

10 mai 2026·1 175 lectures
NEWSLETTER
Ce sur quoi j'écris, ce sur quoi je travaille, ce que j'ai appris.
Envoyé le premier dimanche du mois. Désabonnement à tout moment.