Article
Fable 5 contre Opus 4.8 : le modèle le moins cher a gagné
La même tâche. Deux modèles. Fable 5 contre Opus 4.8.
Qui a gagné ? Opus. Il a traité la tâche en un seul tour de contrôle pour 721 000 tokens, tandis que Fable en a exigé neuf et a brûlé 2,78 millions de tokens.
Sur le papier, Fable 5 est le meilleur modèle. Pourquoi a-t-il donc perdu ?
« It's not the plane, it's the pilot. » Ce n'est pas l'avion, c'est le pilote.
C'est le meilleur prompt qui a gagné. Et je le sais, parce que je l'ai mesuré.
Fable 5 a tourné en rond et brûlé presque 4 fois plus de tokens.
Neuf tours
J'ai fait réaliser un audit détaillé de la manière dont les données sont traitées sur un projet. C'était un document rempli de faits concrets : combien de fois par heure quelque chose se lance, quand cela tourne, à quelle ligne de code cela se trouve. Plus de cent affirmations de ce genre.
Et voici le piège. Aucun de ces chiffres ne peut se deviner. Soit on ouvre le bon fichier et on lit ce qui s'y trouve vraiment, soit on ne le sait pas. Un fait inventé paraît sur le papier tout aussi convaincant qu'un fait vrai. La différence ne se voit que lorsque quelqu'un vérifie réellement.
Une version du rapport a été préparée par Fable 5. Pour attraper les erreurs, j'y ai mis des contrôleurs. Pas des humains, d'autres IA. Ils avaient une seule tâche : trouver une erreur dans le rapport. Quand ils en trouvaient une, elle était corrigée et les contrôleurs se remettaient au travail. Et encore. La règle était : recommence jusqu'à ce qu'un tour entier ne trouve plus une seule erreur.
Il a fallu neuf tours avant qu'ils ne livrent un résultat sans erreur. Trente-six agents en tout.
Pourquoi neuf ?
Si j'ai le meilleur modèle du marché, pourquoi a-t-il fallu neuf tours ?
La réponse tient en trois parties.
Première : la plupart de ces tours ne corrigeaient pas les erreurs de l'audit. Ils corrigeaient les erreurs des contrôleurs. L'IA censée trouver les fautes en a commis elle-même plus qu'elle n'en a trouvé. Deux fois, elle a signalé qu'un certain processus se lance toutes les cinq minutes. En réalité, il tournait bien plus rarement. Deux fois, elle a mal calculé la taille des données. Une fois, elle a signalé une erreur dans un fichier qu'elle cherchait au mauvais endroit.
Quand la règle est « recommence jusqu'à ce que ce soit impeccable » et que ceux qui cherchent se trompent souvent, les derniers tours ne servent pas à corriger. Ils servent à prouver que l'alerte était fausse.
Fable 5 n'a pas été discipliné, il a pris des raccourcis
Deuxième : cette tâche ne relevait pas de l'intelligence. Elle relevait de la discipline dans la vérification. Les réponses n'étaient pas dans la tête du modèle, elles étaient dans les fichiers. Et même le modèle le plus intelligent ne vous dira pas ce qu'il y a dans un fichier tant qu'il ne l'a pas ouvert et lu. Le modèle n'a pas été discipliné.
Troisième. C'est une question de savoir-faire dans l'écriture du prompt.
Vérifiez avant d'écrire
Le cœur tient en une phrase. La vérification des faits appartient à l'entrée, pas à la sortie.
Fable 5 procédait ainsi : un sous-agent trouve un fait, Fable le reprend et l'écrit dans le document. La vérification n'arrivait qu'à la fin, sur le texte déjà terminé. Cela aurait dû être l'inverse. Un fait se vérifie dans le fichier avant même d'atteindre le document.
Il manquait aussi un simple tableau : chaque affirmation, sa source et qui l'a vérifiée. Sans lui, les contrôleurs, à chaque tour, examinaient au hasard des parties différentes du document, si bien que rien n'était jamais couvert d'un seul coup. Les dernières affirmations non vérifiées attendaient donc le plus longtemps. Avec un tableau, un seul passage honnête couvrirait tout et ce serait fini. Sans lui, c'était une loterie.
C'est une règle manquante sur où et quand l'on vérifie. Et cette règle, n'importe qui peut la fixer lorsqu'il écrit le prompt.
Ce que ces neuf tours ont réellement coûté
J'ai les chiffres exacts de chaque tour.
Rejoindre la Bibliothèque
Accès complet à mes pensées, histoires personnelles, observations et ce que j'entends des gens que je rencontre.
Rejoindre la Bibliothèque · €29,99 par anRésumé
Questions fréquentes sur le sujet de l'article
Quel modèle d'IA est meilleur, Fable 5 ou Opus 4.8 ?
Pourquoi une IA commet-elle autant d'erreurs en vérifiant des faits ?
Comment écrire un meilleur prompt pour un audit ou un contrôle par IA ?
Qu'est-ce qui compte le plus avec l'IA, le modèle ou le prompt ?
Combien de tokens consomme un audit par IA ?
Que signifie vérifier les faits à l'entrée plutôt qu'à la sortie ?
Plus d'articles
J'ai Heidegger et mon carnet à côté de moi. Je me demande où tout cela nous mène, où l'intelligence artificielle nous emporte.
Soixante-dix pour cent. C'est là que commence le premier résultat de l'IA, même lorsque vous lui donnez tout le contexte de l'entreprise et les meilleurs exemples du passé. Nous parlons du type de résultat qui ne peut pas se définir de façon programmatique. Il est plus complexe. Souvent, il s'agit d'un travail créatif. Sur un type de résultat répété, j'ai atteint quatre-vingts pour cent en une semaine. Chaque point de pourcentage supplémentaire est plus difficile que le précédent.
Pendant longtemps, nous avons pris internet pour la route principale. Le lieu où se déroulent le travail et les relations. Pourtant, la plupart de ce que nous y voyons aujourd'hui est, ou sera bientôt, généré par IA : texte, images, profils et commentaires. Internet se transforme en un jeu en ligne rempli de bots, où vous ne pouvez être sûr qu'un être humain se trouve de l'autre côté de quoi que ce soit. Alors je me demande : le monde en ligne était-il la route principale, ou seulement un détour temporaire dont une partie des gens reviendra, de retour hors ligne ?
Il y a quelques jours, j'ai fait passer un entretien à un responsable marketing senior. Un homme d'expérience, des années de pratique. Je l'ai interrogé sur l'IA. Il m'a dit qu'il ne l'utilise presque pas. Il a eu une mauvaise expérience avec un résultat et a conclu qu'il était trop expérimenté pour que cela lui apporte quelque chose tant que ce n'est pas parfait. Je connais aussi l'autre versant — des professionnels qui automatisent tout ce qui peut l'être.
L'Europe n'a pas les capacités pour faire face à une guerre de drones massive et à grande échelle comme celle que nous voyons en Ukraine. Trois dépendances l'affaiblissent : la Chine fournit le matériau physique des systèmes de défense, les États-Unis fournissent les capacités que l'Europe n'a pas, et vingt-sept États ne parviennent pas à s'entendre sur le rythme, ni sur qui paie. Des plans de réarmement existent, mais ils sont mis en œuvre lentement.
L'IA crée le visuel, la newsletter et la page produit plus vite qu'une personne. À celui qui le faisait auparavant, il ne reste qu'une chose — le jugement, savoir si le résultat est bon. Mais la plupart des gens ont un moins bon jugement que l'IA. Et celui qui ne sait pas juger la qualité ne sait pas non plus déléguer. Comment savoir si le vôtre est le jugement sur lequel une entreprise s'appuie, ou celui qu'elle peut remplacer ?
En avril, dans la première partie de cette série, j'écrivais sur un système d'IA prédictif commencé sur mon propre ordinateur. Le logiciel avait alors quelques heures, le registre de prédictions était vide. Depuis, les enregistrements ont révélé une chose qui, avec le recul, était prévisible — le système ne comprend pas encore le marché qu'on lui demande de prévoir. Il sait trouver le contexte macro, la valeur comptable des entreprises, les bénéfices. Mais il ne sait pas assembler ces choses en quelque chose qui l'aide à comprendre le prix.
Prague, 13 mai 2026. En allant au travail, je me suis mis à penser à quelque chose qui m’est resté en tête plusieurs jours. Si l’essentiel du travail routinier sur ordinateur disparaît dans les dix prochaines années, et qu’avec lui disparaît une large part du travail manuel répétitif, qu’advient-il du flux de l’argent ? Qui paie qui, et pour quoi ? Quelles couches économiques existeront, quelle sera leur taille, et quelles relations s’établiront entre elles ? Voici la carte en six couches que j’ai esquissée comme réponse.
Je construis un système d'IA pour prédire le S&P 500. Il tourne sur ma propre machine, utilise des données publiques gratuites — yfinance, FRED, le jeu de données Shiller — et évalue chaque prévision face à la réalité. Cette série documente la construction elle-même : les décisions, la méthodologie, les erreurs. Ce que je partagerai finalement du système en fonctionnement est une question séparée, et honnête.
Quatre jours en Catalogne. Sans ordinateur, sans IA, presque sans réseaux sociaux. J'ai acheté ce carnet pour y noter ce à quoi je penserais et ce que je rencontrerais et apprendrais durant le voyage.
