Agents IA : 90 % des tokens dépensés en entreprise seraient superflus
Le CEO de Varick Agents affirme qu'on peut diviser la facture par dix sans passer à l'open source, simplement en arrêtant de confier à un LLM ce qu'un « if » sait déjà faire.

En breve
Le CEO de Varick Agents, qui construit des agents pour de grands groupes, défend une méthode pour réduire de plus de 90 % les dépenses en tokens : découper chaque workflow en tâches, coder tout ce qui est déterministe, router le reste vers le plus petit modèle fiable et mettre en cache les réponses connues. Le sujet compte parce que les entreprises voient leur facture IA exploser sans gains de productivité à la hauteur.
🍺 Versión de barra
En gros, les boîtes ont embauché un prix Nobel pour vérifier que deux cases d'un formulaire contiennent le même chiffre, et elles s'étonnent de la note de frais. Le gars de Varick explique que la plupart des tâches « intelligentes » sont en fait cent petites tâches idiotes déguisées, qu'un bout de code ou un petit modèle fait très bien pour trois fois rien. Et quand l'IA a déjà rangé l'agrafeuse dans « fournitures de bureau », pas besoin de lui reposer la question tous les matins. Le jour où les directions financières demanderont combien rapporte chaque token, ceux qui ont tout confié au modèle le plus cher vont avoir une conversation gênante.
Para recordar
- 1
Selon l'auteur, la consommation d'IA a explosé dans les grandes entreprises alors que la productivité n'a progressé que marginalement, d'où une pression nouvelle sur la facture de tokens.
- 2
L'indicateur à suivre n'est ni la dépense brute ni la dépense par employé, mais le ROI de l'intelligence consommée.
- 3
Le nombre d'étapes d'un workflow et la quantité d'intelligence qu'il exige sont deux choses distinctes : beaucoup de workflows « agentiques » sont en majorité déterministes.
- 4
L'erreur de conception principale serait d'automatiser au niveau du workflow entier plutôt que tâche par tâche.
- 5
Varick benchmarke les modèles sur chaque tâche et retient le plus petit fiable, ce qui donne une répartition « 90/9/1 » : 90 % non-frontier, 9 % near-frontier, 1 % frontier.
- 6
Le cache des sorties connues (par exemple le code comptable associé à « agrafeuse ») évite des appels répétés au LLM.
- 7
Un harness qui restreint le contexte à quelques champs et documents réduit les coûts et améliore la précision.
De la fièvre des tokens à la gueule de bois
Il y a un an, la dépense en tokens n'était pas un sujet. Les entreprises étaient persuadées que l'IA allait « transformer leur business » et ne regardaient pas la facture. L'auteur parle d'un « token-maxxing » alors généralisé.
Aujourd'hui, le décor a changé : l'usage de l'IA a fortement augmenté dans les grands groupes, la facture aussi, mais la productivité n'a progressé que marginalement et les retours financiers espérés ne sont pas au rendez-vous. Les dirigeants veulent comprendre pourquoi la note grimpe et comment la réduire sans perdre les gains d'efficacité.
L'auteur reprend une idée de Daniel, responsable de l'équipe FDE de Varick : piloter les tokens comme une société de trading gère son capital, en réallouant vers les usages au meilleur rendement. Le billet se concentre lui sur le versant ingénierie.
Une tâche difficile, ou cent tâches faciles ?
La question centrale : comment utiliser le moins d'intelligence possible, et faire en sorte que celle qu'on consomme soit utile et bon marché. Exemple donné : si 10 dollars de « Fable 5 » résolvent une tâche difficile et 10 dollars de Gemini 3.6 Flash en résolvent cent faciles, il faut se demander combien de tâches « difficiles » ne sont en réalité que des paquets de tâches faciles.
La réponse de l'auteur : la plupart. Une fois un workflow complexe découpé, la majorité des étapes n'exige pas un modèle à l'état de l'art. Certaines sont déterministes, d'autres relèvent d'un petit modèle, d'autres encore peuvent être servies depuis un cache.
D'où la formule choc du billet : 90 % des dépenses en tokens d'une entreprise n'auraient jamais dû avoir lieu.
Le workflow n'est pas la bonne unité d'automatisation
Vus de l'extérieur, les workflows d'entreprise paraissent complexes : écritures dans plusieurs systèmes, embranchements, validations, exceptions. Le réflexe est d'y mettre un agent sophistiqué propulsé par un modèle frontier.
Mais en les décortiquant étape par étape, l'équipe de Varick a constaté que l'« agent » passait l'essentiel de son temps à vérifier la concordance de champs, déplacer des données ou appliquer une règle. Du travail que du code fait pour bien moins cher.
Les modèles actuels sont capables de dérouler seuls un processus compliqué avec beaucoup de contexte et quelques outils, et c'est justement le piège : ils sont alors sollicités partout, y compris là où ils ne servent à rien. La recommandation : raisonner tâche par tâche, car chacune a un besoin d'intelligence différent.
Le partage 90/9/1
Le jugement d'un modèle n'est utile que là où la bonne réponse dépend du contexte et admet plusieurs options plausibles, comme interpréter un email client. Mais même là, l'auteur met en garde contre le réflexe de pointer le modèle le plus lourd sur chaque micro-décision.
La méthode Varick : découper le workflow, benchmarker les modèles sur chaque tâche et retenir le plus petit qui la traite de façon fiable. Résultat, un système qui tourne sur Gemini 3.6 Flash quand c'est possible et ne sollicite Opus qu'en dernier recours.
La répartition obtenue, environ 90 % non-frontier, 9 % near-frontier et 1 % frontier, est à l'origine du chiffre de 90 % d'économies, calculé par rapport à un scénario où tout tournerait sur un modèle frontier.
Code, petit modèle, cache : le test à appliquer à chaque étape
Les étapes déterministes deviennent du code pur : si un email arrive avec des pièces jointes, on les télécharge. « If X, then Y », à l'ancienne.
Le raisonnement simple part vers un petit modèle : lire une ligne de facture, reconnaître une agrafeuse, lui attribuer le code comptable « fournitures de bureau ». Et la réponse est ensuite mise en cache, pour que la prochaine agrafeuse soit classée sans appeler le LLM.
Pour les étapes à forte charge de jugement ou d'expertise métier, ou quand une erreur coûterait cher, l'auteur recommande d'escalader vers un modèle plus puissant ou de garder un humain dans la boucle.
Le contexte, autre gouffre à tokens
Deux ans d'IA appliquée ont convaincu l'équipe que le harness autour du modèle pèse lourd dans la consommation. L'auteur renvoie à un article d'Eyad, chez Varick, sur la manière d'en construire un.
Un bon harness évite de noyer le modèle sous des informations inutiles. Si une décision ne dépend que de quelques champs et d'un document, inutile d'envoyer tout l'historique du workflow à chaque appel.
Bonus selon l'auteur : un contexte étroit est aussi plus précis, car c'est dans l'information superflue que les modèles se perdent. Moins de tokens, moins d'erreurs.
“90% of your company's token spend never needed to happen in the first place. Spend less tokens.”
“The number of steps in a workflow and the amount of intelligence required in that workflow are two very different things.”
“The goal is to spend intelligence sparingly, not just for token spend, but for accuracy as well.”
Por qué importa
Le billet capte un basculement réel : après la phase d'expérimentation à tout prix, l'IA en entreprise entre dans l'ère du contrôle de gestion, et le coût marginal de l'intelligence devient une variable d'architecture. Le fond du propos est solide et peu glamour : c'est un retour aux fondamentaux du génie logiciel, où l'on réserve la ressource chère aux endroits qui l'exigent, à rebours de la mode du « donnez des outils au modèle et laissez-le faire ». Il faut toutefois lire le texte pour ce qu'il est : un contenu de marque qui se termine par une invitation à prendre rendez-vous. Le fameux 90 % est mesuré contre un scénario où tout tournerait sur un modèle frontier, un point de comparaison flatteur que peu d'équipes sérieuses appliquent réellement. Surtout, le billet ne chiffre pas ce que coûte la décomposition elle-même : le temps d'ingénieurs pour cartographier les workflows, benchmarker les modèles tâche par tâche, maintenir les caches et réécrire la logique quand les processus évoluent. Aucune donnée non plus sur la précision obtenue. La thèse reste juste, mais l'économie réelle se joue dans ce que le texte ne mesure pas.
Para ti
Ponla a trabajar con tus fuentes.
Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.
Para tu equipo
La misma máquina, sobre tus temas.
Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.