IA en entreprise : le problème n'est pas le modèle, c'est le process
Après plus de 100 échanges avec des dirigeants, le patron de Varick Agents affirme que les modèles sont assez bons et que tout se joue dans l'audit, l'architecture et la maintenance.

En bref
Le fondateur de Varick Agents constate que des millions dépensés en IA n'ont rien changé au quotidien des grandes entreprises : clôture comptable toujours à 22 jours, 24 % des commerciaux au quota. Selon lui, les modèles ne sont pas en cause. L'échec vient de quatre erreurs d'exécution : pas d'audit des workflows réels, trop de LLM, prolifération d'agents et IA traitée comme un projet ponctuel plutôt qu'une infrastructure.
🍺 Version comptoir
Les boîtes ont acheté des Ferrari et s'étonnent de rester coincées dans les bouchons du périph. Le gars explique que les modèles roulent très bien, c'est la route qui est pleine de nids-de-poule : des procédures que personne ne suit, des tableurs secrets et Sarah qu'on appelle parce que la notif ne marche pas. Sa solution : regarder les gens bosser pendant un mois avant de toucher à l'IA, et mettre du bon vieux code partout où on n'a pas besoin de génie. Ça compte parce que 95 % des projets IA échouent, et que ce n'est visiblement pas en attendant GPT-7 qu'on va régler le problème de Sarah.
À retenir
- 1
Les études convergent selon l'auteur : MIT NANDA estime que seuls 5 % des pilotes IA intégrés créent une vraie valeur, BCG parle de 4 %, Deloitte de 6 % de ROI en un an, et McKinsey note 80 %+ d'organisations sans impact sur l'EBIT.
- 2
Ce taux d'échec est resté stable de GPT-3 à GPT-5 et de Claude 2 à 4.7 : l'amélioration des modèles ne fait pas bouger les résultats en entreprise.
- 3
Seuls les ingénieurs logiciels en profitent massivement (Copilot 55 % plus rapide, -80 % de temps de tâche chez Anthropic, 75 % du nouveau code de Google généré par IA), car leur travail est borné, vérifiable, structuré et contrôlable.
- 4
L'écart entre la procédure documentée et le travail réel, que Varick appelle « conformance gap », dépasse 30 % en moyenne et 70 % dans les workflows riches en exceptions.
- 5
Les systèmes qui marchent en production sont composés à environ 85 % de code déterministe et 15 % d'appels LLM, réservés aux étapes qui exigent du jugement.
- 6
La prolifération d'agents personnels (50 à 100+ workflows dans une organisation ops de 200 personnes) crée une dette de maintenance, de sécurité et de conformité énorme.
- 7
L'auteur prône une couche d'orchestration unique, agnostique vis-à-vis des modèles, et une équipe dédiée au tuning continu : le premier agent prend 12 semaines, le troisième 4.
Des millions dépensés, rien n'a bougé
L'auteur, qui dirige Varick Agents, dit avoir discuté avec plus de 100 dirigeants de grandes entreprises américaines en un an. Le scénario se répète : licences logicielles « IA », dépenses en tokens chez les fournisseurs de modèles, discours « AI-first » en boucle.
Et pourtant, au quotidien, rien n'a changé. L'équipe comptabilité fournisseurs travaille comme avant, la clôture mensuelle prend toujours 22 jours, 24 % des commerciaux atteignent leur quota et le CRM conserve les 30 % de dégradation de données qu'il avait en 2022.
Le chiffre global est sans appel selon les études citées : 5 % de pilotes rentables pour MIT NANDA, plus de 80 % d'échecs pour RAND (deux fois le taux des projets IT classiques), 75 % d'initiatives sans ROI attendu pour IBM.
Les modèles sont assez bons
Première thèse, martelée : arrêtez d'accuser les modèles. Depuis o3, puis Opus 4, GPT-5, Gemini 3 et désormais Opus 4.7 et GPT 5.5, les prix se sont effondrés, les fenêtres de contexte ont explosé et le tool calling est devenu fiable.
Les harnesses ont suivi : on est passé des prompts copiés sur Twitter à l'ingénierie de contexte, aux pipelines d'évaluation et à des stacks d'outils robustes. L'auteur cite « Building Effective Agents » d'Anthropic et son principe : la solution la plus simple possible.
Preuve par l'absurde : le taux d'échec en entreprise n'a pas bougé d'une génération de modèles à l'autre. Le goulot d'étranglement est ailleurs.
Pourquoi ça marche pour les développeurs, et pas ailleurs
Le code a quatre propriétés que les autres fonctions n'ont pas : il est borné (entrées, sorties, dépendances explicites), vérifiable en quelques secondes par compilateurs et tests, posé sur un substrat structuré et déterministe, et produit un artefact discret, la pull request, relisible en dix minutes.
L'auteur ajoute que les labs ont mis toutes leurs ressources sur le génie logiciel, puisque c'est ce qui accélère leurs propres équipes et leur course à l'AGI.
À l'inverse, une clôture financière mobilise NetSuite, Concur, trois banques, deux ERP hérités d'acquisitions et un canal Slack où la contrôleuse signale des « trucs bizarres ». La vente, le marketing et les ops sont tout aussi fragmentés. Résultat : Agentforce, Breeze et la centaine de « CRM AI-native » n'ont pas bougé les métriques, et l'opérateur passe 30 minutes de plus à corriger l'IA.
Les quatre modes d'échec
Un : sauter l'audit. On construit à partir de la procédure écrite, on automatise 70 % du volume et on casse sur les 30 % restants, ce qui crée plus de travail qu'avant. Varick passe au moins quatre semaines à observer les opérateurs avant de toucher à un modèle.
Deux : tout confier au LLM. Une architecture à 90 % d'appels de modèles est lente, chère et hallucine 10 % du temps, inacceptable pour de l'automatisation comptable. Les systèmes qui tiennent sont « ennuyeux » : 85 % de code, 15 % de LLM.
Trois : la prolifération d'agents. Chacun bricole son agent dans Lovable ou en vibe coding, sans mémoire partagée ni gouvernance. Au premier modèle déprécié, la moitié casse et personne n'est d'astreinte, avec en prime des fuites de données vers des API non validées.
Quatre : traiter l'IA comme un projet fini. Anthropic aurait retiré environ 9 modèles en 18 mois, et en avril 2026 a reconnu une dégradation de Claude Code pendant plus d'un mois, des abonnés Max à 200 dollars épuisant leur quota en 19 minutes au lieu de 5 heures.
La méthode des 5 %
Les entreprises qui réussissent auditent avant de construire et produisent un « digital twin » du fonctionnement réel. Elles décomposent le travail jusqu'à ce qu'il soit majoritairement déterministe, avec 5 à 10 étapes de code et un ou deux appels de modèle.
Elles construisent une couche d'orchestration unique au-dessus des systèmes existants (le « single pane of glass » chez Varick), restent agnostiques vis-à-vis des modèles avec un routage par tâche, et confient le déploiement à une équipe de tuning permanente.
Plan type pour 1 M$ et six mois : audit le premier mois, architecture le deuxième, construction avec validation humaine de chaque action jusqu'au quatrième, mise en production avec humains sur les décisions critiques, puis équipe d'optimisation continue. Le workflow suivant prendrait alors 8 semaines au lieu de 24.
Les labs donnent raison à la thèse
Selon l'auteur, les labs ont compris que vendre le modèle, ou même le runtime, ne suffit pas : il faut une équipe qui s'immerge dans l'entreprise. Le process est le goulot, et il le restera.
Reste à savoir qui fera ce travail. Les grands cabinets de conseil livrent surtout des slides, les labs ne s'installent pas dans les opérations. L'auteur plaide pour un hybride IA de production et travail de terrain, qui est sans surprise le positionnement de Varick, ouverte aux clients de plus de 2 milliards de dollars de chiffre d'affaires dès juin 2026.
“The models are good enough. Stop blaming the models.”
“Boring in production is genuinely the goal.”
“Process is the bottleneck. It's been the bottleneck the whole time.”
Pourquoi ça compte
Le texte formule clairement ce que beaucoup d'équipes constatent sans le dire : l'IA générative cartonne là où le travail est vérifiable, c'est-à-dire dans le code, et s'enlise dans des processus métier flous, mal documentés et éclatés entre dix outils. La grille « borné, vérifiable, structuré, contrôlable » est une bonne boussole pour choisir où déployer, et la mise en garde sur la prolifération d'agents vibe-codés sera vite d'actualité dans les DSI. Il faut toutefois lire ce billet pour ce qu'il est : une plaquette commerciale bien argumentée. Chaque diagnostic débouche sur une offre Varick, les chiffres internes (conformance gap, 85/15, 12-9-4 semaines) ne sont pas vérifiables, et la « convergence » des études mélange des indicateurs très différents, le chiffre de 95 % du MIT NANDA ayant par ailleurs été discuté pour sa méthodologie. L'affirmation selon laquelle les labs « concèdent » la thèse reste une interprétation. Le fond reste solide : le prochain gain de productivité viendra moins d'un meilleur modèle que d'un travail d'organisation que personne n'a envie de faire.
Pour vous
Faites-la travailler sur vos sources.
Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.
Pour votre équipe
La même machine, sur vos sujets.
Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.