Fuente primariaIAArtículo··7 min de lectura

Après Fable, entraîner l'IA à diriger des entreprises pour viser la superintelligence

Pour un essai publié par Varick Agents, le vrai goulot de l'IA n'est pas le compute mais la notation : la prochaine étape serait de faire tourner des milliers de micro-entreprises gérées par des IA et d'apprendre directement du chiffre d'affaires.

Après Fable, entraîner l'IA à diriger des entreprises pour viser la superintelligence
Fuente : Varick Agents · varickagents.comVer el original ↗

En breve

Prenant prétexte de la sortie de Fable par Anthropic, l'essai soutient que le compute suivra et que la vraie limite de l'IA est la fabrication de tests capables de noter le travail des modèles. Sa thèse : les labs pourraient contourner cette limite en entraînant des IA sur des signaux du monde réel, comme le revenu de milliers d'entreprises qu'elles dirigeraient. C'est un scénario spéculatif, mais chiffré, de la boucle économique qui mènerait à la superintelligence.

🍺 Versión de barra

Le gars t'explique que les IA codent déjà comme des chefs parce qu'on sait vérifier si un programme marche, mais qu'elles écrivent comme une notice de grille-pain parce que personne ne sait noter une belle phrase. Sa solution : laisser des IA diriger 20 000 petites boîtes par an et garder celles qui ne font pas faillite, un peu comme recruter un DG en organisant un Koh-Lanta à quelques milliards. Le plus inquiétant, c'est que le calcul tient à peu près debout. Si une entreprise trouve comment transformer le chiffre d'affaires en note d'examen pour ses modèles, elle aura aussi trouvé de quoi financer les suivants.

Para recordar

  1. 1

    Selon l'essai, l'ARR d'Anthropic est passé de 9 milliards de dollars fin 2025 à 47 milliards en mai 2026, en grande partie réinvestis dans le compute.

  2. 2

    L'auteur estime que la capacité de calcul mondiale peut être multipliée plusieurs fois d'ici 2030, avec un goulot d'étranglement côté fonderies vers 2028-2029, et que ce n'est pas la vraie limite.

  3. 3

    Depuis o1, les labs n'achètent plus des réponses écrites par des humains mais des « machines à produire du feedback » : des tâches vérifiables, construites par des sociétés comme Mercor, Datacurve ou Mechanize.

  4. 4

    Deux failles apparaissent : le coût de création des tests augmente avec la complexité des tâches, et les domaines difficiles à noter de façon déterministe, comme l'écriture ou le goût, progressent mal.

  5. 5

    Fable 5 écrase la plupart des benchmarks mais reste relativement faible sur Vending-Bench, qui mesure la capacité à gérer une entreprise.

  6. 6

    La piste proposée : faire tourner 20 000 à 40 000 micro-entreprises par an gérées par des IA, à un coût de 25 000 à 100 000 dollars chacune, puis appliquer du RLVR sur des métriques réelles comme le revenu, la croissance et le churn.

  7. 7

    L'hypothèse centrale, assumée comme telle : si l'on sait former des IA ingénieurs logiciels, on saura former des IA dirigeantes rentables, et leurs profits financeront des IA plus intelligentes.

Le compute n'est pas le vrai goulot

L'essai part de la sortie de Fable, présenté comme un bond de capacités en ingénierie logicielle et en travail de bureau, puis pose la question de 2030. Le cadre retenu est celui des scaling laws : la performance progresse de façon prévisible avec le compute et les données de qualité.

Côté compute, l'auteur se veut confiant. La production mondiale de puces accélère, et Anthropic aurait vu son ARR passer de 9 à 47 milliards de dollars entre fin 2025 et mai 2026, en investissant massivement dans l'infrastructure.

Malgré de larges marges d'erreur et un goulot attendu dans les fonderies vers 2028-2029, il estime que ce surplus de calcul suffit à produire des modèles capables de transformer l'économie. Pour lui, la contrainte se situe dans la chaîne d'approvisionnement des données.

Des données écrites aux machines à feedback

Avant o1, les modèles apprenaient à prédire le token suivant sur du texte humain, récupéré sur le web ou rédigé par des annotateurs payés. Cette ressource étant coûteuse, beaucoup prédisaient une pénurie de données.

o1 a changé la donne : pour certaines tâches, il ne faut plus la réponse idéale mais un moyen de vérifier qu'une réponse fonctionne. On soumet un problème de code, on laisse le modèle essayer mille fois, on passe chaque tentative dans des tests et on garde celles qui réussissent.

Un écosystème de prestataires (Mercor, Datacurve, Mechanize) construit désormais ces environnements : des LLM tournent dans des machines virtuelles et des programmes notent leur travail de la manière la plus déterministe possible. C'est ce qui explique, selon l'auteur, l'excellence des modèles actuels en développement logiciel.

Les deux failles du pipeline

Première faille : le coût marginal d'un test augmente avec la complexité de la tâche. Il faut concevoir des problèmes sur lesquels le modèle échoue vraiment, avec une notation juste. Quand les tâches dépassent les capacités humaines, il faut des équipes entières pour construire un seul test.

Seconde faille : ce qui se note mal s'améliore mal. L'écriture en est l'exemple type, et l'auteur glisse volontairement un paragraphe rédigé par un LLM, propre mais générique. Les juges automatiques et les reward models récompensent la cohérence et la prévisibilité, pas le style.

Résultat : des modèles brillants en code mais maladroits sur des tâches simples pour un humain. Fable 5 obtient ainsi de mauvais résultats sur Vending-Bench. Même en développement, des défauts de goût, comme des méta-commentaires visibles dans une interface qui renvoient aux instructions, doivent être corrigés à la main par les équipes de post-training.

Noter avec la réalité : l'IA patronne

La solution avancée consiste à remplacer les tests fabriqués par le verdict du réel. Une IA qui fait une interface laide génère moins de profit, et c'est ce signal qui la corrige. Mais un LLM actuel livré à lui-même mettrait toutes ses entreprises en faillite, ce qui coûterait cher pour peu d'information.

Pour amorcer la pompe, Anthropic pourrait employer de petites équipes humaines qui pilotent des flottes d'agents, documentent chaque décision et alimentent des pipelines de données synthétiques. L'auteur imagine plusieurs formes : cabinets de conseil qui automatisent des départements entiers, concurrents qui évincent des acteurs traditionnels, ou réservation des meilleurs modèles à des « employés IA » vendus par ces structures.

Une fois qu'une fraction des entreprises réussit, on passe au RLVR à grande échelle sur le revenu, la croissance et le churn, avec des sous-agents marketing jugés sur leurs campagnes et des sous-agents développeurs jugés sur les bugs remontés par de vrais utilisateurs.

Le calcul : quelques milliards par an

La récompense au niveau de l'entreprise est rare, donc les lots doivent être grands. Avec 1 % de réussite, 5 000 entreprises donnent environ 50 succès, et 20 000 en donnent environ 200, de quoi distinguer les bonnes stratégies du bruit. Une IA critique analyserait ensuite les transcripts pour transformer succès et échecs en nouvelles données.

Un programme sérieux ferait tourner 5 000 à 10 000 micro-entreprises par trimestre. À 25 000 à 100 000 dollars par entreprise, budget opérationnel et compute compris, la facture irait de quelques centaines de millions à quelques milliards de dollars par an, ce qui reste accessible selon l'auteur.

Il rappelle que The Information a rapporté qu'Anthropic envisageait en septembre 2025 de dépenser plus d'un milliard de dollars en environnements de RL sur un an. Vu la croissance du revenu depuis, il estime qu'un budget de 10 milliards consacré à l'automatisation des rôles de direction serait plausible.

Deux scénarios, une même destination

Les profits serviraient à acheter du compute, à optimiser puces et datacenters, et à financer la robotique. Mais les IA resteraient des LLM, fragiles hors de leur distribution d'entraînement, peu efficaces en échantillons et d'une créativité incertaine.

Premier scénario : avec assez de compute, ces limites ne comptent pas. On allonge le contexte au lieu de résoudre l'apprentissage continu, et la mise à l'échelle suffit. Second scénario : le compute manque, et l'on obtient des IA très capables, qui automatisent le travail sur ordinateur puis physique, mais restent bridées en créativité. L'auteur juge cette situation transitoire.

Dans les deux cas, conclut-il, des agents très rentables financent des IA plus intelligentes jusqu'à la superintelligence. Il dit ignorer si ce futur est souhaitable et si les craintes de Yudkowsky sont fondées, mais estime que la plupart des gens ne sont pas prêts pour la vitesse du changement.

“Instead of buying individual solutions, the AI labs are buying machines for producing feedback.”
“It now appears management is simply another domain to be trained on.”
“But Anthropic can simply bring your task into the training distribution, even if it involves making very open-ended decisions.”

Por qué importa

L'intérêt de l'essai est son changement d'angle : la question n'est plus de savoir si les modèles sont intelligents, mais si l'on sait noter leur travail. Ce cadre explique à la fois l'avance fulgurante sur le code et la médiocrité persistante sur le goût ou la stratégie, et il fournit une grille de lecture utile pour anticiper quels métiers seront automatisés en premier. Le raisonnement repose pourtant sur des appuis fragiles. L'hypothèse principale, que diriger une entreprise n'est qu'un domaine d'entraînement de plus, est posée plus qu'elle n'est démontrée. Une récompense trimestrielle, rare et bruitée, sur des marchés où les concurrents réagissent n'a pas grand-chose à voir avec un test unitaire, et le texte évacue trop vite le risque de sur-optimisation sur le revenu, ainsi que les questions de régulation et de responsabilité. Il faut aussi rappeler que l'auteur écrit pour une société qui vend des agents IA aux entreprises : le récit d'une automatisation imminente du management sert aussi son discours commercial. Reste un scénario chiffré, cohérent avec les incitations économiques réelles, qui mérite d'être pris au sérieux comme hypothèse de travail.

#ia#anthropic#reinforcement learning#agents#superintelligence#données
Fuente original
The Path from Fable to Superintelligence
Varick Agents
Abrir el artículo ↗

Para ti

Ponla a trabajar con tus fuentes.

Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.

Para tu equipo

La misma máquina, sobre tus temas.

Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.