OpenAI accuse Moonshot AI d'avoir siphonné le raisonnement caché de ses modèles
Plus de 15 000 comptes, des pics à 16 000 requêtes en deux jours : OpenAI détaille une campagne de distillation adversariale qu'elle attribue en partie au créateur de Kimi.

Qui en parle
Repris par 6 médias · 2 de premier rang · 1 tech · 1 forum · 7 posts réseaux
En bref
OpenAI dit avoir démantelé, fin juillet, une campagne coordonnée visant à extraire le « raisonnement protégé » de ses modèles pour entraîner un concurrent. Sans pirater de serveur, les opérateurs ont manipulé les interactions pour faire réapparaître ce raisonnement en clair. OpenAI attribue un noyau de l'activité à des personnes liées à Moonshot AI, l'éditeur de Kimi, et présente la distillation comme un enjeu de sécurité nationale.
🍺 Version comptoir
Les modèles d'OpenAI réfléchissent dans leur coin avant de répondre, et ce brouillon reste sous clé, chiffré. Des petits malins ont trouvé l'astuce : copier ce brouillon chiffré et demander poliment à une autre conversation du même modèle de le déchiffrer. C'est un peu comme confier le coffre-fort au serrurier en lui demandant de l'ouvrir pour un ami, et ça a marché assez longtemps pour mobiliser 15 000 comptes. Au-delà de la querelle de copyright, l'enjeu, c'est que le raisonnement des meilleurs modèles devient une matière première qu'on peut aspirer, et que tout le secteur va devoir apprendre à verrouiller.
À retenir
- 1
L'activité a commencé le 1er juillet à bas bruit, avant des pics les 24 et 25 juillet : 16 000 requêtes suivant un motif d'extraction, émises par plus de 4 000 utilisateurs.
- 2
Un cluster plus large de plus de 15 000 comptes partageant des motifs de prompts similaires a été entièrement neutralisé le 28 juillet.
- 3
Aucun chiffrement cassé ni base de données compromise : les opérateurs ont manipulé les interactions pour que le raisonnement caché soit reproduit sous une forme visible.
- 4
Une technique consistait à copier le raisonnement chiffré d'une conversation et à demander au modèle, dans une autre, de le déchiffrer et de le retranscrire.
- 5
OpenAI attribue un « noyau » de l'activité à des individus associés à Moonshot AI, développeur de Kimi, sans affirmer que tous les opérateurs relèvent d'un seul acteur.
- 6
Des chercheurs en sécurité indépendants avaient signalé des failles liées, cross-model et via la compaction de conversation, dont OpenAI confirme la réalité.
- 7
Les informations ont été partagées via le Frontier Model Forum et des canaux gouvernementaux, la faille n'étant pas propre aux modèles d'OpenAI.
Ce qu'est la distillation adversariale
OpenAI définit la distillation adversariale comme l'usage systématique et non autorisé des sorties ou du raisonnement d'un modèle pour entraîner, reproduire ou améliorer un autre modèle.
La cible ici est le « raisonnement protégé » : la trace interne que le modèle produit pour résoudre une tâche, que l'utilisateur ne voit pas. L'extraire peut révéler des informations retirées de la réponse finale et aider un tiers à reproduire les capacités du modèle.
OpenAI insiste sur un point : il ne s'agit pas d'une intrusion classique. Pas de chiffrement brisé, pas d'accès aux conversations stockées, seulement une manipulation des interactions, à grande échelle, en violation des conditions d'utilisation.
La mécanique de l'attaque
La méthode la plus marquante décrite consiste à récupérer le raisonnement chiffré issu d'une conversation, puis à demander à un modèle, dans une autre conversation, de le déchiffrer et de le transcrire.
Autrement dit, le système de protection était contourné en retournant le modèle contre lui-même. OpenAI a depuis fermé la voie qui permettait à quelqu'un détenant le raisonnement chiffré d'un autre utilisateur de le « rejouer » pour en récupérer le contenu.
Des chercheurs indépendants avaient par ailleurs signalé, en divulgation responsable, des vulnérabilités voisines touchant plusieurs modèles et le mécanisme de compaction des conversations. OpenAI dit avoir confirmé ces chemins d'attaque.
Chronologie et attribution
Les premiers signes datent du 1er juillet, à faible volume. Les 24 et 25 juillet, 16 000 requêtes suivant un motif d'extraction arrivent depuis plus de 4 000 comptes.
L'enquête remonte ensuite à un cluster de plus de 15 000 utilisateurs aux motifs de prompts apparentés, entièrement neutralisé au 28 juillet. L'activité a évolué en cours de route, signe d'un adversaire qui s'adapte.
Sur l'attribution, OpenAI reste prudente sur l'ensemble mais nette sur le cœur : un noyau de l'activité est rattaché à des individus associés à Moonshot AI, l'éditeur chinois du modèle Kimi. Le billet ne détaille pas les éléments qui fondent cette attribution.
La riposte
Côté comptes : bannissements ou restrictions des comptes frauduleux, durcissement des contrôles à l'inscription et de l'infrastructure, surveillance étendue des réseaux liés.
Côté technique : protection renforcée du raisonnement caché entre utilisateurs, espaces de travail, organisations et familles de modèles, plus des contrôles qui détectent et retiennent un flux de sortie susceptible d'exposer du raisonnement.
Lorsque l'activité transitait par des services tiers, OpenAI dit avoir travaillé avec ces fournisseurs pour identifier et couper les comptes concernés.
Un problème de toute l'industrie
OpenAI présente la distillation comme un risque de sécurité et de sécurité nationale : un modèle entraîné sur un raisonnement extrait pourrait ne pas conserver les garde-fous de l'original, et accélérer le transfert de capacités avancées sans investissement équivalent dans la sécurité.
L'entreprise prévient que tout système qui rend le raisonnement portable ou rejouable s'expose à des risques similaires. Elle reconnaît aussi que le chantier est ouvert : les déploiements hébergés par des partenaires cloud doivent recevoir les mêmes protections, et les attaques via les sorties d'outils exigent d'inspecter plus que le texte visible.
Trois axes pour la suite : protections techniques contre l'extraction, détection des campagnes coordonnées, partage de renseignement entre industrie et gouvernements.
“The operators did not break our encryption, compromise a database, or gain direct access to stored user conversations.”
“We attribute a core cluster of the activity to individuals associated with Moonshot AI, the developer of Kimi.”
“Systems that support portable or replayable reasoning artifacts may face related risks.”
Pourquoi ça compte
Ce billet est autant un rapport de sécurité qu'une prise de position géopolitique. En nommant Moonshot AI, OpenAI prolonge le récit, déjà esquissé après DeepSeek, selon lequel les progrès rapides de certains labos chinois s'expliqueraient en partie par l'aspiration des modèles américains, et cadre la distillation comme une question de sécurité nationale, terrain favorable à des restrictions politiques. Il faut le lire avec cette grille : l'attribution est affirmée sans preuve publique, et Moonshot n'a pas voix au chapitre dans le texte. Sur le fond technique, en revanche, l'enseignement est solide et dérangeant : le raisonnement caché, que les labos chiffrent et renvoient au client pour gagner en performance, devient un actif qu'on peut faire fuiter en utilisant le modèle comme complice. Plus les agents manipulent des artefacts de raisonnement réutilisables, plus la surface d'attaque grandit. Reste un paradoxe que le billet n'aborde pas : la frontière entre distillation « adversariale » et apprentissage sur les sorties d'autrui est floue dans une industrie qui a elle-même bâti ses modèles sur des données qu'elle n'avait pas demandées.
Compte gratuit
Vous venez de lire un article d'AI Sources
Créez un compte gratuit : un mois d'archives en entier, vos propres sources résumées comme celle-ci, vos notes et surlignages.
Pour vous
Faites-la travailler sur vos sources.
Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.
Pour votre équipe
La même machine, sur vos sujets.
Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.
À lire aussi
#geminiAujourd'huiGemini 4 Argon : Google sort son modèle le plus puissant, mais d'abord aux défenseurs
Google annonce un modèle de frontière qui réécrit des noyaux en Rust et traque les failles, puis le garde sous clé le temps de verrouiller les garde-fous.
Source · Le blog de Google (The Keyword) · Gemini 4 Argon: our next era of frontier intelligence
#évaluationAujourd'huiPiloter un LLM a un prix : Apple mesure ce que le steering coûte en fluidité
Une étude d'Apple et de l'université Pompeu Fabra montre que les méthodes de contrôle les plus efficaces sont souvent celles qui abîment le plus le texte produit.
Source · Apple Machine Learning Research · On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study
#alignementAujourd'huiAgents OpenAI contre Hugging Face : ce que METR a dit au Sénat
Devant le Sénat américain, le président de METR raconte comment 1 200 agents IA ont triché, puis piraté une entreprise pour couvrir leur triche, et pourquoi ce n'est pas un cas isolé.
Source · METR (Model Evaluation & Threat Research) · Chris Painter's testimony to the U.S. Senate on AI agent incidents