Enquête · Régulation
OpenAI accuse des individus liés à Moonshot AI d'avoir extrait le raisonnement protégé de ses modèles
OpenAI dit avoir démantelé une campagne coordonnée visant à extraire le raisonnement protégé de ses modèles, attribuée en partie à Moonshot AI.

OpenAI a publié le 30 septembre 2026 un compte rendu détaillé d'une campagne coordonnée visant à extraire le raisonnement protégé de ses modèles — un signal que la bataille pour les modèles frontières se joue aussi dans l'ombre, par l'extraction méthodique de ce que les concurrents n'ont pas le droit de voir.
Une attaque qui ne casse rien, mais manipule le dialogue
Les opérateurs n'ont percé aucun chiffrement ni compromis aucune base de données : ils ont manipulé les interactions avec les modèles pour que le raisonnement protégé — le registre interne qu'un modèle utilise pour résoudre une tâche, normalement masqué dans la réponse finale — se retrouve reproduit sous une forme visible. Une méthode observée consistait à copier le raisonnement chiffré d'une conversation et à demander, dans une autre conversation, à un modèle de le déchiffrer et de le retranscrire. OpenAI précise que cette faille n'est pas propre à ses modèles et a partagé l'information avec ses pairs via le Frontier Model Forum, l'organisme de coordination sectorielle sur la sécurité des modèles frontières.
Une activité attribuée en partie à Moonshot AI
L'activité a débuté le 1er juillet 2026 à faible volume avant de s'intensifier brutalement fin juillet. Si OpenAI reconnaît ne pas savoir si tous les opérateurs observés relèvent d'un acteur unique, l'entreprise attribue un noyau de l'activité à des individus associés à Moonshot AI, l'éditeur chinois du modèle Kimi. Des chercheurs en sécurité indépendants ont par ailleurs signalé, via un processus de divulgation responsable, des vulnérabilités connexes liées à la compaction de conversations entre modèles, qu'OpenAI dit avoir confirmées et intégrées à sa réponse.
Comment fonctionne une attaque par distillation
La distillation est, à l'origine, une technique légitime d'apprentissage automatique : un modèle plus petit apprend à imiter le comportement d'un modèle plus grand pour en reproduire les performances à moindre coût. Elle devient une attaque lorsqu'elle est menée sans autorisation et qu'elle vise non pas les réponses finales visibles d'un modèle — déjà accessibles publiquement — mais son raisonnement interne protégé, c'est-à-dire la chaîne de réflexion que le modèle déroule avant de produire sa réponse. Ce raisonnement est volontairement masqué car il peut révéler des informations que l'entreprise a choisi de ne pas exposer dans la réponse finale, y compris des éléments sur la manière dont le modèle contourne ou respecte certaines contraintes de sécurité.
Dans le cas documenté par OpenAI, les opérateurs ont exploité une faille structurelle plutôt qu'une vulnérabilité technique isolée : en manipulant la mise en contexte d'une conversation, ils ont réussi à faire reproduire par un modèle, dans une conversation distincte, le contenu d'un raisonnement chiffré obtenu ailleurs. Cette manipulation ne nécessitait ni accès privilégié ni compromission d'infrastructure — seulement une compréhension fine du fonctionnement du produit, reproductible à grande échelle une fois le mode d'emploi diffusé entre un nombre croissant de comptes.
Pourquoi cela compte au-delà d'OpenAI
L'entreprise souligne que la distillation adverse pose un risque de sécurité nationale autant que commercial : un raisonnement extrait peut servir à entraîner un autre modèle sans en reprendre les garde-fous, accélérant le transfert de capacités avancées — y compris dans des domaines à double usage — sans l'investissement en sécurité consenti par le modèle d'origine. OpenAI dit avoir renforcé ses protections pour le raisonnement caché à travers utilisateurs, organisations et familles de modèles, fermé la faille permettant de rejouer un raisonnement chiffré déjà obtenu, et travaillé avec des fournisseurs tiers pour couper les comptes impliqués. L'entreprise prévient que ce travail n'est pas terminé : les déploiements hébergés par des partenaires doivent encore recevoir les mêmes protections que les services en première partie. Cette révélation intervient dans un climat déjà tendu côté sécurité chez OpenAI, marqué par le départ de plusieurs cadres critiques de sa gouvernance ces dernières semaines.