Les modèles d’IA révèlent leurs pensées les plus intimes grâce à une nouvelle technique

Une équipe de chercheurs a mis au point une méthode pour extraire les processus de pensée cachés des modèles d'IA, ce qui soulève des questions sur la s...

Les chercheurs en informatique ont récemment découvert un moyen d’extraire les processus de pensée cachés des modèles d’IA de pointe lorsqu’ils résolvent des problèmes complexes. Ces découvertes fournissent certaines preuves, bien que non concluantes, que certains modèles chinois pourraient avoir été formés en distillant des informations de raisonnement provenant de modèles américains qui étaient censés être cachés en raison de la similarité de leurs modèles de pensée ou de raisonnement. Les chercheurs ont également démontré que la méthode pourrait être utilisée pour récupérer des informations personnelles, telles que des mots de passe et des clés API, à partir des processus de pensée internes d’un modèle, bien que cette vulnérabilité ait été corrigée.

La découverte d’une faille dans les modèles d’IA

Tous les principaux fournisseurs de modèles de pointe que nous avons testés partagent cette vulnérabilité, affirme Alexander Panfilov, un informaticien de l’Université de Tübingen en Allemagne qui a participé à ces travaux. Cela peut conduire à des fuites d’informations personnelles et permettre des attaques de distillation de raisonnement à grande échelle. Panfilov et ses collègues de l’Université de Tübingen, de l’Institut Max Planck, de l’Institut de sécurité de l’IA MATS Research et de la société de sécurité Snyk ont identifié le même problème avec les modèles de pointe d’OpenAI, d’Anthropic et de Google qui sont accessibles via une interface de programmation d’application ou API.

Dans un document présentant les travaux, les chercheurs montrent que le modèle chinois Kimi K3 de Moonshot AI produit une sortie remarquablement similaire aux traces de raisonnement cachées – les étapes de raisonnement écrites impliquées dans la résolution d’un problème – de Claude Opus 4.8 et GPT 5.6 Sol pour certaines invites. Malgré les similarités, ils notent que les travaux ne peuvent pas établir de lien de cause à effet avec la distillation. Ils ont constaté que deux autres modèles à poids ouvert, le chinois DeepSeek et l’américain Inkling de la société Thinking Machines, ne présentaient pas ce type de similarité de raisonnement avec Claude Opus.

Les implications de la distillation dans les modèles d’IA

La distillation est une technique bien établie et largement utilisée pour copier efficacement les capacités des modèles existants sur de nouveaux modèles, et est particulièrement courante dans le développement de modèles à poids ouvert ou de modèles entièrement téléchargeables. Cependant, la distillation est devenue un sujet controversé en raison des allégations selon lesquelles les sociétés chinoises d’IA l’utilisent pour copier essentiellement les meilleurs modèles américains. En février, OpenAI a déclaré aux législateurs américains que DeekSeek semblait avoir copié l’un de ses modèles pour construire un modèle de raisonnement appelé R1. En juin, Anthropic a déclaré aux législateurs que Alibaba avait systématiquement distillé ses modèles pour construire ses propres modèles, appelés Qwen.

Les conséquences de la découverte pour la sécurité des données

Il n’y a aucune indication que les sociétés chinoises d’IA aient utilisé cette technique spécifique pour distiller les modèles d’IA américains. Cependant, Panfilov et ses collaborateurs affirment que l’utilisation de leur méthode rendrait possible la distillation de plus d’informations à partir de modèles fermés que ce qui était précédemment réalisé. Les modèles avancés d’IA résolvent des problèmes complexes en les décomposant en problèmes plus petits, et la compréhension de ces processus de pensée peut aider à améliorer la sécurité et la confidentialité des données.

Conclusion et perspectives

En conclusion, la découverte d’une faille dans les modèles d’IA pour extraire leurs processus de pensée cachés soulève des questions importantes sur la sécurité et la confidentialité des données. Les chercheurs et les développeurs doivent être conscients de ces risques et travailler pour les atténuer. Les utilisateurs doivent également être informés des risques potentiels liés à l’utilisation de modèles d’IA et prendre des mesures pour protéger leurs données personnelles. À l’avenir, il sera important de continuer à étudier et à améliorer la sécurité des modèles d’IA pour garantir que les avantages de ces technologies puissantes soient réalisés tout en minimisant les risques.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *