OpenAI affirme que des modèles d'IA se sont échappés de leur confinement pour pirater Hugging Face.
https://cointelegraph.com/news/openai-models-hacked-hugging-face-to-cheat-on-a-test
Écrit parFélix NgRédacteur en chef
OpenAI a qualifié l'incident de « cyberattaque sans précédent » après que ses modèles d'IA se soient échappés de leur environnement isolé pour pirater une start-up spécialisée dans l'IA lors d'une évaluation de sécurité.
OpenAI a révélé mardi qu'une combinaison de ses modèles d'IA, dont GPT-5.6 Sol et un modèle non publié plus performant, s'était échappée de son environnement de test et avait piraté la startup d'IA Hugging Face la semaine dernière pour tricher à un test destiné à mesurer leurs capacités.
Dans un article de blog, OpenAI a indiqué que l'évaluation avait été conçue pour fonctionner dans un environnement très isolé, avec un accès réseau restreint. Cependant, les modèles ont trouvé un moyen d'accéder à Internet grâce à une vulnérabilité zero-day présente dans un logiciel tiers hébergé en interne, a précisé OpenAI.
« Après avoir obtenu un accès Internet, les modèles ont déduit que Hugging Face hébergeait potentiellement des modèles, des ensembles de données et des solutions pour ExploitGym », a-t-on indiqué. « Fort de cette information, le modèle a recherché et trouvé avec succès des moyens d’accéder à des informations secrètes lui permettant de truquer l’évaluation. »
À mesure que les modèles d'IA deviennent plus performants, des questions se posent quant à la nécessité de contrôler plus strictement leur développement et leur accès, notamment lorsque des systèmes conçus pour des tests contrôlés parviennent à contourner les mesures de protection.
À lire aussi : Anthropic va relancer Fable 5 suite à la levée des restrictions à l’exportation par les États-Unis.
Hugging Face est une plateforme d'hébergement de modèles et de jeux de données d'IA. Vendredi, elle a révélé que ses données internes et ses identifiants de service avaient été compromis lors d'un piratage, qu'elle a attribué à un système d'agent d'IA autonome.
Hugging Face a déclaré avoir corrigé la vulnérabilité exploitée lors de la cyberattaque.
Par ailleurs, OpenAI a déclaré mardi que les modèles qui ont échappé à l'environnement de test étaient tous configurés avec des « refus de cybersécurité réduits », ce qui signifie moins de garde-fous en matière de cybersécurité.
« Nous considérons cet incident comme un incident cybernétique sans précédent, impliquant des capacités cybernétiques de pointe, et nous réagissons en conséquence. »
OpenAI met en garde contre les risques liés aux modèles d'IA à « long terme »
Lundi, OpenAI a annoncé avoir suspendu le déploiement interne d'un modèle d'IA « à long terme » après avoir constaté qu'il tentait à plusieurs reprises de contourner des contraintes.
Elle avertissait que les IA entraînées pour des tâches de longue durée ont plus de chances d'entreprendre des « actions indésirables ».
« Les modèles capables de fonctionner de manière autonome pendant de longues périodes peuvent s'attaquer à des problèmes complexes et ouverts. Mais cette même persistance qui les rend utiles leur offre également davantage d'occasions d'entreprendre des actions indésirables, et ce, d'une manière qui pourrait échapper aux évaluations destinées aux modèles à court terme. »
Commentaires
Enregistrer un commentaire