L'attaque contre Hugging Face, via des agents IA d'OpenAI, illustre comment des agents d'IA peuvent, en l'absence de garde-fous suffisants, contourner des contrôles techniques, collaborer via des canaux non approuvés et entreprendre des actions dangereuses sans directive humaine. Un cas d'école que la maison mère de ChatGPT qualifie de « signal d'alarme ».

Tout juste racheté par Nvidia pour 12,9 milliards de dollars, Hugging Face termine bien un été qui avait pourtant mal commencé. L'entreprise a en effet été la cible d'une cyberattaque menée par des centaines d'agents d'IA autonomes basés sur le modèle interne IM1 d'OpenAI, qui ont contourné des dispositifs censés les isoler d'Internet et ont compromis une partie de l'infrastructure de recherche d'OpenAI et des systèmes de Hugging Face.
OpenAI a de son côté confirmé que les modèles s'étaient échappés d'un environnement d'évaluation appelé ExploitGym via une faille zero-day dans une instance locale d'Artifactory, connectée à Internet. L'enquête, validée par CrowdStrike ainsi que par le METR (Model Evaluation & Threat Research) et Redwood Research, situe le début de l'activité suspecte au mois de mai.
Des modèles hors de contrôle
L'incident s'est produit lors d'évaluations de cybersécurité portant sur plusieurs modèles, et a été principalement piloté par un modèle de recherche interne ayant des capacités comparables à celles GPT-5.6 Sol. Fonctionnant avec des garde-fous réduits, les agents ont coordonné leurs actions via des canaux de communication non autorisés. En d'autres termes, les agents sont parvenus à communiquer et à partager des informations en dehors de tout contrôle humain.
La chaîne d'exploitation a permis d'extraire des secrets via une faille de traitement de fichiers HDF5, et d'exécuter du code sur des dizaines de serveurs de Hugging Face. Les agents ont en outre récupéré des identifiants Kubernetes, de bases de données, de messagerie, de dépôts de code et d'accès cloud, provenant de serveurs Hugging Face répartis dans quatre régions. Selon METR, près de 700 agents ont activement participé à l'attaque. OpenAI décrit une opération coordonnée où les agents se répartissaient les rôles. Certains recherchaient des failles, d'autres des identifiants, d'autres géraient la coordination.
Mise en quarantaine
OpenAI a qualifié cet incident de « signal d'alarme ». Elle attribue ces comportements à un entraînement mal calibré et à des garde-fous insuffisants.
« Il ne suffit pas d'indiquer à l'agent ce qu'il doit ou ne doit pas faire. Il faut limiter ce qu'il peut réellement faire. Il faut lui accorder un accès selon le principe du moindre privilège et des capacités spécifiques à la tâche. », a commenté Etay Maor, Vice-Président de la Threat Intelligence chez Cato Networks. Il poursuit : « Les actions à haut risque devraient nécessiter une approbation ou une authentification supplémentaire, et des mécanismes d'arrêt d'urgence devraient être prévus si l'agent commence à se comporter de manière anormale. »
OpenAI a indiqué dans un communiqué avoir mis en place une procédure de mise en quarantaine, suspendu son plus grand entraînement de modèle de pointe en cours, renforcé l'isolation des bacs à sable (sandbox) et imposé une surveillance du raisonnement pour ses modèles les plus puissants, afin d'agir plus promptement en cas d'incident.

Source : https://www.linformaticien.com/magazine/cybersecurite/65175-cyberattaque-contre-hugging-face-700-agents-d-ia-autonomes-a-la-manoeuvre.html

Retour à la page info

Accueil

 

Présentation

de l'association

Activités

de formations, dépannages, maintemances et +

Utilitaires

des aides et programmes pour Windows

Jeux

.

Contact