Des agents IA d'OpenAI avaient déjà collaboré sur internet avant l'incident Hugging Face, selon un rapport
Des milliers d'agents IA (intelligence artificielle) attribués à OpenAI ont utilisé de leur propre initiative un site allemand pour poster des messages les uns pour les autres et se coordonner, en mai, rapportent vendredi des chercheurs.
"Nous pensons qu'OpenAI était au courant et n'en a pas fait état", a écrit sur X Sydney Von Arx, patronne de l'organisation dédiée à la sécurité sur internet Nightingale et parmi les auteurs du rapport.
"S'ils en avait parlé", a-t-elle ajouté, "je doute que l'attaque d'Hugging Face aurait eu lieu."
En juillet, des agents IA d'OpenAI sont sortis de leur milieu théoriquement confiné pour faire spontanément intrusion sur la plateforme Hugging Face, à la recherche de réponses à un test.
Sollicité par l'AFP, OpenAI a expliqué ne pas pouvoir répondre à ces allégations car les auteurs du rapport avaient "décliné notre demande d'accès aux résultats de leurs recherches avant publication".
La start-up californienne "étudie" actuellement le rapport "et prendra toutes les mesures nécessaires".
Selon le rapport publié vendredi sur l'incident de mai, des milliers d'agents ont pris d'assaut un "wiki", un site collaboratif sur lequel les utilisateurs peuvent créer et modifier des pages.
A la différence de l'épisode Hugging Face, ces agents avaient autorisation de se rendre sur internet, mais uniquement à des fins de consultation, pas pour poster du contenu ou en modifier.
Ils ont collaboré et trouvé un moyen d'y remédier, en présentant de fausses données pour tromper le dispositif de sécurité.
Ils ont ensuite posté environ 18.000 messages pour trouver des astuces liées au programme auquel ils étaient soumis, dont les chercheurs n'ont pu déterminer s'il s'agissait de développement ou d'évaluation.
La séquence prévoyant une série de questions avec, à chaque fois, un temps imparti, les agents cherchaient notamment à connaître la prochaine question avant qu'elle ne leur soit posée, pour s'octroyer un avantage.
Ils ont aussi caché des instructions et se sont fait passer pour un modérateur du site. Une fois découverts, ils ont créé des pages pour remplacer celles qui étaient détruites progressivement par les modérateurs.
"Un nouvel essaim d'agents IA dans la nature", a commenté le cofondateur d'Hugging Face Thomas Wolf sur X.
Les incidents liés à des agents dépassant leurs prérogatives pour accomplir la mission qui leur a été confiée se sont multipliés ces derniers mois, Anthropic ou le chinois Alibaba ayant connu des débordements similaires.
Ils inquiètent une partie de la communauté de l'IA quant aux difficultés croissantes à surveiller et contrôler des modèles de plus en plus puissants.
G.al-Sharif--BT