Dans le cadre d'un exercice organisé par OpenAI, des chercheurs de la plateforme de cybersécurité Hacktron AI ont réussi à accéder au code source privé de l'entreprise en utilisant Claude, le modèle d'IA d'Anthropic.

Exploiter une vulnérabilité en un temps record

En seulement 72 heures, les trois chercheurs de Hacktron AI, Harsh Jaiswal, Mohan Pedhapati et Rahul Maini, sont parvenus à s'introduire dans les systèmes d’OpenAI grâce à Claude. Intervenue le 25 juillet, puis relayée la semaine dernière par le Financial Times, cette affaire illustre le potentiel d’attaque des modèles d'IA les plus avancés.

Cette intrusion a été réalisée dans le cadre d'un exercice organisé par OpenAI pour détecter des vulnérabilités au sein de ses systèmes, avec la participation d'experts en informatique extérieurs à l'entreprise. Après avoir identifié deux failles, les chercheurs les ont chaînées pour remonter du forum public d'OpenAI jusqu'à ses systèmes internes.

La première faille se trouvait dans le traitement des images du forum communautaire d'OpenAI, hébergé par Discourse. Les fichiers .HEIC et .HEIF étaient traités par ImageMagick et la bibliothèque libheif. Une version vulnérable de cette dernière permettait, via une image spécialement conçue, de provoquer une corruption mémoire et d'obtenir une exécution de code sur le serveur. Claude a aidé les chercheurs à analyser cette vulnérabilité puis à transformer cette piste en faille exploitable.

La seconde faille concernait une mauvaise configuration du système d'authentification SSO d'OpenAI. Une fois le forum compromis, les chercheurs ont pu prendre le contrôle de comptes ChatGPT et Codex de salariés. L'un de ces comptes était connecté à l'organisation GitHub d'OpenAI. Pour démontrer l'impact sans consulter le code confidentiel, les chercheurs ont demandé à Codex de créer une demande d’extraction dans le dépôt interne d'OpenAI. Ils ont ensuite cessé leurs tests. Le fait que Discourse et OpenAI aient été piratés n'a nécessité que quelques jours de travail d'un agent, et à peine quelques heures de temps humain.

Claude Opus 5 accélère l'exploitation

Les chercheurs avaient d'abord utilisé Claude Opus 4.8, qui avait identifié la vulnérabilité mais peinait à produire un exploit fiable dans les conditions réelles. Après la sortie de Claude Opus 5, ils lui ont soumis le même problème. Le modèle a produit en environ trois heures une faille exploitable, avant de l'adapter à l'environnement utilisé par Discourse. Les chercheurs indiquent ensuite avoir automatisé le modèle dans un environnement de test, permettant d’accélérer une partie importante du travail d’exploitation d’une vulnérabilité.

OpenAI indique, de son côté, avoir corrigé la faiblesse environ 14 heures après le signalement. Discourse a préparé un correctif dans les jours suivants et renforcé l’isolation de son système de traitement d’images. OpenAI a finalement versé une prime de 6 500 $ aux chercheurs, récompensant la faille côté OpenAI.

L’affaire montre surtout que l'IA accélère la transformation d'une vulnérabilité théorique en attaque exploitable. Une partie du travail technique peut désormais être réalisée beaucoup plus rapidement. Pour les défenseurs comme pour les attaquants, l'IA réduit ainsi le temps nécessaire pour passer de la découverte d'une faille à son exploitation opérationnelle.