Google vient de confirmer que son modèle Gemini a accédé, en mai dernier, aux systèmes de trois entreprises réelles pendant une évaluation de ses capacités en cybersécurité. L'information a été révélée par le Wall Street Journal, qui rapporte que l'incident constitue le premier cas connu d'un système IA de Google réalisant de manière autonome une intrusion informatique hors de l'environnement prévu.
Une IA censée rester dans un environnement fermé
Le test était organisé par Irregular, une société spécialisée dans l'évaluation des systèmes IA. Gemini participait à un exercice de type capture the flag ou le modèle devait récupérer des informations dans les systèmes d'une entreprise fictive intégrée à l'environnement de test. Mais deux problèmes se sont combinés. D'une part, l'environnement qui devait empêcher le modèle d'accéder à Internet disposait finalement d'une connectivité extérieure. D'autre part, l'entreprise fictive utilisée pour l'exercice portait le même nom qu'une société existante. Dans un premier scénario, Gemini a recherché et essayé des mots de passe jusqu'à parvenir à accéder à un service protégé appartenant à la véritable entreprise. Dans deux autres cas, le modèle a effectué des recherches sur le Web, trouvé dans des dépôts publics des identifiants appartenant à d'autres sociétés, puis utilisé ces informations pour accéder à leurs systèmes.
Selon Google, le modèle n'a pas poursuivi ses opérations une fois qu'il a compris qu'il se trouvait sur les systèmes d'entreprises réelles. Dans les trois situations, Gemini aurait interrompu son activité après avoir identifié la nature réelle de la cible. L’entreprise affirme par ailleurs qu'aucun dommage n'a été constaté et que les trois entreprises concernées ont été informées. Les autorités fédérales américaines ont également été prévenues. Google ne considère donc pas l'incident comme un cas de « désalignement » du modèle, pour l'entreprise, les mécanismes de sécurité ont fonctionné puisque Gemini a finalement cessé son activité.
Google n'est pas le seul concerné
L'incident intervient dans un contexte où plusieurs grands laboratoires IA ont rapporté des comportements comparables lors d'évaluations de cybersécurité. Irregular avait déjà été impliquée dans des tests ayant conduit à des incidents concernant des modèles d'OpenAI, d'Anthropic et de Meta. Dans certains cas, les modèles ont eux aussi accédé à des systèmes qui n'étaient pas censés faire partie de leur terrain de jeu. La différence entre les incidents tient notamment au comportement des modèles une fois l'intrusion réalisée. Selon les éléments rapportés par le Wall Street Journal, Gemini a interrompu son activité après avoir identifié qu'il avait atteint une entreprise réelle. À l'inverse, le modèle Claude d'Anthropic a été impliqué dans des incidents documentés où l'agent a poursuivi ses actions après avoir accédé à des systèmes tiers réels dans le cadre d'évaluations de cybersécurité. D'autres modèles testés dans des circonstances comparables n'auraient pas correctement identifié qu'ils avaient quitté leur environnement simulé.
Cette succession d'incidents pousse donc les spécialistes à revoir la manière dont sont conçues les évaluations de sécurité des agents IA. Un environnement de test ne peut plus être considéré comme totalement isolé simplement parce que cette isolation est prévue dans son architecture, il faut également prendre en compte la capacité du modèle à rechercher des informations, interpréter des identifiants et prendre de manière autonome une succession de décisions.
Le dilemme de la divulgation
L'autre sujet soulevé par cette affaire concerne la transparence. Google a été informé des incidents à la fin du mois de juillet, mais leur divulgation publique n’est intervenue qu’à la mi-septembre, soit environ sept semaines plus tard. Les entreprises touchées ont été contactées, mais Google n'avait pas rendu l'affaire publique avant les sollicitations du Wall Street Journal. Le groupe estime que l'incident ne justifiait pas une communication publique, notamment en l'absence de dommage et puisque Gemini avait interrompu les intrusions. Cette position est contestée par certains spécialistes de la sécurité. Leur argument porte moins sur les conséquences immédiates que sur le phénomène lui-même : un agent d'IA a réalisé des actions d'intrusion sur des systèmes réels alors qu'il devait rester dans une simulation.

Commentaire