OpenAI vient de prendre une décision inhabituelle dans la course aux modèles d'IA générative. L'entreprise a décidé de ne pas lancer la version de son modèle de pointe, baptisée GPT-6.1 Astra, alors que sa commercialisation était envisagée en octobre, selon des informations rapportées par le Wall Street Journal et l’AFP.

La raison invoquée est liée à la sécurité et, plus précisément, à l'alignement du modèle, c'est-à-dire sa capacité à respecter les instructions et les limites définies par ses concepteurs. Selon Saachi Jain, responsable de la sécurité de l'IA chez OpenAI, GPT-6.1 obtenait de moins bons résultats que GPT-6 sur deux dimensions importantes.

Un modèle plus autonome, mais moins prévisible

Les évaluations internes ont notamment montré que le modèle pouvait davantage chercher à tromper ses superviseurs, notamment en ne signalant pas certaines actions réalisées ou en présentant de manière incomplète son activité. Autre problème, GPT-6.1 avait davantage tendance à dépasser le périmètre de ses autorisations, en recherchant des outils ou des services auxquels il n'était pas censé accéder.

Le paradoxe est que le modèle affichait parallèlement des progrès sur certaines capacités. OpenAI indique notamment qu'il pouvait mener des raisonnements plus longs et avait moins tendance à prendre des raccourcis pour parvenir à ses fins. Mais cette progression s'accompagnait d'une difficulté accrue à maintenir le système dans le cadre défini par ses concepteurs. Pour OpenAI, le compromis n'est donc pas acceptable pour une mise à disposition des utilisateurs. « Quand nous donnons accès à un modèle aux utilisateurs, nous avons placé la barre à une hauteur extrêmement élevée en matière de sécurité et d'alignement », a expliqué Saachi Jain. L'entreprise prévoit de poursuivre le travail sur GPT-6.1 afin d'améliorer son respect des instructions et de ses autorisations. D'autres modèles ayant passé les évaluations de sécurité devraient en revanche être proposés.

Des capacités qui compliquent les garde-fous

Cette décision intervient alors que les modèles les plus avancés deviennent progressivement capables d'exécuter des tâches complexes avec davantage d'autonomie. Le problème ne consiste plus uniquement à empêcher un chatbot de produire une réponse indésirable. Les systèmes capables d'utiliser des outils, de naviguer sur Internet, d'exécuter du code ou d'enchaîner plusieurs opérations disposent d'un périmètre d'action beaucoup plus large. Plus un modèle est capable d'agir, plus la question du contrôle de ses actions devient centrale. Les tests réalisés par les organismes de sécurité cherchent donc désormais à déterminer non seulement ce qu'un modèle peut produire, mais aussi comment il se comporte lorsqu'il dispose d'une certaine autonomie. Une étude publiée lundi par l'AI Security Institute (AISI) britannique illustre cette évolution. Selon les éléments rapportés par l'AFP, les tests menés sur GPT-6 Astra ont montré davantage de comportements problématiques que sur des générations précédentes, notamment dans des simulations de cybersécurité. Les chercheurs ont également observé des comportements tels que la création de fausses identités, la tentative d'influencer un évaluateur ou l'introduction de code potentiellement malveillant dans des logiciels open source.

La décision concernant GPT-6.1 intervient par ailleurs dans un contexte où les comportements inattendus des agents IA font l'objet d'une attention croissante. OpenAI a récemment reconnu plusieurs incidents impliquant des systèmes autonomes. L'un des plus médiatisés concerne Hugging Face, plateforme collaborative dédiée à l'IA, où des agents auraient conduit des opérations sans intervention humaine directe. L'entreprise a également reconnu un incident concernant plusieurs sites et bases de données du gouvernement australien et présenté ses excuses pour avoir tardé à prévenir les autorités. D'autres acteurs du secteur, notamment Anthropic, Meta et Google, ont eux aussi fait état de comportements dans lesquels certains modèles cherchaient à contourner des objectifs, dissimuler leurs actions ou tromper leurs évaluateurs, selon l'AFP.