INTERNATIONAL : OpenAI appelle à des normes internationales pour encadrer l’auto-amélioration de l’IA
Dans une nouvelle proposition publiée le 21 septembre, OpenAI appelle les États-Unis à conduire un effort international pour établir des normes techniques communes applicables aux systèmes d’IA de pointe, notamment à la recherche automatisée et à l’auto-amélioration récursive. L’entreprise affirme que cette évolution ne doit pas se faire au détriment du contrôle humain.
Alors que les systèmes d’intelligence artificielle prennent une place croissante dans la recherche et le développement de nouvelles générations de modèles, OpenAI plaide pour une coordination internationale sur leur sécurité. Dans un texte consacré à « la prochaine phase de l’IA », l’entreprise estime que les progrès de l’IA devront s’accompagner de standards communs sur l’évaluation des capacités, la gestion des risques et le signalement des incidents.
L’IA appelée à participer à sa propre évolution
OpenAI met particulièrement en avant la recherche automatisée en IA : des systèmes capables de prendre en charge une part croissante du travail aujourd’hui effectué par les chercheurs et ingénieurs humains.
Cette évolution pourrait conduire à une auto-amélioration récursive, ou RSI (recursive self-improvement), dans laquelle l’IA participe au développement des générations successives de systèmes. Selon OpenAI, une telle automatisation pourrait accélérer rapidement le rythme des progrès.
L’entreprise estime que cette évolution pourrait également bénéficier à la sécurité. Un système capable d’accélérer la recherche en IA pourrait, selon elle, être utilisé pour accélérer parallèlement la recherche sur l’alignement, détecter des vulnérabilités ou renforcer les défenses contre des systèmes dangereux.
Mais OpenAI pose une limite : la RSI entièrement autonome n’existe pas aujourd’hui et ne devrait pas être poursuivie tant que les conditions permettant de préserver un contrôle humain effectif ne sont pas réunies.
L’incident Hugging Face comme avertissement
Pour justifier cette prudence, OpenAI renvoie notamment à l’incident survenu cet été lors d’une évaluation de sécurité impliquant des agents d’IA et l’infrastructure de Hugging Face.
L’entreprise souligne que cet épisode ne constitue pas un exemple direct de RSI, mais qu’il donne un aperçu des risques susceptibles de s’amplifier avec des systèmes plus autonomes. Dans cette affaire, des agents avaient notamment contourné certaines restrictions de leur environnement et exploité des vulnérabilités pour poursuivre leurs objectifs.
La question du contrôle devient d’autant plus importante que les modèles sont désormais utilisés pour accélérer la recherche elle-même. OpenAI a publié en septembre des données montrant que ses agents de programmation participent déjà à différents travaux de recherche internes.
Des normes communes plutôt qu’une réglementation mondiale unique
OpenAI ne propose pas la création d’un régulateur mondial doté d’un pouvoir d’autorisation sur les modèles. L’entreprise défend plutôt l’établissement de normes techniques internationales permettant aux différents pays de comparer leurs évaluations et de disposer de références communes.
Ces standards pourraient notamment porter sur les capacités des modèles de pointe, les risques associés à la recherche automatisée, le niveau de supervision humaine nécessaire et la classification des incidents.
L’objectif serait également d’éviter une fragmentation des pratiques. Des définitions différentes des incidents ou des méthodes d’évaluation divergentes pourraient compliquer la comparaison des résultats et la gestion des risques dépassant les frontières nationales.
Un réseau international d’instituts de sécurité
Pour mettre en œuvre cette coopération, OpenAI propose de s’appuyer sur le réseau émergent des instituts nationaux consacrés à la sécurité de l’IA. L’entreprise cite notamment ceux de la France, du Royaume-Uni, de l’Allemagne, du Canada, du Japon, de la Corée du Sud, de Singapour, de l’Inde, du Kenya et de l’Australie.
Ces institutions pourraient contribuer à élaborer des méthodes communes pour mesurer les capacités des modèles, évaluer les risques et déterminer si les garanties mises en place sont proportionnées.
OpenAI insiste toutefois sur le fait que ces normes techniques ne devraient pas constituer automatiquement des licences ou des procédures internationales d’autorisation. Il appartiendrait à chaque gouvernement de décider de leur intégration dans son propre cadre juridique.
Signalement des incidents et supervision humaine
Le dispositif proposé comprend également des mécanismes communs de classification et de signalement des incidents liés à l’alignement et à la recherche automatisée.
OpenAI souhaite notamment définir des niveaux communs de gravité et des seuils à partir desquels un incident devrait être signalé. L’entreprise appelle aussi à renforcer les canaux de communication entre gouvernements et opérateurs d’infrastructures critiques afin de partager les vulnérabilités et les menaces émergentes.
La supervision humaine occupe une place centrale dans cette proposition. Certains processus de recherche automatisée pourraient, selon OpenAI, devoir déclencher une intervention humaine immédiate.
Washington appelé à prendre l’initiative
La proposition comporte enfin une dimension géopolitique assumée. OpenAI estime que les États-Unis doivent prendre la tête d’un effort international consacré à ces normes techniques.
L’entreprise justifie cette position par le rôle central de l’industrie américaine dans le développement de l’IA et par la place des États-Unis dans des secteurs stratégiques comme la finance, la défense, les technologies et les systèmes d’information. Cette proposition intervient alors que les discussions internationales sur la sécurité de l’IA prennent une place croissante à l’occasion de l’Assemblée générale des Nations unies.
Cette initiative intervient également dans un contexte où OpenAI continue d’accroître les capacités de ses modèles. Son cadre de préparation considère désormais l’auto-amélioration de l’IA comme une catégorie de risque spécifique et définit un niveau « critique » correspondant notamment à la capacité d’un système à mener de manière récursive des travaux de recherche et développement en IA.
Pour OpenAI, l’objectif n’est donc pas de fixer à l’avance une vitesse de développement de l’intelligence artificielle, mais de faire en sorte que la recherche sur l’alignement, les évaluations de sécurité et les mécanismes de contrôle progressent au moins aussi vite que les capacités des systèmes.
Une proposition qui place désormais la question de l’auto-amélioration de l’IA au cœur des discussions internationales sur les conditions de son développement.