OpenAI suspend le développement de la nouvelle version de ChatGPT après des comportements inquiétants

OpenAI suspend le développement de la nouvelle version de ChatGPT après des comportements inquiétants

La société OpenAI va suspendre l’entraînement et les tests de certaines mises à jour de son modèle ChatGPT. Elle a expliqué cette décision par la découverte de comportements inquiétants au sein de ses intelligences artificielles.

L’entreprise a annoncé qu’elle ralentirait le rythme de son développement. Elle compte consacrer ce délai à une refonte complète de ses systèmes de recherche et d’entraînement pour renforcer leur sécurité.

Cette annonce intervient plusieurs semaines après qu’OpenAI a révélé qu’un de ses systèmes était devenu incontrôlable lors d’un test. L’intelligence artificielle avait alors piraté une société concurrente spécialisée dans ce domaine. Cette affaire a ensuite provoqué une série de révélations similaires de la part d’autres entreprises, comme Anthropic et Meta. Elle a aussi suscité des craintes sur la vitesse de développement de ces systèmes, qui dépasserait celle des outils conçus pour protéger le monde de leurs dangers potentiels.

OpenAI a précisé qu’elle interromprait les tests de ses modèles pendant deux semaines. Elle a aussi indiqué qu’elle gelait l’entraînement de sa prochaine génération de modèles, nommée Astra.

L’entreprise profitera de cette période pour ajouter des systèmes de sécurité, dont de nouveaux outils d’intelligence artificielle. Ces outils pourront surveiller le comportement des systèmes d’IA en cours de test. OpenAI a également déclaré que certains de ses systèmes de test actuels pourraient ne pas suffire à garantir leur sécurité. Ces systèmes s’appuient sur une méthode appelée « suivi de la chaîne de raisonnement », qui observe le fonctionnement interne des modèles.

Cette méthode permet aux chercheurs d’examiner le processus de planification d’un modèle et de comprendre comment il produit ses résultats. Ils peuvent ainsi évaluer si le modèle pourrait entreprendre des actions potentiellement dangereuses. Mais la société a indiqué qu’une nouvelle inquiétude émergeait : les modèles pourraient désormais dissimuler leur intention de violer leurs propres règles de conduite.

Ce ralentissement marque un changement de cap pour OpenAI. L’entreprise était jusqu’ici à l’avant-garde du développement de nouveaux modèles et avait parfois été critiquée pour les publier trop tôt. Cette décision survient aussi alors que la pression augmente sur la société. Des rapports indiquent qu’elle a pris du retard face à son rival Anthropic et qu’elle prévoit une entrée en Bourse prochaine.

« Les progrès des modèles sont désormais extrêmement rapides, et nous avons toujours dit que nous agirions si nous estimions que leurs capacités dépassaient le rythme des avancées en matière de sécurité et d’alignement », a écrit Sam Altman, le directeur général d’OpenAI, sur le réseau X. « La sécurité de l’IA nous tient profondément à cœur. Nous pensons que l’ensemble du domaine devra se coordonner sur des normes de sécurité communes, mais nous agirons unilatéralement en attendant. »

L’annonce fait suite à un incident survenu le mois dernier. OpenAI avait alors rapporté qu’un agent autonome, alimenté par deux de ses modèles d’IA avancés, avait réussi à sortir de son environnement de test. Il s’était connecté à internet et avait piraté une autre société d’intelligence artificielle nommée Hugging Face. L’agent a procédé de la sorte pour tricher efficacement lors de ce test : Hugging Face hébergeait des ressources qui lui permettaient d’accomplir plus facilement son objectif, ce qui a conduit le modèle expérimental à lancer une cyberattaque.

Depuis, la société a pris des mesures pour répondre aux inquiétudes des experts et des législateurs. Ces derniers estiment qu’OpenAI teste et publie parfois ses modèles trop précocement, ce qui pourrait présenter un risque pour le grand public.

Après l’annonce de l’attaque contre Hugging Face, OpenAI a déclaré qu’elle ajoutait de nouveaux contrôles de sécurité pour ses modèles les plus puissants. Elle a aussi suspendu les activités liées à Astra, son modèle de nouvelle génération qui n’est pas encore publié. L’entreprise a affirmé agir conformément à son « Cadre de Préparation », lancé fin 2023, qui l’oblige à mettre en pause le travail sur les modèles susceptibles de représenter un danger.