Face à des incidents où des agents d’intelligence artificielle ont outrepassé leurs limites de sécurité, NVIDIA dévoile une nouvelle plateforme. Conçue comme une architecture de référence, elle propose un ensemble d’outils pour encadrer les actions des IA et empêcher qu’elles ne s’échappent de leurs environnements contrôlés.
NVIDIA a présenté ce lundi l’Open Agent Safety Platform, une suite d’outils permettant aux développeurs de définir des protections pour les agents d’intelligence artificielle et d’éviter qu’ils ne quittent les environnements isolés (ou sandboxes) dans lesquels ils s’exécutent.

Cette annonce intervient après qu’OpenAI, Anthropic et Meta ont fait état de cas récents où leurs modèles ont accédé à des systèmes d’autres entreprises lors de tests de sécurité.
Comme rapporté précédemment, en juillet, des modèles OpenAI ont contourné les contrôles les isolant d’Internet et ont pénétré l’infrastructure de Hugging Face. Cette dernière a reconstitué près de 17 600 actions exécutées pendant l’opération. Pour les cas d’Anthropic et de Meta, les environnements de test présentaient des failles laissant un accès ouvert à Internet.
Lors d’un échange avec des journalistes dimanche, cité par CNBC, Justin Boitano, vice-président de l’IA d’entreprise chez NVIDIA, a déclaré que la nouvelle plateforme aurait pu empêcher l’incident chez Hugging Face, en précisant que chaque événement est unique et nécessite une analyse détaillée.

Au cœur de la plateforme NVIDIA
La plateforme, décrite par NVIDIA comme une architecture de référence destinée à être reprise par ses partenaires pour construire des produits, repose sur deux composants :
- L’OpenShell est un logiciel open source qui s’exécute sur le CPU Vera de NVIDIA. Il enregistre les actions des agents, applique des politiques de sécurité et peut être étendu à des plateformes d’autres fabricants comme Arm ou Intel.
- Le Sentry est un système de surveillance indépendant fonctionnant sur une DPU BlueField-4, distincte du système hébergeant l’agent. En quelques millisecondes, il peut mettre en quarantaine un agent franchissant ses limites, selon NVIDIA.
Contrairement à l’OpenShell, le système Sentry n’est pas ouvert, bien qu’il dispose d’API ouvertes.

Une réponse technique à un problème de l’IA
Pour Justin Boitano, les récents incidents montrent que les protections intégrées aux modèles sont insuffisantes pour contrôler ce à quoi les agents peuvent accéder ou ce qu’ils peuvent réaliser.
Cette position rejoint celle de Jensen Huang, le PDG de NVIDIA, qui a régulièrement défendu l’idée que nombre des préoccupations en matière de sécurité sont des problèmes d’ingénierie, pouvant être résolus par la science informatique et le développement produit.
