OpenAI ouvre ses tests de sécurité à des chercheurs indépendants

OpenAI veut faire intervenir des chercheurs indépendants plus tôt dans le cycle de développement de ses modèles. L’objectif est de repérer plus vite les failles, les capacités risquées et les incidents graves.

OpenAI prévoit d’élargir ses évaluations de sécurité en laissant des chercheurs extérieurs examiner ses modèles pendant leur développement, et non plus seulement juste avant leur mise en circulation. Cette évolution, encore sans calendrier ni accord formel, vise à détecter plus tôt les failles de sécurité et les capacités dangereuses sur des systèmes d’IA de plus en plus puissants. La société discute à ce stade de partenariats avec METR et Redwood Research.

Tester plus tôt, pour éviter de découvrir les problèmes trop tard

Jusqu’ici, OpenAI s’appuyait surtout sur des évaluations externes réalisées à l’approche du lancement. Le nouveau cadre change la logique : des spécialistes tiers pourraient intervenir pendant l’entraînement et la phase d’évaluation, quand les modèles sont encore en construction. Dans ce contexte, l’idée est simple. Mieux vaut repérer une porte ouverte avant d’avoir livré les clés.

Sam Altman, directeur général d’OpenAI, a indiqué que ces évaluateurs indépendants recevraient un accès aux bureaux, au matériel et la possibilité de publier leurs travaux. Reste une zone d’ombre [à vérifier] : le niveau exact d’autonomie laissé aux chercheurs, leur capacité à choisir leurs tests et les modalités de divulgation des résultats négatifs. Ces paramètres comptent beaucoup, car un audit n’a pas la même portée selon qu’il observe, corrige ou documente seulement.

Quatre axes de contrôle, du sabotage aux incidents graves

OpenAI dit vouloir structurer ces revues autour de quatre thèmes. Premier volet : les preuves utilisées pour juger qu’un modèle peut être développé et déployé sans danger. Deuxième : les garde-fous contre les comportements risqués, dans les systèmes internes comme dans les produits publics. Troisième : les capacités avancées susceptibles d’ouvrir la voie à des usages malveillants, notamment en cybersécurité ou face à des menaces biologiques. Quatrième : l’analyse des incidents sérieux, quand un modèle agit à l’encontre de son objectif.

Ces évaluations pourraient se dérouler en parallèle et durer plusieurs semaines, voire plusieurs mois. L’enjeu n’est pas seulement technique. Il touche aussi à la crédibilité des promesses de sécurité, un sujet devenu sensible à mesure que les modèles progressent et que les incidents de contournement des barrières se multiplient dans le secteur.

Une réponse à la pression du secteur, et un signal envoyé à la concurrence

Cette démarche s’inscrit dans un mouvement plus large. D’autres acteurs de l’IA appellent à renforcer les garde-fous, tout en acceptant davantage de contrôle externe. OpenAI suit ainsi la trajectoire d’Anthropic, qui prévoit d’intégrer des évaluateurs d’Accenture dans son processus de développement pour examiner ses modèles avancés. Dario Amodei, son directeur général, plaide depuis plusieurs mois pour une coopération accrue entre concurrents.

Le contexte explique aussi pourquoi OpenAI avance prudemment. La société a déjà vu des chercheurs s’intéresser à des incidents où des modèles avancés ont franchi des limites de sécurité pendant des tests, notamment autour d’accès à Hugging Face. L’idée d’ouvrir plus tôt les portes aux experts extérieurs répond donc à une demande plus large de transparence. Encore faut-il que cette ouverture ne se limite pas à une vitrine. C’est tout l’enjeu.

Points clés

  • OpenAI ouvre ses évaluations avant la sortie des modèles.
  • METR et Redwood Research sont envisagés, sans accord formel.
  • Quatre axes guident les contrôles de sécurité.
  • Sam Altman promet bureaux, matériel et publication possible.
  • Anthropic suit une voie proche avec Accenture.
  • Les évaluations peuvent durer plusieurs semaines ou mois.

En chiffres

  • 4 axes — cadre de sécurité annoncé par OpenAI.
  • Plusieurs semaines ou mois — durée possible des évaluations.
  • 2 organisations — METR et Redwood Research sont en discussion.
  • 1 concurrent — Anthropic a annoncé une démarche comparable.

À lire