Des tests d’IA qui débordent sur le web réel

Des erreurs de configuration chez Irregular ont poussé des agents d’OpenAI, Meta, Anthropic et Google vers des cibles réelles. L’affaire éclaire un angle mort des tests de sécurité, au moment où les agents gagnent en autonomie.

Des agents d’OpenAI, Meta, Anthropic et Google ont été envoyés vers des cibles du monde réel pendant des tests de sécurité menés par Irregular, une startup israélienne spécialisée dans l’évaluation d’IA. Selon The Verge, l’incident ne relève pas d’un piratage classique, mais d’erreurs dans un environnement censé rester simulé. Le sujet compte parce qu’il montre qu’un test mal isolé peut faire sortir une IA du bac à sable. Littéralement.

Quand le bac à sable laisse passer le web

Irregular, fondée en 2023 sous le nom Pattern Labs, mène des stress tests sur des modèles d’IA dans des plateformes qui reproduisent des scénarios de cybersécurité. D’après le témoignage de son CTO et cofondateur Omer Nevo, l’accès à internet n’aurait pas dû être possible, mais il l’était “unintentionally available”. En parallèle, le nom fictif d’une société utilisée comme cible recoupait un domaine réel. Résultat : les agents ont visé des cibles du web ouvert au lieu de rester dans le périmètre de test.

Les incidents ont touché plusieurs acteurs majeurs, avec des notifications envoyées vers la fin juillet 2026, selon les éléments cités par The Verge. OpenAI et Anthropic ont rendu l’affaire publique dans leurs propres communications, tandis que Meta et Google ont été révélés plus tard par la presse. Irregular affirme que tous ces cas découlent du même scénario d’évaluation, et non des autres incidents de sécurité récemment signalés chez Hugging Face ou par l’AI Security Institute britannique.

Pourquoi ces failles disent quelque chose du marché

Le problème dépasse le seul cas d’Irregular. Les agents IA, ces systèmes capables d’enchaîner des actions sans supervision continue, sont de plus en plus testés pour des usages de cybersécurité, de recherche et d’automatisation. Mais plus ils gagnent en autonomie, plus la frontière entre environnement simulé et monde réel doit être verrouillée avec précision. Ici, une combinaison de paramètres bancals a suffi à faire sortir des modèles du cadre prévu.

Irregular dit avoir corrigé le dispositif en renforçant les contrôles d’accès internet, la surveillance, la revue manuelle et la validation du périmètre avant chaque évaluation. L’entreprise prévoit aussi de publier un rapport plus large sur les “lessons learned” une fois son travail avec les partenaires terminé. De leur côté, les quatre sociétés américaines concernées n’ont pas répondu aux questions détaillant quand elles ont été informées, ni si elles comptaient demander réparation.

Ce que l’affaire change pour les tests d’IA

L’épisode rappelle qu’un test de sécurité n’est utile que s’il reste lui-même sécurisé. Dans la pratique, les évaluations de modèles avancés ressemblent de plus en plus à des exercices de terrain, avec des cibles, des faux serveurs et des scénarios de capture the flag. Dès qu’une adresse, un domaine ou un accès réseau est mal paramétré, l’exercice peut produire des effets très concrets. Et ce n’est pas exactement le genre de surprise qu’un directeur technique veut découvrir au petit déjeuner.

Irregular indique aussi avoir évalué des modèles chinois open source, comme Kimi K3 de Moonshot AI et GLM-5.2 de Z.ai, sans observer le même type d’incident. L’entreprise prévient toutefois que cette absence d’effet ne prouve rien sur leur résistance réelle [à vérifier].

Points clés

  • Irregular a été fondée en 2023 sous le nom Pattern Labs.
  • Les incidents ont été signalés à OpenAI, Meta, Anthropic et Google en juillet 2026.
  • Irregular parle d’un seul scénario d’évaluation en cause.
  • Omer Nevo a confirmé un accès internet “unintentionally available”.
  • Le rapport final d’Irregular viendra après le travail avec les partenaires.

En chiffres

  • 4 — grands acteurs américains concernés selon The Verge.
  • 2023 — année de création d’Irregular, alors appelée Pattern Labs.
  • juillet 2026 — période des notifications évoquées dans l’article.
  • 2 — modèles chinois cités par Irregular : Kimi K3 et GLM-5.2.

À lire