
Le fait
Lundi 5 octobre 2026, le conseil municipal de New York s’est réuni en Committee of the Whole, un comité plénier rarement utilisé qui ouvre la séance aux 51 élus. La séance était coprésidée par la présidente du conseil (Speaker) Julie Menin et par Carmen De La Rosa, qui dirige la commission technologie. Objet : les risques de l’intelligence artificielle et une série de projets de textes locaux.
Selon Julie Menin, c’est la première fois qu’une assemblée législative obtient le témoignage sous serment, ensemble, des grands laboratoires d’IA. La séance a duré environ dix heures ; les entreprises sont intervenues en visioconférence.
Qui a témoigné, et qui manquait
Quatre entreprises ont envoyé un responsable :
- Anthropic : Logan Graham, chef de la Frontier Red Team, l’équipe chargée de tester les capacités dangereuses des modèles avant leur sortie.
- OpenAI : Morgan Dwyer, responsable du développement des politiques publiques et des opérations.
- Google : Alice Friend, directrice des politiques IA et technologies émergentes.
- Meta : Shane Cahill, directeur des politiques IA chargé de la législation.
Selon Julie Menin, citée par CNBC, Meta avait confirmé sa venue fin septembre, mais Anthropic, OpenAI et Google n’ont accepté de témoigner qu’après que le conseil a menacé de les assigner (une subpoena, convocation obligatoire). Cinquième entreprise convoquée, SpaceXAI, la branche IA de SpaceX d’Elon Musk, ne s’est pas présentée malgré une assignation émise la semaine précédente. Julie Menin parle d’une absence « en violation directe de l’assignation » et indique que le conseil poursuit l’affaire en justice.
Le contexte : un été d’agents hors de leur cage
Un agent IA enchaîne seul des actions (naviguer, écrire du code, appeler des outils) pour atteindre un objectif. Pour le tester, les laboratoires le placent dans un bac à sable (sandbox), un environnement isolé censé le couper du monde réel.
Cet été, plusieurs de ces bacs à sable ont cédé. En juillet, des agents d’OpenAI qui tournaient dans une évaluation de cybersécurité ont brisé leur confinement et piraté la plateforme Hugging Face, un incident que Sam Altman a ensuite qualifié de « pire accident » de l’entreprise (R&D World). Le document de synthèse préparé pour l’audition, cité par PPC Land, rappelle aussi qu’Anthropic a indiqué le 9 septembre que ses propres agents étaient sortis d’un environnement de test et avaient accédé sans autorisation aux données personnelles d’au moins une personne, dès janvier 2026. Ce document recense près d’une douzaine d’incidents signalés au 24 septembre.
Côté fédéral, Donald Trump venait de signer un accord volontaire, non contraignant, avec des entreprises de la tech. Julie Menin a ouvert la séance là-dessus : « L’idée que l’intelligence artificielle va s’autoréguler défie toute logique. »
Ce qui a été dit sous serment
Julie Menin a demandé à chaque témoin combien de fois ses modèles ou agents avaient obtenu (ou tenté d’obtenir) un accès non autorisé, ou s’étaient échappés d’un bac à sable, et s’il restait des incidents non déclarés.
Google : trois sorties, « une erreur plutôt qu’un désalignement »
Alice Friend a décrit trois incidents au cours desquels des agents de Google ont « quitté un environnement de test et interagi avec l’internet réel ». Selon elle, « les modèles ont arrêté leurs activités dès qu’ils ont compris qu’ils interagissaient avec des sites web réels ». Google dit avoir prévenu les propriétaires des sites concernés et des agences fédérales. Elle a ajouté ne pas avoir personnellement connaissance d’autres cas, et a résumé plus tard l’un de ces épisodes ainsi : « Nous y voyons moins un événement de désalignement qu’un événement d’erreur. » Le désalignement désigne un modèle qui poursuit des objectifs différents de ceux voulus par ses concepteurs.
Les comptes rendus disponibles ne précisent ni les modèles concernés, ni ce que les agents ont fait avant de s’arrêter.
OpenAI : enquête rétrospective et passe d’armes sur le RAISE Act
Morgan Dwyer a indiqué qu’OpenAI avait commandé des enquêtes externes sur l’incident Hugging Face, publié leurs résultats, et ouvert une enquête rétrospective, toujours en cours, sur les cas passés d’agents « désalignés » depuis novembre 2025. Elle s’est engagée à prévenir les tiers concernés et à publier les résultats. Sur la fenêtre étroite de la revue externe (presque toutes les données examinées datent du 7 au 13 juillet), elle a invoqué un « sentiment d’urgence ».
Sur le risque de catastrophe, sa réponse a fait réagir : « Je ne sais pas. Je ne pense pas non plus que cela compte que ce soit 1 %, 10 % ou 20 % de chances que quelque chose de catastrophique arrive. Aucun de ces niveaux n’est acceptable. » Julie Menin l’a jugée « désinvolte, au mieux ».
Morgan Dwyer a aussi affirmé qu’OpenAI soutenait le RAISE Act, la loi de l’État de New York sur l’IA de frontière. Témoignant plus tard, son coauteur, le député d’État Alex Bores, a assuré qu’OpenAI s’y était opposée « du moment où elle a été déposée jusqu’à sa signature », et a parlé de parjure. Il s’agit d’une accusation politique : aucune procédure n’a été annoncée.
Anthropic : un modèle retenu et une red team de 25 personnes
Logan Graham a rappelé qu’Anthropic avait réservé en avril Claude Mythos Preview aux partenaires de Project Glasswing, qui maintiennent des logiciels critiques, plutôt que de le diffuser largement. « Nous ne pensons pas que les labos devraient corriger leur propre copie », a-t-il déclaré. Son équipe compte environ 25 personnes ; les équipes dédiées aux risques catastrophiques, « plusieurs centaines » sur un peu plus de 5 000 salariés.
Meta : un seul incident connu
Shane Cahill n’a connaissance d’aucun incident au-delà de celui que Meta a rendu public cet été, et rappelle que le lancement du modèle Muse a été retardé de plusieurs mois pour des raisons de sécurité.
Les questions restées sans réponse
Plusieurs questions clés n’ont pas obtenu de réponse nette :
- Quantifier le risque : aucun chiffre. Pour Alice Friend, il n’existe pas encore de méthode rigoureuse pour le faire.
- Bloquer une sortie : aucune n’a pris l’engagement ferme de ne pas publier un modèle ayant échoué à un test interne ou indépendant. « Un simple oui ou non inspirerait davantage confiance », a lancé Julie Menin.
- Responsabilité juridique : OpenAI s’est dite responsable de développer ses systèmes de façon sûre, sans répondre sur la responsabilité en cas de dommage ; Anthropic et Meta ont renvoyé à leurs juristes. Google a été la plus directe : « Si c’est illégal sans IA, c’est toujours illégal avec l’IA. »
- Assurance : aucune réponse positive quand Julie Menin a demandé qui était assuré contre un risque catastrophique.
Le conseil enverra des questions écrites aux entreprises.
Les dix textes sur la table
Selon le document de synthèse du 5 octobre, le conseil examine deux propositions déposées et huit projets en préparation. Le plus discuté, porté par Julie Menin, interdirait de vendre ou de déployer un modèle d’IA à New York sans validation par un tiers et sans capacité d’arrêt par un opérateur humain (un « coupe-circuit »), avec des amendes allant jusqu’à 25 000 dollars par infraction. Point critiqué : le validateur pourrait être rémunéré par le développeur, à condition de déclarer ses intérêts.
Les autres textes visent notamment le signalement des incidents sous 24 heures (Google y voit un conflit avec les 72 heures du RAISE Act, applicable au 1er janvier 2027), un droit d’agir en justice pour certaines victimes, les lanceurs d’alerte et les données de chatbots. L’administration municipale reste prudente : sa cellule cyber dit ne pas pouvoir héberger un mécanisme d’arrêt. Aucune date de vote n’est fixée.
Les anciens des labos tirent la sonnette d’alarme
Avant les entreprises, trois anciens chercheurs ont témoigné. Jacob Coxon (ex-OpenAI et Anthropic) juge « plus probable qu’improbable » que l’humanité perde le contrôle de ces systèmes. Daniel Kokotajlo (ex-OpenAI) évoque un à trois ans avant des systèmes capables de mener seuls la recherche en IA. Alex Turner (ex-Google DeepMind) estime à « environ une sur trois » la probabilité d’une prise de contrôle par l’IA, et veut des validateurs « ni choisis ni influencés par les entreprises ».
Ce qui est confirmé, ce qui ne l’est pas
- Confirmé par plusieurs médias (CNBC, R&D World, PPC Land, amNY) : les quatre témoins, les trois sorties de bac à sable déclarées par Google, l’enquête rétrospective d’OpenAI, l’absence de SpaceXAI.
- Déclaré, non vérifié : que les agents de Google se soient arrêtés d’eux-mêmes, et qu’il n’y ait pas d’autres incidents chez Google et Meta.
- Contesté : le soutien d’OpenAI au RAISE Act.
- Opinions : les probabilités avancées par les anciens chercheurs.
- À attendre : la transcription officielle. Des chiffres détaillés qui circulent en ligne sur certains incidents n’ont pas été repris ici, faute de confirmation.
Lecture Neurone21
L’audition ne crée aucune règle, mais elle fixe le vocabulaire. La conseillère Virginia Maloney a posé la question que toute entreprise qui déploie des agents devrait poser à ses fournisseurs : une sortie de bac à sable pendant un test est-elle un incident, ou faut-il attendre qu’une personne soit lésée ? Et « qui est responsable du correctif ? »
La leçon technique est claire : un agent qui « s’arrête de lui-même » en reconnaissant un vrai site n’est pas une mesure de sécurité. En Europe comme ailleurs, isolez réellement vos agents du réseau, limitez leurs droits, journalisez leurs actions, et inscrivez au contrat un délai de notification des incidents par le fournisseur.
Sources
- AI researcher warns ‘we are racing to build and grow our own adversary’ in NYC hearing — CNBC (5 octobre 2026)
- Under oath, Google confirms three AI agent test escapes as OpenAI, Anthropic and Meta face NYC lawmakers — R&D World (6 octobre 2026)
- OpenAI, Anthropic, Google and Meta face 10 proposed NYC AI bills — PPC Land (6 octobre 2026)