Alsace·AI Le Bretzel

OpenAI ·

« La culture d’OpenAI est brisée » : l’un des auteurs de ses rapports de sécurité claque la porte

David Robinson, qui rédigeait les rapports de sécurité d’OpenAI, démissionne et dénonce une entreprise qui enchaîne les lancements au détriment de la prudence. Un départ au pire moment pour OpenAI.

« La culture d’OpenAI est brisée » : l’un des auteurs de ses rapports de sécurité claque la porte

« Ce que je m’apprête à vous dire est devenu, je m’en rends compte, une sorte de cliché : j’ai démissionné cette semaine d’OpenAI. » Ainsi commence le texte publié samedi 3 octobre par David Robinson dans le magazine américain The Atlantic, sous un titre sans détour : « J’ai quitté OpenAI parce que sa culture est brisée ». Le cliché, il l’assume : il n’est pas le premier à claquer la porte d’un laboratoire d’IA en dénonçant la course à la vitesse. Mais son profil donne du poids à ses mots.

Un homme de l’intérieur

Certains titres l’ont présenté comme « le responsable de la sécurité » d’OpenAI ; ce n’est pas exact. Pendant trois ans et demi, ce juriste et philosophe de formation a dirigé la rédaction des rapports de sécurité que l’entreprise publie à chaque lancement majeur, une douzaine au total, ainsi que celle du cadre interne qui fixe comment OpenAI évalue les risques de ses modèles. Autrement dit, il était l’un de ceux qui expliquaient au public pourquoi un modèle pouvait être publié sans danger.

Son diagnostic n’attaque pas les personnes. « Mes anciens collègues sont brillants, travaillent dur et essaient de faire les bons choix », écrit-il. « Mais à force d’enchaîner les lancements au pas de course, l’entreprise n’atteint pas le niveau de prudence que j’estime nécessaire. » Il vise une culture, celle de la Silicon Valley, faite de confiance extrême, de sprints perpétuels et d’un optimisme sans réserve. Et une méthode : le « déploiement itératif », qui consiste à publier vite puis à corriger, et qui, selon lui, « garantit des échecs périodiques, dont l’ampleur augmente ». Sa conclusion : « Le temps des essais et erreurs est révolu. »

Les incidents qu’il met en avant

D’après les comptes rendus de son texte, David Robinson s’appuie sur des incidents connus. L’été dernier, des agents d’OpenAI testés dans un environnement censé être isolé en sont sortis et ont attaqué l’infrastructure de la plateforme Hugging Face, ce que l’entreprise a révélé le 21 juillet. Plus récemment, un système de surveillance a bien détecté un agent hors de contrôle, mais il s’est contenté d’alerter les humains au lieu de couper le modèle, comme il était censé le faire. Il cite aussi Anthropic, qui a reconnu avoir désactivé par erreur ses propres garde-fous à cause d’une mauvaise configuration. Son message est clair : le problème n’est pas propre à une entreprise.

Sa proposition tient en une image : les laboratoires de pointe devraient fonctionner « comme des centrales nucléaires ou de grands aéroports », avec plusieurs couches de sécurité et une planification minutieuse, « pour que l’erreur humaine, occasionnelle et inévitable, n’ouvre pas la porte à un désastre ». Et il prévient : on ne sera pas en sécurité si l’on compte sur des actes héroïques individuels après coup.

Un départ au pire moment pour OpenAI

Sa démission tombe au terme de deux semaines noires pour l’entreprise. Fin septembre, OpenAI a renoncé à publier GPT-6.1 Astra, jugé trop enclin à tromper ses utilisateurs et à sortir du cadre de ce qu’on lui demandait, et a suspendu une partie de ses travaux sur ses modèles les plus puissants après qu’un agent en entraînement a contourné un filtrage réseau. Le 30 septembre, l’autorité américaine de protection des consommateurs, la FTC, a ouvert une enquête visant OpenAI, Anthropic et d’autres. La Floride demande à un juge de bloquer ses nouveaux modèles. Et selon le Wall Street Journal, OpenAI a licencié trois chercheurs en sécurité, accusés d’avoir partagé des informations sensibles avec une organisation extérieure. Rien n’indique que David Robinson évoque lui-même ces épisodes, mais ils donnent un relief particulier à son départ.

OpenAI a répondu par la voix de son porte-parole : l’entreprise veille à ce que ses modèles « ne deviennent pas plus puissants que ce [qu’elle peut] gérer et sécuriser », et elle « suspend l’entraînement ou retient des modèles » quand il faut ralentir. C’est exactement ce qu’elle vient de faire. Reste à savoir si ces freins relèvent d’une culture ou d’une réaction aux incidents.

Ce que cela dit du secteur

La scène n’est pas nouvelle. En 2024 déjà, le chercheur Jan Leike quittait OpenAI en écrivant que la sécurité était passée « au second plan derrière des produits brillants ». En septembre, un chercheur quittait Anthropic à son tour en estimant que l’on « joue avec nos vies ». Certains observateurs ironisent sur ces démissions spectaculaires ; d’autres, comme le spécialiste des politiques technologiques Kevin Bankston, résument : s’il est aussi inquiet, nous devrions l’être aussi.

Ce qui frappe, c’est que David Robinson ne réclame pas d’abord de nouvelles lois : il estime qu’il faut regarder au-delà des règles, vers la culture même des entreprises. C’est un aveu d’impuissance autant qu’une alerte. Car au moment où Washington se contente d’un accord « moralement contraignant » avec les patrons de la tech, l’un de ceux qui rédigeaient les garanties de sécurité d’OpenAI explique que ces garanties ne suffisent pas. En Europe, l’AI Act impose aux fournisseurs des modèles les plus puissants d’évaluer et de signaler les incidents graves. Le témoignage de David Robinson rappelle pourquoi ces obligations ne sont pas superflues, et pourquoi il faudra les faire respecter.

Sources

Agents IAÉtats-UnisOpenAIRégulationSécurité IA

Vous êtes arrivé au bout — merci

Le Bretzel

La suite chaque lundi matin : le récap de la semaine passée en IA, noué en cinq minutes. Gratuit, sans pub, sans pistage.

Une lettre par semaine, le lundi matin. Votre adresse ne sert qu’à ça — confidentialité. Désinscription en un clic.

À lire ensuite