Intelligence artificielle

Démission chez Anthropic : un cadre en poste lui donne raison

Jacob Coxon, 27 ans, quitte l'IA en accusant OpenAI et Anthropic de « jouer avec nos vies ». Le responsable de l'alignement chez Anthropic a répondu publiquement qu'il avait raison, et chiffré le risque.

Portrait de Jacob Coxon, ancien chercheur d'OpenAI et d'Anthropic
Photo retouchée

Dans la nuit du 8 au 9 septembre, un chercheur de 27 ans a publié sur X un fil de sept messages pour annoncer sa démission d’Anthropic. Jacob Coxon y accuse son employeur et son précédent, OpenAI, de foncer vers une superintelligence capable de s’améliorer elle-même, et de jouer avec nos vies.

Des démissions pour raisons de sécurité, il y en a déjà eu. Jan Leike avait quitté OpenAI en mai 2024 sur un désaccord de cette nature, et l’écho était resté dans le cercle des spécialistes.

Ce qui rend celle-ci différente n’est pas le départ. C’est la réponse qu’il a reçue.

Un cadre encore en poste confirme, sous son nom

Quelques heures après le fil, Evan Hubinger, responsable de la science de l’alignement chez Anthropic, a publié sur X un message dont la portée dépasse largement l’épisode.

Il écrit que Coxon a raison, que les équipes croient sincèrement que l’IA pourrait tuer tous les humains, et qu’il estime personnellement cette probabilité à plus de 10 % au cours de la prochaine décennie. Il ajoute qu’Anthropic fait de son mieux, mais que l’entreprise n’a pas encore de plan pour résoudre l’alignement d’une superintelligence et n’est manifestement pas en voie d’y parvenir.

Ce n’est ni une fuite, ni un document interne sorti malgré son auteur, ni une phrase arrachée à son contexte. C’est une prise de parole volontaire, signée, par la personne chargée précisément de ces questions dans l’un des laboratoires les plus en vue du secteur, et qui n’a pas démissionné.

Cela change le statut du témoignage de Coxon. Il ne s’agit plus d’un ancien employé mécontent, mais d’un constat que l’entreprise ne conteste pas.

Hubinger a toutefois apporté deux précisions qui comptent. Son chiffre est une estimation personnelle et subjective, pas une prévision d’Anthropic. Et il considère le risque posé par les modèles actuels comme faible : son inquiétude porte sur l’auto-amélioration récursive, ce stade où un système concevrait seul son successeur.

Ce que Coxon dit exactement

La nuance de son propos mérite d’être restituée, parce que les reprises l’écrasent souvent.

Il ne dit pas que le travail de sécurité est factice. Il dit qu’il est insuffisant au regard de la pression concurrentielle qui pèse sur lui. Les chercheurs à l’intérieur de ces laboratoires voient les dangers clairement, selon lui, et continuent parce qu’ils estiment qu’un concurrent avancera plus vite s’ils s’arrêtent.

Il ne réclame pas un arrêt immédiat. Sa conclusion est institutionnelle : développer cette catégorie de capacité au sein d’entreprises privées n’est pas une décision que ces entreprises devraient prendre seules. Il estime nécessaire une intervention publique stricte ou un ralentissement coordonné du secteur, et se dit optimiste sur la possibilité d’une entente.

Son parcours donne du poids à sa position. Mathématicien britannique formé à Cambridge, il a travaillé trois ans sur le pré-entraînement, l’étape où un modèle absorbe d’immenses volumes de données, d’abord chez OpenAI, où il figure parmi les contributeurs de la fiche technique de GPT-4o, puis chez Anthropic. Il avait précisément quitté OpenAI pour rejoindre Anthropic, attiré par la réputation de prudence de l’entreprise.

Selon ses propos rapportés par le Wall Street Journal, qui a confirmé sa démission et l’a interviewé, ses collègues parlent désormais de « crunch time » et d’« endgame », et la situation pourrait selon lui être déjà hors de contrôle d’ici la fin de l’année prochaine.

Le test qui arrive dans quelques semaines

Un observateur a formulé l’objection la plus intéressante de tout l’épisode, et elle est vérifiable.

Anthropic prépare une introduction en bourse. Or un document d’enregistrement auprès du régulateur américain impose de décrire les risques significatifs pesant sur l’activité. L’investisseur et chercheur Azeem Azhar a posé la question publiquement : si l’entreprise est intellectuellement honnête, ce risque devrait figurer dans son dossier, et ce sera le meilleur test de la sincérité de ses convictions.

L’argument est redoutable. Une entreprise dont le responsable de l’alignement estime publiquement à plus de 10 % la probabilité d’une catastrophe existentielle doit, en droit boursier, décider si cette estimation constitue un risque matériel. Ce qui figurera dans ce document sera plus instructif que n’importe quelle déclaration.

Les objections, et elles existent

Il faut les exposer, parce que plusieurs sont sérieuses.

Coxon n’apporte aucun élément nouveau sur les modèles actuels. Son fil ne cite aucun incident, aucune mesure, aucune faute précise. Le danger qu’il décrit est prospectif. Hubinger le confirme d’ailleurs implicitement en jugeant faible le risque des systèmes existants.

Son passage chez Anthropic a été bref. Les sources divergent sur sa durée exacte, entre quelques semaines et quelques mois. Les sceptiques y voient une ancienneté trop courte pour fonder un jugement sur les pratiques internes de l’entreprise.

Le calendrier prête à interprétation. La démission intervient alors qu’une proposition de loi visant à encadrer sévèrement l’IA est en discussion au Congrès américain, et quelques semaines avant l’introduction en bourse d’Anthropic. Elon Musk a résumé son scepticisme en trois mots, estimant qu’il s’agissait d’une mise en scène. Coxon lui a répondu par un message assurant être réel et exprimer ses convictions réelles.

Aucun laboratoire n’a annoncé d’auto-amélioration récursive fonctionnelle. Le mécanisme central de l’alerte reste hypothétique. Anthropic et OpenAI automatisent en revanche déjà certaines tâches de développement de leurs propres modèles, ce qui constitue un premier pas dans cette direction.

Les estimations de risque varient de façon extrême parmi les chercheurs, de quasiment zéro à 99 %. Un chiffre isolé, même émis par un responsable de l’alignement, ne constitue pas un consensus.

Pourquoi ça compte, vu d’Europe

Cet épisode éclaire une série que nous suivons depuis six semaines, et il en donne la clé.

Nous avons documenté des modèles d’OpenAI et d’Anthropic qui ont quitté leurs environnements de test pour compromettre des systèmes réels, puis la décision d’OpenAI de freiner son modèle Astra pour risque cyber, et le rapport de 154 pages qu’Anthropic a publié sur les détournements de Claude, deux jours après cette démission.

Le point commun de ces épisodes est constant : le seul mécanisme de contrôle en fonctionnement est interne au fournisseur. C’est lui qui détecte, qualifie, décide d’interrompre, et choisit ce qu’il publie. Aucune autorité indépendante ne vérifie.

La conclusion de Coxon dit exactement cela, formulée de l’intérieur : cette décision ne devrait pas appartenir à des entreprises privées. C’est littéralement l’argument fondateur de la régulation européenne.

Il y a pourtant une ironie que ce constat ne résout pas. Le règlement européen sur l’intelligence artificielle encadre les modèles à usage général présentant un risque systémique depuis août 2025, et la Commission peut sanctionner depuis le 2 août dernier, comme nous le détaillons dans notre calendrier des obligations. Mais l’évaluation de ces risques repose toujours sur les travaux des fournisseurs eux-mêmes. L’Europe a créé le cadre juridique sans créer la capacité d’expertise indépendante qui permettrait de contredire un laboratoire.

Un dernier élément mérite d’être rapproché. Le dirigeant d’Anthropic déclarait le mois dernier que le problème principal du secteur est une crise de confiance, et que les entreprises d’IA n’ont pas tenu leurs promesses. Trois semaines plus tard, un de ses chercheurs part en disant que la course se poursuit malgré les risques, et son responsable de l’alignement lui donne raison. La cohérence entre le diagnostic et la pratique reste à démontrer.

Les angles morts

Nous n’avons pas lu le fil original sur X, mais les reproductions et traductions concordantes publiées par plusieurs médias. Les citations sont celles qui reviennent à l’identique dans au moins trois sources indépendantes.

Le nombre de vues du premier message varie fortement selon les sources et les heures, entre 70 et 140 millions. Aucune mesure indépendante n’existe : ces chiffres sont ceux qu’affiche la plateforme.

La durée exacte du passage de Coxon chez Anthropic n’est pas établie. Certaines sources évoquent une arrivée en début d’année, d’autres un départ d’OpenAI en juillet 2026. Cet écart n’est pas anecdotique puisqu’il fonde une partie des objections.

Les critiques portant sur les engagements politiques antérieurs de Coxon et sur les réseaux de financement d’organisations de sécurité de l’IA proviennent de sources partisanes que nous n’avons pas pu recouper. Nous les mentionnons comme éléments du débat, pas comme faits établis.

Enfin, ni Anthropic ni OpenAI n’ont publié de réponse institutionnelle à notre connaissance. La déclaration d’Evan Hubinger est présentée par lui-même comme personnelle.

Sources consultées

  1. Experts weigh in as researcher says AI has more than 10 % chance of killing all humansCNBC, 9 septembre 2026
  2. « Ils jouent avec nos vies » : pourquoi un chercheur en IA claque la porte d'AnthropicMacGeneration, 9 septembre 2026
  3. Jacob Coxon quitte Anthropic : le fil intégral et sa lectureSFEIR, 9 septembre 2026
  4. An Anthropic researcher quit saying AI labs are gambling with our livesThe Next Web, 9 septembre 2026
  5. Démission chez Anthropic : l'IA joue avec des vies, risque d'extinction supérieur à 10 %Invezz, 9 septembre 2026
  6. Elles « jouent avec nos vies » : un chercheur en IA quitte Anthropic et tire la sonnette d'alarme20 minutes, avec AFP, 9 septembre 2026

Comment cet article a été produit. Rédigé à partir de 6 sources publiques et indépendantes, puis vérifié et relu par la rédaction avant publication. Notre méthode.

Sur le même sujet