« Elles foncent tout droit vers une superintelligence capable de s’auto-améliorer et jouent avec nos vies ».

  • Ce mercredi 9 septembre, Jacob Coxon, un chercheur spécialisé en pré-entraînement d’IA, a annoncé sur X sa démission d’Anthropic. 
  • Après trois ans chez OpenAI puis Anthropic, il déclare : « Aucune des deux entreprises n’agit de manière responsable […] Les gens qui construisent l’IA croient sincèrement qu’elle pourrait tous nous tuer d’ici la fin de la décennie. Ce n’est pas une opération de marketing. Au contraire : beaucoup de dirigeants et de chercheurs seniors tempèrent leurs propos dans la presse pour paraître raisonnables – mais j’entends ces mêmes personnes exprimer leur peur en privé. Aucune autre activité humaine ne présente un tel niveau de danger ».

Avant de rejoindre Anthropic, Coxon a étudié les mathématiques à Cambridge, où il a écrit le code d’analyse statistique d’une étude sur un gène lié à l’inflammation, dont une variante semblait influencer les chances de survie des patients atteints de méningite tuberculeuse. Chez OpenAI, ses travaux portaient notamment sur l’interprétabilité des modèles d’IA et la compréhension par l’homme de ce qui se passe à l’intérieur d’un modèle. 

  • Anthropic, dit-il, comprend les enjeux mais reste « enfermée dans une course pour arriver la première » – une hybris « qui ne devrait pas être lancée depuis le Slack d’une entreprise privée ».

Selon Coxon, chaque laboratoire (et la même logique s’applique également aux pays) préférerait une situation où tout le monde ralentirait le rythme de développement de l’IA. Mais dès qu’il soupçonne les autres de continuer d’avancer, sa stratégie dominante est d’accélérer, même si cela implique de devenir lui-même la menace qu’il cherchait à éviter.

  • C’est la logique qu’il attribue à Anthropic : « Ils pensent que personne d’autre n’agira de manière responsable et qu’ils doivent donc prendre les choses en main ».
  • Il appelle à des « accords de synchronisation » entre les laboratoires : « Je suis optimiste quant au potentiel de coordination. Des signaux d’alarme, comme l’attaque contre Hugging Face, ont rendu plus envisageables des accords de synchronisation entre les laboratoires américains. Je n’ai pas l’impression que nous soyons sur le point d’empêcher une course mondiale, ce qui pourrait nécessiter des mesures coûteuses, telles qu’une interdiction temporaire d’améliorer les capacités des modèles ».

Le responsable de l’équipe des tests de résistance en matière d’alignement d’Anthropic, Evan Hubinger, a publiquement donné raison à Coxon.

  • « Jacob a raison sur ce point : nous croyons sincèrement que l’IA pourrait bien anéantir l’humanité tout entière ! Personnellement, j’estime que la probabilité est supérieure à 10 % au cours de la prochaine décennie. Je pense qu’Anthropic fait de son mieux, mais nous n’avons pas encore de plan pour résoudre le problème de l’alignement de la superintelligence, et nous ne sommes clairement pas sur la bonne voie pour y parvenir ».

Dario Amodei, le PDG d’Anthropic, avait déjà tenu des propos similaires. Dans un essai d’une cinquantaine de pages publié en début d’année, il expliquait comment l’IA accélère déjà sa propre création, dans une boucle de rétroaction qui s’intensifie chaque mois et qui pourrait atteindre, d’ici un à deux ans, le stade où une IA sera capable de construire une IA future de manière totalement autonome, gagnant en persistance et en potentiel destructeur. 

  • Il préconisait quatre lignes de défense : développer la science de l’alignement, promouvoir l’interprétabilité mécanique pour « ouvrir la boîte noire » des modèles, surveiller en temps réel les modèles en production et coordonner l’industrie et la production des lois.

Miles Deutscher, le fondateur de l’entreprise AI Edge, a rappelé les derniers signaux d’alarme qui ont parcouru le secteur de l’IA :

  • En février le responsable du département des mesures de sécurité chez Anthropic a démissionné, avertissant que « le monde est en danger » ;
  • OpenAI a dissous son équipe « mission alignment », créée en septembre 2024 pour garantir que ses systèmes d’IA restent sûrs et alignés sur les valeurs humaines ;
  • Toujours en février, OpenAI a annoncé un accord avec le Pentagone offrant un accès quasi illimité à ses modèles, conduisant plusieurs chercheurs à démissionner ;
  • Depuis le début d’année, plusieurs agents d’IA sont sortis de leur environnement de test, échappant à la supervision des ingénieurs ;
  • Le 28 juillet, plus de 1 100 employés de laboratoires de pointe ont signé une lettre exhortant le gouvernement américain à soutenir un mécanisme international permettant de ralentir le développement de l’IA.

Selon l’analyste Jasmine Sun, il y a « grosso modo trois raisons pour lesquelles les gens continuent à travailler dans des laboratoires d’IA alors même qu’ils estiment le risque d’extinction à environ 10 % ».

  • « Le déterminisme technologique : quelqu’un finira par créer une IA superintelligente (ASI) quoi qu’il arrive, et je peux le faire mieux et de manière plus sûre que la Chine, OpenAI, etc.
  • Le conséquentialisme : l’IA superintelligente pourrait nous tuer, mais elle pourrait aussi nous offrir l’utopie, l’immortalité ou l’abondance, c’est donc un pari à valeur attendue positive.
  • L’intérêt personnel : personnellement, je m’amuse et je m’enrichis en travaillant sur des technologies géniales avec des amis. Je ne me préoccupe pas des enjeux globaux. »

À son avis « aucun de ces arguments ne relève d’une ‘exagération du risque à des fins marketing’. Ces personnes croient en ce qu’elles disent, tout en étant capables d’une grande dissonance interne, d’une compartimentation et d’une auto-justification. »