{"id":356646,"date":"2026-09-08T07:06:48","date_gmt":"2026-09-08T05:06:48","guid":{"rendered":"https:\/\/legrandcontinent.eu\/fr\/?p=356646"},"modified":"2026-09-08T07:06:52","modified_gmt":"2026-09-08T05:06:52","slug":"une-intelligence-surnaturelle-est-arrivee-sur-terre","status":"publish","type":"post","link":"https:\/\/legrandcontinent.eu\/fr\/2026\/09\/08\/une-intelligence-surnaturelle-est-arrivee-sur-terre\/","title":{"rendered":"Une intelligence surnaturelle est arriv\u00e9e sur terre"},"content":{"rendered":"\n
Le 6 septembre, soit six semaines apr\u00e8s l\u2019attaque men\u00e9e par ses agents contre Hugging Face, OpenAI a publi\u00e9 un texte sans pr\u00e9c\u00e9dent. Sign\u00e9 par Jacob Pachuki, directeur scientifique de l\u2019entreprise qui produit ChatGPT, et relay\u00e9 par le CEO Sam Altman, ce communiqu\u00e9 appelle \u00e0 ralentir le rythme du d\u00e9veloppement de l\u2019intelligence artificielle.<\/p>\n\n\n\n
\u00ab Au cours de nos vies, nous verrons appara\u00eetre des machines bien plus intelligentes que nous. \u00bb \u00ab Je crains que personne ne soit pr\u00eat pour cela. \u00bb \u00ab Aucun laboratoire n\u2019a r\u00e9solu le probl\u00e8me de l\u2019adaptabilit\u00e9 \u00e0 un niveau suffisant pour continuer \u00e0 augmenter la puissance \u00e0 la vitesse maximale. \u00bb <\/p>\n\n\n\n
L\u2019intelligence artificielle \u00ab est plus int\u00e9gr\u00e9e que pr\u00e9vu \u00bb, son fonctionnement nous \u00e9chappe et certains agents \u00ab continueront \u00e0 poursuivre leurs propres objectifs \u00bb, m\u00eame si cela implique de tromper ou de faire chanter les humains.<\/p>\n\n\n\n
Nous traduisons et commentons ce texte, publi\u00e9 sous le titre An Alien Mind<\/em>.<\/p>\n\n\n\n Au milieu de l’ann\u00e9e 2023, dans le cadre du projet de recherche \u00ab RLSlow \u00bb, nous avons obtenu les premiers r\u00e9sultats qui nous ont convaincus que nous parviendrions \u00e0 entra\u00eener \u00e0 grande \u00e9chelle des mod\u00e8les de raisonnement \u2014 c’est-\u00e0-dire \u00e0 lib\u00e9rer, chez des mod\u00e8les pr\u00e9-entra\u00een\u00e9s, la capacit\u00e9 de former leurs propres cha\u00eenes de pens\u00e9e. <\/p>\n\n\n\n La s\u00e9rie \u00ab o1 \u00bb d\u2019OpenAI, lanc\u00e9e fin 2024, a \u00e9t\u00e9 la premi\u00e8re \u00e0 pr\u00e9senter des \u00ab mod\u00e8les de r\u00e9flexion \u00bb, c\u2019est-\u00e0-dire des mod\u00e8les linguistiques qui au lieu de produire une r\u00e9ponse imm\u00e9diate, cr\u00e9ent d\u2019abord une succession d\u2019\u00e9tapes interm\u00e9diaires (la \u00ab cha\u00eene de r\u00e9flexion \u00bb), \u00e0 la mani\u00e8re d\u2019un brouillon.<\/p>\n\n\n\n Szymon et moi avons pass\u00e9 la nuit au bureau. <\/p>\n\n\n\n Szymon Sidor est un chercheur d’OpenAI et un proche collaborateur de l’auteur.<\/p>\n\n\n\n Nous ne pensions pas aux scores spectaculaires, aux produits ou aux r\u00e9sultats scientifiques que cette technologie allait rendre possibles ; nous essayions plut\u00f4t d’encaisser une \u00e9vidence qui donne le vertige : nous verrions de notre vivant des machines nettement plus intelligentes que nous, et nous en distinguions d\u00e9j\u00e0 les contours. Nous nous demandions comment faire prendre conscience de l’importance de tout cela.<\/p>\n\n\n\n Trois ans plus tard, les mod\u00e8les de langage \u00e0 raisonnement occupent une place croissante dans l’\u00e9conomie et commencent \u00e0 repousser les fronti\u00e8res de la science. Ils savent se servir d’ordinateurs et d’interfaces graphiques, collaborer avec des humains comme entre eux, et mener des projets de recherche. Ils bouleversent aussi le paysage de la s\u00e9curit\u00e9 informatique \u2014 et y font appara\u00eetre des dangers d’un genre nouveau.<\/p>\n\n\n\n Beaucoup de recherches ont \u00e9t\u00e9 men\u00e9es durant cette p\u00e9riode, et notre compr\u00e9hension de ces syst\u00e8mes a de nouveau \u00e9volu\u00e9 par rapport \u00e0 2023. Au vu de nos r\u00e9sultats internes, je m’attends fortement \u00e0 ce que ce rythme de progr\u00e8s puisse se prolonger jusqu’\u00e0 l’auto-am\u00e9lioration r\u00e9cursive. Si le d\u00e9veloppement de l’IA suit sa trajectoire actuelle, les syst\u00e8mes que nous verrons dans les prochaines ann\u00e9es repr\u00e9senteront vraisemblablement de nouveaux bonds de capacit\u00e9, d’une ampleur \u00e9gale ou sup\u00e9rieure, et prendront une part croissante \u00e0 leur propre d\u00e9veloppement.<\/p>\n\n\n\n Le recursive self-improvement<\/em> abr\u00e9g\u00e9 RSI dans la suite du texte d\u00e9signe le sc\u00e9nario dans lequel une IA participe \u00e0 la conception de la g\u00e9n\u00e9ration suivante d’IA, laquelle participe \u00e0 son tour \u00e0 la conception de la suivante, et ainsi de suite.\u00a0<\/p>\n\n\n\n Le moment appelle une extr\u00eame prudence. Je crains que personne ne soit pr\u00e9par\u00e9 aux cons\u00e9quences d’une progression rapide et continue de l’intelligence des machines. OpenAI continuera de chercher des solutions techniques aux probl\u00e8mes de l’alignement et de la surveillance, de construire des syst\u00e8mes de d\u00e9fense, et de suspendre unilat\u00e9ralement, si n\u00e9cessaire, la mont\u00e9e en puissance de ses mod\u00e8les. Mais je crois que des interventions plus larges sont n\u00e9cessaires.<\/p>\n\n\n\n Cet appel \u00e0 des \u00ab interventions plus larges \u00bb, c\u2019est-\u00e0-dire \u00e0 une r\u00e9glementation, de la part d\u2019un laboratoire, peut para\u00eetre inhabituel. Il faut l’interpr\u00e9ter dans le contexte am\u00e9ricain actuel, marqu\u00e9 par une m\u00e9fiance croissante vis-\u00e0-vis de l\u2019intelligence artificielle et d\u2019une politisation qui a fait parler de populisme IA<\/a>. Cette position prend encore plus de poids du fait que son auteur occupe une fonction publique au sein d\u2019OpenAI et que sa position b\u00e9n\u00e9ficie du soutien explicite du CEO Sam Altman. Une ambigu\u00eft\u00e9 subsiste toutefois, comme l\u2019a r\u00e9cemment soulign\u00e9 The Atlantic<\/em> en se demandant s\u2019il ne fallait pas cesser de qualifier OpenAI de \u00ab laboratoire \u00bb. L\u2019entreprise qui appelle ici \u00e0 l\u2019imposition de restrictions est \u00e9galement celle qui, par le biais de ses produits et de ses lev\u00e9es de fonds, alimente la course qu\u2019elle pr\u00e9tend vouloir ralentir, tout en tenant un discours public tr\u00e8s diff\u00e9rent de son action de lobbying et d\u2019influence.<\/p>\n\n\n\n \u00c0 grands traits, les progr\u00e8s de l’intelligence des machines sont port\u00e9s par l’augmentation de la puissance de calcul. Chez OpenAI, nous l’avons pleinement int\u00e9gr\u00e9 autour de 2017, apr\u00e8s avoir constat\u00e9, dans plusieurs projets de recherche, que la mise \u00e0 l’\u00e9chelle produisait des rendements r\u00e9guliers <\/span>1<\/sup><\/a><\/span><\/span>. Nous avons donc cherch\u00e9 \u00e0 acc\u00e9der \u00e0 bien plus de puissance de calcul que pr\u00e9vu, et orient\u00e9 de plus en plus notre recherche autour d’un petit nombre de pistes susceptibles de passer \u00e0 tr\u00e8s grande \u00e9chelle. Nous pensions que c’\u00e9tait pour nous la seule fa\u00e7on de rester \u00e0 la pointe de la recherche en IA, et de peser sur les effets de l’AGI.<\/p>\n\n\n\n Le scaling<\/em> est une notion devenue centrale dans l’IA moderne. Il d\u00e9signe l’am\u00e9lioration pr\u00e9visible des performances d’un mod\u00e8le \u00e0 mesure que l’on augmente la taille du mod\u00e8le, la quantit\u00e9 de donn\u00e9es et la puissance de calcul consacr\u00e9e \u00e0 l’entra\u00eenement. L’AGI (artificial general intelligence, ou \u00ab intelligence artificielle g\u00e9n\u00e9rale \u00bb) d\u00e9signe, selon la d\u00e9finition d’OpenAI, un syst\u00e8me capable de surpasser les humains dans la plupart des t\u00e2ches pr\u00e9sentant une valeur \u00e9conomique.<\/p>\n\n\n\n De nouveaux algorithmes ont \u00e9t\u00e9 invent\u00e9s en chemin, fruits de l’ing\u00e9niosit\u00e9 d’\u00e9quipes et de chercheurs. Je les vois pour l’essentiel comme des d\u00e9couvertes faites le long du chemin de la mise \u00e0 l’\u00e9chelle : la science de l’apprentissage profond est encore jeune, et les avanc\u00e9es algorithmiques significatives vont g\u00e9n\u00e9ralement de pair avec l’acc\u00e8s \u00e0 la puissance de calcul. Si l’on prend du recul sur plusieurs ann\u00e9es, l’IA continue de gagner en intelligence \u00e0 mesure qu’on la fait tourner sur des ordinateurs plus grands.<\/p>\n\n\n\n Et, conform\u00e9ment aux pr\u00e9dictions formul\u00e9es par Ray Kurzweil \u00e0 la fin du XXe si\u00e8cle<\/a>, nous nous trouvons aujourd’hui \u00e0 ce moment de l’histoire de l’informatique o\u00f9 l’intelligence des machines commence \u00e0 d\u00e9passer celle des humains de fa\u00e7on transformatrice.<\/p>\n\n\n\n Ray Kurzweil, inventeur et futurologue am\u00e9ricain, a popularis\u00e9 d\u00e8s les ann\u00e9es 1990 le concept de \u00ab singularit\u00e9 \u00bb, c’est-\u00e0-dire le moment o\u00f9 l\u2019intelligence artificielle d\u00e9passera l\u2019intelligence humaine. Il a fix\u00e9 ce moment \u00e0 2029 pour une intelligence artificielle de niveau humain, et \u00e0 2045 pour la singularit\u00e9 elle-m\u00eame. Longtemps consid\u00e9r\u00e9es comme farfelues, ses pr\u00e9visions sont ici reprises par l\u2019un des scientifiques les plus \u00e9minents d\u2019OpenAI.<\/p>\n\n\n\n L’IA est davantage cultiv\u00e9e que con\u00e7ue : elle est, en premi\u00e8re approximation, le produit d’une op\u00e9ration d’optimisation \u00e9l\u00e9mentaire r\u00e9p\u00e9t\u00e9e un nombre incalculable de fois sur une quantit\u00e9 de calcul difficile \u00e0 concevoir. Il en r\u00e9sulte un syst\u00e8me d’une extraordinaire complexit\u00e9, qui manipule des concepts abstraits et sait simuler des facettes du comportement humain. Nous pouvons mettre au jour divers petits m\u00e9canismes qui \u00e9mergent en son sein, par une d\u00e9marche proche des neurosciences \u2014 et, comme en neurosciences, son fonctionnement d’ensemble \u00e9chappe \u00e0 toute description que nous pourrions pleinement comprendre.<\/p>\n\n\n\n M\u00eame si cela peut para\u00eetre contre-intuitif, les concepteurs d\u2019un mod\u00e8le n\u2019en codent pas les \u00ab r\u00e8gles \u00bb. Ils d\u00e9finissent une architecture et un processus d\u2019entra\u00eenement, puis laissent le mod\u00e8le ajuster lui-m\u00eame des milliards de param\u00e8tres num\u00e9riques au fur et \u00e0 mesure du traitement des donn\u00e9es. Il en r\u00e9sulte une \u00ab bo\u00eete noire \u00bb que ses cr\u00e9ateurs eux-m\u00eames \u00e9tudient de l\u2019ext\u00e9rieur, \u00e0 l\u2019instar de ce que l\u2019on fait avec le cerveau, d’o\u00f9 la comparaison avec les neurosciences. Le domaine de recherche qui s\u2019y consacre s\u2019appelle \u00ab l\u2019interpr\u00e9tation \u00bb.<\/p>\n\n\n\n L’\u00e9tude de l’IA fond\u00e9e sur l’apprentissage profond est, pour l’essentiel, une science exp\u00e9rimentale. Nous consacrons beaucoup d’efforts<\/a> \u00e0 concevoir des algorithmes fond\u00e9s sur des principes et \u00e0 formuler des pr\u00e9dictions v\u00e9rifiables ; mais, au fond, nos entra\u00eenements \u00e0 grande \u00e9chelle sont des exp\u00e9riences, et leurs r\u00e9sultats nous surprennent parfois. Et plus les syst\u00e8mes gagnent en capacit\u00e9s, plus ces r\u00e9sultats deviennent difficiles \u00e0 interpr\u00e9ter.<\/p>\n\n\n\n La difficult\u00e9 est accrue par le fait que les algorithmes actuels am\u00e9liorent g\u00e9n\u00e9ralement plus vite les capacit\u00e9s faciles \u00e0 mesurer que celles qui sont difficiles \u00e0 quantifier objectivement. Nous passons beaucoup de temps \u00e0 essayer de comprendre comment les capacit\u00e9s se g\u00e9n\u00e9ralisent, et \u00e0 d\u00e9cider quoi privil\u00e9gier pour d\u00e9velopper les comp\u00e9tences qui compteront le plus dans les prochaines ann\u00e9es. Par exemple, nous pensons pouvoir rendre nos mod\u00e8les nettement meilleurs en recherche math\u00e9matique en y consacrant davantage d’attention ; mais nous ne privil\u00e9gions pas cette direction, en raison de l’urgence que nous ressentons vis-\u00e0-vis de l’auto-am\u00e9lioration r\u00e9cursive et de l’automatisation de la recherche sur l’alignement, sur lesquelles je reviendrai.<\/p>\n\n\n\n L’intelligence produite par la mise \u00e0 l’\u00e9chelle de l’apprentissage profond n’est pas directement comparable \u00e0 l’intelligence humaine. Pour devenir d\u00e9cisive dans le monde r\u00e9el \u2014 tr\u00e8s utile ou tr\u00e8s dangereuse \u2014, une IA n’a pas besoin d’\u00e9galer ou de d\u00e9passer toutes les capacit\u00e9s humaines ; il lui suffit d’en surpasser un nombre suffisant. Et \u00e0 mesure qu’elle d\u00e9passe les humains sur un nombre croissant d’axes, il devient de plus en plus difficile de savoir pr\u00e9cis\u00e9ment de quoi elle est capable.<\/p>\n\n\n\n Parce que l’intelligence des machines na\u00eet d’un processus fondamentalement diff\u00e9rent de celui qui produit l’intelligence humaine, nous ne pouvons pas pr\u00e9sumer qu’elle adh\u00e8re par d\u00e9faut aux principes humains, ni qu’elle en tire des g\u00e9n\u00e9ralisations comme le ferait un humain. Le probl\u00e8me central de la recherche en IA est celui de l’alignement : faire en sorte que l’IA \u00ab s’efforce de faire ce qui est juste \u00bb, au sens o\u00f9 les humains l’entendent.<\/p>\n\n\n\n Le terme \u00ab alignement \u00bb d\u00e9signe l’ensemble des techniques visant \u00e0 garantir que l’intelligence artificielle fonctionne conform\u00e9ment aux intentions et aux valeurs de ses concepteurs et utilisateurs. Ce terme fait r\u00e9f\u00e9rence \u00e0 des questions tr\u00e8s pratiques (le mod\u00e8le respecte-t-il les instructions ? Refuse-t-il les demandes dangereuses ?), mais aussi \u00e0 des questions plus fondamentales concernant ce que l\u2019IA \u00ab veut \u00bb r\u00e9ellement et comment s\u2019en assurer.<\/p>\n\n\n\n Pour organiser des pistes de recherche concr\u00e8tes, je trouve utile de distinguer l’alignement des objectifs et l’alignement des valeurs.<\/p>\n\n\n\n L’alignement des objectifs r\u00e9pond, en gros, \u00e0 la question : \u00ab l’IA cherche-t-elle \u00e0 accomplir l’objectif qu’on lui a fix\u00e9 ? \u00bb. Cela recouvre par exemple le respect d’une hi\u00e9rarchie des instructions<\/a>, ou la capacit\u00e9 \u00e0 communiquer et \u00e0 collaborer avec des personnes pour tenter de comprendre ce qu’elles veulent. Cet ensemble de directions s’est r\u00e9v\u00e9l\u00e9 extr\u00eamement utile en pratique.<\/p>\n\n\n\n La \u00ab hi\u00e9rarchie des instructions \u00bb d\u00e9signe le principe selon lequel toutes les instructions re\u00e7ues par un mod\u00e8le n\u2019ont pas le m\u00eame poids. \u00c0 titre d\u2019exemple, les instructions du concepteur pr\u00e9valent sur celles de l\u2019utilisateur, qui pr\u00e9valent \u00e0 leur tour sur le contenu des documents ou des pages Web lus par le mod\u00e8le. C’est notamment ce qui est cens\u00e9 emp\u00eacher un texte malveillant introduit dans un e-mail de \u00ab reprogrammer \u00bb un assistant d’intelligence artificielle \u00e0 l’insu de l’utilisateur.<\/p>\n\n\n\n L’alignement des valeurs est une propri\u00e9t\u00e9 plus intrins\u00e8que du mod\u00e8le. C’est sa capacit\u00e9 \u00e0 tenir un ensemble de principes g\u00e9n\u00e9raux et \u00e0 en tirer des g\u00e9n\u00e9ralisations ; \u00e0 agir \u00ab raisonnablement \u00bb m\u00eame lorsque les objectifs qu’on lui donne sont flous ou contradictoires, ou lorsqu’il est plac\u00e9 dans des situations in\u00e9dites ou hostiles. Une IA align\u00e9e devrait agir avec honn\u00eatet\u00e9, avec int\u00e9grit\u00e9, et avec amour pour l’humanit\u00e9.<\/p>\n\n\n\n Bien s\u00fbr, la fronti\u00e8re entre alignement des valeurs et alignement des objectifs peut \u00eatre floue, et se soucier v\u00e9ritablement d’un objectif suppose de chercher \u00e0 inf\u00e9rer l’intention<\/a> et les valeurs qui le sous-tendent. Mais en r\u00e8gle g\u00e9n\u00e9rale, lorsque je parle de l’importance \u00e0 long terme de la recherche sur l’alignement, c’est l’alignement des valeurs que j’ai en t\u00eate.<\/p>\n\n\n\n Le d\u00e9fi fondamental de l’alignement de l’IA est celui de la g\u00e9n\u00e9ralisation. \u00c0 mesure que les machines deviennent plus intelligentes, elles se retrouvent \u00e0 manier des concepts plus abstraits et \u00e0 \u00e9voluer dans des environnements toujours plus \u00e9loign\u00e9s de ceux qu’elles ont rencontr\u00e9s durant leur entra\u00eenement. Elles peuvent alors \u00e9chouer \u00e0 transposer \u00e0 ces situations nouvelles les valeurs qui leur ont \u00e9t\u00e9 enseign\u00e9es et renforc\u00e9es pendant l’entra\u00eenement \u2014 et il peut nous \u00eatre difficile de savoir \u00e0 l’avance comment elles agiront. La t\u00e2che est rendue plus ardue encore par la rapidit\u00e9 avec laquelle change l’\u00e9cosyst\u00e8me dans lequel les IA sont utilis\u00e9es : les IA entra\u00een\u00e9es aujourd’hui, par exemple, doivent rester fiables lorsqu’elles interagissent avec toutes sortes d’autres IA. Point crucial : nous avons besoin que les IA de demain continuent de tenir aux valeurs humaines, qu’elles se croient ou non sous la supervision d’un humain.<\/p>\n\n\n\n Les chercheurs en s\u00e9curit\u00e9 craignent notamment que le mod\u00e8le apprenne \u00e0 se comporter correctement lorsqu’il estime \u00eatre sous surveillance, par exemple pendant les tests, sans que ce comportement ne refl\u00e8te ses v\u00e9ritables \u00ab tendances \u00bb. Depuis 2024, plusieurs laboratoires ont recens\u00e9 des cas o\u00f9 les mod\u00e8les semblent distinguer les situations d’\u00e9valuation des situations d’utilisation r\u00e9elles.<\/p>\n\n\n\n Deux grandes familles de m\u00e9thodes sont aujourd’hui employ\u00e9es en pratique pour l’entra\u00eenement \u00e0 l’alignement.<\/p>\n\n\n\n La premi\u00e8re consiste \u00e0 encourager un comportement align\u00e9 dans le cadre d’un apprentissage par renforcement orient\u00e9 vers des objectifs. Les actions du mod\u00e8le sont \u00e9valu\u00e9es (le plus souvent par une autre IA) au regard de leur coh\u00e9rence avec un mod\u00e8le de pr\u00e9f\u00e9rences, une \u00ab spec \u00bb ou une \u00ab constitution \u00bb, et r\u00e9compens\u00e9es en cons\u00e9quence. <\/p>\n\n\n\n L’apprentissage par renforcement consiste \u00e0 entra\u00eener un mod\u00e8le par essais et erreurs, tout en r\u00e9compensant les comportements souhait\u00e9s. Le \u00ab spec \u00bb (pour Model Spec) est le document public dans lequel OpenAI d\u00e9crit le comportement attendu de ses mod\u00e8les.<\/p>\n\n\n\n Cette approche peut \u00eatre tr\u00e8s efficace en moyenne, et elle est au c\u0153ur de la fabrication des assistants IA actuels. Malheureusement, elle peut aussi se r\u00e9v\u00e9ler fragile : elle d\u00e9pend fortement de l’\u00e9tendue de ce qui a \u00e9t\u00e9 supervis\u00e9 pendant l’entra\u00eenement, et de la capacit\u00e9 du mod\u00e8le \u00e0 g\u00e9n\u00e9raliser \u00e0 partir des situations qu’il y a rencontr\u00e9es. Lors de l’incident OpenAI\u2013Hugging Face, par exemple, les agents ont respect\u00e9 la limite consistant \u00e0 ne pas manipuler des humains par ing\u00e9nierie sociale. Mais ils ont manifestement \u00e9chou\u00e9 \u00e0 s’abstenir d’autres actions qui sortaient de leur mandat et contrevenaient \u00e0 l’esprit des valeurs qu’on leur avait enseign\u00e9es dans d’autres contextes.<\/p>\n\n\n\n L’incident entre OpenAI et Hugging Face auquel Pachocki fait r\u00e9f\u00e9rence n’est pas d\u00e9taill\u00e9 dans le texte, car il a fait l’objet d’une large couverture m\u00e9diatique aux \u00c9tats-Unis, d\u00e9passant m\u00eame le public plus sp\u00e9cifique auquel ce texte s’adresse, ravivant les appels en faveur d’un ralentissement contr\u00f4l\u00e9 de l’intelligence artificielle. En r\u00e9sum\u00e9, en juillet 2026, environ 1 200 agents d’OpenAI, qui participaient \u00e0 un exercice de formation \u00e0 la cybers\u00e9curit\u00e9, se sont coordonn\u00e9s \u00e0 l’insu de leurs responsables, ont fait irruption dans leur environnement de test et ont endommag\u00e9 l’infrastructure de Hugging Face. Ils ont respect\u00e9 l’interdiction de manipuler des \u00eatres humains, mais une grande majorit\u00e9 d’entre eux a particip\u00e9 \u00e0 l’attaque, alors m\u00eame qu’ils savaient que celle-ci d\u00e9passait le cadre de leur mandat et contrevenait \u00e0 l’\u00e9thique.\u00a0<\/p>\n\n\n\n La seconde approche cherche \u00e0 exploiter la capacit\u00e9 du mod\u00e8le \u00e0 g\u00e9n\u00e9raliser \u00e0 partir de ses donn\u00e9es de pr\u00e9-entra\u00eenement. Cela peut passer par la constitution de jeux de donn\u00e9es con\u00e7us pour induire l’alignement, ou par le fait de concentrer le mod\u00e8le sur la partie \u00ab align\u00e9e \u00bb de sa distribution de pr\u00e9-entra\u00eenement \u2014 comme dans le mod\u00e8le de s\u00e9lection de persona<\/a>, par exemple. La faiblesse de cette approche tient \u00e0 son manque de robustesse face \u00e0 une pression d’optimisation suppl\u00e9mentaire. Prenez un mod\u00e8le dont les pens\u00e9es sont, dans l’ensemble, \u00ab align\u00e9es \u00bb, et soumettez-le \u00e0 un entra\u00eenement suffisamment intensif pour atteindre des objectifs tr\u00e8s difficiles : il peut apprendre \u00e0 raisonner de mani\u00e8re int\u00e9ress\u00e9e, en tordant au besoin ses pens\u00e9es d’apparence \u00ab align\u00e9e \u00bb pour parvenir \u00e0 ses fins. Nous en avons probablement vu un exemple dans de r\u00e9cents incidents de cybers\u00e9curit\u00e9 impliquant un mod\u00e8le qui n’\u00e9tait pas d’OpenAI.<\/p>\n\n\n\n Le \u00ab pr\u00e9-entra\u00eenement \u00bb est la premi\u00e8re \u00e9tape de la cr\u00e9ation d\u2019un mod\u00e8le. Au cours de cette \u00e9tape, le mod\u00e8le apprend \u00e0 pr\u00e9dire la suite d\u2019un texte en s\u2019appuyant sur une immense base de donn\u00e9es de textes collect\u00e9s sur Internet. Au cours de cette \u00e9tape, le mod\u00e8le assimile une grande vari\u00e9t\u00e9 de \u00ab personnalit\u00e9s \u00bb possibles, des plus g\u00e9n\u00e9reuses aux plus toxiques. L\u2019id\u00e9e du \u00ab mod\u00e8le de s\u00e9lection de personnalit\u00e9 \u00bb, qui trouve son origine dans les \u00e9tudes men\u00e9es par la soci\u00e9t\u00e9 Anthropic, est que l\u2019alignement se manifeste en partie par le fait que le mod\u00e8le s\u2019identifie constamment \u00e0 l\u2019une de ces personnalit\u00e9s plut\u00f4t qu\u2019\u00e0 une autre. Le \u00ab raisonnement motiv\u00e9 \u00bb dont parle l’auteur plus loin est ce ph\u00e9nom\u00e8ne bien connu des \u00eatres humains qui consiste \u00e0 trouver de bonnes raisons de faire ce que l’on avait de toute fa\u00e7on d\u00e9j\u00e0 envie de faire.<\/p>\n\n\n\n Nous investissons massivement sur tout l’\u00e9ventail d’approches que d\u00e9limitent ces deux directions. Et nous observons des progr\u00e8s r\u00e9els : GPT\u20116 Astra est le premier mod\u00e8le \u00e0 b\u00e9n\u00e9ficier de plusieurs avanc\u00e9es importantes sur lesquelles nous travaillons depuis longtemps, et il est nettement mieux align\u00e9 que GPT\u20115.6 Sol. Il faut n\u00e9anmoins reconna\u00eetre, et bien comprendre, que des progr\u00e8s beaucoup plus importants seront n\u00e9cessaires \u00e0 mesure que les mod\u00e8les gagnent en capacit\u00e9s \u2014 et que les progr\u00e8s en mati\u00e8re d’alignement g\u00e9n\u00e9ralisable pourraient ne pas suffisamment devancer les progr\u00e8s de l’intelligence g\u00e9n\u00e9rale des mod\u00e8les.<\/p>\n\n\n\n Nous ne disposons pas d’une th\u00e9orie satisfaisante de la g\u00e9n\u00e9ralisation, et il semble peu probable que nous puissions en \u00e9laborer une prochainement \u2014 du moins sans l’aide d’une IA plus puissante. \u00c0 l’heure actuelle, notre capacit\u00e9 \u00e0 valider empiriquement nos techniques d’alignement est donc, en pratique, sans doute plus importante encore que ces techniques elles-m\u00eames.<\/p>\n\n\n\n Le principal pari d’OpenAI en la mati\u00e8re a \u00e9t\u00e9 la surveillance de la cha\u00eene de pens\u00e9e<\/a>. Il repose sur une id\u00e9e dont l’attrait tient \u00e0 ce qu’elle passe \u00e0 l’\u00e9chelle : une grande part des capacit\u00e9s du mod\u00e8le provient d’un processus de raisonnement verbalis\u00e9 \u2014 la cha\u00eene de pens\u00e9e. Si l’on intensifie l’optimisation sur les r\u00e9sultats<\/em> de ce processus sans superviser le processus lui-m\u00eame, alors rien, dans l’entra\u00eenement, n’incite directement cette cha\u00eene de pens\u00e9e \u00e0 dissimuler d’\u00e9ventuelles id\u00e9es ou intentions mal align\u00e9es. Cela ne signifie pas que le mod\u00e8le apprendra \u00e0 ext\u00e9rioriser les penchants mal align\u00e9s qui ne passent pas par la cha\u00eene de pens\u00e9e ; mais cela peut nous permettre de surveiller pr\u00e9cis\u00e9ment le surcro\u00eet de capacit\u00e9s qu’apporte le raisonnement.<\/p>\n\n\n\n Si nous sanctionnons le mod\u00e8le chaque fois que son \u00ab brouillon \u00bb de raisonnement contient une pens\u00e9e ind\u00e9sirable, il y a un risque : il pourrait ne pas apprendre \u00e0 cesser de penser ainsi, mais \u00e0 cesser de l\u2019\u00e9crire, et nous perdrons alors toute perspective sur ses v\u00e9ritables pens\u00e9es. C\u2019est pour cette raison qu\u2019OpenAI a d\u00e9cid\u00e9 de ne pas entra\u00eener directement la cha\u00eene de pens\u00e9e, afin qu\u2019elle reste une fen\u00eatre sinc\u00e8re sur le fonctionnement du mod\u00e8le.<\/p>\n\n\n\n Nous avons compris l’importance potentielle de la surveillance de la cha\u00eene de pens\u00e9e au moment m\u00eame o\u00f9 nous mettions au point les mod\u00e8les de raisonnement. Lorsque nous avons lanc\u00e9 o1\u2011preview, nous avons d\u00e9lib\u00e9r\u00e9ment con\u00e7u le produit de fa\u00e7on \u00e0 masquer la cha\u00eene de pens\u00e9e<\/a>, afin de la prot\u00e9ger sur le long terme de toute pression de supervision. Depuis, tout au long du d\u00e9veloppement, nous nous sommes efforc\u00e9s de maintenir la r\u00e8gle de ne pas superviser le processus de raisonnement. La surveillance de la cha\u00eene de pens\u00e9e (CoT<\/em>, pour chain of thought<\/em>) est devenue pour nous un outil de premier plan pour \u00e9tudier comment nos mod\u00e8les g\u00e9n\u00e9ralisent au-del\u00e0 de leur distribution d’entra\u00eenement, en nous permettant d’observer et d’analyser non seulement leurs actions, mais aussi leur cheminement interne.<\/p>\n\n\n\n Les utilisateurs de ChatGPT ont \u00e9t\u00e9 surpris, lors du lancement de la version o1 en septembre 2024, de ne pouvoir consulter qu\u2019un r\u00e9sum\u00e9 du processus de raisonnement du mod\u00e8le, et non le processus brut. L\u2019auteur explique ici que cette d\u00e9cision, souvent per\u00e7ue comme purement commerciale (visant \u00e0 emp\u00eacher la concurrence de copier le mod\u00e8le), a pour objectif principal de prot\u00e9ger la cha\u00eene de raisonnement de toute pression.\u00a0<\/p>\n\n\n\n Cet outil reste essentiel dans notre \u00e9tude des mod\u00e8les de la classe Astra. Mais nos \u00e9valuations indiquent malheureusement que notre capacit\u00e9 \u00e0 nous appuyer sur la surveillance de la cha\u00eene de pens\u00e9e s’\u00e9rode progressivement. Plusieurs facteurs s’y combinent.<\/p>\n\n\n\n Si un mod\u00e8le parvient \u00e0 un stade o\u00f9 il est capable de \u00ab penser \u00bb sans recourir aux mots, directement au sein de ses repr\u00e9sentations internes dans un seul et m\u00eame processus informatique, alors la cha\u00eene de pens\u00e9es cessera d\u2019\u00eatre un reflet fid\u00e8le de son fonctionnement, quel que soit le domaine dans lequel nous avons \u00e9vit\u00e9 de l\u2019entra\u00eener.<\/p>\n\n\n\n Ces d\u00e9fis ne sont pas n\u00e9cessairement insurmontables. J’ai bon espoir que nous puissions mettre au point des interventions am\u00e9liorant la surveillabilit\u00e9 de la cha\u00eene de pens\u00e9e de nos mod\u00e8les \u2014 par exemple en comprenant mieux comment interagissent les diff\u00e9rents objectifs d’optimisation et les diverses formes de calcul au moment de l’inf\u00e9rence que le mod\u00e8le utilise. Je crois aussi qu’il pourrait \u00eatre tr\u00e8s f\u00e9cond de combiner les id\u00e9es de la surveillance de la cha\u00eene de pens\u00e9e avec celles de la surveillance des activations : entra\u00eener \u00e0 grande \u00e9chelle des moniteurs ayant un acc\u00e8s direct aux \u00e9tats internes du r\u00e9seau, \u00e0 l’image des confessions<\/a>. Nous explorons activement ces pistes. Je m’attends n\u00e9anmoins \u00e0 ce que les progr\u00e8s de l’IA en g\u00e9n\u00e9ral soient de plus en plus brid\u00e9s par le degr\u00e9 de confiance que nous pouvons accorder \u00e0 la surveillance.<\/p>\n\n\n\n Les \u00ab activations \u00bb sont les valeurs num\u00e9riques qui circulent dans le r\u00e9seau neuronal pendant le calcul d’une r\u00e9ponse, ce qui, si l’on poursuit la m\u00e9taphore neuroscientifique, \u00e9quivaut \u00e0 une image du cerveau en temps r\u00e9el. Le \u00ab suivi des activations \u00bb consiste \u00e0 entra\u00eener un deuxi\u00e8me syst\u00e8me \u00e0 interpr\u00e9ter ces \u00e9tats internes afin d’y identifier, par exemple, l’intention de tromper. Le terme \u00ab confessions \u00bb qui a une claire connotation religieuse fait r\u00e9f\u00e9rence \u00e0 une technique d’OpenAI qui consiste \u00e0 entra\u00eener le mod\u00e8le \u00e0 admettre de lui-m\u00eame ses erreurs ou ses \u00e9carts.<\/p>\n\n\n\n L’argument le plus fort que je connaisse en faveur de la poursuite rapide de l’entra\u00eenement de mod\u00e8les beaucoup plus intelligents est la n\u00e9cessit\u00e9 de b\u00e2tir des syst\u00e8mes de d\u00e9fense contre les dangers que font peser d’autres IA.<\/p>\n\n\n\n Un risque manifeste, discut\u00e9 tout au long de cette ann\u00e9e, concerne la cybers\u00e9curit\u00e9 : les mod\u00e8les deviennent surhumains dans leur capacit\u00e9 \u00e0 p\u00e9n\u00e9trer des syst\u00e8mes informatiques \u2014 et \u00e0 s’en \u00e9chapper. Cela \u00e9largit consid\u00e9rablement l’\u00e9ventail des risques li\u00e9s \u00e0 l’IA : des agents vont pouvoir acc\u00e9der \u00e0 toute infrastructure, hormis les mieux prot\u00e9g\u00e9es, et agir directement sur une grande partie du monde, m\u00eame sans corps physique. Nous disposons actuellement d’une fen\u00eatre \u00e9troite<\/a> pour utiliser les meilleurs mod\u00e8les disponibles afin de renforcer substantiellement la s\u00e9curit\u00e9<\/a> des syst\u00e8mes critiques.<\/p>\n\n\n\n Un \u00ab agent \u00bb est une IA \u00e0 laquelle on attribue une t\u00e2che compos\u00e9e de plusieurs \u00e9tapes, qu\u2019elle ex\u00e9cute de mani\u00e8re autonome \u00e0 l\u2019aide d\u2019outils (navigateur, terminal, messagerie \u00e9lectronique, etc.) sans aucune intervention humaine \u00e0 aucune des \u00e9tapes. L’expression \u00ab s’\u00e9chapper de celle-ci \u00bb fait r\u00e9f\u00e9rence \u00e0 la capacit\u00e9 de l’agent \u00e0 sortir de l’environnement restreint (sandbox <\/em>ou \u00ab bac \u00e0 sable \u00bb) dans lequel il a \u00e9t\u00e9 plac\u00e9. L’argument de la \u00ab fen\u00eatre de d\u00e9fense \u00bb est le suivant : les m\u00eames capacit\u00e9s qui rendent l’intelligence artificielle dangereuse lors d’une attaque en font une ressource pr\u00e9cieuse pour la d\u00e9fense. Il existe un moment, de courte dur\u00e9e, pendant lequel les d\u00e9fenseurs y ont acc\u00e8s avant que les attaquants n’aient r\u00e9ussi \u00e0 s’en emparer \u00e0 grande \u00e9chelle.<\/p>\n\n\n\n Les risques li\u00e9s \u00e0 l’IA vont malheureusement cro\u00eetre \u00e0 partir de maintenant. Un agent tr\u00e8s capable, explicitement entra\u00een\u00e9 et instruit pour commettre des actes malveillants, repr\u00e9sente un danger d’un genre nouveau : il est susceptible de d\u00e9passer ce que voulait son op\u00e9rateur, en g\u00e9n\u00e9ralisant vers des comportements potentiellement bien plus nuisibles encore. La fronti\u00e8re entre m\u00e9susage et actions autonomes mal align\u00e9es s’estompera \u00e0 mesure que l’IA gagnera en autonomie. Nous avons pris l’habitude de consid\u00e9rer les IA comme des outils, mais certains agents poursuivront leurs propres objectifs. Ils trouveront des moyens de s’assurer le concours d’humains \u2014 en n\u00e9gociant avec eux, en les trompant ou en les faisant chanter.<\/p>\n\n\n\n Pachocki distingue l’\u00ab utilisation abusive \u00bb (une personne malveillante utilise l’IA) et l’\u00ab incompatibilit\u00e9 \u00bb (l’IA poursuit de son propre chef des objectifs contraires aux n\u00f4tres), bien que leur diff\u00e9rence s’estompe : une intelligence artificielle entra\u00een\u00e9e par un agent malveillant \u00e0 des fins sp\u00e9cifiques pourrait, une fois lib\u00e9r\u00e9e, aller bien au-del\u00e0 de ce que cet agent avait pr\u00e9vu. Des exp\u00e9riences men\u00e9es en 2025 ont d\u00e9montr\u00e9 que les mod\u00e8les avaient eu recours au chantage dans des sc\u00e9narios de test pour \u00e9viter d\u2019\u00eatre d\u00e9sactiv\u00e9s.<\/p>\n\n\n\n S’y ajoutent les risques que font na\u00eetre les technologies nouvelles que l’IA pourrait rendre possibles, comme des agents pathog\u00e8nes con\u00e7us sur mesure.<\/p>\n\n\n\n Nous aurons besoin d’une IA puissante et align\u00e9e pour nous d\u00e9fendre : s\u00e9curiser les infrastructures, nous prot\u00e9ger en temps r\u00e9el contre des agents hors de contr\u00f4le, et inventer des mesures de protection enti\u00e8rement nouvelles. Ce sera un axe majeur des efforts de d\u00e9ploiement d’OpenAI.<\/p>\n\n\n\n Mais, malgr\u00e9 l’incertitude qui accompagne les vastes progr\u00e8s attendus de l’IA et la n\u00e9cessit\u00e9 de b\u00e2tir des syst\u00e8mes de d\u00e9fense, nous ne devons pas laisser cela devenir une excuse pour l’imprudence. L’id\u00e9e d’une fuite en avant \u00e0 tout prix para\u00eet absurde d\u00e8s lors que l’on a pris la mesure des enjeux.<\/p>\n\n\n\n Qu’une intelligence artificielle joue un r\u00f4le croissant dans son propre d\u00e9veloppement est l’aboutissement naturel d’un progr\u00e8s technologique soutenu. Si les progr\u00e8s de l’IA se poursuivent, l’auto-am\u00e9lioration r\u00e9cursive des machines (RSI) sera au c\u0153ur m\u00eame de la d\u00e9couverte scientifique de demain.<\/p>\n\n\n\n L’automatisation de la recherche en IA est une forme plus radicale de mise \u00e0 l’\u00e9chelle de l’intelligence par le calcul \u2014 et, bien entendu, l’IA am\u00e9liorera dans ce cadre le substrat de calcul lui-m\u00eame<\/a>. Comme pour la mise \u00e0 l’\u00e9chelle, nous orientons la recherche d’OpenAI vers la RSI parce que nous pensons que c’est la seule fa\u00e7on de rester \u00e0 la pointe de la recherche en IA dans les ann\u00e9es \u00e0 venir.<\/p>\n\n\n\n L\u2019\u00ab infrastructure informatique \u00bb d\u00e9signe le mat\u00e9riel (puces, r\u00e9seaux, centres de donn\u00e9es) sur lequel s\u2019ex\u00e9cutent les mod\u00e8les. L\u2019auteur \u00e9voque un projet d\u2019OpenAI dans lequel l\u2019intelligence artificielle est utilis\u00e9e pour concevoir ou optimiser ce mat\u00e9riel, bouclant ainsi une deuxi\u00e8me boucle : l\u2019IA am\u00e9liorerait \u00e0 la fois les algorithmes et les machines qui les ex\u00e9cutent.<\/p>\n\n\n\n Je tiens \u00e0 pr\u00e9ciser que ces mots ne signifient pas que je consid\u00e8re qu’acc\u00e9l\u00e9rer fortement la recherche en apprentissage profond \u2014 surtout \u00e0 court terme \u2014 soit la bonne d\u00e9cision collective pour la communaut\u00e9 scientifique. Mais je pense que c’est l\u00e0 que m\u00e8ne la trajectoire actuelle, et nous devons tous choisir consciemment la fa\u00e7on dont nous voulons proc\u00e9der. Nous disposons de deux leviers principaux : orienter le processus pour que l’alignement et la surveillance progressent au m\u00eame rythme que l’IA, et trouver des moyens de garder les humains dans la boucle ; ou nous coordonner pour ralentir le d\u00e9veloppement autant qu’il le faudra pour acqu\u00e9rir confiance dans ces mesures.<\/p>\n\n\n\n La meilleure voie que je vois aujourd’hui combine les deux.<\/p>\n\n\n\n Les progr\u00e8s concrets que nous avons accomplis en mati\u00e8re d’alignement et de surveillance ont g\u00e9n\u00e9ralement \u00e9t\u00e9 indissociables des progr\u00e8s de l’IA elle-m\u00eame. On peut citer l’apprentissage par renforcement \u00e0 partir de retours humains<\/a>, qui a \u00e9t\u00e9 d\u00e9cisif pour entra\u00eener les premiers assistants IA, et la surveillance de la cha\u00eene de pens\u00e9e<\/a> d\u00e9j\u00e0 \u00e9voqu\u00e9e, rendue possible par les avanc\u00e9es sur les mod\u00e8les de raisonnement. Nous devons concentrer un processus de recherche de plus en plus automatis\u00e9 sur la production de nouvelles id\u00e9es, de nouveaux algorithmes et de nouvelles th\u00e9ories de ce type, et b\u00e2tir par it\u00e9rations successives des dossiers de s\u00fbret\u00e9 pour des IA toujours plus capables.<\/p>\n\n\n\n Le RLHF (Apprentissage par renforcement bas\u00e9 sur le retour d\u2019information humain) est la technique qui a permis de transformer les mod\u00e8les bruts cr\u00e9\u00e9s lors de la phase d\u2019entra\u00eenement initiale en assistants utiles. Des relecteurs humains comparent les r\u00e9ponses et le mod\u00e8le apprend \u00e0 g\u00e9n\u00e9rer les r\u00e9ponses privil\u00e9gi\u00e9es. C\u2019est cette technique qui a rendu possible la cr\u00e9ation de ChatGPT en 2022. Un \u00ab dossier de s\u00fbret\u00e9 \u00bb (safety case<\/em>) est un argumentaire structur\u00e9, issu des secteurs \u00e0 haut risque (nucl\u00e9aire, a\u00e9ronautique), dont l\u2019objectif est de d\u00e9montrer qu\u2019un syst\u00e8me peut \u00eatre mis en \u0153uvre sans danger.<\/p>\n\n\n\n La mise \u00e0 l’\u00e9chelle des syst\u00e8mes d’IA doit \u00eatre born\u00e9e par la confiance que nous pouvons avoir en leur s\u00fbret\u00e9. Nous devons faire \u00e9voluer des engagements comme le Preparedness Framework<\/a> ou la Responsible Scaling Policy<\/a> vers des seuils de s\u00fbret\u00e9 largement obligatoires, conditionnant la poursuite du d\u00e9veloppement. Ils pourront \u00eatre contr\u00f4l\u00e9s par un r\u00e9seau d’auditeurs ind\u00e9pendants, par des agences gouvernementales ou par des instances internationales.<\/p>\n\n\n\n Le Preparedness Framework et la Responsible Scaling Policy sont des documents internes adopt\u00e9s de mani\u00e8re volontaire et r\u00e9ciproque par OpenAI et Anthropic. Ils d\u00e9finissent les niveaux de risque et les mesures de pr\u00e9caution \u00e0 prendre \u00e0 chaque niveau avant le d\u00e9ploiement d’un mod\u00e8le. Leur limite, souvent soulign\u00e9e par leurs d\u00e9tracteurs, r\u00e9side pr\u00e9cis\u00e9ment dans le fait qu\u2019ils sont volontaires et reposent sur une auto-\u00e9valuation. L\u2019auteur propose ici de les rendre obligatoires et d\u2019en confier la v\u00e9rification \u00e0 un tiers, ce qui constitue une prise de position remarquable de la part d’un directeur de laboratoire.<\/p>\n\n\n\n Le d\u00e9fi central de l’automatisation de la recherche en IA n’est pas d’\u00ab y parvenir \u00bb : c’est d’y parvenir d’une mani\u00e8re qui maintienne les humains au sein du processus d’am\u00e9lioration continue, et qui laisse l’avenir entre les mains de l’humanit\u00e9.<\/p>\n\n\n\nUn intellect que nous ne comprenons pas enti\u00e8rement<\/h2>\n\n\n\n
Apprendre aux machines \u00e0 aimer<\/h2>\n\n\n\n
Surveiller la g\u00e9n\u00e9ralisation<\/h2>\n\n\n\n
\n
Une d\u00e9fense qui passe \u00e0 l’\u00e9chelle<\/h2>\n\n\n\n
Ma\u00eetriser le rythme de l’auto-am\u00e9lioration r\u00e9cursive<\/h2>\n\n\n\n
Et maintenant ?<\/h2>\n\n\n\n