Mistral a lancé aujourd’hui, mardi 6 octobre, le Mistral Large 4 (ML4), un modèle doté de mille milliards de paramètres présenté comme étant « à la pointe des modèles à poids ouverts ».
- Le lancement avait été annoncé la veille par Arthur Mensch, cofondateur et directeur général de Mistral, dans un message sur X montrant la remontée inespérée d’une athlète française devenue culte par le commentaire du présentateur télé : « Alors peut-être… »
- Ces dernières semaines, il a par ailleurs multiplié les déclarations visant à recalibrer la perception du retard européen, faisant ainsi monter d’un cran le niveau d’attente.
Les caractéristiques du nouveau modèle de Mistral sont les suivantes :
- Au total, Mistral Large 4 repose sur mille milliards de paramètres. Son architecture, dite « de mélange d’experts », est cependant conçue pour n’en utiliser que 49 milliards à chaque requête, ce qui réduit le coût de fonctionnement.
- L’apprentissage a été réalisé à partir de zéro sur 4 000 processeurs Nvidia Grace Blackwell dans les centres de données de Mistral en Europe pendant deux mois. À titre de référence, cela représente environ 10 mégawatts de puissance installée. L’écart avec les laboratoires américains reste considérable sur ce point.
- Le seul site Colossus de xAI à Memphis compte environ 555 000 processeurs pour une puissance de 2 gigawatts, soit deux cents fois la puissance mobilisée par Mistral.
Les « poids » du modèle, c’est-à-dire les paramètres permettant de l’exécuter de manière autonome, ne seront pas publiés avant le 27 octobre. D’ici là, seul un accès payant sera disponible.
- La question de la distillation reste en suspens. Entraîner un modèle sur les réponses d’un modèle plus avancé permet de capturer une partie de ses capacités à moindre coût. Le communiqué de Mistral ne dit rien de la composition de ses données d’entraînement, mais l’entreprise a annoncé qu’elle fournirait des précisions sur son architecture et sa méthode lors de la publication des poids, le 27 octobre.
- Pour mémoire, Mistral travaille sur des modèles dits « à poids ouverts », dont le concepteur publie les paramètres, ce qui permet à chacun de les télécharger et de les faire fonctionner sur ses propres serveurs. À l’inverse, les modèles fermés d’OpenAI ou d’Anthropic ne sont accessibles qu’à travers leurs propres services.
Mistral se présente ainsi comme le leader mondial des modèles ouverts dans les domaines de la cybersécurité, de la finance, de l’industrie et du traitement d’images, et affirme occuper la première place « hors de Chine » dans toutes les catégories.
- La formulation « hors de Chine » est symptomatique : Mistral ne prétend pas dépasser les laboratoires chinois, mais seulement être le meilleur en dehors d’eux. Une personne au fait du dossier nous indique d’ailleurs que les équipes de Mistral savent qu’elles sont derrière les modèles chinois ouverts.
- Pour situer son modèle, Mistral l’a comparé à GLM, la référence chinoise des modèles ouverts, lors d’un test sur DeepSWE qui mesure la capacité à résoudre de manière autonome de véritables problèmes de programmation.
L’accent mis sur la cybersécurité pourrait, quant à lui, relever d’un calcul politique, dans un contexte où l’intérêt des acteurs publics et des laboratoires pour la structuration d’une offre souveraine est en hausse.
- ML4 se place dans le top 5 mondial de l’Artificial Analysis Cyber Index, et apparaît comme le meilleur modèle open-weight développé hors de Chine sur cet indice, même s’il reste derrière MiMo-V2.6-Pro au classement général et au niveau de GLM-5.3-Flash, un modèle nettement plus petit.
- Il se distingue surtout sur CyberGym-E2E, où il atteint 82 %, devant MiMo-V2.6-Pro, sur des tâches consistant à reproduire puis corriger des vulnérabilités dans de vrais logiciels open source, soit le meilleur score annoncé à ce jour, tous modèles confondus.
- Mistral y voit un argument de souveraineté : les modèles fermés américains refusent souvent de travailler sur des tâches de défense, alors que les attaquants parviennent déjà à contourner leurs garde-fous (« jailbreak »). Hugging Face avait d’ailleurs utilisé GLM-5.2 pour analyser l’incident dont elle a été victime en juillet.