Mistral ha lanciato oggi, martedì 6 ottobre, il Mistral Large 4 (ML4), un modello dotato di mille miliardi di parametri presentato come «all’avanguardia tra i modelli a peso aperto».
- Il lancio era stato annunciato il giorno prima da Arthur Mensch, cofondatore e amministratore delegato di Mistral, in un post su X che mostrava l’inaspettata rimonta di un’atleta francese diventata un’icona grazie al commento del conduttore televisivo: «Allora forse…»
- Nelle ultime settimane, ha inoltre rilasciato numerose dichiarazioni volte a ridefinire la percezione del ritardo europeo, alzando così di un gradino il livello delle aspettative.
Le caratteristiche del nuovo modello di Mistral sono le seguenti:
- In totale, Mistral Large 4 si basa su mille miliardi di parametri. La sua architettura, detta “a miscela di esperti”, è tuttavia progettata per utilizzarne solo 49 miliardi per ogni richiesta, il che riduce i costi di funzionamento.
- L’addestramento è stato effettuato partendo da zero su 4.000 processori Nvidia Grace Blackwell nei data center di Mistral in Europa per due mesi. A titolo di riferimento, ciò corrisponde a circa 10 megawatt di potenza installata. Il divario rispetto ai laboratori statunitensi rimane considerevole su questo punto.
- Il solo sito Colossus di xAI a Memphis conta circa 555.000 processori per una potenza di 2 gigawatt, ovvero duecento volte la potenza utilizzata da Mistral.
I «pesi» del modello, ovvero i parametri che ne consentono l’esecuzione in modo autonomo, non saranno pubblicati prima del 27 ottobre. Fino ad allora, sarà disponibile solo un accesso a pagamento.
- La questione della distillazione rimane in sospeso. Addestrare un modello utilizzando le risposte di un modello più avanzato consente di acquisire parte delle sue capacità a un costo inferiore. Il comunicato stampa di Mistral non fornisce alcuna indicazione sulla composizione dei dati di addestramento, ma l’azienda ha annunciato che fornirà ulteriori dettagli sulla propria architettura e sul proprio metodo in occasione della pubblicazione dei pesi, prevista per il 27 ottobre.
- Per completezza, Mistral lavora su modelli cosiddetti “a codice aperto”, i cui parametri vengono resi pubblici dal loro sviluppatore, consentendo a chiunque di scaricarli e di eseguirli sui propri server. Al contrario, i modelli chiusi di OpenAI o Anthropic sono accessibili solo tramite i loro servizi.
Mistral si presenta quindi come leader mondiale dei modelli aperti nei settori della sicurezza informatica, della finanza, dell’industria e dell’elaborazione delle immagini, e afferma di occupare il primo posto «al di fuori della Cina» in tutte le categorie.
- L’espressione «al di fuori della Cina» è significativa: Mistral non pretende di superare i laboratori cinesi, ma solo di essere il migliore al di fuori di essi. Una persona ben informata sulla questione ci riferisce inoltre che i team di Mistral sono consapevoli di essere in ritardo rispetto ai modelli cinesi aperti.
- Per contestualizzare il proprio modello, Mistral lo ha confrontato con GLM, il modello di riferimento cinese per i modelli aperti, nel corso di un test su DeepSWE che misura la capacità di risolvere in modo autonomo problemi reali di programmazione.
L’enfasi posta sulla sicurezza informatica potrebbe, dal canto suo, rientrare in una strategia politica, in un contesto in cui cresce l’interesse degli attori pubblici e dei laboratori per la creazione di un’offerta sovrana.
- ML4 si colloca tra i primi cinque al mondo nell’Artificial Analysis Cyber Index e risulta essere il miglior modello open-weight sviluppato al di fuori della Cina in questo indice, sebbene rimanga dietro a MiMo-V2.6-Pro nella classifica generale e allo stesso livello di GLM-5.3-Flash, un modello nettamente più piccolo.
- Si distingue soprattutto su CyberGym-E2E, dove raggiunge l’82%, davanti a MiMo-V2.6-Pro, in compiti che consistono nel riprodurre e poi correggere vulnerabilità in software open source reali: si tratta del miglior punteggio registrato finora, considerando tutti i modelli.
- Mistral vede in questo un argomento a favore della sovranità: i modelli chiusi statunitensi spesso si rifiutano di lavorare su compiti legati alla difesa, mentre gli hacker riescono già ad aggirare le loro misure di sicurezza (“jailbreak”). Hugging Face aveva del resto utilizzato GLM-5.2 per analizzare l’incidente di cui è stata vittima a luglio.