SSysDigest
Mistral Large 4 : le « Chonk » est-il vraiment le meilleur modèle ouvert ?

Photo : ActuIA

Intelligence Artificielle

Mistral Large 4 : le « Chonk » est-il vraiment le meilleur modèle ouvert ?

Mistral AI lance Large 4, un mastodonte de 1050 milliards de paramètres. Mais les chiffres avancés par l'entreprise résistent-ils vraiment à l'analyse indépendante ?

comparatifactuIAmise à jour
Partager :

Mistral AI vient de sortir Large 4, surnommé en interne « le Chonk », et le mot n'est pas volé : 1050 milliards de paramètres au total, dont 49 milliards activés à chaque calcul, et une capacité à traiter du texte comme de l'image. Pour l'instant il faut passer par l'API Mistral Studio pour y toucher, les poids du modèle (la version qu'on peut télécharger et faire tourner soi-même) étant promis pour fin octobre. Côté tarif, la facture a déjà été coupée en deux depuis le lancement, sans qu'on sache combien de temps ça va durer.

Mistral affirme que son modèle est « compétitif avec les plus forts modèles open source au monde » et qu'il écrase largement tout ce qui se fait en poids ouverts aux US ou en Europe. Entraîné en deux mois sur 3800 GPU Nvidia Grace Blackwell dans des data centers européens, Large 4 fusionne pour la première fois le mode « instruction » classique et le mode « raisonnement » dans un seul modèle, contre deux versions séparées pour son prédécesseur Large 3.

Sauf que quand on regarde les classements indépendants d'Artificial Analysis, l'histoire est un peu moins flatteuse : Large 4 arrive seulement huitième parmi les modèles à poids ouverts, derrière pas moins de six modèles chinois. La formule « meilleur modèle ouvert hors Chine » tient à peine, Large 4 ne devançant le coréen Motif 3 que de quatre petits points. Là où le bilan est clairement positif, c'est en comparaison avec le reste des modèles occidentaux : douze points d'avance sur le meilleur concurrent américain, et un bond spectaculaire par rapport à Large 3, qui plafonnait autrefois à 9 sur cet indice.

Mistral reconnaît elle-même que l'entraînement par renforcement du modèle est encore en cours et que Large 4 ne montre aucun signe de saturation, ce qui laisse penser que la marge de progression n'est pas épuisée. Reste que les benchmarks mis en avant par l'entreprise, comme le fameux 61,7% sur le test de code DeepSWE, n'ont pas encore été vérifiés par des tiers indépendants, et un comparatif publié par un concurrent, Reflection AI, montre d'autres modèles chinois absents des graphiques de Mistral mais plutôt bien placés sur ce même exercice.

Ceci est un résumé rédigé par SysDigestLire l'article original sur ActuIA →

À lire aussi