SSysDigest
Gemini 4 premier partout ? Les benchmarks de Google font grincer des dents

Photo : Pachon in Motion sur Pexels

Actu Tech

Gemini 4 premier partout ? Les benchmarks de Google font grincer des dents

Google claironne que Gemini 4 Argon domine 13 benchmarks sur 19, mais les tests indépendants le placent loin derrière Claude Opus 5.5 et GPT-6 Astra.

comparatifactuintelligence artificielle
Partager :

Google vient de dégainer Gemini 4 Argon, son dernier modèle d'IA, avec une annonce qui sonne comme une victoire totale : premier sur 13 des 19 benchmarks présentés lors du lancement. Sur le papier, ça impressionne, mais dès que des testeurs indépendants s'y sont penchés, l'histoire change complètement de visage.

En conditions réelles, Gemini 4 se retrouve à cinq points de Claude Opus 5.5, le modèle d'Anthropic, et dégringole même à la huitième place du classement général, loin derrière GPT-6 Astra d'OpenAI. Du coup, les critiques fusent et parlent de « benchmaxxing » : l'idée que Google aurait soigneusement choisi ses tests maison pour mettre Gemini 4 sous son meilleur jour, plutôt que de donner une image fidèle de ses capacités face à la concurrence.

Ce n'est pas vraiment une surprise dans le milieu : les entreprises d'IA ont toutes tendance à présenter leurs résultats sous l'angle le plus flatteur possible, un peu comme un CV qu'on enjolive pour l'entretien. Mais l'écart ici semble plus marqué que d'habitude, et ça relance le débat sur la fiabilité des benchmarks officiels fournis par les boîtes elles-mêmes au moment du lancement.

Au final, ce qui ressort de cette polémique, c'est surtout qu'il ne faut jamais se fier aux seuls chiffres annoncés par un constructeur. Pour savoir qui est réellement le meilleur entre Gemini 4, Claude et GPT-6, mieux vaut attendre les comparatifs indépendants qui tiennent la route sur la durée.

Ceci est un résumé rédigé par SysDigestLire l'article original sur Frandroid →

À lire aussi