SSysDigest
Jailbreak Benchmark de MLCommons : même le juge IA se trompe souvent

Photo : ActuIA

Intelligence Artificielle

Jailbreak Benchmark de MLCommons : même le juge IA se trompe souvent

MLCommons teste 8 IA face à des requêtes dangereuses reformulées pour contourner leurs garde-fous. Résultat : son propre juge automatique se plante un paquet de fois.

actuintelligence artificiellesécurité
Partager :

MLCommons, le consortium derrière les bancs d'essai MLPerf et AILuminate, vient de publier les premiers résultats complets de son Jailbreak Benchmark v1.0. L'idée : prendre 264 requêtes clairement dangereuses (violence, armes, exploitation, haine...) et voir comment huit modèles à poids ouverts réagissent, d'abord face aux questions brutes, puis face aux mêmes questions déguisées avec des techniques de contournement bien connues. Verdict global : le taux de réponses problématiques grimpe de 11% à presque 19% une fois les attaques appliquées.

Le panel mélange des poids légers comme Gemma 3N de Google, LFM2-24B de Liquid AI ou Qwen 2.5 d'Alibaba Cloud, et des grosses pointures comme GPT-OSS 120B d'OpenAI, Kimi K2.6 de Moonshot AI ou DeepSeek-V4-Pro. Fait marrant : certains modèles comme Gemma 4, DeepSeek-V4-Pro et Kimi K2.6 répondent en fait moins dangereusement sous attaque que sans, un résultat que les chercheurs n'arrivent pas totalement à expliquer (le modèle a-t-il flairé le piège, ou le juge n'a-t-il juste pas compris la réponse déguisée ?).

Mais le vrai twist de l'étude, c'est que le juge automatique censé noter tout ça n'est pas fiable : il laisse passer 16,4% des réponses réellement dangereuses, et accuse à tort 37,9% des réponses pourtant inoffensives. Les auteurs eux-mêmes admettent que ces taux dépassent largement leurs objectifs, et préviennent qu'il ne faut pas prendre les chiffres absolus trop au sérieux. MLCommons a quand même choisi ce juge en priorité pour limiter les dangers manqués, au prix de plus de fausses alertes.

Attention, ce banc d'essai ne teste que des échanges textuels en un seul tour : pas de conversation multi-messages, pas d'image, pas d'agent qui utilise des outils, un terrain déjà exploré par d'autres dispositifs comme OpenShell de NVIDIA. Autrement dit, c'est un premier jalon utile pour comparer les modèles entre eux, mais encore loin d'une mesure parfaite de la sécurité réelle des IA.

Ceci est un résumé rédigé par SysDigestLire l'article original sur ActuIA →

À lire aussi