
Photo : ActuIA
Jailbreak Benchmark de MLCommons : même le juge IA se trompe souvent
MLCommons teste 8 IA face à des requêtes dangereuses reformulées pour contourner leurs garde-fous. Résultat : son propre juge automatique se plante un paquet de fois.
MLCommons, le consortium derrière les bancs d'essai MLPerf et AILuminate, vient de publier les premiers résultats complets de son Jailbreak Benchmark v1.0. L'idée : prendre 264 requêtes clairement dangereuses (violence, armes, exploitation, haine...) et voir comment huit modèles à poids ouverts réagissent, d'abord face aux questions brutes, puis face aux mêmes questions déguisées avec des techniques de contournement bien connues. Verdict global : le taux de réponses problématiques grimpe de 11% à presque 19% une fois les attaques appliquées.
Le panel mélange des poids légers comme Gemma 3N de Google, LFM2-24B de Liquid AI ou Qwen 2.5 d'Alibaba Cloud, et des grosses pointures comme GPT-OSS 120B d'OpenAI, Kimi K2.6 de Moonshot AI ou DeepSeek-V4-Pro. Fait marrant : certains modèles comme Gemma 4, DeepSeek-V4-Pro et Kimi K2.6 répondent en fait moins dangereusement sous attaque que sans, un résultat que les chercheurs n'arrivent pas totalement à expliquer (le modèle a-t-il flairé le piège, ou le juge n'a-t-il juste pas compris la réponse déguisée ?).
Mais le vrai twist de l'étude, c'est que le juge automatique censé noter tout ça n'est pas fiable : il laisse passer 16,4% des réponses réellement dangereuses, et accuse à tort 37,9% des réponses pourtant inoffensives. Les auteurs eux-mêmes admettent que ces taux dépassent largement leurs objectifs, et préviennent qu'il ne faut pas prendre les chiffres absolus trop au sérieux. MLCommons a quand même choisi ce juge en priorité pour limiter les dangers manqués, au prix de plus de fausses alertes.
Attention, ce banc d'essai ne teste que des échanges textuels en un seul tour : pas de conversation multi-messages, pas d'image, pas d'agent qui utilise des outils, un terrain déjà exploré par d'autres dispositifs comme OpenShell de NVIDIA. Autrement dit, c'est un premier jalon utile pour comparer les modèles entre eux, mais encore loin d'une mesure parfaite de la sécurité réelle des IA.
À lire aussi

Pourquoi j'ai laché le 4K pour un écran OLED 1440p/360Hz
Après une décennie à courir après le 4K, cet amateur de PC gaming explique pourquoi un écran OLED 1440p/360Hz lui a fait oublier la résolution au profit de la fluidité.

J'ai fait auditer mon NAS UGREEN par une IA : 2 To en doublons
Un utilisateur a demandé à ChatGPT Codex de scanner son NAS UGREEN DH4300 Plus, qui a débusqué 2 To de fichiers sauvegardés deux fois pour rien.

J'ai viré le cloud de ma domotique avec n8n en local, et ça change tout
Un utilisateur a remplacé ses automatisations cloud par des workflows n8n en local, couplés à Home Assistant, pour une maison connectée plus fiable et plus privée.