Chez Glean, nous croyons que l’avenir de la sécurité de l’IA, c’est l’IA elle-même. Les modèles de raisonnement deviennent de plus en plus performants pour garder une longueur d’avance sur des menaces en constante évolution, en détectant les attaques et les expositions de données sensibles.
C’est pourquoi nous sommes ravis de partager les résultats de nos investissements dans la sécurité de l’IA : de nouveaux modèles de détection qui atteignent 97,8% de détection des injections de prompt, 93,5% de détection de contenu toxique et 94,3% de détection de code malveillant sur les benchmarks de référence.  ;
Dans cet article, nous allons expliquer comment nous sommes parvenus à ces résultats, comment nous avons développé les meilleurs modèles de détection du secteur, ainsi que notre approche multicouche de la sécurité de l’IA.
Approche multicouche de la sécurité de l’IA
Par conception, les modèles d’IA visent à être aussi utiles que possible. Ils exploreront plusieurs voies pour atteindre l’objectif d’un utilisateur, même lorsque cet objectif est malveillant — sauf si des contrôles de sécurité l’en empêchent.
De nombreux modèles commerciaux et open source intègrent désormais ces contrôles de sécurité de l’IA. Cependant, dans un monde multi-modèles où les modèles collaborent entre eux sur des tâches complexes, ces garde-fous seuls ne suffisent pas. Il faut une couche de protection supplémentaire au niveau des prompts et des agents pour bloquer les injections de prompt, le code malveillant et le contenu toxique.  ;
Les modèles de sécurité de l’IA de Glean, disponibles en disponibilité générale dès aujourd’hui, fournissent ces capacités — en adoptant une approche de sécurité en couches pour protéger les entreprises. Dès le premier jour, Glean a introduit des connecteurs de données et des contrôles d’accès appliquant les permissions, afin d’empêcher que des tentatives d’injection de prompt n’entraînent des fuites de données ou des actions non autorisées. Désormais, nous ajoutons une nouvelle couche de sécurité de l’IA pour préserver l’intégrité et la fiabilité des modèles : des modèles de sécurité dédiés qui inspectent et valident les sessions de chat et les étapes d’exécution des agents.

Tous les modèles de sécurité de l’IA ne se valent pas
Tous les modèles de sécurité de l’IA ne se valent pas la qualité et le fait de rester à jour face à l’évolution des menaces comptent. Nous avons constaté que les modèles prêts à l’emploi ne protègent pas pleinement les cas d’usage en entreprise. Nous avons donc développé des modèles spécifiquement adaptés au paysage des menaces lié à l’IA en entreprise.  ;
En affinant l’entraînement à l’aide de jeux de données publics pertinents pour les scénarios en entreprise, nos modèles sont mieux armés pour identifier et atténuer les risques propres aux entreprises — en évitant les taux élevés de faux positifs et les menaces manquées, fréquents avec des solutions génériques. Par ailleurs, nous employons une stratégie à modèles combinés pour valider les résultats initiaux et réduire encore davantage les faux positifs.
Nous partageons des benchmarks de performance montrant comment nos modèles de sécurité se comparent aux principaux modèles open source de safety pour LLM, aux solutions d’observabilité et aux offres des fournisseurs cloud. Glean atteint 97,8% de précision sur la détection des injections de prompt, 93,5% de précision sur la détection de contenu toxique et 94,3% de précision sur la détection de code malveillant sur les benchmarks de référence.  ;


Les résultats sont moyennés sur l’ensemble des evalsets pour l’injection de prompt, le contenu toxique et le code malveillant. Les fournisseurs cloud hyperscale ne prennent pas en charge la détection de code malveillant.
*Glean bloque les attaques d’injection de prompt directes avec un taux de précision de 97,8% et les attaques d’injection de prompt indirectes avec un taux de précision de 90%.
| Injection de prompt | Contenu toxique | Code malveillant |
|---|---|---|
| Do Anything Now (personnalisé) : variante sélectionnée de DAN, adaptée pour en faire un benchmark en un seul tour, basé uniquement sur l’entrée. | OpenAI Moderation Dataset : jeu de données annoté par des humains à partir de transactions réelles, couramment utilisé pour évaluer la détection de contenus nuisibles/toxiques.* | Malware Plaintext:  ; ;  ;ensemble créé par Glean de véritables extraits issus de virus, d’exploits et d’outils post‑exploitation, chacun associé à un prompt standardisé « analyze or execute » en texte clair, afin de tester la détection de code réellement malveillant. |
| Do Anything Now (bénin) : ensemble de contrôle de phrases sûres qui utilisent des mots déclencheurs de DAN, dont « prompt injection », « jailbreak », « do anything now » et « dan », afin de mesurer les faux positifs. | HarmfulQ:  ; ;  ;petit ensemble composé uniquement de contenus nuisibles, centré sur les biais et les préjudices liés au contexte social — excellent pour tester la capacité de blocage (recall) dans des conditions de stress.* | Malware Benign:  ; ;  ;ensemble de contrôle de 5 000 extraits de code bénins provenant d’un benchmark de traduction de code, associés au même prompt « analyze or execute », destiné à mesurer les faux positifs. |
| XSTest : mélange, rédigé par des humains, de prompts sûrs et dangereux, qui évalue la calibration — bloquer les contenus nuisibles sans surbloquer — ce qui le rend idéal pour tester les arbitrages entre utilité et innocuité.* |
*Benchmarks extraits de Guardbench.
En regardant les chiffres plus en détail, on constate que Glean affiche un faible taux de faux positifs par rapport aux autres fournisseurs. C’est un indicateur essentiel pour l’IA en production, car l’expérience utilisateur se dégrade si l’on bloque trop de requêtes bénignes. Si Glean parvient à maintenir un faible taux de faux positifs, c’est grâce à une approche à deux modèles pour la sécurité de l’IA, qui fait passer les résultats par un second modèle afin d’en garantir la précision.
| Glean | Modèle open source de sécurité des LLM | Fournisseur cloud hyperscale 1 | Fournisseur cloud hyperscale 2 | |
|---|---|---|---|---|
| % de faux positifs sur les attaques d’injection de prompts | 3.0% | 6.1% | 1.4% | 17.4% |
Nous permettons aux utilisateurs de remonter facilement à la source de la violation afin de la corriger rapidement, grâce à un tableau de bord de sécurité IA qui fournit tout le contexte autour de l’incident, le prompt, le fichier source, l’identifiant de l’agent, les informations utilisateur et la session de chat.  ;
La sécurité IA est un investissement continu pour Glean, aujourd’hui comme demain. À mesure que les attaques évoluent, nous serons en première ligne, en ajustant nos modèles pour protéger les entreprises. Nous nous réjouissons des avancées d’aujourd’hui et des résultats de benchmark, et nous continuerons d’évoluer pour garder une longueur d’avance et protéger nos clients entreprises.
Les modèles de sécurité IA font partie de Glean Protect+, une suite de sécurité premium. Ils sont disponibles dès aujourd’hui dans les déploiements GCP.











