Le contexte d’entreprise est ce qui rend l’IA pertinente et utile au travail plus vous apportez de contexte, plus les insights sont riches. Même si le contexte dans Glean repose sur l’application des permissions, cette application n’est efficace que si les permissions sous-jacentes le sont aussi. Or, avec des centaines d’applications SaaS et des milliards de contenus générés par les utilisateurs, de nombreuses entreprises n’arrivent pas à suivre les contrôles d’accès et ont besoin d’une aide supplémentaire pour préparer leurs données à l’IA.  ;
Lors de notre conférence annuelle utilisateurs, Glean:GO, nous avons présenté la protection continue et le masquage automatisé des contenus sensibles dans Glean, sur plus de 100 sources de données. Ces fonctionnalités permettent aux clients de configurer des politiques personnalisées pour détecter les informations les plus sensibles pour leur organisation — des données employés aux mots de passe et à l’authentification, jusqu’aux projets top secret — grâce à plus de 100 infotypes, ainsi qu’à la détection par regex et correspondance de termes.  ;
Aujourd’hui, nous sommes ravis d’aller plus loin avec des modèles de contenus sensibles qui distinguent le signal du bruit en associant des classificateurs d’infotypes traditionnels à des modèles d’IA entraînés sur l’ensemble du contexte d’entreprise, comme le contenu des documents, les activités et les permissions. Ces modèles de contenus sensibles aident à différencier les cas d’usage bénins des expositions réelles, avec un taux de précision de 80 % sur les données non structurées.
Si de nombreuses solutions détectent les contenus sensibles dans les données structurées, rares sont celles qui résolvent le cas des données non structurées — en particulier à l’échelle de couverture fournie par Glean. Les contenus non structurés n’ont pas de schéma : la sensibilité dépend du contexte, pas seulement du contenu. C’est pourquoi les modèles de contenus sensibles de Glean se démarquent : ils interprètent le contexte, en s’appuyant sur une recherche propriétaire et des graphes d’entreprise, autour des infotypes, des regex et des correspondances de termes, pour aider les entreprises à protéger automatiquement leurs données à grande échelle.  ;
La conception des modèles de contenus sensibles
Nous avons eu la chance de collaborer avec plusieurs grandes entreprises pour développer ces modèles de contenus sensibles, ce qui nous a permis de refléter la manière dont les équipes sécurité évaluent réellement l’exposition. Les équipes sécurité de nos clients entreprises ont également aidé à identifier des cas d’usage où les données sont moins sensibles qu’elles ne le semblent à première vue. Par exemple :
| Gravité faible | Gravité moyenne | Gravité élevée |
|---|---|---|
| Identifiants de test partagés avec toute l’organisation. Justification d’une gravité faible : supports de formation à la sécurité, où la valeur pédagogique l’emporte sur un risque d’exposition minimal puisqu’ils sont indiqués comme des exemples |
Données personnelles identifiables partagées avec le service RH. Justification d’une gravité moyenne : créé et partagé par le responsable du service RH. |
Numéro de sécurité sociale partagé avec toute l’entreprise. Justification d’une gravité élevée : contient des numéros de sécurité sociale de production et est accessible anonymement via un lien, ce qui signifie qu’il est exposé publiquement. |
Comme le montrent les exemples ci-dessus, nous expliquons les décisions prises par les modèles de contenus sensibles afin que vous puissiez comprendre leur logique. Grâce aux retours dans le produit, notamment les votes pouce vers le haut et pouce vers le bas, les modèles continuent d’apprendre ce que les entreprises considèrent comme des données sensibles.
Les modèles de contenus sensibles comprennent le contexte
Si les modèles de contenus sensibles peuvent raisonner sur des données non structurées, c’est parce qu’ils comprennent le contexte : le contexte du document lui-même, l’activité autour du document et les relations au sein de l’entreprise. Les modèles de contenus sensibles analysent les relations sémantiques entre les titres de documents, les résumés de contenu et les motifs sensibles identifiés. Un document intitulé « Bonnes pratiques de sécurité » contenant des identifiants d’exemple sera traité de manière fondamentalement différente d’un fichier nommé « Sauvegarde de base de données de production » présentant des motifs de contenu similaires. Le système comprend des indices contextuels comme « exemple », « échantillon », « modèle », et « formation », qui indiquent un usage pédagogique plutôt qu’opérationnel.
Glean va au-delà de l’analyse d’un document isolé. Il examine également les documents étroitement liés, ainsi que l’emplacement du document dans les structures de dossiers, les canaux, et plus encore. Les documents appartenant aux équipes sécurité, stockés dans des espaces de formation ou étiquetés avec des métadonnées pédagogiques font l’objet d’évaluations de risque différentes de ceux présents dans des systèmes opérationnels.  ;
Les modèles utilisent aussi le graphe d’entreprise, qui cartographie les relations derrière les données d’entreprise (notamment les personnes, les projets et les processus), afin de fournir du contexte à l’IA. Le graphe d’entreprise peut déterminer le rôle du document dans l’ensemble de l’organisation : s’il est largement partagé au sein des équipes sécurité, fréquemment consulté par des formateurs, ou intégré à des parcours d’onboarding, cela suggère un cas d’usage légitime pour du contenu sensible. À l’inverse, des documents avec des schémas d’accès restreints, un historique de consultation limité, ou un accès concentré sur des rôles à hauts privilèges peuvent indiquer un risque plus élevé.

Mettez l’IA au travail en toute confiance grâce à la sécurité des données automatisée
Les modèles de contenus sensibles marquent un tournant — chez Glean, nous utilisons désormais l’IA pour sécuriser l’IA elle-même. En comprenant à la fois le contexte du document et le contexte d’entreprise, nous pouvons concevoir des modèles d’IA capables de distinguer les données réellement sensibles du bruit sur l’ensemble des données non structurées. Glean protège les contenus sensibles avec précision et déploie l’IA en toute sécurité dans toute l’entreprise.
Consultez notre page September Drop pour en savoir plus sur d’autres fonctionnalités Glean passionnantes sorties cette semaine !  ;
Les modèles de contenus sensibles sont en bêta et font partie de Glean Protect+, une suite de sécurité premium.












