Le contexte d’entreprise commence avec l’indexation, mais ne s’y arrête pas

0
minutes de lecture
Le contexte d’entreprise commence avec l’indexation, mais ne s’y arrête pas

Table des matières

Vous avez des questions ou souhaitez une démo ?

Nous sommes là pour vous aider ! Cliquez sur le bouton ci-dessous et nous vous recontacterons.

Demander une démo
Partager cet article :

De plus en plus de fournisseurs d’IA d’entreprise se tournent vers l’indexation pour améliorer la précision, la latence et l’efficacité des tokens. C’est une très bonne nouvelle. Cela valide un principe sur lequel Glean s’appuie depuis notre création : donner à l’IA l’accès aux systèmes de l’entreprise ne suffit pas. Les données d’entreprise doivent être organisées, soumises aux autorisations, et rendues pertinentes avant qu’un modèle puisse les exploiter efficacement.

L’indexation est l’un des moyens les plus efficaces d’apporter le contexte d’entreprise à l’IA. Nos clients bénéficient de l’indexation de Glean depuis 2019, sur l’ensemble de leurs applications, et ses bénéfices n’ont fait que se renforcer à mesure que l’IA prend en charge des tâches plus longues et plus complexes. Le rôle que joue l’indexation dans la réduction de la consommation de tokens, en simplifiant la récupération du contexte pertinent, devient de plus en plus important.

Mais l’indexation seule ne constitue pas l’ensemble du système. Ce n’est qu’un composant du système de contexte de Glean. L’indexation rend l’information d’entreprise découvrable et pertinente. Les graphes cartographient les relations afin que la pertinence reflète la façon dont l’entreprise fonctionne réellement. La mémoire conserve les apprentissages d’une session et d’une tâche à l’autre. Les connecteurs de données ingèrent ou récupèrent l’information via l’indexation, des requêtes structurées ou une fédération en temps réel selon la source. Les outils permettent à l’IA d’agir sur ce contexte.

Tous les index ne connectent pas l’entreprise

« Nous indexons vos données » peut décrire des systèmes très différents. Cela peut vouloir dire générer des embeddings limités pour des documents provenant de quelques applications, ou même maintenir un index séparé pour chaque source. La meilleure indexation couvre l’ensemble de vos applications d’entreprise, en créant une base unifiée, respectueuse des permissions, qui préserve les entités, les identités, l’activité et les relations. On appelle tout cela des index. Ils ne donnent pas à l’IA la même vision de l’entreprise.

Un index par application peut améliorer la récupération au sein de cette source. Mais le travail en entreprise reste rarement dans un seul système. Un client peut apparaître dans le CRM, des tickets de support, des notes d’appel et des documents de planification. Si ces sources restent isolées, le modèle doit malgré tout reconnaître qu’elles renvoient au même client et réconcilier des résultats classés séparément par chaque système.

Glean normalise le contenu et les signaux à travers les applications connectées afin que la recherche et les agents partent d’une base cohérente et respectueuse des permissions. La pertinence est préparée avant la requête, et non reconstruite à chaque fois à partir de résultats déconnectés.

Un index d’entreprise a besoin d’étendue et de profondeur

De nombreux fournisseurs affirment se connecter à une gamme de systèmes clés de l’entreprise, mais compter les connecteurs ne raconte qu’une partie de l’histoire. Ce qui compte, c’est à la fois jusqu’où un index s’étend et ce qu’il préserve une fois sur place.

Étendue : l’index atteint-il l’endroit où le travail se fait ?

Le contexte n’est utile qu’à la hauteur des sources qu’il inclut. Un index qui atteint le wiki de l’entreprise et la file de support, mais s’arrête avant le CRM, peut répondre correctement aux questions de processus et incomplètement aux questions clients. Le risque d’inexactitude est d’autant plus grand que la réponse peut tout de même sembler complète, entraînant des erreurs évitables. Aucun système d’IA ne peut prendre en compte une décision, une relation ou une exception qu’il n’a jamais eu l’occasion de trouver.

Les lacunes de couverture sont silencieuses. Elles ne produisent pas de message d’erreur. Elles produisent des réponses confiantes auxquelles il manque des éléments.

Profondeur : l’index préserve-t-il ce qui rend chaque source utile ?

Un connecteur peut récupérer du texte tout en perdant la structure qui l’entoure. Un enregistrement peut arriver sans son propriétaire, son statut, ses permissions ou ses relations. Un document peut perdre les signaux d’activité et de fraîcheur qui indiquent si les équipes s’y fient encore. 

Glean indexe le texte intégral, mais aussi les métadonnées, les entités structurées, les identités, les permissions et les signaux d’activité. Une opportunité Salesforce reste une opportunité, avec ses champs et ses relations intacts, plutôt que d’être stockée comme un bloc de texte décrivant ces champs. Les permissions de la source sont répliquées, et les mises à jour, les changements de permissions et les suppressions sont reflétés au fur et à mesure que les systèmes sous-jacents évoluent.

Cette profondeur façonne aussi le classement. La similarité sémantique peut montrer que deux documents traitent du même sujet. Elle ne peut pas dire au système lequel l’entreprise considère comme fiable. L’auteur, les vues, les modifications, les commentaires, la fraîcheur et les relations aident à déterminer ce qui est réellement pertinent, tandis que les permissions protègent toujours les données sensibles et contrôlent ce que chaque personne peut voir.

Des travaux différents nécessitent des index différents

L’information d’entreprise n’a pas partout le même aspect ni le même comportement. Un document de politique interne, un dépôt de code, une fiche client, un profil employé et un événement de calendrier posent chacun un problème de récupération différent. Résoudre ces problèmes de récupération rapidement et efficacement devient de plus en plus important à mesure que l’IA prend en charge des tâches plus longues, plus importantes et plus complexes.

La récupération sémantique aide lorsqu’une personne décrit une idée différemment de la source. La récupération lexicale est préférable lorsque les mots exacts comptent, comme un nom, un identifiant, un nom de fichier ou un message d’erreur. Les enregistrements structurés doivent préserver leurs champs et leurs relations plutôt que d’être aplatis en texte. Trouver le bon expert ou le bon outil repose sur des signaux différents de ceux nécessaires pour trouver un document.

C’est pourquoi Glean ne s’appuie pas sur un seul index polyvalent. Il utilise des index spécialisés pour les données de l’entreprise, le code, les experts, les profils, les outils et les calendriers. Ces index rendent la récupération plus rapide et plus simple, réduisant l’effort dont l’IA a besoin pour fournir des réponses utiles, précises et fiables.

Un meilleur index améliore l’efficacité et le rendement des tokens

Lorsque l’information source est correctement indexée, les modèles ont moins de travail à faire. Point important : l’efficacité des tokens commence avant même que le modèle ne se mette à raisonner. Au moment où une question parvient au modèle, le système devrait déjà avoir effectué une grande partie du travail consistant à trouver et à préparer le bon contexte. Glean construit des index sémantiques et lexicaux sur mesure, entraînés sur le corpus de votre entreprise, apprenant les acronymes, les noms de produits, les noms d’équipes, les termes métier, afin que la récupération trouve le bon contexte dès le premier passage, au lieu que le modèle doive lui-même trier et lever les ambiguïtés.

L’efficacité des tokens ne consiste pas à poursuivre le nombre de tokens le plus bas possible pour le principe. L’objectif est de consacrer les tokens au raisonnement plutôt qu’à trier à répétition des résultats faibles ou redondants. Une fenêtre de contexte plus grande, à elle seule, ne résout pas ce problème. Davantage d’informations non triées donne au modèle plus à passer au crible, pas une meilleure compréhension de ce qui compte.

Cela devient plus important à mesure que les agents prennent en charge des tâches plus longues. Un contexte faible à une étape peut déformer tout ce qui suit. Une base de récupération plus solide rend la qualité et la latence plus prévisibles et laisse davantage d’attention du modèle pour le raisonnement, la planification et l’action.

En pratique, une meilleure efficacité des tokens signifie qu’une plus grande partie de l’effort du modèle est consacrée à la tâche, et une plus petite au tri du contexte.

L’index est la base de l’IA d’entreprise

Un index solide aide l’IA à trouver la bonne information. Mais la recherche n’est qu’une partie du travail. Un agent doit encore comprendre comment ces informations s’articulent entre elles, comment le travail est réalisé, quels outils utiliser, et si le résultat est réellement bon.

L’indexation est une composante d’un système de contexte efficace

C’est précisément ce que le système de contexte de Glean est conçu pour faire. Index, graphes, mémoire, connecteurs de données et outils résolvent chacun une partie différente du problème du contexte.

  • Les index trouvent les informations pertinentes. Glean utilise des index spécialisés pour les données d’entreprise, le code, les experts, les profils, les outils et les calendriers, ainsi que des modes de recherche sémantique, lexicale et structurée, adaptés à différents types d’informations et de questions.
  • Les graphes expliquent comment les informations s’articulent entre elles. L’Enterprise Graph relie les personnes, les équipes, les clients, les projets, les contenus, les applications et les processus à l’origine du travail. Les graphes personnels ajoutent du contexte sur la manière dont une personne travaille, y compris ses tâches, ses préférences, ses projets et ses schémas d’activité.
  • La mémoire conserve et prolonge le contexte utile. La mémoire d’entreprise aide les agents à appliquer ce qui a été appris sur des travaux plus longs, tandis que la mémoire personnelle aide à adapter les réponses et les tâches à une personne au fil du temps.
  • Les connecteurs de données empruntent le bon chemin pour chaque source. Certaines informations sont mieux indexées. Les systèmes structurés peuvent être interrogés directement. D’autres sources nécessitent une recherche fédérée ou en temps réel. Glean prend en charge chaque approche plutôt que de forcer tous les systèmes à passer par la même méthode de recherche.
  • Les outils permettent à l’IA d’agir. Des actions natives et basées sur MCP permettent aux agents de mettre à jour des enregistrements, d’envoyer des communications et d’exécuter des tâches dans des applications connectées.

Il ne s’agit pas de cinq fonctionnalités indépendantes assemblées autour d’un index. Elles se renforcent mutuellement. Des signaux plus riches issus des connecteurs et des outils donnent au graphe davantage d’entités, de relations et de signaux de pertinence sur lesquels s’appuyer. Ensemble, l’Enterprise Graph et les graphes personnels ajoutent du contexte sur le fonctionnement de l’entreprise et sur la manière dont chaque personne y travaille. La mémoire prolonge ce contexte, et les outils le transforment en action.

Un index superficiel limite tout ce qui est construit dessus. Mais même le meilleur index ne peut pas faire tout le travail.

C’est la différence entre ajouter un index et construire un système de contexte. Un index aide l’IA à trouver l’information. Le système de contexte de Glean l’aide à comprendre l’entreprise, à agir en fonction de ce qu’elle sait et à apprendre du travail.

Ce que les entreprises devraient demander ensuite

Voir davantage de fournisseurs investir dans l’indexation est une évolution bienvenue. Mais une annonce d’index n’est qu’un point de départ. Les entreprises doivent examiner l’index en détail, puis aller au-delà.

Comment l’index fonctionne-t-il ? Unifie-t-il les informations à travers les applications ou garde-t-il chaque source séparée ? Préserve-t-il les entités, les champs, les identités, les autorisations, la fraîcheur et l’activité ? Utilise-t-il des méthodes de recherche adaptées à différents types de travail ? Et quelle part du classement, du filtrage et de la préparation du contexte est effectuée avant que le modèle ne commence à consommer des tokens ?

Qu’est-ce que le fournisseur a construit au-delà de l’index ? Le système peut-il relier les informations via les relations d’entreprise, comprendre la personne et le processus derrière la tâche, prolonger les apprentissages, choisir et utiliser les bons outils, et déterminer si le travail a été réalisé avec succès et dans le respect des règles de l’entreprise ?

Comment le fournisseur sécurise-t-il les données indexées ? L’index peut-il refléter les autorisations dans les systèmes sources ? Comment le fournisseur protège-t-il contre des données sensibles qui pourraient ne pas être correctement protégées par des autorisations au sein d’une organisation ?

Glean construit sur ces fondations depuis 2019. Le critère n’est pas de savoir si un fournisseur a un index. C’est de savoir s’il a construit le système de contexte dont l’IA a besoin pour comprendre l’entreprise et mener à bien un travail réel.

Voir Work AI en action

Get a demo
Get a demo