Donc, votre fournisseur d’IA développe des connecteurs d’entreprise — voici 9 questions pour distinguer les véritables systèmes d’IA pour l’entreprise

0
minutes de lecture
Donc, votre fournisseur d’IA développe des connecteurs d’entreprise — voici 9 questions pour distinguer les véritables systèmes d’IA pour l’entreprise

Table des matières

Vous avez des questions ou souhaitez une démo ?

Nous sommes là pour vous aider ! Cliquez sur le bouton ci-dessous et nous vous recontacterons.

Demander une démo
Partager cet article :

L’IA d’entreprise s’appuie sur du contexte provenant de plusieurs dizaines d’applications SaaS, notamment la gestion documentaire, le chat et l’e-mail, la gestion de projet, les dépôts de code, la gestion de la relation client (CRM) et les systèmes de planification des ressources de l’entreprise (ERP). Ce contexte constitue la base de la prise de décision et aide à déterminer quelle action un agent doit entreprendre ensuite. L’accès au bon contexte dépend de la qualité de conception des connecteurs de données par votre fournisseur d’IA. Leur architecture détermine s’ils peuvent passer à l’échelle jusqu’à des centaines de millions de documents, récupérer des données en temps réel et maintenir des index résilients et hautement fiables. Tout aussi important, les connecteurs de données définissent la manière dont l’information de l’entreprise est consultée.

Lorsque des fournisseurs d’IA commencent à proposer la prise en charge de connecteurs de données, il est essentiel de commencer à poser des questions sur leur conception. Ces questions contribuent à garantir que le contexte d’entreprise — le fondement des décisions pilotées par l’IA — reste intact.

1. Indexez-vous les données ou effectuez-vous une récupération fédérée ?  ; ;  ;

Une recherche d’entreprise efficace, colonne vertébrale d’une IA de qualité, commence par l’indexation — le stockage et l’organisation des données pour une récupération rapide et précise. Pensez à l’index à la fin d’un livre : au lieu de lire tout le livre pour trouver une information, vous pouvez aller directement à la page pertinente. Les index de recherche fonctionnent de la même manière, mais au-delà de la vitesse, ils améliorent la qualité en normalisant les résultats, en appliquant un scoring et en gérant de façon cohérente les synonymes et les acronymes. C’est ainsi que Google a structuré le web pour comprendre l’information du monde. Même si c’était un problème d’envergure, les données internet avaient aussi l’avantage d’un modèle de données standard et d’une architecture ouverte. À l’inverse, les entreprises ont des données hétérogènes, avec des permissions propres à chaque utilisateur.

Une autre approche, la récupération fédérée, consiste à récupérer les données directement depuis diverses sources via leurs API de recherche. Cependant, la qualité et la latence des API varient fortement, ce qui rend les résultats incohérents. Dans un système fédéré, vous interrogez des dizaines de systèmes en parallèle, puis vous attendez que les résultats les plus lents reviennent avant de générer une réponse. Il n’existe pas de système de scoring unifié entre les sources, ce qui conduit souvent à une simple union des résultats. Avec la fenêtre de contexte limitée des LLM, ce problème s’amplifie, forçant l’IA à traiter les données d’entreprise de manière inefficace et sans véritable compréhension du contexte — ce qui réduit la précision et la pertinence des résultats. La récupération fédérée exige aussi que les utilisateurs sachent exactement quelle source de données interroger. Un signe révélateur d’un système de récupération fédérée est lorsque les fournisseurs exigent une authentification utilisateur pour chaque source de données.

Chez Glean, nous avons constaté que la plupart des clients extraient des données d’au moins trois sources différentes pour répondre à une seule question. Les données sont fragmentées, et les utilisateurs ne savent pas toujours où est stockée l’information dont ils ont besoin. C’est pourquoi l’indexation est essentielle pour l’IA d’entreprise.

Votre fournisseur doit indexer vos données à l’aide d’index de recherche à la fois sémantiques et lexicaux, afin d’ancrer votre IA dans le contexte d’entreprise le plus pertinent.

2. Comment appliquez-vous les permissions des sources de données ?  ;

Chaque connecteur possède son propre ensemble de permissions  votre fournisseur d’IA doit donc respecter des structures de permissions granulaires au niveau de la source de données. Les systèmes d’entreprise utilisent un mélange de :

  • Listes de contrôle d’accès (ACL)
  • Structures de répertoires
  • Hiérarchies de groupes
  • Exceptions individuelles
  • Paramètres de partage par lien
  • Une combinaison des éléments ci-dessus
  • Des changements en temps réel de l’ensemble de ces éléments, qui doivent être appliqués instantanément

Votre fournisseur d’IA doit garantir des mises à jour en temps réel des permissions afin d’empêcher tout accès non autorisé aux données. Des contrôles d’entreprise capables de gérer l’indexation jusqu’au niveau d’un document individuel garantissent également que les données sensibles ou non pertinentes restent hors de votre base de connaissances.

Un aspect souvent négligé de la conception des connecteurs est la nécessité de construire un graphe d’identité entre les sources de données afin que les utilisateurs ne voient que ce à quoi ils sont autorisés. Les noms d’utilisateur et les e-mails diffèrent également d’une application à l’autre, ce qui rend essentiel le rapprochement des alias dans un graphe d’identité.

Certains fournisseurs contournent cette complexité en n’indexant que les données de l’entreprise accessibles publiquement, comme des wikis et des canaux Slack publics, ou en n’appliquant que des permissions larges et de haut niveau. Cependant, pour être sécurisée, l’IA d’entreprise doit refléter la granularité des contrôles d’accès du monde réel.

3. Comment protégez-vous les données sensibles ?

Les permissions seules ne suffisent pas à protéger les données d’entreprise. Sous le poids de la prolifération du SaaS, de nombreuses organisations ont subi des politiques de conservation et d’application des règles trop laxistes. À mesure que l’adoption de l’IA passe du simple téléversement de fichiers à l’intégration de données d’entreprise à grande échelle, les fournisseurs doivent être évalués sur leur capacité à offrir une couche supplémentaire de gouvernance afin d’empêcher que des informations sensibles — secrets commerciaux, données clients, dossiers financiers — ne se retrouvent dans des réponses générées par l’IA.

4. À quelle fréquence les nouvelles données sont-elles mises à jour et rendues accessibles à l’IA ?

La valeur des données d’entreprise peut se dégrader rapidement. À mesure que l’IA évolue vers des systèmes agentiques qui agissent sur la base d’un contexte en temps réel, il est plus important que jamais que les résultats soient ancrés dans le contexte de messages Slack récents, d’e-mails Microsoft Outlook ou de réunions Zoom. Vous devez vous attendre à ce que des connecteurs en temps réel répercutent les mises à jour des données en quelques minutes, et non en heures.

Maintenir les données et les permissions à jour représente un défi trompeur. Les fournisseurs opèrent dans les limites de taux des API imposées par les sources de données, où les coûts de requête et les quotas varient — et peuvent évoluer dynamiquement en fonction de la charge des serveurs. Vous voudrez un fournisseur qui utilise intelligemment plusieurs stratégies de crawl pour récupérer autant de données que possible sans saturer l’API. Toutefois, cela exige de la finesse et un respect constant de limites d’API changeantes. Cela nécessite aussi une priorisation rigoureuse de l’ordre des éléments à indexer, en faisant passer l’indexation des permissions avant celle du contenu afin de maintenir la sécurité des données.  ;

5. Qui est responsable de la modélisation des données ?

Un autre facteur clé à évaluer est l’effort requis pour rendre chaque source de données exploitable par un système d’IA. De nombreux fournisseurs proposent de vastes catalogues d’intégrations mais laissent la modélisation des données et l’indexation au client. Ils peuvent aussi s’appuyer sur des intégrateurs de systèmes pour réaliser l’essentiel du travail plutôt que de proposer une prise en charge native des connecteurs de données.

La modélisation des données est complexe, car chaque application a sa propre structure. Prenez Slack, par exemple :

  • Canaux publics vs. privés
  • DM, messages de groupe et conversations en fil
  • Posts principaux vs. mentions
  • Pièces jointes, liens et espaces de travail partagés

Chaque élément est interconnecté — les fils renvoient aux posts d’origine et les messages Slack n’ont pas de titres traditionnels, ce qui peut affecter le classement dans un moteur de recherche classique. Une modélisation des données efficace aide l’IA à interpréter la structure d’une application et à classer l’information.

La plupart des entreprises ont déjà investi massivement dans la modélisation des données pour l’analytique structurée. Étendre cet effort aux données non structurées dans les LLM est gourmand en ressources et évolue en permanence à mesure que les applications introduisent de nouvelles fonctionnalités. Les fournisseurs d’IA doivent adapter en continu leur modèle de données plutôt que d’adopter une approche « on configure une fois et on n’y touche plus », car chacune de ces applications SaaS publie constamment de nouvelles fonctionnalités et fait évoluer son modèle de données.

6. Quelles données indexez-vous ?

Les informations d’entreprise les plus pertinentes sont souvent fiables, récentes et personnalisées. Capturer ces facteurs nécessite plus que le simple indexage du contenu — les données d’activité et de personnes reflètent comment et par qui l’information est utilisée. Le contexte plus large est essentiel, car les applications de recherche d’entreprise et d’IA manquent de signaux de feedback robustes. Sans cela, l’IA a du mal à comprendre et à apprendre l’importance d’un document unique.  ;

Comprendre quel contenu est indexé est également important. Dans de nombreux cas, seule une fraction du contenu ou des fonctionnalités d’une source de données est prise en charge, ce qui limite la capacité de l’IA à fournir des insights complets. Évaluer la profondeur et l’étendue de l’indexation aide l’IA d’entreprise à disposer de tout le contexte nécessaire pour des résultats pertinents.  ;

Pour les entreprises disposant de plusieurs années de contexte historique, l’indexation intelligente est clé pour l’efficacité des coûts. Fixer des limites rigides basées sur le temps, comme n’indexer que l’année écoulée, peut exclure des données fiables à forte valeur. Une approche plus efficace consiste à utiliser des algorithmes dynamiques qui déterminent quoi indexer, en s’adaptant en fonction de l’activité continue et de la pertinence, et en veillant à ce que l’IA traite les données les plus précieuses tout en évitant des coûts de stockage inutiles.

7. Organisez-vous les données dans un graphe de connaissances ?

Indexer le contenu, l’activité et les données de personnes n’est que la première étape. Le véritable facteur différenciant des connecteurs de données d’IA pour l’entreprise, ce sont les graphes de connaissances.

La connaissance d’entreprise ne consiste pas seulement à traiter du texte — il s’agit de comprendre comment l’information est utilisée, qui en dépend et son impact global. Même au sein d’une même organisation, des termes peuvent avoir des significations différentes  par exemple, « POC » peut signifier « proof of concept » en ingénierie mais « point of contact » en ventes. Les graphes de connaissances fournissent cette structure, donnant à l’IA le contexte nécessaire pour rendre la connaissance actionnable et améliorer la prise de décision.

Construire un graphe de connaissances est complexe, car il faut fusionner les données d’entreprise, puis les passer au crible pour identifier et comprendre des concepts à travers des documents, des messages et des requêtes. Ce processus doit aller au-delà de la simple correspondance de texte, car les concepts sont souvent désignés par plusieurs noms.  ;

8. Où l’index est-il stocké ?

À mesure que le nombre de connecteurs augmente, l’ensemble de votre base de connaissances d’entreprise est effectivement indexé, créant une quasi réplique de vos données. Cela soulève des considérations importantes sur où et comment ces données sont stockées. Un modèle de déploiement cloud-prem, où les données résident dans votre VPC isolé, offre davantage de contrôle et de sécurité que les environnements SaaS multi-tenant traditionnels.  ;

Au-delà du stockage, protéger le transfert des données d’entreprise vers les LLM est tout aussi important. Établir des accords avec les fournisseurs de LLM pour une conservation des données nulle et aucune utilisation pour l’entraînement sur les données d’entreprise permet d’éviter la fuite accidentelle de données d’entreprise vers les LLM.  ;

9. Comment votre infrastructure de connecteurs passe-t-elle à l’échelle ?

Explorer et indexer des données à travers un écosystème d’entreprise de connecteurs nécessite une infrastructure de crawl distribuée horizontalement. Chaque source de données demande une quantité de travail différente — par exemple, un message Slack est bien plus petit qu’un fichier Google Drive. Et un fichier texte brut est plus simple à indexer qu’un PDF, qui nécessite un prétraitement. Au-delà de la complexité des données, les quotas d’API posent des défis. Ces quotas ne montent pas proportionnellement au volume de données, créant des goulots d’étranglement dans votre infrastructure de crawl et limitant la vitesse à laquelle les données peuvent être indexées.  ;

Ce défi ne se manifeste pas pour les petites équipes, mais oui pour les entreprises comptant 10 000 à 100 000 utilisateurs et gérant des centaines de millions de documents. Gérer des données à l’échelle de l’entreprise exige une approche d’indexation qui optimise l’efficacité et la montée en charge indépendante, tout en composant avec les contraintes des API.  ;

Réflexions finales

Les connecteurs de données ont un impact direct sur la qualité et la sécurité de l’IA d’entreprise. Une base solide de connecteurs avec indexation du contenu, de l’activité et des personnes, application des permissions et mises à jour en temps réel donne aux agents IA le contexte dont ils ont besoin pour prendre des décisions automatisées de manière intelligente. En posant ces questions difficiles, vous pouvez évaluer si un fournisseur comprend réellement la complexité de la création d’un framework de connecteurs prêt pour l’entreprise. Ne vous contentez pas de les croire sur parole quant au support futur des connecteurs — creusez la manière dont ils prévoient de les implémenter et de les maintenir. Ainsi, vous pourrez prendre des décisions éclairées sur la façon dont vos données alimentent les agents IA et, à terme, sur l’avenir de l’IA au sein de votre organisation.

Work AI qui fonctionne.

CTA Background Gradient 3CTA Background Gradient 3CTA Background Mobile