Un guide complet sur la recherche d’informations en 2024

0
minutes de lecture
Un guide complet sur la recherche d’informations en 2024

Table des matières

Vous avez des questions ou souhaitez une démo ?

Nous sommes là pour vous aider ! Cliquez sur le bouton ci-dessous et nous vous recontacterons.

Demander une démo
Partager cet article :

La recherche d’information est le processus qui consiste à trouver et à classer des informations pertinentes au sein d’un vaste ensemble de données en réponse à une requête. Au lieu de renvoyer un enregistrement exact unique, un système de recherche d’information explore des sources non structurées comme des documents, des pages web et des messages, puis classe les résultats selon leur correspondance avec ce que vous avez demandé.

Vous interagissez avec la recherche d’information tous les jours. Elle alimente les moteurs de recherche web, les bibliothèques numériques, la recherche de produits e-commerce et la recherche d’entreprise dans les outils internes d’une société. Elle est aussi à la base de l’IA moderne : la retrieval-augmented generation (RAG) utilise une étape de recherche d’information pour fournir aux grands modèles de langage le bon contexte avant qu’ils ne répondent.

Pour les organisations, la qualité de la recherche d’information détermine la rapidité avec laquelle les employés trouvent des réponses fiables plutôt que des réponses obsolètes ou incomplètes. La recherche sur le lieu de travail de Glean applique ces principes à plus de 250 applications d’entreprise connectées, en renvoyant des résultats cités, tenant compte des autorisations et ancrés dans les connaissances de votre entreprise. Ce guide explique le fonctionnement de la recherche d’information, les modèles et composants qui la sous-tendent, la manière dont sa qualité est mesurée et l’évolution du domaine.

Types de modèles de recherche d’information

Les modèles de recherche d’information (Information Retrieval, IR) sont des modèles mathématiques utilisés pour récupérer des informations pertinentes à partir d’un vaste ensemble de données. Voici quelques-uns des modèles d’IR couramment utilisés :

Modèle booléen

Le modèle booléen est le type de modèle d’IR le plus simple et le plus fondamental. Il est basé sur l’algèbre booléenne et utilise des opérateurs logiques (AND, OR, NOT) pour récupérer des documents pertinents. Dans ce modèle, la requête est représentée sous forme d’expression booléenne, et le moteur de recherche renvoie tous les documents qui satisfont l’expression.

Modèle vectoriel

Le modèle vectoriel (Vector Space Model, VSM) est un modèle d’IR largement utilisé qui représente les documents et les requêtes sous forme de vecteurs dans un espace multidimensionnel. Dans ce modèle, chaque terme du document ou de la requête est représenté comme une dimension de l’espace. La similarité entre les vecteurs de la requête et du document est utilisée pour récupérer les documents pertinents.

Modèle probabiliste

Le modèle probabiliste repose sur l’hypothèse que la pertinence d’un document par rapport à une requête est une fonction probabiliste. Le modèle utilise des techniques statistiques pour estimer la probabilité de pertinence et récupère les documents en fonction de leur probabilité de pertinence.

Modèle de langage

Le modèle de langage repose sur l’hypothèse qu’un document est une séquence de mots générée par un modèle de langage probabiliste. Dans ce modèle, la requête est également représentée comme un modèle de langage, et le moteur de recherche récupère des documents en fonction de leur similarité avec le modèle de langage de la requête.

Chacun de ces modèles a ses propres forces et faiblesses et convient à différents types d’applications. Le choix du modèle d’IR dépend des exigences spécifiques de l’application et du type de données sur lequel porte la recherche.

Les systèmes modernes s’appuient rarement sur un seul modèle. Ils combinent une recherche sparse, fondée sur des mots-clés, avec une recherche dense, neuronale, dans une approche hybride qui capture à la fois les correspondances exactes et le sens sémantique. Glean utilise ce type de recherche hybride, en associant un algorithme de recherche lexicale à un modèle de langage auto-apprenant, afin que les courts messages Slack et les longs documents soient tous deux classés avec précision.

Principaux composants d’un système de recherche d’information

Un système de recherche d’information est un programme logiciel qui récupère des informations à partir d’un ensemble de documents. Les principaux composants d’un système de recherche d’information incluent :

1. Collection de documents

La collection de documents est l’ensemble des documents dans lequel le système de recherche d’information effectue des recherches pour trouver des informations pertinentes. La collection peut être stockée sur un ordinateur local ou sur un serveur distant.

2. Indexation

L’indexation est le processus de création d’un index des mots de la collection de documents. L’index est utilisé pour trouver rapidement des documents qui contiennent des mots ou des expressions spécifiques. Le processus d’indexation implique la tokenisation, la racinisation et la suppression des mots vides.

3. Processeur de requêtes

Le processeur de requêtes est responsable du traitement des requêtes des utilisateurs et de la récupération des documents pertinents à partir de la collection de documents. Le processeur de requêtes utilise l’index pour trouver rapidement des documents qui correspondent à la requête.

4. Algorithme de classement

L’algorithme de classement est utilisé pour déterminer la pertinence de chaque document par rapport à la requête de l’utilisateur. L’algorithme de classement attribue un score à chaque document en fonction de facteurs tels que la fréquence des termes de la requête dans le document, l’emplacement des termes de la requête dans le document et la popularité du document.

5. Interface utilisateur

L’interface utilisateur est le composant du système de recherche d’information qui permet aux utilisateurs d’interagir avec le système. L’interface utilisateur peut prendre de nombreuses formes, notamment une interface en ligne de commande, une interface web ou une interface graphique.

Dans l’ensemble, ces composants travaillent ensemble pour offrir aux utilisateurs un accès rapide et précis aux informations pertinentes. Dans un contexte d’entreprise, ils passent à l’échelle à travers de nombreux outils : Glean construit un Enterprise Graph qui indexe le contenu, l’activité et l’identité de plus de 250 applications, puis applique un classement tenant compte des autorisations afin que les résultats reflètent à la fois la pertinence et ce que chaque utilisateur est autorisé à voir.

5 cas d’usage de la recherche d’information dans une organisation

La recherche d’information (Information retrieval, IR) est un élément crucial pour toute organisation ou entreprise qui traite de grands volumes de données. Voici cinq cas d’usage de l’IR qui peuvent contribuer à améliorer la productivité et l’efficacité au sein d’une organisation :

  1. Gestion documentaire : l’IR peut gérer et organiser les documents au sein d’une organisation. Cela inclut l’indexation, la recherche et la récupération de documents sur la base de mots-clés, de tags ou d’autres métadonnées. Avec l’IR, les employés peuvent facilement localiser les informations dont ils ont besoin, réduisant le temps et les efforts nécessaires pour trouver des documents pertinents.
  2. Service client : l’IR améliore le service client en fournissant des réponses rapides et précises aux demandes des clients. En utilisant l’IR pour récupérer des informations à partir d’une base de connaissances, les conseillers du service client peuvent rapidement trouver les informations nécessaires pour répondre aux questions des clients, réduisant les temps d’attente et améliorant la satisfaction client.
  3. Analyse de données : l’IR peut analyser de grandes quantités de données et en extraire des insights pertinents. Cela inclut l’indexation et la recherche dans des jeux de données afin d’identifier des motifs, des tendances et des corrélations. Avec l’IR, les organisations peuvent rapidement identifier des axes d’amélioration et prendre des décisions fondées sur les données.
  4. E-Discovery : l’IR peut être utilisée dans le cadre de procédures judiciaires pour rechercher et récupérer des documents et des informations pertinents. Cela inclut l’indexation et la recherche dans les e-mails, les documents et d’autres données électroniques afin de trouver des preuves liées à une affaire. Grâce à l’IR, les équipes juridiques peuvent rapidement localiser et analyser les informations pertinentes, réduisant le temps et les coûts nécessaires à l’e-discovery.
  5. Recherche d’entreprise : l’IR peut créer une plateforme de recherche centralisée permettant aux employés d’effectuer des recherches dans plusieurs sources de données. Cela inclut l’indexation et la recherche dans les e-mails, les documents, les bases de données et d’autres sources d’information. Grâce à la recherche d’entreprise, les employés peuvent trouver rapidement les informations dont ils ont besoin, quel que soit l’endroit où elles sont stockées.

Glean Search réunit ces cas d’usage au même endroit, en permettant aux employés de rechercher dans les e-mails, les documents, les tickets et les discussions, avec des résultats cités qui respectent les autorisations existantes.

Articles associés :

Différence entre recherche d’information et récupération de données

La recherche d’information (IR) et la récupération de données (DR) sont deux concepts liés, mais distincts, dans le domaine de la gestion des données. Bien que les deux impliquent la recherche de données spécifiques, elles diffèrent par leur périmètre et leur objectif.

Définition

La recherche d’information est le processus consistant à récupérer des informations pertinentes à partir d’un ensemble de données non structurées ou semi-structurées. Elle implique l’utilisation de moteurs de recherche ou d’autres systèmes de recherche d’information pour trouver des documents ou d’autres sources d’information correspondant à une requête donnée.

La récupération de données, en revanche, est le processus consistant à extraire des données spécifiques d’une base de données structurée ou d’un autre système de stockage de données. Elle implique l’utilisation de requêtes ou d’autres techniques de récupération de données pour extraire les données souhaitées d’un ensemble de données plus large.

Périmètre

Le périmètre de la recherche d’information est généralement plus large que celui de la récupération de données. Les systèmes de recherche d’information sont conçus pour explorer de vastes collections de données, comme internet ou une bibliothèque numérique, et renvoyer un ensemble de documents pertinents ou d’autres sources d’information.

La récupération de données, en revanche, est généralement centrée sur un ensemble de données ou une base spécifique. Elle extrait des éléments de données précis, tels que des noms de clients ou des chiffres de ventes, à partir d’un ensemble de données plus large.

Objectif

L’objectif de la recherche d’information est d’aider les utilisateurs à trouver des informations pertinentes rapidement et efficacement. Elle est souvent utilisée dans des situations où l’utilisateur ne sait pas exactement ce qu’il cherche et doit explorer une vaste collection de données pour identifier les informations pertinentes.

L’objectif de la récupération de données, en revanche, est d’extraire des éléments de données spécifiques à des fins d’analyse ou de traitement. Elle est souvent utilisée dans des applications de business intelligence ou d’analyse de données, où l’utilisateur doit extraire des éléments précis d’un ensemble de données plus large pour approfondir l’analyse.

Glean prend en charge le volet « recherche d’information » de cette distinction. Glean Assistant récupère et classe les connaissances non structurées à travers vos outils, puis renvoie des réponses citées plutôt que des lignes brutes issues d’une base de données.

Comment mesurer la qualité de la recherche d’information

La qualité de la recherche d’information se mesure principalement à l’aide de trois métriques : la précision, le rappel et la mesure F. Chacune compare les résultats renvoyés par un système aux documents qui sont réellement pertinents pour une requête.

  • La précision est la proportion de documents récupérés qui sont pertinents. Si une recherche renvoie 10 résultats et que 7 sont utiles, la précision est de 70 %.
  • Le rappel est la proportion de tous les documents pertinents que le système a effectivement récupérés. Si 20 documents pertinents existent et que la recherche en trouve 15, le rappel est de 75 %.
  • La mesure F est un score unique qui équilibre précision et rappel, afin qu’un système ne puisse pas paraître performant en privilégiant l’un au détriment de l’autre.

Glean évalue la qualité de récupération grâce à une évaluation basée sur des LLM, en notant à la fois si le système a récupéré les documents les plus pertinents et s’il les a utilisés pour générer une réponse exacte.

Tendances émergentes en recherche d’information

Dans le domaine en évolution de la recherche d’information, on observe un net passage vers des techniques plus nuancées et sophistiquées. Ces méthodes promettent une meilleure précision et une meilleure expérience utilisateur pour trouver des informations pertinentes.

Tendances émergentes en recherche d’information

Recherche sémantique

La recherche sémantique va au-delà de la correspondance par mots-clés pour comprendre l’intention et le sens contextuel derrière la requête d’un utilisateur. Elle s’appuie sur le traitement automatique du langage naturel (NLP) et sur des technologies sémantiques pour interpréter la requête d’une manière plus proche de celle d’un humain. Cette approche permet d’établir un lien entre les termes de recherche et la compréhension conceptuelle de ces termes.

Approches d’apprentissage automatique

L’apprentissage automatique transforme la recherche d’information en permettant aux systèmes d’apprendre à partir des données et de s’améliorer au fil du temps. Des modèles prédictifs et des algorithmes sont entraînés pour améliorer la pertinence des résultats, la personnalisation et fournir de meilleures recommandations. Des techniques comme l’apprentissage supervisé pour la classification et l’apprentissage non supervisé pour développer des modèles de sujets jouent un rôle clé dans l’amélioration des systèmes de recherche.

Recherche d’information multimédia

La recherche d’information multimédia répond au besoin croissant de rechercher et de gérer efficacement divers types de contenus tels que les images, les vidéos et l’audio. Les innovations dans ce domaine s’appuient sur des techniques de recherche basées sur le contenu, où le contenu lui-même est analysé pour en extraire des caractéristiques comme la couleur, la texture ou la forme. De plus, les métadonnées et les systèmes de balisage automatique sont essentiels pour permettre des capacités de recherche plus fines au sein des bases de données multimédias.

Recherche d’information dans l’IA et la RAG

La recherche d’information sert désormais d’ancrage aux grands modèles de langage (LLM) via la retrieval-augmented generation (RAG), une technique qui récupère un contexte pertinent depuis une source de connaissances et l’alimente à un modèle avant que celui-ci ne génère une réponse. Sans cette étape de récupération, un modèle s’appuie uniquement sur ses données d’entraînement et est susceptible d’halluciner ou de ne citer aucune source.

Pour les entreprises, la qualité de la récupération détermine la qualité des réponses. Glean Assistant utilise une récupération tenant compte des autorisations pour n’extraire que les documents auxquels un utilisateur est autorisé à accéder, puis renvoie des réponses citées, ancrées dans les connaissances de votre entreprise, afin que les employés puissent vérifier chaque réponse. Les recherches de Glean sur le raisonnement agentique ont montré que cette approche augmentait la pertinence des réponses et des actions de 24 %. Pour en savoir plus, consultez la présentation de Glean sur le raisonnement agentique et l’avenir de Work AI.

Tirer le meilleur parti de l’IA générative

L’IA générative n’est fiable que dans la mesure où la récupération d’informations qui la sous-tend l’est. Glean ancre la genAI dans les connaissances de votre entreprise, grâce à une récupération tenant compte des autorisations et à des réponses citées, afin que les employés obtiennent des réponses auxquelles ils peuvent se fier et qu’ils peuvent vérifier.

Glean se connecte aux applications d’entreprise via plus de 250 connecteurs, en indexant le contenu tout en respectant les autorisations existantes de chaque source. Le gain est mesurable : les employés déclarent que l’IA leur fait gagner 11 heures par semaine, selon le Work AI Index 2026 de Glean. Prêt à le voir avec vos propres données ? Demandez une démo de Glean pour découvrir comment la récupération d’informations et l’IA peuvent fonctionner à travers vos outils.

Foire aux questions

Quelle est la différence entre la récupération d’informations et un moteur de recherche ?

Un moteur de recherche est un système de récupération d’informations appliqué, tandis que la récupération d’informations est la science sous-jacente qui consiste à trouver et à classer les données pertinentes. Chaque moteur de recherche, de Google à Glean Search, repose sur des principes de récupération d’informations.

Quels sont les principaux types de modèles de récupération d’informations ?

Les principaux modèles sont booléens, à espace vectoriel, probabilistes et des modèles de langage. Les systèmes modernes combinent souvent des modèles clairsemés et neuronaux dans une récupération hybride pour une meilleure pertinence.

Comment la récupération d’informations est-elle utilisée en IA et en RAG ?

Dans la génération augmentée par récupération (RAG), la récupération d’informations fournit le contexte pertinent dont un grand modèle de langage a besoin pour répondre avec précision. Glean utilise une récupération tenant compte des autorisations pour ancrer ses réponses dans les connaissances de votre entreprise et citer chaque source.

Comment les performances de la récupération d’informations sont-elles mesurées ?

Les performances de la récupération d’informations se mesurent avec la précision, le rappel et la mesure F. La précision indique combien de résultats récupérés sont pertinents, le rappel indique combien de résultats pertinents ont été trouvés, et la mesure F équilibre les deux.

La récupération d’informations est-elle la même chose que la récupération de données ?

Non. La récupération d’informations recherche des données non structurées et classe les résultats par pertinence, tandis que la récupération de données extrait des correspondances exactes à partir de bases de données structurées.

Work AI qui fonctionne.

CTA Background Gradient 3CTA Background Gradient 3CTA Background Mobile