Les avancées des grands modèles de langage (LLMs) et de l’IA générative ont ouvert la voie à des expériences de recherche plus abouties. Pour obtenir des réponses à leurs questions, les utilisateurs peuvent désormais s’adresser à des chatbots d’IA tels que ChatGPT et recevoir une réponse en quelques secondes, au lieu de passer des heures à éplucher de longues pages de résultats de recherche. Cependant, dans sa forme actuelle, la production des LLMs n’est pas ancrée dans des connaissances exactes et fiables, et peut parfois générer des réponses fondées sur des informations erronées ou biaisées. Pour y remédier, une solution consiste à intégrer un système de recherche qui fournit aux LLMs des informations crédibles.
Heureusement, l’essor des LLMs a également profité à la recherche. La recherche vectorielle, qui utilise des embeddings dérivés de ces LLMs, a introduit un nouveau niveau d’intelligence dans les systèmes de recherche. Dans cet article, nous comparerons les offres d’embeddings de texte du marché et montrerons comment Glean crée des modèles d’embeddings avancés pour les entreprises en les affinant avec le langage propre à chaque organisation. Ces modèles d’embeddings spécifiques à l’entreprise sont ensuite combinés à des méthodes classiques de recherche d’information et à une personnalisation avancée pour créer un système hybride qui améliore les capacités de recherche en entreprise.
Introduction à la recherche vectorielle
Les embeddings sont des représentations numériques du texte qui en capturent les informations sémantiques, ce qui permet aux ordinateurs de mieux comprendre les relations entre les concepts. Contrairement aux méthodes traditionnelles de recherche d’information par correspondance de mots-clés, la recherche vectorielle s’appuie sur ces représentations pour fournir des résultats plus précis dans certains scénarios.

Pour comprendre les performances des embeddings dans la recherche en entreprise, nous avons mené une expérience en utilisant les meilleurs embeddings de texte de deux grands fournisseurs de LLMs, ainsi que trois modèles open source les plus performants. L’expérience a évalué les performances de différents modèles d’embeddings de texte sur un jeu d’évaluation de recherche en entreprise. Pour mesurer l’efficacité de ces embeddings, nous avons utilisé deux métriques clés : NDCG@10 et R@100. NDCG@10 mesure la qualité des 10 premiers résultats de recherche en tenant compte à la fois de la pertinence et du classement, tandis que R@100 évalue la capacité du système de recherche à retrouver des résultats pertinents, exprimée comme le pourcentage des 100 premiers résultats de recherche contenant des informations pertinentes.

Les résultats de notre expérience ont révélé que, pour cette tâche de recherche en entreprise, des embeddings open source tels que E5-large, Instructor-XL et MPNet surpassaient encore les embeddings fournis par des fournisseurs d’API commerciales comme OpenAI (text-embedding-ada-002) et Cohere (large). Cela indique que, du moins dans ce cas d’usage précis, les embeddings open source restent un meilleur choix pour la recherche en entreprise que les fournisseurs d’API commerciales. Toutefois, l’IA progresse rapidement, et il sera passionnant d’observer l’évolution du domaine à l’avenir.
{{richtext-banner-component}}
Adapter la recherche vectorielle au langage de votre entreprise
Chez Glean, nous savons que la manière dont vous communiquez au sein de votre entreprise peut être très différente de celle d’autres organisations. Par exemple, les entreprises ont souvent des acronymes spécifiques, des noms de code de projets ou des concepts techniques propres à leur activité, qui contribuent à un langage totalement endémique à chaque lieu de travail et à chaque secteur (médecine, juridique, banque, etc.). Ces termes et expressions peuvent ne pas être reconnus par des embeddings de texte génériques et, par conséquent, ne pas produire les résultats souhaités en recherche en entreprise.

C’est pourquoi nous avons développé une méthode d’ajustement fin (fine-tuning) des embeddings au langage unique de nos clients, afin que chaque client dispose de son propre grand modèle de langage personnalisé, performant quel que soit le métier ou le secteur. Autrement dit, inutile de constituer des jeux d’entraînement verticaux ! Nos expériences montrent que ce fine-tuning in-domain améliore nettement les performances de la recherche vectorielle, en surpassant à la fois les fournisseurs d’API commerciales et les modèles open source les plus performants. Cela s’inscrit dans la lignée de recherches externes qui mettent en évidence les limites des méthodes de recherche par vecteurs denses sur des données hors domaine.
Non seulement cette méthode améliore les performances initiales de recherche, mais nos recherches montrent également que plus un client reste avec nous, meilleur devient son modèle de langage. L’adaptation continue et l’ajustement fin du modèle conduisent à une expérience utilisateur toujours plus performante et à des résultats de recherche plus précis.

La recherche vectorielle comme composant de la recherche en entreprise moderne et de la découverte des connaissances
Si la recherche vectorielle est une technologie fondamentale pour la compréhension sémantique automatique, elle ne suffit pas à elle seule à résoudre le problème de la fourniture de résultats de qualité dans la recherche en entreprise et la découverte des connaissances. Glean s’appuie sur une approche multidimensionnelle
en combinant la recherche vectorielle, la recherche traditionnelle par mots-clés et une personnalisation avancée au sein d’un puissant système de recherche hybride.  ;Envie de voir comment tout cela fonctionne ? Demandez une démo dès aujourd’hui et découvrez comment nous révolutionnons la recherche pour les environnements d’entreprise.











