Glean Waldo expliqué : améliorer l’efficacité de la recherche avec des LLMs frontier
Waldo est le modèle d’apprentissage par renforcement de Glean pour la planification de la recherche en entreprise — en traitant la récupération séparément du raisonnement, il réduit la latence de bout en bout d’environ 50% et diminue la consommation de tokens d’environ 25%, selon les benchmarks publiés par Glean (avril 2025). La plupart des requêtes d’IA en entreprise consomment du temps et des tokens parce qu’un même modèle gère à la fois la recherche d’informations et le raisonnement dessus, alors qu’il s’agit de tâches fondamentalement différentes.
Waldo se concentre exclusivement sur la phase de collecte d’informations — identifier quoi récupérer et comment l’interroger — avant de transmettre le contexte à un LLM frontier pour la génération de la réponse finale. Résultat : des réponses plus rapides à moindre coût, sans dégradation de la qualité des réponses.
Qu’est-ce que Waldo ?
Waldo est un modèle de recherche agentique conçu spécifiquement pour la recherche IA en entreprise. Il gère une seule mission — la planification de la recherche et la collecte de preuves — puis transmet un contexte bien assemblé à un LLM frontier, afin que le modèle de raisonnement puisse se consacrer entièrement à la synthèse et à la génération de la réponse.
Plutôt que de détourner un modèle généraliste pour la récupération, Waldo détermine quelles informations une requête nécessite, formule la bonne stratégie de récupération, et rassemble le contexte pertinent avant de passer la main à un LLM frontier. Cette approche s’inscrit dans l’évolution plus large vers la récupération agentique, où les systèmes d’IA planifient et adaptent activement leurs stratégies de recherche au lieu de s’appuyer sur une recherche en un seul passage.
L’idée centrale derrière Waldo est simple. La plupart des tâches d’IA en entreprise ne commencent pas par du raisonnement — elles commencent par la recherche du bon contexte, dispersé dans des documents, des messages et des outils.
Utiliser un modèle frontier à la fois pour la planification de la récupération et pour la génération de réponse, c’est comme embaucher un analyste senior pour sortir des dossiers d’une armoire avant de faire l’analyse proprement dite. Dans les benchmarks de Glean, Waldo gère cette récupération de fichiers à une latence P50 d’environ 250 ms par appel, soit plus de 10x plus rapide que ce que prendrait un modèle de raisonnement par défaut pour la même étape.
Glean a construit Waldo sur le modèle open foundation Nemotron 3 Nano de NVIDIA et l’a post-entraîné pour la planification de recherche via l’apprentissage par renforcement. L’architecture Nemotron 3 Nano utilise une conception hybride mixture-of-experts qui n’active que 3 milliards de ses 30 milliards de paramètres par appel d’inférence, offrant jusqu’à 4x plus de débit que son prédécesseur. Le processus d’entraînement RL a façonné Waldo pour améliorer la planification de la récupération plutôt que pour générer des réponses en langage naturel — une contrainte délibérée qui maintient le modèle petit, rapide et fortement focalisé sur la tâche où la vitesse compte le plus.
Pourquoi l’IA en entreprise a besoin d’une couche dédiée de planification de recherche
La plupart du travail en entreprise commence par la récupération d’informations. Un ingénieur qui résout un incident en production recherche des runbooks, des discussions Slack et des postmortems passés. Un commercial qui se prépare à un appel extrait les dernières mises à jour produit, des informations concurrentielles et l’historique du compte depuis une douzaine de systèmes.
Un nouveau collaborateur fouille des wikis, des documents d’onboarding et des démonstrations enregistrées pendant ses premières semaines. Dans chaque cas, la qualité du résultat final dépend d’abord de la capacité à trouver le bon contexte. La recherche IDC quantifie ce frein : le travailleur du savoir moyen passe environ 2,5 heures par jour — soit environ 30% de la journée de travail — simplement à chercher des informations.
Lorsqu’un seul modèle frontier gère à la fois la planification de la recherche et le raisonnement, il alloue une puissance de calcul coûteuse à des tâches qui ne nécessitent pas d’inférence profonde. Décomposer une requête en sous-questions, sélectionner quelles sources de données interroger et décider quand suffisamment de preuves ont été rassemblées sont des opérations procédurales, sensibles à la latence. Elles bénéficient de la vitesse et de la précision, pas de la vaste connaissance du monde et des capacités de génération nuancées qui rendent les modèles frontier précieux.
Regrouper ces deux rôles dans un seul modèle revient à payer le coût d’un modèle frontier pour un travail qu’un modèle plus petit, entraîné pour un objectif précis, peut faire plus vite et à moindre coût. Des recherches de Centific illustrent concrètement ce problème de coût : dans les frameworks d’IA agentique, les coûts des tokens en entrée dominent la dépense totale, car les appels LLM en chaîne accumulent d’énormes contextes en entrée, renforçant encore l’argument en faveur d’une séparation entre récupération et raisonnement.
Une architecture composable sépare ces préoccupations. Glean Search applique ce principe à plus de 100 sources de données d’entreprise, avec une couche dédiée de planification de recherche qui orchestre la récupération à faible latence avant de transmettre un paquet de contexte bien assemblé à un modèle frontier.
La séparation de la planification de recherche du raisonnement reflète la manière dont les équipes efficaces travaillent déjà : une personne rassemble les documents de briefing, une autre les analyse et rédige la recommandation. Résultat : un coût de calcul plus faible, des temps de réponse de bout en bout plus rapides, et un modèle frontier qui opère sur une entrée mieux préparée.
Comment Waldo fonctionne avec les LLMs frontier
L’interaction entre Waldo et un LLM frontier suit un schéma de passation clair : Waldo gère la planification de la recherche et la collecte de preuves, puis le modèle frontier prend le relais pour le raisonnement agentique et la synthèse. Chaque modèle opère dans la phase où ses atouts de conception comptent le plus, et aucun ne duplique le travail de l’autre.
Planification de la recherche et décomposition de la requête
Lorsqu’une requête arrive, Waldo la décompose en sous-questions distinctes et détermine quels outils, connecteurs et sources de données interroger pour chacune. Pour une question du type « Quels ont été les principaux enseignements de la revue produit du trimestre dernier, et comment se rapportent-ils à la roadmap de ce trimestre ? », Waldo identifie qu’il doit récupérer des notes de revue produit, des documents de roadmap et potentiellement des transcriptions de réunions associées — chacun provenant de systèmes différents.
Il lance des récupérations ciblées, évalue les preuves retournées et décide si suffisamment de contexte a été rassemblé ou si des passages supplémentaires sont nécessaires. La boucle itérative de collecte de preuves opère aux latences inférieures à la seconde évoquées plus haut, ce qui maintient une phase de récupération rapide même pour des requêtes multi-sources.
Passation aux modèles frontier pour le raisonnement et la synthèse
Une fois que Waldo détermine qu’il a rassemblé un contexte suffisant, il regroupe les éléments probants récupérés et les transmet à un LLM frontier. À ce stade, le modèle frontier reçoit une fenêtre de contexte ciblée contenant les documents, extraits et métadonnées pertinents — sans avoir dépensé le moindre token à déterminer où chercher ou quoi récupérer.
Toute la capacité du modèle frontier est alors dédiée au travail à forte valeur ajoutée : synthétiser l’information entre les sources, tirer des inférences, résoudre les contradictions et générer une réponse cohérente. Les organisations ne paient les coûts en tokens du modèle frontier que pour l’étape de raisonnement, et non pour l’orchestration de la récupération qui l’a précédée.
Routage intelligent des requêtes
Toutes les requêtes ne nécessitent pas l’ensemble du pipeline récupération puis raisonnement. D’après les tests de Glean, environ la moitié des requêtes en entreprise peuvent être traitées via un chemin rapide avec un raisonnement minimal — une simple recherche factuelle, un lien vers le bon document, ou une réponse directe depuis une source unique faisant autorité.
Le routage intelligent évalue les requêtes entrantes et oriente les récupérations simples vers un chemin léger, en réservant le pipeline complet Waldo-plus-frontier aux questions complexes en plusieurs étapes. Ce routage évite des invocations inutiles du modèle frontier, réduisant les coûts de calcul globaux sans affecter la qualité des réponses pour les requêtes qui nécessitent réellement un raisonnement approfondi.
Gains de performance : latence, coût en tokens et qualité
L’architecture de Waldo — qui sépare la planification de recherche du raisonnement — génère des gains mesurables sur trois dimensions. Dans les benchmarks internes de Glean, la latence de bout en bout diminue d’environ 50%, car la phase de récupération s’exécute sur un modèle optimisé pour la vitesse plutôt que sur un modèle frontier qui embarque une surcharge liée à des capacités sans rapport avec la planification de recherche. La consommation de tokens baisse d’environ 25%, puisque le modèle frontier reçoit un contexte déjà rassemblé au lieu de générer des tokens pour planifier et exécuter lui-même des recherches.
La qualité des réponses reste stable — il n’y a pas de régression, car l’étape de raisonnement s’exécute toujours sur un modèle frontier à pleine capacité, travaillant avec les mêmes éléments probants (ou mieux préparés).
Ces chiffres comptent davantage à grande échelle qu’ils ne peuvent le laisser penser pris isolément. Une organisation exécutant des milliers de requêtes assistées par l’IA par jour au sein des équipes support, sales et engineering cumule à la fois les gains de latence et les réductions de coûts en tokens. Alors que les dépenses des entreprises en IA devraient atteindre 37 milliards de dollars en 2025 selon Menlo Ventures, la pression pour optimiser les coûts d’inférence s’intensifie dans chaque département.
Une amélioration de 50% de la latence signifie que les employés attendent une à deux secondes au lieu de trois à quatre pour des requêtes complexes — une différence qui détermine si les équipes font suffisamment confiance à l’outil pour l’intégrer à leur flux de travail par défaut. Une réduction de 25% de la consommation de tokens se traduit directement par une baisse des coûts d’infrastructure à mesure que l’usage augmente. Comme l’a noté l’analyste Forrester Rowan Curran : « There is an increasing appeal for these more directed models for tasks within overall agentic workflows and executions. »
L’approche d’entraînement renforce le modèle de confidentialité. Glean a post-entraîné Waldo via l’apprentissage par renforcement afin d’améliorer la planification de la récupération, et le processus d’entraînement n’a utilisé aucun contenu de documents clients. Le modèle apprend à planifier des recherches efficacement, pas ce que contiennent les documents d’une organisation en particulier.
Quels types de tâches tirent le plus parti de la recherche agentique
Les workflows fortement axés sur la récupération sont ceux qui enregistrent les plus grands gains de performance grâce à la couche dédiée de planification de recherche de Waldo. Les équipes support qui résolvent des tickets doivent souvent extraire des informations depuis des systèmes de knowledge management, d’anciens tickets, de la documentation produit et des notes internes des équipes engineering — le tout au sein d’une seule interaction.
Les équipes sales qui préparent des appels ont besoin de l’historique du compte, des changements récents du produit, du positionnement face à la concurrence et d’études de cas pertinentes, assemblés depuis différents systèmes. Les nouveaux employés pendant l’onboarding doivent retrouver des politiques, de la documentation de processus, des normes d’équipe et des guides d’outillage disséminés entre wikis, disques partagés et canaux de messagerie. Dans chaque cas, le goulot d’étranglement consiste à rassembler le bon contexte depuis plusieurs sources, ce qui est précisément l’étape que Waldo accélère.
La découverte de connaissances inter-équipes — trouver une expertise, des décisions ou un contexte issus d’un autre département — est un autre domaine où la collecte d’éléments probants multi-sources apporte des avantages clairs. Ces requêtes franchissent généralement les frontières de l’organisation, nécessitant de récupérer des informations depuis des systèmes que la personne qui pose la question ne sait peut-être même pas qu’il faut consulter. Comme Glean Search se connecte à plus de 100 sources de données d’entreprise via son Enterprise Graph, Waldo peut identifier des éléments probants pertinents au-delà des frontières d’équipe sans exiger que l’utilisateur précise où chercher.
Les recherches simples en bénéficient moins, et c’est là que le routage intelligent prend toute sa valeur. Lorsqu’une requête a une réponse unique et évidente dans un emplacement connu, la faire passer par un chemin léger évite la surcharge du pipeline complet de récupération. Concrètement, la planification de recherche devient une infrastructure critique principalement pour les requêtes complexes en plusieurs étapes qui consomment le plus de temps et de calcul — celles pour lesquelles une récupération plus rapide et moins coûteuse offre le retour le plus net.
Questions fréquentes
Quelle est la différence entre un modèle de recherche agentique et un système de récupération standard ?
Un système de récupération standard met en correspondance une requête avec un index et renvoie des résultats classés. Un modèle de recherche agentique planifie activement la stratégie de récupération — en décomposant les requêtes en sous-questions, en sélectionnant des sources de données, en rassemblant des éléments probants de manière itérative, et en décidant quand suffisamment de contexte a été collecté avant de passer le relais à un modèle de raisonnement. Pour une analyse plus approfondie de la manière dont ces AI agents fonctionnent dans les environnements d’entreprise, découvrez comment les organisations les appliquent à travers les départements.
Waldo remplace-t-il les LLMs frontier ?
Non — Waldo gère la planification de recherche et la collecte d’éléments probants, puis transmet le contexte assemblé à un LLM frontier pour le raisonnement et la génération de la réponse. Les deux modèles fonctionnent en séquence, chacun intervenant dans la phase où ses forces de conception s’appliquent.
Comment Waldo maintient-il la confidentialité des données en entreprise ?
Glean a post-entraîné Waldo via apprentissage par renforcement afin d’améliorer la planification de la recherche, et le processus d’entraînement n’a utilisé aucun contenu de documents clients. Le modèle apprend à planifier des recherches — il ne mémorise pas le contenu des documents d’une organisation, et tous les accès aux données respectent les autorisations existantes de l’entreprise.
Quel gain de latence les équipes peuvent-elles espérer ?
Dans les benchmarks internes de Glean, la latence de bout en bout des requêtes diminue d’environ 50 % par rapport aux architectures à modèle unique. La phase de planification de la recherche s’exécute à environ 250 ms de latence P50 par appel, l’amélioration réelle variant selon la complexité de la requête.
Waldo peut-il gérer des requêtes qui nécessitent un raisonnement approfondi en plusieurs étapes ?
Waldo prend en charge la partie planification de recherche multi-étapes — décomposer les requêtes, récupérer des preuves depuis plusieurs sources et itérer jusqu’à rassembler un contexte suffisant. Le LLM de pointe prend ensuite en charge le raisonnement approfondi : tirer des inférences, synthétiser entre les sources et résoudre les contradictions.
Une couche dédiée à la planification de la recherche s’attaque au goulot d’étranglement le plus courant dans les workflows d’IA en entreprise — trouver le bon contexte — tout en préservant les capacités des modèles de pointe pour le travail de raisonnement qui justifie leur coût. Waldo démontre ce qui devient possible lorsque la recherche et le raisonnement disposent chacun d’un modèle conçu pour la tâche. Demandez une démo pour découvrir comment Glean et l’IA peuvent transformer votre lieu de travail.









.webp)
.webp)
