Glean Waldo : un modèle de recherche agentique qui s'associe aux LLMs pour offrir une intelligence de pointe avec ~50 % de latence en moins et ~25 % de jetons en moins

0
minutes de lecture
Glean Waldo : un modèle de recherche agentique qui s'associe aux LLMs pour offrir une intelligence de pointe avec ~50 % de latence en moins et ~25 % de jetons en moins

Table des matières

L'IA sans contexte gaspille des tokens

Découvrez comment le contexte, le routage des modèles et la conception de l'exécution façonnent le coût et les performances de l'IA en entreprise.

Télécharger le livre blanc
Partager cet article :

Glean est utilisé pour des tâches allant de recherches simples à des travaux approfondis comme l'analyse de données, la création de contenu et le passage à l'action. Bien que nous ayons historiquement utilisé des modèles de pointe pour les tâches de recherche, nous avons récemment constaté que des modèles spécialisés peuvent accomplir ce travail plus efficacement. C'est pourquoi nous lançons le premier modèle de recherche agentique de Glean, surnommé Waldo, qui décide comment décomposer la question, quels outils utiliser, quoi lire ensuite et quand il dispose de suffisamment de preuves pour passer la main à un LLM de pointe afin d'obtenir une réponse de haute qualité.

Nous pensons que l'avenir de l'IA d'entreprise inclut non seulement des outils spécialisés, mais aussi des modèles spécialisés conçus pour des tâches à forte demande et bien définies, où la latence et le coût peuvent être optimisés. Même si les modèles de pointe peuvent eux-mêmes gérer la recherche d'informations, le faire est souvent plus lent et plus coûteux que nécessaire. La meilleure approche consiste à utiliser un modèle dédié, comme Waldo, qui travaille de concert avec les modèles de pointe pour délivrer des résultats agentiques de bout en bout.

Waldo ne se contente pas de collecter des informations. En s'exécutant d'abord et en constituant du contexte avant même que le modèle de pointe ne voie la requête, il devient une entrée naturelle pour décider du niveau de raisonnement requis pour la tâche : cette requête a-t-elle besoin d'une réponse légère et rapide, ou faut-il l'escalader vers un niveau de raisonnement plus élevé ? Le contexte issu de Waldo, notamment les outils utilisés, le nombre de recherches et la correspondance sémantique de la requête avec des tâches complexes et peu complexes, aide à déterminer le niveau de raisonnement requis.  ;

À lui seul, Waldo est plus de 10 fois plus rapide que notre modèle de raisonnement par défaut (GPT-5.4 medium) par appel au LLM, avec des améliorations de latence moyenne d'environ 250 ms contre environ 3 s. Intégré à notre harness, cela se traduit par environ 50 % de latence en moins et environ 25 % de jetons en moins, sans régression de qualité. Conçu pour la recherche en entreprise, Waldo utilise NVIDIA Nemotron 3 Nano comme modèle de base et est post-entraîné pour la planification de recherche.

Cet article explique comment nous avons construit Waldo, comment nous l'avons entraîné et les choix de conception que nous avons faits en cours de route.

La plupart des travaux d'entreprise commencent par une recherche

Lorsque nous avons analysé les schémas de requêtes dans Glean, une chose s'est imposée : quel que soit le niveau de complexité de l'objectif final, la plupart des tâches commencent par une recherche. Lorsqu'un utilisateur a besoin d'informations sur un projet, un client, un processus ou une décision, Glean recherche dans les documents internes, lit les résultats et synthétise une réponse. Parfois, cela ne nécessite qu'une seule recherche  souvent, cela demande plusieurs boucles itératives consistant à lire un résultat, affiner la requête, puis relancer une recherche. Même les tâches qui nécessitent finalement de créer un document, d'exécuter un workflow ou d'agir sur plusieurs systèmes commencent par cette phase de collecte de contexte.

Les modèles de pointe gèrent cela correctement, mais ils accomplissent en même temps deux tâches très différentes : planifier ce qu'il faut rechercher et raisonner sur ce qu'ils ont trouvé pour générer une réponse. La première tâche est relativement mécanique : correspondance de motifs par rapport à l'intention de la requête, sélection d'outils et évaluation de la suffisance des preuves. La seconde exige un raisonnement profond, une synthèse sur long contexte et une génération nuancée. Regrouper les deux dans un seul modèle coûteux signifie que vous payez le prix d'un modèle de pointe pour la planification de la recherche, tout en ajoutant de la latence à chaque tour de boucle.

Lorsque vous avez une tâche bien définie qui s'exécute à fort volume, nous avons constaté qu'il vaut la peine de l'isoler dans un modèle plus petit, entraîné pour un usage spécifique, plutôt que d'utiliser un modèle de raisonnement généraliste. Le coût du modèle de pointe est mieux investi dans la synthèse et la génération de la réponse.

Waldo est un modèle de recherche agentique  ;

Waldo est un modèle de recherche agentique appris par renforcement qui s'exécute avant l'appel à un modèle de pointe. Son rôle est d'exécuter de courts plans d'outils sur un ensemble d'outils fixe, notamment Glean Search, la recherche de personnes et la recherche web, puis de passer le relais au modèle de pointe avec le contexte récupéré déjà en place.

Waldo recherche jusqu'à disposer d'assez de contexte ou jusqu'à reconnaître que la tâche nécessite des capacités allant au-delà de la recherche (création de document, exécution de code, outils d'écriture). À l'issue de son exécution, il ne génère pas de langage naturel. Il transmet le contrôle au modèle de pointe, qui voit la conversation comme s'il avait lui-même effectué le travail de recherche : mêmes messages, mêmes sorties d'outils.

Le choix architectural clé a été de faire de Waldo une étape initiale plutôt que de laisser le modèle de pointe l'invoquer comme sous-agent. Nous avons envisagé l'approche sous-agent, car elle simplifie le récit d'orchestration, mais la latence était trop élevée. Dans la conception sous-agent, même une simple requête nécessitant une seule recherche exige trois étapes d'inférence sérielles : le modèle de pointe décide d'appeler Waldo, Waldo effectue la recherche, puis le modèle de pointe génère la réponse. Faire de Waldo le premier modèle appelé peut aboutir au meilleur scénario, à savoir un seul appel au modèle de pointe, puisque Waldo a déjà fait le travail.  ;

Entraînement : DPO + apprentissage par renforcement

Notre pipeline d'entraînement comporte deux phases : un démarrage supervisé, suivi d'un apprentissage par renforcement avec un signal de récompense spécifique à la tâche. Nous avons utilisé l'API Tinker de Thinking Machine Labs pour un fine-tuning basé sur LoRA, ce qui nous a permis d'adapter efficacement le modèle sans gérer d'infrastructure d'entraînement distribuée.

Waldo est un planificateur de recherche. Il décide quelles requêtes lancer et quand s'arrêter, mais la qualité réelle de la récupération provient de l'infrastructure de recherche existante de Glean, fruit d'années de travail sur des modèles de recherche sémantique d'entreprise qui apprennent le langage d'une entreprise et d'un Enterprise Graph qui comprend les relations entre les personnes, le contenu et les systèmes. Rien de tout cela n'est remplacé par Waldo  cela est enrichi par Waldo. Ce que Waldo doit apprendre, c'est la couverture : combien de recherches lancer, comment varier les requêtes et quand les preuves récupérées sont suffisantes.

Phase 1 : optimisation directe des préférences (DPO)

La première phase utilise le DPO pour amener le modèle de base dans le bon espace comportemental. Le DPO fonctionne en s'entraînant sur des paires de préférences : pour chaque requête, le modèle voit une sortie « préférée » et une sortie « rejetée », et apprend à attribuer une probabilité plus élevée à la sortie préférée. Au fil de nombreuses paires, le comportement du modèle s'oriente vers la distribution préférée sans nécessiter de fonction de récompense explicite.

Nous construisons ces paires à partir de traces de production de haute qualité, anonymisées, issues du propre déploiement de Glean. Important : Waldo ne s'entraîne jamais sur les données des clients ni sur le contenu des documents. Les traces capturent uniquement les schémas d'usage des outils : quels outils ont été appelés, dans quel ordre et si le plan a réussi. Pour le côté préféré de chaque paire, lorsque le système de production utilise les outils principaux (recherche, lecteur de document), nous extrayons le plan d'outils. Lorsque la tâche n'a pas besoin des outils principaux, la sortie préférée est un signal de passage direct ou de relais. Pour le côté rejeté, nous échantillonnons des sorties du modèle de base et filtrons les cas suffisamment différents du comportement de production.

Il s'agit d'un modèle entraîné sur la manière d'utiliser les outils, et non sur des données d'entreprise. Son objectif est le conditionnement : apprendre au modèle le vocabulaire de base de « quand rechercher, quand s'arrêter, quand passer la main ».

Phase 2 : apprentissage par renforcement

C'est la phase qui permet à Waldo de créer des plans meilleurs que ceux du système de production. Nous exécutons le modèle sur des requêtes de production et le récompensons en fonction des résultats.

Pour les requêtes où la recherche était nécessaire, la récompense comporte deux composantes. Premièrement, un signal binaire de terminaison indiquant si Waldo a déterminé que les outils principaux étaient suffisants ou non. Deuxièmement, un signal de récompense basé sur le rappel/F1 par rapport aux documents cités par le système de production dans la réponse finale. Une fois que le système complet produit une réponse finale, nous examinons quels documents il a effectivement cités, puis nous remontons le fil pour demander : les recherches de Waldo ont-elles fait apparaître ces documents ? Le rappel mesure si Waldo a trouvé tous les documents qui ont fini par compter. La F1 équilibre ensuite rappel et précision, en pénalisant Waldo s'il récupère beaucoup de bruit en plus des documents pertinents.

Ce qui est intéressant, c'est que si le système de production a effectué plusieurs recherches itératives pour trouver un document, Waldo peut apprendre à le trouver en une seule. Le signal de récompense ne se soucie pas de la manière dont Waldo y est arrivé  il se soucie de savoir si les bonnes preuves ont été récupérées.

Nous entraînons sur des traces de production issues du propre déploiement de Glean, et nous avons constaté que le modèle se généralise bien aux déploiements clients externes. Le modèle de base est Nemotron 3 Nano (une architecture mixture-of-experts avec 30 milliards de paramètres au total et 3 milliards de paramètres actifs), choisi pour son profil de latence et de coût. Nous avons délibérément choisi d'utiliser Nemotron dans une logique d'instruction, plutôt qu'avec du raisonnement, afin de repousser les limites de latence, puisque notre environnement de post-entraînement nous permet d'atteindre nos objectifs de qualité sans modèle de raisonnement.  ;

__wf_reserved_inherit
La courbe de récompense de Waldo s'est améliorée rapidement lors des 100 à 200 premières étapes d'entraînement, a continué à monter au milieu de l'entraînement, puis s'est aplatie vers la fin, ce qui suggère que l'entraînement supplémentaire aidait encore, mais apportait des gains plus faibles qu'aux premières étapes.

De Waldo au raisonnement adaptatif

Waldo a résolu le problème de collecte d'informations, mais il a aussi révélé une deuxième opportunité : utiliser les signaux du modèle de recherche agentique pour déterminer dynamiquement le niveau de raisonnement requis par une tâche.

Puisque Waldo s'exécute en premier, sa propre exécution devient la base de cette décision. Il sait combien d'outils il a invoqués, combien de documents sont revenus et si ses sorties étaient vides ou clairsemées. Autrement dit, il sait à quel point il a peiné. Une requête qui a déclenché plusieurs appels d'outils mais a renvoyé peu de contenu pertinent constitue un signal fort indiquant qu'un modèle léger ne suffira pas. Lorsque Waldo détermine que la tâche nécessite des outils allant au-delà de la recherche pour agir ou exécuter du code, ce signal de relais devient une autre entrée de routage, que le modèle produit naturellement dans le cadre de son flux de travail. En lisant son propre travail et en l'évaluant à l'aune de la complexité de la demande initiale, le modèle de recherche agentique décide du niveau de raisonnement nécessaire.

__wf_reserved_inherit
Mesure du modèle observant la latence par profil de performance. Le mode adaptatif, utilisant Waldo, a pu diviser la latence par deux tout en conservant des performances similaires, mesurées par la réussite normalisée de la tâche.

Économies de coût et de latence grâce aux modèles spécialisés  ;

En combinant Waldo avec un modèle de pointe, Glean a pu offrir environ 50 % de latence en moins et environ 25 % de jetons en moins tout en maintenant une qualité similaire. Nous avons constaté qu'environ la moitié de toutes les requêtes restent sur un chemin rapide avec un raisonnement minimal, n'ont jamais besoin de toute la capacité d'un modèle de pointe et ce, sans sacrifier la qualité des réponses.  ;

Nous pensons que ce schéma de petits modèles spécialisés travaillant de concert avec des modèles de pointe deviendra de plus en plus courant à mesure que les systèmes agentiques mûriront. Toutes les tâches du pipeline n'ont pas besoin d'une intelligence de niveau modèle de pointe, et le reconnaître constitue une étape importante vers des systèmes à la fois plus capables et plus efficaces.

Disponibilité : Waldo sera bientôt déployé auprès des clients.  ;

Work AI qui fonctionne.

CTA Background Gradient 3CTA Background Gradient 3CTA Background Mobile