Health Agents : concevoir une plateforme multi-agents pour la surveillance proactive de la santé

0
minutes de lecture
Health Agents : concevoir une plateforme multi-agents pour la surveillance proactive de la santé

Table des matières

Vous avez des questions ou souhaitez une démo ?

Nous sommes là pour vous aider ! Cliquez sur le bouton ci-dessous et nous vous recontacterons.

Demander une démo
Partager cet article :

Les équipes d'infrastructure modernes manquent rarement de données. Elles manquent d'un jugement clair et partagé.

Chez Glean, nous avons été confrontés à un problème récurrent : nous prenons en charge des centaines de déploiements clients isolés, et à mesure que nous avons grandi, il est devenu de plus en plus difficile de surveiller manuellement l'état de santé du système sur des composants d'infrastructure et des déploiements critiques. En parallèle, les signaux relatifs à la santé des services internes étaient dispersés dans de nombreuses sources hétérogènes — tableaux de bord, journaux, tickets, alertes et fils de discussion — ce qui rendait impossible d'obtenir rapidement une vue d'ensemble fiable de la santé d'un déploiement pour un client donné. Cet écart était particulièrement pénalisant pour les équipes GTM en contact avec les clients, qui avaient besoin d'un résumé fiable de la santé client sans disposer d'une expertise approfondie sur chacun des systèmes d'ingénierie sous-jacents.

Nous avons donc construit la plateforme Health Agents sur Glean Agents : un système d'agents dédiés et proactifs qui surveillent en continu les domaines d'infrastructure clés sur l'ensemble des déploiements, transformant des signaux désordonnés en jugements de santé clairs et en explications.

Construire une plateforme de monitoring de santé agentique

Health Agents est une plateforme extensible qui surveille les composants d'infrastructure critiques de chaque déploiement client. Au lieu de forcer tout le monde chez Glean à interpréter eux-mêmes les tableaux de bord, journaux, alertes et tickets bruts, la plateforme produit un rapport de santé de haut niveau pour le déploiement, alimenté par des agents de santé spécialisés pour chaque composant.  ;

Chaque agent de santé de composant est responsable de l'interprétation des signaux dans son propre domaine, comme la latence et la fiabilité du service de requêtes, la fraîcheur de l'indexation de recherche, la stabilité du pipeline ML, la santé des instances de base de données, la fiabilité de l'ingestion des documents, et bien plus encore. Les agents évaluent des entrées disparates et produisent une sortie structurée :

  • Un verdict de santé clair vert / jaune / rouge
  • Une courte explication du ou des principaux problèmes et de leur impact en aval
  • Des liens de support, des vues de drill-down et des prochaines actions recommandées

Les rapports au niveau des composants remontent dans un rapport au niveau du déploiement client, offrant à la fois un résumé rapide de l'état de santé global et des points d'entrée vers une investigation plus approfondie pour les équipes GTM et Engineering.

__wf_reserved_inherit
Figure 1. Des agents de santé spécialisés évaluent chaque composant de l'infrastructure. Chaque rapport au niveau du composant remonte dans un résumé de santé au niveau du déploiement.

Architecture du système

Sous le capot, Health Agents est un système en couches qui combine Glean Agents avec une couche d'orchestration et d'agrégation personnalisée :

  • Signaux bruts : métriques, journaux, alertes, tickets, métadonnées de déploiement, rapports de coûts et autres éléments de contexte opérationnel.
  • Agents de santé spécialisés : agents spécifiques à un domaine, conçus et détenus par les experts les plus proches de chaque partie de la pile.
  • Orchestration et agrégation : un service développé sur mesure qui gère l'agrégation des rapports de santé, la planification configurable des agents de santé à grande échelle, le stockage des rapports de santé et des APIs pour les intégrations d'outils internes.
  • Surfaces orientées utilisateur : tableau de bord de monitoring interne, liens vers les sources des problèmes et sorties proactives qui aident les équipes à évaluer la santé des déploiements et à prendre les prochaines actions.

Nous avons rendu Health Agents scalable en nous appuyant sur Glean Agents comme fondation d'exécution, avec le mode auto de Glean Agent Builder qui permet de créer rapidement de nouveaux agents spécialisés à partir d'instructions en langage naturel. Plutôt que de créer des agents de zéro pour chaque composant d'infrastructure, nous avons encodé un jugement de santé partagé dans des compétences d'agent réutilisables pour collecter des signaux provenant de sources disparates, les interpréter et produire un rapport de santé cohérent et explicable. Cette structure a facilité l'extension de la plateforme de monitoring par différentes équipes d'ingénierie avec de nouveaux agents de santé pour leurs domaines.  ;

En parallèle des agents de santé spécialisés, nous avons également construit un agent de digest hebdomadaire qui s'exécute sur l'ensemble des déploiements clients afin d'analyser les tendances de santé et de mettre en évidence les problèmes récurrents ou émergents.

__wf_reserved_inherit
Figure 2. Vue en couches de la plateforme : les signaux bruts sont évalués en continu par des agents de santé spécialisés et servent à produire un instantané de santé au niveau du déploiement. Ces rapports de santé sont exposés via des tableaux de bord, des digests et des flux d'investigation, où des agents de débogage ou des humains peuvent prendre le relais pour un diagnostic plus approfondi.

Compromis de conception des Health Agents

La spécialisation était notre principe de conception central : des agents ciblés produisent des résultats plus précis et plus fiables que des agents généralistes. Nous avons appliqué ce principe de deux façons.

Premièrement, nous avons séparé l'expertise de santé au niveau des composants de l'agrégation de santé au niveau du déploiement. C'était utile parce que la santé globale d'un système n'est pas un seul problème  c'est un ensemble de problèmes spécifiques à chaque domaine. Par exemple, les signaux qui indiquent qu'un pipeline d'entraînement ML est en mauvaise santé sont différents des signaux qui indiquent qu'un service de requête est indisponible, et ils n'ont pas non plus le même niveau d'impact en aval. En confiant la maintenance de chaque agent de santé de composant à des experts du domaine, nous avons préservé la nuance nécessaire à un bon jugement. Pendant ce temps, l'agent au niveau du déploiement synthétise la santé des composants dans un rapport unique et fondé que les utilisateurs peuvent interpréter rapidement.

Cette séparation nous a apporté trois avantages :

  1. Meilleure explicabilité. Chaque jugement de santé est fondé sur un ensemble de signaux et une logique de scoring clairement définis et traçables.
  2. Meilleure maintenabilité. Les équipes peuvent améliorer un agent de santé de composant sans réécrire tout le système.
  3. Meilleure portabilité. Le même schéma peut évoluer à travers les déploiements, les composants et de nouveaux domaines de monitoring au fil du temps.

Deuxièmement, nous avons séparé les agents de monitoring de santé légers des agents de débogage internes plus approfondis. Les agents de santé sont optimisés pour l'étendue : exécutions fréquentes, large couverture, sorties structurées et coût plus faible. Les agents de débogage sont optimisés pour la profondeur : investigation plus riche une fois qu'un problème est apparu. Ce passage de relais ajoute de la complexité, mais en pratique il nous permet d'optimiser la qualité et la cohérence des sorties tout en faisant évoluer indépendamment les capacités de détection et de débogage, au lieu de forcer un seul agent fourre-tout à tout faire.

Confiance et calibration

Nous avons lancé les premières versions de Health Agents auprès d'un petit groupe d'utilisateurs pilotes chez Glean avant d'étendre l'usage à l'ensemble de l'entreprise. Dans ce processus, nous avons appris que la confiance des utilisateurs est essentielle pour rendre un système agentique utile. Nous avons construit cette confiance grâce à quelques mécanismes concrets :

  • Données de haute qualité : chaque agent spécialisé commence avec un petit ensemble d'indicateurs à fort signal qui peut produire un jugement de santé utile pour ce domaine.
  • Explicabilité : chaque rapport de santé explique exactement ce qui semble anormal pour chaque composant d'infrastructure, quel est l'impact en aval et où aller ensuite.
  • Boucles de feedback et d'itération : les retours continus des utilisateurs sont devenus une partie centrale du système, en orientant les mises à jour des compétences d'agent, l'extension de la couverture de monitoring, les améliorations de l'UX et les actions de suivi.

Les contributions des utilisateurs ont façonné à la fois le comportement des agents et l'expérience produit autour. Lors des premiers pilotes, certains agents spécialisés étaient trop agressifs en qualifiant des composants de critiques ou dégradés, si bien que les utilisateurs ont commencé à ne plus tenir compte de ces jugements. Pour réduire le bruit, nous avons travaillé avec les experts métier d'ingénierie concernés afin de clarifier quelles conditions devaient déclencher une action immédiate versus être simplement signalées pour une inspection plus attentive. Nous avons aussi constaté que les utilisateurs avaient besoin d'une meilleure visibilité sur les problèmes détectés récemment par rapport à ceux qui duraient depuis longtemps, ce qui nous a amenés à ajouter des graphiques historiques de tendance de santé et des indicateurs de hausse / baisse au niveau supérieur dans le tableau de bord piloté par les agents. Enfin, pour aider les utilisateurs à comprendre le contexte plus large des problèmes de santé de l'infrastructure, nous avons utilisé Glean Artifacts pour créer des rapports visuels interactifs et des diagrammes de dépendances en complément du tableau de bord de monitoring.

Health Agents nous a montré que la qualité d'un agent est un problème produit, pas seulement un problème de prompt. La qualité d'un système agentique dépend de l'ensemble de l'expérience utilisateur : facilité d'utilisation, fiabilité, cohérence entre les surfaces, explicabilité et valeur claire.

Impact de Health Agents

Aujourd'hui, Health Agents est utilisé au quotidien chez Glean par les équipes GTM et Engineering, en couvrant les composants d'infrastructure critiques sur l'ensemble des déploiements clients. Côté GTM, les équipes account peuvent repérer et comprendre de manière proactive les problèmes de santé des déploiements clients sans avoir besoin d'impliquer les ingénieurs. Côté Engineering, nous utilisons Health Agents pour surveiller nos propres zones d'infrastructure à travers les déploiements, vérifier si une régression récente est isolée ou généralisée, et trouver rapidement des problèmes corrélés entre composants dépendants.  ;

Quelques exemples :

  • Préparation à une expansion client : avant une expansion à plus de 10 000 utilisateurs, l'équipe account a utilisé Health Agents pour obtenir un instantané de santé de haut niveau, signaler les composants proches des limites de ressources et orienter les suivis vers les bons responsables d'ingénierie avant la mise en production.
  • Préparation plus rapide des réunions client : au lieu de vérifier plusieurs tableaux de bord, journaux et fils Slack avant un appel client, les SA et SE affectés à un compte peuvent obtenir rapidement une vue de santé client de haut niveau et approfondir si quelque chose semble anormal.
  • Visibilité transverse sur la santé des déploiements : les équipes d'astreinte Engineering peuvent voir si un problème est isolé ou fait partie d'un schéma plus large à travers les déploiements, et trouver facilement les tendances et corrélations de problèmes.

En plus de l'usage, nous comparons aussi la qualité des agents en confrontant les problèmes détectés par les agents aux escalades clients et à d'autres canaux de remontée de problèmes. Nous suivons le taux de détection proactive des escalades et le délai d'avance de détection des problèmes afin d'améliorer continuellement Health Agents au fil du temps.

__wf_reserved_inherit
Figure 3. Vue filtrée de notre tableau de bord interne Health Agent, montrant la santé inter-déploiement et inter-composant dans une seule interface. Chaque cellule peut être développée pour voir le rapport détaillé de l'agent de santé, l'historique des contrôles de santé et les prochaines étapes.

La suite

Aujourd'hui, chez Glean, Health Agents détecte et explique de manière proactive les problèmes à travers les déploiements en transformant des signaux fragmentés en jugements de santé clairs. À mesure que le système devient de plus en plus central dans les flux de travail quotidiens, les prochains axes d'investissement consistent à élargir la couverture des signaux, automatiser l'ajustement des agents à partir des métriques de qualité, resserrer la boucle entre les problèmes exposés et les prochaines actions, et approfondir les intégrations avec d'autres outils internes. Ensemble, ces évolutions constituent les étapes nécessaires vers la remédiation en boucle fermée : un système agentique qui passe de la détection au diagnostic puis à la résolution, avec des humains dans la boucle uniquement pour les actions à plus haut risque et la vérification finale.

Work AI qui fonctionne.

CTA Background Gradient 3CTA Background Gradient 3CTA Background Mobile