Vous avez créé votre premier agent. Vous lancez quelques requêtes de test, et les résultats semblent prometteurs — et ensuite ? La clé pour passer d’une démo sympa à un agent fiable, c’est de créer une évaluation.
Tout le monde devrait apprendre à évaluer des agents, non seulement parce que cela renforce la confiance dans leur qualité, mais aussi parce que cela vous apprend à exploiter au mieux votre plateforme d’agents. Les meilleures plateformes d’agents rendent les évaluations accessibles en veillant à ce que les agents excellent sur les fondamentaux. Pensez au respect des instructions, à la sécurité, à la personnalisation et à la compréhension du contexte. Cela permet aux créateurs de concentrer leurs évaluations sur des critères de qualité plus avancés, ceux qui rendent les agents réellement utiles et impactants pour les utilisateurs finaux.
Chez Glean, nous menons des évaluations à grande échelle depuis des années, en nous appuyant sur tout ce que nous avons appris grâce à la recherche. Dans cet article, nous aborderons les deux sujets : comment vous pouvez évaluer des agents individuels pour les améliorer, et comment nous abordons les évaluations à grande échelle afin de garantir la fiabilité des agents dans toute l’entreprise.
Comment concevoir votre évaluation
Considérez une évaluation comme une méthode structurée pour voir comment votre agent se comporte dans le monde réel. Avant de commencer à construire votre agent, posez-vous quelques questions simples :
- De quoi votre équipe a-t-elle besoin ? Visualisez les workflows les plus importants que vos utilisateurs traitent. Comment un agent IA peut-il les aider à donner le meilleur d’eux-mêmes ?
- À quoi ressemble un excellent résultat ? Si vous deviez noter la sortie de l’agent, quel serait le critère unique le plus important pour réussir ? C’est votre étoile polaire.
Répondre à ces questions tôt vous aidera à concevoir une évaluation ciblée et interprétable, qui vous donnera des indications efficaces sur la manière d’améliorer votre agent.
Partir du réel : créer votre evalset
Une bonne évaluation commence par un evalset : un ensemble représentatif d’instructions utilisateurs, associé aux réponses idéales. La meilleure façon de construire un evalset est d’aller directement à la source : vos utilisateurs. Commencez par demander à quelques experts métier côté utilisateurs de vous aider à sélectionner un petit ensemble de grande qualité, d’environ 20 exemples réels. C’est bien plus précieux que de s’appuyer uniquement sur des benchmarks publics ou des requêtes hypothétiques, qui passent souvent à côté de la complexité de votre activité.
Ne craignez pas les evalsets complexes ! Les utilisateurs ont tendance à pousser les capacités des agents en demandant des tâches multi-étapes, couvrant plusieurs sources. Ce ne sont pas des cas limites, mais souvent les jobs to be done les plus précieux. Commencez par tester les instructions sur lesquelles vous avez des doutes afin de voir exactement ce que votre agent peut gérer avant de vous lancer dans des optimisations.
Par exemple, lorsque nous avons construit un agent de prospection commerciale, nous avons demandé à l’équipe Sales ce qui fait un excellent email de premier contact. Leurs retours et exemples idéaux sont devenus le cœur de notre evalset.

À quoi ressemble le succès ? Choisir vos métriques
Une fois que vous avez votre evalset, il vous faut une méthode cohérente pour noter les performances de l’agent. C’est là qu’interviennent les métriques. Commencez avec une seule métrique étoile polaire : la mesure la plus importante de la qualité ou de l’utilité de l’agent, sur laquelle tout le monde peut s’aligner.
Se concentrer sur une métrique principale ne veut pas dire ignorer la manière dont on y arrive. Imaginez un excellent agent comme un groupe qui joue en harmonie : si le son global est l’étoile polaire, chaque instrument doit être accordé. Décomposez votre métrique étoile polaire en 2 à 4 sous-métriques simples, à noter de façon cohérente, afin d’obtenir une vision claire de ce qu’il faut améliorer. Pour notre agent de prospection commerciale, notre étoile polaire était la qualité du message, que nous avons décomposée en quatre composantes :
- Exhaustivité : Le message contient-il tous les ingrédients clés ?
- Un accroche percutante pour capter l’attention.
- Une mention de la priorité stratégique du prospect.
- Le problème qui bloque cette priorité.
- Le résultat business positif que Glean apporte.
- Une preuve (comme une statistique ou un exemple client).
- Un appel à l’action clair.
- Personnalisation : Le message est-il adapté au prospect ?
- Pertinent : « L’expansion en Europe avec [customer program] ajoute beaucoup de complexité — comment votre équipe gère-t-elle le partage de connaissances à travers les fuseaux horaires et les régions ? »
- Générique : « Je vois que vous déployez l’IA dans votre app — la prochaine étape, c’est l’IA pour vos équipes internes ? »
- Ton : Le message paraît-il personnel, pertinent, et facile à comprendre ?
- Juste ce qu’il faut : « Vos ingénieurs ne passent que deux heures par jour à coder — Glean les aide à récupérer le reste en rendant le code, la documentation et les tickets rapidement trouvables. »
- Mauvais ton : « La technologie de recherche propriétaire de Glean interroge diverses sources de données non structurées afin d’identifier des documents d’entreprise pertinents pour chaque utilisateur. »
- Ancrage dans les faits : Les affirmations s’appuient-elles sur des données d’entreprise et publiques exactes ?
Pour noter les métriques, un scoring binaire simple (0 ou 1) fonctionne le mieux. Cela évite la confusion liée aux scores partiels et maintient des résultats clairs et cohérents. Les gens jugent souvent différemment un « 3 sur 5 ». Cela rend aussi la notation avec des juges LLM plus fiable, car les modèles de langage ont tendance à avoir du mal avec des échelles nuancées. Les principales exceptions concernent des métriques comme le coût ou la latence, où des chiffres précis comptent réellement.
Des enseignements à l’action : améliorer votre agent
Une fois votre évaluation exécutée, il est temps de passer à la partie la plus importante : utiliser les résultats pour améliorer votre agent. Vous pouvez vous appuyer sur cette boucle de feedback pour transformer un bon agent en un excellent agent.
Commencez par examiner les métriques pour voir où l’agent a sous-performé, passez en revue des exemples pour repérer des schémas, puis apportez des améliorations ciblées. Par exemple, un agent de prospection commerciale qui échoue sur la personnalisation n’utilise peut-être pas les bonnes sources — reformuler ses instructions de recherche peut aider. Si le problème vient du ton, ajoutez des exemples de bon versus mauvais ton. En règle générale, apportez des changements à l’agent dans cet ordre :
- Affiner les instructions : Les changements ayant le plus d’impact viennent souvent de l’amélioration des instructions. Soyez plus précis, ajoutez des exemples de ce qu’il faut faire (et de ce qu’il ne faut pas faire), et fournissez un cadre clair pour structurer la réflexion et les réponses.
- Structurer le contexte : Contrôlez les informations auxquelles l’agent a accès en le dirigeant vers des sources de données spécifiques lorsque le contexte général est trop large. Vous pouvez aussi éviter la surcharge d’informations en utilisant des sous-agents avec leur propre mémoire.
- Ajuster les paramètres : Ajustez les paramètres des LLM, comme la température, qui contrôle la créativité de l’agent. C’est un excellent moyen d’affiner le ton du rendu.
- Choisir les LLMs : Certains modèles excellent vraiment dans certains domaines de tâches et sont moins performants dans d’autres. Remplacer le LLM par un autre peut apporter un gain significatif.
Trouver la bonne solution devient plus facile avec la pratique. Voici quelques scénarios courants :
- Votre agent d’insights concurrentiels propose une analyse superficielle ? Essayez d’ajouter une étape qui demande à l’agent d’exposer son raisonnement avant de donner la réponse finale.
- Votre agent conversationnel répond bien, mais trop lentement ? Ajustez les paramètres de mémoire afin qu’il ne lise, à chaque cycle de réponse, que les parties pertinentes de l’historique de la conversation.
- Votre agent de rédaction de contenu a un ton rigide et trop formaté ? Augmentez le niveau de créativité et donnez-lui quelques extraits comme source d’inspiration.
- Votre agent de messages commerciaux omet des témoignages clients clés ? Ajustez les instructions de ses étapes de recherche pour être plus descriptif sur les informations qu’il doit trouver.
Évaluations à grande échelle : automatisation et bouclage de la boucle de feedback
Confiez maintenant votre agent à vos utilisateurs. L’utilisation en conditions réelles — où des retours comme les votes positifs, votes négatifs et partages aident à valider les performances — est souvent le test le plus précieux. Vous pouvez même échantillonner de vraies requêtes d’utilisateurs et les ajouter à votre évaluation afin de garder votre evalset à jour et aligné sur l’évolution des besoins. En plus de l’échantillonnage des requêtes, l’automatisation de la notation avec des LLMs est un excellent moyen de faire passer vos évaluations à l’échelle à mesure que votre base d’utilisateurs grandit.
Chez Glean, nous menons des évaluations automatisées à grande échelle afin de nous assurer que les agents, quel que soit le cas d’usage et l’environnement de travail, sont utiles et dignes de confiance. Nous décomposons la qualité de la plateforme en métriques distinctes. La plupart sont évaluées par des LLMs alignés sur le feedback utilisateur (votes positifs et négatifs), ainsi que par des experts métier. En superposant ces métriques pour couvrir tous les aspects de la préparation à l’échelle de l’entreprise, Glean propose une plateforme d’agents de confiance pour des cas d’usage transverses.

Commencez à construire en toute confiance
Les évaluations sont le pont entre des agents IA qui font bonne impression en démo et des agents IA qui génèrent un impact réel. Elles vous aident à affiner les instructions, à préciser le périmètre et à régler vos agents à partir de données réelles d’utilisateurs, plutôt que de suppositions.
Pendant que vous évaluez des agents pour vos cas d’usage spécifiques, Glean exécute en continu, en arrière-plan, des évaluations au niveau de la plateforme, en suivant des métriques comme la précision, la pertinence et le respect des instructions afin de garantir que les agents restent fiables à grande échelle.
Notre objectif chez Glean est de rendre les évaluations accessibles, afin que vous puissiez avoir confiance dans les performances des agents et vous sentir à l’aise pour les partager à l’échelle de votre organisation. À vous de jouer maintenant. Commencez à créer des agents, commencez à les évaluer, et mettez au travail pour votre équipe un ensemble d’agents.










