Chez Glean, nous pensons depuis longtemps que privilégier l’intelligence de façon isolée, sans tenir compte des coûts, est une mauvaise approche. Alors que le paysage des modèles évolue en permanence, courir après l’intelligence de pointe à elle seule est un pari coûteux. À l’inverse, comprendre les compromis que différents modèles font entre coût et performance, et utiliser cette compréhension pour appliquer la bonne intelligence au bon cas d’usage, est bien plus important.
Nous avons mené deux analyses complémentaires pour le démontrer. D’abord, nous avons comparé en interne Glean Assistant, avec l’auto routing activé, à Claude Cowork, exécutant son modèle recommandé pour le travail du quotidien, Claude Sonnet 5, sur plus de 180 tâches d’entreprise. Glean a économisé 81 % sur les coûts de tokens et a été choisi comme réponse préférée 78 % du temps. Claude Cowork affichait une moyenne de 2,98 $ par tâche Glean s’établissait à 0,58 $.
Ensuite, nous avons construit une analyse de frontière de Pareto qui cartographie les compromis coût/performance sur l’ensemble du paysage des modèles pour des tâches d’entreprise, et cette analyse aide à éclairer la manière dont Glean prend des décisions d’auto routing. Avec l’auto routing, Glean associe les tâches à des modèles et à leurs niveaux de raisonnement en fonction de l’effort et des capacités requis.

Le coup de fouet des tokens en 2026
Le tokenmaxxing était en vogue au début de 2026, les entreprises suivant qui consommait le plus de tokens comme métrique de productivité. Le retour de bâton a été rapide : Uber a révélé avoir épuisé l’intégralité de son budget 2026 pour le développement avec l’IA en seulement quatre mois, et ServiceNow a rapporté le même sort quelques semaines plus tard, son DSI parlant d’« un problème vraiment difficile ». À mesure que de nouveaux modèles de pointe continuaient de sortir et que le développement agentique entrait davantage dans le grand public, les entreprises sont arrivées à la même conclusion : parier sur un seul modèle de pointe, sans discipline sur la façon dont il est réellement utilisé, est une habitude coûteuse.
Le mois dernier a apporté un bouleversement dans le paysage des modèles. De nouveaux modèles open comme GLM 5.2, Kimi K3 et DeepSeek V4 Flash sont arrivés à des niveaux de prix plus bas, aux côtés des propres baisses de prix d’OpenAI sur GPT-5.6 Luna et Terra en juillet. Et les entreprises ont réagi : beaucoup ont ajouté davantage de modèles open au mix, et les plateformes d’inférence et de serving de modèles qui les prennent en charge voient leur part de marché augmenter en conséquence.
Analyse de frontière de Pareto : évaluer les modèles sur le coût et la qualité, ensemble
Avec une telle amplitude entre coût et capacités, nous avons mené une analyse distincte pour voir comment ces modèles se comparent en intelligence au regard du coût, cette fois sur un ensemble plus large de 1 000 tâches d’entreprise, à travers 37 modèles et configurations d’effort de raisonnement, dans un environnement de production. Cette analyse nous donne la granularité nécessaire pour voir comment différents types de tâches se comportent selon les modèles, et pour utiliser ces résultats afin d’optimiser les décisions de routage.
Pour donner du sens à ce compromis, nous nous sommes appuyés sur la frontière de Pareto : l’ensemble des modèles offrant le meilleur compromis possible entre performance et coût. Un modèle est Pareto-optimal si aucune autre option n’offre de meilleures performances à son niveau de prix, ou, de manière équivalente, si aucun modèle moins cher n’est disponible à son niveau de performance. Représentés sous forme de courbe, les modèles peu coûteux et moins performants se situent en bas à gauche, les modèles coûteux et très performants en haut à droite, et la ligne entre les deux trace la frontière optimale.

L’analyse de Glean est unique en ce que la plupart des frontières de Pareto sont généralement construites à partir de jeux de données publics et ne sont pas adaptées aux complexités et à la diversité du travail en entreprise. La frontière de Pareto de Glean est calculée sur la base d’une évaluation sécurisée du trafic de production en entreprise, en utilisant des méthodes qui ne rendent visibles aux évaluateurs que des statistiques agrégées.
Pour construire le graphique de frontière de Pareto, Glean a évalué les réponses des modèles en confrontation directe, requête par requête, à l’aide d’un juge agentique centré sur l’exactitude, l’exécution de la tâche et l’état de préparation de la sortie. Notre protocole de comparaison a combiné un tournoi en round-robin entre les 11 familles de modèles à leurs niveaux de raisonnement par défaut, avec des comparaisons entre niveaux de raisonnement adjacents au sein de chaque famille, pour un total de 81 confrontations par paires de modèles. Nous avons utilisé la méthodologie de Bradley–Terry, une technique statistique standard permettant de convertir des résultats en face-à-face en une note relative unique, pour calculer le score de qualité Glean. Le score représente la performance attendue de préférence d’un modèle face au champ de référence : un score de 60 signifie que le modèle est censé l’emporter sur la qualité dans 60 % des tâches lors d’un face-à-face contre un concurrent choisi au hasard, les égalités étant réparties équitablement dans cette analyse. Des scores plus élevés sont meilleurs, un score de 50 indiquant le milieu de la distribution de qualité.
Ce que nous avons constaté :
- GPT-5.6 Luna (xhigh) se situe sur la frontière, avec un score de 55 au score de qualité Glean, tout en restant très rentable à 0,0819 $.
- GLM 5.2 (high), pour les amateurs de modèles open source, est légèrement meilleur que GPT-5.6 Luna (xhigh) avec un score de 57, mais à un coût plus élevé de 0,3489 $.
- Claude Opus 5 (high) se situe également sur la frontière, avec un score de 67, à un coût bien plus élevé de 2,9605 $.
- Kimi K3 (high) représente un juste milieu plus équilibré, avec des gains de qualité significatifs par rapport à GPT-5.6 Luna, à un score de 63 pour un coût de 0,8995 $.
- Gemini 3.7 Flash (high) en est un autre exemple, avec un score de 61 et un coût de 0,4748 $.
Ce que montre cette analyse, c’est que la frontière n’est pas dominée par un seul fournisseur, et que l’écart de coût entre Luna 5.6 (xhigh) et le modèle le plus cher présent sur la frontière, Opus 5 (high), est de 36× pour un gain de 22 % sur le score de qualité. En outre, plusieurs modèles, Kimi K3 et Gemini 3.7 Flash (high), peuvent capter des gains de qualité par rapport à GPT-5.6 Luna (xhigh), tout en coûtant 3 à 6× moins cher qu’Opus 5 (high).
Ces enseignements montrent qu’il n’existe pas un modèle « meilleur » unique et qu’il y a une plage optimale, ce qui explique pourquoi le choix du modèle et l’auto routing peuvent atteindre la qualité pour une fraction du coût. Les évaluations de frontière de Pareto rejoignent les milliers d’évaluations que Glean exécute chaque trimestre pour éclairer les décisions de routage.
Comment fonctionne l’auto routing de Glean
Le routage automatique est l’approche de Glean pour associer le bon modèle, au bon niveau de raisonnement, à la tâche à accomplir, afin qu’aucun utilisateur n’ait besoin d’être expert en modèles ni de se demander lequel choisir. Nous abordons le routage sous deux angles. Le premier est la sélection de modèle : lequel des plus de 40 modèles ouverts et frontier disponibles est le plus adapté à une tâche donnée. Le second est le routage de l’effort : à quel point le modèle doit réfléchir au sujet, en utilisant le niveau de raisonnement comme levier.
Pour décider du niveau de raisonnement optimal à l’exécution, Glean utilise un petit modèle spécialiste, Glean Waldo, post-entraîné sur NVIDIA Nemotron 3 Nano. Une fois que Waldo détermine le niveau de raisonnement, il peut déléguer à un modèle spécialiste si nécessaire pour accomplir la tâche. Nous avons constaté, par exemple, que Claude Opus 4.8 excelle dans la création d’artefacts visuels le harness passe donc à Opus 4.8 en fonction de sa compréhension de la tâche.
Analyse de benchmark : Glean versus Claude Cowork sur le travail inter-départements
Glean offre un coût par tâche plus faible sur la base de deux métriques d’entrée. La première est le coût moyen pondéré par token sur l’ensemble du mix de modèles utilisé par le routage automatique. La seconde est le nombre de tokens utilisés. Glean a utilisé moins de tokens, 1,3 million contre 4,4 millions pour Claude Cowork, soit une réduction de 70 %. Combinés, c’est ce qui a fait baisser le coût moyen chez Glean à 0,58 $ par tâche, contre 2,98 $ pour Cowork.

La raison pour laquelle nous avons obtenu une réduction de 70 % de l’usage de tokens repose sur des choix d’architecture dans Glean :
- Fondations de contexte d’entreprise : Glean part d’une vue unifiée, pré-indexée et classée des informations de l’entreprise, tandis que l’approche MCP fédérée de Claude Cowork doit interroger chaque système individuellement, en sur-récupérant souvent des résultats et en consommant des tokens pour normaliser les données, résoudre les conflits et répéter des boucles de raisonnement dont il n’aurait pas besoin.
- Conception du harness : Glean conserve les sorties d’outils et l’état intermédiaire dans des fichiers sandbox au lieu de tout recharger dans la fenêtre de contexte du modèle à chaque fois. Il charge progressivement uniquement les outils, compétences et schémas dont une tâche a besoin, tandis que des sous-agents isolés empêchent aussi le contexte non pertinent d’entrer dans la boucle de raisonnement principale.
Analyse de benchmark : Glean atteint une qualité supérieure à Claude Cowork à moindre coût
L’efficacité des coûts n’a d’importance que si la sortie est exploitable, et c’est là qu’intervient la qualité. Glean a été préféré 78 % du temps à Claude Cowork sur plus de 180 requêtes, avec une victoire sur :
- Préférence globale : La réponse qu’ils utiliseraient réellement au travail
- Exactitude : La réponse la plus factuellement exacte, logiquement solide et étayée par des sources actuelles
- Exhaustivité : La réponse qui satisfait le mieux la demande et laisse moins de travail inachevé
- Qualité d’interaction : Le système qui nécessite moins de pilotage, de corrections, de re-prompts, d’attente ou de sauvetage manuel

La préférence pour Glean s’est vérifiée dans chaque département évalué, notamment les ventes, l’ingénierie, le marketing, les RH et people, le produit, la finance, ainsi que le support et la réussite client. Les tâches sélectionnées pour l’ensemble d’évaluation se sont inspirées de la manière dont les clients utilisent Glean aujourd’hui, même si toutes les requêtes ont été générées de façon synthétique afin de protéger la confidentialité des utilisateurs. Les tâches ont été revues par des experts métier dans chaque domaine, avec des membres de l’équipe commerciale vérifiant les tâches de vente, des marketeurs vérifiant les tâches marketing, etc., afin de garantir qu’elles soient représentatives de leur travail.

L’avantage de Glean s’est également maintenu selon les types de tâches. L’ensemble d’évaluation couvrait l’éventail du travail en entreprise : rédaction et amélioration de contenu (y compris des artefacts comme des slides, des feuilles de calcul et du HTML, de plus en plus centraux dans les cas d’usage de coworking en entreprise), résumé et synthèse de sources, analyse de données, recherche de ressources, automatisation de workflows, et compréhension de sujets complexes.

Analyse de benchmark : Les réponses préférées de Glean aident à s’attaquer au botsitting
Nous avons aussi constaté que les réponses préférées de Glean limitent le botsitting, ce travail largement non budgété que les employés assument pour rendre l’IA utilisable, en lui fournissant du contexte, en supervisant la sortie et en corrigeant les erreurs. Une étude du Work AI Institute de Glean, basée sur une enquête auprès de 6 000 travailleurs numériques à temps plein, a montré que les employés consacrent 6,4 heures par semaine au botsitting, soit plus de temps que celui qu’ils passent à utiliser l’IA pour produire réellement du travail. Les retours de nos évaluateurs ont mis en évidence des schémas d’échec qui créent ce type de travail de correction :
- Des tâches mal comprises
- Des sorties difficiles à lire ou à partager
- Des rôles ou du contexte de compte manquants
- Des preuves incomplètes ou obsolètes
- Des conclusions non étayées, voire incorrectes
Chacun de ces points représente une petite taxe pour la personne qui utilise la sortie, précisément le travail que le Work AI Institute quantifie comme du botsitting. Lorsqu’un système démarre avec le bon contexte déjà en place, il nécessite moins de corrections de ce type, et les collaborateurs récupèrent les heures qui, autrement, seraient consacrées à gérer l’IA.
Analyse de benchmark : Méthodologie d’évaluation
L’évaluation interne s’appuyait sur des requêtes synthétiques accédant aux propres données de production de Glean, avec des évaluateurs notant plus de 180 réponses sur une échelle de préférence en 5 points, en comparant Glean Assistant et Claude Cowork côte à côte. Pour l’accès aux données d’entreprise, Glean a utilisé ses connecteurs natifs et basés sur MCP, tandis que Claude Cowork a été configuré avec des connecteurs MCP standard couvrant Google Drive, Gmail, Google Calendar, Slack, Atlassian Rovo, Linear, Intercom et Sigma, ainsi que des serveurs MCP locaux pour Salesforce, GitHub et GCP. Glean a été exécuté avec le routage automatique activé Claude Cowork a été maintenu constant sur Claude Sonnet 5 avec un raisonnement élevé, la recommandation d’Anthropic
niveau de raisonnement qui équilibre qualité et rapidité.L’essor de la frontière de Pareto et l’évaluation des modèles selon le rapport coût-performance
L’essor de la frontière de Pareto marque le déclin de l’intelligence maximale comme stratégie par défaut pour l’IA en entreprise. Les entreprises n’ont plus besoin de choisir entre le coût de l’IA et ce qu’elle délivre, et miser sur un seul modèle de la frontière, sans discipline quant à la manière dont il est réellement utilisé, n’est pas une habitude durable. Les résultats de Glean le démontrent : associer un routage à travers un paysage de modèles en évolution rapide au contexte de l’entreprise réduit les coûts de tokens de 81 %, tandis que les sorties elles-mêmes sont préférées dans 78 % des cas. Glean s’engage à aider les entreprises à réduire drastiquement les coûts de tokens afin qu’elles puissent accroître considérablement le volume de travail qu’elles confient à l’IA.
Rejoignez-nous à Glean:GO pour en savoir plus sur ces résultats.









