Guide d'achat : que rechercher dans une plateforme d'IA d'entreprise pour un déploiement économe en jetons

0
minutes de lecture
Guide d'achat : que rechercher dans une plateforme d'IA d'entreprise pour un déploiement économe en jetons

Table des matières

Vous avez des questions ou souhaitez une démo ?

Nous sommes là pour vous aider ! Cliquez sur le bouton ci-dessous et nous vous recontacterons.

Demander une démo
Partager cet article :

Une plateforme d'IA d'entreprise économe en jetons délivre de solides résultats sans consommer plus de contexte, de calcul et de surcharge de workflow qu'une tâche n'en nécessite réellement. L'efficacité dépend bien davantage de la manière dont la plateforme récupère, sélectionne et achemine le contexte que du modèle qu'elle exécute ou de la taille de sa fenêtre de contexte.

L'efficacité en jetons devient un véritable enjeu dès que l'IA dépasse la phase pilote. Alors que de nombreuses évaluations en phase de production se concentrent sur la qualité du modèle, le nombre de connecteurs ou l'impression laissée par la démo, aucun de ces éléments n'indique si la plateforme restera efficace à mesure que l'utilisation s'étend entre équipes, outils et workflows en plusieurs étapes.

Les coûts augmentent en production pour des raisons prévisibles : la plateforme récupère trop d'informations, en transmettant des documents entiers au lieu de simples passages pertinents. Ou bien elle oriente chaque tâche vers un seul parcours de modèle coûteux et retraite les mêmes informations à chaque étape. Les dépenses augmentent, les réponses ralentissent et l'ancrage aux sources s'affaiblit.

À grande échelle, l'efficacité en jetons dépend de la conception de la plateforme, le prix du modèle n'étant qu'un facteur parmi d'autres. La bonne plateforme améliore à la fois le coût, la latence et la qualité des réponses : elle récupère un meilleur contexte, sélectionne uniquement ce dont la tâche a besoin et gère intelligemment les travaux en plusieurs étapes.

La question logique suivante est de savoir comment optimiser l'efficacité en jetons lors du déploiement d'une plateforme d'IA, et c'est là que ce guide entre en jeu : quoi évaluer avant de vous engager, quels signaux d'alerte surveiller, et comment Glean aborde un déploiement économe en jetons.

Commencez par la bonne question d'évaluation

La première erreur que commettent souvent les équipes est de demander quel modèle est le moins cher. Cette question est trop étroite pour guider un achat d'entreprise, et elle détourne l'attention de la vraie question : quelle plateforme produit le meilleur résultat par jeton  ; ?

Mesuré de cette façon, l'objectif devient un travail utile et ancré, produit avec le moins de gaspillage possible. Une plateforme qui dépense légèrement plus de jetons mais fournit une réponse plus rapide et mieux fondée peut être plus efficace qu'une autre qui paraît moins chère sur le papier puis génère davantage de reprises, de revues et de frictions dans les workflows.

Les acheteurs d'entreprise devraient évaluer l'utilisation des jetons selon quatre résultats :

  • Coût par tâche
  • Latence par tâche
  • Qualité et ancrage de la sortie
  • Capacité de montée en charge sur les workflows et les équipes

Glean optimise la récupération, la sélection du contexte et l'orchestration, là où les gains d'efficacité les plus importants se produisent avant même que le modèle ne génère un seul jeton. À l'inverse, un modèle bon marché dans une plateforme inefficace finit quand même par devenir un déploiement coûteux.

Évaluez d'abord la qualité de la récupération

La qualité de la récupération est le premier point de contrôle à examiner de près, car la plupart des gaspillages commencent en amont. Lorsqu'une plateforme récupère trop de sources, les classe mal ou transmet des documents entiers pour quelques lignes pertinentes, le modèle brûle des jetons à lire du contenu dont il n'a pas besoin.

L'optimisation de la récupération apporte la solution : elle réduit l'espace de recherche avant le début de la génération, en utilisant la pertinence, les permissions, la récence, la propriété, les métadonnées et les relations entre systèmes pour décider quelles preuves doivent entrer dans le contexte de travail.

Questions à poser aux fournisseurs :

  • Comment la plateforme décide-t-elle quelles sources récupérer  ; ?
  • Peut-elle renvoyer des preuves au niveau du passage plutôt que des documents entiers  ; ?
  • Comment gère-t-elle les résultats dupliqués, obsolètes ou faiblement liés  ; ?
  • Comment hiérarchise-t-elle les informations entre plusieurs systèmes  ; ?

L'étendue des connecteurs peut être trompeuse ici. L'accès à de nombreux systèmes est utile, mais l'accès seul ne crée pas l'efficacité. La plateforme doit malgré tout extraire avec précision les bonnes preuves de ces systèmes.

Glean est conçu autour de ce problème. Il récupère la connaissance vivante de l'entreprise à travers les systèmes, respecte les permissions et met en avant les preuves les plus pertinentes au lieu de forcer le modèle à lire de larges déversements de documents. Une meilleure récupération a tendance à améliorer la qualité et la rapidité tout en réduisant les coûts.

Dans une évaluation aveugle et aléatoire portant sur environ 280 requêtes complexes d'entreprise sur des sources de données comparables, les évaluateurs ayant exprimé une préférence ont jugé les réponses de Glean correctes environ 1,9x plus souvent que celles de ChatGPT et 1,6x plus souvent que celles de Claude. C'est le type d'écart qui découle d'un ancrage dans un contexte d'entreprise tenant compte des permissions, plutôt que du choix du modèle.

Évaluez la manière dont la plateforme gère le contexte, pas seulement l'accès

De nombreux fournisseurs mettent en avant l'accès au contexte : nombre de connecteurs, grandes fenêtres, ingestion large. Un déploiement économe en jetons dépend plutôt de la gestion du contexte. Une plateforme peut se connecter à toutes les principales applications SaaS et continuer à gaspiller des jetons si elle ne sait pas restreindre, délimiter, dédupliquer et hiérarchiser ce qui atteint le modèle.

La distinction à faire préciser aux fournisseurs est de savoir si la plateforme accède simplement aux données ou si elle peut aussi y sélectionner ce qu'il faut. Se connecter à une source est la partie facile  décider quels quelques passages une tâche nécessite réellement est ce qui influence les dépenses en jetons.

Recherchez des plateformes qui :

  • Ne transmettent que les preuves requises par la tâche
  • Dédupliquent le contexte répétitif entre systèmes
  • Respectent automatiquement les permissions
  • Privilégient les sources récentes et fiables aux sources obsolètes
  • Maintiennent un contexte de travail léger même lorsque le matériau source est volumineux

Une grande fenêtre de contexte ne peut pas remplacer une mauvaise gestion du contexte. Remplir une fenêtre avec du contenu marginal peut nuire à la qualité des réponses autant qu'au coût : les modèles accordent une attention moins fiable au passage pertinent lorsqu'il est noyé parmi des milliers de jetons de remplissage. Le coût et la latence apparaissent quand même en production.

Glean traite le contexte comme quelque chose à gérer, et non à accumuler. Le système pondère ce qui est actuel, connecté, conforme aux permissions et pertinent pour la tâche — c'est pourquoi la récupération et l'ancrage portent une grande partie de l'histoire de l'efficacité. Dans un benchmark portant sur environ 175 requêtes d'entreprise, le contexte d'entreprise de Glean a été préféré environ 2,5x plus souvent que les outils MCP standards, qui utilisaient en moyenne environ 30% de jetons en plus. Le test conservait le modèle et le harness constants et ne remplacait que la couche de contexte.

Recherchez un routage intelligent des modèles et un raisonnement adapté à la tâche

Toutes les tâches n'ont pas besoin de la même puissance de calcul. Une plateforme qui traite chaque étape comme un travail de modèle de pointe devient vite coûteuse.

La récupération, la planification, la synthèse, le résumé et l'exécution d'actions appellent souvent des modèles différents. Certaines étapes exigent un raisonnement profond  beaucoup n'en ont pas besoin. Acheminer le travail vers le bon modèle devient un critère d'achat clé dès lors que vous prenez en charge plusieurs workflows à grande échelle.

Questions à poser :

  • La plateforme peut-elle répartir le travail entre différents modèles  ; ?
  • Peut-elle réserver le raisonnement coûteux aux étapes qui en ont besoin  ; ?
  • Peut-elle utiliser des modèles plus petits ou spécialisés pour les étapes simples  ; ?
  • Les administrateurs peuvent-ils gouverner l'utilisation des modèles par workflow ou par niveau de risque  ; ?

Un routage adapté à la tâche est l'un des moyens les plus directs de réduire le coût d'inférence de l'IA : les tâches simples s'exécutent sur des modèles moins chers au lieu de payer des tarifs de pointe à chaque étape. Le bénéfice ne se limite pas à un coût en jetons d'IA plus faible. La latence et le débit s'améliorent aussi, parce que les tâches simples n'attendent plus derrière des parcours de raisonnement surdimensionnés.

C'est aussi là que la démo la plus élégante peut masquer une architecture inefficace — un seul modèle premium, un seul contexte surdimensionné, toutes les tâches confondues. Une plateforme plus mature dépense souvent moins parce qu'elle sait quelles étapes n'ont pas besoin d'un modèle de pointe.

Model Hub de Glean donne aux administrateurs accès à plus de 15 modèles leaders via Amazon Bedrock, Google Vertex AI et Azure OpenAI au moyen d'une seule clé universelle, et le générateur d'agents prend en charge la sélection du modèle par étape afin que chaque phase d'un workflow puisse s'exécuter sur le bon niveau. Glean Search achemine déjà les récupérations simples vers des modèles légers et réserve un raisonnement plus poussé aux requêtes complexes et multi-sources. Pour environ 70% des interactions avec Glean Assistant, la plateforme sélectionne automatiquement le modèle en fonction du contexte de la tâche. Les administrateurs conservent la gouvernance sur les familles de modèles disponibles et sur leur utilisation. Pour un examen plus approfondi des mécanismes de routage, voir comment Glean aborde le routage des jetons.

Testez l'orchestration multi-étapes sur des workflows réalistes

Les démonstrations en un seul aller-retour montrent rarement où les coûts se cumulent. Le vrai test est un workflow en plusieurs étapes : recueillir des informations, résumer, décider, récupérer à nouveau, puis éventuellement agir. Une orchestration faible multiplie le gaspillage à chaque étape.

Voici les schémas d'échec les plus courants :

  • Recharger le même contexte brut à chaque étape
  • Transmettre des sorties intermédiaires surdimensionnées sans compression
  • Recourir à un outil alors qu'une étape plus simple suffirait
  • Relancer une récupération large lorsque le système dispose déjà de ce dont il a besoin
  • Laisser le contexte actif gonfler au fil du workflow

Une plateforme plus robuste garde une mémoire de travail bien délimitée. Elle résume, met en cache, compacte et route afin que la tâche ne devienne pas plus lourde à chaque étape. Testez des tâches réalistes, pas seulement des invites ponctuelles. Par exemple :

  • Un résumé de projet interfonctionnel construit à partir de plusieurs systèmes
  • Une réponse de support ou de politique qui exige des preuves ancrées
  • Une tâche de recherche couvrant récupération, synthèse et action de suivi
  • Un workflow marketing qui agrège plusieurs entrées en un livrable exploitable

Relancez ensuite en demandant ce qu'il advient du contexte lors des tâches longues  si la plateforme recharge les mêmes informations  dans quelle mesure elle résume les sorties intermédiaires  et comment elle décide qu'un appel à un outil est réellement nécessaire.

La plateforme de Glean va au-delà de la recherche pour cette raison précise. Son Agentic Engine conserve l'état entre les étapes d'un workflow, de sorte que les appels en aval reçoivent des résultats intermédiaires structurés au lieu de relire l'intégralité du contexte accumulé à chaque aller-retour, et il compresse le contexte récupéré avant de le transmettre aux étapes de raisonnement. Cela empêche le jeu de travail de gonfler à mesure qu'une tâche s'exécute. Une plateforme doit prouver qu'elle peut orchestrer efficacement un workflow complet, et pas seulement répondre correctement à une requête unique.

Vérifiez l'observabilité, la gouvernance et la mesure

On ne peut pas gérer ce qu'on ne peut pas voir en matière d'efficacité en jetons. L'observabilité et la gouvernance sont des critères d'achat essentiels, pas de simples commodités administratives. Les équipes doivent savoir quels workflows sont efficaces, où se produit le gaspillage et si la sortie reste bien ancrée à mesure que l'usage augmente.

Recherchez la possibilité d'inspecter :

  • Les jetons par tâche réussie
  • La latence par workflow
  • La qualité de la récupération et la sélection des preuves
  • L'ancrage des réponses et l'appui des sources
  • L'utilisation des modèles par workflow, équipe ou cas d'usage
  • L'exposition aux coûts et les contrôles administrateur

Une utilisation non maîtrisée conduit souvent à des dépenses non maîtrisées. Lorsque chaque workflow peut récupérer largement, appeler le même modèle coûteux et s'exécuter sans mesure, une plateforme qui semblait correcte en pilote devient difficile à gérer par la suite.

Glean relie l'efficacité à l'ancrage, aux permissions et à l'évaluation. Son observabilité des agents et ses évaluations vous donnent une visibilité étape par étape sur le comportement des agents — où les jetons s'accumulent, quelle couche de modèle a pris en charge chaque étape et quelles preuves la réponse a utilisées. Ce sont les éléments d'entrée dont vous avez besoin pour juger si le système améliore les résultats par jeton au fil du temps.

Surveillez ces signaux d'alerte pendant l'évaluation

Quelques signes avant-coureurs reviennent lorsqu'une plateforme risque de devenir gourmande en jetons en production.

  1. Le fournisseur parle uniquement des modèles, pas de la conception de la plateforme. Une conversation centrée sur l'accès aux modèles, les grilles tarifaires ou la taille de fenêtre sous-estime les parties de la pile qui déterminent réellement l'efficacité.
  2. La démo s'appuie sur un contexte surdimensionné au lieu d'une récupération précise. Une plateforme qui continue de gagner en envoyant plus d'informations au modèle masque peut-être une faible récupération par la force brute.
  3. L'équipe ne peut pas expliquer comment elle réduit le contexte. Si personne ne peut décrire comment fonctionnent la pertinence, les permissions, la récence, le classement ou la sélection des passages, partez du principe que le système récupère trop.
  4. Chaque tâche suit le même parcours de modèle coûteux. L'absence de flexibilité de routage signifie généralement que la plateforme aura du mal à équilibrer coût, vitesse et qualité à mesure que l'utilisation s'étend.
  5. La visibilité sur les dépenses par tâche ou workflow est faible. Si les administrateurs ne peuvent pas relier l'utilisation à un workflow, à un schéma de comportement ou à un parcours de modèle, l'optimisation reste réactive.
  6. Elle brille dans les démonstrations en un seul aller-retour mais trébuche sur les tâches multi-étapes. Ce schéma pointe davantage vers un problème d'orchestration que vers une limite du modèle.

Utilisez une grille simple pour comparer les plateformes

Une grille légère rend les évaluations concrètes, surtout lorsque plusieurs parties prenantes sont impliquées.

                                                                                       
CatégorieCe qu'il faut rechercherPourquoi c'est important
Précision de la récupérationPreuves au niveau du passage, classement solide, réduction tenant compte des permissionsRéduit le gaspillage de jetons avant le début de la génération
Sélection du contexteDéduplication, contexte délimité, préférence pour les sources récentesÉvite les invites bruyantes et répétitives
Flexibilité du routagePlusieurs parcours de modèle, raisonnement adapté, contrôles administrateurAméliore le rapport prix-performance entre les tâches
Efficacité de l'orchestrationRésumé, mise en cache, état intermédiaire compactEmpêche le gaspillage de se cumuler au fil des étapes
LatenceAchèvement rapide dans des workflows réalistesL'efficacité doit améliorer l'expérience utilisateur, pas seulement le coût
Observabilité et gouvernanceVisibilité au niveau du workflow, vérifications d'ancrage, contrôles de dépensesRend l'optimisation gérable en production
Qualité du résultat par jetonRéponses solides sans contexte inutileRelie l'efficacité à la valeur métier

La grille permet aussi de maintenir les décisions liées aux résultats d'entreprise plutôt qu'au simple vernis de la démo.

Choisissez la plateforme qui reste efficace quand l'usage devient réel

Les plateformes qui se transforment le mieux à l'échelle récupèrent un meilleur contexte, le gèrent avec soin, routent efficacement le travail et maintiennent l'exécution multi-étapes efficiente à mesure que l'usage augmente. Du point de vue plateforme, un accès puissant aux modèles est un prérequis, pas le facteur différenciant.

L'efficacité en jetons est au fond une question d'architecture d'IA d'entreprise. Les acheteurs qui testent en amont la récupération, la gestion du contexte, le routage, l'orchestration et la gouvernance ont tendance à choisir des systèmes qui tiennent la route une fois en production.

Glean fonctionne déjà à l'échelle de l'entreprise : Booking.com l'a adopté à l'échelle de l'entreprise pour environ 14 000 employés, et Zillow l'utilise pour relier les personnes, les projets et les connaissances à travers l'organisation. Glean part d'un contexte d'entreprise ancré et tenant compte des permissions, puis prolonge cette discipline dans la récupération, le raisonnement et l'exécution, de sorte que la qualité des réponses et l'efficacité progressent ensemble au lieu d'être en concurrence.

Voyez comment Glean améliore la qualité des réponses et l'efficacité en jetons grâce à une meilleure récupération et à un routage intelligent — découvrez la plateforme.

Work AI qui fonctionne.

CTA Background Gradient 3CTA Background Gradient 3CTA Background Mobile