Claude Sonnet 4.5 optimise l’exécution des outils afin de débloquer 10 % des requêtes qui étaient auparavant hors de portée

0
minutes de lecture
Claude Sonnet 4.5 optimise l’exécution des outils afin de débloquer 10 % des requêtes qui étaient auparavant hors de portée

Table des matières

Vous avez des questions ou souhaitez une démo ?

Nous sommes là pour vous aider ! Cliquez sur le bouton ci-dessous et nous vous recontacterons.

Demander une démo
Partager cet article :

Glean est une plateforme ouverte qui prend en charge les derniers modèles open source et commerciaux, offrant aux entreprises un accès aux LLMs les plus avancés. Glean fournit le contexte dont ces modèles ont besoin en se connectant à plus de 100 sources de données dans l’entreprise et en construisant un Enterprise Graph qui comprend le fonctionnement de votre organisation — les personnes, les relations, les projets, les tâches et les processus. Résultat : nous aidons les entreprises à accomplir davantage avec l’IA — du débogage à la rédaction, en passant par l’analyse de données et bien plus encore, le tout ancré dans le contexte.

Glean s’engage à prendre rapidement en charge les modèles de pointe, notamment Claude Sonnet 4.5, et à donner aux utilisateurs la possibilité de les tester sur de véritables charges de travail en entreprise. Nous sommes heureux de prendre en charge Sonnet 4.5 dès cette semaine dans notre générateur d’agents no-code, permettant aux utilisateurs de choisir le meilleur modèle pour chaque besoin parmi Sonnet 4.5 et plus de 15 modèles, par agent ou par étape d’agent.  ;

Chez Glean, nous évaluons les modèles et notre moteur agentique selon la complétude, la justesse et l’alignement avec le feedback humain. Nous partageons ensuite ces résultats afin que les utilisateurs puissent prendre des décisions éclairées sur les modèles à utiliser. Nos évaluations ont montré que, par rapport à Sonnet 4.0, Sonnet 4.5 offre une justesse et une complétude supérieures et, plus important encore, traite avec succès 10 % de requêtes supplémentaires avec feedback humain (requêtes « downvotées »), une catégorie de requêtes hors de portée de Sonnet 4.0. Sonnet 4.5 atteint la réponse finale avec moins d’itérations de planification — offrant de meilleures performances, plus efficacement.

Sonnet 4.5 traite des requêtes auxquelles Sonnet 4.0 ne pouvait tout simplement pas répondre

Glean a observé sa plus forte amélioration avec Sonnet 4.5 sur l’alignement avec le feedback humain, qui mesure la fréquence à laquelle les modèles plus récents résolvent avec succès des requêtes auparavant downvotées.

L’alignement avec le feedback humain est une cible mouvante. Nous avons récemment déployé une mise à niveau majeure de Glean’s Agentic Engine 2, le moteur qui planifie de manière adaptative et itère sur le contexte d’entreprise. Cela nous a permis de résoudre une catégorie de requêtes représentant 20 % de toutes les requêtes downvotées, auparavant hors de portée. Avec ce nouveau moteur, le niveau d’exigence pour répondre au feedback humain a considérablement augmenté, rendant plus difficile pour Sonnet 4.5 de démontrer des gains de performance. Dans ce contexte, nous sommes impressionnés par le bond de 10 % d’amélioration du nouveau modèle Sonnet.

Sonnet 4.5 est plus efficient grâce à un meilleur appel aux outils et une meilleure utilisation de la planification adaptative

Si Sonnet 4.5 progresse en justesse et en complétude par rapport à Sonnet 4.0, la victoire la plus notable est que le modèle obtient ces résultats de manière efficiente. Nous suivons l’efficience avec deux métriques :

  • Appel aux outils : le nombre de fois où l’agent utilise des données externes ou exécute des actions pendant la résolution du problème.
  • Cycles de planification adaptative : le nombre d’itérations au cours desquelles l’agent révise et exécute son plan en fonction des résultats intermédiaires jusqu’à ce que la tâche soit accomplie.
                                           
Appels d’outils (moyenne)Appels d’outils en parallèle (moyenne)Cycles de planification adaptative (moyenne)
Claude Sonnet 4.51.611.342.19
Claude Sonnet 4.02.081.003.08

Non seulement le modèle identifie plus vite les bons outils, mais il est aussi plus efficient dans l’usage des appels d’outils en parallèle, sans incitation excessive par prompt. Le modèle peut déduire le bon ordre d’exécution pour les étapes dépendantes et reconnaître quand des appels peuvent être parallélisés.  ;

Si nous constatons que la planification adaptative est précieuse pour les questions ouvertes ou de recherche, son usage excessif peut augmenter la latence et la consommation de ressources. Sonnet 4.5 est meilleur pour analyser de grands ensembles de résultats et s’engager sur une réponse lorsque son niveau de confiance est élevé, ce qui lui permet de répondre sans lancer une étape de confirmation supplémentaire.

Ce qui est impressionnant, c’est que Sonnet 4.5 utilise l’appel aux outils et la planification adaptative plus efficacement, sans dégrader les performances de complétude ou de justesse.

Comment Sonnet 4.5 optimise l’appel aux outils  ; ;  ;

Dans les données d’évaluation, nous constatons que Sonnet 4.5 analyse la requête de l’utilisateur et détermine les opérateurs à utiliser, appliquant efficacement les bons filtres et paramètres aux outils — ce qui produit des résultats plus précis avec moins d’appels aux outils. Il est également meilleur pour identifier les outils qui font progresser la tâche de manière mesurable — en réduisant l’incertitude, en écartant des voies d’exécution possibles ou en produisant le résultat final.

Nous observons les améliorations de l’appel aux outils et de la planification adaptative dans cette requête :

__wf_reserved_inherit

Avec Sonnet 4.5, cette requête a été traitée avec 3 recherches parallélisées plutôt que 3 recherches séquentielles, économisant 2 appels LLM et réduisant la latence.  ;

Accédez à Sonnet 4.5 ainsi qu’aux principaux modèles open source et commerciaux dans le Glean model hub

Sonnet 4.5 fournit des réponses plus précises et plus complètes pour l’IA en entreprise que Sonnet 4.0 — et utilise plus efficacement les outils d’entreprise pour résoudre des questions plus difficiles avec une meilleure efficience. Sonnet 4.5 arrive cette semaine dans le Glean model hub aux côtés de plus de 15 modèles open source et commerciaux de premier plan, afin que vous puissiez voir comment il fonctionne sur vos propres agents d’entreprise.

Si vous n’êtes pas utilisateur de Glean et que vous souhaitez voir Sonnet 4.5 en action, inscrivez-vous dès aujourd’hui pour une démo gratuite.

Auteurs : Kunal Patil, Nikhil Mandava, Seema Jethani,

Nilesh Dalvi, Julie Mills

Work AI qui fonctionne.

CTA Background Gradient 3CTA Background Gradient 3CTA Background Mobile