OpenAI GPT-5 surpasse o3 avec 83 % de justesse, et les clients Glean peuvent en tirer parti dès aujourd’hui

0
minutes de lecture
OpenAI GPT-5 surpasse o3 avec 83 % de justesse, et les clients Glean peuvent en tirer parti dès aujourd’hui

Table des matières

Vous avez des questions ou souhaitez une démo ?

Nous sommes là pour vous aider ! Cliquez sur le bouton ci-dessous et nous vous recontacterons.

Demander une démo
Partager cet article :

Nous sommes ravis de prendre en charge GPT-5 dès son premier jour de disponibilité. Cela reflète notre engagement continu à prendre en charge rapidement les derniers modèles d’IA, afin que les entreprises puissent les évaluer et les déployer dans des agents qui comprennent pleinement leur contexte d’entreprise. 

Chaque client Glean peut essayer GPT-5 avec Agents et le comparer directement à d’autres modèles pris en charge, notamment OpenAI o3, OpenAI GPT-4.1, Claude Sonnet 4, Meta Llama 4, Google Gemini 2.5 Pro, Google Gemini 2.5 Flash, et bien plus encore. Les utilisateurs peuvent le tester avec l’intégralité du contexte de leurs données d’entreprise et des Agents qu’ils ont déjà créés sur Glean.

Dans le cadre de notre collaboration continue avec OpenAI, Glean a obtenu un accès anticipé à GPT-5 et l’évalue pour des cas d’usage d’IA agentique en entreprise. Dans cet article, nous partagerons nos enseignements sur les domaines et les façons dont GPT-5 excelle, afin de vous aider à orienter votre propre évaluation pour vos agents d’entreprise. 

GPT-5 surpasse o3 sur tous les plans : exactitude, exhaustivité et alignement avec les retours humains

GPT-5 est le premier modèle à fusionner des capacités généralistes et de raisonnement au sein d’un modèle unique. Lorsque nous avons étudié quels modèles utiliser pour évaluer GPT-5, nous nous sommes appuyés sur la génération précédente de modèles OpenAI : GPT-4.1 était conçu pour des tâches généralistes, tandis que o3 était spécialisé dans le raisonnement.

Chez Glean, nous construisons des Agents et des Assistants qui planifient de manière adaptative, en itérant à partir d’échecs ou d’enseignements précédents. o3 excelle en raisonnement : il est plus susceptible de lancer des recherches de suivi, de réessayer des plans alternatifs et de rassembler davantage de contexte lorsque c’est nécessaire. C’est précisément cet ensemble de compétences qui permet à Glean de prendre en charge des tâches plus complexes. C’est pourquoi nous avons choisi de comparer GPT-5 à o3 dans notre évaluation.

Chez Glean, nous disposons de plus de 25 juges LLM qui évaluent en continu nos produits Search, Assistant et Agents sur un large éventail de travaux d’entreprise (c.-à-d. : recherche d’informations, rédaction, analyse de données, code, etc.). Nous évaluons également les LLM selon ces mêmes métriques, afin d’orienter les modèles que nous prenons en charge et la manière dont les clients peuvent combiner les modèles. 

Avec autant de juges à disposition, nous avons utilisé plusieurs métriques pour comparer o3 à GPT-5 sur le déploiement en production de Glean. Ici, nous nous sommes limités à notre propre cas d’usage en entreprise par contrainte de temps, mais nous faisons habituellement cet exercice sur un ensemble d’évaluation bien plus large, composé de requêtes clients réelles, de requêtes synthétiques et de requêtes finement calibrées.

Ces métriques se concentrent sur ce qui compte réellement pour les entreprises en matière d’IA :

  • Exactitude : Le résultat est-il correct ou passe-t-il à côté ? Que ce soit à cause d’hallucinations ou simplement parce qu’il suit une mauvaise piste pour parvenir à la réponse.
  • Exhaustivité : L’agent a-t-il accompli entièrement ce que l’utilisateur a demandé ? Cela peut être rédiger un e-mail, créer un ticket Jira, ou simplement répondre à tous les éléments précisés dans la question de l’utilisateur.
  • Alignement avec les retours humains : Les nouvelles réponses sont-elles davantage alignées avec les retours humains que nous avons reçus sur nos requêtes précédentes ?

Nous avons constaté que GPT-5 surpassait o3 sur ces métriques clés :

__wf_reserved_inherit

Remarque : o3 ne propose pas de verbosité, mais nous avons observé un niveau de verbosité moyen dans nos évaluations.

__wf_reserved_inherit

Dans la section suivante de cet article, nous examinerons pourquoi nous avons observé une amélioration de ces métriques avec GPT-5.

L’utilisation étendue des outils par GPT-5 bat la planification approfondie de o3

Pour mieux comprendre les différences entre o3 et GPT-5, nous avons examiné quelques métriques d’investigation : le nombre d’étapes de planification et le nombre de recherches effectuées.

__wf_reserved_inherit

Ce que nous observons dans ces métriques, ainsi qu’en examinant les plans des agents, c’est que GPT-5 a tendance à voir large. Face à une invite, il collecte rapidement des informations via plusieurs outils ou essaie plusieurs stratégies en parallèle. Les appels d’outils en parallèle font partie des nouvelles fonctionnalités de GPT-5, et il sait s’en servir. 

Cela signifie que GPT-5 trouve souvent ce dont il a besoin sans devoir suivre une longue chaîne d’étapes intermédiaires. Par conséquent, le « plan » suivi par l’agent (la séquence d’actions qu’il exécute) est plus court, avec moins d’étapes du début à la fin.

À l’inverse, o3 a tendance à creuser. Il peut commencer avec un focus étroit, puis suivre une chaîne de raisonnement ou d’actions, par exemple : rechercher une source, puis approfondir un document spécifique, puis poser une question de clarification, etc. Cela se traduit par davantage d’étapes de planification, l’agent adoptant une approche plus séquentielle et investigative.

Si l’on regarde les résultats de performance, on constate que l’approche d’utilisation étendue des outils adoptée par GPT-5 l’emporte. Cela suggère que l’utilisation efficace des outils devient un moteur de performance des agents en entreprise, réduisant souvent le besoin d’étapes de planification supplémentaires. En définitive, cela souligne que l’usage d’outils pour établir le contexte est primordial le contexte donne aux modèles d’IA l’avantage décisif dont ils ont besoin pour accomplir le travail. 

Voyons cela à l’œuvre dans un exemple d’invite :

Quel modèle utilisons-nous pour les étapes intermédiaires ?

o3 a effectué une recherche initiale dans l’entreprise et a halluciné, en identifiant à tort un seul modèle utilisé pour les étapes intermédiaires sur la base des informations disponibles.

__wf_reserved_inherit

GPT-5 a exploité 110 sources pour trouver le contexte le plus pertinent, a reconnu qu’il existe plusieurs versions de notre architecture de raisonnement agentique, et que les clients ont la flexibilité de choisir leur propre modèle dans les agents, afin de faire remonter une réponse précise et complète. 

__wf_reserved_inherit

GPT-5 sait mieux quand demander de l’aide

L’un des enseignements intéressants avec GPT-5, c’est qu’il est capable d’évaluer quand répondre directement à une question et quand revenir vers l’utilisateur pour poser des questions de suivi.

Voyons cela appliqué à un exemple de prompt : 

Rédige un message à Tony expliquant comment les agents peuvent améliorer sa productivité, avec des exemples spécifiques à son équipe.

Comme vous pouvez le voir dans le résultat ci-dessous, o3 s’est lancé dans des suppositions en partant du principe que Tony faisait référence à Tony Gentilcore, un cofondateur ingénieur de Glean.

__wf_reserved_inherit

Mais en réalité, il y a deux Tony chez Glean. Ces deux Tony devraient recevoir des réponses différentes, puisqu’ils ont des rôles différents au sein de l’organisation. GPT-5 l’a compris en effectuant une recherche large et en posant une question de suivi, afin de mieux identifier la meilleure façon de répondre à la question. 

__wf_reserved_inherit

Nous avons vu les questions de suivi devenir courantes, à la fois au sein de l’expérience Glean Assistant et dans l’ensemble des chatbots IA grand public. Aujourd’hui, nous arrivons au stade où le modèle peut déterminer quand il est pertinent de revenir vers l’utilisateur avec l’information dont il a besoin, rapidement, lorsque c’est possible, et d’engager une conversation uniquement lorsque ce ne l’est pas. Ce changement rend chaque expérience conversationnelle plus précieuse.

GPT-5 introduit le niveau de verbosité, et les premières évaluations montrent que nous allons l’implémenter

Anecdote : lorsque Glean a conçu à l’origine son expérience Assistant, notre équipe d’ingénierie a mis en place une instruction explicite visant à privilégier la concision autant que possible. Elle jugeait la qualité du chat depuis sa propre perspective, préférant aller droit au but plutôt que d’ajouter du superflu (leurs mots, pas les miens). Nous avons depuis retiré ce réglage, en constatant qu’il limitait la capacité de l’Assistant à s’adapter à la fois à la tâche et aux préférences individuelles.

Un ajout intéressant de GPT-5 est l’introduction de la verbosité — la capacité de passer de réponses brèves à moyennes puis longues — et il peut répondre entièrement au prompt même en verbosité moyenne.

Voyons cela dans une requête Assistant pour une question de support produit :

Comment puis-je ajouter Glean à un workspace ServiceNow ?

Dans cet exemple, o3 fournit une réponse bien structurée et complète, ce qui la rend idéale pour un article de centre d’aide.

__wf_reserved_inherit

À présent, si j’étais un ingénieur préférant des réponses plus succinctes, je pourrais appliquer un réglage de verbosité faible dans GPT-5, répondant à mes préférences sans sacrifier l’exhaustivité.

__wf_reserved_inherit

Nous travaillons déjà à exploiter les contrôles de verbosité avec la personnalisation pour l’utilisateur final, à la fois globalement et selon la tâche, ainsi que pour limiter la sortie de tokens sur les étapes intermédiaires des agents. À suivre !

GPT-5 surmonte les difficultés de mise en forme avec o3

Si la verbosité nous offre un nouveau niveau de contrôle, elle corrige aussi un défaut que nous avons observé en passant à o3 depuis GPT-4.1 : une baisse de la qualité des réponses. La qualité des réponses correspond à une évaluation globale de la capacité de notre Assistant à fournir des réponses exactes, lisibles et alignées avec l’utilisateur. 

En effet, GPT-4.1 est bien meilleur qu’o3 pour structurer ses réponses. C’est l’un des avantages de la nouvelle approche combinant modèles généralistes et modèles de raisonnement : GPT-5 peut offrir les deux.

Nous l’avons constaté non seulement en échantillonnant les résultats d’évaluation, mais aussi dans les métriques de mise en forme que nous suivons. En examinant la mise en forme appliquée dans les réponses, nous pouvons voir que GPT-5 en verbosité élevée est plus à même d’utiliser des listes et des séparateurs, donnant davantage de structure au rendu.

__wf_reserved_inherit

Nous espérons qu’en utilisant la verbosité de la bonne manière, nous pourrons récupérer une partie des métriques de qualité de réponse perdues avec o3. 

Tous les modèles qui comptent, sur une seule plateforme

Si vous ne l’aviez pas encore compris, nous sommes vraiment enthousiastes quant aux gains de performance que nous avons mesurés en évaluant GPT-5. Nos clients devraient se réjouir que nous prenions en charge ce nouveau modèle, et qu’ils puissent l’évaluer eux-mêmes en comparant GPT-5 aux principaux modèles open source et commerciaux pour l’IA en entreprise.

Si GPT-5 a réalisé des progrès en matière de raisonnement, aucun modèle unique n’est parfait pour tous les cas d’usage. C’est pourquoi Glean continue d’offrir aux clients le choix du modèle, de prendre en charge les tout derniers modèles et de partager ouvertement des métriques de performance, afin que vous puissiez exploiter ces enseignements pour concevoir les expériences agentiques les plus performantes au travail.

Si vous êtes prêt à découvrir comment GPT-5 peut aider votre organisation à avancer, vous pouvez commencer à l’essayer dès aujourd’hui dans Glean Agents.

Work AI qui fonctionne.

CTA Background Gradient 3CTA Background Gradient 3CTA Background Mobile