Passer au contenu principal
OpenAI

13 août 2026

IA appliquée

Le guide du développeur pour GPT‑5.6

Enseignements techniques de startups en production

Chargement...

GPT‑5.6 établit une nouvelle référence en matière de rapport qualité-prix

La famille de modèles GPT‑5.6 rend les performances d’agents de pointe nettement plus abordables, tout en repoussant les limites du possible.

Dans ce guide, nous montrons comment les startups s’appuient sur une sélection plus intelligente des modèles et sur de nouvelles commandes d’API facilitant la continuité du raisonnement, l’orchestration multi-agents et l’appel programmatique d’outils pour créer plus rapidement des agents plus performants, à une fraction du coût.

Une meilleure expérience prête à l’emploi

Depuis GPT‑5, chaque génération de modèles cherche à traiter des tâches à plus long terme avec moins de tokens. GPT‑5.6 poursuit sur cette lancée : de meilleures performances des agents et des coûts réduits, avec un minimum de modifications du harnais sous-jacent.

Les gains globaux de rentabilité sont renforcés par une précision accrue avec un effort de raisonnement moindre. Par exemple, dans Agents’ Last Exam, GPT‑5.6 Sol avec un raisonnement « faible » a surpassé GPT‑5.5 avec un raisonnement « élevé », à harnais constant. Nous avons observé des réussites similaires lors de tests en production, où des startups signalent d’importantes économies sur divers workflows après avoir réduit l’effort de raisonnement par rapport aux valeurs par défaut précédentes.

Nous avons intégré GPT‑5.6 à notre harnais, et un faible effort de raisonnement nous a donné nos meilleurs résultats. Il savait reconnaître l’absence de données, ne suivait pas de fausses pistes et trouvait la bonne réponse avec moins de tokens.
— Izzy Miller, responsable de la recherche en IA, Hex(ouverture dans une nouvelle fenêtre)

Sélection du modèle

Historiquement, passer à un modèle phare avec le niveau de raisonnement le plus élevé disponible constituait la meilleure option pour les cas d’usage à long terme. Cela tenait en grande partie au fait que ces modèles géraient les contextes longs et l’appel d’outils bien mieux que les modèles optimisés pour les coûts. La famille 5.6 change la donne : avec davantage de calcul au moment du test, Luna et Terra offrent souvent des performances comparables à GPT‑5.4 et 5.5, pour un coût nettement inférieur.

1 sur 3
Luna conserve 98 % de la précision d’extraction de GPT‑5.5 pour un coût dix-huit fois inférieur. Nos agents bénéficient ainsi d’une compréhension de haute qualité des documents, à un prix qui permet de l’utiliser dans bien plus de workflows.
— Serhii Shchoholiev, responsable de l’ingénierie des agents, Hypha(ouverture dans une nouvelle fenêtre)

Prenons les tâches de BrowseComp, un benchmark fondé sur la recherche qui évalue la capacité d’un modèle à trouver des faits difficiles à dénicher. Il y a trois mois, GPT‑5.5 (Très élevé) obtenait 84,36 % à ce benchmark, pour un coût total de 33,27 $. À son lancement, GPT‑5.6 Luna (Très élevé) offre pratiquement les mêmes performances, avec un score de 84,04 % pour un coût de 1,33 $. Depuis, nous avons encore réduit les prix. En savoir plus sur nos dernières baisses de prix.

Les modèles plus petits de la famille 5.6 sont particulièrement adaptés aux charges de travail à volume élevé, aux interactions sensibles à la latence et aux étapes répétées des workflows agentiques. Par exemple, si votre startup de technologie juridique analyse des notes manuscrites avant une analyse agentique, vous pouvez désormais utiliser Terra ou Luna pour l’extraction plutôt qu’un modèle de pointe pour l’ensemble du cas d’usage, et ainsi réaliser d’importantes économies.

Faire évoluer l’API Responses pour concevoir des agents plus efficaces

En plus d’améliorer les performances prêtes à l’emploi de GPT‑5.6, nous avons ajouté de nouvelles primitives à l’API Responses afin de permettre des gains supplémentaires. Nous avons entraîné GPT‑5.6 de bout en bout avec trois interventions architecturales complémentaires permettant aux agents de fonctionner plus efficacement :

  1. Réutiliser le travail déjà effectué : en permettant de conserver le raisonnement(ouverture dans une nouvelle fenêtre) entre les tours du modèle et en utilisant le compactage natif(ouverture dans une nouvelle fenêtre) pour compresser les longues conversations, le modèle peut préserver la cohérence de son travail sur des tâches à plus long terme sans se perdre ni devoir reconstruire le contexte précédent.
  2. Décomposer en parallèle lorsque cela convient : l’orchestration multi-agents native(ouverture dans une nouvelle fenêtre) permet de coordonner plusieurs agents dans des flux de travail parallèles afin d’accomplir plus vite les tâches complexes.
  3. Transférer le travail déterministe dans le code : utiliser l’appel programmatique d’outils(ouverture dans une nouvelle fenêtre) pour filtrer, agréger et orchestrer les sorties des outils hors de la fenêtre de contexte du modèle permet de réserver les tokens du modèle au jugement et de réduire les coûts, la latence et la dégradation du contexte.

Utilisés ensemble, ces éléments peuvent faire une différence spectaculaire. Par exemple, sur ARC-AGI-3, GPT‑5.6 Sol a obtenu 13,3 % avec le harnais standard. Après activation de la conservation du raisonnement et du compactage, le score a toutefois bondi à 38,3 %, avec environ six fois moins de tokens de sortie. Aucune modification du modèle, mais des performances presque triplées. Vous pouvez en savoir plus dans notre étude du harnais ARC-AGI-3.

Appel programmatique d’outils

Les workflows agentiques impliquent souvent deux types de travail :

  1. Les tâches qui exigent du jugement
  2. Le travail qui consiste principalement à déplacer, filtrer et combiner des données

Lorsqu’un agent récupère 100 documents réglementaires, les filtre par date et identifie les transactions pertinentes, le modèle ne devrait pas avoir à raisonner sur chaque résultat intermédiaire dans sa fenêtre de contexte. L’appel programmatique d’outils permet à GPT‑5.6 d’écrire du JavaScript pour orchestrer les outils, exécuter des appels indépendants en parallèle et traiter leurs sorties hors de la fenêtre de contexte. Le modèle peut ainsi se concentrer sur ce qui exige de l’intelligence : exercer son jugement.

En recherche financière, le plus difficile est d’extraire les documents réglementaires de façon fiable, de coordonner les outils et d’analyser les chiffres. Lors de nos évaluations, GPT‑5.6 avec l’appel programmatique d’outils a atteint le niveau de qualité de notre grille tout en utilisant 21 % de tokens d’entrée en moins. C’est ce qui distingue un agent capable de parler de recherche financière d’un agent capable de la mener réellement.
— Alex Wang, IA appliquée, Rogo(ouverture dans une nouvelle fenêtre)

Multi-agents

Pour les tâches complexes et parallélisables, répartir les actions et le raisonnement entre plusieurs flux de travail d’agents permet d’accomplir les tâches plus vite et avec davantage d’intelligence. Dans ces configurations, l’agent principal est chargé d’orchestrer les sous-agents et de leur déléguer des tâches. Les sous-agents poursuivent leurs objectifs en parallèle, puis transmettent leurs résultats à l’agent principal pour la synthèse finale. Les équipes peuvent commencer à exploiter nativement le mode multi-agents en activant le mode multi-agents(ouverture dans une nouvelle fenêtre) dans l’API Responses. C’est également ainsi que fonctionne le réglage de capacité Ultra dans ChatGPT.

1 sur 2
Qualia mobilise des équipes d’agents sur des problèmes de recherche ouverts, et GPT‑5.6 Sol a tout de suite fait ses preuves. Il a nettement surpassé GPT‑5.5, terminé plus vite que presque tous les autres modèles testés et s’est rapidement imposé comme notre modèle OpenAI de référence.
— E Chi, fondateur, Quadrillion(ouverture dans une nouvelle fenêtre)

Bien que GPT‑5.6 sache bien déterminer le nombre approprié de sous-agents et quand les créer, le comportement multi-agents reste très facile à orienter. Indiquer au modèle quand solliciter des sous-agents peut augmenter la probabilité qu’il ne crée des agents que lorsque la dépense supplémentaire de tokens améliore les performances.

Mise en cache des prompts

Pour toute la famille de modèles, la durée de vie du cache de prompts a été portée à au moins 30 minutes, et des points de rupture du cache peuvent désormais être définis de manière déterministe dans la fenêtre de contexte d’un modèle. Les startups ont ainsi pu améliorer considérablement leur taux de succès du cache.

Nous avons ajouté des points de rupture du cache et des clés propres à chaque espace de travail à un prompt partagé de 29 000 tokens, réduisant de 28 % les entrées non mises en cache. La fenêtre de cache de 30 minutes a également changé la donne : nos agents pouvaient réutiliser le même contexte d’une exécution à l’autre au lieu de repartir de zéro.
— Lorenzo Gentile, ingénieur en IA, Ploy(ouverture dans une nouvelle fenêtre)

Outre la définition de points de rupture du cache, continuer à utiliser une prompt_cache_key(ouverture dans une nouvelle fenêtre) appropriée augmente la probabilité que les requêtes soient dirigées vers le même moteur d’inférence que celui ayant déjà traité le même préfixe, ce qui réduit la latence.

Conclusion

Ce qui ressort de tous ces exemples, c’est à quel point l’économie de la création d’agents a évolué.

Les cas d’usage qui exigeaient autrefois un modèle de pointe à chaque étape peuvent désormais obtenir des résultats comparables ou meilleurs pour une fraction du coût, grâce à des modèles plus petits, au réglage de l’effort de raisonnement et à des choix architecturaux efficaces.

Nous avons hâte de découvrir ce que vous allez créer !

  • 2026
  • Plateforme API

À propos des auteurs

Ce guide a été élaboré par Samarth Madduru(ouverture dans une nouvelle fenêtre), Prashant Mital(ouverture dans une nouvelle fenêtre), Dave Leo(ouverture dans une nouvelle fenêtre) et Julien Reiman(ouverture dans une nouvelle fenêtre), à partir de leur expérience aux côtés de startups développant avec GPT‑5.6, des premiers tests jusqu’à la production.