Le guide du développeur pour GPT‑5.6
Enseignements techniques de startups en production
La famille de modèles GPT‑5.6 rend les performances d’agents de pointe nettement plus abordables, tout en repoussant les limites du possible.
Dans ce guide, nous montrons comment les startups s’appuient sur une sélection plus intelligente des modèles et sur de nouvelles commandes d’API facilitant la continuité du raisonnement, l’orchestration multi-agents et l’appel programmatique d’outils pour créer plus rapidement des agents plus performants, à une fraction du coût.
Depuis GPT‑5, chaque génération de modèles cherche à traiter des tâches à plus long terme avec moins de tokens. GPT‑5.6 poursuit sur cette lancée : de meilleures performances des agents et des coûts réduits, avec un minimum de modifications du harnais sous-jacent.
Les gains globaux de rentabilité sont renforcés par une précision accrue avec un effort de raisonnement moindre. Par exemple, dans Agents’ Last Exam, GPT‑5.6 Sol avec un raisonnement « faible » a surpassé GPT‑5.5 avec un raisonnement « élevé », à harnais constant. Nous avons observé des réussites similaires lors de tests en production, où des startups signalent d’importantes économies sur divers workflows après avoir réduit l’effort de raisonnement par rapport aux valeurs par défaut précédentes.
Historiquement, passer à un modèle phare avec le niveau de raisonnement le plus élevé disponible constituait la meilleure option pour les cas d’usage à long terme. Cela tenait en grande partie au fait que ces modèles géraient les contextes longs et l’appel d’outils bien mieux que les modèles optimisés pour les coûts. La famille 5.6 change la donne : avec davantage de calcul au moment du test, Luna et Terra offrent souvent des performances comparables à GPT‑5.4 et 5.5, pour un coût nettement inférieur.
Prenons les tâches de BrowseComp, un benchmark fondé sur la recherche qui évalue la capacité d’un modèle à trouver des faits difficiles à dénicher. Il y a trois mois, GPT‑5.5 (Très élevé) obtenait 84,36 % à ce benchmark, pour un coût total de 33,27 $. À son lancement, GPT‑5.6 Luna (Très élevé) offre pratiquement les mêmes performances, avec un score de 84,04 % pour un coût de 1,33 $. Depuis, nous avons encore réduit les prix. En savoir plus sur nos dernières baisses de prix.
Les modèles plus petits de la famille 5.6 sont particulièrement adaptés aux charges de travail à volume élevé, aux interactions sensibles à la latence et aux étapes répétées des workflows agentiques. Par exemple, si votre startup de technologie juridique analyse des notes manuscrites avant une analyse agentique, vous pouvez désormais utiliser Terra ou Luna pour l’extraction plutôt qu’un modèle de pointe pour l’ensemble du cas d’usage, et ainsi réaliser d’importantes économies.
En plus d’améliorer les performances prêtes à l’emploi de GPT‑5.6, nous avons ajouté de nouvelles primitives à l’API Responses afin de permettre des gains supplémentaires. Nous avons entraîné GPT‑5.6 de bout en bout avec trois interventions architecturales complémentaires permettant aux agents de fonctionner plus efficacement :
- Réutiliser le travail déjà effectué : en permettant de conserver le raisonnement(ouverture dans une nouvelle fenêtre) entre les tours du modèle et en utilisant le compactage natif(ouverture dans une nouvelle fenêtre) pour compresser les longues conversations, le modèle peut préserver la cohérence de son travail sur des tâches à plus long terme sans se perdre ni devoir reconstruire le contexte précédent.
- Décomposer en parallèle lorsque cela convient : l’orchestration multi-agents native(ouverture dans une nouvelle fenêtre) permet de coordonner plusieurs agents dans des flux de travail parallèles afin d’accomplir plus vite les tâches complexes.
- Transférer le travail déterministe dans le code : utiliser l’appel programmatique d’outils(ouverture dans une nouvelle fenêtre) pour filtrer, agréger et orchestrer les sorties des outils hors de la fenêtre de contexte du modèle permet de réserver les tokens du modèle au jugement et de réduire les coûts, la latence et la dégradation du contexte.
Utilisés ensemble, ces éléments peuvent faire une différence spectaculaire. Par exemple, sur ARC-AGI-3, GPT‑5.6 Sol a obtenu 13,3 % avec le harnais standard. Après activation de la conservation du raisonnement et du compactage, le score a toutefois bondi à 38,3 %, avec environ six fois moins de tokens de sortie. Aucune modification du modèle, mais des performances presque triplées. Vous pouvez en savoir plus dans notre étude du harnais ARC-AGI-3.
Les workflows agentiques impliquent souvent deux types de travail :
- Les tâches qui exigent du jugement
- Le travail qui consiste principalement à déplacer, filtrer et combiner des données
Lorsqu’un agent récupère 100 documents réglementaires, les filtre par date et identifie les transactions pertinentes, le modèle ne devrait pas avoir à raisonner sur chaque résultat intermédiaire dans sa fenêtre de contexte. L’appel programmatique d’outils permet à GPT‑5.6 d’écrire du JavaScript pour orchestrer les outils, exécuter des appels indépendants en parallèle et traiter leurs sorties hors de la fenêtre de contexte. Le modèle peut ainsi se concentrer sur ce qui exige de l’intelligence : exercer son jugement.
Pour les tâches complexes et parallélisables, répartir les actions et le raisonnement entre plusieurs flux de travail d’agents permet d’accomplir les tâches plus vite et avec davantage d’intelligence. Dans ces configurations, l’agent principal est chargé d’orchestrer les sous-agents et de leur déléguer des tâches. Les sous-agents poursuivent leurs objectifs en parallèle, puis transmettent leurs résultats à l’agent principal pour la synthèse finale. Les équipes peuvent commencer à exploiter nativement le mode multi-agents en activant le mode multi-agents(ouverture dans une nouvelle fenêtre) dans l’API Responses. C’est également ainsi que fonctionne le réglage de capacité Ultra dans ChatGPT.
“Qualia mobilise des équipes d’agents sur des problèmes de recherche ouverts, et GPT‑5.6 Sol a tout de suite fait ses preuves. Il a nettement surpassé GPT‑5.5, terminé plus vite que presque tous les autres modèles testés et s’est rapidement imposé comme notre modèle OpenAI de référence.”
“GPT‑5.6 est le meilleur orchestrateur que nous ayons vu chez OpenAI. Nous lui avons soumis six spécifications à la fois, en lui demandant de les rédiger, de les développer et de toutes les commenter, et il a tout suivi sans aucune dégradation de la qualité.”
Bien que GPT‑5.6 sache bien déterminer le nombre approprié de sous-agents et quand les créer, le comportement multi-agents reste très facile à orienter. Indiquer au modèle quand solliciter des sous-agents peut augmenter la probabilité qu’il ne crée des agents que lorsque la dépense supplémentaire de tokens améliore les performances.
Pour toute la famille de modèles, la durée de vie du cache de prompts a été portée à au moins 30 minutes, et des points de rupture du cache peuvent désormais être définis de manière déterministe dans la fenêtre de contexte d’un modèle. Les startups ont ainsi pu améliorer considérablement leur taux de succès du cache.
Outre la définition de points de rupture du cache, continuer à utiliser une prompt_cache_key(ouverture dans une nouvelle fenêtre) appropriée augmente la probabilité que les requêtes soient dirigées vers le même moteur d’inférence que celui ayant déjà traité le même préfixe, ce qui réduit la latence.
Ce qui ressort de tous ces exemples, c’est à quel point l’économie de la création d’agents a évolué.
Les cas d’usage qui exigeaient autrefois un modèle de pointe à chaque étape peuvent désormais obtenir des résultats comparables ou meilleurs pour une fraction du coût, grâce à des modèles plus petits, au réglage de l’effort de raisonnement et à des choix architecturaux efficaces.
Nous avons hâte de découvrir ce que vous allez créer !
- 2026
- Plateforme API
À propos des auteurs
Ce guide a été élaboré par Samarth Madduru(ouverture dans une nouvelle fenêtre), Prashant Mital(ouverture dans une nouvelle fenêtre), Dave Leo(ouverture dans une nouvelle fenêtre) et Julien Reiman(ouverture dans une nouvelle fenêtre), à partir de leur expérience aux côtés de startups développant avec GPT‑5.6, des premiers tests jusqu’à la production.


