Guide des modèles de la famille GPT‑6
Conseils pratiques pour tirer le meilleur parti des modèles GPT‑6 tout en gérant le temps et les coûts
GPT‑6 est notre gamme de modèles la plus avancée à ce jour et offre un choix de modèles pour différents types de travail.
Que vous transformiez une idée en prototype fonctionnel, développiez et testiez une fonctionnalité ou orchestriez des flux de travail à plusieurs étapes entre dépôts de code, bases de données et API externes, ce guide explique comment choisir un modèle GPT‑6, lui donner des instructions efficaces, gérer le travail de longue durée et préparer la mise en production.

Assurez un fonctionnement efficace en production. Utilisez la mise en cache(s'ouvre dans une nouvelle fenêtre) et le compactage(s'ouvre dans une nouvelle fenêtre) pour gérer le contexte et les coûts. Mesurez la réussite des tâches et la latence, et prévoyez la surveillance et les contrôles des données.
Adaptez le modèle à votre charge de travail. Équilibrez capacités, coût et latence en choisissant le modèle, l’effort de raisonnement(s'ouvre dans une nouvelle fenêtre) et la vitesse adaptés à la tâche.
Ajustez vos invites et vos compétences. Veillez à la cohérence des invites, des compétences et des instructions du dépôt quant aux livrables attendus, à l’autonomie du modèle et aux critères d’achèvement.
Gardez le cap sur le travail de longue durée. Utilisez le pilotage(s'ouvre dans une nouvelle fenêtre), les outils asynchrones(s'ouvre dans une nouvelle fenêtre) et la délégation(s'ouvre dans une nouvelle fenêtre) pour gérer les mises à jour et le travail indépendant. Définissez clairement quand le modèle doit vous consulter.
Avant le déploiement, mettez en place plusieurs vérifications et bonnes pratiques.
Gardez l’efficacité à l’esprit. (s'ouvre dans une nouvelle fenêtre)Retirez le contexte inutile à la tâche(s'ouvre dans une nouvelle fenêtre) tout en conservant les éléments probants nécessaires. Si votre application le permet, exécutez les tâches indépendantes en parallèle(s'ouvre dans une nouvelle fenêtre) pour qu’une étape lente ne bloque pas le travail sans lien avec elle.
Réutilisez le contexte partagé grâce à la mise en cache des invites(s'ouvre dans une nouvelle fenêtre) pour les tâches récurrentes. Selon le modèle, les tokens d’entrée en cache coûtent jusqu’à 95 % de moins(s'ouvre dans une nouvelle fenêtre) que ceux qui ne le sont pas. Placez les instructions stables et les références avant les détails variables de la tâche, et gardez les définitions des outils cohérentes. Le tableau de bord de mise en cache(s'ouvre dans une nouvelle fenêtre) et le guide de diagnostic(s'ouvre dans une nouvelle fenêtre) vous aident à repérer où cette réutilisation échoue. Incluez les écritures en cache et les tarifs de contexte long dans l’estimation du coût d’un flux de travail complet.
Pour les longues conversations, le compactage(s'ouvre dans une nouvelle fenêtre) réduit la taille du contexte tout en préservant l’état nécessaire pour poursuivre.
Décidez comment vous allez surveiller le comportement(s'ouvre dans une nouvelle fenêtre) et examinez les contrôles des données(s'ouvre dans une nouvelle fenêtre) de votre application.
Testez avant le déploiement : exécutez des tâches représentatives et mesurez leur réussite, la latence et le coût par tâche réussie. Consultez notre liste de vérification du déploiement de l’API(s'ouvre dans une nouvelle fenêtre).
Considérez le choix du modèle et du niveau de raisonnement comme un compromis entre intelligence et prix.
Modèle :
GPT‑6 Astra(s'ouvre dans une nouvelle fenêtre) pour le raisonnement le plus exigeant, nécessitant une intelligence maximale.
GPT‑6.1 Sol(s'ouvre dans une nouvelle fenêtre) pour la programmation complexe, la recherche et l’utilisation de l’ordinateur.
GPT‑6 Luna(s'ouvre dans une nouvelle fenêtre) pour les tâches ciblées à grande échelle et le travail quotidien répétitif à objectif clair, comme extraire les champs de factures, classer des demandes ou produire des résumés structurés.
Pour choisir le meilleur modèle pour la tâche, comparez les tarifs(s'ouvre dans une nouvelle fenêtre) de chaque modèle.
Niveau de raisonnement : Dans l’API, choisissez l’effort que le modèle consacre à la tâche.
Faible : tâches courantes, comme extraire des faits ou faire de petites modifications.
Moyen : travail exigeant du jugement, comme planifier une fonctionnalité ou comparer des options.
Élevé : débogage difficile, analyse approfondie ou examen minutieux.
Très élevé / Max : à tester si disponible lorsque le niveau Élevé ne suffit pas, et à conserver seulement si le gain justifie le temps et le coût supplémentaires.
Dans l’API, vous pouvez modifier l’effort de raisonnement en cours de conversation(s'ouvre dans une nouvelle fenêtre) sans invalider le cache.
Dans Codex, commencez par le niveau de raisonnement par défaut du modèle, puis réduisez-le pour les tâches simples ou augmentez-le pour une analyse approfondie.
Vitesse :
Dans l’API, utilisez le Mode rapide(s'ouvre dans une nouvelle fenêtre) lorsque le temps de réponse compte, comme dans les applications de clavardage ou les outils de programmation. Il offre des temps de réponse plus courts et plus constants, à un coût par token supérieur au traitement Standard.
Dans Codex et l’API, utilisez le mode Ultrarapide(s'ouvre dans une nouvelle fenêtre) lorsque des réponses plus rapides valent le supplément, comme pour des itérations rapides de programmation. Il accélère la génération de tokens indépendamment de l’effort de raisonnement. Disponible pour GPT‑6 Astra(s'ouvre dans une nouvelle fenêtre).

Commencez par un mandat clair : le résultat souhaité, son destinataire, le contexte et les contraintes pertinents, et les critères d’achèvement. Examinez ensuite ces quatre axes, résumés de l’article Repenser les compétences et les invites pour GPT‑6 Astra(s'ouvre dans une nouvelle fenêtre), pour approfondir la mise à jour de vos instructions :
Créez de meilleures compétences : Décrivez brièvement et clairement quand exécuter chacune, chargez les détails complémentaires au besoin seulement et remplacez les recettes rigides par des conseils adaptés aux modèles de votre équipe.
Mettez à jour votre AGENTS.md : Expliquez quand certains documents et tests sont pertinents, et autorisez explicitement les flux de travail courants sûrs, comme les tests locaux avec des données jetables, sans accès à la production.
Définissez les limites décisionnelles : Précisez les actions autonomes et celles exigeant une approbation, en remplaçant les règles générales comme « toujours demander » par des limites claires.
Précisez jusqu’où persévérer : Définissez ce que signifie « terminé » : mettre en œuvre le changement, l’exécuter, inspecter le résultat et corriger les échecs. Précisez aussi les décisions qui exigent votre examen.
Pour en savoir plus, consultez les bonnes pratiques de raisonnement(s'ouvre dans une nouvelle fenêtre).
Que vous travailliez dans Codex ou développiez avec l’API, précisez les décisions que le modèle peut prendre, les moments où il doit vous consulter et ce qui constitue une réponse utile.
Donnez au modèle assez de directives pour faire avancer le travail sans avoir à deviner les décisions importantes. (s'ouvre dans une nouvelle fenêtre)Indiquez-lui les choix qu’il peut faire et quand vous consulter(s'ouvre dans une nouvelle fenêtre). Par exemple, il peut choisir comment organiser un résumé, mais doit vous consulter avant de modifier la portée du projet. (s'ouvre dans une nouvelle fenêtre)Décrivez ce qui constitue une réponse utile(s'ouvre dans une nouvelle fenêtre) : par exemple, un langage clair, des détails techniques adaptés au public et un bref compte rendu des changements, des vérifications et des points à régler.
Avec la famille de modèles GPT‑6, vous pouvez maintenant entreprendre des tâches qui s’étendent sur des heures ou des jours. Utilisez les fonctionnalités suivantes pour mieux gérer les agents qui exécutent des tâches de longue durée.
Dans l’API, utilisez le pilotage, les outils asynchrones et le travail en parallèle pour faire avancer les tâches de longue durée.
Mettez à jour les instructions en cours d’exécution : Le pilotage en cours de tour(s'ouvre dans une nouvelle fenêtre) permet d’envoyer une correction par l’API WebSocket Responses(s'ouvre dans une nouvelle fenêtre) pendant que le modèle travaille. Les mises à jour sont placées en file d’attente; elles n’annulent ni les outils en cours d’exécution ni les actions terminées.
Poursuivez le travail pendant l’exécution d’un outil : L’appel d’outils asynchrones(s'ouvre dans une nouvelle fenêtre) permet au modèle de poursuivre le travail indépendant pendant que votre application exécute une tâche plus lente, comme des tests. Votre application renvoie le résultat dès qu’il est prêt. Attendez ce résultat avant de commencer le travail qui en dépend.
Déléguez les sous-tâches indépendantes : GPT‑6.1 Sol prend en charge les flux de travail multiagents dans l’API Responses(s'ouvre dans une nouvelle fenêtre). Il peut confier du travail indépendant à des sous-agents, comme examiner différentes parties d’une base de code, et combiner leurs constats en une réponse finale. La fonctionnalité multiagent est actuellement en version bêta.
Les tâches de longue durée peuvent révéler des décisions que vous n’auriez pas forcément prévues dans l’invite initiale. Utilisez les clarifications et le pilotage pour garder le cap.
Répondez aux questions à mesure que le travail avance : Avec GPT‑6 Astra, Codex peut demander des précisions pendant qu’il travaille(s'ouvre dans une nouvelle fenêtre). Réglez les questions qui influent sur la prochaine étape et précisez le travail indépendant qui peut continuer pendant votre réflexion. Si vous devez vous absenter, indiquez à Codex les tâches qui peuvent continuer et quand il doit s’arrêter pour attendre votre réponse.
Réorientez le travail lorsque les exigences changent : Pilotez la tâche en cours(s'ouvre dans une nouvelle fenêtre) avec de nouveaux renseignements, en expliquant ce qui doit changer et ce qui doit rester identique. Vous éviterez ainsi de consacrer plus de temps à une approche qui ne répond plus à vos besoins.

L’utilisation de l’ordinateur(s'ouvre dans une nouvelle fenêtre) permet à GPT‑6 Astra, GPT‑6.1 Sol et GPT‑6 Luna d’interagir directement avec des sites Web et des applications de bureau, même sans API. Par exemple, vous pouvez demander au modèle d’examiner un bogue, de corriger le code et d’ouvrir votre produit dans un navigateur pour vérifier que la correction fonctionne.
Choisissez la méthode fiable la plus simple pour chaque étape :
Utilisez une API ou un outil connecté lorsqu’il peut accomplir la tâche directement.
Recourez à l’utilisation de l’ordinateur lorsque le modèle doit lire un écran, cliquer sur des boutons ou remplir un formulaire pour vous.
Si vous intégrez l’utilisation de l’ordinateur à votre application, fournissez au modèle un outil capable d’exécuter du code pour contrôler un navigateur ou un environnement de bureau. Playwright fonctionne avec les navigateurs(s'ouvre dans une nouvelle fenêtre); PyAutoGUI fonctionne avec les applications de bureau.



