Guide des modèles de la famille GPT‑6
Des conseils pratiques pour tirer le meilleur des modèles GPT‑6 tout en maîtrisant les délais et les coûts
GPT‑6 est notre suite de modèles la plus avancée à ce jour et propose un choix de modèles adaptés à différents travaux.
Que vous transformiez une idée en prototype fonctionnel, développiez et testiez une fonctionnalité ou orchestriez des workflows en plusieurs étapes entre dépôts de code, bases de données et API externes, ce guide explique comment choisir un modèle GPT‑6, lui donner des instructions efficaces, gérer les tâches de longue durée et préparer la mise en production.

Optimisez l’exécution en production. Utilisez la mise en cache(ouverture dans une nouvelle fenêtre) et le compactage(ouverture dans une nouvelle fenêtre) pour gérer le contexte et les coûts. Mesurez la réussite des tâches et la latence, et prévoyez la surveillance et les contrôles des données.
Adaptez le modèle à votre charge de travail. Équilibrez capacités, coût et latence en choisissant le modèle, l’effort de raisonnement(ouverture dans une nouvelle fenêtre) et la vitesse adaptés à la tâche.
Ajustez vos prompts et vos compétences. Veillez à la cohérence des prompts, compétences et instructions du dépôt quant aux livrables attendus, à l’autonomie du modèle et aux critères d’achèvement.
Gardez le cap sur les tâches de longue durée. Utilisez le pilotage(ouverture dans une nouvelle fenêtre), les outils asynchrones(ouverture dans une nouvelle fenêtre) et la délégation(ouverture dans une nouvelle fenêtre) pour gérer les mises à jour et les tâches indépendantes. Définissez clairement quand le modèle doit vous consulter.
Avant le déploiement, mettez en place plusieurs vérifications et bonnes pratiques.
Gardez l’efficacité à l’esprit. (ouverture dans une nouvelle fenêtre)Supprimez le contexte inutile à la tâche(ouverture dans une nouvelle fenêtre) tout en conservant les éléments de preuve nécessaires. Si votre application le permet, exécutez les tâches indépendantes en parallèle(ouverture dans une nouvelle fenêtre) pour qu’une étape lente ne bloque pas les autres travaux.
Réutilisez le contexte commun grâce à la mise en cache des prompts(ouverture dans une nouvelle fenêtre) pour les tâches récurrentes. Les tokens d’entrée en cache coûtent jusqu’à 95 % de moins(ouverture dans une nouvelle fenêtre) que ceux hors cache, selon le modèle. Placez les instructions stables et les références avant les détails variables de la tâche, et gardez des définitions d’outils cohérentes. Le tableau de bord du cache(ouverture dans une nouvelle fenêtre) et le guide de diagnostic(ouverture dans une nouvelle fenêtre) vous aident à repérer où cette réutilisation échoue. Incluez les écritures en cache et les éventuels tarifs des longs contextes dans l’estimation du coût d’un workflow complet.
Pour les longues conversations, le compactage(ouverture dans une nouvelle fenêtre) réduit la taille du contexte tout en conservant l’état nécessaire pour poursuivre.
Déterminez comment surveiller le comportement(ouverture dans une nouvelle fenêtre) et examinez les contrôles des données(ouverture dans une nouvelle fenêtre) de votre application.
Testez avant de déployer : exécutez des tâches représentatives et mesurez leur réussite, la latence et le coût par tâche réussie. Consultez notre liste de vérification pour le déploiement de l’API(ouverture dans une nouvelle fenêtre).
Considérez le choix du modèle et du niveau de raisonnement comme un compromis entre intelligence et prix.
Modèle :
GPT‑6 Astra(ouverture dans une nouvelle fenêtre) pour les tâches de raisonnement les plus difficiles, qui exigent une intelligence maximale.
GPT‑6.1 Sol(ouverture dans une nouvelle fenêtre) pour les tâches complexes de programmation, de recherche et d’utilisation de l’ordinateur.
GPT‑6 Luna(ouverture dans une nouvelle fenêtre) pour les tâches ciblées à grande échelle et les tâches quotidiennes répétitives à objectif clair : extraire les champs de factures, classer des demandes ou produire des résumés structurés.
Pour choisir le meilleur modèle pour la tâche, comparez les tarifs(ouverture dans une nouvelle fenêtre) de chaque modèle.
Niveau de raisonnement : dans l’API, choisissez l’effort que le modèle consacre à la tâche.
Faible : tâches courantes, comme extraire des faits ou effectuer de petites modifications.
Moyen : tâches exigeant du discernement, comme planifier une fonctionnalité ou comparer des options.
Élevé : débogage difficile, analyse approfondie ou examen minutieux.
Très élevé / Max : à tester si disponible lorsque le niveau Élevé ne suffit pas, et à conserver uniquement si le gain justifie le temps et le coût supplémentaires.
Dans l’API, vous pouvez modifier l’effort de raisonnement en cours de conversation(ouverture dans une nouvelle fenêtre) sans invalider le cache.
Dans Codex, commencez par le niveau de raisonnement par défaut du modèle, puis réduisez-le pour les tâches simples ou augmentez-le pour une analyse approfondie.
Vitesse :
Dans l’API, utilisez le mode Rapide(ouverture dans une nouvelle fenêtre) lorsque le temps de réponse compte, par exemple dans les applications de chat ou les outils de programmation. Il offre des temps de réponse plus courts et plus réguliers, à un coût par token supérieur au traitement Standard.
Dans Codex et l’API, utilisez le mode Ultrarapide(ouverture dans une nouvelle fenêtre) si des réponses plus rapides justifient le surcoût, par exemple pour des itérations de code rapides. Il accélère la génération de tokens indépendamment de l’effort de raisonnement. Disponible pour GPT‑6 Astra(ouverture dans une nouvelle fenêtre).

Commencez par une mission claire : résultat souhaité, public visé, contexte et contraintes pertinents, et critères d’achèvement. Examinez ensuite ces quatre points, résumés de l’article Repenser les compétences et les prompts pour GPT‑6 Astra(ouverture dans une nouvelle fenêtre), pour approfondir la mise à jour de vos instructions :
Créez de meilleures compétences : décrivez brièvement et explicitement quand chacune doit s’exécuter, ne chargez les détails complémentaires qu’au besoin et remplacez les recettes rigides par des consignes adaptées aux modèles de votre équipe.
Mettez à jour votre fichier AGENTS.md : expliquez quand certains documents et tests sont pertinents et autorisez explicitement les workflows courants sûrs, comme les tests locaux sur des données jetables, sans accès à la production.
Fixez les limites décisionnelles : précisez quelles actions sont autonomes et lesquelles exigent une approbation. Remplacez les règles générales du type « toujours demander » par des limites claires.
Précisez jusqu’où persévérer : définissez ce que signifie « terminé » — implémenter la modification, l’exécuter, examiner le résultat et corriger les échecs — et identifiez les décisions qui exigent votre avis.
Pour plus de conseils, consultez les bonnes pratiques de raisonnement(ouverture dans une nouvelle fenêtre).
Que vous travailliez dans Codex ou développiez avec l’API, précisez les décisions que le modèle peut prendre, les cas où il doit vous consulter et ce qui constitue une réponse utile.
Donnez au modèle assez d’indications pour avancer sans devoir deviner les décisions importantes. (ouverture dans une nouvelle fenêtre)Indiquez-lui les choix qu’il peut faire et quand vous consulter(ouverture dans une nouvelle fenêtre) : il peut, par exemple, choisir comment organiser un résumé, mais doit vous demander confirmation avant de modifier le périmètre du projet. (ouverture dans une nouvelle fenêtre)Décrivez ce qui constitue une réponse utile(ouverture dans une nouvelle fenêtre) : par exemple, un langage clair, des détails techniques adaptés au public et un bref compte rendu des modifications, des vérifications et des points restant à traiter.
Avec la famille de modèles GPT‑6, vous pouvez désormais réaliser des tâches qui s’étendent sur plusieurs heures ou jours. Utilisez les fonctionnalités suivantes pour mieux gérer les agents sur les tâches de longue durée.
Dans l’API, utilisez le pilotage, les outils asynchrones et le travail en parallèle pour faire avancer les tâches de longue durée.
Mettez à jour les instructions pendant l’exécution : le pilotage en cours de tour(ouverture dans une nouvelle fenêtre) vous permet d’envoyer une correction via l’API WebSocket Responses(ouverture dans une nouvelle fenêtre) pendant que le modèle travaille. Les mises à jour sont mises en file d’attente ; elles n’annulent ni les outils en cours d’exécution ni les actions déjà réalisées.
Poursuivez le travail pendant l’exécution d’un outil : l’appel asynchrone d’outils(ouverture dans une nouvelle fenêtre) permet au modèle de continuer des travaux indépendants pendant que votre application exécute une tâche plus lente, comme des tests. Votre application renvoie le résultat dès qu’il est prêt. Attendez ce résultat avant de commencer les travaux qui en dépendent.
Déléguez les sous-tâches indépendantes : GPT‑6.1 Sol prend en charge les workflows multi-agents dans l’API Responses(ouverture dans une nouvelle fenêtre). Il peut confier des travaux indépendants à des sous-agents, comme l’examen de différentes parties d’une base de code, puis regrouper leurs conclusions dans une réponse finale. La fonctionnalité multi-agent est actuellement en bêta.
Les tâches de longue durée peuvent faire émerger des décisions que vous n’auriez pas forcément anticipées dans le prompt initial. Utilisez les clarifications et le pilotage pour garder le cap.
Répondez aux questions au fil du travail : avec GPT‑6 Astra, Codex peut demander des précisions pendant qu’il travaille(ouverture dans une nouvelle fenêtre). Tranchez les questions qui influencent l’étape suivante et précisez quels travaux indépendants peuvent continuer pendant votre réflexion. Si vous devez vous absenter, indiquez à Codex quelles tâches peuvent continuer et quand il doit s’interrompre pour attendre votre réponse.
Réorientez le travail lorsque les exigences changent : Pilotez la tâche en cours(ouverture dans une nouvelle fenêtre) avec de nouvelles informations, en expliquant ce qui doit changer et ce qui doit rester identique. Vous éviterez ainsi de consacrer davantage de temps à une approche qui ne répond plus à vos besoins.

L’utilisation de l’ordinateur(ouverture dans une nouvelle fenêtre) permet à GPT‑6 Astra, GPT‑6.1 Sol et GPT‑6 Luna d’interagir directement avec des sites web et des applications de bureau, même sans API. Vous pouvez, par exemple, demander au modèle d’analyser un bug, de corriger le code et d’ouvrir votre produit dans un navigateur pour vérifier que la correction fonctionne.
Choisissez la méthode fiable la plus simple pour chaque étape :
Utilisez une API ou un outil connecté lorsqu’ils peuvent accomplir la tâche directement.
Recourez à l’utilisation de l’ordinateur lorsque le modèle doit lire un écran, cliquer sur des boutons ou remplir un formulaire pour vous.
Si vous intégrez l’utilisation de l’ordinateur à votre application, fournissez au modèle un outil capable d’exécuter du code pour contrôler un navigateur ou un bureau. Playwright fonctionne avec les navigateurs(ouverture dans une nouvelle fenêtre) ; PyAutoGUI, avec les applications de bureau.



