Un tableau de bord pour l’ère de l’IA
La question que j’entends partout de la part des directions financières est simple : comment tirer plus de valeur de nos dépenses en IA?
Pendant des années, le marché a mesuré le succès des logiciels en fonction de leur adoption : licences achetées, utilisateurs actifs, licences renouvelées. Pour comprendre la valeur de l’IA, il faut adopter une mesure plus puissante : le travail accompli.
La question économique fondamentale pour les équipes financières et les autres dirigeants d’entreprise est de savoir si la valeur du travail accompli par l’IA croît plus vite que son coût de production.
Pour y répondre, il faut aller plus loin qu’une mesure comme le coût par token. Un modèle moins coûteux peut offrir des tokens moins chers, mais l'obtention d’excellents résultats peut demander plus d’essais, plus de temps ou plus de révision humaine. Un modèle plus performant peut avoir des tokens plus chers, mais accomplir la même tâche en une seule tentative. Ce qui compte, c’est le coût total nécessaire pour produire un résultat réussi, comparé à la valeur que ce résultat crée.
Le tableau de bord de référence pour l’ère de l’IA pourrait se résumer à « l’intelligence utile par dollar ». Cette mesure répond à quatre grandes questions :
- L’IA accomplit-elle un travail qui compte?
- Combien coûte chaque tâche réussie?
- Les gens peuvent-ils compter sur le résultat?
- Chaque dollar investi dans l'IA produit-il plus de valeur à mesure que l’utilisation augmente?
Commencez par le travail lui-même.
Combien de problèmes clients l’IA a-t-elle aidé à résoudre? Combien de modifications de code a-t-elle aidé à livrer? Combien de contrats a-t-elle examinés? Combien de temps a-t-elle redonné aux équipes? Combien de décisions ont été améliorées parce que le bon contexte était disponible au bon moment?
Les tokens créent de la valeur lorsqu’ils se transforment en travail utile pour les gens. À mesure que les modèles deviennent plus performants, ils peuvent prendre en charge des tâches plus longues et plus complexes : conserver le contexte, raisonner en plusieurs étapes, travailler avec divers outils et s’adapter en cours de route.
Le meilleur point de départ est un seul flux de travail. Définissez ce que signifie « terminé » et mesurez ce résultat dans le système où le travail est effectué.
Pour une équipe de soutien, « terminé » peut vouloir dire qu’un problème client est résolu. Pour une équipe d’ingénierie, cela peut être une modification de code qui réussit ses tests. Pour une équipe juridique, cela peut être un contrat examiné avec exactitude et dans les délais.
Prenons l’exemple d’une équipe des finances qui se prépare à une revue des prévisions. Une grande partie du travail s'effectue avant la décision finale : trouver les dernières prévisions, transférer les données dans Excel ou Sheets, repérer les changements, rapprocher les onglets, refaire les diapositives et vérifier que tout concorde parfaitement.
ChatGPT Work peut prendre en charge une grande partie de ce processus, ce qui donne à l’équipe plus de temps pour se concentrer sur les questions importantes : qu’est-ce qui a changé? Pourquoi? Que devrions-nous faire ensuite?
Voilà à quoi ressemble, en pratique, l’intelligence utile par dollar en pratique. Plus de travail est accompli, plus rapidement, tandis que les gens consacrent davantage de temps à exercer leur jugement, leur créativité et leur expertise.
La question suivante est de savoir ce qu’il en coûte pour bien accomplir ce travail.
Les tâches d’IA varient beaucoup. Une réponse rapide peut exiger peu de calcul. Un flux de travail de codage, de recherche ou de finances peut nécessiter un raisonnement plus approfondi, l’utilisation d’outils et de nombreuses actions. Ces tâches plus complexes peuvent demander plus de calcul, mais elles peuvent créer beaucoup plus de valeur.
Au niveau du modèle, le coût par tâche réussie dépend du prix, de la quantité de calcul utilisée et de la probabilité d’obtenir le bon résultat. Pour une entreprise, le coût complet comprend aussi le temps consacré par les employés, la révision humaine, les nouvelles tentatives et le travail à refaire.
Le calcul est simple :
- Additionnez le coût complet de l’exécution du travail.
- Comptez les tâches qui ont atteint le niveau de qualité requis.
- Divisez le coût complet par le nombre de tâches réussies.
C’est pourquoi le prix le plus bas par token ne donne pas toujours le coût le plus bas par résultat. Un modèle de pointe peut offrir la meilleure valeur, même pour une demande courante, s’il produit la bonne réponse en une seule tentative, réduisant les nouvelles tentatives, la latence, les révisions et la puissance de calcul totale nécessaire.
Une famille de modèles par niveaux donne aux clients plus de façons d’optimiser cette équation. GPT‑5.6, que nous avons lancé la semaine dernière, compte trois niveaux : Sol est notre modèle phare; Terra équilibre performance et coût; Luna est notre modèle le plus rapide et le plus abordable.
Ces niveaux offrent des points de départ utiles. L’économie de la tâche complète devrait déterminer le modèle le mieux adapté. Un client pourrait utiliser Luna pour un flux de travail rapide et à fort volume, Terra pour un travail exigeant plus de profondeur, ou Sol lorsqu’un raisonnement plus solide donne le meilleur résultat avec moins de tentatives.
Nous avons entraîné GPT‑5.6 pour tirer plus de travail utile de chaque token. Dans l’Artificial Analysis Coding Agent Index, GPT‑5.6 Sol, avec le raisonnement maximal, a établi un nouveau sommet de performance tout en utilisant 54 % moins de tokens de sortie qu’un autre modèle de premier plan. Le graphique ci-dessous illustre la comparaison.
DeepSWE v1.1 : Tâches d’ingénierie à long terme; GPT‑5.6 Sol atteint un nouveau record de 72,7 %, contre 69,9 % pour Claude Fable 5, pour un coût d’API estimé inférieur de 36,2 %.
Dans toute la famille GPT‑5.6, l’objectif est le même : plus de travail réussi par dollar. Une plus grande efficacité rend les tâches existantes plus abordables. Une capacité accrue rend possibles des types de travail entièrement nouveaux.
Chaque nouvelle génération de modèles devrait améliorer les deux côtés de cette équation. Les clients devraient pouvoir accomplir un travail plus précieux tandis que, en parallèle, le coût d’exécution de chaque tâche continue de diminuer.
La troisième mesure est la fiabilité.
L’adoption de l’IA tend à s’approfondir par étapes. D’abord, l’IA aide à rédiger. Ensuite, elle trouve le contexte et raisonne à travers les outils et les données. Avec le temps, elle commence à agir, à gérer les exceptions et à exécuter des flux de travail, tandis que les personnes apportent jugement et contrôle au besoin.
Chaque étape crée plus de valeur et exige davantage du système.
La fiabilité a une valeur économique directe. Lorsque les résultats sont exacts, bien sourcés, cohérents et transférés au bon niveau, les gens passent moins de temps à réviser, corriger et refaire le travail. Les tâches réussies coûtent moins cher, et les organisations gagnent la confiance nécessaire pour utiliser l’IA dans des flux de travail plus importants.
Les équipes peuvent concrétiser cela en suivant trois résultats :
- Prêt à utiliser : le résultat a atteint le niveau de qualité requis tel que livré.
- À corriger : le résultat a nécessité un autre essai ou des modifications humaines.
- À escalader : une personne a dû intervenir pour terminer le travail.
Ces mesures dressent un portrait plus complet que la seule exactitude du modèle. Elles montrent si l’IA réduit réellement le travail nécessaire pour mener le projet à terme.
La fiabilité exige aussi des limites claires. Avant que l’IA passe de la rédaction à l’action, les organisations devraient définir :
- Les données auxquelles le système peut accéder.
- Les systèmes qu’il peut utiliser ou modifier.
- Les moments où une personne doit réviser ou approuver une action.
La sûreté, la sécurité, la confidentialité et le contrôle créent les bases d’une utilisation plus poussée. Les gens doivent comprendre comment le système se comporte, comment leurs données sont traitées et comment ses actions sont encadrées.
ChatGPT Work s’appuie sur les bases de sécurité, de confidentialité, de conformité et de gestion de l’espace de travail de ChatGPT Enterprise. Cela permet aux organisations de donner à l’IA plus de contexte et l’accès à des flux de travail plus précieux, tout en maintenant une surveillance appropriée.
La capacité suscite la première utilisation. La fiabilité intègre l’IA à la manière dont le travail s'effectue.
La dernière question est de savoir si l’économie s’améliore à grande échelle.
Les entreprises peuvent le mesurer en suivant le même flux de travail au fil du temps. Suivez le nombre de tâches qui ont atteint le niveau de qualité requis, le coût total pour les accomplir et le coût par tâche réussie. Si le travail accompli augmente plus vite que le coût total, tandis que la qualité se maintient ou s’améliore, chaque dollar investi dans l’IA produit plus de valeur.
La puissance de calcul est au cœur de cette équation.
La puissance de calcul alimente la recherche et chaque tâche que l’IA accomplit. Elle influe sur la qualité, la rapidité, la fiabilité, la disponibilité et le coût des produits. La puissance de calcul consacrée à l'entraînement bâtit les capacités futures. Celle consacrée à l’inférence fournit du travail utile aujourd’hui. Les deux devraient se traduire par de meilleurs résultats pour les clients.
De meilleurs modèles, une inférence plus efficace, du matériel conçu à cette fin, une utilisation accrue, un routage plus intelligent et une conception de produit plus solide améliorent tous le rendement de la puissance de calcul. Chaque nouvelle génération d’infrastructure aide à entraîner des modèles plus performants. De meilleurs algorithmes, matériels et logiciels aident ensuite à servir ces modèles plus efficacement.
Les clients constatent ces améliorations concrètement : de meilleures réponses, des résultats plus rapides, moins de corrections, des produits plus fiables et un coût plus bas pour le travail dont ils ont besoin.
Les gains se composent. Une meilleure infrastructure accélère la recherche. La recherche produit des modèles plus performants et plus efficaces. De meilleurs modèles améliorent les produits. De meilleurs produits stimulent l’adoption, l’apprentissage et les revenus. Cette croissance soutient l’investissement continu dans la prochaine génération de recherche, de calcul, de déploiement et de sécurité.
OpenAI réunit ces éléments au sein d’une même plateforme d’intelligence partagée. Les gens l’utilisent avec ChatGPT et ChatGPT Work. Les développeurs s’en servent pour bâtir avec Codex et l’API. Les entreprises la déploient dans les systèmes où le travail esr effectué.
Quand une composante s’améliore, chaque produit et chaque client peut en profiter.
Ensemble, ces quatre mesures nous indiquent si l’intelligence utile par dollar s’améliore.
Le travail utile nous dit ce que l’IA produit. Le coût par tâche réussie nous dit ce qu’il faut pour atteindre le résultat. La fiabilité nous dit quelle part du travail les gens peuvent utiliser avec confiance. La valeur à grande échelle nous dit si chaque dollar, et chaque unité de calcul, accomplit davantage au fil du temps.
L’objectif est une IA qui aide les gens à faire un travail plus significatif, à prendre de meilleures décisions et à consacrer plus de temps aux aspects de leur emploi qui exigent un jugement et une créativité proprement humains.
Notre travail consiste à améliorer cette équation à chaque nouvelle génération : des modèles plus performants, des résultats plus rapides et plus fiables, et des coûts plus bas pour accomplir le travail dont les clients ont besoin.
C’est ainsi que l’IA devient de plus en plus utile à un plus grand nombre de personnes et d’organisations au fil du temps.


