Un tableau de bord pour l’ère de l’IA
La question que j’entends partout de la part des CFO est simple : comment tirer davantage de valeur de nos dépenses en IA ?
Pendant des années, le marché a mesuré le succès des logiciels à leur adoption : postes achetés, utilisateurs actifs, licences renouvelées. Comprendre la valeur de l’IA exige un indicateur plus robuste : le travail accompli.
La question économique fondamentale pour les CFO et les autres dirigeants est de savoir si la valeur du travail accompli par l’IA croît plus vite que son coût de production.
Pour y répondre, il faut aller au-delà d’une métrique comme le coût par token. Un modèle moins coûteux peut avoir des tokens moins chers, mais obtenir d’excellents résultats peut demander plus d’essais, plus de temps ou davantage de revue humaine. Un modèle plus performant peut avoir des tokens plus chers, mais accomplir la même tâche en une seule passe. Ce qui compte, c’est le coût complet de production d’un résultat réussi, rapporté à la valeur qu’il crée.
Le tableau de bord ultime de l’ère de l’IA pourrait être vu comme « l’intelligence utile par dollar ». Cette métrique répond à quatre questions clés :
- L’IA accomplit-elle un travail qui compte ?
- Combien coûte chaque tâche réussie ?
- Peut-on compter sur le résultat ?
- Chaque dollar investi dans l’IA produit-il plus de valeur à mesure que l’usage augmente ?
Commencez par le travail lui-même.
Combien de problèmes clients l’IA a-t-elle aidé à résoudre ? Combien de modifications de code a-t-elle aidé à livrer ? Combien de contrats a-t-elle examinés ? Combien de temps a-t-elle rendu aux équipes ? Combien de décisions se sont améliorées parce que le bon contexte était disponible au bon moment ?
Les tokens créent de la valeur lorsqu’ils se transforment en travail utilisable par les personnes. À mesure que les modèles deviennent plus performants, ils peuvent prendre en charge des tâches plus longues et plus complexes : maintenir le contexte, raisonner en plusieurs étapes, travailler avec différents outils et s’adapter en cours de route.
Le meilleur point de départ consiste à choisir un seul workflow. Définissez ce que signifie « terminé » et mesurez ce résultat dans le système où le travail est effectué.
Pour une équipe de support, « terminé » peut signifier qu’un problème client est résolu. Pour une équipe d’ingénierie, cela peut être une modification de code qui passe ses tests. Pour une équipe juridique, cela peut être un contrat examiné avec exactitude et dans les délais.
Prenons une équipe financière qui prépare une revue de prévisions. Une grande partie du travail a lieu avant la décision finale : trouver les dernières prévisions, transférer les données dans Excel ou Sheets, identifier les changements, rapprocher les onglets, refaire les présentations et vérifier que tout concorde parfaitement.
ChatGPT Work peut prendre en charge une grande partie de ce processus et donner à l’équipe plus de temps pour se concentrer sur les questions qui comptent : qu’est-ce qui a changé ? Pourquoi ? Que devons-nous faire ensuite ?
C’est l’intelligence utile par dollar en pratique. Davantage de travail est accompli, plus rapidement, tandis que les personnes consacrent plus de temps à exercer leur jugement, leur créativité et leur expertise.
La question suivante est de savoir combien coûte la bonne exécution de ce travail.
Les tâches d’IA varient beaucoup. Une réponse rapide peut nécessiter peu de calcul. Un workflow de code, de recherche ou de finance peut impliquer un raisonnement plus approfondi, l’utilisation d’outils et de nombreuses actions. Ces tâches plus complexes peuvent nécessiter davantage de calcul, mais elles peuvent créer beaucoup plus de valeur.
Au niveau du modèle, le coût par tâche réussie dépend du prix, de la quantité de calcul utilisée et de la probabilité d’atteindre le bon résultat. Pour une entreprise, le coût complet inclut aussi le temps des employés, la revue humaine, les nouveaux essais et les reprises.
Le calcul est simple :
- Additionnez le coût complet nécessaire pour accomplir le travail.
- Comptez les tâches qui ont atteint le niveau de qualité requis.
- Divisez le coût complet par le nombre de tâches réussies.
C’est pourquoi le prix par token le plus bas ne produit pas toujours le coût par résultat le plus faible. Un modèle de pointe peut offrir la meilleure valeur, même pour une demande courante, s’il produit la bonne réponse en une seule passe, en réduisant les nouveaux essais, la latence, la revue et le calcul total.
Une famille de modèles à plusieurs niveaux donne aux clients davantage de moyens d’optimiser cette équation. GPT‑5.6, que nous avons lancé la semaine dernière, comporte trois niveaux : Sol est notre modèle phare ; Terra équilibre performance et coût ; Luna est notre modèle le plus rapide et le plus abordable.
Ces niveaux constituent des points de départ utiles. L’économie de la tâche complète doit, au bout du compte, déterminer le bon modèle. Un client peut utiliser Luna pour un workflow rapide et à fort volume, Terra pour un travail demandant plus de profondeur, ou Sol lorsque son raisonnement plus puissant donne le meilleur résultat avec moins d’essais.
Nous avons entraîné GPT‑5.6 pour tirer plus de travail utile de chaque token. Dans l’Artificial Analysis Coding Agent Index, GPT‑5.6 Sol avec le raisonnement réglé au maximum a établi un nouvel état de l’art tout en utilisant 54 % de tokens de sortie en moins qu’un autre modèle de premier plan. Le graphique ci-dessous illustre la comparaison.
DeepSWE v1.1 : Tâches d’ingénierie à long terme ; GPT‑5.6 Sol atteint un nouveau record de 72,7 %, contre 69,9 % pour Claude Fable 5, pour un coût d’API estimé inférieur de 36,2 %.
Dans toute la famille GPT‑5.6, l’objectif est le même : plus de travail réussi par dollar. Une plus grande efficacité rend les tâches existantes plus abordables. Une plus grande capacité rend possibles des types de travail entièrement nouveaux.
Chaque nouvelle génération de modèles devrait améliorer les deux côtés de cette équation. Les clients doivent pouvoir accomplir un travail plus précieux tandis que, dans le même temps, le coût d’exécution de chaque tâche continue de baisser.
Le troisième indicateur est la fiabilité.
L’adoption de l’IA tend à s’approfondir par étapes. D’abord, l’IA aide à rédiger. Puis elle trouve du contexte et raisonne à travers les outils et les données. Avec le temps, elle commence à agir, à gérer les exceptions et à mener des workflows à bien, les personnes apportant leur jugement et leur contrôle lorsque c’est nécessaire.
Chaque étape crée plus de valeur et exige davantage du système.
La fiabilité a une valeur économique directe. Lorsque les résultats sont exacts, bien sourcés, cohérents et escaladés de manière appropriée, les personnes passent moins de temps à revoir, corriger et répéter le travail. Les tâches réussies coûtent moins cher, et les organisations gagnent la confiance nécessaire pour utiliser l’IA dans des workflows plus importants.
Les équipes peuvent rendre cela concret en suivant trois résultats :
- Prêt à l’emploi : le résultat a atteint le niveau de qualité requis tel qu’il a été livré.
- Correction nécessaire : le résultat a exigé un nouvel essai ou des modifications humaines.
- Escalade nécessaire : une personne a dû intervenir et terminer le travail.
Ces mesures racontent une histoire plus riche que la seule précision du modèle. Elles montrent si l’IA réduit réellement le travail nécessaire pour mener le projet à bien.
La fiabilité exige aussi des limites claires. Avant que l’IA ne passe de la rédaction à l’action, les organisations doivent définir :
- Les données auxquelles le système peut accéder.
- Les systèmes qu’il peut utiliser ou modifier.
- Les cas où une personne doit revoir ou approuver une action.
La sûreté, la sécurité, la confidentialité et le contrôle constituent le socle d’usages plus approfondis. Les personnes doivent comprendre comment le système se comporte, comment leurs données sont traitées et comment ses actions sont gouvernées.
ChatGPT Work s’appuie sur les fondations de sécurité, de confidentialité, de conformité et de gestion de l’espace de travail de ChatGPT Enterprise. Cela permet aux organisations de donner à l’IA davantage de contexte et d’accès à des workflows plus précieux, tout en maintenant une supervision appropriée.
La capacité permet le premier usage. La fiabilité fait de l’IA une partie intégrante de la manière dont le travail est accompli.
La dernière question est de savoir si l’économie s’améliore à grande échelle.
Les entreprises peuvent le mesurer en suivant le même workflow au fil du temps. Suivez le nombre de tâches ayant atteint le niveau de qualité requis, le coût total de leur exécution et le coût par tâche réussie. Si le travail accompli augmente plus vite que le coût total tandis que la qualité se maintient ou s’améliore, chaque dollar d’IA produit plus de valeur.
Le calcul est au centre de cette équation.
Le calcul alimente la recherche et chaque tâche accomplie par l’IA. Il façonne la qualité des produits, la vitesse, la fiabilité, la disponibilité et le coût. Le calcul d’entraînement construit les capacités futures. Le calcul d’inférence fournit le travail utile aujourd’hui. Tous deux doivent se traduire par de meilleurs résultats pour les clients.
De meilleurs modèles, une inférence plus efficace, du matériel conçu à cet effet, une utilisation accrue, un routage plus intelligent et une meilleure conception produit améliorent tous le rendement du calcul. Chaque génération d’infrastructure aide à entraîner des modèles plus performants. De meilleurs algorithmes, matériels et logiciels aident ensuite à servir ces modèles plus efficacement.
Les clients perçoivent ces améliorations en termes humains : de meilleures réponses, des résultats plus rapides, moins de corrections, des produits plus fiables et un coût plus faible pour le travail dont ils ont besoin.
Les gains se cumulent. Une meilleure infrastructure accélère la recherche. La recherche produit des modèles plus performants et plus efficaces. De meilleurs modèles améliorent les produits. De meilleurs produits favorisent l’adoption, l’apprentissage et le chiffre d’affaires. Cette croissance soutient l’investissement continu dans la prochaine génération de recherche, de calcul, de déploiement et de sûreté.
OpenAI rassemble ces éléments au sein d’une plateforme d’intelligence partagée. Les utilisateurs y accèdent via ChatGPT et ChatGPT Work. Les développeurs construisent avec elle via Codex et l’API. Les entreprises la déploient dans les systèmes où le travail a lieu.
Lorsqu’une couche s’améliore, chaque produit et chaque client peuvent en bénéficier.
Pris ensemble, ces quatre indicateurs nous disent si l’intelligence utile par dollar s’améliore.
Le travail utile nous dit ce que l’IA produit. Le coût par tâche réussie nous dit ce qu’il faut pour atteindre le résultat. La fiabilité nous dit quelle part du travail les personnes peuvent utiliser en toute confiance. La valeur à grande échelle nous dit si chaque dollar, et chaque unité de calcul, accomplit davantage au fil du temps.
L’objectif est une IA qui aide les personnes à accomplir un travail plus utile, à prendre de meilleures décisions et à consacrer plus de temps aux aspects de leur métier qui exigent un jugement et une créativité proprement humains.
Notre travail consiste à améliorer cette équation à chaque génération : des modèles plus performants, des résultats plus rapides et plus fiables, et des coûts plus faibles pour le travail dont les clients ont besoin.
C’est ainsi que l’IA devient plus utile à un plus grand nombre de personnes et d’organisations au fil du temps.


