Un quadre de comandament per a l’era de la IA
La pregunta que sento de directors financers d’arreu és senzilla: com podem obtenir més valor de la despesa en IA?
Durant anys, el mercat va mesurar l’èxit del programari a través de l’adopció: llocs contractats, usuaris actius i llicències renovades. Entendre el valor de la IA exigeix una mesura més potent: la feina feta.
La qüestió econòmica bàsica que afronten els directors financers i altres líders empresarials és si el valor de la feina que completa la IA creix més de pressa que el cost de produir-la.
Respondre a aquesta pregunta requereix mirar més enllà d’una mètrica com el cost per token. Un model de cost més baix pot tenir tokens més barats, però obtenir grans resultats pot exigir més intents, més temps o més revisió humana. Un model més capaç pot tenir tokens més cars, però completar la mateixa tasca d’una sola passada. El que importa és el cost total de produir un resultat satisfactori, comparat amb el valor que aquest resultat crea.
El quadre de comandament definitiu per a l’era de la IA es podria entendre com a "intel·ligència útil per dòlar". Aquesta mètrica respon quatre preguntes clau:
- La IA completa feina que importa?
- Quant costa cada tasca reeixida?
- La gent pot confiar en el resultat?
- Cada dòlar invertit en IA genera més valor a mesura que creix l’ús?
Comença per la feina en si.
Quantes incidències de clients ha ajudat a resoldre la IA? Quants canvis de codi ha ajudat a publicar? Quants contractes ha revisat? Quant de temps ha retornat a les persones? Quantes decisions han millorat perquè el context adequat era disponible en el moment adequat?
Els tokens creen valor quan es transformen en feina que la gent pot utilitzar. A mesura que els models esdevenen més capaços, poden assumir tasques més llargues i complexes: mantenir el context, raonar en diversos passos, treballar amb diferents eines i adaptar-se sobre la marxa.
El millor punt de partida és un sol flux de treball. Defineix què vol dir "fet" i mesura aquest resultat en el sistema on es fa la feina.
Per a un equip de suport, "fet" podria voler dir una incidència de client resolta. Per a un equip d’enginyeria, podria voler dir un canvi de codi que supera les proves. Per a un equip jurídic, podria voler dir un contracte revisat amb precisió i dins del termini.
Pensem en un equip financer que prepara una revisió de previsions. Bona part de la feina passa abans de prendre una decisió final: trobar l’última previsió, portar les dades a Excel o Sheets, identificar canvis, conciliar pestanyes, reconstruir diapositives i comprovar que tot quadra perfectament.
ChatGPT Work pot assumir bona part d’aquest procés i donar a l’equip més temps per centrar-se en les preguntes importants: què ha canviat? Per què? Què hem de fer ara?
Això és la intel·ligència útil per dòlar a la pràctica. Es completa més feina i més de pressa, mentre les persones dediquen més temps a aplicar criteri, creativitat i expertesa.
La següent pregunta és quant costa completar bé aquesta feina.
Les tasques d’IA varien molt. Una resposta ràpida pot requerir poca capacitat de càlcul. Un flux de treball de codi, recerca o finances pot implicar un raonament més profund, ús d’eines i moltes accions. Aquestes tasques més complexes poden requerir més capacitat de càlcul, però també poden crear molt més valor.
A escala de model, el cost per tasca reeixida depèn del preu, de la quantitat de càlcul utilitzada i de la probabilitat d’arribar al resultat correcte. Per a una empresa, el cost total també inclou el temps dels empleats, la revisió humana, els reintents i la feina refeta.
El càlcul és senzill:
- Suma el cost total de completar la feina.
- Compta les tasques que han assolit el llindar de qualitat requerit.
- Divideix el cost total pel nombre de tasques reeixides.
Per això el preu més baix per token no sempre dona el cost més baix per resultat. Un model d’avantguarda pot oferir el millor valor fins i tot per a una petició rutinària si produeix la resposta correcta d’una sola passada i redueix reintents, latència, revisió i càlcul total.
Una família de models per nivells ofereix als clients més maneres d’optimitzar aquesta equació. GPT‑5.6, que vam llançar la setmana passada, té tres nivells: Sol és el nostre vaixell insígnia; Terra equilibra rendiment i cost; Luna és el nostre model més ràpid i assequible.
Aquests nivells ofereixen bons punts de partida. L’economia de la tasca completa hauria de determinar, en última instància, quin és el model adequat. Un client podria fer servir Luna per a un flux de treball ràpid i de gran volum, Terra per a feina que requereix més profunditat o Sol quan un raonament més sòlid ofereix el millor resultat amb menys intents.
Hem entrenat GPT‑5.6 per obtenir més feina útil de cada token. A l’Artificial Analysis Coding Agent Index, GPT‑5.6 Sol amb el raonament màxim va marcar un nou estat de l’art tot utilitzant un 54 % menys de tokens de sortida que un altre model líder. El gràfic següent il·lustra la comparació.
DeepSWE v1.1: tasques d’enginyeria de llarg abast; GPT‑5.6 Sol assoleix una nova alta del 72,7 %, per sobre del 69,9 % de Claude Fable 5, amb un cost estimat de l’API un 36,2 % inferior.
A tota la família GPT‑5.6, l’objectiu és el mateix: més feina reeixida per dòlar. Una eficiència més gran fa més assequibles les tasques existents. Una capacitat més gran fa possibles tipus de feina completament nous.
Cada nova generació de models hauria de millorar tots dos costats d’aquesta equació. Els clients haurien de poder completar feina més valuosa mentre, alhora, el cost de completar cada tasca continua baixant.
La tercera mesura és la fiabilitat.
L’adopció de la IA tendeix a aprofundir-se per etapes. Primer, la IA ajuda a redactar. Després troba context i raona a través d’eines i dades. Amb el temps, comença a actuar, gestionar excepcions i completar fluxos de treball, amb persones que aporten criteri i control quan cal.
Cada pas crea més valor i exigeix més del sistema.
La fiabilitat té un valor econòmic directe. Quan els resultats són precisos, ben documentats, coherents i escalats adequadament, les persones dediquen menys temps a revisar, corregir i repetir la feina. Les tasques reeixides costen menys, i les organitzacions guanyen confiança per utilitzar la IA en fluxos de treball més importants.
Els equips poden concretar-ho fent el seguiment de tres resultats:
- A punt per utilitzar: el resultat ha assolit el llindar de qualitat tal com s’ha lliurat.
- Cal correcció: el resultat ha requerit un altre intent o edicions humanes.
- Cal escalament: ha calgut que una persona intervingués i acabés la feina.
Aquestes mesures expliquen una història més rica que la precisió del model per si sola. Mostren si la IA redueix realment la feina necessària per completar el projecte.
La fiabilitat també requereix límits clars. Abans que la IA passi de redactar a actuar, les organitzacions haurien de definir:
- A quines dades pot accedir el sistema.
- Quins sistemes pot utilitzar o modificar.
- Quan una persona ha de revisar o aprovar una acció.
La seguretat, la protecció, la privacitat i el control creen la base per a un ús més profund. Les persones han d’entendre com es comporta el sistema, com es gestionen les seves dades i com es governen les seves accions.
ChatGPT Work es basa en els fonaments de seguretat, privacitat, compliment i gestió de l’espai de treball de ChatGPT Enterprise. Això permet a les organitzacions donar a la IA més context i accés a fluxos de treball més valuosos, mantenint una supervisió adequada.
La capacitat impulsa el primer ús. La fiabilitat fa que la IA formi part de com es fa la feina.
La pregunta final és si l’economia millora a escala.
Les empreses poden mesurar-ho seguint el mateix flux de treball al llarg del temps. Fes el seguiment de quantes tasques han assolit el llindar de qualitat, del cost total de completar-les i del cost per tasca reeixida. Si la feina completada creix més de pressa que el cost total mentre la qualitat es manté o millora, cada dòlar en IA produeix més valor.
La capacitat de càlcul és al centre d’aquesta equació.
El càlcul impulsa la recerca i cada tasca que completa la IA. Determina la qualitat del producte, la velocitat, la fiabilitat, la disponibilitat i el cost. El càlcul d’entrenament construeix la capacitat futura. El càlcul d’inferència aporta feina útil avui. Tots dos s’haurien de traduir en millors resultats per als clients.
Models millors, inferència més eficient, maquinari dissenyat a mida, més utilització, encaminament més intel·ligent i un disseny de producte més sòlid milloren el retorn del càlcul. Cada generació d’infraestructura ajuda a entrenar models més capaços. Després, millors algoritmes, maquinari i programari ajuden a servir aquests models de manera més eficient.
Els clients experimenten aquestes millores en termes humans: millors respostes, resultats més ràpids, menys correccions, productes més fiables i un cost més baix per a la feina que necessiten completar.
Els guanys es reforcen mútuament. Una infraestructura millor accelera la recerca. La recerca produeix models més capaços i eficients. Models millors milloren els productes. Productes millors impulsen l’adopció, l’aprenentatge i els ingressos. Aquest creixement dona suport a la inversió continuada en la pròxima generació de recerca, càlcul, desplegament i seguretat.
OpenAI reuneix totes aquestes peces en una plataforma d’intel·ligència compartida. La gent la utilitza a través de ChatGPT i ChatGPT Work. Els desenvolupadors hi creen amb Codex i l’API. Les empreses la despleguen en els sistemes on es fa la feina.
Quan una capa millora, cada producte i cada client se’n poden beneficiar.
En conjunt, aquestes quatre mesures ens indiquen si la intel·ligència útil per dòlar està millorant.
La feina útil ens diu què produeix la IA. El cost per tasca reeixida ens diu què cal per arribar al resultat. La fiabilitat ens diu quina part de la feina poden utilitzar les persones amb confiança. El valor a escala ens diu si cada dòlar i cada unitat de càlcul aconsegueixen més amb el temps.
L’objectiu és una IA que ajudi les persones a fer feina més significativa, prendre millors decisions i dedicar més temps a les parts de la feina que requereixen criteri i creativitat clarament humans.
La nostra feina és millorar aquesta equació amb cada generació: models més capaços, resultats més ràpids i fiables, i costos més baixos per a la feina que els clients necessiten completar.
Així és com la IA esdevé més útil per a més persones i organitzacions al llarg del temps.


