Kad skor untuk era AI
Soalan yang saya dengar daripada CFO di mana-mana mudah sahaja: bagaimana kita boleh mendapat lebih nilai daripada perbelanjaan kita untuk AI?
Selama bertahun-tahun, pasaran mengukur kejayaan perisian melalui penggunaan: tempat duduk yang dibeli, pengguna aktif, lesen yang diperbaharui. Memahami nilai permintaan AI memerlukan ukuran yang lebih kuat: kerja yang diselesaikan.
Persoalan ekonomi asas yang dihadapi CFO dan pemimpin perniagaan lain adalah sama ada nilai kerja yang diselesaikan AI meningkat lebih pantas daripada kos menghasilkannya.
Untuk menjawab soalan itu, kita perlu melihat lebih mendalam daripada metrik seperti kos bagi setiap token. Model berkos lebih rendah mungkin mempunyai token yang lebih murah, tetapi untuk mendapat hasil yang hebat mungkin memerlukan lebih banyak percubaan, lebih masa atau lebih banyak semakan manusia. Model yang lebih berkeupayaan mungkin mempunyai token yang lebih mahal, tetapi dapat menyelesaikan tugasan yang sama dalam satu cubaan. Yang penting ialah kos penuh untuk memberikan hasil yang berjaya, diukur berbanding nilai yang dicipta oleh hasil itu.
Kad skor muktamad untuk era AI boleh dilihat sebagai “Kecerdasan yang Berguna bagi Setiap Dolar”. Metrik ini menjawab empat soalan utama:
- Adakah AI menyelesaikan kerja yang penting?
- Berapakah kos setiap tugasan yang berjaya?
- Bolehkah orang bergantung pada hasilnya?
- Adakah setiap dolar AI menghasilkan lebih nilai apabila penggunaan berkembang?
Mulakan dengan kerja itu sendiri.
Berapa banyak isu pelanggan yang AI bantu selesaikan? Berapa banyak perubahan kod yang dibantunya dihantar? Berapa banyak kontrak yang disemaknya? Berapa banyak masa yang dipulangkannya kepada orang ramai? Berapa banyak keputusan menjadi lebih baik kerana konteks yang tepat tersedia pada masa yang tepat?
Token mencipta nilai apabila ia berubah menjadi kerja yang orang ramai boleh gunakan. Apabila model menjadi lebih berkeupayaan, ia boleh mengambil tugasan yang lebih panjang dan kompleks: mengekalkan konteks, menaakul melalui beberapa langkah, bekerja merentas alat dan menyesuaikan diri sepanjang proses tersebut.
Tempat terbaik untuk bermula adalah dengan satu aliran kerja. Takrifkan maksud “selesai” dan ukur hasil itu dalam sistem tempat kerja berlaku.
Bagi pasukan sokongan, “selesai” mungkin bermaksud isu pelanggan telah diselesaikan. Bagi pasukan kejuruteraan, ia mungkin bermaksud perubahan kod yang lulus ujiannya. Bagi pasukan undang-undang, ia mungkin bermaksud kontrak disemak dengan tepat dan tepat pada waktunya.
Pertimbangkan pasukan kewangan yang bersedia untuk semakan ramalan. Sebahagian besar kerja berlaku sebelum keputusan akhir dibuat: mencari ramalan terkini, memindahkan data ke Excel atau Sheets, mengenal pasti perubahan, menyelaraskan tab, membina semula slaid dan memastikan semuanya dijumlahkan dengan tepat.
ChatGPT Work boleh mengambil alih sebahagian besar proses itu, memberi pasukan lebih masa untuk menumpukan soalan yang penting: Apa yang berubah? Mengapa? Apa yang patut kita lakukan seterusnya?
Itulah kecerdasan yang berguna bagi setiap dolar dalam amalan. Lebih banyak kerja diselesaikan dengan lebih pantas, sementara orang ramai menggunakan lebih banyak masa mereka untuk menerapkan pertimbangan, kreativiti dan kepakaran.
Soalan seterusnya ialah kos untuk menyelesaikan kerja itu dengan baik.
Tugasan AI sangat berbeza-beza. Jawapan pantas mungkin memerlukan sedikit komputasi. Aliran kerja pengekodan, penyelidikan atau kewangan mungkin melibatkan penaakulan yang lebih mendalam, penggunaan alat dan banyak tindakan. Tugasan yang lebih kompleks itu boleh memerlukan lebih banyak komputasi, tetapi ia juga boleh mencipta jauh lebih banyak nilai.
Pada peringkat model, kos bagi setiap tugasan berjaya bergantung pada harga, jumlah komputasi yang digunakan dan kebarangkalian mencapai hasil yang betul. Bagi perniagaan, kos penuh juga merangkumi masa pekerja, semakan manusia, percubaan semula dan kerja semula.
Pengiraannya mudah:
- Jumlahkan kos penuh untuk menyelesaikan kerja.
- Kira tugasan yang memenuhi tahap kualiti yang diperlukan.
- Bahagikan kos penuh dengan bilangan tugasan yang berjaya.
Inilah sebabnya harga terendah bagi setiap token tidak semestinya menghasilkan kos terendah bagi setiap hasil. Model termaju mungkin memberikan nilai terbaik walaupun untuk permintaan rutin jika ia menghasilkan jawapan yang betul dalam satu cubaan, sekali gus mengurangkan percubaan semula, kependaman, semakan dan jumlah komputasi.
Keluarga model bertingkat memberi pelanggan lebih banyak cara untuk mengoptimumkan persamaan ini. GPT‑5.6, yang kami keluarkan minggu lalu, mempunyai tiga peringkat: Sol ialah model utama kami; Terra mengimbangi prestasi dan kos; Luna ialah model kami yang terpantas dan paling mampu milik.
Peringkat ini menyediakan titik permulaan yang berguna. Ekonomi tugasan penuh akhirnya harus menentukan model yang tepat. Pelanggan mungkin menggunakan Luna untuk aliran kerja pantas dan berskala tinggi, Terra untuk kerja yang memerlukan kedalaman lebih besar, atau Sol apabila penaakulan yang lebih kuat memberikan hasil terbaik dengan lebih sedikit percubaan.
Kami melatih GPT‑5.6 untuk mendapatkan lebih banyak kerja yang berguna daripada setiap token. Dalam Artificial Analysis Coding Agent Index, GPT‑5.6 Sol dengan max reasoning menetapkan tahap kecanggihan baharu sambil menggunakan 54% lebih sedikit token output berbanding model terkemuka lain. Carta di bawah menggambarkan perbandingan tersebut.
DeepSWE v1.1: Tugasan kejuruteraan jangka panjang; GPT‑5.6 Sol mencapai tahap tertinggi baharu sebanyak 72.7%, melebihi 69.9% Claude Fable 5, dengan kos anggaran API yang 36.2% lebih rendah.
Di seluruh keluarga GPT‑5.6, matlamatnya sama: lebih banyak kerja berjaya bagi setiap dolar. Kecekapan yang lebih tinggi menjadikan tugasan sedia ada lebih mampu milik. Keupayaan yang lebih besar membolehkan jenis kerja yang benar-benar baharu dilakukan.
Setiap generasi model baharu seharusnya menambah baik kedua-dua sisi persamaan itu. Pelanggan seharusnya dapat menyelesaikan kerja yang lebih bernilai, sementara pada masa yang sama kos untuk menyelesaikan setiap tugasan terus menurun.
Ukuran ketiga ialah kebolehharapan.
Penggunaan AI cenderung berkembang secara berperingkat. Pertama, AI bantu menyediakan draf. Kemudian ia mencari konteks dan menaakul merentas alat dan data. Lama-kelamaan, ia mula mengambil tindakan, mengendalikan pengecualian dan menyelesaikan aliran kerja, dengan manusia memberikan pertimbangan dan kawalan apabila diperlukan.
Setiap langkah mencipta lebih nilai dan menuntut lebih banyak daripada sistem.
Kebolehharapan mempunyai nilai ekonomi langsung. Apabila hasil tepat, bersumber dengan baik, konsisten dan dirujuk dengan sewajarnya, orang ramai mengambil kurang masa untuk menyemak, membetulkan dan mengulangi kerja. Tugasan yang berjaya menelan kos lebih rendah, dan organisasi memperoleh keyakinan untuk menggunakan AI dalam aliran kerja yang lebih penting.
Pasukan boleh menjadikannya konkrit dengan menjejaki tiga hasil:
- Sedia digunakan: Hasil memenuhi tahap kualiti seperti yang disampaikan.
- Perlu pembetulan: Hasil memerlukan percubaan lain atau suntingan manusia.
- Perlu dirujuk: Seseorang perlu masuk campur dan menyiapkan kerja.
Ukuran ini memberikan gambaran yang lebih lengkap daripada ketepatan model sahaja. Ia menunjukkan sama ada AI benar-benar mengurangkan kerja yang terlibat untuk menyiapkan projek.
Kebolehharapan juga memerlukan sempadan yang jelas. Sebelum AI beralih daripada menyediakan draf kepada mengambil tindakan, organisasi harus mentakrifkan:
- Data yang boleh diakses oleh sistem.
- Sistem yang boleh digunakan atau diubahnya.
- Bila seseorang perlu menyemak atau meluluskan tindakan.
Keselamatan, sekuriti, privasi dan kawalan membina asas untuk penggunaan yang lebih mendalam. Individu perlu memahami cara sistem berkelakuan, cara data mereka dikendalikan dan cara tindakannya ditadbir.
ChatGPT Work dibina atas asas keselamatan, privasi, pematuhan dan pengurusan ruang kerja ChatGPT Enterprise. Ini membolehkan organisasi memberi AI lebih banyak konteks dan akses kepada aliran kerja yang lebih bernilai sambil mengekalkan pengawasan yang sesuai.
Keupayaan mendorong penggunaan pertama. Kebolehharapan menjadikan AI sebahagian daripada cara kerja diselesaikan.
Soalan terakhir ialah sama ada ekonomi bertambah baik pada skala besar.
Syarikat boleh mengukurnya dengan mengikuti aliran kerja yang sama dari semasa ke semasa. Jejaki bilangan tugasan yang memenuhi tahap kualiti, jumlah kos untuk menyelesaikannya dan kos bagi setiap tugasan berjaya. Jika kerja yang diselesaikan berkembang lebih pantas daripada jumlah kos sementara kualiti kekal atau bertambah baik, setiap dolar AI menghasilkan lebih nilai.
Komputasi berada di tengah-tengah persamaan ini.
Komputasi menggerakkan penyelidikan dan setiap tugasan yang diselesaikan oleh AI. Ia membentuk kualiti produk, kelajuan, kebolehharapan, ketersediaan dan kos. Komputasi latihan membina keupayaan masa depan. Komputasi inferens menyampaikan kerja yang berguna hari ini. Kedua-duanya harus diterjemahkan kepada hasil yang lebih baik untuk pelanggan.
Model yang lebih baik, inferens yang lebih cekap, perkakasan khusus, penggunaan yang lebih tinggi, penghalaan yang lebih pintar dan reka bentuk produk yang lebih kukuh semuanya meningkatkan pulangan komputasi. Setiap generasi infrastruktur bantu melatih model yang lebih berkeupayaan. Algoritma, perkakasan dan perisian yang lebih baik kemudian bantu menyampaikan model tersebut dengan lebih cekap.
Pelanggan merasai penambahbaikan tersebut dari sudut pengalaman manusia: jawapan yang lebih baik, hasil yang lebih pantas, kurang pembetulan, produk yang lebih boleh diharapkan dan kos yang lebih rendah untuk kerja yang perlu mereka selesaikan.
Keuntungan itu berganda-ganda. Infrastruktur yang lebih baik mempercepatkan penyelidikan. Penyelidikan menghasilkan model yang lebih berkeupayaan dan cekap. Model yang lebih baik menambah baik produk. Produk yang lebih baik mendorong penggunaan, pembelajaran dan hasil. Pertumbuhan itu menyokong pelaburan berterusan dalam generasi penyelidikan, komputasi, pelaksanaan dan keselamatan yang seterusnya.
OpenAI menghimpunkan semua unsur ini melalui satu platform kecerdasan bersama. Orang ramai menggunakannya melalui ChatGPT dan ChatGPT Work. Pembangun membina dengannya melalui Codex dan API. Perusahaan melaksanakannya ke dalam sistem di tempat kerja berlaku.
Apabila satu lapisan bertambah baik, setiap produk dan pelanggan boleh mendapat manfaat.
Secara keseluruhan, empat ukuran ini memberitahu kita sama ada kecerdasan yang berguna bagi setiap dolar semakin bertambah baik.
Kerja yang berguna memberitahu kita apa yang dihasilkan oleh AI. Kos bagi setiap tugasan berjaya memberitahu kita apa yang diperlukan untuk mencapai hasil. Kebolehharapan memberitahu kita berapa banyak kerja yang orang ramai boleh gunakan dengan yakin. Nilai pada skala besar memberitahu kita sama ada setiap dolar dan setiap unit komputasi mencapai lebih banyak dari semasa ke semasa.
Matlamatnya ialah AI membantu orang ramai melakukan kerja yang lebih bermakna, membuat keputusan yang lebih baik dan meluangkan lebih banyak masa dalam bahagian kerja mereka yang memerlukan pertimbangan serta kreativiti manusia yang tersendiri.
Tugas kami ialah menjadikan persamaan itu lebih baik dengan setiap generasi: model yang lebih berkeupayaan, hasil yang lebih pantas dan lebih boleh diharapkan, serta kos yang lebih rendah untuk kerja yang perlu pelanggan selesaikan.
Dengan cara itu AI menjadi lebih berguna kepada lebih ramai orang dan organisasi dari semasa ke semasa.


