ԱԲ դարաշրջանի գնահատման քարտ
Հարցը, որ ամենուր լսում եմ ֆինանսական տնօրեններից, պարզ է. ինչպե՞ս ավելի մեծ արժեք ստանալ ԱԲ-ի վրա կատարած մեր ներդրումներից։
Տարիներ շարունակ շուկան ծրագրային ապահովման հաջողությունը չափում էր դրա կիրառման մակարդակով՝ գնված տեղեր, ակտիվ օգտատերեր, երկարաձգված լիցենզիաներ։ ՍԲ-ի արժեքը հասկանալու համար պետք է ավելի հզոր չափանիշ՝ կատարված աշխատանքը։
Ֆինանսական տնօրենների և այլ բիզնես ղեկավարների առջև կանգնած հիմնական տնտեսական հարցն այն է, թե արդյոք ԱԲ-ի կատարած աշխատանքի արժեքն ավելի արագ է աճում, քան դրա ստեղծման ծախսը։
Այդ հարցին պատասխանելու համար պետք է ավելի խորքային ցուցանիշներ դիտարկել, քան պարզապես մեկ թոքենի արժեքը։ Ավելի ցածր արժեքով մոդելը կարող է ունենալ ավելի էժան թոքեններ, բայց գերազանց արդյունքների համար կարող են պահանջվել ավելի շատ փորձեր, ավելի շատ ժամանակ կամ ավելի շատ մարդկային ստուգում։ Ավելի հզոր մոդելը կարող է ունենալ ավելի թանկ թոքեններ, բայց նույն առաջադրանքը կատարել մեկ փորձով։ Կարևորը հաջող արդյունք ստեղծելու ամբողջական ծախսն է՝ համեմատած այդ արդյունքի ստեղծած արժեքի հետ:
ԱԲ-ի դարաշրջանի վերջնական գնահատման քարտը կարելի է դիտարկել որպես «օգտակար բանականություն մեկ դոլարի դիմաց»։ Այս չափանիշը պատասխանում է չորս հիմնական հարցի.
Արդյո՞ք ԱԲ-ն կատարում է կարևոր աշխատանք։
Ի՞նչ արժե յուրաքանչյուր հաջող առաջադրանք։
Մարդիկ կարո՞ղ են վստահել արդյունքին։
Արդյո՞ք արհեստական բանականության վրա ծախսված յուրաքանչյուր դոլարը, դրա կիրառման ընդլայնմանը զուգընթաց, ստեղծում է ավելի մեծ արժեք։
Սկսեք հենց աշխատանքից։
Քանի՞ հաճախորդի խնդիր է ԱԲ-ն օգնել լուծել։ Քանի՞ կոդային փոփոխություն է այն օգնել թողարկել։ Քանի՞ պայմանագիր է այն վերանայել։ Որքա՞ն ժամանակ է այն խնայել մարդկանց համար։ Քանի՞ որոշում է դարձել ավելի արդյունավետ, որովհետև անհրաժեշտ տեղեկատվությունը հասանելի է եղել ճիշտ պահին:
Թոքեններն արժեք են ստեղծում, երբ վերածվում են մարդկանց կողմից օգտագործելի աշխատանքի: Քանի որ մոդելներն ավելի են հզորանում, կարող են ստանձնել ավելի երկար ու բարդ առաջադրանքներ՝ պահպանել համատեքստը, հիմնավորում կատարել մի քանի քայլով, աշխատել տարբեր գործիքներով և հարմարվել ընթացքին։
Սկսելու լավագույն տեղը մեկ աշխատանքային հոսքն է։ Սահմանեք, թե ինչ է նշանակում «կատարված», և չափեք այդ արդյունքը այն համակարգում, որտեղ կատարվում է աշխատանքը։
Աջակցման թիմի համար «կատարվածը» կարող է նշանակել հաճախորդի լուծված խնդիր։ Ինժեներական թիմի համար դա կարող է լինել կոդային փոփոխություն, որը անցնում է իր թեստերը։ Իրավաբանական թիմի համար դա կարող է նշանակել պայմանագիր, որը վերանայվել է ճշգրիտ և ժամանակին։
Պատկերացրեք ֆինանսական թիմ, որը պատրաստվում է կանխատեսման վերանայման։ Աշխատանքի մեծ մասը կատարվում է մինչև վերջնական որոշումը՝ գտնել վերջին կանխատեսումը, տվյալները տեղափոխել Excel կամ Sheets, գտնել փոփոխությունները, համադրել ներդիրները, նորից կազմել սլայդները և ստուգել, որ ամեն ինչ իդեալականորեն համընկնում է։
ChatGPT Աշխատանքը կարող է ստանձնել այդ գործընթացի մեծ մասը՝ թիմին ավելի շատ ժամանակ տալով կենտրոնանալու կարևոր հարցերի վրա. ի՞նչ փոխվեց։ Ինչո՞ւ։ Ի՞նչ պետք է անենք հաջորդիվ։
Սա գործնականում հենց օգտակար արհեստական բանականությունն է մեկ դոլարի դիմաց։ Ավելի շատ աշխատանք է ավարտվում, ավելի արագ, իսկ մարդիկ իրենց ժամանակի ավելի մեծ մասն ուղղում են դատողության, ստեղծագործականության և մասնագիտության կիրառմանը։
Հաջորդ հարցն է՝ ինչ արժե այդ աշխատանքը լավ ավարտելը։
ԱԲ-ի առաջադրանքները շատ տարբեր են։ Արագ պատասխանը կարող է քիչ հաշվարկ պահանջել։ Կոդավորման, հետազոտական կամ ֆինանսական աշխատանքային հոսքը կարող է ներառել ավելի խոր հիմնավորում, գործիքների օգտագործում և բազմաթիվ գործողություններ։ Այդ ավելի բարդ առաջադրանքները կարող են ավելի շատ հաշվարկ պահանջել, բայց նաև շատ ավելի մեծ արժեք ստեղծել։
Մոդելի մակարդակում հաջող առաջադրանքի արժեքը կախված է գնից, օգտագործված հաշվարկի ծավալից և ճիշտ արդյունքի հասնելու հավանականությունից։ Բիզնեսի համար ամբողջական ծախսը ներառում է նաև աշխատակիցների ժամանակը, մարդկային վերահսկումը, կրկնափորձերը և վերամշակումը։
Հաշվարկը պարզ է.
Գումարեք աշխատանքը ավարտելու ամբողջական ծախսը։
Հաշվեք այն առաջադրանքները, որոնք բավարարել են պահանջվող որակի շեմը։
Ամբողջական ծախսը բաժանեք հաջող առաջադրանքների քանակի վրա։
Ահա թե ինչու թոքենի ամենացածր գինը միշտ չէ, որ տալիս է արդյունքի ամենացածր արժեքը։ Առաջադեմ մոդելը կարող է լավագույն արժեքը տալ նույնիսկ սովորական հարցման դեպքում, եթե ճիշտ պատասխանը տալիս է մեկ փորձով՝ նվազեցնելով կրկնափորձերը, ուշացումը, ստուգումը և ընդհանուր հաշվարկը։
Մոդելների բազմաշերտ ընտանիքը հաճախորդներին այս հավասարումը օպտիմալացնելու ավելի շատ եղանակներ է տալիս։ GPT‑5.6‑ը, որը թողարկեցինք անցյալ շաբաթ, ունի երեք մակարդակ. Sol-ը մեր առաջատարն է, Terra-ն հավասարակշռում է կատարողականությունն ու արժեքը, իսկ Luna-ն մեր ամենաարագ և ամենամատչելի մոդելն է։
Այս մակարդակները օգտակար մեկնարկային կետեր են։ Սակայն, ի վերջո, ճիշտ մոդելի ընտրությունը պետք է որոշվի ամբողջական առաջադրանքի տնտեսական արդյունավետությամբ: Հաճախորդը կարող է Luna-ն օգտագործել արագ, մեծածավալ հոսքի համար, Terra-ն՝ ավելի մեծ խորություն պահանջող աշխատանքի համար, կամ Sol-ը, երբ հզոր հիմնավորումը լավագույն արդյունքն է տալիս ավելի քիչ փորձերով։
Մենք GPT‑5.6‑ը վարժեցրել ենք այնպես, որ յուրաքանչյուր թոքենից ստացվի ավելի շատ օգտակար աշխատանք։ Artificial Analysis Coding Agent Index-ում GPT‑5.6 Sol-ը առավելագույն հիմնավորումով սահմանեց նոր առաջադեմ մակարդակ՝ օգտագործելով 54%-ով ավելի քիչ ելքային թոքեններ, քան մեկ այլ առաջատար մոդել։ Ստորև բերված գծապատկերը ցույց է տալիս համեմատությունը։
DeepSWE v1.1․ երկարաժամկետ ինժեներական առաջադրանքներ։ GPT‑5.6 Sol-ը գրանցում է նոր հզոր ցուցանիշ՝ 72,7%, գերազանցելով Claude Fable 5-ի 69,9%-ը՝ API-ի գնահատված ծախսը նվազեցնելով 36,2%-ով։
GPT‑5.6 ընտանիքի ամբողջ շարքում նպատակը նույնն է՝ ավելի շատ հաջող աշխատանք մեկ դոլարի դիմաց։ Ավելի բարձր արդյունավետությունը գոյություն ունեցող առաջադրանքները դարձնում է ավելի մատչելի։ Ավելի մեծ կարողությունը հնարավոր է դարձնում աշխատանքի բոլորովին նոր տեսակներ։
Մոդելների յուրաքանչյուր նոր սերունդ պետք է բարելավի այդ հավասարման երկու կողմերն էլ։ Հաճախորդները պետք է կարողանան ավելի արժեքավոր աշխատանք կատարել, մինչդեռ յուրաքանչյուր առաջադրանքի կատարման ծախսը շարունակում է նվազել։
Երրորդ չափանիշը հուսալիությունն է։
ԱԲ-ի ներդրումը սովորաբար խորանում է փուլերով։ Սկզբում ԱԲ-ն օգնում է սևագրել։ Հետո այն գտնում է համատեքստը և հիմնավորում է տարբեր գործիքների ու տվյալների միջով։ Ժամանակի ընթացքում այն սկսում է գործողություններ կատարել, մշակել բացառությունները և ավարտել աշխատանքային հոսքերը, իսկ մարդիկ անհրաժեշտ տեղերում ապահովում են դատողություն և վերահսկողություն։
Յուրաքանչյուր քայլ ավելի մեծ արժեք է ստեղծում և համակարգից ավելին է պահանջում։
Հուսալիությունն ունի ուղղակի տնտեսական արժեք։ Երբ արդյունքները ճշգրիտ են, հիմնավորված են վստահելի աղբյուրներով, հետևողական և ճիշտ ձևով փոխանցվում են ավելի բարձր մակարդակ, մարդիկ ավելի քիչ ժամանակ են ծախսում ստուգելու, ուղղելու և աշխատանքը կրկնելու վրա։ Հաջողությամբ ավարտված առաջադրանքներն ունեն ավելի ցածր արժեք, իսկ կազմակերպությունները վստահություն են ձեռք բերում ԱԲ-ն ավելի կարևոր աշխատանքային հոսքերում օգտագործելու համար։
Թիմերը կարող են սա կոնկրետացնել՝ հետևելով երեք արդյունքի.
Պատրաստ է օգտագործման համար. արդյունքը ստացման պահին բավարարել է որակի շեմը։
Ուղղման կարիք ունի. արդյունքը պահանջել է ևս մեկ փորձ կամ մարդկանց կողմից խմբագրումներ։
Էսկալացման կարիք ունի. մարդու կողմից միջամտության և աշխատանքը ավարտելու անհրաժեշտություն է առաջացել։
Այս չափումներն ավելի հարուստ պատկեր են տալիս, քան միայն մոդելի ճշգրտությունը։ Դրանք ցույց են տալիս, որ ԱԲ-ն իսկապես նվազեցնում է արդյոք նախագծի ավարտման համար պահանջվող աշխատանքը։
Հուսալիությունը պահանջում է նաև հստակ սահմաններ։ Նախքան ԱԲ-ն սևագրումից անցնի գործողությունների կատարմանը, կազմակերպությունները պետք է սահմանեն.
Ինչ տվյալների հասանելիություն կարող է ունենալ համակարգը։
Ինչ համակարգեր կարող է այն օգտագործել կամ փոխել։
Երբ պետք է մարդը վերանայի կամ հաստատի գործողությունը։
Անվտանգությունը, պաշտպանությունը, գաղտնիությունը և վերահսկողությունը ստեղծում են ավելի խորքային կիրառման հիմքը։ Մարդիկ պետք է հասկանան, թե ինչպես է համակարգը վարվում, ինչպես են մշակվում իրենց տվյալները և ինչպես են կառավարվում դրա գործողությունները։
ChatGPT Work-ը կառուցվում է ChatGPT Enterprise-ի անվտանգության, գաղտնիության, համապատասխանության և աշխատատարածքի կառավարման հիմքի վրա։ Սա կազմակերպություններին թույլ է տալիս ԱԲ-ին տալ ավելի շատ համատեքստ և ավելի արժեքավոր աշխատանքային հոսքերի հասանելիություն՝ պահպանելով պատշաճ վերահսկողությունը։
Կարողունակությունը ապահովում է առաջին կիրառումը։ Հուսալիությունը ԱԲ-ն դարձնում է աշխատանքի կատարման ձևի մաս։
Վերջնական հարցն այն է, թե արդյոք տնտեսագիտությունը բարելավվում է մասշտաբի աճի հետ։
Ընկերությունները կարող են սա չափել՝ ժամանակի ընթացքում հետևելով նույն աշխատանքային հոսքին։ Հետևեք, թե քանի առաջադրանք է բավարարել որակի շեմը, որքան է դրանց ավարտման ընդհանուր ծախսը և որքան է մեկ հաջող առաջադրանքի արժեքը։ Եթե ավարտված աշխատանքն աճում է ավելի արագ, քան ընդհանուր ծախսը, իսկ որակը պահպանվում կամ բարելավվում է, ԱԲ-ի վրա ծախսված յուրաքանչյուր դոլարն ավելի մեծ արժեք է ստեղծում։
Հաշվարկն այս հավասարման կենտրոնում է։
Հաշվարկը ապահովում է հետազոտությունը և ԱԲ-ի կատարած յուրաքանչյուր առաջադրանք։ Այն ձևավորում է արտադրանքի որակը, արագությունը, հուսալիությունը, հասանելիությունը և արժեքը։ Ուսուցման համար օգտագործվող հաշվարկը ստեղծում է ապագա հնարավորությունները։ Ինֆերենսի համար օգտագործվող հաշվարկը այսօր տալիս է օգտակար աշխատանք։ Երկուսն էլ պետք է վերածվեն հաճախորդների համար ավելի լավ արդյունքների։
Ավելի լավ մոդելները, ավելի արդյունավետ ինֆերանսը, հատուկ նպատակով ստեղծված սարքավորումները, ռեսուրսների ավելի բարձր օգտագործման մակարդակը, ավելի խելացի ուղղորդումը և ավելի ուժեղ արտադրանքի դիզայնը բարելավում են հաշվարկի վերադարձը։ Ենթակառուցվածքի յուրաքանչյուր սերունդ օգնում է ուսուցանել ավելի կարողունակ մոդելներ։ Ավելի լավ ալգորիթմները, սարքավորումները և ծրագրային ապահովումը հետո օգնում են այդ մոդելներն ավելի արդյունավետ սպասարկել։
Հաճախորդները այդ բարելավումները զգում են մարդկային տեսանկյունից՝ ավելի լավ պատասխաններ, ավելի արագ արդյունքներ, ավելի քիչ ուղղումներ, ավելի հուսալի արտադրանքներ և իրենց անհրաժեշտ աշխատանքի ավելի ցածր արժեք։
Ձեռքբերումները կուտակային բնույթ ունեն։ Ավելի լավ ենթակառուցվածքը արագացնում է հետազոտությունը։ Հետազոտությունը ստեղծում է ավելի կարողունակ և արդյունավետ մոդելներ։ Ավելի լավ մոդելները բարելավում են արտադրանքները։ Ավելի լավ արտադրանքները խթանում են ընդունումը, ուսուցումը և եկամուտը։ Այդ աճը աջակցում է հետազոտության, հաշվարկի, ներդրման և անվտանգության հաջորդ սերնդում շարունակական ներդրումներին։
OpenAI-ն այս բաղադրիչները միավորում է մեկ ընդհանուր բանականության հարթակի միջոցով։ Մարդիկ այն օգտագործում են ChatGPT‑ի և ChatGPT Work-ի միջոցով։ Մշակողները դրա հիման վրա կառուցում են Codex-ի և API-ի միջոցով։ Ձեռնարկությունները այն ներդնում են այն համակարգերում, որտեղ կատարվում է աշխատանքը։
Երբ մեկ շերտը բարելավվում է, յուրաքանչյուր արտադրանք և հաճախորդ կարող է օգտվել դրանից։
Այս չորս չափանիշները միասին ցույց են տալիս, թե արդյոք մեկ դոլարի դիմաց ստացվող օգտակար բանականությունը բարելավվում է:
Օգտակար աշխատանքը ցույց է տալիս, թե ինչ է ստեղծում ԱԲ-ն։ Հաջող առաջադրանքի արժեքը ցույց է տալիս, թե ինչ է պահանջվում արդյունքին հասնելու համար։ Հուսալիությունը ցույց է տալիս, թե աշխատանքի որ մասն են մարդիկ կարող վստահորեն օգտագործել։ Մասշտաբային արժեքը ցույց է տալիս, թե արդյոք յուրաքանչյուր դոլար և հաշվարկի յուրաքանչյուր միավոր ժամանակի ընթացքում ավելի շատ են կատարում։
Նպատակն այն է, որ ԱԲ-ն մարդկանց օգնի անել ավելի իմաստալից աշխատանք, կայացնել ավելի լավ որոշումներ և ավելի շատ ժամանակ հատկացնել իրենց աշխատանքի այն մասերին, որոնք պահանջում են բացառապես մարդկային դատողություն և ստեղծագործականություն։
Մեր գործն է յուրաքանչյուր սերնդի հետ բարելավել այդ հավասարումը՝ ավելի կարողունակ մոդելներ, ավելի արագ և հուսալի արդյունքներ և ավելի ցածր ծախսեր հաճախորդներին անհրաժեշտ աշխատանքի համար։
Այսպես է ԱԲ-ն ժամանակի ընթացքում ավելի օգտակար դառնում ավելի շատ մարդկանց և կազմակերպությունների համար։


