ԱԲ դարաշրջանի գնահատման քարտ
Հարցը, որ ամենուր լսում եմ ֆինանսական տնօրեններից, պարզ է. ինչպե՞ս ավելի մեծ արժեք ստանալ ԱԲ-ի վրա կատարած մեր ներդրումներից։
Տարիներ շարունակ շուկան ծրագրային ապահովման հաջողությունը չափում էր դրա կիրառման մակարդակով՝ գնված տեղեր, ակտիվ օգտատերեր, երկարաձգված լիցենզիաներ։ ՍԲ-ի արժեքը հասկանալու համար պետք է ավելի հզոր չափանիշ՝ կատարված աշխատանքը։
Ֆինանսական տնօրենների և այլ բիզնես ղեկավարների առջև կանգնած հիմնական տնտեսական հարցն այն է, թե արդյոք ԱԲ-ի կատարած աշխատանքի արժեքն ավելի արագ է աճում, քան դրա ստեղծման ծախսը։
Այդ հարցին պատասխանելու համար պետք է ավելի խորքային ցուցանիշներ դիտարկել, քան պարզապես մեկ թոքենի արժեքը։ Ավելի ցածր արժեքով մոդելը կարող է ունենալ ավելի էժան թոքեններ, բայց գերազանց արդյունքների համար կարող են պահանջվել ավելի շատ փորձեր, ավելի շատ ժամանակ կամ ավելի շատ մարդկային ստուգում։ Ավելի հզոր մոդելը կարող է ունենալ ավելի թանկ թոքեններ, բայց նույն առաջադրանքը կատարել մեկ փորձով։ Կարևորը հաջող արդյունք ստեղծելու ամբողջական ծախսն է՝ համեմատած այդ արդյունքի ստեղծած արժեքի հետ:
ԱԲ-ի դարաշրջանի վերջնական գնահատման քարտը կարելի է դիտարկել որպես «օգտակար բանականություն մեկ դոլարի դիմաց»։ Այս չափանիշը պատասխանում է չորս հիմնական հարցի.
- Արդյո՞ք ԱԲ-ն կատարում է կարևոր աշխատանք։
- Ի՞նչ արժե յուրաքանչյուր հաջող առաջադրանք։
- Մարդիկ կարո՞ղ են վստահել արդյունքին։
- Արդյո՞ք արհեստական բանականության վրա ծախսված յուրաքանչյուր դոլարը, դրա կիրառման ընդլայնմանը զուգընթաց, ստեղծում է ավելի մեծ արժեք։
Սկսեք հենց աշխատանքից։
Քանի՞ հաճախորդի խնդիր է ԱԲ-ն օգնել լուծել։ Քանի՞ կոդային փոփոխություն է այն օգնել թողարկել։ Քանի՞ պայմանագիր է այն վերանայել։ Որքա՞ն ժամանակ է այն խնայել մարդկանց համար։ Քանի՞ որոշում է դարձել ավելի արդյունավետ, որովհետև անհրաժեշտ տեղեկատվությունը հասանելի է եղել ճիշտ պահին:
Թոքեններն արժեք են ստեղծում, երբ վերածվում են մարդկանց կողմից օգտագործելի աշխատանքի: Քանի որ մոդելներն ավելի են հզորանում, կարող են ստանձնել ավելի երկար ու բարդ առաջադրանքներ՝ պահպանել համատեքստը, հիմնավորում կատարել մի քանի քայլով, աշխատել տարբեր գործիքներով և հարմարվել ընթացքին։
Սկսելու լավագույն տեղը մեկ աշխատանքային հոսքն է։ Սահմանեք, թե ինչ է նշանակում «կատարված», և չափեք այդ արդյունքը այն համակարգում, որտեղ կատարվում է աշխատանքը։
Աջակցման թիմի համար «կատարվածը» կարող է նշանակել հաճախորդի լուծված խնդիր։ Ինժեներական թիմի համար դա կարող է լինել կոդային փոփոխություն, որը անցնում է իր թեստերը։ Իրավաբանական թիմի համար դա կարող է նշանակել պայմանագիր, որը վերանայվել է ճշգրիտ և ժամանակին։
Պատկերացրեք ֆինանսական թիմ, որը պատրաստվում է կանխատեսման վերանայման։ Աշխատանքի մեծ մասը կատարվում է մինչև վերջնական որոշումը՝ գտնել վերջին կանխատեսումը, տվյալները տեղափոխել Excel կամ Sheets, գտնել փոփոխությունները, համադրել ներդիրները, նորից կազմել սլայդները և ստուգել, որ ամեն ինչ իդեալականորեն համընկնում է։
ChatGPT Աշխատանքը կարող է ստանձնել այդ գործընթացի մեծ մասը՝ թիմին ավելի շատ ժամանակ տալով կենտրոնանալու կարևոր հարցերի վրա. ի՞նչ փոխվեց։ Ինչո՞ւ։ Ի՞նչ պետք է անենք հաջորդիվ։
Սա գործնականում հենց օգտակար արհեստական բանականությունն է մեկ դոլարի դիմաց։ Ավելի շատ աշխատանք է ավարտվում, ավելի արագ, իսկ մարդիկ իրենց ժամանակի ավելի մեծ մասն ուղղում են դատողության, ստեղծագործականության և մասնագիտության կիրառմանը։
Հաջորդ հարցն է՝ ինչ արժե այդ աշխատանքը լավ ավարտելը։
ԱԲ-ի առաջադրանքները շատ տարբեր են։ Արագ պատասխանը կարող է քիչ հաշվարկ պահանջել։ Կոդավորման, հետազոտական կամ ֆինանսական աշխատանքային հոսքը կարող է ներառել ավելի խոր հիմնավորում, գործիքների օգտագործում և բազմաթիվ գործողություններ։ Այդ ավելի բարդ առաջադրանքները կարող են ավելի շատ հաշվարկ պահանջել, բայց նաև շատ ավելի մեծ արժեք ստեղծել։
Մոդելի մակարդակում հաջող առաջադրանքի արժեքը կախված է գնից, օգտագործված հաշվարկի ծավալից և ճիշտ արդյունքի հասնելու հավանականությունից։ Բիզնեսի համար ամբողջական ծախսը ներառում է նաև աշխատակիցների ժամանակը, մարդկային վերահսկումը, կրկնափորձերը և վերամշակումը։
Հաշվարկը պարզ է.
- Գումարեք աշխատանքը ավարտելու ամբողջական ծախսը։
- Հաշվեք այն առաջադրանքները, որոնք բավարարել են պահանջվող որակի շեմը։
- Ամբողջական ծախսը բաժանեք հաջող առաջադրանքների քանակի վրա։
Ահա թե ինչու թոքենի ամենացածր գինը միշտ չէ, որ տալիս է արդյունքի ամենացածր արժեքը։ Առաջադեմ մոդելը կարող է լավագույն արժեքը տալ նույնիսկ սովորական հարցման դեպքում, եթե ճիշտ պատասխանը տալիս է մեկ փորձով՝ նվազեցնելով կրկնափորձերը, ուշացումը, ստուգումը և ընդհանուր հաշվարկը։
Մոդելների բազմաշերտ ընտանիքը հաճախորդներին այս հավասարումը օպտիմալացնելու ավելի շատ եղանակներ է տալիս։ GPT‑5.6‑ը, որը թողարկեցինք անցյալ շաբաթ, ունի երեք մակարդակ. Sol-ը մեր առաջատարն է, Terra-ն հավասարակշռում է կատարողականությունն ու արժեքը, իսկ Luna-ն մեր ամենաարագ և ամենամատչելի մոդելն է։
Այս մակարդակները օգտակար մեկնարկային կետեր են։ Սակայն, ի վերջո, ճիշտ մոդելի ընտրությունը պետք է որոշվի ամբողջական առաջադրանքի տնտեսական արդյունավետությամբ: Հաճախորդը կարող է Luna-ն օգտագործել արագ, մեծածավալ հոսքի համար, Terra-ն՝ ավելի մեծ խորություն պահանջող աշխատանքի համար, կամ Sol-ը, երբ հզոր հիմնավորումը լավագույն արդյունքն է տալիս ավելի քիչ փորձերով։
Մենք GPT‑5.6‑ը վարժեցրել ենք այնպես, որ յուրաքանչյուր թոքենից ստացվի ավելի շատ օգտակար աշխատանք։ Artificial Analysis Coding Agent Index-ում GPT‑5.6 Sol-ը առավելագույն հիմնավորումով սահմանեց նոր առաջադեմ մակարդակ՝ օգտագործելով 54%-ով ավելի քիչ ելքային թոքեններ, քան մեկ այլ առաջատար մոդել։ Ստորև բերված գծապատկերը ցույց է տալիս համեմատությունը։
DeepSWE v1.1․ երկարաժամկետ ինժեներական առաջադրանքներ։ GPT‑5.6 Sol-ը գրանցում է նոր հզոր ցուցանիշ՝ 72,7%, գերազանցելով Claude Fable 5-ի 69,9%-ը՝ API-ի գնահատված ծախսը նվազեցնելով 36,2%-ով։
GPT‑5.6 ընտանիքի ամբողջ շարքում նպատակը նույնն է՝ ավելի շատ հաջող աշխատանք մեկ դոլարի դիմաց։ Ավելի բարձր արդյունավետությունը գոյություն ունեցող առաջադրանքները դարձնում է ավելի մատչելի։ Ավելի մեծ կարողությունը հնարավոր է դարձնում աշխատանքի բոլորովին նոր տեսակներ։
Մոդելների յուրաքանչյուր նոր սերունդ պետք է բարելավի այդ հավասարման երկու կողմերն էլ։ Հաճախորդները պետք է կարողանան ավելի արժեքավոր աշխատանք կատարել, մինչդեռ յուրաքանչյուր առաջադրանքի կատարման ծախսը շարունակում է նվազել։
Երրորդ չափանիշը հուսալիությունն է։
ԱԲ-ի ներդրումը սովորաբար խորանում է փուլերով։ Սկզբում ԱԲ-ն օգնում է սևագրել։ Հետո այն գտնում է համատեքստը և հիմնավորում է տարբեր գործիքների ու տվյալների միջով։ Ժամանակի ընթացքում այն սկսում է գործողություններ կատարել, մշակել բացառությունները և ավարտել աշխատանքային հոսքերը, իսկ մարդիկ անհրաժեշտ տեղերում ապահովում են դատողություն և վերահսկողություն։
Յուրաքանչյուր քայլ ավելի մեծ արժեք է ստեղծում և համակարգից ավելին է պահանջում։
Հուսալիությունն ունի ուղղակի տնտեսական արժեք։ Երբ արդյունքները ճշգրիտ են, հիմնավորված են վստահելի աղբյուրներով, հետևողական և ճիշտ ձևով փոխանցվում են ավելի բարձր մակարդակ, մարդիկ ավելի քիչ ժամանակ են ծախսում ստուգելու, ուղղելու և աշխատանքը կրկնելու վրա։ Հաջողությամբ ավարտված առաջադրանքներն ունեն ավելի ցածր արժեք, իսկ կազմակերպությունները վստահություն են ձեռք բերում ԱԲ-ն ավելի կարևոր աշխատանքային հոսքերում օգտագործելու համար։
Թիմերը կարող են սա կոնկրետացնել՝ հետևելով երեք արդյունքի.
- Պատրաստ է օգտագործման համար. արդյունքը ստացման պահին բավարարել է որակի շեմը։
- Ուղղման կարիք ունի. արդյունքը պահանջել է ևս մեկ փորձ կամ մարդկանց կողմից խմբագրումներ։
- Էսկալացման կարիք ունի. մարդու կողմից միջամտության և աշխատանքը ավարտելու անհրաժեշտություն է առաջացել։
Այս չափումներն ավելի հարուստ պատկեր են տալիս, քան միայն մոդելի ճշգրտությունը։ Դրանք ցույց են տալիս, որ ԱԲ-ն իսկապես նվազեցնում է արդյոք նախագծի ավարտման համար պահանջվող աշխատանքը։
Հուսալիությունը պահանջում է նաև հստակ սահմաններ։ Նախքան ԱԲ-ն սևագրումից անցնի գործողությունների կատարմանը, կազմակերպությունները պետք է սահմանեն.
- Ինչ տվյալների հասանելիություն կարող է ունենալ համակարգը։
- Ինչ համակարգեր կարող է այն օգտագործել կամ փոխել։
- Երբ պետք է մարդը վերանայի կամ հաստատի գործողությունը։
Անվտանգությունը, պաշտպանությունը, գաղտնիությունը և վերահսկողությունը ստեղծում են ավելի խորքային կիրառման հիմքը։ Մարդիկ պետք է հասկանան, թե ինչպես է համակարգը վարվում, ինչպես են մշակվում իրենց տվյալները և ինչպես են կառավարվում դրա գործողությունները։
ChatGPT Work-ը կառուցվում է ChatGPT Enterprise-ի անվտանգության, գաղտնիության, համապատասխանության և աշխատատարածքի կառավարման հիմքի վրա։ Սա կազմակերպություններին թույլ է տալիս ԱԲ-ին տալ ավելի շատ համատեքստ և ավելի արժեքավոր աշխատանքային հոսքերի հասանելիություն՝ պահպանելով պատշաճ վերահսկողությունը։
Կարողունակությունը ապահովում է առաջին կիրառումը։ Հուսալիությունը ԱԲ-ն դարձնում է աշխատանքի կատարման ձևի մաս։
Վերջնական հարցն այն է, թե արդյոք տնտեսագիտությունը բարելավվում է մասշտաբի աճի հետ։
Ընկերությունները կարող են սա չափել՝ ժամանակի ընթացքում հետևելով նույն աշխատանքային հոսքին։ Հետևեք, թե քանի առաջադրանք է բավարարել որակի շեմը, որքան է դրանց ավարտման ընդհանուր ծախսը և որքան է մեկ հաջող առաջադրանքի արժեքը։ Եթե ավարտված աշխատանքն աճում է ավելի արագ, քան ընդհանուր ծախսը, իսկ որակը պահպանվում կամ բարելավվում է, ԱԲ-ի վրա ծախսված յուրաքանչյուր դոլարն ավելի մեծ արժեք է ստեղծում։
Հաշվարկն այս հավասարման կենտրոնում է։
Հաշվարկը ապահովում է հետազոտությունը և ԱԲ-ի կատարած յուրաքանչյուր առաջադրանք։ Այն ձևավորում է արտադրանքի որակը, արագությունը, հուսալիությունը, հասանելիությունը և արժեքը։ Ուսուցման համար օգտագործվող հաշվարկը ստեղծում է ապագա հնարավորությունները։ Ինֆերենսի համար օգտագործվող հաշվարկը այսօր տալիս է օգտակար աշխատանք։ Երկուսն էլ պետք է վերածվեն հաճախորդների համար ավելի լավ արդյունքների։
Ավելի լավ մոդելները, ավելի արդյունավետ ինֆերանսը, հատուկ նպատակով ստեղծված սարքավորումները, ռեսուրսների ավելի բարձր օգտագործման մակարդակը, ավելի խելացի ուղղորդումը և ավելի ուժեղ արտադրանքի դիզայնը բարելավում են հաշվարկի վերադարձը։ Ենթակառուցվածքի յուրաքանչյուր սերունդ օգնում է ուսուցանել ավելի կարողունակ մոդելներ։ Ավելի լավ ալգորիթմները, սարքավորումները և ծրագրային ապահովումը հետո օգնում են այդ մոդելներն ավելի արդյունավետ սպասարկել։
Հաճախորդները այդ բարելավումները զգում են մարդկային տեսանկյունից՝ ավելի լավ պատասխաններ, ավելի արագ արդյունքներ, ավելի քիչ ուղղումներ, ավելի հուսալի արտադրանքներ և իրենց անհրաժեշտ աշխատանքի ավելի ցածր արժեք։
Ձեռքբերումները կուտակային բնույթ ունեն։ Ավելի լավ ենթակառուցվածքը արագացնում է հետազոտությունը։ Հետազոտությունը ստեղծում է ավելի կարողունակ և արդյունավետ մոդելներ։ Ավելի լավ մոդելները բարելավում են արտադրանքները։ Ավելի լավ արտադրանքները խթանում են ընդունումը, ուսուցումը և եկամուտը։ Այդ աճը աջակցում է հետազոտության, հաշվարկի, ներդրման և անվտանգության հաջորդ սերնդում շարունակական ներդրումներին։
OpenAI-ն այս բաղադրիչները միավորում է մեկ ընդհանուր բանականության հարթակի միջոցով։ Մարդիկ այն օգտագործում են ChatGPT‑ի և ChatGPT Work-ի միջոցով։ Մշակողները դրա հիման վրա կառուցում են Codex-ի և API-ի միջոցով։ Ձեռնարկությունները այն ներդնում են այն համակարգերում, որտեղ կատարվում է աշխատանքը։
Երբ մեկ շերտը բարելավվում է, յուրաքանչյուր արտադրանք և հաճախորդ կարող է օգտվել դրանից։
Այս չորս չափանիշները միասին ցույց են տալիս, թե արդյոք մեկ դոլարի դիմաց ստացվող օգտակար բանականությունը բարելավվում է:
Օգտակար աշխատանքը ցույց է տալիս, թե ինչ է ստեղծում ԱԲ-ն։ Հաջող առաջադրանքի արժեքը ցույց է տալիս, թե ինչ է պահանջվում արդյունքին հասնելու համար։ Հուսալիությունը ցույց է տալիս, թե աշխատանքի որ մասն են մարդիկ կարող վստահորեն օգտագործել։ Մասշտաբային արժեքը ցույց է տալիս, թե արդյոք յուրաքանչյուր դոլար և հաշվարկի յուրաքանչյուր միավոր ժամանակի ընթացքում ավելի շատ են կատարում։
Նպատակն այն է, որ ԱԲ-ն մարդկանց օգնի անել ավելի իմաստալից աշխատանք, կայացնել ավելի լավ որոշումներ և ավելի շատ ժամանակ հատկացնել իրենց աշխատանքի այն մասերին, որոնք պահանջում են բացառապես մարդկային դատողություն և ստեղծագործականություն։
Մեր գործն է յուրաքանչյուր սերնդի հետ բարելավել այդ հավասարումը՝ ավելի կարողունակ մոդելներ, ավելի արագ և հուսալի արդյունքներ և ավելի ցածր ծախսեր հաճախորդներին անհրաժեշտ աշխատանքի համար։
Այսպես է ԱԲ-ն ժամանակի ընթացքում ավելի օգտակար դառնում ավելի շատ մարդկանց և կազմակերպությունների համար։


