Անցնել հիմնական բովանդակությանը
OpenAI

Հետազոտությունների արագացում․ հայացք OpenAI-ի ներսից

Բեռնվում է…

Որպեսզի AGI-ն օգուտ բերի ողջ մարդկությանը, այն, մեր համոզմամբ, պետք է կառավարվի ժողովրդավարական ճանապարհով։ Սա պահանջում է իրազեկ հանրային բանավեճ հզոր ԱԲ համակարգերի կարողությունների, ռիսկերի և պաշտպանական միջոցների շուրջ։ Ամենուր մարդիկ պետք է հասկանան առաջադեմ ԱԲ-ի զարգացման հավանական ուղին՝ դրա վրա իրական ազդեցություն ունենալու համար։

Կոնկրետ ռիսկերի, միջադեպերի և պաշտպանական միջոցների թափանցիկությունը անհրաժեշտ է, բայց ոչ բավարար։ Հանրությունը պետք է նաև հասկանա, թե առաջադեմ լաբորատորիաներում ինչպես են զարգանում հզորագույն համակարգերն ու խթանում հետազոտությունները։

Մեր նպատակն է անվտանգ ստեղծել ավտոմատացված ԱԲ հետազոտող, որը մարդու հսկողությամբ կզարգացնի խորքային ուսուցումն ու մարդկային նպատակներին համապատասխանեցումը՝ ապահովելով հաջորդական բարելավումներ։ Մեր չափումներով՝ հասել ենք անցյալ աշնանը հայտարարված⁠(բացվում է նոր պատուհանում) նպատակին՝ մինչև այս սեպտեմբեր ունենալ ավտոմատացված հետազոտող-պրակտիկանտ։ «Հետազոտող-պրակտիկանտը» մարդու ղեկավարությամբ հստակ հետազոտական առաջադրանքներ կատարող համակարգ է, այդ թվում՝ հմուտ հետազոտողից մի քանի օր պահանջող։ Մեծ առաջընթաց ենք գրանցում մինչև 2028-ի մարտ ավտոմատացված ԱԲ հետազոտող ստեղծելու ուղղությամբ։

Այս տարի OpenAI-ի հետազոտողների առօրյա աշխատանքը զգալիորեն փոխվել է։ Նրանք ողջ օրը կոդավորման ագենտներ են օգտագործում, հաճախ՝ զուգահեռ աշխատաշրջաններում։ Ընդհանուր օգտագործումը արագ աճում է՝ գերազանցելով OpenAI-ի մյուս թիմերի աճը։ Հետազոտողներն ավելի արագ են կոդ ավելացնում և ավելի շատ փորձեր անցկացնում։ Փոխվում են նաև օգտագործման ձևերը․ ագենտները կատարում են ավելի բարդ առաջադրանքներ և ավելի հաճախ հաջողում։ ԱԲ հետազոտությունը բարդ գործընթաց է՝ բազմաթիվ հնարավոր խոչընդոտներով, ուստի ընդհանուր առաջընթացը հավանաբար չի հասնի այս ցուցանիշների աճի տեմպին։ Բայց արդյունքները համահունչ են մեր շատ աշխատակիցների տպավորությանը, որ ագենտային գործիքները զգալիորեն արագացնում են հետազոտությունները։ Դեռ մարդիկ են որոշում հետազոտական առաջնահերթությունները, ընտրում զարգացվելիք գաղափարներն ու արդյունքները և որոշում՝ մասշտաբավորել, դադարեցնել, թե ներդնել համակարգերը։

Պատասխանատու մոտեցմամբ ավտոմատացված ԱԲ հետազոտությունը, մեր համոզմամբ, կստեղծի մարդու բարեկեցությունը բարձրացնող և OpenAI-ի առաքելությանը նպաստող մոդելներ։ Այն կարող է նվազեցնել առաջադեմ բանականության արժեքը՝ օգուտ բերելով մարդկանց ամբողջ աշխարհում։ Այս աշխատանքը մասամբ անում ենք, քանի որ ավտոմատացված հետազոտությունը կարող է լուծել համապատասխանեցման խնդիրը և պաշտպանություն ստեղծել ավելի հզոր ԱԲ-ի դեմ։ Ավտոմատացված ԱԲ հետազոտողը կարող է ուսումնասիրել նաև անվտանգությունն ու համապատասխանեցումը։ Ավելի կարող, համապատասխանեցված համակարգերը կարող են պաշտպանել կարևոր ենթակառուցվածքները վտանգավոր ԱԲ ագենտներից և ստեղծել նոր պաշտպանական միջոցներ։

Սրանք ավտոմատացված հետազոտությունը զարգացնելու հիմքեր են, բայց չեն նշանակում, որ արագ RSI-ն անպայման պետք է լինի մեր նպատակը։ Շարունակելու որոշումն ու եղանակը պետք է կախված լինեն մարդկային վերահսկողությունը պահպանելու կարողությունից և օգուտների ու ռիսկերի մասին իրազեկ ժողովրդավարական ընտրությունից։

Դեռ չգիտենք՝ ինչպես անվտանգ հասնել լիարժեք, համապատասխանեցված RSI-ի։ Աշխատում ենք կարողություններին զուգահեռ ընդլայնել համապատասխանեցման և անվտանգության միջոցները։ Բայց չենք կարող ենթադրել, որ դրանք նույն տեմպով կզարգանան․ ավելի կարող համակարգերը կարող են ավելի դժվար վերահսկվել։ Առանցքում համապատասխանեցման և անվտանգության հետևողական աշխատանքն է՝ սկսած Ագենտային կոդավորման համակարգերում առկա անվտանգության խնդիրների չափումից ու նվազեցումից։ Անընդունելի ռիսկ հայտնաբերելիս կձեռնարկենք համապատասխան քայլեր՝ նաև դանդաղեցնելով կամ դադարեցնելով այն համակարգերի մշակումն ու ներդրումը, որոնց բավարար անվտանգությունը չենք կարող ապահովել։

Hugging Face-ի վերջին միջադեպից հետո իրագործեցինք այս հանձնառությունը⁠՝ դադարեցնելով ներդրվելիք վերջին մոդելների ամրապնդումով ուսուցումը (RL), մինչ ամրապնդում և հարձակողական փորձարկման էինք ենթարկում հետազոտական միջավայրերն ու ընդլայնում մշտադիտարկումը։ Բոլոր հետազոտությունները չդադարեցին․ որոշ աշխատանքներ վերսկսվեցին ուժեղացված հսկողությամբ, մյուսները մնացին դադարեցված։ Բարձրացրել ենք անվտանգության ու համապատասխանեցման չափանիշները՝ դրանք խորացնելով մոդելի կենսացիկլում և ողջ ուսուցման ընթացքում պահանջելով համապատասխան վարքագծի ավելի համոզիչ ապացույցներ։

Այսօր մանրամասն ներկայացնում ենք վերջին ամիսներին ագենտային համակարգերի ներդրումը դեպի RSI մեր առաջընթացում։ Ագենտային համակարգերը նոր են ու արագ փոփոխվող, իսկ մեր չափումները դեռ նախնական են։ Կիսվելով նախնական արդյունքներով ու մեթոդներով՝ ուզում ենք իրազեկել հանրությանը, խրախուսել բացահայտումների մշակույթը և նպաստել չափման ընդհանուր չափանիշների ձևավորմանը։

Ինչպես նշել ենք մեր առաջադեմ ԱԲ քաղաքականության ծրագրում⁠, մեզ և մյուս ընկերություններին պետք է պարտավորեցնել հրապարակայնորեն հետևել դեպի RSI առաջընթացին։ Նույնիսկ առանց նման պահանջի՝ մտադիր ենք շարունակել թափանցիկ ներկայացնել դեպի RSI մեր առաջընթացը։ Չափման մեթոդների և պատկերացումների բարելավմանը զուգընթաց կզարգացնենք թափանցիկության մոտեցումը՝ նաև պաշտպանելով անվտանգությունն ու սեփականության իրավունքով պաշտպանված տեղեկությունները։

1. Կոդավորման ագենտները փոխում են OpenAI-ի հետազոտողների առօրյան

Տարեսկզբին OpenAI-ի՝ ըստ ագենտների օգտագործման մեդիանային հետազոտողը կոդավորման ագենտներ քիչ էր օգտագործում։ Օգոստոսի կեսին նա արդեն ամեն օր ագենտներ էր օգտագործում՝ API-ի գներով օրական ավելի քան $600-ի հաշվարկներ կատարելով։ Մեր հետազոտական ստորաբաժանման 90-րդ պերսենտիլի օգտատերն այժմ օրական ավելի քան $7,000-ի թոքեն է օգտագործում։

Մինչև 2026-ի հունիսը հետազոտական ստորաբաժանման ագենտների ընդհանուր աշխատաժամանակը դեռ պակաս էր մարդկայինից։ Այժմ պատկերը փոխվել է։ Օգոստոսի կեսի դրությամբ, ստանդարտ 8-ժամյա աշխատանքային օրերով հաշված, հետազոտական ստորաբաժանումը մարդու մեկ աշխատանքային օրվա դիմաց օգտագործում է ագենտի 3.1 աշխատանքային օր։

Մեկ այլ ցուցիչ է, թե քանի հետազոտող է կիրառում խիստ զուգահեռ աշխատանքային հոսքեր, օրինակ՝ միաժամանակ 4 կամ ավելի ագենտ գործարկելով։ Ինչպես երևում է ստորև, այս թիվն աճում է։ Այս թվերը ներառում են թե՛ օգտատիրոջ գործարկած ագենտների, թե՛ դրանց ստեղծած ենթաագենտների օրական առավելագույն քանակները։

2. Հետազոտողներն ավելի շատ կոդ են գրում և փորձեր անցկացնում

ԱԲ հետազոտության մեծ մասը աշխատատար գործընթաց է՝ մեր հիմնական մոդելներից մեկի բանականությունը կամ արդյունավետությունը բարելավելու նպատակով։ Առաջընթացի համար բոլոր քայլերը պետք է հաջողվեն․ նախագծել բարելավումներ, գրել գնահատման թեստեր և լայնածավալ փորձարկման ենթակառուցվածք, ուսուցման ընթացքում հայտնաբերել վրիպակներն ու վտանգավոր կամ չհամապատասխանեցված վարքագիծը, հաջող գաղափարները ներառել հիմնական ուսուցման մեջ։ Ցանկացած փուլի ձախողում կարող է սահմանափակել ողջ հետազոտական ցիկլը։

Կոդ գրելն ու փորձեր անցկացնելը հետազոտողների երկու հիմնական աշխատանքներն են, և տվյալները վկայում են դրանց արագացման մասին։

Այս ցուցանիշները համեմատաբար հեշտ է չափել, բայց դժվար՝ մեկնաբանել։ Ավտոմատացմանը զուգընթաց՝ ամենաքիչ ավտոմատացվող առաջադրանքները կպահանջեն հետազոտողների ջանքերի ավելի մեծ մասը՝ դառնալով առաջընթացի գլխավոր խոչընդոտները։ Հաշվողական ռեսուրսները ևս սահմանափակող գործոն են, որի դերը կարող է մեծանալ մյուս խոչընդոտների նվազմանը զուգընթաց։

2026-ին մեկ ակտիվ փորձարարի հաշվով փորձերն ավելացել են․ օգոստոսին գրանցվել է առավելագույնը՝ 2025-ի հունվարից չափումների մեկնարկից ի վեր։ Սա կապված է Codex-ի տարածման հետ, թեև 2025-ից մեր հաշվողական ռեսուրսները ևս զգալիորեն աճել են։

3. Փոխվում է ագենտներին վստահվող աշխատանքը

Տպավորություններն ու ներքին տվյալները ցույց են տալիս, որ կոդավորման ագենտներին ավելի հաճախ են վստահվում բարձր մակարդակի և երկարատև առաջադրանքներ։

Միտումը պարզելու համար վերլուծել ենք վերջին օգտագործումը՝ ըստ Epoch AI-ի վերջերս հրապարակված դասակարգման⁠(բացվում է նոր պատուհանում), որն ընդգրկում է ԱԲ հետազոտության և մշակման աշխատանքները։ O*NET աշխատանքների դասակարգման համակարգից ներշնչված այս մոտեցումը հարմարեցված է առաջադեմ ԱԲ հետազոտությանն ու մշակմանը՝ վեց հիմնական փուլով․

  1. Որոշում․ ինչի վրա աշխատել, ինչ շարունակել, ուր հատկացնել ռեսուրսներ

  2. Նախագծում․ հետազոտական գաղափարներ և տեխնիկական պահանջներ

  3. Ստեղծում․ կոդ և տվյալաշարեր

  4. Գործարկում․ ուսուցում, գնահատում, սարքավորում, սպասարկում

  5. Վերլուծություն․ փորձեր, մոդելներ, ներդրում, արտաքին աշխատանք

  6. Հաղորդակցում․ արդյունքներ, արձագանքներ, ընթացք, որոշումներ

Ստորև կոդավորման ագենտների թոքենները դասակարգում ենք այս մոտեցմամբ։

2026-ի հունվարից օգոստոս աճել են հետազոտական գործունեության բոլոր կատեգորիաները։ Հունվարին գերակշռում էր հետազոտական և ենթակառուցվածքային կոդը։ Այս կատեգորիան ընդլայնվել է, բայց զգալիորեն աճել են նաև մյուսները, հատկապես՝ տեխնիկական աջակցությունն ու գործարկումների մշտադիտարկումը։ Բարձր մակարդակի պլանավորումը դեռ ագենտների ելքային թոքենների չնչին մասն է։

Գործընկերները նշում են, որ ագենտները գերազանց են լուծում ներքին հետազոտական ենթակառուցվածքի խնդիրները՝ վերացնելով առաջընթացի էական խոչընդոտներից մեկը։ Փորձերի խնդիրները լուծելու համար խորհրդատվական ժամեր անցկացնող մի քանի թիմեր 2026-ին նկատել են հաճախումների անկում։ Մեկը դադարեցրել է հանդիպումները՝ կենտրոնանալով համակարգի այլ բարելավումների վրա։

Այստեղ ներկայացնում ենք օրական հիմնական գրառումների թիվը ներքին գլխավոր ալիքներից մեկում, որտեղ հետազոտողները այլ թիմերից տեխնիկական աջակցություն են խնդրում։ Մեր տեղեկություններով՝ ակտիվության անկումը չի փոխհատուցվել հարցումները մարդկանց սպասարկած այլ աջակցության ալիք տեղափոխելով։ Հաղորդագրությունների նվազումը համահունչ է այս ընդհանուր փոփոխությանը։

Կարող ենք նաև ուսումնասիրել՝ արդյոք ագենտները հաջողությամբ կատարում են հետազոտողների առաջադրանքները։ Ագենտային դասակարգիչով պարզել ենք, որ հունվարից հուլիս հստակ ելքով առաջադրանքների հաջողությունը հիմնականում աճել է բարդության մի քանի խմբերում՝ ըստ մարդու համար գնահատված տևողության։ Սակայն հաջողելու համար ագենտներին դեռ զգալի մարդկային ուղղորդում է պետք, հատկապես՝ բարդ առաջադրանքներում։ Վերջին 6 ամսում հաջողված 4–8 ժամանոց առաջադրանքների կեսից ավելին պահանջել է առնվազն մեկ միջամտություն։

Հետազոտողների առաջադրանքների հաջողության ցուցանիշները ժամանակի ընթացքում աճել են։ Գրաֆիկից բացառված են անորոշ ելքով դասակարգումները և <50 աշխատաշրջան կամ <50 եզակի օգտատեր ունեցող կետերը։

Առաջադրանքների հաջողության և միջամտության ցուցանիշները հունվարից հուլիս՝ ըստ ժամանակային հորիզոնի։ Չեն ներառվում այն դասակարգումները, որոնց ելքն անորոշ էր։

4. Մոդելների մշակման տեմպի կարգավորում

Անվտանգ և օգտակար AGI-ի համար ավելի կարող համակարգերի ստեղծման առաջընթացը կախված կլինի նաև այդ աշխատանքի համար անհրաժեշտ պաշտպանական միջոցներից։ Ռիսկերի մասին ավելին իմանալուն զուգընթաց՝ անհրաժեշտ պաշտպանական միջոցների մեր գնահատականը կարող է փոխվել։

Ինչպես արդեն նկարագրել ենք,⁠ վերջերս թարմացրել ենք մշտադիտարկման, մարդկային նպատակներին համապատասխանեցման և պաշտպանվածության մեր չափանիշները։ Այստեղ ցույց ենք տալիս, թե վերջին սահմանափակումներն ինչպես են ազդել հետազոտական գործունեության մի կողմի վրա։

*Հուլիսի 20-ից օգոստոսի 6-ն այստեղ ներկայացված Astra-ի հաշվողական ռեսուրսների մեծ մասը նախատեսված էր անվտանգության և պաշտպանվածության բարելավումների ներդրումը փորձարկելու համար։

Հուլիսի 20-ին, հայտնաբերելով, որ ագենտները խախտել են մեր հետազոտական ենթակառուցվածքի պաշտպանությունը, ժամանակավորապես անջատեցինք ուսուցման համար օգտագործվող կոնտեյներային ծառայությունը, ապա վերականգնեցինք այն՝ էական լրացուցիչ սահմանափակումներով։

Արդյունքում RL ուսուցման հաշվողական ռեսուրսները կտրուկ նվազեցին, մինչ թիմերը վերակազմակերպում էին աշխատանքը՝ ուժեղացված պաշտպանությամբ հետազոտական միջավայրում գործելու համար։ Վերևի գրաֆիկը ներառում է ներդրման համար նախատեսված մեր վերջին մոդելների ամրապնդումով ուսուցման երկշաբաթյա դադարը։ Հուլիսի 20-ից օգոստոսի 6-ը Astra դասի RL փորձերի գործարկումների մեծ մասը՝ ըստ GPU հատկացումների, նախատեսված էր անվտանգության և պաշտպանվածության բարելավումների ներդրումը փորձարկելու համար։

Օգոստոսի 7-ին նախնական տվյալները, որ Astra-ն մեր Պատրաստվածության շրջանակի⁠(բացվում է նոր պատուհանում) համաձայն կարող է ունենալ կրիտիկական կիբեռկարողություններ⁠, հանգեցրին այդ մոդելին հատուկ լրացուցիչ պաշտպանական սահմանափակումների։ Դրանք պահանջում էին Astra մոդելը գործարկել ավելի բարձր պաշտպանվածությամբ հետազոտական միջավայրերում։ Հաջորդ շաբաթ Astra դասի GPU հատկացումները նվազեցին ևս 59.2 տոկոսով, իսկ մյուս դասերի մոդելներինը աճեցին 17.2 տոկոսով։ Այդ աճը փոխհատուցեց Astra դասի նվազման մոտ 85 տոկոսը՝ վերլուծված RL աշխատանքներին հատկացված ընդհանուր ռեսուրսները թողնելով գրեթե անփոփոխ։ Այս պատկերը համահունչ է այն ենթադրությանը, որ Astra-ի հետ աշխատանքը սահմանափակված լինելու ընթացքում ուսուցման և փորձարկումների մի մասը տեղափոխվել է այլ մոդելների վրա։ Դա համապատասխանում է նաև հետազոտողների առանձին հաղորդումներին, որ նրանք այլ կիրառություններ են գտել այն ռեսուրսների համար, որոնք այլևս չէին կարող օգտագործվել նոր սահմանափակումների տակ ընկնող աշխատանքներում։

Այս տվյալները կարևոր հուշում են ուսուցման և անվտանգության շուրջ քննարկումների համար․ նոր վերահսկողության միջոցների ներդրումից հետո էլ հաշվողական ռեսուրսները մնում են արժեքավոր և ճկուն, ու բնականորեն ուղղվում են հետազոտական գործունեության այլ կիրառությունների։ Երկարաժամկետ հեռանկարում ԱԲ առաջընթացի տեմպի քննարկումները պետք է ընդգրկեն նաև այն հարցը, թե ինչպես լավագույնս օգտագործել նոր կամ առաջարկվող վերահսկողության ենթակա հաշվողական ռեսուրսները։

5. Հետագա ուղին

Մարդկային նպատակներին համապատասխանեցված RSI-ի ուղղությամբ առաջընթացն ու դրա ըմբռնումը կարևոր են մեր առաքելության համար։ Կշարունակենք կատարելագործել մեր մեթոդները, ներկայացնել մեր զարգացող պատկերացումները և նպաստել առաջադեմ համակարգերի շուրջ իրազեկ հանրային բանավեճին ու իրական ժողովրդավարական կառավարմանը։

Հավելված․ այս հրապարակման մեթոդները

Ագենտների օգնությամբ ԱԲ հետազոտությունը դեռ նոր է, և մենք դեռ սովորում ենք չափել այն։ Որոշ ցուցանիշներ, օրինակ՝ մեր հետազոտական թիմերի ստեղծած կոդի ծավալը, համեմատաբար հեշտ է հավաքել, բայց դժվար է մեկնաբանել, քանի որ դրանց կապը հետազոտական առաջընթացի հետ հստակ չէ։ Հետազոտական առաջընթացն ավելի ուղղակիորեն արտացոլող ցուցանիշները, օրինակ՝ որքան հաճախ են ագենտները հաջողությամբ կատարում հետազոտողների առաջադրանքները, կարող են ավելի օգտակար լինել, բայց դրանց մշակումն ու վավերացումը բարդ են։ Լրացուցիչ դժվարություն է այն, որ հետազոտողների օգտագործած գործիքներն ու համակարգերն արագ զարգանում են։ Հետազոտությունների արագացման մասին մեր պատկերացումների խորացումը OpenAI-ի կարևոր ուղղություններից է։

Այս վերլուծություններում, եթե այլ բան նշված չէ՝

  • «Հետազոտողը» լայն եզրույթ է, որը ներառում է մեր հետազոտական ստորաբաժանման ցանկացած անդամի, այդ թվում՝ հետազոտական ենթակառուցվածք ստեղծողներին, նախագծեր կառավարողներին կամ այլ կերպ գործունեությանն աջակցողներին։

  • Կոդավորման ագենտների օգտագործման ցուցանիշներն ընդգրկում են օգտագործման մեծ մասը, բայց ոչ ամբողջը՝ հաշվի առնելով հետազոտողների գործիքների և համակարգերի արագ զարգացումը։