Անցնել հիմնական բովանդակությանը
OpenAI
Բեռնվում է…

Այսօր թողարկում ենք GPT‑6 Astra-ն՝ մինչ օրս մեր լայնորեն ներդրված ամենաբարձր կարողություններով մոդելը։ Astra-ն մեր առաջին մոդելն է, որը Պատրաստվածության շրջանակի համաձայն հասել է կիբեռանվտանգության կարողությունների «Կրիտիկական» մակարդակին։

Այս թողարկման անվտանգության մասին ամենակարևոր տեղեկությունները հետևյալն են․

  1. GPT‑6 Astra-ն էապես առաջադիմել է կիբեռկարողությունների առումով և հասել է մեր «Կրիտիկական» շեմին։ Սա նշանակում է, որ համապատասխան գործիքների և հասանելիության առկայության դեպքում GPT‑6 Astra-ն կարող է նախկինում անհայտ անվտանգության խոցելիություններ գտնել և բազմաթիվ լավ պաշտպանված համակարգերում մշակել դրանք շահագործելու նոր եղանակներ՝ առանց յուրաքանչյուր քայլում մարդու ուղղորդման։ Ուստի մենք էապես ուժեղացրել ենք մոդելի վնասակար կիբեռգործողությունները կանխող պաշտպանական միջոցները՝ անկախ նրանից՝ նման գործողությունները չարաշահման, թե անհամապատասխանեցվածության հետևանք են։ Մենք նաև միջոցներ ենք ձեռնարկել Astra-ի և նմանատիպ մոդելների ներքին մշակումն ու ներդրումն անվտանգ դարձնելու համար, այդ թվում՝ կիրառելով ավելի խիստ մեկուսացում, ստուգակետերի գաղտնագրում, գործողությունների ամբողջական շղթաների, ներառյալ մտքերի շղթաների (CoT), համընդհանուր մշտադիտարկում և ներքին օգտագործումից առաջ համապատասխանեցման արգելափակող գնահատման գործընթաց։
  2. GPT‑6 Astra-ն զգալիորեն ավելի դիմակայուն է, քան իր նախորդները։ Անվտանգության դիմակայունությունն ամրապնդող ուսուցման նոր մեթոդների շնորհիվ GPT‑6 Astra-ն զգալիորեն ավելի դիմակայուն է պաշտպանական սահմանափակումների շրջանցման փորձերի նկատմամբ, քան GPT‑5.6 Sol-ը, այդ թվում՝ գործողությունների ավելի երկար շղթաների դեպքում։ Դա հաստատում են մեր անցանց թեստերը և հաքերային հարձակման գործընթացների խիստ ներքին ու արտաքին փորձարկման և հայտնաբերված խնդիրների վերացման ծրագիրը։ Հնարավոր բարձր ռիսկայնություն ունեցող օգտատերերի դեպքում մոդելը լրացուցիչ ուսուցանել ենք այնպես, որ հնարավոր լինի դրա մերժման սահմանն ավելի պահպանողական դարձնել և ընդգրկել երկակի օգտագործման ռիսկերի ավելի լայն շրջանակ։ Հետընթացային թեստավորման միջոցով համոզվում ենք, որ Astra-ն դիմակայուն է նախորդ փորձարկումներում հայտնաբերված հաքերային հարձակման գործընթացների նկատմամբ։ Մեր բարելավումները հաստատելու համար նաև ավտոմատ նախափորձարկման նոր փուլեր ենք անցկացրել՝ օգտագործելով մեր նորագույն ներքին հակառակորդային մոդելները։
  3. GPT‑6 Astra-ն ավելի լավ է համապատասխանեցված, քան GPT‑5.6 Sol-ը։ Astra-ն զգալի առաջընթաց է մոդելի համապատասխանեցման ոլորտում և ներառում է բարելավումներ, որոնք ընդգրկում են ամեն ինչ՝ նախնական ուսուցման տվյալների կազմից մինչև ամրապնդմամբ ուսուցման ընթացքում կիրառվող գնահատումը։ Ներկայացնում ենք համապատասխանեցման գնահատումների նոր փաթեթ(բացվում է նոր պատուհանում) և պարզել ենք, որ GPT‑6 Astra-ն ավելի հուսալիորեն է պահպանում անվտանգության և ապահովության սահմանները և գործում է իրեն լիազորված շրջանակում։ Ավելի քան 54,000 ներքին Codex առաջադրանք(բացվում է նոր պատուհանում) ընդգրկող մոդելավորման ընթացքում Astra-ն ավելի ծանր անհամապատասխան վարքի համար մոտ երկու անգամ ավելի քիչ նշումներ է ստացել, քան Sol-ը։
  4. Մենք լայնորեն ներդնում ենք անհամապատասխանեցվածության մշտադիտարկումը։ Մոդելի համապատասխանեցումը համարում ենք մեր մոդելների հնարավոր անհամապատասխան վարքը կանխելու հիմնական միջոցը։ Այնուամենայնիվ, մշտադիտարկումը լայն պատկերացում է տալիս առաջադեմ մոդելի վարքի մասին՝ բացահայտելով համապատասխանեցումն ու անվտանգությունն էլ ավելի բարելավելու հնարավորությունները։ Բացի այդ, այն պաշտպանության լրացուցիչ շերտ է ապահովում հայտնաբերված անհամապատասխան վարքից։ Այդ պատճառով Astra-ի արտաքին ներդրման շրջանակում գործիքների օգտագործմամբ կատարվող բոլոր արտածման գործընթացների համար ավելացրել ենք անհամապատասխանեցվածության մշտադիտարկում՝ դրա համար հատկացնելով զգալի հաշվողական ռեսուրսներ։ Այս համակարգը համանման է մեր ներքին համակարգին։
  5. GPT‑6 Astra-ի մշտադիտարկելիությունը նվազել է GPT‑5.6 Sol-ի համեմատ։ Մենք մանրամասն ուսումնասիրել ենք GPT‑6 Astra-ի մշտադիտարկելիությունը(բացվում է նոր պատուհանում) և կառավարելիությունը(բացվում է նոր պատուհանում)։ Պարզել ենք, որ GPT‑6 Astra-ն GPT‑5.6 Sol-ից ավելի լավ է կարողանում կառավարել իր մտքերի շղթան (CoT) և ավելի քիչ հավանականությամբ է դրանում ներառում իրեն վարկաբեկող տեղեկություններ։ Հակառակորդային պայմաններում, երբ մոդելին դրդում ենք խուսափել մեր մշտադիտարկիչներից, այն կարողանում է աննկատ մնալ՝ գնահատումներում ռազմավարականորեն ցածր արդյունք ցուցադրելիս («խելամիտ թաքցնում»), իսկ որոշակի խափանարար առաջադրանքներ(բացվում է նոր պատուհանում) կատարելու հրահանգ ստանալիս երբեմն կարողանում է խուսափել մեր ներքին մշտադիտարկիչներից։ Մենք չենք հայտնաբերել ստենոգրաֆիկ CoT դատողության ապացույցներ (օրինակ՝ թաքնված դատողությունը սովորական և առերևույթ անկապ տեքստում քողարկելու դեպքեր)։ Սա ցույց է տալիս, որ շրջանցման ռիսկը կարող է հիմնականում սահմանափակվել ավելի ցածր մակարդակի դատողություն պահանջող առաջադրանքներով։
    • Այս արդյունքները ցույց են տալիս, որ Astra դասի մոդելները հակառակորդային պայմաններում կարող են շրջանցել մեր CoT մշտադիտարկիչները։ Առայժմ այս արդյունքները հիմնականում հիմնված են հակառակորդային գնահատումների վրա (այսինքն՝ երբ մոդելին հրահանգում ենք խուսափել մշտադիտարկումից)։ Միևնույն ժամանակ, համապատասխանեցման մեր գնահատումները ցույց են տալիս, որ Astra-ն ընդհանուր առմամբ GPT‑5.6 Sol-ից ավելի քիչ հավանականությամբ է խախտում ապահովության և անվտանգության սահմանափակումները։
    • Այնուամենայնիվ, մենք լրջորեն ենք վերաբերվում այս միտմանը և, մեր մոդելների կարողությունների աճին զուգահեռ, շարունակում ենք ուսումնասիրել այս արդյունքներն ու մշտադիտարկելիության վրա դրանց ազդեցությունը։ OpenAI-ն աշխատել է մտքերի շղթայի մշտադիտարկումը պահպանելու և օգտագործելու ուղղությամբ, իսկ CoT-ի մշտադիտարկելիության պահպանումը հետազոտական ծրագրի առանցքային նպատակներից է։ Սակայն այս արդյունքները նաև ընդգծում են համապատասխանեցման աուդիտի այնպիսի մեթոդներ մշակելու կարևորությունը, որոնք չեն սահմանափակվում մոդելի մտքերի շղթայի ուսումնասիրությամբ։
  6. GPT‑6 Astra-ն ավելի պատասխանատու է գործում համացանցային զննարկման և աշխատանքային միջավայրերում․ GPT‑6 Astra-ն հարցումների ներարկումների նկատմամբ զգալիորեն ավելի կայուն է, քան GPT‑5.6 Sol-ը։ Մենք նաև փորձարկել ենք մոդելի վարքը համացանցային զննարկման և համակարգչային իրատեսական աշխատանքային միջավայրերում ու պարզել, որ GPT‑5.6 Sol-ի համեմատ այն զգալիորեն ավելի քիչ հավանականությամբ է կատարում անհամապատասխան և հնարավոր կործանարար գործողություններ (օրինակ՝ չարտոնված գործարքներ, տվյալների կորուստ, չափազանց լայն հասանելիության ձեռքբերում կամ վերահսկողության միջոցների շրջանցում)։ Գործակալային միջավայրերում այն նաև ավելի անվտանգ է արձագանքում վնասակար հարցումներին, օրինակ՝ բռնի հարձակման պլանավորմանն աջակցելու կամ խարդախություն կատարելու խնդրանքներին։
  7. GPT‑6 Astra-ն բարձր ռիսկայնության սցենարներում զգալիորեն ավելի անվտանգ է։ GPT‑6 Astra-ն արտադրական միջավայրից և մարդկանց հակառակորդային նախափորձարկումից վերցված բարդ հարցումներին ավելի անվտանգ է արձագանքում, քան GPT‑5.6 Sol-ը։ Astra-ն ապահովում է Պարետոյի բարելավում՝ վտանգավոր հարցումներն անվտանգ կերպով մշակելու և անվնաս հարցումներն անհարկի չմերժելու առումով։ Այս բարելավումները տարածվում են նաև ծանր հետևանքներով այն սցենարների վրա, որոնցում վնասի ռիսկը բխում է ավելի լայն համատեքստից, այլ ոչ թե հստակ արտահայտված հարցումից։ Astra-ն նաև մինչև 18 տարեկան օգտատերերի դեպքում ավելի հետևողականորեն է կիրառում նրանց տարիքին համապատասխան անվտանգության սահմանները։

Լրացուցիչ տեղեկությունների համար ծանոթացեք համակարգի ամբողջական քարտին(բացվում է նոր պատուհանում)։