Hleður inn...
Í dag gefum við út GPT‑6 Astra, öflugasta líkanið sem við höfum tekið í almenna notkun til þessa. Astra er fyrsta líkanið okkar sem nær mikilvægu stigi netöryggisgetu samkvæmt Undirbúningsramma okkar.
Mikilvægustu atriðin um öryggi þessarar útgáfu eru eftirfarandi:
- GPT‑6 Astra er stórt framfaraskref í netgetu og nær alvarlega viðmiði okkar. Þetta þýðir að með réttum verkfærum og aðgangi getur GPT‑6 Astra fundið áður óþekkta öryggisgalla og þróað nýjar leiðir til að nýta þá í mörgum vel vörðum kerfum, án þess að manneskja leiðbeini því í hverju skrefi. Við efldum því verulega varnir okkar gegn því að líkanið framkvæmi skaðlegar netaðgerðir, hvort sem það stafar af misnotkun eða ósamræmingu. Við gerðum einnig ráðstafanir til að tryggja innri þróun og innleiðingu Astra og sambærilegra líkana, meðal annars með strangari einangrun, dulkóðun varðpunkta, altæku eftirliti með heilum ferlum, þar á meðal hugsanaferlum (CoT), og samræmingarmati sem getur stöðvað innri notkun áður en hún hefst.
- GPT‑6 Astra er mun traustara en fyrirrennarar þess. Með nýjum aðferðum við öryggisþjálfun til að auka traustleika er GPT‑6 Astra mun traustara en GPT‑5.6 Sol gagnvart tilraunum til að komast fram hjá öryggistakmörkunum, einnig í lengri ferlum. Þetta vitum við af prófunum án nettengingar og umfangsmikilli áætlun okkar um innri og ytri prófanir og úrbætur gegn slíkum tilraunum. Fyrir notendur sem merktir eru sem mögulega áhættusamir höfum við einnig þjálfað líkanið í að færa höfnunarmörk sín í varfærnari átt svo þau nái yfir fjölbreyttari áhættu tengda tvíþættri notkun. Við notum aðhvarfsprófanir til að tryggja að Astra standist tilraunir til að komast fram hjá öryggistakmörkunum sem fundust á fyrri prófunartímabilum. Við gerðum einnig nýjar umferðir sjálfvirks rauðteymis með nýjustu innri árásaraðilum rauðteymis til að staðfesta umbæturnar.
- GPT‑6 Astra er betur samræmt en GPT‑5.6 Sol. Astra er stórt framfaraskref í samræmingu líkana og felur í sér umbætur allt frá samsetningu forþjálfunargagna okkar til einkunnagjafar í styrkingarnámi. Við birtum nýtt safn samræmingarmata(opnast í nýjum glugga) og komumst að því að GPT‑6 Astra virðir betur öryggismörk og heldur sig innan heimilaðs verksviðs. Í hermun með meira en 54.000 innri Codex-verkefnum(opnast í nýjum glugga) fékk Astra einnig um helmingi færri merkingar vegna alvarlegrar ósamræmdrar hegðunar en Sol.
- Við innleiðum víðtækt eftirlit með ósamræmingu. Við lítum á samræmingu líkana sem helsta úrræðið til að koma í veg fyrir hugsanlega ósamræmda hegðun líkana okkar. Eftirlit veitir þó víðtæka innsýn í hegðun háþróaðra líkana og varpar ljósi á tækifæri til að bæta samræmingu og öryggi enn frekar. Auk þess er eftirlit viðbótarvörn gegn ósamræmdri hegðun sem greinist. Af þessum ástæðum höfum við einnig bætt eftirliti með ósamræmingu við alla ályktun með verkfæranotkun í ytri innleiðingu Astra, þrátt fyrir umtalsverðan reiknikostnað. Þetta kerfi samsvarar innra fyrirkomulagi okkar.
- Eftirlitshæfni GPT‑6 Astra hefur minnkað miðað við GPT‑5.6 Sol. Við höfum rannsakað ítarlega eftirlitshæfni(opnast í nýjum glugga) og stýranleika(opnast í nýjum glugga) GPT‑6 Astra. Við komumst að því að GPT‑6 Astra getur betur stjórnað eigin CoT en GPT‑5.6 Sol og er ólíklegra til að setja upplýsingar sem benda til misferlis í CoT sitt. Við óvinveittar aðstæður, þar sem við reynum að fá líkanið til að komast undan eftirliti, getur það komist hjá greiningu með því að standa vísvitandi undir getu í mati (sandbagging) og stundum komist undan innra eftirliti okkar þegar það er beðið um að vinna tiltekin skemmdarverk(opnast í nýjum glugga). Við höfum ekki séð vísbendingar um dulritaða rökhugsun í CoT, til dæmis að falin rökhugsun sé dulbúin í venjulegum texta sem virðist ótengdur. Það bendir til þess að hættan á undanskoti kunni að mestu að takmarkast við verkefni sem krefjast minni rökhugsunar.
- Þessar niðurstöður benda til þess að líkön í Astra-flokknum gætu komist undan CoT-eftirliti okkar við óvinveittar aðstæður. Sem stendur byggjast þessar niðurstöður að mestu á óvinveittum mötum, það er þegar við fyrirmælum líkaninu að komast undan eftirliti. Samræmingarmöt okkar sýna þó í heild að Astra er ólíklegra en GPT‑5.6 Sol til að brjóta gegn öryggistakmörkunum.
- Við tökum þessari þróun þó alvarlega og höldum áfram að rannsaka niðurstöðurnar og áhrif þeirra á eftirlitshæfni eftir því sem líkön okkar verða öflugri. OpenAI hefur unnið að því að varðveita og nýta eftirlit með hugsanaferlum og eitt meginmarkmið rannsóknaráætlunarinnar er að varðveita eftirlitshæfni CoT. Niðurstöðurnar undirstrika þó einnig mikilvægi þess að þróa aðferðir til að endurskoða samræmingu sem ganga lengra en að skoða hugsanaferli líkansins.
- GPT‑6 Astra tekst á við vafur og vinnuumhverfi af meiri ábyrgð: GPT‑6 Astra er mun traustara gegn kvaðningarvörpunum en GPT‑5.6 Sol. Við höfum einnig prófað hegðun líkansins við raunhæft vafur og í tölvuumhverfi atvinnulífsins. Niðurstöðurnar sýna að mun ólíklegra er að líkanið framkvæmi ósamræmdar og mögulega skaðlegar aðgerðir en GPT‑5.6 Sol, svo sem óheimilar færslur, gagnatap, óhóflegan aðgang eða sniðgöngu stýringa. Það bregst einnig við á öruggari hátt þegar það meðhöndlar skaðlegar beiðnir í sjálfstæðum vinnuferlum, svo sem beiðnir um aðstoð við skipulagningu ofbeldisárásar eða fjársvik.
- GPT‑6 Astra er mun öruggara í áhættumeiri aðstæðum. GPT‑6 Astra bregst á öruggari hátt en GPT‑5.6 Sol við krefjandi beiðnum úr raunnotkun og óvinveittu rauðteymi manna. Astra nær Pareto-framförum með því að afgreiða óöruggar beiðnir á öruggan hátt og forðast óþarfa höfnun skaðlausra beiðna. Þessar umbætur ná einnig til mjög alvarlegra aðstæðna þar sem skaðahættan stafar af víðara samhengi en ekki skýrri beiðni. Astra beitir einnig öryggismörkum sem hæfa aldri með samkvæmari hætti fyrir notendur yngri en 18 ára.
Nánari upplýsingar eru á kerfiskortinu í heild(opnast í nýjum glugga).
Höfundur
OpenAI


