Pangkalahatang-ideya sa kaligtasan: GPT‑6 Astra
Naglo-load…
Ngayong araw, inilalabas namin ang GPT‑6 Astra, ang pinakamahusay na modelo na malawakan naming na-deploy. Ang Astra ang una naming modelo na umabot sa Kritikal na antas ng kakayahan sa cybersecurity sa ilalim ng aming Preparedness Framework.
Narito ang pinakamahahalagang dapat malaman tungkol sa kaligtasan ng paglulunsad na ito:
- Malaking pagsulong ang GPT‑6 Astra sa mga kakayahang cyber at naaabot nito ang aming Kritikal na pamantayan. Ibig sabihin, gamit ang mga tamang tool at access, kayang tumuklas ng GPT‑6 Astra ng mga dati nang umiiral ngunit hindi pa natutukoy na kahinaan sa seguridad at bumuo ng mga bagong paraan upang samantalahin ang mga ito sa maraming sistemang mahusay ang proteksiyon, nang hindi kailangang gabayan ng tao ang bawat hakbang. Dahil dito, lubos naming pinahusay ang aming mga proteksiyon laban sa paggawa ng modelo ng mapaminsalang cyber na pagkilos, dulot man iyon ng maling paggamit o maling pagkakaayon. Gumawa rin kami ng mga hakbang upang gawing mas secure ang aming internal na pag-develop at pag-deploy ng Astra at mga katulad na modelo, kabilang ang mas mahigpit na paghihiwalay, pag-encrypt ng checkpoint, pangkalahatang pagsubaybay sa buong trajectory kasama ang mga chain of thought (CoT), at proseso ng pagsusuri sa pagkakaayon na humaharang bago ang internal na paggamit.
- Mas matatag ang GPT‑6 Astra kaysa sa mga nauna rito. Dahil gumagamit ito ng mga bagong teknik sa pagsasanay para sa kaligtasan at katatagan, mas matatag ang GPT‑6 Astra laban sa mga jailbreak kaysa sa GPT‑5.6 Sol, kabilang ang mas mahahabang trajectory. Alam namin ito mula sa mga offline na pagsubok at sa aming programa ng masusing internal at external na pagsusuri at pagwawasto ng mga jailbreak. Para sa mga user na natukoy na posibleng may mataas na panganib, sinanay din namin ang modelo na maitakda ang hangganan ng pagtanggi nito nang mas maingat at masaklaw ang mas maraming panganib ng dalawahang paggamit. Gumagamit kami ng regression testing upang matiyak na matatag ang Astra laban sa mga jailbreak na natuklasan sa mga nakaraang yugto ng pagsusuri. Nagsagawa rin kami ng mga bagong round ng awtomatikong red teaming gamit ang aming mga pinakabagong internal na attacker sa red teaming upang patunayan ang aming mga pagpapahusay.
- Mas mahusay ang pagkakaayon ng GPT‑6 Astra kaysa sa GPT‑5.6 Sol. Malaking pagsulong ang Astra sa pagkakaayon ng modelo, na may mga pagpapahusay mula sa komposisyon ng aming data sa pre-training hanggang sa pagmamarka namin sa panahon ng pagpapatibay ng pag-aaral. Inilalahad namin ang bagong hanay ng mga pagsusuri sa pagkakaayon(magbubukas sa bagong window), at natuklasan naming mas mahusay ang GPT‑6 Astra sa pagsunod sa mga hangganan ng kaligtasan at seguridad at sa pananatili sa awtorisadong saklaw nito. Sa isang simulation na gumamit ng mahigit 54,000 internal na gawain sa Codex(magbubukas sa bagong window), halos kalahati rin ang dami ng mga flag na natanggap ng Astra para sa mas malulubhang maling pagkakaayon ng pag-uugali kumpara sa Sol.
- Malawakan naming ipinapatupad ang pagsubaybay sa maling pagkakaayon. Itinuturing namin ang pagkakaayon ng modelo bilang pangunahing paraan upang maiwasan ang posibleng maling pagkakaayon ng pag-uugali ng aming mga modelo. Gayunman, nagbibigay ang pagsubaybay ng malawak na pananaw sa pag-uugali ng frontier na modelo, kaya natutukoy ang mga pagkakataong higit pang mapahusay ang pagkakaayon at kaligtasan. Bukod dito, nagsisilbing karagdagang proteksiyon ang pagsubaybay laban sa natutukoy na maling pagkakaayon ng pag-uugali. Dahil dito, nagdagdag din kami ng pagsubaybay sa maling pagkakaayon sa lahat ng inference na gumagamit ng tool sa aming external na pag-deploy ng Astra, kahit malaki ang gastos nito sa compute. Katulad ng aming internal na setup ang sistemang ito.
- Bumaba ang kakayahang masubaybayan ang GPT‑6 Astra kumpara sa GPT‑5.6 Sol. Nagsagawa kami ng malalalim na pagsisiyasat sa kakayahang masubaybayan(magbubukas sa bagong window) at kakayahang makontrol(magbubukas sa bagong window) ang GPT‑6 Astra. Natuklasan naming mas kaya ng GPT‑6 Astra na kontrolin ang sarili nitong CoT kaysa sa GPT‑5.6 Sol, at mas maliit ang posibilidad na magsama ito ng impormasyong maaaring magpatunay ng pagkakasala sa CoT nito. Sa mga adversarial na sitwasyon, kung saan itinutulak namin ang modelo na iwasan ang aming mga monitor, natuklasan naming kaya nitong manatiling hindi natutukoy kapag sadya itong nagpapakita ng mababang pagganap sa mga pagsusuri (sandbagging), at kung minsan ay naiiwasan nito ang aming mga internal na monitor kapag inutusang magsagawa ng ilang gawaing pansabotahe(magbubukas sa bagong window). Wala kaming nakitang ebidensiya ng steganographic na pangangatwirang CoT—halimbawa, pagtatago ng lihim na pangangatwiran sa karaniwan at tila walang kaugnayang teksto—na nagpapahiwatig na maaaring higit na limitado ang panganib ng pag-iwas sa mga gawaing nangangailangan ng mas mababang antas ng pangangatwiran.
- Ipinapahiwatig ng mga natuklasang ito na maaaring maiwasan ng mga modelo sa klase ng Astra ang aming mga CoT monitor sa mga adversarial na kondisyon. Sa ngayon, higit na nakabatay ang mga natuklasang ito sa mga adversarial na pagsusuri—ibig sabihin, kapag inuutusan namin ang modelo na iwasan ang pagsubaybay. Gayunman, ipinapakita ng aming pangkalahatang pagsusuri sa pagkakaayon na mas maliit ang posibilidad na lumabag ang Astra sa mga paghihigpit sa seguridad at kaligtasan kaysa sa GPT‑5.6 Sol.
- Gayunman, sineseryoso namin ang trend na ito at patuloy naming sinisiyasat ang mga natuklasang ito at ang mga implikasyon ng mga ito sa kakayahang masubaybayan habang lalo pang humuhusay ang aming mga modelo. Nagsikap ang OpenAI na panatilihin at gamitin ang pagsubaybay sa chain of thought, at pangunahing layunin ng programa sa pananaliksik ang pagpapanatili ng kakayahang masubaybayan ang CoT. Gayunman, binibigyang-diin din ng mga resultang ito ang kahalagahan ng pagbuo ng mga teknik sa pag-audit ng pagkakaayon na higit pa sa pagsusuri sa chain of thought ng modelo.
- Mas responsable ang GPT‑6 Astra sa pag-browse at sa mga sitwasyon sa trabaho: Mas matatag ang GPT‑6 Astra laban sa mga prompt injection kaysa sa GPT‑5.6 Sol. Sinubukan din namin ang pag-uugali ng modelo sa makatotohanang mga kapaligiran sa pag-browse at mga computer sa trabaho. Natuklasan naming mas maliit ang posibilidad na magsagawa ito ng mga maling nakaayon at posibleng mapaminsalang pagkilos—gaya ng mga hindi awtorisadong transaksiyon, pagkawala ng data, labis na access, o pag-iwas sa mga kontrol—kumpara sa GPT‑5.6 Sol. Mas ligtas din itong kumikilos kapag humahawak ng mapaminsalang kahilingan sa mga agentic na sitwasyon, gaya ng mga kahilingang tumulong sa pagpaplano ng marahas na pag-atake o paggawa ng panloloko.
- Mas ligtas ang GPT‑6 Astra sa mga sitwasyong mas mataas ang panganib. Mas ligtas tumugon ang GPT‑6 Astra kaysa sa GPT‑5.6 Sol sa mahihirap na kahilingang kinuha mula sa production at adversarial na red teaming ng tao. Nakakamit ng Astra ang isang pagpapahusay na Pareto sa ligtas na pagtugon sa mga hindi ligtas na kahilingan habang iniiwasan ang hindi kinakailangang pagtanggi sa mga kahilingang hindi nakapipinsala. Saklaw rin ng mga pagpapahusay na ito ang malulubhang sitwasyon kung saan nagmumula ang panganib ng pinsala sa mas malawak na konteksto sa halip na sa isang tahasang kahilingan. Mas pare-pareho ring inilalapat ng Astra ang mga hangganan sa kaligtasan na angkop sa edad para sa mga user na wala pang 18 taong gulang.
Para sa higit pang impormasyon, tingnan ang buong card ng system(magbubukas sa bagong window).
May-akda
OpenAI


