Pacing ng model development sa era ng cyber-critical capabilities
Sa nakalipas na ilang linggo, dalawang development ang nagbigay-diin sa mga lumalaking risk na kaakibat ng patuloy na paghusay ng mga AI system: ang insidente ng OpenAI-Hugging Face at, bukod dito, ang paunang ebidensiyang maaaring maabot ng Astra, isa sa aming mga paparating na model, ang threshold ng Critical cybersecurity capability sa ilalim ng aming Preparedness Framework. Ang mga development na ito, kasama ng mabilis na progress ng aming internal research, ay nagdagdag pa ng urgency sa aming trabaho para sa pagpapatibay ng aming mga safeguard sa pag-monitor, alignment, at containment sa lahat ng stage ng training process.
Habang nagiging mas capable ang mga model, lumalaki rin ang mga risk na nauugnay sa internal na pag-develop at pag-test ng mga ito. Dapat na mauuna pa rin kaysa sa mga risk na iyon ang aming mga pamantayan sa pag-monitor, alignment, at security. Gusto naming maglaan ng sapat na panahon para matugunan ang mga pamantayang iyon, kaya pansamantala naming binagalan ang pag-scale. Kabilang dito ang dalawang linggong pag-pause sa reinforcement learning (RL) training para sa aming mga pinakabagong model na nilalayong i-deploy, habang lalo naming pinatitibay at isinasailalim sa red-teaming ang aming mga research environment at pinapalawak ang saklaw ng aming mga system sa pag-monitor. Nananatiling naka-hold ang pinakamalaki naming nakaplanong frontier RL run habang nagsasagawa kami ng mas maliliit na training at evaluation para i-assess ang behavior ng model, i-validate ang aming mga safeguard, at makakuha ng higit pang ebidensiya ng alignment bago mag-proceed.
Ang alignment—ang pagsisikap na matiyak na kumikilos ang mga AI system ayon sa nilalayon at tumutugon sa pangangasiwa ng tao—ay matagal nang sentro ng aming research program. Nire-require na namin ngayon ang mas matibay na ebidensiya ng aligned behavior sa buong training, batay sa research at mga evaluation na isinisagawa na. Ang pagpapanatiling naka-align ang patuloy na humuhusay na mga system ay isang hamong kailangang tugunan ng buong larangan. Malinaw sa mga senyales mula sa progress ng mga paparating na model na kailangan namin ng mas malawak na pamamaraan—isang paraang nakabatay sa Preparedness Framework at lumalampas sa kasalukuyang saklaw nito.
Mahalaga para sa amin na maging malinaw tungkol sa pagbabago ng aming approach. Sa ibaba, inilalarawan namin ang mga pagbabagong nagawa na namin sa aming mga proseso at imprastraktura sa progress, pati ang mga gawaing nagpapatuloy pa.
Nakabatay sa tatlong magkatuwang na safeguard ang aming approach ng pag-develop ng mga mas capable na model:
- Pag-monitor, na nagde-detect ng nakababahalang behavior at nagbibigay-daan para matugunan namin ito.
- Alignment, na nagpapababa sa posibilidad ng mga mapaminsala o hindi awtorisadong action.
- Mga security measure, na naglilimita sa puwedeng i-access o maapektuhan ng mga AI system.
Inaasahan naming malapit nang pangasiwaan ng mga model ang karamihan sa security work, kabilang ang pagdepensa laban sa ibang mga model. Dahil dito, makakasabay sa capability ng model ang lahat ng tatlong safeguard, na itinuturing naming crucial.
Inilalapat namin ang mga safeguard na ito sa research at deployment, at ina-adapt ang mga ito sa mga capability, operating environment, at level ng risk ng bawat model.
Habang lumalakas ang mga capability sa cybersecurity ng mga frontier model, itinataas namin ang mga pamantayan sa security ng mga environment na ginagamit sa pag-train at pag-evaluate sa mga ito. Nangailangan ng substantial na engineering work ang pagtugon sa mga pamantayang ito at nagdulot ito ng malaking gastos at mga pagkaantala sa frontier research. Pagkatapos mismo ng insidente ng OpenAI-Hugging Face*, itinigil namin ang frontier model inference sa mga research cluster para sa mga run na maaaring mag-execute ng code o gumamit ng mga tool na may access sa internet. Medyo mabilis naming na-restore ang mas limitado at secure na path ng code execution, at pagkatapos ay isa-isa naming sinuri ang bawat workload para malaman kung safe itong maipagpapatuloy. Naipagpatuloy ang ilang workload sa research sa ilalim ng mga bagong kontrol na ito, samantalang nag-require ng mga karagdagang pagbabago ang iba.
Sa mga sumunod na linggo, itinakda at sinimulan naming ipatupad ang mas mahihigpit na requirement sa security para sa mga frontier research workload. Halimbawa:
- Isolation ng workload: Nire-require na namin ngayon ang mas matibay na isolation (“mga sandbox”) para sa mga workload na nag-e-execute ng code na generated ng model o kung hindi man ay untrusted na code. Nalalapat din ito sa software na maaaring makompromiso habang pinoproseso ang mga output ng model.
- Isolation ng network: Nag-implement kami ng higit pang kontrol para i-solate sa internet ang mga workload na may mas mataas na risk at untrusted. Dinisenyo namin ang mga kontrol na ito para hindi sapat ang iisang pagkakompromiso sa isang workload o pansuportang serbisyo para magkaroon ng hindi awtorisadong access sa internet o iba pang internal network.
- Tuluy-tuloy na pag-test sa security: Ni-reconfigure namin ang aming environment para alisin ang mga posibleng vulnerable na naka-share na serbisyo, bawasan ang mga standing privilege, at pahusayin ang mga hangganan ng security at trust. Pinahuhusay din namin ang aming kakayahang mangolekta at mag-monitor ng mga log ng security. Panghuli, nag-i-invest kami sa automation gamit ang aming mga model para tuloy-tuloy na i-test ang mga hangganang ito laban sa mga simulated attack.
Kapag sama-sama, nagbibigay ang mga kontrol na ito ng patong-patong na depensa at tumutulong na protektahan ang aming research environment laban sa mga pag-atake. Sa kasalukuyan, nire-require namin ang strictest level ng mga security safeguard para sa mga workload na kung saan involved ang Astra o mga cyber model, dahil natukoy naming maaaring magkaroon ng critical level ng cyber capability ang mga Astra model. Nalalapat din ang mga safeguard na na ito sa lahat ng iba pang workload na nauugnay sa cyber.
Bagama't natutugunan ng ilang training at evaluation sa Astra ang mga requirement na iyon, nananatiling naka-pause ang maraming workload hanggang sa ganap na mai-migrate at ma-enhance ang mga ito para matugunan ang bagong security bar. Inuuna naming i-migrate sa mga bagong environment na ito ang mga workload para sa safety at alignment.
Matagal nang mahalagang bahagi ng proseso ng model development ang pag-monitor, kabilang ang pag-monitor sa mga internal coding agent at mga long-running session. Partikular na nakatuon ang aming monitoring efforts sa mga internal deployment ng mga frontier model at frontier RL training run, na itinuring naming mga workload na may pinakamataas na risk dahil maaari nilang pagsamahin ang mga advanced na capability ng model at access sa mga tool, sensitibong system, at internal o external na network. Hindi inilapat ang mga ito sa lahat ng inference at training run na gumagamit ng mga tool. Ni-revise at in-expand namin ang aming approach gamit ang bago naming setup ng pag-monitor.
Maraming stage ang bagong setup ng pag-monitor na ito. Nagsisimula ito sa mga activation classifier (mga detector na nag-i-inspect sa internal na aktibidad ng model) na nagra-run sa bawat sampled na token at nag-e-escalate ng mga posibleng alalahanin sa mga automated investigator na nagiging mas sopistikado at nangangailangan ng mas malaking compute. Sinusuri ng mga system na iyon ang mga action ng tool, available reasoning, at buong pagkakasunod-sunod ng aktibidad para matukoy ang hindi awtorisadong access, pagnanakaw ng data, mapanirang gawi, at mga pagtatangkang daigin ang mga safeguard. Layunin naming mag-issue ng alerto sa loob ng 30 minuto matapos matukoy ng aming system ng pag-monitor ang nakakabahalang aktibidad. Kung matukoy ng system ng pag-monitor ang posibleng paglabag sa isang kritikal na hangganan ng security, magje-generate ito ng alertong may pinakamataas na priyoridad. Sa kasalukuyan naming pag-implement, agad na inaabisuhan ang mga safety, security, at research team. Kung hindi nila tiyak na mapapatunayang false positive ang flag sa loob ng 30 minuto, inaasahang ipo-pause ng mga team na iyon ang aktibidad.
Required ang pag-monitor na ito para sa lahat ng RL training at evaluation na gumagamit ng mga tool para sa mga model may capability ng Sol o mas mataas. Nang matukoy namin noong Agosto 7 na maaaring may mga kritikal na cyber capability ang Astra, nagdagdag kami ng isa pang requirement sa pag-monitor para sa lahat ng inference ng Astra na gumagamit ng mga tool (hindi lang mga RL training at evaluation).
Nagre-require ng meaningful compute ang mga safeguard na ito. Sa kasalukuyan naming estimates, ang overhead ng pag-monitor ay humigit-kumulang 20% ng inference compute na mino-monitor, bagama't malaki ang pagkakaiba ng gastos sa iba't ibang workload ng training at evaluation. Magse-share kami ng higit pang detalye tungkol sa system na ito sa isang paparating na post sa blog.
Nakasentro sa aming misyon ang research sa alignment. Misyon naming tiyaking napapakinabangan ng buong sangkatauhan ang artificial general intelligence. Habang nagkakaroon ang mga model ng mga advanced na capability, gaya ng kakayahang magsagawa ng cyberattack, at mag-operate sa mga mas komplikadong environment, ang mga hindi naka-align na behavior gaya ng reward hacking (paghahanap ng mga paraan para makatanggap ng matataas na reward sa training nang hindi talaga nakakamit ang nilalayong kalalabasan), panlilinlang, o hindi awtorisadong access ay magdudulot ng mas malubhang risk.
Para sa mga RL run sa mga pinaka-capable na model, inilalapat na namin ang aming mga core alignment technique sa mas maraming stage ng training process. Kabilang dito ang pag-improve sa mga reward model para mas mahusay na ma-detect at ma-discourage ang hindi safe na behavior sa iba't ibang task at environment; pag-train sa mga model para maging mas tapat tungkol sa kanilang mga action, capability, at limitasyon; at pagbawas sa mga behavior nagsasamantala sa mga kahinaan ng mga reward, grader, tool, o oversight. Pinalalawak din namin ang saklaw ng training para sa mga behavior na maaaring magdulot ng pinsala kapag nakikipag-interact ang mga model sa mga external na system o resource.
Patuloy kaming nag-i-invest nang agresibo sa research sa alignment, nagpapalawak ng saklaw ng evaluation, at ginagamit ang aming mga natututunan para gabayan ang training at mga safeguard. Plano naming mag-share sa nalalapit na hinaharap ng mas marami tungkol sa aming research sa alignment, kabilang ang mga natututunan namin tungkol sa behavior ng model at anumang bagong hamong matutuklasan namin.
Ie-evolve namin ang aming Preparedness Framework para pagsamahin ang mga safeguard na ito sa training at deployment, at mas mahusay na i-reflect ang mga capability ng mga model sa hinaharap at ang mga environment kung saan nag-o-operate ang mga ito. Ang pag-develop ng mga method na makakasabay sa mga capability na iyon ay magre-require ng tuloy-tuloy na investment sa model-assisted security, mas epektibong pag-monitor, at patuloy na pagsulong sa research sa alignment. Layunin naming isali ang mga external na organization at mag-share ng higit pa sa aming mga natututunan habang nagde-develop ang aming approach.
Mabilis na nag-a-accelerate ang mga capability ng mga frontier model. Dapat na mag-stay ahead ang kakayahan naming unawain, i-align, at i-secure ang mga ito.
*Magpa-publish kami ng technical report tungkol sa aming mga natutunan sa mga darating na linggo.


