గత కొన్ని వారాల్లో, మరింత సామర్థ్యం పెరుగుతున్న AI వ్యవస్థలతో ముడిపడిన పెరుగుతున్న ప్రమాదాలను రెండు పరిణామాలు స్పష్టంగా చూపించాయి: OpenAI-Hugging Face ఘటన మరియు, విడిగా, మా రాబోయే మోడల్లలో ఒకటైన Astra, కీలక సైబర్సెక్యూరిటీ సామర్థ్యం థ్రెషోల్డ్ను చేరవచ్చని సూచించే ప్రాథమిక ఆధారాలు మా సంసిద్ధతా ఫ్రేమ్వర్క్ కింద ఉన్నాయి. ఈ పరిణామాలు అన్నీ కలిసి, మా అంతర్గత పరిశోధనలో వేగవంతమైన పురోగతితో కలిపి, శిక్షణా ప్రక్రియ యొక్క అన్ని దశలలో మా పర్యవేక్షణ, అమరిక మరియు నియంత్రణ రక్షణలను బలోపేతం చేయడంపై మా పనికి అత్యవసరతను జోడించాయి.
మోడల్స్కు మరింత సామర్థ్యం ఉన్నప్పుడు, వాటిని అంతర్గతంగా అభివృద్ధి చేయడం మరియు పరీక్షించడంతో సంబంధం ఉన్న ప్రమాదాలు కూడా పెరుగుతాయి. పర్యవేక్షణ, అలైన్మెంట్ మరియు భద్రతకు సంబంధించిన మా ప్రమాణాలు ఆ ప్రమాదాల కంటే ఎప్పుడూ ముందుండాలి. ఆ ప్రమాణాలను అందుకోవడానికి అవసరమైన సమయాన్ని తీసుకోవాలని మేం భావించాం, అందుకే స్కేలింగ్ ప్రక్రియ వేగాన్ని తాత్కాలికంగా తగ్గించాం. ఇందులో, మా మానిటరింగ్ సిస్టమ్ల కవరేజ్ను విస్తరించడంతో పాటు మా పరిశోధనా పరిసరాలను మరింత బలపరచి మరియు రెడ్-టీమ్ చేస్తూ, డిప్లాయ్మెంట్ కోసం ఉద్దేశించిన మా తాజా మోడల్లపై రీఇన్ఫోర్స్మెంట్ లెర్నింగ్ (RL) శిక్షణను రెండు వారాలు నిలిపివేయడం కూడా ఉంది. మేం మోడల్ ప్రవర్తనను అంచనా వేయడానికి, మా రక్షణ చర్యలను ధృవీకరించడానికి, ముందుకు వెళ్లే ముందు అమరికకు సంబంధించిన మరిన్ని ఆధారాలను ఏర్పరచడానికి చిన్న-స్థాయి శిక్షణ మరియు మూల్యాంకనాలను నిర్వహిస్తున్నందున, మా అతిపెద్ద ప్రణాళికాబద్ధమైన అత్యాధునిక RL రన్ ఇంకా నిలిపివేసి ఉంది.
అలైన్మెంట్—AI సిస్టమ్లు ఉద్దేశించినట్లుగా ప్రవర్తించేలా మరియు మానవ పర్యవేక్షణకు స్పందించేలా చేయడం అనే పని—చాలాకాలంగా మా పరిశోధన కార్యక్రమానికి కేంద్రంగా ఉంది. ఇప్పటికే కొనసాగుతున్న పరిశోధన మరియు మూల్యాంకనాలపై ఆధారపడుతూ, శిక్షణ మొత్తం కాలంలో లక్ష్యాలకు అనుగుణమైన ప్రవర్తనకు సంబంధించి మాకు ఇప్పుడు మరింత బలమైన సాక్ష్యం అవసరం. రోజురోజూ మరింత సామర్థ్యం సంతరించుకుంటున్న వ్యవస్థలను లక్ష్యాలకు అనుగుణంగా ఉంచడం, ఈ రంగం మొత్తం పరిష్కరించాల్సిన సవాలు. రాబోయే మోడల్ పురోగతి నుంచి మేం చూస్తున్న సంకేతాలు, ప్రస్తుత ప్రిపేర్డ్నెస్ ఫ్రేమ్వర్క్ పై ఆధారపడి దానిని దాటి విస్తరించే మరింత విస్తృతమైన విధానం మాకు అవసరమని స్పష్టం చేస్తున్నాయి.
మా విధానం ఎలా మారుతోందనే దాని గురించి పారదర్శకంగా ఉండటం ముఖ్యమని మేం భావిస్తున్నాం. క్రింద, మా పరిశోధన ప్రక్రియలు మరియు మౌలిక వసతులకు మేం ఇప్పటికే చేసిన మార్పులు, అలాగే ఇంకా కొనసాగుతున్న పనిని వివరిస్తున్నాం.
మరింత సామర్థ్యవంతమైన మోడల్స్ అభివృద్ధి చేయడానికి మా విధానం, ఒకదానిని మరొకటి బలపరచే మూడు రక్షణలపై ఆధారపడి ఉంటుంది:
- పర్యవేక్షణ, ఇది ఆందోళన కలిగించే ప్రవర్తనను గుర్తించి, దానికి స్పందించడానికి మాకు వీలు కల్పిస్తుంది.
- అలైన్మెంట్, ఇది హానికరమైన లేదా అనధికారిక చర్యల సంభావ్యతను తగ్గిస్తుంది.
- AI వ్యవస్థలు దేనిని యాక్సెస్ చేయగలవో లేదా ప్రభావితం చేయగలవో పరిమితం చేసే, భద్రతా చర్యలు.
మోడల్లు త్వరలోనే ఇతర మోడల్ల నుంచి రక్షించడం సహా, ఎక్కువ భాగం భద్రతా పనిని నడిపిస్తాయని మేం ఆశిస్తున్నాం. ఇది మూడు రక్షణ చర్యలన్నీ మోడల్ సామర్థ్యానికి అనుగుణంగా విస్తరించడానికి అనుమతిస్తుంది, దీనిని మేం కీలకంగా చూస్తున్నాము.
మేం ఈ భద్రతా చర్యలను పరిశోధన మరియు అమలులో అంతటా వర్తింపజేస్తాం, వాటిని ప్రతి మోడల్ సామర్థ్యాలు, ఆపరేటింగ్ వాతావరణం మరియు ప్రమాద స్థాయికి అనుగుణంగా సర్దుబాటు చేస్తాం.
అత్యాధునిక మోడల్లు మరింత బలమైన సైబర్ సెక్యూరిటీ సామర్థ్యాలు పొందే కొద్దీ, మేం వాటిని శిక్షణ ఇవ్వడం మరియు మూల్యాంకనం చేయడం జరిగే పరిసరాల కోసం భద్రతా ప్రమాణాలను పెంచుతున్నాం. ఈ ప్రమాణాలను చేరుకోవడానికి గణనీయమైన ఇంజినీరింగ్ పని అవసరమైంది మరియు అత్యాధునిక పరిశోధనకు భారీ ఖర్చు మరియు ఆలస్యాలు కలిగాయి. OpenAI-Hugging Face ఘటన* జరిగిన వెంటనే, కోడ్ను అమలు చేయగలిగే లేదా ఇంటర్నెట్ను యాక్సెస్ చేయగల సాధనాలను ఉపయోగించగల రన్ల కోసం, పరిశోధన క్లస్టర్ల్లో అత్యాధునిక మోడల్ ఇన్ఫరెన్స్ను మేం నిలిపివేశాం. కోడ్ అమలుకు మరింత పరిమితమైన మరియు సురక్షితమైన మార్గాన్ని మేం తగినంత త్వరగానే పునరుద్ధరించాం, ఆ తరువాత ప్రతి వర్క్లోడ్ను విడివిడిగా పరిశీలించి, అది సురక్షితంగా మళ్లీ ప్రారంభించవచ్చా, లేదా అని నిర్ధారించాం. ఈ కొత్త నియంత్రణల క్రింద కొన్ని పరిశోధన వర్క్లోడ్లు తిరిగి ప్రారంభమయ్యాయి, మరికొన్నింటికి అదనపు మార్పులు అవసరమయ్యాయి.
తదుపరి వారాల్లో, మేం అత్యాధునిక పరిశోధన వర్క్లోడ్ల కోసం మరింత బలమైన భద్రతా అవసరాలను నిర్వచించి, అమలు చేయడం ప్రారంభించాం. ఉదాహరణకు:
- వర్క్లోడ్ ఐసోలేషన్: మోడల్-సృష్టించిన లేదా ఇతర విధంగా నమ్మదగని కోడ్ను అమలు చేసే వర్క్లోడ్ల కోసం మేం ఇప్పుడు మరింత బలమైన ఐసోలేషన్ (“sandboxes”)ను అవసరం చేస్తున్నాం. మోడల్ అవుట్పుట్లను ప్రాసెస్ చేస్తున్నప్పుడు రాజీ పడే అవకాశం ఉన్న సాఫ్ట్వేర్కూ ఇది వర్తిస్తుంది.
- నెట్వర్క్ ఐసోలేషన్: ఇంటర్నెట్ నుండి హై-ప్రమాద మరియు విశ్వసనీయత లేని వర్క్లోడ్లను వేరుచేయడానికి మేం మరిన్ని నియంత్రణలను అమలు చేశాం. ఒక వర్క్లోడ్ లేదా సహాయక సేవ భద్రతాపరంగా రాజీ పడిన ఒక్క సంఘటనే, దాని ఒక్కదానివల్లే, ఇంటర్నెట్కు లేదా ఇతర అంతర్గత నెట్వర్క్లకు అనధికార యాక్సెస్ను అనుమతించకుండా ఉండేలా మేం ఈ నియంత్రణలను రూపొందించాం.
- నిరంతర భద్రతా పరీక్ష: మేము హాని కలిగించే అవకాశం ఉన్న పంచుకునే సర్వీస్లను తొలగించడానికి, శాశ్వత అధికారాలను తగ్గించడానికి, మరియు భద్రత, విశ్వసనీయత పరిధులను మెరుగుపరచడానికి మా వాతావరణాన్ని పునర్వ్యవస్థీకరించాము. భద్రతా లాగ్లను సేకరించి పర్యవేక్షించే మా సామర్థ్యాన్ని కూడా మేం మెరుగుపరుస్తున్నాము. చివరగా, అనుకరణ దాడులపై ఈ సరిహద్దులను నిరంతరం పరీక్షించడానికి మా మోడల్స్ను ఉపయోగించి ఆటోమేషన్లో మేం పెట్టుబడి పెడుతున్నాము.
ఈ నియంత్రణలు కలిసి బహుళస్థాయి రక్షణను అందించి, దాడుల నుండి మా పరిశోధనా వాతావరణాన్ని రక్షించడంలో సహాయపడతాయి. ఈరోజు, Astra లేదా సైబర్ మోడల్లతో సంబంధం ఉన్న వర్క్లోడ్ల కోసం మేం అత్యంత కఠినమైన భద్రతా చర్యలను అవసరం చేస్తున్నాము, ఎందుకంటే Astra మోడల్లు సైబర్ సామర్థ్యంలో కీలక స్థాయి కలిగి ఉండవచ్చని మేం నిర్ధారించాము. ఈ భద్రతా చర్యలు ఇతర అన్ని సైబర్-సంబంధిత వర్క్లోడ్లకూ వర్తిస్తాయి.
కొన్ని Astra శిక్షణ మరియు మూల్యాంకనాలు ఆ అవసరాలను తీర్చినప్పటికీ, కొత్త భద్రతా ప్రమాణాన్ని తీర్చేలా పూర్తిగా మైగ్రేట్ చేసి మెరుగుపరచే వరకు గణనీయమైన సంఖ్యలో వర్క్లోడ్లు తాత్కాలికంగా నిలిపివేయబడి ఉన్నాయి. మేం ఈ కొత్త ఎన్విరాన్మెంట్లకు ముందుగా మైగ్రేట్ చేయడానికి సేఫ్టీ మరియు అలైన్మెంట్ వర్క్లోడ్లకు ప్రాధాన్యత ఇస్తున్నాము.
మానిటరింగ్ చాలా కాలంగా మా మోడల్ అభివృద్ధి ప్రక్రియలో ఒక ముఖ్యమైన భాగంగా ఉంది, ఇందులో అంతర్గత కోడింగ్ ఏజెంట్ల కోసం మానిటరింగ్ మరియు దీర్ఘకాలం కొనసాగే సెషన్లు ఉన్నాయి. మా మానిటరింగ్ ప్రయత్నాలు ప్రత్యేకంగా అత్యాధునిక మోడల్ల అంతర్గత డిప్లాయ్మెంట్లపై మరియు అత్యాధునిక RL శిక్షణ రన్లపై కేంద్రీకరించబడ్డాయి, ఎందుకంటే అవి టూల్స్, సున్నితమైన సిస్టమ్లు, మరియు అంతర్గత లేదా బాహ్య నెట్వర్క్లకు యాక్సెస్తో పాటు అధునాతన మోడల్ సామర్థ్యాలను కలపగలవు కాబట్టి, మేం వీటిని అత్యధిక-ప్రమాద వర్క్లోడ్లుగా పరిగణించాము. సాధనాలను ఉపయోగించే అన్ని ఇన్ఫరెన్స్ మరియు ట్రైనింగ్ రన్లకు అవి వర్తింపజేయబడలేదు. మా కొత్త మానిటరింగ్ సెటప్తో మా విధానాన్ని మేం సవరించాము మరియు విస్తరించాము.
ఈ కొత్త పర్యవేక్షణ ఏర్పాటు బహుళ-దశలుగా ఉంటుంది, ఇది ప్రతి నమూనా తీసుకున్న టోకెన్ వద్ద నడిచే మరియు సంభావ్య ఆందోళనలను క్రమంగా మరింత ఆధునికమైన మరియు హై-కంప్యూట్ స్వయంచాలిత పరిశోధకులకు ఎస్కలేట్ చేసే యాక్టివేషన్ క్లాసిఫైయర్లతో (మోడల్ యొక్క అంతర్గత కార్యాచరణను పరిశీలించే డిటెక్టర్లు) ప్రారంభమవుతుంది. ఆ సిస్టమ్లు టూల్ చర్యలు, అందుబాటులో ఉన్న రీజనింగ్ మరియు అనధికార ప్రాప్యత, డేటా దొంగతనం, విధ్వంసక ప్రవర్తన మరియు రక్షణలను ఓడించే ప్రయత్నాల కోసం కార్యకలాపాల పూర్తి క్రమాన్ని పరిశీలిస్తాయి. మా పర్యవేక్షణ వ్యవస్థ ద్వారా ఆందోళన కలిగించే కార్యకలాపం గుర్తించబడిన తర్వాత 30 నిమిషాల లోపు అలర్ట్ను జారీ చేయడమే మా లక్ష్యం. పర్యవేక్షణ వ్యవస్థ ఒక కీలక భద్రతా సరిహద్దు యొక్క సంభావ్య ఉల్లంఘనను గుర్తిస్తే, అది అత్యధిక ప్రాధాన్యత హెచ్చరికను సృష్టిస్తుంది. మా ప్రస్తుత అమలులో, భద్రత, రక్షణ మరియు పరిశోధన బృందాలకు పేజ్లు పంపబడతాయి. 30 నిమిషాల్లో ఆ ఫ్లాగ్ తప్పుడు సానుకూలం అని నిశ్చయాత్మకంగా నిర్ధారించలేకపోతే, ఆ బృందాలు ఆ కార్యకలాపాన్ని తాత్కాలికంగా నిలిపివేయాలి.
Sol సామర్థ్యం లేదా హై స్థాయి ఉన్న మోడల్ల కోసం టూల్స్తో సంబంధం ఉన్న అన్ని RL శిక్షణ మరియు మూల్యాంకనాలకు ఈ పర్యవేక్షణ అవసరం. 07 ఆగస్టు న మేం Astra కీలకమైన సైబర్ సామర్థ్యాలు కలిగి ఉండవచ్చని నిర్ధారించిన తర్వాత, టూల్స్తో Astra యొక్క అన్ని ఇన్ఫరెన్స్ల కోసం మేం అదనపు పర్యవేక్షణ అవసరాన్ని జోడించాము (కేవలం RL శిక్షణ మరియు మూల్యాంకనాలకు మాత్రమే కాదు).
ఈ భద్రతా చర్యలకు గణనీయమైన కంప్యూటింగ్ వనరులు అవసరం. మా ప్రస్తుత అంచనాల ప్రకారం, మానిటర్ చేయబడుతున్న ఇన్ఫరెన్స్ కంప్యూట్లో మానిటరింగ్ ఓవర్హెడ్ సుమారు 20%గా ఉంది, అయితే శిక్షణ మరియు మూల్యాంకన వర్క్లోడ్లలో ఈ ఖర్చు గణనీయంగా మారుతుంది. ఈ సిస్టమ్ గురించి మరిన్ని వివరాలను రాబోయే బ్లాగ్ పోస్ట్లో మేం పంచుకుంటాము.
అలైన్మెంట్ పరిశోధన మా మిషన్కు కేంద్రంగా ఉంది. మా మిషన్ ఆర్టిఫిషియల్ జనరల్ ఇంటెలిజెన్స్ మొత్తం మానవజాతికి లాభం చేకూర్చేలా నిర్ధారించడం. మోడల్లు సైబర్దాడి చేసే సామర్థ్యం వంటి అధునాతన సామర్థ్యాలను పొందుతూ, మరింత సంక్లిష్టమైన పరిసరాల్లో పనిచేస్తున్న కొద్దీ, రివార్డ్ హ్యాకింగ్ (శిక్షణలో అసలు ఉద్దేశించిన ఫలితాన్ని సాధించకుండా ఎక్కువ రివార్డులు పొందే మార్గాలను కనుగొనడం), మోసం, లేదా అనధికారిక ప్రవేశం వంటి తప్పుగా సర్దుబాటు అయిన ప్రవర్తనలు మరింత తీవ్రమైన ప్రమాదాన్ని సృష్టిస్తాయి.
అత్యంత సామర్థ్యమైన మోడల్లపై RL రన్ల కోసం, ఇప్పుడు మేం మా ప్రాథమిక అలైన్మెంట్ పద్ధతులను శిక్షణ ప్రక్రియలోని మరిన్ని దశల అంతటా వర్తింపజేస్తున్నాము. ఇందులో పనులు మరియు పరిసరాల అంతటా సురక్షితం కాని ప్రవర్తనను మరింత బాగా గుర్తించి నిరుత్సాహపరచడానికి రివార్డ్ మోడల్లను మెరుగుపరచడం; మోడల్లు తమ చర్యలు, సామర్థ్యాలు మరియు పరిమితుల గురించి మరింత నిజాయితీగా ఉండేలా శిక్షణ ఇవ్వడం; మరియు రివార్డ్లు, గ్రేడర్లు, టూల్లు లేదా పర్యవేక్షణలోని బలహీనతలను దోపిడీ చేసే ప్రవర్తనలను తగ్గించడం ఉన్నాయి. మోడల్లు బాహ్య సిస్టమ్లు లేదా వనరులతో పరస్పరం చర్య చేసేటప్పుడు హాని కలిగించగల ప్రవర్తనల కోసం కూడా మేం శిక్షణ కవరేజ్ను పెంచుతున్నాము.
మేం అలైన్మెంట్ పరిశోధనలో దూకుడుగా పెట్టుబడి కొనసాగిస్తూ, మూల్యాంకన పరిధిని విస్తరించి, నేర్చుకున్న విషయాలను శిక్షణ మరియు రక్షణ చర్యలకు మార్గనిర్దేశం చేయడానికి ఉపయోగిస్తున్నాము. సమీప భవిష్యత్తులో మా అలైన్మెంట్ పరిశోధన గురించి, మోడల్ ప్రవర్తనపై మేం ఏమి నేర్చుకుంటున్నామో, అలాగే మేం గుర్తించే ఏవైనా కొత్త సవాళ్లను గణనీయంగా మరింత పంచుకోవాలని మేం ప్రణాళిక చేస్తున్నాము.
శిక్షణ మరియు అమలులో ఈ భద్రతా చర్యలను సమగ్రంగా తీసుకురావడానికి, అలాగే భవిష్యత్ మోడల్స్ సామర్థ్యాలు మరియు అవి పనిచేసే పరిసరాలను మెరుగ్గా ప్రతిబింబించడానికి, మేం మా ప్రిపేర్డ్నెస్ ఫ్రేమ్వర్క్ను అభివృద్ధి చేస్తాము. ఆ సామర్థ్యాలకు అనుగుణంగా విస్తరించగల పద్ధతులను అభివృద్ధి చేయడానికి మోడల్-సహాయక భద్రతలో నిరంతర పెట్టుబడి, మరింత ప్రభావవంతమైన పర్యవేక్షణ, మరియు అలైన్మెంట్ పరిశోధనలో కొనసాగుతున్న పురోగతులు అవసరం. మా విధానం అభివృద్ధి చెందుతున్న కొద్దీ, బాహ్య సంస్థలను చేర్చి, మేం నేర్చుకున్న విషయాలను మరింతగా పంచుకుంటాము.
అత్యాధునిక మోడళ్ల సామర్థ్యాలు వేగంగా పురోగమిస్తున్నాయి. వాటిని అర్థం చేసుకోవడం, అలైన్ చేయడం మరియు భద్రపరచడంలో మన సామర్థ్యం ముందుండాలి.
*రాబోయే వారాల్లో మేం నేర్చుకున్న విషయాలపై సాంకేతిక నివేదికను ప్రచురిస్తాం.

