మోడల్ మూల్యాంకనంలో భద్రతా ఘటనను పరిష్కరించేందుకు OpenAI, Hugging Face భాగస్వామ్యం
గత వారం, Hugging Face తమ మౌలిక వసతులను దెబ్బతీసిన ఒక కృత్రిమ మేధస్సు ఏజెంట్ను గుర్తించి, నియంత్రించిన తర్వాత కొత్త రకమైన భద్రతా ఘటనను వెల్లడించింది(కొత్త విండోలో తెరుచుకుంటుంది). సైబర్ సామర్థ్యాలు పెరుగుతున్న మోడల్లు విస్తరిస్తున్న నేపథ్యంలో ఇలాంటి ఘటనలు మరింత సాధారణమవుతాయని మేము భావిస్తున్నాము. దర్యాప్తు తర్వాత, సైబర్ సామర్థ్యాల బెంచ్మార్క్(కొత్త విండోలో తెరుచుకుంటుంది)పై అంతర్గతంగా పరీక్షిస్తున్న సమయంలో ఈ నిర్దిష్ట ఘటనకు GPT‑5.6 Solతో పాటు ఇంకా సామర్థ్యం ఎక్కువగల ప్రీ-రిలీజ్ మోడల్ సహా OpenAI మోడల్ల కలయిక కారణమని ఇప్పుడు మాకు తెలుసు; ఇవన్నీ మూల్యాంకన ప్రయోజనాల కోసం సైబర్ నిరాకరణలు తగ్గించబడినవే.
అత్యాధునిక సైబర్ సామర్థ్యాలు భాగమైన ఈ ఘటనను మేము మునుపెన్నడూ లేని సైబర్ ఘటనగా పరిగణించి, దానికి తగిన విధంగా స్పందిస్తున్నాము. ఏం జరిగిందో రక్షకులు అర్థం చేసుకోవడానికి, ఇప్పుడు మోడల్లు ఏం చేయగలవో అంచనా వేసుకోవడానికి సహాయపడేందుకు ఈ దశలో మేము ప్రాథమిక ఫలితాలను పంచుకుంటున్నాము. Hugging Faceతో కలిసి మేము సమగ్ర దర్యాప్తును కొనసాగిస్తాము; మా దర్యాప్తు పూర్తయినప్పుడు దుర్బలతలు, ఘటన మరియు ఫలితాలపై మరిన్ని వివరాలను పంచుకుంటాము.
మోడల్ల సైబర్ సామర్థ్యాలను కొలవడానికి, సంక్లిష్ట దాడి మార్గాలను ఉపయోగించి అధునాతన దోపిడీని అనుసరించమని మోడల్లను ప్రేరేపించే అంతర్గత మూల్యాంకనం సమయంలో ఈ ఘటన జరిగింది. అధిక ప్రమాదం గల సైబర్ కార్యకలాపాలను మోడల్లు అనుసరించకుండా నిరోధించడానికి ఉపయోగించే ప్రొడక్షన్ వర్గీకరణకాలు లేకుండా ఈ మూల్యాంకనాన్ని నడిపి, గరిష్ఠ సైబర్ సామర్థ్యాలను మేము అంచనా వేస్తాము. మా బెంచ్మార్క్లు అత్యంత వేరుచేసిన పరిసరంలో నడుస్తాయి; నెట్వర్క్ యాక్సెస్ అంతర్గతంగా హోస్ట్ చేసిన, ప్యాకేజ్ రిజిస్ట్రీలకు ప్రాక్సీ మరియు క్యాష్గా పనిచేసే మూడవ పక్ష సాఫ్ట్వేర్ ద్వారా ప్యాకేజ్లను ఇన్స్టాల్ చేయగల సామర్థ్యానికి మాత్రమే పరిమితం చేయబడింది.
మోడల్లు OpenAI పరిశోధన పరిసరం మరియు Hugging Face ప్రొడక్షన్ మౌలిక వసతుల అంతటా దుర్బలతలను గుర్తించి గొలుసుగా అనుసంధానించి, Hugging Face ప్రొడక్షన్ డేటాబేస్ నుంచే పరీక్ష పరిష్కారాలను పొందాయి. ExploitGymకు పరిష్కారం కనుగొనడంపైనే మోడల్లు అత్యంత దృష్టి పెట్టి, చాలా సంకుచితమైన పరీక్ష లక్ష్యాన్ని సాధించడానికి అసాధారణమైన హద్దులకూ వెళ్లాయని అందుబాటులోని అన్ని ఆధారాలు సూచిస్తున్నాయి.
మా శాండ్బాక్స్ పరీక్షా పరిసరంలో పనిచేస్తున్నప్పుడు, మూల్యాంకన సమస్యను పరిష్కరించాలనే లక్ష్యంతో ఓపెన్ ఇంటర్నెట్ యాక్సెస్ పొందే మార్గాన్ని కనుగొనడానికి మా మోడల్లు గణనీయమైన ఇన్ఫరెన్స్ కంప్యూట్ను వినియోగించాయి. యాక్సెస్ పొందడానికి, ప్యాకేజ్ రిజిస్ట్రీ క్యాష్ ప్రాక్సీలో ఉన్న ఒక జీరో-డే దుర్బలతను మోడల్లు గుర్తించి దోపిడీ చేశాయి; దాన్ని ఇప్పుడు మేము విక్రేతకు బాధ్యతాయుతంగా వెల్లడించాము. ఈ యాక్సెస్తో, మా మోడల్లు మా పరిశోధన పరీక్షా పరిసరంలో ప్రివిలేజ్ ఎస్కలేషన్ మరియు లాటరల్ మూవ్మెంట్ చర్యల శ్రేణిని నిర్వహించి, చివరికి ఇంటర్నెట్ యాక్సెస్ ఉన్న ఒక నోడ్కు చేరుకున్నాయి.
ఇంటర్నెట్ యాక్సెస్ పొందిన తర్వాత, Hugging Face ExploitGym కోసం మోడల్లు, డేటాసెట్లు మరియు పరిష్కారాలను హోస్ట్ చేసి ఉండవచ్చని మోడల్లు ఊహించాయి. ఇది తెలిసిన తర్వాత, మూల్యాంకనంలో మోసం చేయడానికి ఉపయోగించగల రహస్య సమాచారానికి యాక్సెస్ పొందే మార్గాలను మోడల్ వెతికి విజయవంతంగా కనుగొంది. ఒక ఉదాహరణలో, Hugging Face సర్వర్లపై రిమోట్ కోడ్ ఎగ్జిక్యూషన్ మార్గాన్ని కనుగొనడానికి దొంగిలించిన క్రెడెన్షియల్లు మరియు జీరో-డే దుర్బలతలను ఉపయోగించడం సహా పలు దాడి వెక్టర్లను మోడల్ గొలుసుగా అనుసంధానించింది. OpenAI భద్రతా బృందం ఈ అసాధారణ కార్యకలాపాన్ని అంతర్గతంగా కనుగొంది.
మా బృందాలు సంప్రదించేలోపే, Hugging Face భద్రతా బృందం మరియు ఏజెంట్లు తమ మౌలిక వసతులపై ఆ కార్యకలాపాన్ని గుర్తించి ఆపివేశాయి; తమ స్వంత ఓపెన్-సోర్స్ మోడల్లతో కంటైన్మెంట్ మరియు ఫోరెన్సిక్ పునర్నిర్మాణాన్ని ఇప్పటికే ప్రారంభించాయి. ఈ ఘటనపై దర్యాప్తును కొనసాగించడానికి మేము వారితో చురుకుగా కలిసి పనిచేస్తున్నాము. దర్యాప్తు మరియు పరిష్కారంలో Hugging Face వేగంగా, సన్నిహితంగా సహకరించినందుకు మేము కృతజ్ఞులం.
- దర్యాప్తులో భాగంగా, లోపాలను ప్యాచ్ చేసే వరకు పరిశోధన వేగం తగ్గినా మౌలిక వసతుల కాన్ఫిగరేషన్లో మేము కఠిన నియంత్రణలను అమలు చేస్తున్నాము. ఈ నియంత్రణలు మరియు వాటి ప్రభావంపై మేము మా భద్రతా మరియు సెక్యూరిటీ కమిటీకి క్రమం తప్పకుండా వివరిస్తున్నాము.
- ఈ ఘటనపై ఫోరెన్సిక్ దర్యాప్తు చేయడానికి మేము Hugging Faceతో కలిసి పనిచేస్తున్నాము.
- అంతర్గతంగా హోస్ట్ చేసిన మూడవ పక్ష సాఫ్ట్వేర్లో గుర్తించిన జీరో-డే దుర్బలతను మేము బాధ్యతాయుతంగా వెల్లడించాము, దాన్ని ప్యాచ్ చేయడానికి వారితో కలిసి పనిచేస్తున్నాము.
- మేము Hugging Faceను విశ్వసనీయ యాక్సెస్ ప్రోగ్రామ్లో చేర్చి, వారి రక్షణలను మెరుగుపరచడానికి మా మోడల్ల సామర్థ్యాలను వేగంగా ఉపయోగించడంలో వారి బృందాలకు మద్దతు ఇస్తున్నాము.
- భవిష్యత్తు శిక్షణ మరియు మూల్యాంకనాల చుట్టూ మేము మరింత బలమైన రక్షణలను మెరుగుపరుస్తూ, జోడిస్తున్నాము. ఈ వారం, మేము లాంగ్ హొరైజన్ మోడల్ల యుగంలో భద్రత మరియు అలైన్మెంట్ను మెరుగుపరచడంపై ఒక బ్లాగ్ ప్రచురించాము. ఈ మూల్యాంకనం సైబర్ దుర్బలతలను పరీక్షించడానికే ఉద్దేశించబడినందున, ఈ డిప్లాయ్మెంట్ రక్షణలను ఉద్దేశపూర్వకంగా ప్రారంభించలేదు. ఈ ఘటన మా మోడల్ అలైన్మెంట్ను, మూల్యాంకన సమయంలో సైబర్ రక్షణలను, అంతర్గత పరీక్షల సమయంలో పర్యవేక్షణను మరింత బలోపేతం చేయాల్సిన అవసరాన్ని సూచిస్తోంది.
మేము ఇటీవల పంచుకున్నట్లుగా, కృత్రిమ మేధస్సు దుర్బలతల ఆవిష్కరణను మరియు వాటి దోపిడీని వేగవంతం చేస్తోంది. ఈ ఘటనలోని ప్రధాన పాఠం ఏమిటంటే, వేగంగా అభివృద్ధి చెందుతున్న సామర్థ్యాలకు అనుగుణంగా మోడల్ భద్రత మరియు సేఫ్టీ కూడా ముందుకు సాగాలి. మోడల్ అభివృద్ధి సమయంలో ఉపయోగించే కంటైన్మెంట్, పర్యవేక్షణ, యాక్సెస్ నియంత్రణలు మరియు మూల్యాంకన పద్ధతులను మేము బలోపేతం చేస్తున్నాము.
GPT‑5.6 Sol వంటి మోడల్లు దీర్ఘ టైమ్ హొరైజన్లలో సంక్లిష్టమైన, బహుళ-దశల సైబర్ ఆపరేషన్లను కొనసాగించగల సామర్థ్యాన్ని క్రమంగా పెంచుకుంటున్నాయని UK AISI మూల్యాంకనం చూపిస్తుంది. ఈ ఘటన ఈ సిద్ధాంతపరమైన సామర్థ్యాలు వాస్తవ ప్రపంచ పరిస్థితులలోనూ వర్తిస్తాయని సూచిస్తోంది.

సోర్స్ కోడ్ యాక్సెస్ లేకుండానే వాస్తవ ప్రపంచ వ్యవస్థల్లో అధునాతన మోడల్లు కొత్త దాడి మార్గాలను కనుగొని దోపిడీ చేయగలవని కూడా ఈ ఘటన స్పష్టం చేస్తోంది. అధునాతన సైబర్ సామర్థ్యాలను మరింత బలమైన రక్షణలు మరియు రక్షణాత్మక సాధనాలతో పాటు అభివృద్ధి చేయాల్సిన అవసరాన్ని ఇది చూపిస్తుంది.
అధునాతన సైబర్ సామర్థ్యం గల మోడల్లు దాడిదారులకంటే ముందే భద్రతా బృందాలు బలహీనతలను కనుగొనడంలో, దుర్బలతలను ఎలా గొలుసుగా అనుసంధానించవచ్చో అర్థం చేసుకోవడంలో, వాటిని యంత్ర వేగంతో పరిష్కరించడంలో సహాయపడాలి అని మేము నమ్ముతున్నాము. మౌలిక వసతుల కాన్ఫిగరేషన్ మరియు మోడల్ మూల్యాంకన పరిసరాల చుట్టూ రక్షణలను మరింత బలోపేతం చేయడానికి మేము ఈ సామర్థ్యాలను ఉపయోగిస్తున్నాము; నేర్చుకుంటూ పోయే క్రమంలో మా ఫలితాలు మరియు ఉత్తమ పద్ధతులను పంచుకుంటాము. ఇతర రక్షకులు విశ్వసనీయ యాక్సెస్ కోసం దరఖాస్తు చేసుకుని, మెరుగైన నివారణ, వేగవంతమైన గుర్తింపు, మరింత ప్రభావవంతమైన ఘటన స్పందనగా ఈ సామర్థ్యాలను మార్చడానికి ఇప్పుడే ఈ మోడల్లతో ప్రయోగాలు చేయాలని మేము ప్రోత్సహిస్తున్నాము.
“ఈ విషయం మరియు ఇతర అంశాలపై OpenAIతో సహకారం అందినందుకు మేము కృతజ్ఞులం. తన రకంలో ఇదే మొదటిదై ఉండవచ్చని భావించే ఈ ఘటన, మేము చాలాకాలంగా నమ్ముతున్న ఒక విషయాన్ని రుజువు చేస్తోంది: కృత్రిమ మేధస్సు భద్రతను ఏ ఒక్క కంపెనీ రహస్యంగా పనిచేసి పరిష్కరించలేరు. అది బహిరంగంగా, సహకారంతో, ఎక్కడైనా ఉన్న ప్రతి రక్షకుడికి కృత్రిమ మేధస్సుకు విస్తృత యాక్సెస్తోనే పరిష్కారమవుతుంది.”


