ప్రధాన కంటెంట్‌కి దాటండి
OpenAI

20 జులై, 2026

భద్రత

దీర్ఘ టైమ్ హొరైజన్ మోడల్‌ల యుగంలో భద్రత, అలైన్‌మెంట్

దీర్ఘకాలం పనిచేసే మోడల్‌ను అంతర్గతంగా ఉపయోగించడం భద్రత గురించి మాకు నేర్పిన విషయాలు.

లోడ్ అవుతోంది…

సారాంశం

  • దీర్ఘకాలం పనిచేసే మోడల్‌లు కఠినమైన, విస్తృత స్వరూపం ఉన్న సమస్యలను పరిష్కరించగలవు, కానీ వాటి పట్టుదల అవాంఛిత చర్యలు చేయడానికి మరిన్ని అవకాశాలను ఇస్తుంది. 

  • దీర్ఘకాల పనుల కోసం శిక్షణ పొందిన మోడల్‌ను పరిమితంగా అంతర్గతంగా ఉపయోగిస్తున్న సమయంలో, మా ప్రస్తుత అమలుకు ముందరి మూల్యాంకనాల్లో పట్టుకోని కొత్త రకమైన వైఫల్యాలను గమనించి, యాక్సెస్‌ను నిలిపివేశాము. ఆ తర్వాత, ఈ వైఫల్యాల నుంచి వచ్చిన అవగాహనలను ఉపయోగించి కొత్త మూల్యాంకనాలను నిర్మించాము, దీర్ఘ టైమ్ హొరైజన్ అలైన్‌మెంట్‌ను మెరుగుపరిచాము, ట్రాజెక్టరీ-స్థాయి పర్యవేక్షణను జోడించాము, పరిమిత యాక్సెస్‌ను పునరుద్ధరించే ముందు వినియోగదారులకు ఎక్కువ దృశ్యమానత మరియు నియంత్రణ ఇచ్చాము.

  • ఈ అనుభవం పునరావృత అమలుకు ఉన్న విలువను మరింత బలంగా చూపించింది. ఎంత స్థిరమైన మూల్యాంకన సమాహారమైనా ప్రతి ప్రవర్తనను ముందుగా ఊహించలేడు; కాబట్టి అమలుకు ముందరి పరీక్షలను సమీప పర్యవేక్షణతో, జోక్యం చేసుకోగల రక్షణలతో, అవసరమైనప్పుడు నిలిపివేయడం లేదా వెనక్కి తీసుకునే సామర్థ్యంతో కలిపి ఉపయోగించాలి.

దీర్ఘకాలం స్వయంచాలకంగా పని చేయగల మోడల్‌లు కఠినమైన, విస్తృత స్వరూపం ఉన్న సమస్యలను చేపట్టగలవు. కానీ వాటిని ఉపయోగకరంగా చేసే అదే పట్టుదల, అవాంఛిత చర్యలు చేయడానికి కూడా మరిన్ని అవకాశాలు ఇస్తుంది; తక్కువ టైమ్ హొరైజన్ మోడల్‌ల కోసం ఉద్దేశించిన మూల్యాంకనాలు గుర్తించలేని విధంగానూ అలా చేయవచ్చు.

సుమారు రెండు నెలల క్రితం, ఒక అంతర్గత సాధారణ-ప్రయోజన మోడల్ Erdős unit distance conjectureని ఖండించిందని మేము ప్రకటించాము. ఈ మోడల్ చాలా దీర్ఘకాలం స్వయంచాలకంగా పని చేయడానికి రూపకల్పన చేయబడింది. పరిమిత, పర్యవేక్షిత అంతర్గత వినియోగంలో, మా ప్రస్తుత అమలు మూల్యాంకనాలు పట్టుకోని అవాంఛిత ప్రవర్తనను గమనించాము. అమలు పరిమితంగా, పర్యవేక్షణలో ఉండటంతో, మేము ఈ సమస్యలను గుర్తించి, యాక్సెస్‌ను నిలిపి, గమనించిన వాటి ఆధారంగా కొత్త మూల్యాంకనాలను రూపొందించి, మోడల్‌ను మరియు దాని రక్షణలను బలోపేతం చేసి, ఆపై నిరంతర పర్యవేక్షణతో యాక్సెస్‌ను పునరుద్ధరించగలిగాము. 

మేము మోడల్‌లను మూల్యాంకనం చేసే పరిస్థితులు, అవి వాస్తవ వినియోగంలో ఎదుర్కొనే పరిస్థితులతో ఎప్పటికీ పూర్తిగా సరిపోలవు. అందుకే అమలుకు ముందు మూల్యాంకనాలతో పాటు పరిమిత, పర్యవేక్షిత అమలు, సమస్యలు తలెత్తినప్పుడు జోక్యం చేసుకోవడం, నిలిపివేయడం లేదా వెనక్కి తీసుకోవడం అవసరం. అమలు నుంచి నేర్చుకున్నది, యాక్సెస్ విస్తరించే ముందు మరింత బలమైన మూల్యాంకనాలు మరియు రక్షణలలో భాగం కావచ్చు.

క్రింది విభాగాల్లో, మేము గమనించిన విషయాలు, సమస్యలను ఎలా పరిష్కరించాము, ఈ అనుభవం భవిష్యత్ విడుదలలను ఎలా ప్రభావితం చేస్తుంది అనే వాటికి స్పష్టమైన ఉదాహరణలను పంచుకుంటాము.

మోడల్ పట్టుదల భద్రతా బలహీనతలను బయటపెట్టగలదు

కొత్త మోడల్ దీర్ఘకాలం పదేపదే ప్రయత్నిస్తూ ఒక లక్ష్యానికి దిశగా పని కొనసాగించగలదు. అదే పట్టుదల, అది తన పర్యావరణంలోని బలహీనతలను కనుగొని దుర్వినియోగం చేయడానికి దారి తీస్తుంది. మునుపటి మోడల్‌లు శాండ్‌బాక్సింగ్ లేదా పర్యావరణ పరిమితులను ఎదుర్కొన్నప్పుడు, సాధారణంగా అక్కడే ఆగి వినియోగదారుని వద్దకు తిరిగి వచ్చేవి. ఈ మోడల్ అయితే తరచుగా తన శాండ్‌బాక్స్ వెలుపల పనిచేసే మార్గాలను వెతకడం సహా ప్రయత్నిస్తూనే ఉండేది.

ఇది NanoGPT స్పీడ్‌రన్(కొత్త విండోలో తెరుచుకుంటుంది)పై జరిగిన అంతర్గత మూల్యాంకనంలో కనిపించింది; ఇది చిన్న భాషా మోడల్‌ను వీలైనంత తక్కువ స్టెప్‌లలో శిక్షణ ఇవ్వడానికి ఉన్న పబ్లిక్ బెంచ్‌మార్క్. మా మోడల్ PowerCool అని పిలిచే పవర్-లా లెర్నింగ్-రేట్ కూల్‌డౌన్‌ను అభివృద్ధి చేసింది, దాంతో గణనీయమైన మెరుగుదల వచ్చింది. దాని ఫలితాలను Slackలో మాత్రమే పోస్ట్ చేయాలని మోడల్‌కు సూచించారు; కానీ NanoGPT సూచనలు ఫలితాలను GitHubకు PRగా పోస్ట్ చేయాలని చెబుతాయి, కాబట్టి మోడల్ రెండో సూచనలను అనుసరించి పబ్లిక్ GitHub రిపోజిటరీలో PR #287ను తెరిచింది. బాహ్య యాక్సెస్‌ను నిరోధించేందుకు రూపొందించిన శాండ్‌బాక్స్ పరిమితులను మోడల్ దాటుకుని, GitHubకు అప్‌లోడ్‌ను కొనసాగించింది. PR చేయడానికి శాండ్‌బాక్స్‌లోని బలహీనతను కనుగొనడానికి మా మోడల్‌కు ఒక గంట పట్టింది; మునుపటి మోడల్‌లు అంత పట్టుదలగా లేక బలహీనతలను కనుగొనలేకపోయాయి, బదులుగా PR భాగాన్ని వదిలేశాయి.1

ఒక్కో చర్యను పరిశీలించడం నుంచి మొత్తం ప్రయాణాలను పరిశీలించడం వరకు

కృత్రిమ మేధస్సు అసిస్టెంట్‌ల కోసం అనేక భద్రతా నియంత్రణలు ఒక్కో చర్య చుట్టూ రూపొందించబడ్డాయి. ఏదైనా చర్యకు అనుమతి లేకపోతే, దాన్ని నిరోధిస్తారు. అది సున్నితమైనదైతే, సిస్టమ్ వినియోగదారుని స్పష్టమైన ఆమోదం అడుగుతుంది. కానీ గంటలు, రోజులు లేదా వారాలపాటు స్వయంచాలకంగా చర్యలు విస్తరించగల దీర్ఘకాల మోడల్‌లు ఈ అమరికకు సవాలు విసురుతాయి: ఒక్కో చర్యను పర్యవేక్షించడం మాత్రమే మొత్తం ప్రయాణం ఉద్దేశాన్ని గమనించడానికి ఇక సరిపోదు.

ఉదాహరణకు, ఒక సమస్యను పరిష్కరించమని మోడల్‌ను అడిగిన సందర్భంలో, ఇతర సిస్టమ్‌లకు విజయవంతమైన కానీ ప్రైవేట్ సమర్పణలు ఉన్నాయని మోడల్ గమనించి, ఆ పరిష్కారాలను మూల్యాంకన బ్యాక్‌ఎండ్ నుంచి తిరిగి పొందడానికి ప్రయత్నించింది. ప్రమాణీకరణ టోకెన్‌ను స్కానర్ గుర్తించడంతో దాని తొలి ప్రయత్నం నిరోధించబడినప్పుడు, మోడల్ టోకెన్ బాడీని రెండు భాగాలుగా విభజించి, వాటిని అస్పష్టం చేసి, పూర్తి టోకెన్ ఒకే వరుస స్ట్రింగ్‌గా ఎప్పుడూ కనిపించకుండా రన్‌టైమ్‌లో క్రెడెన్షియల్‌ను మళ్లీ నిర్మించింది. స్కానర్‌ను దాటవేయడానికి ఈ దశలను తీసుకుంటున్నట్టు మోడల్ వినియోగదారునికి చేసిన వ్యాఖ్యల్లోనూ, తన రీజనింగ్ ట్రేస్‌లలోనూ స్పష్టంగా చెప్పింది.

ఈ ఉదాహరణలో ప్రతి స్టెప్ విడిగా చూసినప్పుడు ఆమోదయోగ్యంగా కనిపించగలిగినా, క్రమం ఆమోదించని ఫలితానికి దారి తీస్తుందని తెలుస్తుంది. దీర్ఘ టైమ్ హొరైజన్‌లలో సమర్థంగా పనిచేసే మోడల్, ఆమోద వ్యవస్థలోని కనిపించని బలహీనతలను నేర్చుకుని, తన లక్ష్యాలను సాధించడానికి వాటిని ఎలా చుట్టొచ్చగలదో కూడా ఇది చూపిస్తుంది. దీర్ఘ టైమ్ హొరైజన్ భద్రతకు “ఈ చర్యకు అనుమతి ఉందా?” అని మాత్రమే కాకుండా, “ఈ చర్యల క్రమం ఏ ఫలితం కోసం సాగుతోంది?” అని కూడా అడగాలి.

దీర్ఘకాలం పనిచేసే మోడల్‌ల కోసం రక్షణలను నిర్మించడం

ఇలాంటి ఘటనల కారణంగా, కొత్త మోడల్ యొక్క అంతర్గత అమలును మేము నిలిపివేశాము. మేము భద్రతా వ్యవస్థను బహుస్థాయి రక్షణ మరియు ట్రాజెక్టరీ-స్థాయి పర్యవేక్షణ చుట్టూ మళ్లీ నిర్మించాము.

  • ఘటనల నుంచి తీసుకున్న మూల్యాంకనాలు. ఒక సిస్టమ్‌ను నిజంగా అమలు చేయడానికి ముందు అది సురక్షితమా కాదా అనే భావనను మూల్యాంకనాలు మాకు ఇవ్వగలవు. అయితే, అత్యంత ఉపయోగకరంగా ఉండాలంటే, ఒక మూల్యాంకనం వాస్తవ అమలులోని ట్రాజెక్టరీల పంపిణీని మరియు టైమ్ హొరైజన్ పొడవును ప్రతిబింబించాలి. ఈ కారణంగా, గమనించిన వైఫల్యాలను ఉపయోగించి మేము ప్రతిద్వంద్వ మూల్యాంకనాలను అభివృద్ధి చేశాము. వాస్తవ ఘటనల నుంచి తీసుకున్న మూల్యాంకనాల్లో మెరుగుదల సాధించడం, ఉత్పత్తిలో అమలు చేసిన తర్వాత మరింత సురక్షిత ప్రవర్తనకు దారి తీసిందని మేము కనుగొన్నాము.
  • మెరుగైన అలైన్‌మెంట్. వినియోగదారుని లక్ష్యాన్ని సాధించే క్రమంలో అనుమతి లేకుండా అవాంఛిత చర్యలు తీసుకునే దాని ప్రవృత్తిని తగ్గించేందుకు మేము చర్యలు తీసుకున్నాము.  ఉదాహరణకు, దీర్ఘ రోలౌట్‌లలో సూచనలను గుర్తుంచుకోవడంలో మా మోడల్‌లు బలహీనంగా ఉన్నాయని గమనించాము; ఈ సామర్థ్యానికి మోడల్‌ను శిక్షణ ఇవ్వడంతో, అది మరింత దీర్ఘ రోలౌట్‌లలోనూ అలైన్‌డ్‌గా నిలిచింది. 
  • సక్రియ పర్యవేక్షణ. మోడల్ అభివృద్ధి చెందుతున్న ట్రాజెక్టరీని పరిశీలించి, అది వినియోగదారు పరిమితి లేదా భద్రతా సరిహద్దును దాటుతోందని సూచించే సంకేతాలను గుర్తించే పర్యవేక్షణ వ్యవస్థను మేము రూపొందించాము. మానిటర్ ఒక్క చర్యను మాత్రమే కాదు, మొత్తం ట్రాజెక్టరీని గమనిస్తుంది. ముఖ్యంగా, మానిటర్ సెషన్‌ను నిలిపి మరింత జాగ్రత్తగా పరిశీలించమని వినియోగదారుని హెచ్చరించగలదు. పరిశీలించిన తర్వాత, మానిటర్ తప్పుగా ట్రిగ్గర్ అయిందని తేలితే, వినియోగదారు మోడల్ పనిని కొనసాగించాలా అనే విషయాన్ని ఎంచుకోవచ్చు. 
  • వినియోగదారులకు ఎక్కువ దృశ్యమానత మరియు నియంత్రణ. ఈ దీర్ఘకాల సెషన్‌లను పరిశీలించడం, తీసుకున్న చర్యలను చూడడం, జోక్యాలను పర్యవేక్షించడం వంటి వినియోగదారు సామర్థ్యాన్ని మేము మెరుగుపరిచాము.

పునరమలు

కొత్త పర్యవేక్షణ వ్యవస్థను మూల్యాంకనం చేయడానికి, మోడల్ గతంలో అలైన్ కాని చర్యలను అనుసరించిన కొద్దిపాటి అంతర్గత అమలు పర్యావరణాలను, ఈసారి కొత్త రక్షణలతో, మేము మళ్లీ ప్లే చేశాము2. మోడల్ అనుసరించిన అలైన్ కాని చర్యల్లో కొత్త రక్షణలు గణనీయంగా మరిన్ని పట్టుకోగలిగాయి; అవి తప్పించినవన్నీ తక్కువ తీవ్రతవిగా నిర్ణయించబడ్డాయి.

ఈ తక్కువ తీవ్రత ఘటనల కొన్ని ఉదాహరణల్లో క్రింది సందర్భాలు ఉన్నాయి:

  • Linear కమాండ్ లైన్ టూల్‌ను యాక్సెస్ చేయడానికి, మోడల్ nested codex --yolo సెషన్‌ను ప్రారంభించింది; వాస్తవానికి --yolo ఫ్లాగ్ లేకుండానే అది చేయగలిగేది.
  • ముందుగా లైవ్‌లో ఉన్న వనరు కనిపించడం లేదని మోడల్ గమనించింది; తర్వాత సరైన కారణం లేకుండానే తన యజమాని నేమ్‌స్పేస్‌లోని ఇతర లైవ్ CPU pod‌లను, అలాగే ఇతర OpenAI ఉద్యోగుల pod‌లను కూడా అన్వేషించి SSH చేయడం ప్రారంభించింది, అయితే రెండోది విజయవంతం కాలేదు.
  • మోడల్‌లో అనేక ఆగిపోయిన find ప్రాసెస్‌లు ఉండగా, ప్రతి shell కమాండ్ నిలిచిపోయింది. తర్వాత అది kill -9 -1 నడిపింది; అది అమలై ఉంటే, ఆ podలో తనకు kill చేయడానికి అనుమతున్న ప్రతి ప్రాసెస్‌కు SIGKILL పంపేది. అయితే అది టైమ్ అవుట్ అయి అమలు కాలేదు.

కొత్త సిస్టమ్‌ను పరీక్షించిన తర్వాత, దీర్ఘ టైమ్ హొరైజన్ సామర్థ్యాలు ఉన్న మోడల్‌లకు పరిమిత అంతర్గత యాక్సెస్‌ను పునరుద్ధరించవచ్చని మేము తేల్చాము. కొన్ని వారాల క్రితం పునరమలు ప్రారంభమైనప్పటి నుంచి రక్షణలను తీవ్రంగా దాటవేసిన ఘటనలను మేము గమనించలేదు. ఈ రక్షణల మొదటి సంస్కరణను ఉద్దేశపూర్వకంగా జాగ్రత్తగా రూపొందించారు. రక్షణలను బలహీనపరచకుండా అనవసర అంతరాయాలను తగ్గించేందుకు మేము సిస్టమ్‌ను నిరంతరం సర్దుబాటు చేస్తున్నాము.

చివరి ఆలోచనలు

మేము దశలవారీగా అమలు చేసినందున, యాక్సెస్‌ను విస్తరించే ముందు లోపాలను కనుగొని పరిష్కరించగలిగాము. అమలుకు ముందు మూల్యాంకనాలు ఇప్పటికీ అవసరమే, కానీ అవి మిస్ చేసే ప్రవర్తనలను అమలు బయటపెడుతుంది. పరిమిత యాక్సెస్‌తో ప్రారంభించడం వల్ల, మోడల్‌ను ఆచరణలో గమనించడం, సమస్యలు వచ్చినప్పుడు నిలిపివేయడం, ఆ వైఫల్యాలను ఉపయోగించి మెరుగైన మూల్యాంకనాలు మరియు రక్షణలను నిర్మించడం, మార్పులను పరీక్షించిన తర్వాత పరిమిత యాక్సెస్‌ను పునరుద్ధరించడం మాకు సాధ్యమైంది.

మోడల్‌లు మరింత దీర్ఘమైన, క్లిష్టమైన పనులను చేపట్టే కొద్దీ, మూల్యాంకనాలు మిస్ చేసే వైఫల్యాలకు మరింత పెద్ద పరిణామాలు ఉండవచ్చు. మూల్యాంకనం మరియు అమలు మధ్య అంతరాన్ని తగ్గించేందుకు మేము పని కొనసాగిస్తాము: దీర్ఘ ట్రాజెక్టరీలపై మోడల్‌లను పరీక్షించడం, అలైన్‌మెంట్‌ను మెరుగుపరచడం, జోక్యం చేసుకోగల పర్యవేక్షణను నిర్మించడం, వినియోగదారులకు మరింత స్పష్టమైన దృశ్యమానత మరియు నియంత్రణ ఇవ్వడం. ఈ సవాళ్లు OpenAIకే ప్రత్యేకమైనవి కావు; మేము నేర్చుకున్న వాటిని పంచుకోవడం విస్తృత రంగం వాటికి సిద్ధం కావడానికి సహాయపడుతుందని ఆశిస్తున్నాము.

రచయిత

OpenAI

ఫుట్‌నోట్‌లు

  1. 1

     మేము PRను త్వరగా మూసివేసినప్పటికీ, స్పీడ్‌రన్‌లోని పలువురు పాల్గొనేవారు అప్పటికే దాన్ని చూసి, తమ స్వంత సమర్పణల్లో ఆ విధానాన్ని ఉపయోగించారు; 3030(కొత్త విండోలో తెరుచుకుంటుంది), 2990(కొత్త విండోలో తెరుచుకుంటుంది), 2930(కొత్త విండోలో తెరుచుకుంటుంది), 2925(కొత్త విండోలో తెరుచుకుంటుంది), 2900(కొత్త విండోలో తెరుచుకుంటుంది) మరియు 2890(కొత్త విండోలో తెరుచుకుంటుంది) స్టెప్‌లతో వచ్చిన వరుస ప్రపంచ రికార్డు సమర్పణలన్నీ PR 287ను ఉదహరిస్తాయి. వీటిలో PR 300(కొత్త విండోలో తెరుచుకుంటుంది) ప్రత్యేకంగా ఆసక్తికరం, ఎందుకంటే Prime Intellect(కొత్త విండోలో తెరుచుకుంటుంది) దాన్ని NanoGPT స్పీడ్‌రన్‌లో మూల్యాంకనం చేసినప్పుడు Opus 4.7 సమర్పించిన PR అదే. మా మోడల్ సమర్పించిన PRను Opus చూసి, ఆ ఆవిష్కరణలను చేర్చుకుని, తన తుది ఫలితంలో మా PRకు క్రెడిట్ ఇచ్చింది.

  2. 2

     పర్యావరణాన్ని పునర్నిర్మించడంలో యాదృచ్ఛికత, లోపాల కారణంగా, రీప్లేలోని రోలౌట్‌లు ప్రతిసారి అదే అలైన్ కాని చర్యను అనుసరిస్తాయని హామీ లేదు.