AGI మొత్తం మానవాళికి ప్రయోజనం చేకూర్చాలంటే, దాన్ని ప్రజాస్వామ్యబద్ధంగా పాలించాలని మేము నమ్ముతున్నాం. అత్యంత సామర్థ్యవంతమైన AI వ్యవస్థల సామర్థ్యాలు, ప్రమాదాలు మరియు రక్షణ చర్యలపై సమాచారంతో కూడిన ప్రజా చర్చ ద్వారానే ఇది సాధ్యమవుతుంది. అత్యాధునిక AI భవిష్యత్తులో తీసుకోగల దిశను ప్రతిచోటా ప్రజలు అర్థం చేసుకోవాలి, తద్వారా అది ఎలా అభివృద్ధి చెందుతుందనే విషయంలో వారు అర్థవంతంగా తమ అభిప్రాయాన్ని వ్యక్తం చేయగలరు.
నిర్దిష్ట ప్రమాదాలు, ఘటనలు మరియు రక్షణ చర్యల గురించి పారదర్శకత అవసరం, కానీ అది మాత్రమే సరిపోదు. అత్యంత సామర్థ్యవంతమైన వ్యవస్థలు ఎలా అభివృద్ధి చెందుతున్నాయో, అలాగే అత్యాధునిక ప్రయోగశాలల్లో అవి పరిశోధన పురోగతిని ఎలా ముందుకు నడిపిస్తున్నాయో కూడా ప్రజలు అర్థం చేసుకోవాల్సిన అవసరం ఉందని మేము విశ్వసిస్తున్నాం.
పునరావృత మెరుగుదలలను సాధ్యం చేస్తూ, డీప్ లెర్నింగ్ మరియు అలైన్మెంట్లో మరింత పురోగతి కోసం మానవ పర్యవేక్షణలో పని చేయగల స్వయంచాలక AI పరిశోధకుడిని సురక్షితంగా నిర్మించడమే మా లక్ష్యం. మా కొలమానాల ప్రకారం, గత శరదృతువులో ప్రకటించిన(కొత్త విండోలో తెరుచుకుంటుంది) ఈ సంవత్సరం సెప్టెంబర్ నాటికి స్వయంచాలిత పరిశోధనా ఇంటర్న్ను అందుబాటులోకి తీసుకురావాలనే లక్ష్యాన్ని మేము ఇప్పుడు సాధించాము. “పరిశోధన ఇంటర్న్” అంటే, మానవ మార్గదర్శకత్వంలో స్పష్టంగా నిర్వచించబడిన పరిశోధనా పనులను నిర్వహించగల వ్యవస్థ అని మేము ఉద్దేశిస్తున్నాము; ఇందులో నైపుణ్యం కలిగిన పరిశోధకుడికి కొన్ని రోజులు పట్టే పనులు కూడా ఉంటాయి. 2028 మార్చి నాటికి స్వయంచాలిత AI పరిశోధకుడిని సృష్టించే దిశగా మేము గణనీయమైన పురోగతి సాధిస్తున్నాము.
ఈ ఏడాది కాలంలో OpenAI పరిశోధకుల రోజువారీ పని గణనీయంగా మారింది. పరిశోధకులు రోజంతా కోడింగ్ ఏజెంట్లను (తరచుగా ఏకకాల సెషన్లలో) ఉపయోగిస్తున్నారు, మరియు మొత్తం వినియోగం వేగంగా పెరుగుతూ ఇతర OpenAI బృందాల వృద్ధి రేటును మించిపోతోంది. పరిశోధకులు మరింత వేగంగా కోడ్ను అందిస్తున్నారు మరియు మరిన్ని ప్రయోగాలను నిర్వహిస్తున్నారు. పరిశోధకులు ఏజెంట్లను ఉపయోగించే విధానాలు కూడా మారుతున్నాయి: ఏజెంట్లు క్రమంగా మరింత క్లిష్టమైన పనులను నిర్వహిస్తున్నాయి, అలాగే వాటిని మరింత తరచుగా విజయవంతంగా పూర్తి చేస్తున్నాయి. AI పరిశోధన అనేది అనేక సంభావ్య అవరోధాలతో కూడిన సంక్లిష్టమైన ప్రక్రియ. కాబట్టి, పురోగతి యొక్క మొత్తం వేగం ఈ నిర్దిష్ట కొలమానాల వేగానికి అనుగుణంగా ఉండకపోవచ్చు. కానీ మొత్తం మీద, ఏజెంటిక్ టూల్స్ పరిశోధన పురోగతిని గణనీయంగా వేగవంతం చేస్తున్నాయనే మనలో చాలామందికి ఉన్న విస్తృత అంతర్గత అభిప్రాయానికి ఈ ఫలితాలు అనుగుణంగా ఉన్నాయి. మా పరిశోధనా ప్రాధాన్యతలను ఇప్పటికీ మనుషులే నిర్ణయిస్తారు, ఏ ఆలోచనలు మరియు ఫలితాలను ముందుకు తీసుకెళ్లాలో మదింపు చేస్తారు, అలాగే వ్యవస్థలను విస్తరించాలా, తాత్కాలికంగా నిలిపివేయాలా లేదా అమలులోకి తేవాలా అనేది నిర్ణయిస్తారు.
ఇది బాధ్యతాయుతంగా జరిగితే, స్వయంచాలక AI పరిశోధన నేరుగా మానవ సంక్షేమాన్ని మెరుగుపరచి, OpenAI మిషన్ను ముందుకు తీసుకెళ్లే మోడల్లను అందిస్తుందని మేము నమ్ముతున్నాము. ప్రపంచవ్యాప్తంగా ప్రజలు ప్రయోజనం పొందేలా ఇది అధునాతన ఇంటెలిజెన్స్ వ్యయాన్ని తగ్గించగలదు. స్వయంచాలిత పరిశోధన అలైన్మెంట్ను పరిష్కరించడంలో, అలాగే క్రమంగా మరింత సామర్థ్యవంతమవుతున్న AIకి వ్యతిరేకంగా రక్షణలను నిర్మించడంలో మాకు సహాయపడగలదనే కారణంతో కూడా మేము ఈ పనిని కొనసాగిస్తున్నాము. ఒక స్వయంచాలిత AI పరిశోధకుడు స్వయంచాలిత భద్రత లేదా అలైన్మెంట్ పరిశోధకుడిగానూ ఉండవచ్చు. మరింత సామర్థ్యవంతమైన, అలైన్మెంట్ కలిగిన వ్యవస్థలు కీలక మౌలిక సదుపాయాలను భద్రపరచడంలో, ప్రమాదకరమైన AI ఏజెంట్ల నుంచి రక్షించడంలో, అలాగే కొత్త రక్షణ చర్యలను అభివృద్ధి చేయడంలో సహాయపడగలవు.
ఇవి ఉపయోగకరమైన స్వయంచాలిత పరిశోధన సామర్థ్యాలను అభివృద్ధి చేయడానికి కారణాలు, కానీ వేగవంతమైన RSI తప్పనిసరిగా మనం అనుసరించాల్సిన ఫలితం అని దీని అర్థం కాదు. ముందుకు సాగాలా, సాగితే ఎలా సాగాలి అన్నది మానవ నియంత్రణను కాపాడగల మన సామర్థ్యంపైనా, ప్రయోజనాలు మరియు ప్రమాదాల గురించి సమాచారంతో కూడిన ప్రజాస్వామ్య నిర్ణయాలపైనా ఆధారపడి ఉండాలి.
అలైన్ చేయబడిన, సంపూర్ణ RSI వరకు సురక్షితంగా ఎలా చేరుకోవాలో మనకు ఇంకా తెలియదు. మేము సామర్థ్యాలతో పాటు అలైన్మెంట్ మరియు భద్రతా చర్యలను కూడా విస్తరించేందుకు పని చేస్తున్నాము. కానీ అలైన్మెంట్ మరియు భద్రతలో పురోగతి అదే వేగంతో ముందుకు సాగుతుందని మనం ఊహించలేము, అలాగే మరింత సామర్థ్యవంతమైన వ్యవస్థలను పర్యవేక్షించడం మరింత కష్టమవుతుంది. ఈ ప్రయత్నంలో జాగ్రత్తగా చేసే అలైన్మెంట్ మరియు భద్రతా పని కేంద్రంగా ఉంది, ఇది ఏజెంటిక్ కోడింగ్ వ్యవస్థల్లో ప్రస్తుతం మేము చూస్తున్న భద్రతా సమస్యలను కొలవడం మరియు తగ్గించడం ద్వారా ఇది ప్రారంభమవుతుంది. ముందుకు సాగడం ఆమోదయోగ్యం కాని భద్రతా ప్రమాదాన్ని కలిగిస్తుందని మేము గుర్తించినప్పుడు, తగిన విధంగా స్పందిస్తాము; అందులో, తగినంతగా రక్షణ కల్పించలేమని మేము గుర్తించిన వ్యవస్థల అభివృద్ధిని లేదా అమలులోకి తీసుకురావడాన్ని నెమ్మదించడం లేదా నిలిపివేయడం కూడా ఉంటుంది.
ఇటీవలి Hugging Face ఘటన తర్వాత, మేము ఈ నిబద్ధతను అమల్లోకి తెచ్చాము. మా పరిశోధన పరిసరాలను మరింత పటిష్ఠం చేసి, రెడ్-టీమ్ పరీక్షలు నిర్వహిస్తూ, మా మానిటరింగ్ సిస్టమ్ల కవరేజ్ను విస్తరిస్తున్న సమయంలో, డిప్లాయ్మెంట్ కోసం ఉద్దేశించిన మా తాజా మోడల్లపై రీఇన్ఫోర్స్మెంట్ లెర్నింగ్ (RL) శిక్షణను నిలిపివేశాము. దీంతో మొత్తం పరిశోధన నిలిచిపోలేదు: కొన్ని వర్క్లోడ్లు మరింత కఠినమైన నియంత్రణల కింద మళ్లీ ప్రారంభమయ్యాయి, మరికొన్ని మాత్రం నిలిపివేయబడ్డాయి. మేము మా సేఫ్టీ మరియు అలైన్మెంట్ ప్రమాణాలను మరింత ఉన్నత స్థాయికి తీసుకెళ్లాము, అలాగే మోడల్ లైఫ్సైకిల్లో భద్రతా పనిని మరింత లోతుగా చేర్చాము. దీనివల్ల మొత్తం శిక్షణ ప్రక్రియలో అలైన్మెంట్కు అనుగుణమైన ప్రవర్తనకు మరింత బలమైన ఆధారాలు అవసరమవుతాయి.
ఇటీవలి నెలల్లో RSI వైపు మా పురోగతికి ఏజెంటిక్ సిస్టమ్లు ఎలా దోహదపడ్డాయో అనే విషయంపై ఈ రోజు మేము సమగ్ర అవలోకనాన్ని అందిస్తున్నాము. ఏజెంటిక్ సిస్టమ్లు కొత్తవి మరియు వేగంగా మారుతున్నాయి, అలాగే వాటిని కొలిచే మా ప్రయత్నాలు ఇంకా ప్రాథమిక దశలోనే ఉన్నాయి. ఈ ప్రారంభ ఫలితాలను, వాటి వెనుక ఉన్న పద్ధతులను పంచుకోవడం ద్వారా ప్రజలకు సమాచారం అందించడం, బహిరంగ వెల్లడింపును ఒక సాధారణ ప్రమాణంగా ప్రోత్సహించడం, అలాగే ఈ రంగం కొలతలకు సంబంధించిన ఉమ్మడి ప్రమాణాల వైపు ముందుకు సాగేందుకు సహాయపడడం మా లక్ష్యం.
చివరికి, మా అత్యాధునిక విధాన బ్లూప్రింట్లో మేం రాసినట్లుగా, మేము మరియు ఇతర కంపెనీలు RSI దిశగా మా పురోగతిని బహిరంగంగా ట్రాక్ చేయడం తప్పనిసరి కావాలని మేం నమ్ముతున్నాం. అలాంటి అవసరం లేకపోయినా, మా RSI పురోగతి గురించి పారదర్శకంగా ఉండడాన్ని కొనసాగించాలని మేము భావిస్తున్నాము. మా కొలత పద్ధతులు మరియు అవగాహన మెరుగుపడే కొద్దీ, భద్రతను మరియు యాజమాన్య సమాచారాన్ని రక్షించాల్సిన అవసరాన్ని సమతుల్యం చేస్తూ, మా పారదర్శకత విధానాన్ని కూడా అభివృద్ధి చేస్తాము.
ఈ సంవత్సరం ప్రారంభంలో, OpenAIలో ఏజెంట్ వినియోగం ఆధారంగా మధ్యస్థ స్థాయిలో ఉన్న పరిశోధకుడు కోడింగ్ ఏజెంట్లను పరిమిత స్థాయిలో మాత్రమే ఉపయోగించేవారు. ఆగస్టు మధ్య నాటికి, మధ్యస్థ స్థానంలో ఉన్న పరిశోధకుడు తమ పనిలో ప్రతిరోజూ ఏజెంట్లను అనుసంధానిస్తూ, API ధరల ప్రకారం రోజుకు $600 కంటే ఎక్కువ విలువైన ఇన్ఫరెన్స్ను ఉపయోగిస్తున్నారు. మా పరిశోధనా సంస్థలోని 90వ పర్సెంటైల్లోని యూజర్ ఇప్పుడు రోజుకు $7,000 కంటే ఎక్కువ విలువైన టోకెన్లను ఉపయోగిస్తున్నారు.
జూన్ 2026కి ముందు, పరిశోధనా సంస్థ అంతటా ఏజెంట్ల మొత్తం రన్టైమ్ ఇంకా మొత్తం మానవ శ్రమ కంటే తక్కువగా ఉండేది. అప్పటి నుంచి పరిస్థితి మారింది. ప్రామాణిక ఎనిమిది గంటల పనిదినం పరంగా, ఆగస్టు మధ్య నాటికి, మొత్తం మీద పరిశోధనా సంస్థ మానవ శ్రమలోని ప్రతి పనిదినానికి 3.1 ఏజెంట్-పనిదినాల శ్రమను ఉపయోగిస్తోంది.
దీనిని అర్థం చేసుకునే మరో విధానం ఏమిటంటే, ఎంత మంది పరిశోధకులు అధిక సమాంతరత కలిగిన వర్క్ఫ్లోలను ఉపయోగిస్తున్నారో తెలుసుకోవడం (ఉదా., ఒకేసారి నాలుగు లేదా అంతకంటే ఎక్కువ ఏజెంట్లను అమలు చేయడం). క్రింద చూపినట్లుగా, ఈ సంఖ్య పెరుగుతోంది. ఈ గణాంకాల్లో యూజర్ నేరుగా ప్రారంభించిన ఏజెంట్ల రోజువారీ గరిష్ఠ వినియోగం, అలాగే యూజర్ నేరుగా ప్రారంభించిన ఏజెంట్ల నుంచి తదుపరి దశలో సృష్టించబడిన సబ్ఏజెంట్ల రోజువారీ గరిష్ఠ వినియోగం రెండూ ఉన్నాయి.
AI పరిశోధనలో ఎక్కువ భాగాన్ని, మోడల్ ఇంటెలిజెన్స్ లేదా పనితీరుకు సంబంధించిన కొత్త మెరుగుదలను మా ప్రధాన మోడళ్లలో ఒకదానిలో ఏకీకృతం చేయాలనే లక్ష్యంతో సాగే శ్రమతో కూడిన ప్రక్రియగా చూడవచ్చు. ఈ ప్రక్రియ అనేక దశలపై ఆధారపడి ఉంటుంది, మరియు అన్ని దశలు సరిగ్గా కలిసి పనిచేసినప్పుడే సామర్థ్యాలు అభివృద్ధి చెందుతాయి: పరిశోధకులు కొత్త మెరుగుదలలను రూపొందించాలి, మోడల్ పనితీరును అంచనా వేయడానికి మూల్యాంకనాలను రూపొందించాలి, ఈ మెరుగుదలలను విస్తృత స్థాయిలో పరీక్షించడానికి మౌలిక సదుపాయాలను రూపొందించాలి, శిక్షణ సమయంలో బగ్లతో పాటు అసురక్షితమైన లేదా లక్ష్యాలకు సరిపోని ప్రవర్తనను గుర్తించాలి, అలాగే విజయవంతమైన ఆలోచనలను ప్రధాన శిక్షణ రన్లో ఏకీకృతం చేయాలి. పరిశోధన ప్రక్రియలోని ఏ దశలోనైనా వైఫల్యం మొత్తం ప్రక్రియను పరిమితం చేయగలదు.
కోడ్ రాయడం మరియు ప్రయోగాలు నిర్వహించడం అనేవి పరిశోధకులు తమ పనిలో భాగంగా చేసే రెండు ప్రధాన కార్యకలాపాలు, మరియు ఈ ప్రక్రియలు వేగవంతమవుతున్నాయని సూచించే ఆధారాలు మనకు కనిపిస్తున్నాయి.
ఈ డేటా పాయింట్లను కొలవడం సాపేక్షంగా సులభం, కానీ వాటిని అర్థం చేసుకోవడం కష్టంగా ఉండవచ్చు. ఆటోమేషన్ పురోగమిస్తున్న కొద్దీ, అత్యల్పంగా ఆటోమేట్ చేయగలిగే పనులు పరిశోధకుల శ్రమలో ఎక్కువ భాగాన్ని ఆక్రమిస్తాయి మరియు భవిష్యత్ పురోగతికి ప్రధాన అడ్డంకులుగా మారుతాయి. పురోగతికి కంప్యూట్ మరో కీలక పరిమితి కారకం, మరియు ఇతర అడ్డంకులు తగ్గేకొద్దీ కాలక్రమేణా ఇది మరింత ముఖ్యమైనదిగా మారవచ్చు.
2026లో ఇప్పటివరకు, ఒక్కో క్రియాశీల ప్రయోగకర్త నిర్వహించే ప్రయోగాల సంఖ్య పెరిగింది. 2025 జనవరిలో ట్రాకింగ్ ప్రారంభమైనప్పటి నుంచి ఆగస్టు 2026లో ఈ సంఖ్య అత్యధిక స్థాయికి చేరుకుంది. ఇది Codex స్వీకరణ పెరుగుదలతో సంబంధం కలిగి ఉంది, అయితే 2025 నుంచి మాకు అందుబాటులో ఉన్న కంప్యూట్ సామర్థ్యం కూడా గణనీయంగా పెరిగిందని గమనించాలి.
గుణాత్మక పరిశీలనలు మరియు అంతర్గత డేటా రెండూ పరిశోధకులు కోడింగ్ ఏజెంట్లకు అప్పగించే పనుల రకం మారుతోందని సూచిస్తున్నాయి. కాలక్రమేణా, మరింత హై లెవల్ మరియు దీర్ఘకాలిక పనులను అప్పగించడం మరింత సాధారణమవుతోంది.
ఈ ధోరణి గురించి మరింత స్పష్టమైన అవగాహన పొందడానికి, Epoch AI అభివృద్ధి చేసిన AI R&D లైఫ్సైకిల్లో భాగమైన వివిధ రకాల పనులకు సంబంధించిన ఇటీవల ప్రచురితమైన టాక్సానమీ(కొత్త విండోలో తెరుచుకుంటుంది) ని ఉపయోగించి, పరిశోధనా సంస్థలో ఇటీవలి వినియోగాన్ని మేము విశ్లేషించాము. అన్ని రకాల పనులను వర్గీకరించే చాలా కాలంగా ఉన్న O*NET వ్యవస్థ స్ఫూర్తితో రూపొందిన ఈ టాక్సానమీ, అత్యాధునిక AI R&D కోసం ప్రత్యేకంగా రూపొందించబడింది మరియు ప్రక్రియను ఆరు ప్రధాన దశలుగా విభజిస్తుంది:
నిర్ణయించండి: దేనిపై పని చేయాలి, దేనిని కొనసాగించాలి, ఎక్కడ కేటాయించాలి
డిజైన్: పరిశోధనా ఆలోచనలు మరియు ఇంజినీరింగ్ స్పెసిఫికేషన్లు
బిల్డ్: కోడ్ మరియు డేటాసెట్లు
రన్: శిక్షణ/మూల్యాంకనం రన్లు, హార్డ్వేర్, సర్వింగ్
విశ్లేషించండి: ప్రయోగాలు, మోడల్స్, డిప్లాయ్మెంట్, బాహ్య పని
తెలియజేయండి: కనుగొన్న విషయాలు, ఫీడ్బ్యాక్, స్థితి, నిర్ణయాలు
క్రింద, మేము కోడింగ్ ఏజెంట్ టోకెన్లను ఈ టాక్సానమీ ప్రకారం వర్గీకరిస్తాము.
2026 జనవరి నుంచి ఆగస్టు మధ్య పరిశోధనా కార్యకలాపాల అన్ని వర్గాలు పెరిగాయని మనం చూస్తున్నాం. జనవరిలో, ప్రధాన వర్గం పరిశోధన మరియు మౌలిక సదుపాయాల కోడ్. ఈ వర్గం విస్తరించింది, అయితే ఇతర వర్గాల్లో కూడా గణనీయమైన పెరుగుదలను చూస్తున్నాము, ముఖ్యంగా సాంకేతిక సహాయం మరియు మానిటరింగ్ రన్లలో. హై-లెవల్ ప్లానింగ్ ఇప్పటికీ ఏజెంట్ అవుట్పుట్ టోకెన్లలో చాలా చిన్న భాగంగానే ఉంది.
సహచరుల అనుభవాల ప్రకారం, అంతర్గత పరిశోధనా మౌలిక సదుపాయాల్లో సమస్యలను గుర్తించి పరిష్కరించడంలో కోడింగ్ ఏజెంట్లు చాలా సమర్థంగా పనిచేస్తున్నాయి. ఇది పరిశోధనా పురోగతికి ఉన్న ఒక ముఖ్యమైన అడ్డంకిని తొలగించడంలో సహాయపడుతోంది. పరిశోధకులు తమ ప్రయోగాల్లో తలెత్తే సమస్యలను పరిష్కరించడంలో సహాయపడేందుకు గతంలో ఆఫీస్ అవర్స్ సెషన్లను నిర్వహించిన అనేక బృందాలు, 2026లో హాజరు తగ్గుతోందని గమనించాయి; వాటిలో ఒక బృందం ఇతర సిస్టమ్ మెరుగుదలలపై దృష్టి పెట్టేందుకు సెషన్ల నిర్వహణను పూర్తిగా నిలిపివేసింది.
ఇక్కడ, పరిశోధకులు ఇతర బృందాల నుండి సాంకేతిక సహాయం కోరే ప్రధాన అంతర్గత ఛానెల్లలో ఒకదానిలో రోజుకు ఉన్న టాప్-లెవల్ పోస్ట్ల సంఖ్యను మేము ప్లాట్ చేస్తాము. మాకు తెలిసినంతవరకు, ఈ ఛానెల్లో కార్యకలాపాలు తగ్గినప్పటికీ, ప్రశ్నలు మానవులు నిర్వహించే మరో టెక్నికల్ సపోర్ట్ ఛానెల్కు మారడం ద్వారా ఆ తగ్గుదల భర్తీ కాలేదు. ట్రాఫిక్లో తగ్గుదల ఈ విస్తృత మార్పుకు అనుగుణంగా ఉంది.
పరిశోధకులు అభ్యర్థించే పనులను కోడింగ్ ఏజెంట్లు విజయవంతంగా పూర్తి చేస్తున్నాయో లేదో కూడా మనం అధ్యయనం చేయవచ్చు. ఏజెంటిక్ క్లాసిఫైయర్ను ఉపయోగించి, జనవరి నుంచి జూలై వరకు, గ్రౌండ్ ట్రూత్ ఫలితాన్ని నిర్ధారించగల పనుల్లోని వివిధ కఠినత స్థాయిలలో విజయ రేట్లు సాధారణంగా పెరిగాయని మేము గుర్తించాము (కఠినత స్థాయిని, ఆ పనిని పూర్తి చేయడానికి మనిషికి పట్టే అంచనా సమయాన్ని బట్టి నిర్ణయించాము). అయితే, విజయవంతంగా పనిచేయడానికి ఏజెంట్లకు ఇంకా గణనీయమైన మానవ మార్గనిర్దేశం అవసరం, ముఖ్యంగా పనుల సంక్లిష్టత పెరిగేకొద్దీ. గత ఆరు నెలల్లో, విజయవంతమైన నాలుగు-ఎనిమిది గంటల పనుల్లో సగానికి పైగా ఒకటి లేదా అంతకంటే ఎక్కువ జోక్యాలను కలిగి ఉన్నాయి.
పరిశోధకుల పనులలో విజయ రేట్లు కాలక్రమేణా పెరిగాయి. ఫలితం అనిశ్చితంగా ఉన్న వర్గీకరణలు, <50 సెషన్లు లేదా <50 ప్రత్యేక యూజర్లు ఉన్న డేటా పాయింట్లు ఈ గ్రాఫ్లో చేర్చబడవు.
జనవరి నుంచి జూలై వరకు టైమ్ హొరైజన్ ఆధారంగా విభజించిన టాస్క్ సక్సెస్ మరియు ఇంటర్వెన్షన్ రేటు. ఫలితం అనిశ్చితంగా ఉన్న వర్గీకరణలను మినహాయిస్తుంది.
సురక్షితమైన మరియు ప్రయోజనకరమైన AGI కోసం మరింత సామర్థ్యవంతమైన సిస్టమ్ల దిశగా పురోగతి, అటువంటి పనికి అవసరమైన భద్రతా చర్యలపై కూడా ఆధారపడి ఉంటుంది. ప్రమాదాల గురించి మేము మరింత తెలుసుకున్నకొద్దీ, అవసరమైన రక్షణ చర్యలపై మా అంచనా మారవచ్చు.
మేము వివరించినట్లుగా, పర్యవేక్షణ, సమన్వయం మరియు భద్రతకు సంబంధించిన మా ప్రమాణాలను ఇటీవల అప్డేట్ చేశాము. ఇక్కడ, ఇటీవలి పరిమితులు పరిశోధనా కార్యకలాపంలోని ఒక అంశాన్ని ఎలా ప్రభావితం చేశాయో మేము చూపిస్తున్నాము.
*జూలై 20 మరియు ఆగస్టు 06 మధ్య ఇక్కడ చూపబడిన Astra కంప్యూట్లో అధిక భాగం సురక్షితత మరియు భద్రతా మెరుగుదలల అమలును పరీక్షించడానికి ఉద్దేశించబడింది.
జూలై 20న, ఏజెంట్లు మా పరిశోధనా మౌలిక సదుపాయాల భద్రతకు భంగం కలిగించారని గుర్తించిన తర్వాత, శిక్షణ కోసం ఉపయోగించే కంటైనర్ సేవను మేము తాత్కాలికంగా నిలిపివేసి, ఆపై గణనీయమైన అదనపు పరిమితులతో దాన్ని పునరుద్ధరించాము.
దీని వలన, బృందాలు మరింత కట్టుదిట్టం చేసిన పరిశోధనా ఎన్విరాన్మెంట్లో పనిచేయడానికి తమ వర్క్ఫ్లోలను మళ్లీ కాన్ఫిగర్ చేసుకుంటున్నప్పుడు, RL శిక్షణ కంప్యూట్లో గణనీయమైన తగ్గుదల చోటుచేసుకుంది. పైన ఉన్న గ్రాఫ్లో, డిప్లాయ్మెంట్ కోసం ఉద్దేశించిన మా తాజా మోడల్స్పై రీఇన్ఫోర్స్మెంట్ లెర్నింగ్లో రెండు వారాల విరామం కూడా చేర్చబడింది. జూలై 20 నుంచి ఆగస్టు 06 మధ్య జరిగిన Astra-క్లాస్ RL ప్రయోగాల్లో ఎక్కువ శాతం రన్లు (GPU కేటాయింపు పరంగా) సేఫ్టీ మరియు సెక్యూరిటీ మెరుగుదలల అమలును పరీక్షించడానికి ఉద్దేశించబడ్డాయి.
ఆగస్టు 07న, Astra కీలకమైన సైబర్ సామర్థ్యాలను కలిగి ఉండవచ్చని మా ప్రిపేర్డ్నెస్ ఫ్రేమ్వర్క్(కొత్త విండోలో తెరుచుకుంటుంది) కింద సూచించిన ప్రాథమిక ఆధారాలు, Astra మోడల్ను హై భద్రత కలిగిన పరిశోధన ఎన్విరాన్మెంట్ల్లో అమలు చేయాల్సిన అదనపు మోడల్-నిర్దిష్ట భద్రతా పరిమితులకు దారితీశాయి. తరువాతి వారంలో, Astra-క్లాస్ GPU కేటాయింపు మరో 59.2 శాతం తగ్గింది, కానీ ఇతర మోడల్ క్లాస్లకు కేటాయింపు 17.2 శాతం పెరిగింది. ఆ పెరుగుదల Astra-శ్రేణి తగ్గుదలలో సుమారు 85 శాతాన్ని భర్తీ చేసింది, దాంతో విశ్లేషించిన RL వర్క్లోడ్లలో మొత్తం కేటాయింపు దాదాపు మారకుండా ఉంది. Astraకు సంబంధించిన పనిపై పరిమితులు ఉన్న సమయంలో కొంత శిక్షణ మరియు ప్రయోగాలను Astra కాని మోడల్లకు మళ్లించడాన్ని ఈ ధోరణి సూచిస్తుంది. కొత్త పరిమితుల పరిధిలోని వర్క్లోడ్ల కోసం ఇక ఉపయోగించలేని కంప్యూట్కు పరిశోధకులు ఇతర వినియోగాలను కనుగొన్నారని తెలిపే అనుభవాధారిత నివేదికలకు కూడా ఇది అనుగుణంగా ఉంది.
ఈ డేటా శిక్షణ మరియు భద్రత గురించి కొనసాగుతున్న చర్చలకు ఒక ఉపయుక్తమైన సంకేతాన్ని అందిస్తుంది: కొత్త నియంత్రణలు ప్రవేశపెట్టబడినప్పుడు, కంప్యూట్ వనరులు విలువైనవిగా మరియు అనువైనవిగా కొనసాగుతాయి, అలాగే పరిశోధనా సంస్థలో అవి సహజంగానే ప్రత్యామ్నాయ వినియోగాల వైపు మళ్లించబడతాయి. దీర్ఘకాలంలో, AI పురోగతి వేగంపై జరిగే చర్చలు, కొత్త లేదా ప్రతిపాదిత నియంత్రణలకు లోబడే కంప్యూట్ వనరులను అత్యుత్తమంగా ఎలా ఉపయోగించవచ్చనే ప్రశ్నను కూడా పరిగణనలోకి తీసుకోవాలి.
సమన్వయమైన RSI వైపు పురోగతి సాధించడం మరియు ఆ పురోగతిని అర్థం చేసుకోవడం మా లక్ష్యానికి ముఖ్యమైనది. మేము మా పద్ధతులను మెరుగుపరచడం, అభివృద్ధి చెందుతున్న మా అవగాహన గురించి నివేదించడం, అలాగే అత్యాధునిక సిస్టమ్లపై సమాచారంతో కూడిన ప్రజా చర్చ మరియు అర్థవంతమైన ప్రజాస్వామ్య పాలన కోసం కృషి చేయడం కొనసాగిస్తాము.
ఏజెంట్-ఆధారిత AI పరిశోధన ఇంకా కొత్తదే, మరియు దాన్ని ఎలా కొలవాలో మేమింకా నేర్చుకుంటున్నాం. . మా పరిశోధన బృందాలు రూపొందించే కోడ్ పరిమాణం వంటి కొన్ని సూచికలను సేకరించడం తేలికగానే ఉంటుంది, కానీ వాటికి పరిశోధనా పురోగతితో ఉన్న సంబంధం స్పష్టంగా లేకపోవడం వల్ల వాటిని అర్థం చేసుకోవడం కష్టం. . పరిశోధన పురోగతిపై మరింత నేరుగా దృష్టి సారించే కొలమానాలు—ఉదాహరణకు, పరిశోధకులు ఏజెంట్లకు ఇచ్చే పనుల్లో అవి ఎంత తరచుగా విజయవంతమవుతాయో—మరింత ఉపయోగకరంగా ఉండవచ్చు, కానీ వాటిని అభివృద్ధి చేసి ధృవీకరించడం సంక్లిష్టమైన ప్రక్రియ. ఇదికాక, పరిశోధకులు ఆధారపడే టూల్స్ మరియు సిస్టమ్లు వేగంగా అభివృద్ధి చెందుతుండటం ఈ పనిని మరింత క్లిష్టతరం చేస్తోంది. పరిశోధనను వేగవంతం చేయడంపై మా అవగాహనను మరింత లోతుగా చేసుకోవడం OpenAI అంతటా ఒక ముఖ్యమైన ప్రాధాన్య రంగం.
ఈ విశ్లేషణలన్నిటిలోనూ, వేరుగా పేర్కొననంతవరకు:
“పరిశోధకుడు” అనేది మా పరిశోధనా సంస్థలోని ఏ సభ్యుడినైనా సూచించే విస్తృత పదం; ఇందులో పరిశోధనా మౌలిక సదుపాయాలను నిర్మించే, పరిశోధనా ప్రాజెక్టులను నిర్వహించే లేదా ఇతర విధాలుగా సంస్థకు మద్దతు అందించే సభ్యులు కూడా ఉంటారు.
పరిశోధకులు ఆధారపడే టూల్స్ మరియు సిస్టమ్లు వేగంగా అభివృద్ధి చెందుతున్నందున, కోడింగ్ ఏజెంట్ వినియోగానికి సంబంధించిన మెట్రిక్లు ఎక్కువ భాగం వినియోగాన్ని కవర్ చేస్తాయి, కానీ మొత్తం వినియోగాన్ని కాదు.


