ప్రధాన కంటెంట్‌కి దాటండి
OpenAI

పరిశోధన వేగవంతం: OpenAI లోపలి దృశ్యం

లోడ్ అవుతోంది…

AGI మొత్తం మానవాళికి ప్రయోజనం చేకూర్చాలంటే, దాన్ని ప్రజాస్వామ్యబద్ధంగా పాలించాలని మేము నమ్ముతున్నాం. అత్యంత సామర్థ్యవంతమైన AI వ్యవస్థల సామర్థ్యాలు, ప్రమాదాలు మరియు రక్షణ చర్యలపై సమాచారంతో కూడిన ప్రజా చర్చ ద్వారానే ఇది సాధ్యమవుతుంది. అత్యాధునిక AI భవిష్యత్తులో తీసుకోగల దిశను ప్రతిచోటా ప్రజలు అర్థం చేసుకోవాలి, తద్వారా అది ఎలా అభివృద్ధి చెందుతుందనే విషయంలో వారు అర్థవంతంగా తమ అభిప్రాయాన్ని వ్యక్తం చేయగలరు.

నిర్దిష్ట ప్రమాదాలు, ఘటనలు మరియు రక్షణ చర్యల గురించి పారదర్శకత అవసరం, కానీ అది మాత్రమే సరిపోదు. అత్యంత సామర్థ్యవంతమైన వ్యవస్థలు ఎలా అభివృద్ధి చెందుతున్నాయో, అలాగే అత్యాధునిక ప్రయోగశాలల్లో అవి పరిశోధన పురోగతిని ఎలా ముందుకు నడిపిస్తున్నాయో కూడా ప్రజలు అర్థం చేసుకోవాల్సిన అవసరం ఉందని మేము విశ్వసిస్తున్నాం.

పునరావృత మెరుగుదలలను సాధ్యం చేస్తూ, డీప్ లెర్నింగ్ మరియు అలైన్‌మెంట్‌లో మరింత పురోగతి కోసం మానవ పర్యవేక్షణలో పని చేయగల స్వయంచాలక AI పరిశోధకుడిని సురక్షితంగా నిర్మించడమే మా లక్ష్యం. మా కొలమానాల ప్రకారం, గత శరదృతువులో ప్రకటించిన⁠(కొత్త విండోలో తెరుచుకుంటుంది) ఈ సంవత్సరం సెప్టెంబర్ నాటికి స్వయంచాలిత పరిశోధనా ఇంటర్న్‌ను అందుబాటులోకి తీసుకురావాలనే లక్ష్యాన్ని మేము ఇప్పుడు సాధించాము. “పరిశోధన ఇంటర్న్” అంటే, మానవ మార్గదర్శకత్వంలో స్పష్టంగా నిర్వచించబడిన పరిశోధనా పనులను నిర్వహించగల వ్యవస్థ అని మేము ఉద్దేశిస్తున్నాము; ఇందులో నైపుణ్యం కలిగిన పరిశోధకుడికి కొన్ని రోజులు పట్టే పనులు కూడా ఉంటాయి. 2028 మార్చి నాటికి స్వయంచాలిత AI పరిశోధకుడిని సృష్టించే దిశగా మేము గణనీయమైన పురోగతి సాధిస్తున్నాము.

ఈ ఏడాది కాలంలో OpenAI పరిశోధకుల రోజువారీ పని గణనీయంగా మారింది. పరిశోధకులు రోజంతా కోడింగ్ ఏజెంట్లను (తరచుగా ఏకకాల సెషన్‌లలో) ఉపయోగిస్తున్నారు, మరియు మొత్తం వినియోగం వేగంగా పెరుగుతూ ఇతర OpenAI బృందాల వృద్ధి రేటును మించిపోతోంది. పరిశోధకులు మరింత వేగంగా కోడ్‌ను అందిస్తున్నారు మరియు మరిన్ని ప్రయోగాలను నిర్వహిస్తున్నారు. పరిశోధకులు ఏజెంట్లను ఉపయోగించే విధానాలు కూడా మారుతున్నాయి: ఏజెంట్లు క్రమంగా మరింత క్లిష్టమైన పనులను నిర్వహిస్తున్నాయి, అలాగే వాటిని మరింత తరచుగా విజయవంతంగా పూర్తి చేస్తున్నాయి. AI పరిశోధన అనేది అనేక సంభావ్య అవరోధాలతో కూడిన సంక్లిష్టమైన ప్రక్రియ. కాబట్టి, పురోగతి యొక్క మొత్తం వేగం ఈ నిర్దిష్ట కొలమానాల వేగానికి అనుగుణంగా ఉండకపోవచ్చు. కానీ మొత్తం మీద, ఏజెంటిక్ టూల్స్ పరిశోధన పురోగతిని గణనీయంగా వేగవంతం చేస్తున్నాయనే మనలో చాలామందికి ఉన్న విస్తృత అంతర్గత అభిప్రాయానికి ఈ ఫలితాలు అనుగుణంగా ఉన్నాయి. మా పరిశోధనా ప్రాధాన్యతలను ఇప్పటికీ మనుషులే నిర్ణయిస్తారు, ఏ ఆలోచనలు మరియు ఫలితాలను ముందుకు తీసుకెళ్లాలో మదింపు చేస్తారు, అలాగే వ్యవస్థలను విస్తరించాలా, తాత్కాలికంగా నిలిపివేయాలా లేదా అమలులోకి తేవాలా అనేది నిర్ణయిస్తారు.

ఇది బాధ్యతాయుతంగా జరిగితే, స్వయంచాలక AI పరిశోధన నేరుగా మానవ సంక్షేమాన్ని మెరుగుపరచి, OpenAI మిషన్‌ను ముందుకు తీసుకెళ్లే మోడల్‌లను అందిస్తుందని మేము నమ్ముతున్నాము. ప్రపంచవ్యాప్తంగా ప్రజలు ప్రయోజనం పొందేలా ఇది అధునాతన ఇంటెలిజెన్స్ వ్యయాన్ని తగ్గించగలదు. స్వయంచాలిత పరిశోధన అలైన్‌మెంట్‌ను పరిష్కరించడంలో, అలాగే క్రమంగా మరింత సామర్థ్యవంతమవుతున్న AIకి వ్యతిరేకంగా రక్షణలను నిర్మించడంలో మాకు సహాయపడగలదనే కారణంతో కూడా మేము ఈ పనిని కొనసాగిస్తున్నాము. ఒక స్వయంచాలిత AI పరిశోధకుడు స్వయంచాలిత భద్రత లేదా అలైన్‌మెంట్ పరిశోధకుడిగానూ ఉండవచ్చు. మరింత సామర్థ్యవంతమైన, అలైన్‌మెంట్ కలిగిన వ్యవస్థలు కీలక మౌలిక సదుపాయాలను భద్రపరచడంలో, ప్రమాదకరమైన AI ఏజెంట్ల నుంచి రక్షించడంలో, అలాగే కొత్త రక్షణ చర్యలను అభివృద్ధి చేయడంలో సహాయపడగలవు.

ఇవి ఉపయోగకరమైన స్వయంచాలిత పరిశోధన సామర్థ్యాలను అభివృద్ధి చేయడానికి కారణాలు, కానీ వేగవంతమైన RSI తప్పనిసరిగా మనం అనుసరించాల్సిన ఫలితం అని దీని అర్థం కాదు. ముందుకు సాగాలా, సాగితే ఎలా సాగాలి అన్నది మానవ నియంత్రణను కాపాడగల మన సామర్థ్యంపైనా, ప్రయోజనాలు మరియు ప్రమాదాల గురించి సమాచారంతో కూడిన ప్రజాస్వామ్య నిర్ణయాలపైనా ఆధారపడి ఉండాలి.

అలైన్ చేయబడిన, సంపూర్ణ RSI వరకు సురక్షితంగా ఎలా చేరుకోవాలో మనకు ఇంకా తెలియదు. మేము సామర్థ్యాలతో పాటు అలైన్‌మెంట్ మరియు భద్రతా చర్యలను కూడా విస్తరించేందుకు పని చేస్తున్నాము. కానీ అలైన్‌మెంట్ మరియు భద్రతలో పురోగతి అదే వేగంతో ముందుకు సాగుతుందని మనం ఊహించలేము, అలాగే మరింత సామర్థ్యవంతమైన వ్యవస్థలను పర్యవేక్షించడం మరింత కష్టమవుతుంది. ఈ ప్రయత్నంలో జాగ్రత్తగా చేసే అలైన్‌మెంట్ మరియు భద్రతా పని కేంద్రంగా ఉంది, ఇది ఏజెంటిక్ కోడింగ్ వ్యవస్థల్లో ప్రస్తుతం మేము చూస్తున్న భద్రతా సమస్యలను కొలవడం మరియు తగ్గించడం ద్వారా ఇది ప్రారంభమవుతుంది. ముందుకు సాగడం ఆమోదయోగ్యం కాని భద్రతా ప్రమాదాన్ని కలిగిస్తుందని మేము గుర్తించినప్పుడు, తగిన విధంగా స్పందిస్తాము; అందులో, తగినంతగా రక్షణ కల్పించలేమని మేము గుర్తించిన వ్యవస్థల అభివృద్ధిని లేదా అమలులోకి తీసుకురావడాన్ని నెమ్మదించడం లేదా నిలిపివేయడం కూడా ఉంటుంది.

ఇటీవలి Hugging Face ఘటన తర్వాత, మేము ఈ నిబద్ధతను అమల్లోకి తెచ్చాము⁠. మా పరిశోధన పరిసరాలను మరింత పటిష్ఠం చేసి, రెడ్-టీమ్ పరీక్షలు నిర్వహిస్తూ, మా మానిటరింగ్ సిస్టమ్‌ల కవరేజ్‌ను విస్తరిస్తున్న సమయంలో, డిప్లాయ్‌మెంట్ కోసం ఉద్దేశించిన మా తాజా మోడల్‌లపై రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ (RL) శిక్షణను నిలిపివేశాము. దీంతో మొత్తం పరిశోధన నిలిచిపోలేదు: కొన్ని వర్క్‌లోడ్‌లు మరింత కఠినమైన నియంత్రణల కింద మళ్లీ ప్రారంభమయ్యాయి, మరికొన్ని మాత్రం నిలిపివేయబడ్డాయి. మేము మా సేఫ్టీ మరియు అలైన్‌మెంట్ ప్రమాణాలను మరింత ఉన్నత స్థాయికి తీసుకెళ్లాము, అలాగే మోడల్ లైఫ్‌సైకిల్‌లో భద్రతా పనిని మరింత లోతుగా చేర్చాము. దీనివల్ల మొత్తం శిక్షణ ప్రక్రియలో అలైన్‌మెంట్‌కు అనుగుణమైన ప్రవర్తనకు మరింత బలమైన ఆధారాలు అవసరమవుతాయి.

ఇటీవలి నెలల్లో RSI వైపు మా పురోగతికి ఏజెంటిక్ సిస్టమ్‌లు ఎలా దోహదపడ్డాయో అనే విషయంపై ఈ రోజు మేము సమగ్ర అవలోకనాన్ని అందిస్తున్నాము. ఏజెంటిక్ సిస్టమ్‌లు కొత్తవి మరియు వేగంగా మారుతున్నాయి, అలాగే వాటిని కొలిచే మా ప్రయత్నాలు ఇంకా ప్రాథమిక దశలోనే ఉన్నాయి. ఈ ప్రారంభ ఫలితాలను, వాటి వెనుక ఉన్న పద్ధతులను పంచుకోవడం ద్వారా ప్రజలకు సమాచారం అందించడం, బహిరంగ వెల్లడింపును ఒక సాధారణ ప్రమాణంగా ప్రోత్సహించడం, అలాగే ఈ రంగం కొలతలకు సంబంధించిన ఉమ్మడి ప్రమాణాల వైపు ముందుకు సాగేందుకు సహాయపడడం మా లక్ష్యం.

చివరికి, మా అత్యాధునిక విధాన బ్లూప్రింట్⁠లో మేం రాసినట్లుగా, మేము మరియు ఇతర కంపెనీలు RSI దిశగా మా పురోగతిని బహిరంగంగా ట్రాక్ చేయడం తప్పనిసరి కావాలని మేం నమ్ముతున్నాం. అలాంటి అవసరం లేకపోయినా, మా RSI పురోగతి గురించి పారదర్శకంగా ఉండడాన్ని కొనసాగించాలని మేము భావిస్తున్నాము. మా కొలత పద్ధతులు మరియు అవగాహన మెరుగుపడే కొద్దీ, భద్రతను మరియు యాజమాన్య సమాచారాన్ని రక్షించాల్సిన అవసరాన్ని సమతుల్యం చేస్తూ, మా పారదర్శకత విధానాన్ని కూడా అభివృద్ధి చేస్తాము.

1. కోడింగ్ ఏజెంట్లు OpenAI పరిశోధకుల రోజువారీ పని విధానాన్ని మారుస్తున్నాయి

ఈ సంవత్సరం ప్రారంభంలో, OpenAI‌లో ఏజెంట్ వినియోగం ఆధారంగా మధ్యస్థ స్థాయిలో ఉన్న పరిశోధకుడు కోడింగ్ ఏజెంట్లను పరిమిత స్థాయిలో మాత్రమే ఉపయోగించేవారు. ఆగస్టు మధ్య నాటికి, మధ్యస్థ స్థానంలో ఉన్న పరిశోధకుడు తమ పనిలో ప్రతిరోజూ ఏజెంట్లను అనుసంధానిస్తూ, API ధరల ప్రకారం రోజుకు $600 కంటే ఎక్కువ విలువైన ఇన్‌ఫరెన్స్‌ను ఉపయోగిస్తున్నారు. మా పరిశోధనా సంస్థలోని 90వ పర్సెంటైల్‌లోని యూజర్ ఇప్పుడు రోజుకు $7,000 కంటే ఎక్కువ విలువైన టోకెన్లను ఉపయోగిస్తున్నారు.

జూన్ 2026కి ముందు, పరిశోధనా సంస్థ అంతటా ఏజెంట్ల మొత్తం రన్‌టైమ్ ఇంకా మొత్తం మానవ శ్రమ కంటే తక్కువగా ఉండేది. అప్పటి నుంచి పరిస్థితి మారింది. ప్రామాణిక ఎనిమిది గంటల పనిదినం పరంగా, ఆగస్టు మధ్య నాటికి, మొత్తం మీద పరిశోధనా సంస్థ మానవ శ్రమలోని ప్రతి పనిదినానికి 3.1 ఏజెంట్-పనిదినాల శ్రమను ఉపయోగిస్తోంది.

దీనిని అర్థం చేసుకునే మరో విధానం ఏమిటంటే, ఎంత మంది పరిశోధకులు అధిక సమాంతరత కలిగిన వర్క్‌ఫ్లోలను ఉపయోగిస్తున్నారో తెలుసుకోవడం (ఉదా., ఒకేసారి నాలుగు లేదా అంతకంటే ఎక్కువ ఏజెంట్లను అమలు చేయడం). క్రింద చూపినట్లుగా, ఈ సంఖ్య పెరుగుతోంది. ఈ గణాంకాల్లో యూజర్ నేరుగా ప్రారంభించిన ఏజెంట్ల రోజువారీ గరిష్ఠ వినియోగం, అలాగే యూజర్ నేరుగా ప్రారంభించిన ఏజెంట్ల నుంచి తదుపరి దశలో సృష్టించబడిన సబ్‌ఏజెంట్ల రోజువారీ గరిష్ఠ వినియోగం రెండూ ఉన్నాయి.

2. పరిశోధకులు మరింత కోడ్ రాస్తున్నారు మరియు మరిన్ని ప్రయోగాలు నిర్వహిస్తున్నారు

AI పరిశోధనలో ఎక్కువ భాగాన్ని, మోడల్ ఇంటెలిజెన్స్ లేదా పనితీరుకు సంబంధించిన కొత్త మెరుగుదలను మా ప్రధాన మోడళ్లలో ఒకదానిలో ఏకీకృతం చేయాలనే లక్ష్యంతో సాగే శ్రమతో కూడిన ప్రక్రియగా చూడవచ్చు. ఈ ప్రక్రియ అనేక దశలపై ఆధారపడి ఉంటుంది, మరియు అన్ని దశలు సరిగ్గా కలిసి పనిచేసినప్పుడే సామర్థ్యాలు అభివృద్ధి చెందుతాయి: పరిశోధకులు కొత్త మెరుగుదలలను రూపొందించాలి, మోడల్ పనితీరును అంచనా వేయడానికి మూల్యాంకనాలను రూపొందించాలి, ఈ మెరుగుదలలను విస్తృత స్థాయిలో పరీక్షించడానికి మౌలిక సదుపాయాలను రూపొందించాలి, శిక్షణ సమయంలో బగ్‌లతో పాటు అసురక్షితమైన లేదా లక్ష్యాలకు సరిపోని ప్రవర్తనను గుర్తించాలి, అలాగే విజయవంతమైన ఆలోచనలను ప్రధాన శిక్షణ రన్‌లో ఏకీకృతం చేయాలి. పరిశోధన ప్రక్రియలోని ఏ దశలోనైనా వైఫల్యం మొత్తం ప్రక్రియను పరిమితం చేయగలదు.

కోడ్ రాయడం మరియు ప్రయోగాలు నిర్వహించడం అనేవి పరిశోధకులు తమ పనిలో భాగంగా చేసే రెండు ప్రధాన కార్యకలాపాలు, మరియు ఈ ప్రక్రియలు వేగవంతమవుతున్నాయని సూచించే ఆధారాలు మనకు కనిపిస్తున్నాయి.

ఈ డేటా పాయింట్లను కొలవడం సాపేక్షంగా సులభం, కానీ వాటిని అర్థం చేసుకోవడం కష్టంగా ఉండవచ్చు. ఆటోమేషన్ పురోగమిస్తున్న కొద్దీ, అత్యల్పంగా ఆటోమేట్ చేయగలిగే పనులు పరిశోధకుల శ్రమలో ఎక్కువ భాగాన్ని ఆక్రమిస్తాయి మరియు భవిష్యత్ పురోగతికి ప్రధాన అడ్డంకులుగా మారుతాయి. పురోగతికి కంప్యూట్ మరో కీలక పరిమితి కారకం, మరియు ఇతర అడ్డంకులు తగ్గేకొద్దీ కాలక్రమేణా ఇది మరింత ముఖ్యమైనదిగా మారవచ్చు.

2026లో ఇప్పటివరకు, ఒక్కో క్రియాశీల ప్రయోగకర్త నిర్వహించే ప్రయోగాల సంఖ్య పెరిగింది. 2025 జనవరిలో ట్రాకింగ్ ప్రారంభమైనప్పటి నుంచి ఆగస్టు 2026లో ఈ సంఖ్య అత్యధిక స్థాయికి చేరుకుంది. ఇది Codex స్వీకరణ పెరుగుదలతో సంబంధం కలిగి ఉంది, అయితే 2025 నుంచి మాకు అందుబాటులో ఉన్న కంప్యూట్ సామర్థ్యం కూడా గణనీయంగా పెరిగిందని గమనించాలి.

3. పరిశోధకులు ఏజెంట్లను ఉపయోగించే పనులు మారుతున్నాయి

గుణాత్మక పరిశీలనలు మరియు అంతర్గత డేటా రెండూ పరిశోధకులు కోడింగ్ ఏజెంట్లకు అప్పగించే పనుల రకం మారుతోందని సూచిస్తున్నాయి. కాలక్రమేణా, మరింత హై లెవల్ మరియు దీర్ఘకాలిక పనులను అప్పగించడం మరింత సాధారణమవుతోంది.

ఈ ధోరణి గురించి మరింత స్పష్టమైన అవగాహన పొందడానికి, Epoch AI అభివృద్ధి చేసిన AI R&D లైఫ్‌సైకిల్‌లో భాగమైన వివిధ రకాల పనులకు సంబంధించిన ఇటీవల ప్రచురితమైన టాక్సానమీ⁠(కొత్త విండోలో తెరుచుకుంటుంది) ని ఉపయోగించి, పరిశోధనా సంస్థలో ఇటీవలి వినియోగాన్ని మేము విశ్లేషించాము. అన్ని రకాల పనులను వర్గీకరించే చాలా కాలంగా ఉన్న O*NET వ్యవస్థ స్ఫూర్తితో రూపొందిన ఈ టాక్సానమీ, అత్యాధునిక AI R&D కోసం ప్రత్యేకంగా రూపొందించబడింది మరియు ప్రక్రియను ఆరు ప్రధాన దశలుగా విభజిస్తుంది:

  1. నిర్ణయించండి: దేనిపై పని చేయాలి, దేనిని కొనసాగించాలి, ఎక్కడ కేటాయించాలి

  2. డిజైన్: పరిశోధనా ఆలోచనలు మరియు ఇంజినీరింగ్ స్పెసిఫికేషన్‌లు

  3. బిల్డ్: కోడ్ మరియు డేటాసెట్‌లు

  4. రన్: శిక్షణ/మూల్యాంకనం రన్‌లు, హార్డ్‌వేర్, సర్వింగ్

  5. విశ్లేషించండి: ప్రయోగాలు, మోడల్స్, డిప్లాయ్‌మెంట్, బాహ్య పని

  6. తెలియజేయండి: కనుగొన్న విషయాలు, ఫీడ్‌బ్యాక్, స్థితి, నిర్ణయాలు

క్రింద, మేము కోడింగ్ ఏజెంట్ టోకెన్‌లను ఈ టాక్సానమీ ప్రకారం వర్గీకరిస్తాము.

2026 జనవరి నుంచి ఆగస్టు మధ్య పరిశోధనా కార్యకలాపాల అన్ని వర్గాలు పెరిగాయని మనం చూస్తున్నాం. జనవరిలో, ప్రధాన వర్గం పరిశోధన మరియు మౌలిక సదుపాయాల కోడ్. ఈ వర్గం విస్తరించింది, అయితే ఇతర వర్గాల్లో కూడా గణనీయమైన పెరుగుదలను చూస్తున్నాము, ముఖ్యంగా సాంకేతిక సహాయం మరియు మానిటరింగ్ రన్‌లలో. హై-లెవల్ ప్లానింగ్ ఇప్పటికీ ఏజెంట్ అవుట్‌పుట్ టోకెన్లలో చాలా చిన్న భాగంగానే ఉంది.

సహచరుల అనుభవాల ప్రకారం, అంతర్గత పరిశోధనా మౌలిక సదుపాయాల్లో సమస్యలను గుర్తించి పరిష్కరించడంలో కోడింగ్ ఏజెంట్లు చాలా సమర్థంగా పనిచేస్తున్నాయి. ఇది పరిశోధనా పురోగతికి ఉన్న ఒక ముఖ్యమైన అడ్డంకిని తొలగించడంలో సహాయపడుతోంది. పరిశోధకులు తమ ప్రయోగాల్లో తలెత్తే సమస్యలను పరిష్కరించడంలో సహాయపడేందుకు గతంలో ఆఫీస్ అవర్స్ సెషన్‌లను నిర్వహించిన అనేక బృందాలు, 2026లో హాజరు తగ్గుతోందని గమనించాయి; వాటిలో ఒక బృందం ఇతర సిస్టమ్ మెరుగుదలలపై దృష్టి పెట్టేందుకు సెషన్‌ల నిర్వహణను పూర్తిగా నిలిపివేసింది.

ఇక్కడ, పరిశోధకులు ఇతర బృందాల నుండి సాంకేతిక సహాయం కోరే ప్రధాన అంతర్గత ఛానెల్‌లలో ఒకదానిలో రోజుకు ఉన్న టాప్-లెవల్ పోస్ట్‌ల సంఖ్యను మేము ప్లాట్ చేస్తాము. మాకు తెలిసినంతవరకు, ఈ ఛానెల్‌లో కార్యకలాపాలు తగ్గినప్పటికీ, ప్రశ్నలు మానవులు నిర్వహించే మరో టెక్నికల్ సపోర్ట్ ఛానెల్‌కు మారడం ద్వారా ఆ తగ్గుదల భర్తీ కాలేదు. ట్రాఫిక్‌లో తగ్గుదల ఈ విస్తృత మార్పుకు అనుగుణంగా ఉంది.

పరిశోధకులు అభ్యర్థించే పనులను కోడింగ్ ఏజెంట్లు విజయవంతంగా పూర్తి చేస్తున్నాయో లేదో కూడా మనం అధ్యయనం చేయవచ్చు. ఏజెంటిక్ క్లాసిఫైయర్‌ను ఉపయోగించి, జనవరి నుంచి జూలై వరకు, గ్రౌండ్ ట్రూత్ ఫలితాన్ని నిర్ధారించగల పనుల్లోని వివిధ కఠినత స్థాయిలలో విజయ రేట్లు సాధారణంగా పెరిగాయని మేము గుర్తించాము (కఠినత స్థాయిని, ఆ పనిని పూర్తి చేయడానికి మనిషికి పట్టే అంచనా సమయాన్ని బట్టి నిర్ణయించాము). అయితే, విజయవంతంగా పనిచేయడానికి ఏజెంట్లకు ఇంకా గణనీయమైన మానవ మార్గనిర్దేశం అవసరం, ముఖ్యంగా పనుల సంక్లిష్టత పెరిగేకొద్దీ. గత ఆరు నెలల్లో, విజయవంతమైన నాలుగు-ఎనిమిది గంటల పనుల్లో సగానికి పైగా ఒకటి లేదా అంతకంటే ఎక్కువ జోక్యాలను కలిగి ఉన్నాయి.

పరిశోధకుల పనులలో విజయ రేట్లు కాలక్రమేణా పెరిగాయి. ఫలితం అనిశ్చితంగా ఉన్న వర్గీకరణలు, <50 సెషన్‌లు లేదా <50 ప్రత్యేక యూజర్లు ఉన్న డేటా పాయింట్లు ఈ గ్రాఫ్‌లో చేర్చబడవు.

జనవరి నుంచి జూలై వరకు టైమ్ హొరైజన్‌ ఆధారంగా విభజించిన టాస్క్ సక్సెస్ మరియు ఇంటర్వెన్షన్ రేటు. ఫలితం అనిశ్చితంగా ఉన్న వర్గీకరణలను మినహాయిస్తుంది.

4. మోడల్ అభివృద్ధిని సమతుల్యం చేయడం

సురక్షితమైన మరియు ప్రయోజనకరమైన AGI కోసం మరింత సామర్థ్యవంతమైన సిస్టమ్‌ల దిశగా పురోగతి, అటువంటి పనికి అవసరమైన భద్రతా చర్యలపై కూడా ఆధారపడి ఉంటుంది. ప్రమాదాల గురించి మేము మరింత తెలుసుకున్నకొద్దీ, అవసరమైన రక్షణ చర్యలపై మా అంచనా మారవచ్చు.

మేము వివరించినట్లుగా,⁠ పర్యవేక్షణ, సమన్వయం మరియు భద్రతకు సంబంధించిన మా ప్రమాణాలను ఇటీవల అప్‌డేట్ చేశాము. ఇక్కడ, ఇటీవలి పరిమితులు పరిశోధనా కార్యకలాపంలోని ఒక అంశాన్ని ఎలా ప్రభావితం చేశాయో మేము చూపిస్తున్నాము.

*జూలై 20 మరియు ఆగస్టు 06 మధ్య ఇక్కడ చూపబడిన Astra కంప్యూట్‌లో అధిక భాగం సురక్షితత మరియు భద్రతా మెరుగుదలల అమలును పరీక్షించడానికి ఉద్దేశించబడింది.

జూలై 20న, ఏజెంట్లు మా పరిశోధనా మౌలిక సదుపాయాల భద్రతకు భంగం కలిగించారని గుర్తించిన తర్వాత, శిక్షణ కోసం ఉపయోగించే కంటైనర్ సేవను మేము తాత్కాలికంగా నిలిపివేసి, ఆపై గణనీయమైన అదనపు పరిమితులతో దాన్ని పునరుద్ధరించాము.

దీని వలన, బృందాలు మరింత కట్టుదిట్టం చేసిన పరిశోధనా ఎన్విరాన్‍మెంట్‍లో పనిచేయడానికి తమ వర్క్‌ఫ్లోలను మళ్లీ కాన్ఫిగర్ చేసుకుంటున్నప్పుడు, RL శిక్షణ కంప్యూట్‌లో గణనీయమైన తగ్గుదల చోటుచేసుకుంది. పైన ఉన్న గ్రాఫ్‌లో, డిప్లాయ్‌మెంట్ కోసం ఉద్దేశించిన మా తాజా మోడల్స్‌పై రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్‌లో రెండు వారాల విరామం కూడా చేర్చబడింది. జూలై 20 నుంచి ఆగస్టు 06 మధ్య జరిగిన Astra-క్లాస్ RL ప్రయోగాల్లో ఎక్కువ శాతం రన్‌లు (GPU కేటాయింపు పరంగా) సేఫ్టీ మరియు సెక్యూరిటీ మెరుగుదలల అమలును పరీక్షించడానికి ఉద్దేశించబడ్డాయి.

ఆగస్టు 07న, Astra కీలకమైన సైబర్ సామర్థ్యాలను కలిగి ఉండవచ్చని⁠ మా ప్రిపేర్‌డ్నెస్ ఫ్రేమ్‌వర్క్⁠(కొత్త విండోలో తెరుచుకుంటుంది) కింద సూచించిన ప్రాథమిక ఆధారాలు, Astra మోడల్‌ను హై భద్రత కలిగిన పరిశోధన ఎన్విరాన్‍మెంట్‍ల్లో అమలు చేయాల్సిన అదనపు మోడల్-నిర్దిష్ట భద్రతా పరిమితులకు దారితీశాయి. తరువాతి వారంలో, Astra-క్లాస్ GPU కేటాయింపు మరో 59.2 శాతం తగ్గింది, కానీ ఇతర మోడల్ క్లాస్‌లకు కేటాయింపు 17.2 శాతం పెరిగింది. ఆ పెరుగుదల Astra-శ్రేణి తగ్గుదలలో సుమారు 85 శాతాన్ని భర్తీ చేసింది, దాంతో విశ్లేషించిన RL వర్క్‌లోడ్‌లలో మొత్తం కేటాయింపు దాదాపు మారకుండా ఉంది. Astraకు సంబంధించిన పనిపై పరిమితులు ఉన్న సమయంలో కొంత శిక్షణ మరియు ప్రయోగాలను Astra కాని మోడల్‌లకు మళ్లించడాన్ని ఈ ధోరణి సూచిస్తుంది. కొత్త పరిమితుల పరిధిలోని వర్క్‌లోడ్‌ల కోసం ఇక ఉపయోగించలేని కంప్యూట్‌కు పరిశోధకులు ఇతర వినియోగాలను కనుగొన్నారని తెలిపే అనుభవాధారిత నివేదికలకు కూడా ఇది అనుగుణంగా ఉంది.

ఈ డేటా శిక్షణ మరియు భద్రత గురించి కొనసాగుతున్న చర్చలకు ఒక ఉపయుక్తమైన సంకేతాన్ని అందిస్తుంది: కొత్త నియంత్రణలు ప్రవేశపెట్టబడినప్పుడు, కంప్యూట్ వనరులు విలువైనవిగా మరియు అనువైనవిగా కొనసాగుతాయి, అలాగే పరిశోధనా సంస్థలో అవి సహజంగానే ప్రత్యామ్నాయ వినియోగాల వైపు మళ్లించబడతాయి. దీర్ఘకాలంలో, AI పురోగతి వేగంపై జరిగే చర్చలు, కొత్త లేదా ప్రతిపాదిత నియంత్రణలకు లోబడే కంప్యూట్ వనరులను అత్యుత్తమంగా ఎలా ఉపయోగించవచ్చనే ప్రశ్నను కూడా పరిగణనలోకి తీసుకోవాలి.

5. ముందున్న దారి

సమన్వయమైన RSI వైపు పురోగతి సాధించడం మరియు ఆ పురోగతిని అర్థం చేసుకోవడం మా లక్ష్యానికి ముఖ్యమైనది. మేము మా పద్ధతులను మెరుగుపరచడం, అభివృద్ధి చెందుతున్న మా అవగాహన గురించి నివేదించడం, అలాగే అత్యాధునిక సిస్టమ్‌లపై సమాచారంతో కూడిన ప్రజా చర్చ మరియు అర్థవంతమైన ప్రజాస్వామ్య పాలన కోసం కృషి చేయడం కొనసాగిస్తాము.

అనుబంధం: ఈ పోస్ట్ కోసం మా పద్ధతులు

ఏజెంట్-ఆధారిత AI పరిశోధన ఇంకా కొత్తదే, మరియు దాన్ని ఎలా కొలవాలో మేమింకా నేర్చుకుంటున్నాం. . మా పరిశోధన బృందాలు రూపొందించే కోడ్ పరిమాణం వంటి కొన్ని సూచికలను సేకరించడం తేలికగానే ఉంటుంది, కానీ వాటికి పరిశోధనా పురోగతితో ఉన్న సంబంధం స్పష్టంగా లేకపోవడం వల్ల వాటిని అర్థం చేసుకోవడం కష్టం. . పరిశోధన పురోగతిపై మరింత నేరుగా దృష్టి సారించే కొలమానాలు—ఉదాహరణకు, పరిశోధకులు ఏజెంట్లకు ఇచ్చే పనుల్లో అవి ఎంత తరచుగా విజయవంతమవుతాయో—మరింత ఉపయోగకరంగా ఉండవచ్చు, కానీ వాటిని అభివృద్ధి చేసి ధృవీకరించడం సంక్లిష్టమైన ప్రక్రియ. ఇదికాక, పరిశోధకులు ఆధారపడే టూల్స్ మరియు సిస్టమ్‌లు వేగంగా అభివృద్ధి చెందుతుండటం ఈ పనిని మరింత క్లిష్టతరం చేస్తోంది. పరిశోధనను వేగవంతం చేయడంపై మా అవగాహనను మరింత లోతుగా చేసుకోవడం OpenAI అంతటా ఒక ముఖ్యమైన ప్రాధాన్య రంగం.

ఈ విశ్లేషణలన్నిటిలోనూ, వేరుగా పేర్కొననంతవరకు:

  • “పరిశోధకుడు” అనేది మా పరిశోధనా సంస్థలోని ఏ సభ్యుడినైనా సూచించే విస్తృత పదం; ఇందులో పరిశోధనా మౌలిక సదుపాయాలను నిర్మించే, పరిశోధనా ప్రాజెక్టులను నిర్వహించే లేదా ఇతర విధాలుగా సంస్థకు మద్దతు అందించే సభ్యులు కూడా ఉంటారు.

  • పరిశోధకులు ఆధారపడే టూల్స్ మరియు సిస్టమ్‌లు వేగంగా అభివృద్ధి చెందుతున్నందున, కోడింగ్ ఏజెంట్ వినియోగానికి సంబంధించిన మెట్రిక్‌లు ఎక్కువ భాగం వినియోగాన్ని కవర్ చేస్తాయి, కానీ మొత్తం వినియోగాన్ని కాదు.