મુખ્ય વિષય-સામગ્રી પર જાવો
OpenAI

સંશોધનને વેગ: OpenAIની અંદરનું દૃશ્ય

લોડિંગ…

AGI સમગ્ર માનવજાતને લાભ આપે તે માટે, અમારું માનવું છે કે તેનું સંચાલન લોકશાહી રીતે એટલે કે સૌની સહભાગીતાથી થવું જોઈએ. આ માત્ર અત્યંત સક્ષમ AI સિસ્ટમોની ક્ષમતાઓ, જોખમો અને સુરક્ષા ઉપાયો વિશેની માહિતગાર જાહેર ચર્ચા દ્વારા જ શક્ય બની શકે છે. વિશ્વભરના લોકોએ અત્યાધુનિક AIનો સંભવિત ભાવિ માર્ગ સમજવાની જરૂર છે, જેથી તેના વિકાસમાં તેઓ અર્થપૂર્ણ રીતે પોતાનો મત આપી શકે.

ચોક્કસ જોખમો, ઘટનાઓ અને સુરક્ષા ઉપાયો વિશે પારદર્શિતા જરૂરી છે, પરંતુ તે પૂરતી નથી. અમારું માનવું છે કે જનતાએ એ પણ સમજવાની જરૂર છે કે સૌથી સક્ષમ સિસ્ટમો કેવી રીતે વિકસી રહી છે અને અત્યાધુનિક પ્રયોગશાળાઓમાં તે સંશોધનની પ્રગતિને કેવી રીતે આગળ ધપાવી રહી છે.

અમારો ઉદ્દેશ સુરક્ષિત રીતે એક સ્વચાલિત AI સંશોધક બનાવવાનો છે, જે માનવ દેખરેખ હેઠળ કામ કરીને ડીપ લર્નિંગ અને સંરેખનમાં વધુ પ્રગતિ કરી શકે અને ક્રમશઃ સુધારાઓને શક્ય બનાવી શકે. અમારા માપન મુજબ, અમે હવે આ વર્ષના સપ્ટેમ્બર સુધીમાં સ્વચાલિત સંશોધન ઇન્ટર્ન હોવાના લક્ષ્ય સુધી પહોંચી ગયા છીએ, જેની ગયા શરદઋતુમાં જાહેરાત કરવામાં આવી હતી⁠(નવી વિન્ડોમાં ખૂલે છે). “સંશોધન ઇન્ટર્ન”થી અમારો અર્થ એવી સિસ્ટમ છે જે માનવીય માર્ગદર્શન હેઠળ સ્પષ્ટ રીતે વ્યાખ્યાયિત સંશોધન કાર્યો કરી શકે, જેમાં કૌશલ્યપૂર્ણ સંશોધકને થોડા દિવસો લાગી શકે એવા કાર્યોનો પણ સમાવેશ થાય છે. અમે માર્ચ 2028 સુધીમાં સ્વચાલિત AI સંશોધક બનાવવા તરફ મજબૂત પ્રગતિ કરી રહ્યા છીએ.

આ વર્ષ દરમિયાન, OpenAIના સંશોધકોનું દૈનિક કામ નોંધપાત્ર રીતે બદલાયું છે. સંશોધકો દિવસભર કોડિંગ એજન્ટોનો ઉપયોગ કરે છે (ઘણીવાર એકસાથે ચાલતા સેશન્સમાં) અને કુલ ઉપયોગ ઝડપથી વધી રહ્યો છે, જે અન્ય OpenAI ટીમોમાં થયેલા વધારા કરતાં વધુ છે. સંશોધકો વધુ ઝડપથી કોડમાં યોગદાન આપી રહ્યા છે અને વધુ પ્રયોગો ચલાવી રહ્યા છે. સંશોધકો એજન્ટોનો ઉપયોગ કરવાની રીતો પણ બદલાઈ રહી છે: એજન્ટો ક્રમશઃ વધુ જટિલ કાર્યો સંભાળી રહ્યા છે અને તેમાં વધુ વાર સફળ થઈ રહ્યા છે. AI સંશોધન અનેક સંભવિત અવરોધો ધરાવતી એક જટિલ પ્રક્રિયા છે, તેથી પ્રગતિની એકંદર ગતિ આ ચોક્કસ માપદંડો સાથે તાલમેલ ન પણ રાખી શકે. પરંતુ એકંદરે, આ તારણો આપણામાંથી ઘણા લોકોને આંતરિક રીતે રહેલી વ્યાપક છાપ સાથે સુસંગત છે કે એજેન્ટિક સાધનો સંશોધનની પ્રગતિને નોંધપાત્ર રીતે વેગ આપી રહ્યા છે. લોકો હજુ પણ અમારી સંશોધન પ્રાથમિકતાઓ નક્કી કરે છે, કયા વિચારો અને પરિણામોને આગળ વધારવા તે મૂલવે છે અને સિસ્ટમોને મોટા પાયે લઈ જવી, થોભાવવી કે ડિપ્લોય કરવી તે નક્કી કરે છે.

જો આને જવાબદારીપૂર્વક કરવામાં આવે, તો અમને વિશ્વાસ છે કે સ્વચાલિત AI સંશોધન એવા મોડલો આપશે જે માનવ કલ્યાણમાં સીધો વધારો કરશે અને OpenAIના મિશનને આગળ ધપાવશે. તે અદ્યતન ઇન્ટેલિજન્સની કિંમત ઘટાડી શકે છે, જેથી વિશ્વભરના લોકોને તેનો લાભ મળી શકે. અમે આ કામ આંશિક રીતે એટલા માટે આગળ વધારી રહ્યા છીએ કારણ કે સ્વચાલિત સંશોધન અમને સંરેખણની સમસ્યા ઉકેલવામાં અને વધુને વધુ સક્ષમ બનતી AI સામે રક્ષણાત્મક ઉપાયો વિકસાવવામાં મદદરૂપ થઈ શકે છે. સ્વચાલિત AI સંશોધક સ્વચાલિત સલામતી અથવા સંરેખણ સંશોધક પણ હોઈ શકે છે. વધુ સક્ષમ અને સંરેખિત સિસ્ટમો મહત્વપૂર્ણ ઇન્ફ્રાસ્ટ્રક્ચરને સુરક્ષિત કરવામાં, જોખમી AI એજન્ટો સામે રક્ષણ આપવામાં અને નવા રક્ષણાત્મક પગલાં વિકસાવવામાં મદદ કરી શકે છે.

આ ઉપયોગી સ્વચાલિત સંશોધન ક્ષમતાઓ વિકસાવવા માટેનાં કારણો છે, પરંતુ તેનો અર્થ એવો નથી કે ઝડપી RSI અનિવાર્યપણે એવું પરિણામ છે જેને આપણે હાંસલ કરવાનો પ્રયાસ કરવો જોઈએ. આગળ વધવું કે નહીં અને કેવી રીતે આગળ વધવું, તે માનવીય નિયંત્રણ જાળવી રાખવાની અમારી ક્ષમતા અને લાભો તથા જોખમો અંગે માહિતગાર લોકશાહી પસંદગીઓ પર આધારિત હોવું જોઈએ.

સંરેખિત, પૂર્ણ RSI સુધી સુરક્ષિત રીતે કેવી રીતે પહોંચવું તે અમને હજુ ખબર નથી. અમે ક્ષમતાઓની સાથે સાથે સંરેખણ અને સુરક્ષા પગલાંને વિસ્તૃત કરવા માટે કામ કરી રહ્યા છીએ. પરંતુ અમે એવું માની શકતા નથી કે સંરેખણ અને સુરક્ષામાં થતી પ્રગતિ સમાન ગતિએ આગળ વધશે અને વધુ સક્ષમ સિસ્ટમોનું નિરીક્ષણ કરવું વધુ મુશ્કેલ બની શકે છે. સાવચેતીપૂર્વકનું સંરેખણ અને સલામતી કામ આ પ્રયાસના કેન્દ્રમાં છે અને તેની શરૂઆત આજે એજન્ટિક કોડિંગ સિસ્ટમોમાં દેખાતી સલામતી સમસ્યાઓને માપવાથી અને ઘટાડવાથી થાય છે. જ્યારે પણ અમને જણાશે કે આગળ વધવાથી સલામતીનું અસ્વીકાર્ય જોખમ ઊભું થશે, ત્યારે અમે યોગ્ય રીતે પ્રતિભાવ આપીશું, જેમાં અમે પૂરતી રીતે સુરક્ષિત રાખવામાં અસમર્થ હોઈએ તેવી સિસ્ટમોના અમારા વિકાસ અથવા ડિપ્લોયમેન્ટની પ્રક્રિયાને ધીમી પાડવાનું અથવા રોકવાનું પણ સામેલ છે.

તાજેતરની Hugging Face ઘટના પછી, અમે આ પ્રતિબદ્ધતાને અમલમાં મૂકી⁠ અને ડિપ્લોયમેન્ટ માટે નિર્ધારિત અમારા નવીનતમ મોડલો પર રીઇન્ફોર્સમેન્ટ લર્નિંગ (RL) તાલીમ અટકાવી, આ દરમિયાન અમારા સંશોધન વાતાવરણને વધુ સુરક્ષિત બનાવ્યું અને રેડ-ટીમિંગ કર્યું તથા અમારી દેખરેખ પ્રણાલીઓનું આવરણ વિસ્તારી દીધું. આથી તમામ સંશોધન બંધ થયું નહીં: કેટલાક સંશોધન કાર્યભાર વધુ કડક નિયંત્રણો હેઠળ ફરી શરૂ થયા, જ્યારે અન્ય સ્થગિત જ રહ્યા. અમે અમારા સલામતી અને સંરેખણ ધોરણો વધાર્યા છે અને સલામતી કામને મોડલ જીવનચક્રમાં વધુ ઊંડે સુધી સામેલ કર્યું છે, જેથી સમગ્ર તાલીમ દરમિયાન સંરેખિત વર્તનના વધુ મજબૂત પુરાવાની જરૂર પડે છે.

આજે અમે તાજેતરના મહિનાઓમાં RSI તરફની અમારી પ્રગતિમાં એજન્ટિક સિસ્ટમોએ કેવી રીતે યોગદાન આપ્યું છે તેની વિગતવાર ઝલક પ્રદાન કરી રહ્યા છીએ. એજન્ટિક સિસ્ટમો નવી છે અને ઝડપથી બદલાઈ રહી છે અને અમારા માપન પ્રયાસો હજુ પણ પ્રારંભિક તબક્કામાં છે. આ પ્રારંભિક પરિણામો અને તેમની પાછળની પદ્ધતિઓ શેર કરીને, અમારો હેતુ લોકોને માહિતગાર કરવાનો, જાહેર ખુલાસાની પ્રથાને પ્રોત્સાહિત કરવાનો અને ક્ષેત્રને માપનના સહિયારા ધોરણો તરફ આગળ વધવામાં મદદ કરવાનો છે.

અંતે, અમારી અત્યાધુનિક પોલિસી બ્લૂપ્રિન્ટ⁠માં અમે લખ્યું છે તેમ, અમારું માનવું છે કે અમારે અને અન્ય કંપનીઓએ RSI તરફની અમારી પ્રગતિને જાહેરમાં ટ્રૅક કરવી ફરજિયાત હોવી જોઈએ. આવી કોઈ આવશ્યકતા ન હોવા છતાં, અમે અમારી RSI પ્રગતિ વિશે પારદર્શક રહેવાનું ચાલુ રાખવાની યોજના ધરાવીએ છીએ. અમારી માપન તકનીકો અને સમજણમાં સુધારો થતો જશે તેમ, સુરક્ષા અને માલિકીની માહિતીનું રક્ષણ કરવાની જરૂરિયાત સાથે સંતુલન જાળવતા અમે પારદર્શિતા અંગેનો અમારો અભિગમ વિકસાવતા રહીશું.

1. કોડિંગ એજન્ટો OpenAIના સંશોધકોના દૈનિક કાર્યને નવો આકાર આપી રહ્યા છે

વર્ષની શરૂઆતમાં, OpenAIમાં એજન્ટના ઉપયોગના આધારે મધ્યસ્થ ક્રમે રહેલા સંશોધક મર્યાદિત પ્રમાણમાં જ કોડિંગ એજન્ટોનો ઉપયોગ કરતા હતા. ઑગસ્ટના મધ્ય સુધીમાં, મધ્યસ્થ સંશોધક પોતાના કામમાં દરરોજ એજન્ટોને સંકલિત કરી રહ્યા હતા અને API કિંમતો મુજબ દરરોજ $600 કરતાં વધુ મૂલ્યના ઇન્ફરન્સનો ઉપયોગ કરી રહ્યા હતા. અમારી સંશોધન સંસ્થામાં 90મા પર્સેન્ટાઇલનો વપરાશકર્તા હવે દરરોજ $7,000થી વધુ મૂલ્યના ટોકનનો ઉપયોગ કરે છે.

જૂન 2026 પહેલાં, સંશોધન સંસ્થામાં એજન્ટનો કુલ રનટાઇમ હજુ પણ માનવ શ્રમના કુલ સમય કરતાં ઓછો હતો. ત્યારથી તેમાં ફેરફાર થયો છે. પ્રમાણભૂત આઠ કલાકના કાર્યદિવસના સંદર્ભમાં, ઑગસ્ટના મધ્ય સુધીમાં, કુલ મળીને, સંશોધન સંસ્થા માનવ શ્રમના દરેક કાર્યદિવસ માટે 3.1 એજન્ટ-કાર્યદિવસ જેટલો પ્રયાસ વાપરે છે.

આને જોવાની બીજી રીત એ છે કે કેટલા સંશોધકો અત્યંત સમવર્તી વર્કફ્લોનો ઉપયોગ કરે છે (દા.ત., 4 અથવા વધુ એજન્ટોને એકસાથે ચલાવવા) તે સમજવું. નીચે બતાવ્યા મુજબ, આ સંખ્યા વધી રહી છે. આ આંકડાઓમાં વપરાશકર્તા દ્વારા સીધા શરૂ કરાયેલા એજન્ટો અને વપરાશકર્તાએ સીધા લોન્ચ કરેલા એજન્ટોમાંથી આગળના પ્રવાહમાં બનાવાયેલા સબ-એજન્ટો — બંનેની દૈનિક મહત્તમ સંખ્યાઓનો સમાવેશ થાય છે.

2. સંશોધકો વધુ કોડ લખી રહ્યા છે અને વધુ પ્રયોગો કરી રહ્યા છે

AI સંશોધનનો મોટો ભાગ શ્રમ-સઘન પ્રક્રિયા તરીકે જોઈ શકાય છે, જેનો હેતુ મોડલ ઇન્ટેલિજન્સ અથવા કામગીરીમાં થયેલા નવા સુધારાને અમારા મુખ્ય મોડલોમાંથી એકમાં એકીકૃત કરવાનો છે. આ પ્રક્રિયા ઘણા પગલાં પર આધારિત છે અને જ્યારે બધા પગલાં સાથે મળીને યોગ્ય રીતે થાય ત્યારે ક્ષમતાઓ આગળ વધે છે: સંશોધકોએ નવા સુધારાઓ ડિઝાઇન કરવા, મોડલની કામગીરીનું મૂલ્યાંકન કરવા માટે મૂલ્યાંકનો લખવા, આ સુધારાઓને મોટા પાયે ચકાસવા માટે ઇન્ફ્રાસ્ટ્રક્ચર લખવું, તાલીમ દરમિયાન બગ્સ તેમજ અસુરક્ષિત અથવા અસંરેખિત વર્તન પકડવું અને સફળ વિચારોને મુખ્ય તાલીમ રનમાં એકીકૃત કરવા પડે છે. સંશોધન પ્રક્રિયાના કોઈપણ ભાગમાં નિષ્ફળતા સમગ્ર ચક્રને મર્યાદિત કરી શકે છે.

કોડ લખવો અને પ્રયોગો ચલાવવા એ બે મુખ્ય પ્રવૃત્તિઓ છે જે સંશોધકો તેમના કામના ભાગરૂપે કરે છે અને અમને એવા પુરાવા જોવા મળે છે કે આ પ્રક્રિયાઓ ઝડપી બની રહી છે.

આ ડેટા પોઇન્ટ તુલનાત્મક રીતે માપવા સરળ છે, પરંતુ તેમનું અર્થઘટન કરવું મુશ્કેલ હોઈ શકે છે. જેમ જેમ સ્વચાલન આગળ વધશે, તેમ તેમ જે કાર્યો સૌથી ઓછાં સ્વચાલિત કરી શકાય તેવા હશે, તેઓ સંશોધનકર્તાઓના પ્રયત્નોનો વધુ મોટો હિસ્સો લેશે અને ભવિષ્યની પ્રગતિ માટે મહત્વપૂર્ણ અવરોધો બનશે. કમ્પ્યુટ ક્ષમતા પ્રગતિ માટેનું બીજું મર્યાદાકારક પરિબળ છે અને અન્ય અવરોધો ઘટતા જાય તેમ સમય જતાં તે વધુ મહત્વપૂર્ણ બની શકે છે.

2026 દરમિયાન, સક્રિય પ્રયોગકર્તા દીઠ પ્રયોગોની સંખ્યા વધી છે, જેમાં ઑગસ્ટ 2026 જાન્યુઆરી 2025માં ટ્રૅકિંગ શરૂ થયા પછીનો સર્વકાલીન ઉચ્ચ સંખ્યા રહી છે. આ Codexની વધતી અપનાવટ સાથે સહસંબંધિત છે, જોકે અમે નોંધીએ છીએ કે 2025થી અમારી ઉપલબ્ધ કમ્પ્યુટ ક્ષમતા પણ નોંધપાત્ર રીતે વધી છે.

3. સંશોધકો જે કામ માટે એજન્ટોનો ઉપયોગ કરે છે તે બદલાઈ રહ્યું છે

ગુણાત્મક છાપો અને આંતરિક ડેટા બંને સૂચવે છે કે સંશોધકો કોડિંગ એજન્ટોને જે કાર્યો સોંપતા હોય તેનું મિશ્રણ બદલાઈ રહ્યું છે, જેમાં સમય જતાં ઉચ્ચ સ્તરનાં અને લાંબા ગાળાનાં કાર્યોની સોંપણી વધુ સામાન્ય બનતી જાય છે.

આ વલણનું વધુ સ્પષ્ટ ચિત્ર મેળવવા માટે, અમે Epoch AI દ્વારા વિકસાવવામાં આવેલા AI R&D જીવનચક્રનો ભાગ હોય તે વિવિધ પ્રકારનાં કામની તાજેતરમાં પ્રકાશિત વર્ગીકરણ પદ્ધતિ⁠(નવી વિન્ડોમાં ખૂલે છે) ઉપયોગમાં લઈને સંશોધન સંસ્થામાં થયેલા તાજેતરના ઉપયોગનું વિશ્લેષણ કર્યું. આ વર્ગીકરણ પદ્ધતિ, તમામ પ્રકારના કામને વર્ગીકૃત કરવા માટેની લાંબા સમયથી પ્રચલિત O*NET સિસ્ટમથી પ્રેરિત, અત્યાધુનિક AI R&D માટે ખાસ રીતે તૈયાર કરાઈ છે અને પ્રક્રિયાને છ મુખ્ય તબક્કાઓમાં વહેંચે છે:

  1. નક્કી કરો: શેના પર કામ કરવું, શું ચાલુ રાખવું, ક્યાં ફાળવવું

  2. ડિઝાઇન: સંશોધન વિચારો અને એન્જિનિયરિંગ વિશિષ્ટતાઓ

  3. બિલ્ડ: કોડ અને ડેટાસેટ

  4. રન: તાલીમ/મૂલ્યાંકન રન, હાર્ડવેર, સર્વિંગ

  5. વિશ્લેષણ કરો: પ્રયોગો, મોડલો, ડિપ્લોયમેન્ટ, બાહ્ય કામ

  6. સંચાર કરો: તારણો, પ્રતિસાદ, સ્થિતિ, નિર્ણયો

નીચે, અમે આ વર્ગીકરણ પદ્ધતિ હેઠળ કોડિંગ એજન્ટ ટોકનનું વર્ગીકરણ કરીએ છીએ.

અમે જોઈએ છીએ કે જાન્યુઆરી અને ઑગસ્ટ 2026 વચ્ચે સંશોધન પ્રવૃત્તિઓની તમામ શ્રેણીઓમાં વધારો થયો છે. જાન્યુઆરીમાં, મુખ્ય શ્રેણી તરીકે સંશોધન અને ઇન્ફ્રાસ્ટ્રક્ચર કોડ હતા. આ શ્રેણી વિસ્તરી છે, પરંતુ અમે વધારાની શ્રેણીઓમાં પણ નોંધપાત્ર વધારો જોઈ રહ્યા છીએ, ખાસ કરીને તકનિકી સહાય અને મોનિટરિંગ રનમાં. ઉચ્ચ-સ્તરીય પ્લાનિંગ હજુ પણ એજન્ટના આઉટપુટ ટોકનનો માત્ર ન્યૂનતમ અંશ જ રહે છે.

અનુભવના આધારે, સહકર્મીઓ જણાવે છે કે કોડિંગ એજન્ટો આંતરિક સંશોધન ઇન્ફ્રાસ્ટ્રક્ચરની સમસ્યાઓ ઉકેલવામાં ખૂબ સારું પ્રદર્શન કરે છે, જે સંશોધન પ્રગતિમાં એક મહત્વપૂર્ણ અવરોધને દૂર કરે છે. અગાઉ સંશોધકોને તેમના પ્રયોગોમાં સમસ્યાઓનું નિરાકરણ લાવવામાં મદદ કરવા માટે “ઓફિસ સમય” રાખતી અનેક ટીમોએ 2026માં હાજરીમાં ઘટાડો નોંધ્યો છે અને તેમાંથી એક ટીમે તેના બદલે સિસ્ટમમાં અન્ય સુધારાઓ કરવા પર ધ્યાન કેન્દ્રિત કરવા માટે સત્રો યોજવાનું સંપૂર્ણપણે બંધ કરી દીધું છે.

અહીં, અમે તે મુખ્ય આંતરિક ચેનલોમાંથી એકમાં દરરોજ થતી ટોચના સ્તરની પોસ્ટ્સની સંખ્યા આલેખિત કરી છીએ, જ્યાં સંશોધકો અન્ય ટીમો પાસેથી ટેક્નિકલ સપોર્ટ મેળવવા માંગે છે. અમારી જાણ મુજબ, આ ચેનલની પ્રવૃત્તિમાં થયેલો ઘટાડો માણસો દ્વારા સંચાલિત બીજી ટેક્નિકલ સપોર્ટ ચેનલ પર ક્વેરીઓ ખસવાથી ભરપાઈ થયો નથી. ટ્રાફિકમાં ઘટાડો આ વ્યાપક બદલાવ સાથે સુસંગત છે.

અમે એ પણ અભ્યાસ કરી શકીએ છીએ કે કોડિંગ એજન્ટો સંશોધકો દ્વારા વિનંતી કરવામાં આવતા કાર્યોમાં સફળ થઈ રહ્યા છે કે નહીં. એજેન્ટિક વર્ગીકર્તાનો ઉપયોગ કરીને, અમે શોધ્યું કે જાન્યુઆરીથી જુલાઈ સુધી, સફળતા દરો સામાન્ય રીતે કઠિનતાના અનેક બકેટ્સમાં વધ્યા હતા (જે માટે પ્રોક્સી તરીકે માનવીને કાર્ય પૂર્ણ કરવામાં લાગતા અંદાજિત સમયને માનવામાં આવ્યો છે), એવા કાર્યોમાં કે જેના માટે અમે પાયાના સ્તરેથી સાચું પરિણામ શોધી શકીએ છીએ. જોકે, એજન્ટોને સફળ થવા માટે હજુ પણ નોંધપાત્ર માનવીય માર્ગદર્શનની જરૂર પડે છે, ખાસ કરીને કાર્યની જટિલતા વધતી જાય તેમ. છેલ્લા છ મહિનામાં, ચારથી આઠ કલાકના સફળ કાર્યોમાંથી અડધાથી વધુમાં એક અથવા વધુ હસ્તક્ષેપો સામેલ હતા.

સમય જતાં સંશોધક કાર્યોમાં સફળતાના દરમાં વધારો થયો છે. ગ્રાફ એવા વર્ગીકરણોને બાકાત રાખે છે જેમાં પરિણામ અનિશ્ચિત હતું અને <50 સત્રો અથવા <50 અનન્ય વપરાશકર્તાઓ ધરાવતા પોઇન્ટને બાકાત રાખે છે.

જાન્યુઆરીથી જુલાઈ સુધીના કાર્ય સફળતા દર અને હસ્તક્ષેપ દર, સમય સીમા પ્રમાણે વિભાજિત. જે વર્ગીકરણોમાં પરિણામ અનિશ્ચિત હતું તે બાકાત રાખે છે.

4. મોડલ ડેવલપમેન્ટની ગતિ

સુરક્ષિત અને લાભદાયી AGI માટે વધુ સક્ષમ સિસ્ટમો તરફની પ્રગતિ આવા કામ માટે જરૂરી સુરક્ષાત્મક પગલાં પર પણ નિર્ભર રહેશે. જેમ જેમ અમે જોખમો વિશે વધુ જાણતા જઈએ, તેમ જરૂરી સુરક્ષા ઉપાયો અંગેનું અમારું મૂલ્યાંકન બદલાઈ શકે છે.

અમે વર્ણવ્યું છે તેમ,⁠ અમે તાજેતરમાં નિરીક્ષણ, સંરેખણ અને સુરક્ષા માટેનાં અમારાં ધોરણોને અપડેટ કર્યાં છે. અહીં, અમે બતાવીએ છીએ કે તાજેતરના પ્રતિબંધોએ સંશોધન પ્રવૃત્તિના એક પાસાને કેવી રીતે અસર કરી છે.

*20 જુલાઈથી 6 ઑગસ્ટ વચ્ચે અહીં દર્શાવાયેલ Astra કમ્પ્યુટનો મોટાભાગનો હિસ્સો સલામતી અને સુરક્ષા સુધારાઓના અમલીકરણનું પરીક્ષણ કરવાનો હતો.

20 જુલાઈએ, એજન્ટોએ અમારા સંશોધન ઇન્ફ્રાસ્ટ્રક્ચર સાથે ચેડાં કર્યા હોવાનું જાણવા મળ્યા પછી, અમે તાલીમ માટે ઉપયોગમાં લેવાતી કન્ટેનર સેવાને અસ્થાયી રૂપે બંધ કરી દીધી અને પછી નોંધપાત્ર વધારાના પ્રતિબંધો સાથે તેને પુનઃસ્થાપિત કરી.

આના કારણે RL તાલીમ માટેના કમ્પ્યુટ સંસાધનોમાં તીવ્ર ઘટાડો થયો, જ્યારે ટીમોએ વધુ સુરક્ષિત બનાવાયેલા સંશોધન વાતાવરણમાં કામ કરવા માટે તેમના વર્કફ્લોને ફરીથી ગોઠવ્યા. ઉપરના પ્લોટમાં ડિપ્લોયમેન્ટ માટે નિર્ધારિત અમારા નવીનતમ મોડલો પર રીઇન્ફોર્સમેન્ટ લર્નિંગમાં બે અઠવાડિયાનો વિરામ સામેલ છે. 20 જુલાઈથી 6 ઑગસ્ટ વચ્ચેના Astra-class RL પ્રયોગોમાં (GPU ફાળવણીના આધારે) મોટા ભાગના રન સલામતી અને સુરક્ષા સુધારાઓના અમલીકરણનું પરીક્ષણ કરવા માટે છે.

7 ઑગસ્ટે, અમારા પ્રિપેરડનેસ ફ્રેમવર્ક⁠(નવી વિન્ડોમાં ખૂલે છે) હેઠળ Astraમાં મહત્વપૂર્ણ સાઇબર ક્ષમતાઓ હોઈ શકે છે⁠ તેવા પ્રારંભિક પુરાવાને કારણે મોડલ-વિશિષ્ટ વધારાનાં સુરક્ષા નિયંત્રણો લાગુ કરવામાં આવ્યાં, જેના હેઠળ Astra મોડલને વધુ ઉચ્ચ-સુરક્ષાવાળા સંશોધન વાતાવરણમાં ચલાવવાનું ફરજિયાત બન્યું. તે પછીના અઠવાડિયામાં Astra-class GPU ફાળવણી વધુ 59.2 ટકા ઘટી, પરંતુ અન્ય મોડલ ક્લાસ માટેની ફાળવણી 17.2 ટકા વધી. તે વધારાએ Astra-classમાં થયેલા ઘટાડાના લગભગ 85 ટકા જેટલી ભરપાઈ કરી, જેના કારણે વિશ્લેષિત RL કાર્યભારમાં કુલ ફાળવણી મોટાભાગે યથાવત રહી. આ પેટર્ન Astra સાથે સંકળાયેલું કામ પ્રતિબંધિત હતું ત્યારે કેટલીક તાલીમ અને પ્રયોગો Astra સિવાયનાં મોડલો તરફ ખસેડવામાં આવ્યાં હોવાનું સૂચવે છે અને નવા નિયંત્રણો હેઠળ આવતા કાર્યભાર માટે હવે ઉપયોગમાં લઈ ન શકાતા કમ્પ્યુટના અન્ય ઉપયોગો સંશોધકોએ શોધ્યા હોવાના અનુભવો આધારિત અહેવાલો સાથે સુસંગત છે.

આ ડેટા ટ્રેનિંગ અને સલામતી વિશે ચાલી રહેલી ચર્ચાઓ માટે ઉપયોગી સંકેત આપે છે: જ્યારે નવા નિયંત્રણો રજૂ કરવામાં આવે છે, ત્યારે કમ્પ્યુટિંગ સંસાધનો મૂલ્યવાન અને લવચીક રહે છે અને સંશોધન ઉપક્રમની અંદર સ્વાભાવિક રીતે વૈકલ્પિક ઉપયોગો તરફ વાળવામાં આવશે. લાંબાગાળે, AI પ્રગતિની ગતિ વિશેની ચર્ચાઓ એ પ્રશ્ન સુધી પણ વિસ્તરવી જોઈએ કે નવા અથવા સૂચિત નિયંત્રણોને આધીન રહેલા કમ્પ્યુટિંગ સંસાધનોનો શ્રેષ્ઠ ઉપયોગ કેવી રીતે કરી શકાય.

5. આગળનો માર્ગ

સંરેખિત RSI તરફ પ્રગતિ કરવી અને તેને સમજવી અમારા ધ્યેય માટે મહત્વપૂર્ણ છે. અમે અમારી પદ્ધતિઓને વધુ સુઘડ બનાવતા રહીશું, અમારી વિકસતી સમજ અંગે અહેવાલ આપીશું અને અત્યાધુનિક સિસ્ટમો અંગે માહિતગાર જાહેર ચર્ચા તથા અર્થપૂર્ણ લોકશાહી ઢબે સંચાલન તરફ કામ કરીશું.

પરિશિષ્ટ: આ પોસ્ટ માટેની અમારી પદ્ધતિઓ

એજન્ટ-સંચાલિત AI સંશોધન હજુ નવું છે અને તેને કેવી રીતે માપવું તે અમે હજુ શીખી રહ્યા છીએ. કેટલાક સૂચકાંકો, જેમ કે અમારી સંશોધન ટીમો તૈયાર કરે છે તે કોડનું પ્રમાણ, એકત્ર કરવા માટે પ્રમાણમાં સરળ હોય છે, પરંતુ તેમનું અર્થઘટન કરવું મુશ્કેલ હોય છે, કારણ કે સંશોધનની પ્રગતિ સાથે તેમનો સંબંધ અનિશ્ચિત હોય છે. સંશોધન પ્રગતિ પર વધુ સીધું ધ્યાન કેન્દ્રિત કરતા માપદંડો—જેમ કે સંશોધકો એજન્ટોને આપેલા કાર્યોમાં તેઓ કેટલી વાર સફળ થાય છે—વધુ ઉપયોગી થઈ શકે છે, પરંતુ તેમને વિકસાવવા અને માન્ય કરવા જટિલ હોય છે. મુશ્કેલીમાં વધુ વધારો કરતા, સંશોધકો જે સાધનો અને સિસ્ટમો પર આધાર રાખે છે તે ઝડપથી વિકસિત થઈ રહ્યાં છે. સંશોધનને ઝડપી બનાવવા અંગેની અમારી સમજને વધુ ઊંડી બનાવવી એ સમગ્ર OpenAIમાં ધ્યાન કેન્દ્રિત કરવાનું એક મહત્ત્વનું ક્ષેત્ર છે.

આ તમામ વિશ્લેષણોમાં, જ્યાં સુધી અન્યથા નોંધવામાં ન આવે ત્યાં સુધી:

  • “સંશોધક” એ અમારી સંશોધન સંસ્થાના કોઈપણ સભ્ય માટેનો વ્યાપક શબ્દ છે, જેમાં સંશોધન ઇન્ફ્રાસ્ટ્રક્ચર બનાવનાર, સંશોધન પ્રોજેક્ટ્સનું સંચાલન કરનાર અથવા અન્ય રીતે આ ઉપક્રમને ટેકો આપનાર કેટલાક સભ્યોનો પણ સમાવેશ થાય છે.

  • કોડિંગ એજન્ટના ઉપયોગના મેટ્રિક્સ સંશોધકો જે ટૂલ્સ અને સિસ્ટમો પર આધાર રાખે છે તેમાં થતા ઝડપી વિકાસને કારણે મોટાભાગના, પરંતુ બધા નહીં, વપરાશને આવરી લે છે.