आमच्या मॉडेल्सच्या वास्तविक जगातील कामांवरील कामगिरीचे मोजमाप करणे
आम्ही GDPval सादर करत आहोत, एक नवीन मूल्यांकन जे ४४ व्यवसायांमधील आर्थिकदृष्ट्या मौल्यवान, वास्तविक-जगातील कामांवरील मॉडेल कामगिरीचे मोजमाप करते.
आमचे ध्येय म्हणजे कृत्रिम सामान्य बुद्धिमत्तेचा संपूर्ण मानवजातीला फायदा होईल याची खात्री करणे. आमच्या मिशनचा भाग म्हणून, आम्हाला स्पष्टपणे सांगायचे आहे की AI मॉडेल वास्तविक जगात लोकांना कशी मदत करू शकतात याबद्दल प्रगती स्पष्टपणे सांगायची आहे. म्हणूनच आम्ही GDPval सादर करत आहोत: एक नवीन मूल्यांकन जे आम्हाला आमच्या आणि इतरांच्या मॉडेल्सनी आर्थिकदृष्ट्या मौल्यवान, वास्तविक जगातील कामांमध्ये किती चांगले काम केले यावर लक्ष ठेवण्यास मदत करते. आम्ही या मूल्यांकनाला GDPval असे नाव दिले कारण आम्ही सकल घरगुती उत्पादन (GDP) या प्रमुख आर्थिक निर्देशकाच्या संकल्पनेपासून सुरुवात केली आणि GDP मध्ये सर्वाधिक योगदान देणाऱ्या उद्योगांमधील प्रमुख व्यवसायांमधून कामे निवडली.
लोक अनेकदा AI चा समाजावर व्यापक प्रभाव काय असेल याबाबत अनुमान करतात, परंतु त्याची क्षमता समजून घेण्याचा स्पष्ट मार्ग म्हणजे मॉडेल्स सध्या काय करू शकतात हे पाहणे. इतिहास दाखवतो की इंटरनेटपासून स्मार्टफोनपर्यंतच्या प्रमुख तंत्रज्ञानांना शोधापासून व्यापक पातळीवर स्वीकारण्यात दहा वर्षांहून अधिक काळ लागला. GDPval सारखी मूल्यांकनं भविष्यातील AI सुधारणा याबाबत संभाषण अनुमानाऐवजी पुराव्यांवर आधारित ठेवण्यास मदत करतात आणि वेळोवेळी मॉडेल सुधारणा कशी होत आहे हे ट्रॅक करण्यास मदत करतात.
मॉडेल रिजनिंग क्षमतांच्या सीमा ओलांडण्यासाठी आव्हानात्मक शैक्षणिक चाचण्या आणि स्पर्धात्मक कोडिंग आव्हाने यासारख्या मागील एआय मूल्यांकने आवश्यक राहिली आहेत, परंतु बहुतेकदा ते त्यांच्या दैनंदिन कामात हाताळल्या जाणाऱ्या कामांमध्ये कमी पडतात.
या अंतराला भरून काढण्यासाठी, आम्ही असे मूल्यांकन विकसित करत आहोत जे अधिकाधिक वास्तववादी आणि आर्थिकदृष्ट्या संबंधित क्षमतांचे मोजमाप करतात. ही प्रगती पारंपरिक शैक्षणिक बेंचमार्क्सपासून MMLU (डझनभर विषयांवरील परीक्षासमान प्रश्न) सारख्या, अधिक व्यावहारिक मूल्यांकनांकडे सरकली आहे जसे SWE-Bench (सॉफ्टवेअर इंजिनीअरिंग बग-फिक्सिंग काम), MLE-Bench (मशीन लर्निंग इंजिनीअरिंग काम जसे मॉडेल प्रशिक्षण आणि विश्लेषण), आणि Paper-Bench (शोधपत्रांवरील वैज्ञानिक तर्क आणि समिक्षा), आणि अलीकडेच मार्केट-आधारित मूल्यांकन जसे SWE-Lancer (प्रत्यक्ष पैसे मिळणाऱ्या फ्रीलान्स सॉफ्टवेअर इंजिनीअरिंग प्रोजेक्ट्स).
GDPval ही त्या प्रगतीतील पुढील टप्पा आहे. हे मॉडेलची कामगिरी मोजते जी कामे थेट अनुभवी व्यावसायिकांच्या वास्तविक ज्ञानकेंद्रित कामांमधून घेतली गेली आहेत, विविध व्यवसाय आणि क्षेत्रांमध्ये, आर्थिकदृष्ट्या मौल्यवान कामांवर मॉडेल कशी कामगिरी करतात याचे स्पष्ट चित्र देते. वास्तविक व्यवसायातील कामांवर मॉडेलचे मूल्यांकन केल्याने आपल्याला केवळ ते लॅबमध्ये किती चांगले काम करतात हेच समजत नाही, तर ते लोकांना त्यांच्या दैनंदिन कामात कसे सपोर्ट करू शकतात हे देखील समजते.
GDPval, या मूल्यांकनाची पहिली आवृत्ती, 44 व्यवसाय व्यापते जे U.S. GDP मध्ये सर्वाधिक योगदान देणाऱ्या शीर्ष 9 उद्योगांमधून निवडले गेले आहेत. GDPval चा पूर्ण संच 1,320 विशेष कामांचा समावेश करतो (220 गोल्ड ओपन-सोर्स सेटमध्ये), प्रत्येक काळजीपूर्वक तयार केलेले आणि या क्षेत्रातील सरासरी 14 वर्षांचा अनुभव असलेल्या अनुभवी व्यावसायिकांनी तपासलेले आहेत. प्रत्येक काम वास्तविक कामाच्या उत्पादनांवर आधारित आहे, जसे की कायदेशीर अहवाल, अभियांत्रिकी ब्लूप्रिंट, ग्राहक सपोर्ट संभाषण, किंवा नर्सिंग काळजी योजना.
GDPval हे मूल्यांकन केलेल्या कामांच्या वास्तववाद आणि विविधतेमध्ये दोन्ही बाबतीत वेगळे आहे. इतर मूल्यांकनांप्रमाणे जे आर्थिक मूल्याशी संबंधित आहेत आणि विशिष्ट डोमेनवर लक्ष केंद्रित करतात (उदा., SWE-Lancer), GDPval अनेक कामे आणि व्यवसायांचा समावेश करते. आणि बेंचमार्क्सच्या विपरीत, जिथे शैक्षणिक परीक्षा किंवा चाचणीच्या शैलीमध्ये कृत्रिमपणे काम तयार केले जाते (उदा., Humanity’s Last Exam किंवा MMLU), GDPval अशा कामांवर लक्ष केंद्रित करते जे वितरित उत्पादनांवर आधारित आहेत, जे प्रत्यक्षात अस्तित्वात असलेले काम किंवा उत्पादन आहे किंवा तसेच तयार केलेले काम आहे.
पारंपरिक बेंचमार्क्सच्या विपरीत, GDPval कामे साधे प्रॉम्प्ट्स नाहीत. त्यांच्यासोबत संदर्भ फाइल आणि संदर्भ येतात, आणि अपेक्षित वितरित उत्पादनांमध्ये दस्तऐवज, स्लाईड्स, आकृत्या, स्प्रेडशीट्स आणि मल्टीमीडिया यांचा समावेश आहे. हा वास्तववाद GDPval ला व्यावसायिकांना मॉडेल कसे सपोर्ट करू शकतात याची अधिक वास्तववादी चाचणी बनवतो.
GDPval ही एक सुरुवातीची पायरी आहे जी अनेक आर्थिक कामांच्या संपूर्ण सूक्ष्मतेचे प्रतिबिंबित करत नाही. हे 44 व्यवसाय आणि शेकडो ज्ञान कामांवर व्यापते, परंतु हे एकदाच केलेल्या मूल्यांकनांपुरते मर्यादित आहे, त्यामुळे अशा प्रकरणांना टिपत नाही जिथे मॉडेलला संदर्भ तयार करणे किंवा अनेक ड्राफ्ट्सद्वारे सुधारणा करणे आवश्यक असते. भविष्यातील आवृत्त्या अधिक परस्परसंवादी कार्यप्रवाह आणि संदर्भ-समृद्ध कामांमध्ये विस्तार करतील, जेणेकरून वास्तविक जगातील ज्ञान कार्याच्या जटिलतेचे अधिक अचूक प्रतिबिंब मिळेल (खालील मर्यादा विभाग पहा).
GDPval 9 उद्योगांमध्ये आणि 44 व्यवसायांमध्ये कामे व्यापते, आणि भविष्यातील आवृत्त्या कव्हरेज सुरू ठेऊन वाढवत राहतील. सुरुवातीचे 9 उद्योग U.S. GDP मध्ये 5% पेक्षा जास्त योगदान देणाऱ्या उद्योगांवर आधारित निवडले गेले होते, हे फेडरल रिझर्व्ह बँक ऑफ सेंट लुईसच्या डेटानुसार ठरवले गेले. त्यानंतर, आम्ही प्रत्येक उद्योगातील 5 व्यवसाय निवडले जे एकूण वेतन आणि नुकसानभरपाईत सर्वाधिक योगदान देतात आणि मुख्यत्वे ज्ञान कार्य व्यवसाय आहेत, मे 2024 यूएस ब्युरो ऑफ लेबर स्टॅटिस्टिक्स (BLS) ऑक्युपेशनल एम्प्लॉयमेंट रिपोर्ट(नवीन विंडोमध्ये उघडेल) मधील वेतन आणि रोजगार डेटाचा वापर करून. व्यवसाय मुख्यत्वे ज्ञान काम आहेत की नाही हे ठरवण्यासाठी, आम्ही O*NET(नवीन विंडोमध्ये उघडेल) मधील काम डेटाचा वापर केला, जो U.S. डिपार्टमेंट ऑफ लेबर द्वारे प्रायोजित अमेरिकेतील व्यवसाय माहितीचा डेटाबेस आहे. आम्ही O*NET मधील प्रत्येक व्यवसायासाठी प्रत्येक काम हे ज्ञान कार्य आहे की भौतिक कार्य/मॅन्युअल श्रम (ज्यात भौतिक जगात क्रिया करण्याची आवश्यकता असते) हे वर्गीकृत केले. जर एखाद्या व्यवसायाच्या घटक कामांपैकी किमान 60% कामे भौतिक काम किंवा मॅन्युअल श्रम न लागणारी म्हणून वर्गीकृत केली गेली असतील, तर तो व्यवसाय एकूण “मुख्यत्वे ज्ञान कार्य” म्हणून पात्र ठरतो. आम्ही GDPval च्या पहिल्या आवृत्तीचा प्रारंभिक बिंदू म्हणून 60% मर्यादा निवडली, ज्या व्यवसायांमध्ये AI चा वास्तविक जगातील उत्पादकतेवर सर्वाधिक प्रभाव पडू शकतो अशा व्यवसायांवर लक्ष केंद्रित केले.
या प्रक्रियेत समाविष्ट करण्यासाठी 44 व्यवसाय मिळाले.
रिअल इस्टेट, भाडेपट्टी आणि लीजिंग
कॉनसिएर्जेस
मालमत्ता, रिअल इस्टेट, आणि समुदाय संघ व्यवस्थापक
रिअल इस्टेट विक्री एजंट
रिअल इस्टेट दलाल
काउंटर आणि भाडेकरू लिपिक
सरकार
मनोरंजन कामगार
अनुपालन अधिकारी
पोलीस आणि गुप्तहेरांचे प्रथम श्रेणीचे पर्यवेक्षक
प्रशासनिक सेवा व्यवस्थापक
बाल, कुटुंब आणि शाळा सामाजिक कार्यकर्ते
उत्पादन
मेकॅनिकल इंजिनीअर्स
औद्योगिक अभियंते
खरेदीदार आणि खरेदी एजंट
शिपिंग, रिसिव्हिंग आणि इन्व्हेंटरी लिपिक
उत्पादन आणि ऑपरेटिंग कामगारांचे पहिल्या ओळीचे पर्यवेक्षक
व्यावसायिक, वैज्ञानिक आणि तांत्रिक सेवा
सॉफ्टवेअर विकसक
वकील
लेखापाल आणि लेखापरीक्षक
संगणक आणि माहिती प्रणाली व्यवस्थापक
प्रोजेक्ट व्यवस्थापन तज्ञ
आरोग्य सेवा आणि सामाजिक सहाय्य
नोंदणीकृत परिचारिका
नर्स परिचारिका
वैद्यकीय आणि आरोग्य सेवा व्यवस्थापक
कार्यालय आणि प्रशासनिक सपोर्ट कामगारांचे पहिल्या ओळीचे पर्यवेक्षक
वैद्यकीय सचिव आणि प्रशासकीय सहाय्यक
फायनान्स आणि विमा
ग्राहक सेवा प्रतिनिधी
आर्थिक आणि गुंतवणूक विश्लेषक
फायनान्शियल मॅनेजर्स
वैयक्तिक आर्थिक सल्लागार
सिक्युरिटीज, कमोडिटीज आणि फायनान्शियल सर्व्हिसेस विक्री एजंट्स
खुद्रा व्यापार
फार्मासिस्ट्स
किरकोळ विक्री कामगारांचे पहिल्या ओळीत पर्यवेक्षक
सामान्य आणि संचालन व्यवस्थापक
खाजगी गुप्तहेर आणि अन्वेषक
घाऊक व्यापार
सेल्स व्यवस्थापक
ऑर्डर लिपिक
गैर-रिटेल विक्री कर्मचार्यांचे प्रथम ओळीचे पर्यवेक्षक
विक्री प्रतिनिधी, घाऊक आणि उत्पादन, तांत्रिक आणि वैज्ञानिक उत्पादनांशिवाय
विक्री प्रतिनिधी, घाऊक आणि उत्पादन, तांत्रिक आणि वैज्ञानिक उत्पादने
माहिती
ऑडिओ आणि व्हिडिओ तंत्रज्ञ
निर्माते आणि दिग्दर्शक
बातमी विश्लेषक, वार्ताहर आणि पत्रकार
चित्रपट आणि व्हिडिओ संपादक
संपादक
प्रत्येक व्यवसायासाठी, आम्ही अनुभवी व्यावसायिकांसह काम केले ज्यांनी त्यांच्या दैनंदिन कामाचे प्रतिनिधित्व करणारी कामे तयार करा. या व्यावसायिकांचा सरासरी अनुभव 14 वर्षांचा होता, आणि त्यांच्याकडे प्रगतीचे मजबूत रेकॉर्ड होते. प्रतिनिधित्व वाढवण्यासाठी, आम्ही जाणूनबुजून विविध क्षेत्रातील तज्ज्ञांची भरती केली—उदाहरणार्थ, वेगवेगळ्या प्रॅक्टिस क्षेत्रातील वकील आणि वेगवेगळ्या आकाराच्या फर्म्समधील वकील.
प्रत्येक काम अनेक टप्प्यांच्या पुनरावलोकन प्रक्रियेतून गेले जेणेकरून ते वास्तविक कामाचे प्रतिनिधित्व करते, दुसऱ्या व्यावसायिकासाठी पूर्ण करणे शक्य आहे, आणि मूल्यांकनासाठी स्पष्ट आहे. सरासरी, प्रत्येक कामाला 5 फेऱ्यांचे तज्ज्ञ पुनरावलोकन मिळाले, ज्यात इतर काम लेखकांकडून तपासण्या, अतिरिक्त व्यवसाय पुनरावलोककांकडून पुनरावलोकन, आणि मॉडेल-आधारित प्रमाणीकरण यांचा समावेश होता.
तयार झालेल्या डेटासेटमध्ये प्रत्येक व्यवसायासाठी 30 पूर्णपणे पुनरावलोकन केलेली कामे (पूर्ण संच) समाविष्ट आहेत, आणि आमच्या ओपन-सोर्स सोन्याच्या संचात प्रत्येक व्यवसायासाठी 5 कामे समाविष्ट आहेत, जी वास्तविक ज्ञान कार्यावर मॉडेल कामगिरीचे मूल्यांकन करण्यासाठी ठोस पाया प्रदान करतात.
GDPval कार्यांची उदाहरणे
प्रॉम्प्ट + काम संदर्भ
अनुभवी मानवी वितरित उत्पादन

GDPval मॉडेल कामांचे मूल्यांकन करण्यासाठी, आम्ही तज्ज्ञ “ग्रेडर्स” वर अवलंबून आहोत—डेटासेटमध्ये प्रतिनिधित्व केलेल्या व्यवसायातील अनुभवी व्यावसायिकांचा गट. हे ग्रेडर्स अंधपणे मॉडेल-उत्पन्न केलेल्या वितरित उत्पादनांची तुलना काम लेखकांनी तयार केलेल्या उत्पादनांशी करतात (त्यांना कोणते AI द्वारे आणि कोणते मानवाने तयार केले आहे हे माहित नसते), आणि टीका व रँकिंग देतात. ग्रेडर्स नंतर मानव आणि AI वितरित उत्पादनांचे रँकिंग करतात आणि प्रत्येक AI वितरित उत्पादनाला “चांगले”, “तितकेच चांगले”, किंवा “वाईट” असे एकमेकांशी तुलना करून वर्गीकृत करतात.
काम लेखकांनी त्यांच्या व्यवसायांसाठी सविस्तर स्कोअरिंग रुब्रिक्स तयार केले, ज्यामुळे ग्रेडिंग प्रक्रियेत सुसंगतता आणि पारदर्शकता येते. आम्ही एक “ऑटोमेटेड ग्रेडर” देखील तयार केला, एक AI सिस्टम जी अंदाज लावण्यासाठी प्रशिक्षित आहे की मानव तज्ज्ञ एखाद्या वितरित उत्पादनाचे मूल्यांकन कसे करतील. दुसऱ्या शब्दांत, प्रत्येक वेळी संपूर्ण तज्ज्ञ पुनरावलोकन करण्याऐवजी, स्वयंचलित ग्रेडर पटकन अंदाज लावू शकतो की लोक कोणता आउटपुट प्राधान्य देतील. आम्ही हा साधन evals.openai.com द्वारे प्रयोगात्मक संशोधन सेवेसाठी प्रकाशित करत आहोत, परंतु ते अद्याप तज्ज्ञ ग्रेडर्स इतके विश्वासार्ह नाही, त्यामुळे आम्ही त्याचा वापर त्यांना बदलण्यासाठी करत नाही.
आम्हाला आढळले की आजचे सर्वोत्तम फ्रंटियर मॉडेल्स उद्योग तज्ज्ञांनी तयार केलेल्या कामाच्या गुणवत्तेशी आधीच जवळपास पोहोचत आहेत. याची चाचणी करण्यासाठी, आम्ही ब्लाइंड मूल्यांकन केले जिथे उद्योग तज्ज्ञांनी अनेक प्रमुख मॉडेल्स—GPT‑4o, o4-mini, OpenAI o3, GPT‑5, Claude Opus 4.1, Gemini 2.5 Pro, आणि Grok 4—च्या वितरित उत्पादनांची मानव निर्मित कामाशी तुलना केली. GDPval गोल्ड सेटमधील 220 कामांमध्ये, आम्ही नोंदवले की मॉडेल आउटपुट्स उद्योग तज्ज्ञांच्या वितरित उत्पादनांपेक्षा चांगले (“विन्स”) किंवा समकक्ष (“टाईज”) म्हणून रेट केले गेले, खालील बार चार्टमध्ये दाखवल्याप्रमाणे. Claude Opus 4.1 हा सेटमधील सर्वोत्तम कामगिरी करणारा मॉडेल होता, विशेषतः सौंदर्यशास्त्रात (उदा., दस्तऐवज फॉरमॅटिंग, स्लाईड लेआउट) उत्कृष्ट, आणि GPT‑5 विशेषतः अचूकतेत (उदा., डोमेन-विशिष्ट ज्ञान शोधणे) उत्कृष्ट होता. या कामांवर वेळोवेळी स्पष्ट प्रगती देखील दिसून येते. GPT‑4o (स्प्रिंग 2024 मध्ये रिलीज) पासून GPT‑5 (समर 2025 मध्ये रिलीज) पर्यंत कामगिरी दुप्पट पेक्षा जास्त वाढली आहे, स्पष्ट रेषीय ट्रेंडनुसार.
याशिवाय, आम्हाला आढळले की फ्रंटियर मॉडेल्स GDPval कामे उद्योग तज्ज्ञांपेक्षा सुमारे 100 पट वेगाने आणि 100 पट स्वस्त पूर्ण करू शकतात. तथापि, हे आकडे फक्त मॉडेल इन्फरन्स वेळ आणि API बिलिंग दर दर्शवतात, आणि त्यामुळे वास्तविक कार्यस्थळातील आमच्या मॉडेल्सचा वापर करण्यासाठी आवश्यक असलेली मानवी देखरेख, पुनरावृत्ती, आणि एकत्रीकरणाच्या टप्प्यांचा समावेश करत नाहीत. तरीही, विशेषतः त्या कामांच्या उपसमूहावर जिथे मॉडेल्स विशेषतः मजबूत आहेत, आम्हाला अपेक्षा आहे की मानवी परीक्षणाआधी मॉडेलला काम देणे वेळ आणि पैसे जतन करेल.
तज्ज्ञ ग्रेडर्सनी प्रमुख मॉडेल्सच्या वितरित उत्पादनांची तुलना मानवी तज्ज्ञांशी केली. आजचे फ्रंटियर मॉडेल्स उद्योग तज्ज्ञांनी तयार केलेल्या कामाच्या गुणवत्तेकडे आधीच पोहोचत आहेत. Claude Opus 4.1 ने निम्म्याहून कमी कामांमध्ये मानवांइतके चांगले किंवा त्यापेक्षा चांगले म्हणून मूल्यांकन केलेले आउटपुट तयार केले.
GPT‑4o पासून GPT‑5 पर्यंत, GDPval कामांवर कामगिरी एका वर्षात तीनपट पेक्षा जास्त वाढली.
शेवटी, आम्ही GPT‑5 च्या अंतर्गत, प्रयोगात्मक आवृत्तीचे हळूहळू प्रशिक्षण दिले जेणेकरून आम्ही GDPval वर कामगिरी सुधारू शकतो का हे तपासता येईल. आम्हाला आढळले की या प्रक्रियेमुळे कार्यप्रदर्शन सुधारले, ज्यामुळे पुढील संभाव्य सुधारणा करण्यासाठी मार्ग तयार करा. इतर नियंत्रित प्रयोग हे मागे करतात: मॉडेलचा आकार वाढवणे, अधिक तर्कशक्तीच्या टप्प्यांना प्रोत्साहन देणे, आणि समृद्ध काम संदर्भ देणे, प्रत्येकाने मोजता येणारे फायदे दिले.
आपण आमच्या पेपरमध्ये संपूर्ण निकाल वाचू शकता. आम्ही GDPval कार्यांचा सुवर्ण उपसंच आणि सार्वजनिक ग्रेडिंग सेवा देखील जारी करत आहोत जेणेकरून इतर संशोधक या कार्यावर पुढे काम करू शकतील.
AI अधिक सक्षम होत असताना, नोकरीच्या बाजारात बदल होण्याची शक्यता आहे. प्रारंभिक GDPval निकाल दर्शवतात की मॉडेल्स काही पुनरावृत्तीशील, चांगल्या प्रकारे निश्चित केलेल्या कामांना तज्ज्ञांपेक्षा अधिक वेगाने आणि कमी खर्चात पार पाडू शकतात. तथापि, बहुतेक नोकऱ्या फक्त लिहून ठेवता येणाऱ्या कामांचा संग्रह नसतात. GDPval दाखवते की AI कुठे नियमित काम हाताळू शकतो, ज्यामुळे लोक त्यांच्या कामाच्या सर्जनशील आणि निर्णय-प्रधान भागावर अधिक वेळ देऊ शकतात. जेव्हा AI अशा प्रकारे कामगारांना पूरक बनवतो, तेव्हा ते महत्त्वपूर्ण आर्थिक वृद्धीत रूपांतर होऊ शकते. आमचे ध्येय आहे की सर्वांना AI च्या “अप एलेव्हेटर” वर ठेवणे, या साधनांमध्ये प्रवेश लोकशाहीकरण करणे, बदलाच्या प्रक्रियेत कामगारांना समर्थन देणे, आणि व्यापक योगदानाला बक्षीस देणारी प्रणाली तयार करणे.
GDPval ही एक सुरुवातीची पायरी आहे. जरी हे 44 व्यवसाय आणि शेकडो कामे व्यापते, तरी आम्ही आमचा दृष्टिकोन सुरू ठेवत आहोत जेणेकरून चाचणीची व्याप्ती वाढेल आणि निकाल अधिक अर्थपूर्ण होतील. मूल्यांकनाची वर्तमान आवृत्ती देखील एकदाच केली जाते, त्यामुळे ती अशा प्रकरणांना टिपत नाही जिथे मॉडेलला संदर्भ तयार करणे किंवा अनेक मसुद्यांद्वारे सुधारणा करणे आवश्यक आहे—उदाहरणार्थ, ग्राहक अभिप्रायानंतर कायदेशीर अहवाल पुनरावलोकन करणे किंवा विसंगती आढळल्यावर डेटा विश्लेषणावर पुनरावृत्ती करणे. याव्यतिरिक्त, वास्तविक जगात, कार्ये नेहमीच प्रॉम्प्ट आणि संदर्भ फायलींसह स्पष्टपणे परिभाषित केली जात नाहीत; उदाहरणार्थ, एखाद्या वकिलाला अस्पष्टतेतून मार्ग काढावा लागू शकतो आणि कायदेशीर ब्रीफ तयार करणे हा त्यांच्या क्लायंटला मदत करण्यासाठी योग्य दृष्टिकोन आहे हे ठरवण्यापूर्वी त्यांच्याशी बोलावे लागू शकते. आम्ही GDPval चे विस्तार करण्याची योजना आखत आहोत ज्यामध्ये अधिक व्यवसाय, उद्योग, आणि कार्यप्रकारांचा समावेश असेल, वाढलेल्या परस्परसंवादासह, आणि अस्पष्टतेतून मार्ग काढणारी अधिक कामे, दीर्घकालीन उद्दिष्ट म्हणून विविध ज्ञान कार्यावर प्रगती अधिक चांगल्या प्रकारे मोजणे.
- जर आपण उद्योग तज्ञ असाल आणि GDPval मध्ये योगदान देण्यास इच्छुक असाल, तर कृपया येथे आपली आवड दाखवा.
- जर आपण OpenAI सोबत काम करणारे ग्राहक असाल आणि भविष्यातील GDPval फेरीत योगदान देऊ इच्छित असाल, तर कृपया येथे आपली रुची व्यक्त करा.
समुदायाचा सहभाग अत्यावश्यक आहे—संशोधक, व्यावसायिक, आणि संस्थांसह GDPval तयार करण्यासाठी आम्ही उत्सुक आहोत जे आमच्या उद्दिष्टास सामायिक करतात की AGI कामाच्या ठिकाणी लोकांसाठी अधिक उपयुक्त ठरेल.


