ARC-AGI-3 માપદંડના કોયડા ઉકેલવાનો GPT‑5.6 Solનો ઝડપી બનાવેલો વિડિયો. ડાબે અધિકૃત કાર્યપ્રણાલી છે અને જમણે રિજનિંગ જાળવતી તથા કૉમ્પેક્શન ચાલુ કરતી અમારી રિસ્પોન્સિસ API કાર્યપ્રણાલી છે. આ રમતના(નવી વિન્ડોમાં ખૂલે છે) અગ્રતાક્રમમાં કોઈ અત્યાધુનિક મોડલ પ્રથમથી આગળનું એકેય સ્તર ઉકેલી શકતું નથી. અમારી કાર્યપ્રણાલી સાથે GPT‑5.6 Sol તમામ છ સ્તર ઉકેલે છે.
જ્યારે અમે પહેલી વાર ARC-AGI-3(નવી વિન્ડોમાં ખૂલે છે) માપદંડ પર GPT‑5.6 Solના ઓછા ગુણ જોયા, ત્યારે અમને નવાઈ લાગી.
GPT‑5.6 Solએ ગણિતમાં લાંબા સમયથી વણઉકેલાયેલી સાઇકલ ડબલ કવર પરિકલ્પના(નવી વિન્ડોમાં ખૂલે છે) જેવી સમસ્યાઓ ઉકેલી છે અને Pokémon FireRed જેવી રમતોમાં જીત મેળવી છે. પરંતુ દ્વિ-પરિમાણીય કોયડા-રમતોના માપદંડ ARC-AGI-3 પર GPT‑5.6 Solને માત્ર 7.8% ગુણ મળ્યા, જ્યારે GPT‑5.5 માંડ રમી શક્યું અને તેને ફક્ત 0.4% ગુણ મળ્યા.
શું દ્વિ-પરિમાણીય કોયડા-રમતો અમારા મોડલો માટે અસામાન્ય રીતે મુશ્કેલ હતી? કે પછી કારણ કંઈ બીજું હતું?
માપદંડો ભાગ્યે જ AI મોડલોને અલગથી માપે છે. તેઓ API સેટિંગ, કાર્યપ્રણાલીની રચના અને પ્રોમ્પ્ટિંગ અંગેની ઓછી દેખાતી પસંદગીઓને પણ માપે છે. ARC-AGI-3ના કિસ્સામાં અમને જાણવા મળ્યું કે ChatGPT અને Codexમાં અમે વાપરતાં બે API સેટિંગ—રિજનિંગ જાળવવું અને કૉમ્પેક્શન—ચાલુ કરવાથી સાર્વજનિક કાર્યસેટ પર ગુણ ત્રણ ગણા થયા અને આઉટપુટ ટોકન છ ગણા ઘટ્યા.
અધિકૃત કાર્યપ્રણાલી સાથે GPT‑5.6 Solએ ARC-AGI-3ના સાર્વજનિક સેટ પર 13.3% ગુણ મેળવ્યા. રિજનિંગ જાળવી રાખતાં અને કૉમ્પેક્શન સાથે તેણે 38.3% ગુણ મેળવ્યા. ગુણ સાપેક્ષ માનવ ક્રિયા કાર્યક્ષમતા (RHAE(નવી વિન્ડોમાં ખૂલે છે))—મોડલના પ્રદર્શનની માનવીય આધારરેખા સાથે સરખામણી કરતું માપદંડ—દર્શાવે છે. અધિકૃત ગેમપ્લે લૉગ(નવી વિન્ડોમાં ખૂલે છે)ના આધારે અમારો અંદાજ છે કે સરેરાશ માનવ પરીક્ષકે 48% ગુણ મેળવ્યા. મોડલોને ગુણ કેવી રીતે અપાશે તે જણાવાતું નથી અને તેઓ પ્રક્રિયા દરમિયાન પોતાના ગુણ જોઈ શકતા નથી—ક્રિયાઓ માત્ર દરેક ફ્રેમનું ટેક્સ્ટ સ્વરૂપ અને તેઓ કયા સ્તરે છે તે જ પરત કરે છે.
ARC-AGI-3 એ AI એજન્ટ કેટલું સારી રીતે શીખે અને રિજનિંગ કરે છે તે માપવા માટે રચાયેલ માપદંડ છે. એજન્ટ અજાણી દ્વિ-પરિમાણીય રમતો તપાસે છે અને સ્પષ્ટ સૂચનાઓ વિના તે કેવી રીતે ચાલે છે તે સમજે છે. તમે arcprize.org/tasks(નવી વિન્ડોમાં ખૂલે છે) પર 25 નિદર્શન રમતો રમી શકો છો.
ARC-AGI-3 સાધનો કે વિશેષ સુવિધાઓ વિનાની, ઇરાદાપૂર્વક સામાન્ય કાર્યપ્રણાલી વાપરે છે. ARCનો તર્ક હતો કે સરળ કાર્યપ્રણાલીથી મોડલની ખામીઓ વધુ સ્પષ્ટ દેખાય છે અને મોડલોની સરખામણી વધુ ન્યાયસંગત બને છે. તેનાથી વિપરીત, વ્યાવસાયિક વિકાસકર્તાઓ દરેક મોડલની સુવિધાઓ અને વિશિષ્ટતાઓ અનુસાર કાર્યપ્રણાલીને શ્રેષ્ઠ બનાવે છે.
રમતોમાં GPT‑5.6 Solએ માત્ર દૃશ્ય આધારિત કાર્યપ્રણાલીથી Pokémon FireRedને હરાવી છે (GPT_Plays_Pokemon(નવી વિન્ડોમાં ખૂલે છે) દ્વારા પ્રસારિત), Codexના કમ્પ્યુટર ઉપયોગથી Slay the Spire જીતી છે (EpochAI(નવી વિન્ડોમાં ખૂલે છે) દ્વારા પ્રસારિત) અને Baba Is Youના શરૂઆતના તબક્કા પાર કર્યા છે (Piotr Migdał & Piotr Grabowski(નવી વિન્ડોમાં ખૂલે છે) દ્વારા જણાવ્યા મુજબ). ARC-AGI-3માં એવું શું અલગ હતું?

Ethan Mollick બતાવે છે કે(નવી વિન્ડોમાં ખૂલે છે) Codexમાં GPT‑5.6 Sol, Slay the Spire 2નો અવ્યવસ્થિત દૈનિક પડકાર જીતી રહ્યું છે. આ રમત GPT‑5.6 Solની જ્ઞાન-સમયમર્યાદા પછી રજૂ થઈ હતી.
GPT‑5.5ની ખામીઓ અંગે ARCના વિશ્લેષણ(નવી વિન્ડોમાં ખૂલે છે)થી પ્રેરાઈને અમે GPT‑5.6 Solના કેટલાક પ્રયાસો તપાસ્યા. ARCની જેમ અમને પણ મોડલ બહુ હોશિયાર લાગ્યું નહીં. તે દરેક ક્રિયા વિશે લાંબો સમય વિચારતું અને આગળ વધવામાં મુશ્કેલી અનુભવતું હતું.
પરંતુ વધુ ઊંડાણથી તપાસતાં અમને જાણવા મળ્યું કે મોડલની મોટાભાગની મૂંઝવણ તેની પોતાની મર્યાદાને કારણે નહીં, પણ કાર્યપ્રણાલીનાં સેટિંગને કારણે હતી.
સૌપ્રથમ અમે જોયું કે રમતની દરેક ક્રિયા પછી બધું ખાનગી રિજનિંગ કાઢી નાખવામાં આવતું હતું. એટલે દરેક ક્રિયા વખતે GPT‑5.6 Solને પોતાના અગાઉના વિચારો યાદ રાખ્યા વિના રમતને ફરીથી સમજવાનું કહેવામાં આવતું હતું. મોડલ અગાઉની ચાલો અને તેની સાથેની ટૂંકી નોંધો જોઈ શકતું હતું, પરંતુ એ ચાલો સુધી પહોંચાડનારી યોજનાઓ, સૂઝ કે વિચારો જોઈ શકતું નહોતું.
બીજું, અમે જોયું કે કાર્યપ્રણાલી આગળ સરકતી કાપછાંટ વિન્ડો વાપરતી હતી, જેથી ઇતિહાસ વધતાં જૂની ક્રિયાઓ અદૃશ્ય થતી હતી. આમ, GPT‑5.6 Sol પોતાના અગાઉના વિચારો જ નહીં, અગાઉની ક્રિયાઓ પણ ભૂલી રહ્યું હતું.
કાર્યપ્રણાલીની આ બે વિશેષતાઓ—રિજનિંગ કાઢી નાખવું અને આગળ સરકતી કાપછાંટ—સાથે મળીને સમજાવતી હતી કે GPT‑5.6 Solને સમય જતાં શીખવામાં મુશ્કેલી કેમ પડતી હતી.
અમારા મોડલોને જવાબ કે સાધન કૉલ આપતાં પહેલાં ખાનગી રિજનિંગ સંદેશાઓ દ્વારા વિચારવાની તાલીમ આપવામાં આવી છે. આ ખાનગી વિચાર-સંદેશાઓ વાર્તાલાપના ઇતિહાસના ભાગ તરીકે જાળવી રાખવામાં આવે છે. વાર્તાલાપ બહુ લાંબો થાય તો અમે તેનો સારાંશ બનાવીને આગળ વધીએ છીએ.
અમારા મોડલોને આ રીતે તાલીમ અપાય છે અને ChatGPT તથા Codexમાં પણ આ જ રીતે ઉપયોગમાં લેવાય છે. અમારી વાસ્તવિક ઉત્પાદન વ્યવસ્થાને વધુ સારી રીતે અનુરૂપ બનાવવા અમે અમારી રિસ્પોન્સિસ API(નવી વિન્ડોમાં ખૂલે છે) વડે ARC-AGI-3 કાર્યપ્રણાલી અમલમાં મૂકી. અમારી API સંદર્ભનું સંચાલન સરળ બનાવે છે. GPT‑5.6 માટે અગાઉના પ્રતિસાદનું ID આપવાથી સાધન કૉલ અને વાર્તાલાપના તબક્કાઓમાં રિજનિંગ આપમેળે જળવાય છે.
રિજનિંગ જાળવતાં અમને બે મોટા ફેરફાર જોવા મળ્યા. પહેલું, GPT‑5.6 Sol દરેક ક્રિયા પહેલાં વિચારવામાં ઓછો સમય લેતું હતું, કારણ કે હવે તેને દરેક તબક્કે રમતને શરૂઆતથી સમજવી પડતી નહોતી. બીજું, અગાઉના વિચારો યાદ રાખી શકવાથી GPT‑5.6 Sol સમય જતાં વધુ સારી રીતે શીખતું અને સુસંગત વ્યૂહરચનાઓ અપનાવતું હતું.
આગળનો સુધારો આગળ સરકતી કાપછાંટને કૉમ્પેક્શન(નવી વિન્ડોમાં ખૂલે છે)થી બદલવાથી થયો. રિસ્પોન્સિસ APIમાં આ પણ એક સેટિંગ છે.
ARC-AGI-3 કાર્યપ્રણાલી સંદર્ભની મર્યાદાઓને આગળ સરકતી કાપછાંટ વડે સંભાળે છે. વાર્તાલાપનો સંદર્ભ 175,000 અક્ષર કરતાં વધી જાય ત્યારે સૌથી જૂના સંદેશા કાઢી નાખવામાં આવે છે.
આગળ સરકતી કાપછાંટની બે ખામીઓ છે. પહેલી, મોડલ અગાઉનાં અવલોકનો અને ક્રિયાઓ ગુમાવે છે. બીજી, તે મોટાભાગનું કાર્ય વધુ ભરેલી સંદર્ભ વિન્ડો સાથે કરે છે, જેનાથી પ્રદર્શન થોડું નબળું પડી શકે છે.
અમે ARC-AGI-3 પર કૉમ્પેક્શન ચાલુ કર્યું ત્યારે GPT‑5.6 Sol લાંબા પ્રયાસો દરમિયાન દરેક રમત વિશે શીખેલું વધુ સારી રીતે જાળવી શક્યું અને ઓછા આઉટપુટ ટોકન સાથે વધુ ગુણ મેળવ્યા.
રિજનિંગ જાળવવા અને કૉમ્પેક્શન ચાલુ કરવાની અસર સમજાવવા માટે અહીં દરેક કાર્યપ્રણાલી સાથે ARC-AGI-3 કોયડાઓની શ્રેણી ઉકેલતી વખતે GPT‑5.6 Solની 175K સંદર્ભ વિન્ડો દર્શાવતું ચલચિત્ર છે.
વચ્ચેના બે સ્તંભ દર્શાવે છે કે દરેક કાર્યપ્રણાલી મોડલની સંદર્ભ વિન્ડોનો અલગ રીતે કેવી રીતે ઉપયોગ કરે છે. પોતાના ભૂતકાળની વધુ સારી યાદ હોવાથી GPT‑5.6 Sol દરેક ક્રિયા દીઠ ઓછું વિચારે છે અને ઘણું ઝડપથી આગળ વધે છે. નોંધ: અમારો અમલ અક્ષરોને બદલે 175,000 ટોકનની મર્યાદા વાપરે છે, પરંતુ પરિણામ લગભગ સમાન રહે છે, કારણ કે મોટાભાગનું લખાણ ક્રિયા-જાળીઓનું છે, જેને અમારું ટોકનાઇઝર 1:1ના પ્રમાણમાં ટોકનમાં ફેરવે છે.
રિજનિંગ જાળવવું અને કૉમ્પેક્શન સાથે મળીને GPT‑5.6 Sol (Max)ને લગભગ ત્રણ ગણા ગુણ મેળવવા અને છ ગણા ઓછા આઉટપુટ ટોકન વાપરવા દે છે.
અમને આશા છે કે આ પ્રયોગો યાદ અપાવશે કે મૂલ્યાંકનો ભાગ્યે જ મોડલોને અલગથી માપે છે. તેઓ API સેટિંગ, કાર્યપ્રણાલીની રચના અને પ્રોમ્પ્ટિંગ અંગેની ઓછી દેખાતી પસંદગીઓના સમૂહને પણ માપે છે. સાર્વજનિક માપદંડ પર ઓછા ગુણથી અમને નવાઈ લાગી હોય અને પછી જાણવા મળ્યું હોય કે મૂલ્યાંકન ચલાવનાર સામાન્ય કાર્યપ્રણાલી રિજનિંગ સંદેશાઓ કાઢી નાખતી હતી, એવું આ પહેલી વાર બન્યું નથી.
જો તમે મહત્તમ પ્રદર્શન મેળવવા ઇચ્છતા API વિકાસકર્તા હો, તો અમે અમારા ઉત્પાદનોમાં વાપરીએ છીએ એ જ સેટિંગ વાપરવાની ભલામણ કરીએ છીએ:
- અમારી જૂની ચેટ કમ્પ્લીશન્સ APIને બદલે રિસ્પોન્સિસ API વાપરો
- રિજનિંગ જાળવો
- કૉમ્પેક્શન વાપરો
અને જો તમે મોડલોની સરખામણી કરતા હો, તો ઉપરનાં સેટિંગ વાપરતાં મૂલ્યાંકનો પર આધાર રાખવાની અમારી ભલામણ છે, કારણ કે તે ChatGPT અને Codexના વાસ્તવિક ઉપયોગને સૌથી સારી રીતે અનુરૂપ છે.
AGI મૂલ્યાંકન પર વર્ષોથી કરેલા સર્જનાત્મક કાર્ય અને અમને અહીં વધુ ઊંડાણથી તપાસવાની પ્રેરણા આપનાર વિશ્લેષણ બદલ અમે ARCના આભારી છીએ.
જો તમે અત્યાધુનિક મોડલો સામે પોતાની ક્ષમતા ચકાસવા માંગતા હો, તો arcprize.org/tasks(નવી વિન્ડોમાં ખૂલે છે) પર સાર્વજનિક રમતો જાતે રમો.


