ప్రధాన కంటెంట్‌కి దాటండి
OpenAI

రెండు సెట్టింగ్‌లతో ARC-AGI-3 బెంచ్‌మార్క్‌లో మా స్కోర్లు మూడు రెట్లు ఎలా పెరిగాయి

లోడ్ అవుతోంది…

అధికారిక హార్నెస్‌తో (ఎడమవైపు), రీజనింగ్‌ను నిల్వ ఉంచి కాంపాక్షన్‌ను ఆన్ చేసే మా Responses API హార్నెస్‌తో (కుడివైపు) ARC-AGI-3 బెంచ్‌మార్క్ పజిల్‌లను పరిష్కరించడానికి GPT‑5.6 Sol ప్రయత్నిస్తున్న వేగవంతం చేసిన వీడియో. ఈ గేమ్(కొత్త విండోలో తెరుచుకుంటుంది) లీడర్‌బోర్డ్‌లో ఏ అత్యాధునిక మోడల్ కూడా మొదటి స్థాయిని మించి పరిష్కరించలేదు. మా హార్నెస్‌తో GPT‑5.6 Sol మొత్తం ఆరు స్థాయిలనూ పరిష్కరించింది.

ARC-AGI-3(కొత్త విండోలో తెరుచుకుంటుంది) బెంచ్‌మార్క్‌లో GPT‑5.6 Sol తక్కువ స్కోర్లు సాధించడాన్ని మొదట చూసినప్పుడు మాకు ఆశ్చర్యమేసింది.

GPT‑5.6 Sol గణితంలో చాలాకాలంగా పరిష్కారం కాని సైకిల్ డబుల్ కవర్ ఊహా ప్రతిపాదన(కొత్త విండోలో తెరుచుకుంటుంది) వంటి సమస్యలను పరిష్కరించింది, పోకెమాన్ ఫైర్‌రెడ్ వంటి గేమ్‌లను గెలిచింది. కానీ 2D పజిల్ గేమ్‌ల బెంచ్‌మార్క్ అయిన ARC-AGI-3లో GPT‑5.6 Sol కేవలం 7.8% స్కోర్ సాధించగా, GPT‑5.5 గేమ్‌లను ఆడటానికే చాలా ఇబ్బందిపడి కేవలం 0.4% సాధించింది.

మా మోడల్‌లకు 2D పజిల్ గేమ్‌లు అసాధారణంగా కష్టంగా ఉన్నాయా? లేదా ఇంకేదైనా కారణం ఉందా?

బెంచ్‌మార్క్‌లు AI మోడల్‌లను విడిగా కొలవడం చాలా అరుదు. API సెట్టింగ్‌లు, హార్నెస్ రూపకల్పన, ప్రాంప్టింగ్‌కు సంబంధించి అంతగా కనిపించని ఎంపికల ప్రభావాన్ని కూడా అవి కొలుస్తాయి. ARC-AGI-3 విషయంలో, ChatGPT మరియు Codexలో మేము ఉపయోగించే రెండు API సెట్టింగ్‌లైన రీజనింగ్ నిల్వ, కాంపాక్షన్‌లను ఆన్ చేయడంతో పబ్లిక్ టాస్క్ సెట్‌లో స్కోర్లు మూడు రెట్లు పెరిగి, అవుట్‌పుట్ టోకెన్‌లు ఆరు రెట్లు తగ్గాయని గుర్తించాం.

అధికారిక హార్నెస్‌తో, ARC-AGI-3 పబ్లిక్ సెట్‌లో GPT‑5.6 Sol 13.3% స్కోర్ సాధించింది. రీజనింగ్‌ను నిల్వ ఉంచి, కాంపాక్షన్‌ను ఉపయోగించడంతో 38.3% సాధించింది. స్కోర్లు సాపేక్ష మానవ చర్య సామర్థ్యాన్ని (RHAE(కొత్త విండోలో తెరుచుకుంటుంది))అంటే మోడల్ పనితీరును మానవ ప్రామాణిక స్థాయితో పోల్చే కొలమానాన్ని—సూచిస్తాయి. అధికారిక గేమ్‌ప్లే లాగ్‌ల(కొత్త విండోలో తెరుచుకుంటుంది) ఆధారంగా, సగటు మానవ టెస్టర్ 48% స్కోర్ సాధించినట్లు అంచనా వేశాం. మోడల్‌లకు స్కోర్‌ను ఎలా లెక్కిస్తారో చెప్పరు, అలాగే ప్రక్రియలో తమ స్కోర్‌ను అవి చూడలేవుచర్యలు ప్రతి ఫ్రేమ్‌కు సంబంధించిన టెక్స్ట్ రూపాన్ని, అవి ఉన్న స్థాయిని మాత్రమే అందిస్తాయి.

ARC-AGI-3

AI ఏజెంట్‌లు ఎంత బాగా నేర్చుకుని, రీజనింగ్ చేస్తాయో కొలవడానికి ARC-AGI-3 బెంచ్‌మార్క్‌ను రూపొందించారు. ఏజెంట్‌లు పరిచయం లేని 2D గేమ్‌లను పరిశీలించి, స్పష్టమైన సూచనలు లేకుండానే అవి ఎలా పనిచేస్తాయో అర్థం చేసుకుంటాయి. arcprize.org/tasks(కొత్త విండోలో తెరుచుకుంటుంది)లో మీరు 25 డెమో గేమ్‌లు ఆడవచ్చు.

ARC-AGI-3లో టూల్‌లు లేదా ప్రత్యేక ఫీచర్‌లు లేని, ఉద్దేశపూర్వకంగా సాధారణంగా ఉంచిన హార్నెస్‌ను ఉపయోగిస్తారు. సరళమైన హార్నెస్ మోడల్ లోపాలను మరింత స్పష్టంగా చూపడంతో పాటు, మోడల్‌ల మధ్య పోలికను మరింత న్యాయంగా చేస్తుందని ARC భావించింది. దీనికి భిన్నంగా, వాణిజ్య డెవలపర్‌లు ప్రతి మోడల్ ఫీచర్‌లు, ప్రత్యేక లక్షణాలకు అనుగుణంగా హార్నెస్‌లను మెరుగుపరుస్తారు.

గేమింగ్‌లో GPT‑5.6 Sol దృశ్య సమాచారం మాత్రమే ఉపయోగించే హార్నెస్‌తో పోకెమాన్ ఫైర్‌రెడ్‌ను (GPT_Plays_Pokemon(కొత్త విండోలో తెరుచుకుంటుంది) ప్రసారం చేసింది), Codex కంప్యూటర్ వినియోగంతో స్లే ది స్పైర్‌ను (EpochAI(కొత్త విండోలో తెరుచుకుంటుంది) ప్రసారం చేసింది), బాబా ఈజ్ యూ ప్రారంభ దశలను (పియోటర్ మిగ్డాల్ & పియోటర్ గ్రాబోవ్‌స్కీ(కొత్త విండోలో తెరుచుకుంటుంది) పంచుకున్నారు) గెలిచింది. ARC-AGI-3లో అంత భిన్నంగా ఉన్నది ఏమిటి?

Codexలో స్లే ది స్పైర్ 2 యాదృచ్ఛిక రోజువారీ సవాలును పూర్తి చేస్తున్న GPT-5.6 Sol.

GPT‑5.6 Sol నాలెడ్జ్ కటాఫ్ తర్వాత విడుదలైన స్లే ది స్పైర్ 2లో, Codexలోని GPT‑5.6 Sol యాదృచ్ఛిక రోజువారీ సవాలును గెలవడాన్ని ఈథన్ మాలిక్ చూపించారు(కొత్త విండోలో తెరుచుకుంటుంది).

GPT‑5.5 లోపాలపై ARC చేసిన విశ్లేషణ(కొత్త విండోలో తెరుచుకుంటుంది) స్ఫూర్తితో, GPT‑5.6 Sol చేసిన కొన్ని ప్రయత్నాలను పరిశీలించాం. ARC మాదిరిగానే, మోడల్ అంత తెలివిగా వ్యవహరించడం లేదని మేమూ గమనించాం. అది ప్రతి చర్యపై చాలాసేపు ఆలోచించినా, ముందుకు సాగడానికి ఇబ్బందిపడింది.

కానీ మరింత లోతుగా పరిశీలించినప్పుడు, మోడల్ గందరగోళానికి చాలావరకు దానిలోని సహజ పరిమితులు కాకుండా హార్నెస్ సెట్టింగ్‌లే కారణమని గుర్తించాం.

మొదటగా, ప్రతి గేమ్ చర్య తర్వాత ప్రైవేట్ రీజనింగ్ మొత్తాన్ని తొలగిస్తున్నట్లు గమనించాం. దీనివల్ల GPT‑5.6 Sol తన గత ఆలోచనలను గుర్తుంచుకోలేక, ప్రతి చర్యతో గేమ్‌ను మళ్లీ మొదటి నుంచి అర్థం చేసుకోవాల్సి వచ్చింది. గత కదలికల రికార్డును, వాటితో ఉన్న సంక్షిప్త గమనికలను మోడల్ చూడగలిగినా, వాటికి దారితీసిన ప్రణాళికలు, అంతర్దృష్టులు లేదా ఆలోచనలను చూడలేకపోయింది.

రెండోది, హార్నెస్ రోలింగ్ ట్రంకేషన్ విండోను ఉపయోగించడంతో చరిత్ర పెరిగే కొద్దీ పాత చర్యలు కనిపించకుండా పోతున్నాయని గమనించాం. అందువల్ల GPT‑5.6 Sol తన గత ఆలోచనలనే కాకుండా, గత చర్యలను కూడా మర్చిపోతూ వచ్చింది.

రీజనింగ్‌ను తొలగించడం, రోలింగ్ ట్రంకేషన్ అనే హార్నెస్‌లోని ఈ రెండు లక్షణాలు, కాలక్రమంలో నేర్చుకోవడానికి GPT‑5.6 Sol ఎందుకు ఇబ్బందిపడిందో వివరించాయి.

తాము చేసిన పనిని గుర్తుంచుకున్నప్పుడు ఏజెంట్‌లు ఉత్తమంగా పనిచేస్తాయి

ప్రత్యుత్తరాలు లేదా టూల్ కాల్‌లను అవుట్‌పుట్ చేసే ముందు ప్రైవేట్ రీజనింగ్ సందేశాలతో ఆలోచించేలా మా మోడల్‌లకు శిక్షణ ఇచ్చాం. ఈ ప్రైవేట్ ఆలోచనా సందేశాలు సంభాషణ చరిత్రలో భాగంగా నిల్వ ఉంటాయి. సంభాషణ మరీ పొడవైతే, దాన్ని సంగ్రహించి కొనసాగిస్తాం.

ఎక్కువసేపు కొనసాగే టాస్క్‌లో మోడల్ రీజనింగ్, టూల్ కాల్‌లు, సంభాషణ చరిత్ర, కాంటెక్స్ట్ కాంపాక్షన్ కలిసి ఎలా పనిచేస్తాయో చూపే రేఖాచిత్రం.

మా మోడల్‌లకు ఈ విధంగానే శిక్షణ ఇస్తాం, ChatGPT మరియు Codexలోనూ ఇలాగే అమలు చేస్తాం. మా ప్రొడక్షన్ అమరికకు మరింత దగ్గరగా ఉండేలా, మా Responses API(కొత్త విండోలో తెరుచుకుంటుంది)తో ARC-AGI-3 హార్నెస్‌ను అమలు చేశాం. మా APIతో కాంటెక్స్ట్‌ను సులభంగా నిర్వహించవచ్చు. GPT‑5.6 కోసం మునుపటి రెస్పాన్స్ IDని పంపితే, టూల్ కాల్‌లు, సంభాషణ మలుపుల మధ్య రీజనింగ్ స్వయంచాలకంగా నిల్వ ఉంటుంది.

రీజనింగ్‌ను నిల్వ ఉంచినప్పుడు రెండు ప్రధాన మార్పులను గమనించాం. మొదటగా, ప్రతి మలుపులో గేమ్‌ను మొదటి నుంచి అర్థం చేసుకోవాల్సిన అవసరం లేకపోవడంతో GPT‑5.6 Sol ప్రతి చర్యకు ముందు ఆలోచించడానికి తక్కువ సమయం తీసుకుంది. రెండోది, గత ఆలోచనలను గుర్తుంచుకోగలిగినప్పుడు GPT‑5.6 Sol కాలక్రమంలో మరింత బాగా నేర్చుకుని, సమన్వయంతో కూడిన వ్యూహాలను అమలు చేసింది.

రోలింగ్ ట్రంకేషన్ స్థానంలో Responses APIలోని మరో సెట్టింగ్ అయిన కాంపాక్షన్‌ను(కొత్త విండోలో తెరుచుకుంటుంది) ఉపయోగించడం తదుపరి మెరుగుదల.

ARC-AGI-3 హార్నెస్ రోలింగ్ ట్రంకేషన్‌తో కాంటెక్స్ట్ పరిమితులను నిర్వహిస్తుంది. సంభాషణ కాంటెక్స్ట్ 175,000 అక్షరాలను మించినప్పుడు, అత్యంత పాత సందేశాలు తొలగించబడతాయి.

రోలింగ్ ట్రంకేషన్‌కు రెండు ప్రతికూలతలు ఉన్నాయి. మొదటగా, మోడల్ మునుపటి పరిశీలనలు, చర్యలను కోల్పోతుంది. రెండోది, టాస్క్‌లలో ఎక్కువ భాగం దాదాపు నిండిన కాంటెక్స్ట్ విండోతో పనిచేస్తుంది. దీనివల్ల పనితీరు స్వల్పంగా తగ్గవచ్చు.

ARC-AGI-3లో కాంపాక్షన్‌ను ఆన్ చేసినప్పుడు, సుదీర్ఘ రన్‌లలో ప్రతి గేమ్ గురించి నేర్చుకున్న విషయాలను GPT‑5.6 Sol మరింత బాగా నిలుపుకొని, తక్కువ అవుట్‌పుట్ టోకెన్‌లతో ఎక్కువ స్కోర్ సాధించింది.

రీజనింగ్‌ను నిల్వ ఉంచడం, కాంపాక్షన్‌ను ఆన్ చేయడం వల్ల కలిగే ప్రభావాన్ని చూపడానికి, ప్రతి హార్నెస్‌తో వరుస ARC-AGI-3 పజిల్‌లను పరిష్కరిస్తున్నప్పుడు GPT‑5.6 Solకు చెందిన 175K కాంటెక్స్ట్ విండోను చూపే యానిమేషన్ ఇక్కడ ఉంది.

ప్రతి హార్నెస్ మోడల్ కాంటెక్స్ట్ విండోను ఎలా భిన్నంగా ఉపయోగిస్తుందో మధ్యలోని రెండు నిలువు వరుసలు చూపుతాయి. తన గతాన్ని మెరుగ్గా గుర్తుంచుకోవడంతో GPT‑5.6 Sol ప్రతి చర్యకు తక్కువగా ఆలోచించి, మరింత వేగంగా ముందుకు సాగుతుంది. గమనిక: మా అమలులో అక్షరాలకు బదులుగా 175,000 టోకెన్‌ల పరిమితిని ఉపయోగిస్తాం. అయితే టెక్స్ట్‌లో అత్యధిక భాగం చర్యల గ్రిడ్‌లే కావడం, వాటిని మా టోకనైజర్ 1:1 నిష్పత్తిలో టోకెన్‌లుగా మార్చడం వల్ల రెండూ దాదాపు సమానంగానే ఉంటాయి.

రీజనింగ్‌ను నిల్వ ఉంచడం, కాంపాక్షన్ కలిసి GPT‑5.6 Sol (మ్యాక్స్)కు సుమారు మూడు రెట్ల స్కోర్‌ను, ఆరు రెట్లు తక్కువ అవుట్‌పుట్ టోకెన్‌లతో సాధ్యం చేస్తాయి.

ముగింపు, సిఫార్సులు

మూల్యాంకనాలు మోడల్‌లను విడిగా కొలవడం చాలా అరుదని ఈ ప్రయోగాలు గుర్తుచేస్తాయని ఆశిస్తున్నాం. అవి API సెట్టింగ్‌లు, హార్నెస్ రూపకల్పన, ప్రాంప్టింగ్‌కు సంబంధించిన అంతగా కనిపించని ఎంపికల సమాహారాన్ని కూడా కొలుస్తాయి. పబ్లిక్ బెంచ్‌మార్క్‌లో తక్కువ స్కోర్లు చూసి మేము ఆశ్చర్యపోయి, ఆ తర్వాత మూల్యాంకన రన్నర్ రీజనింగ్ సందేశాలను తొలగించే సాధారణ హార్నెస్‌ను ఉపయోగిస్తోందని గుర్తించడం ఇదే మొదటిసారి కాదు.

మీరు పనితీరును గరిష్ఠ స్థాయికి తీసుకెళ్లాలనుకునే API డెవలపర్ అయితే, మా ఉత్పత్తుల్లో మేము అమలు చేసే సెట్టింగ్‌లనే ఉపయోగించాలని సిఫార్సు చేస్తున్నాం:

  • మా పాత చాట్ కంప్లీషన్స్ APIకి బదులుగా Responses APIని ఉపయోగించండి
  • రీజనింగ్‌ను నిల్వ ఉంచండి
  • కాంపాక్షన్‌ను ఉపయోగించండి

మీరు మోడల్‌లను పోలుస్తుంటే, ChatGPT మరియు Codexలోని వాస్తవ వినియోగానికి అత్యంత దగ్గరగా ఉండే పై సెట్టింగ్‌లను ఉపయోగించే మూల్యాంకనాలపై ఆధారపడాలని సిఫార్సు చేస్తున్నాం.

AGI మూల్యాంకనంపై ఎన్నో ఏళ్లుగా సృజనాత్మకంగా కృషి చేసినందుకు, ఈ అంశాన్ని మరింత లోతుగా పరిశీలించడానికి మాకు స్ఫూర్తినిచ్చిన విశ్లేషణకు ARCకు కృతజ్ఞతలు.

అత్యాధునిక మోడల్‌లతో మీ సామర్థ్యాన్ని పరీక్షించుకోవాలనుకుంటే, arcprize.org/tasks(కొత్త విండోలో తెరుచుకుంటుంది)లోని పబ్లిక్ గేమ్‌లను మీరే ఆడి చూడండి.

రచయిత

Ilan Bigio, Ted Sanders