అధికారిక హార్నెస్తో (ఎడమవైపు), రీజనింగ్ను నిల్వ ఉంచి కాంపాక్షన్ను ఆన్ చేసే మా Responses API హార్నెస్తో (కుడివైపు) ARC-AGI-3 బెంచ్మార్క్ పజిల్లను పరిష్కరించడానికి GPT‑5.6 Sol ప్రయత్నిస్తున్న వేగవంతం చేసిన వీడియో. ఈ గేమ్(కొత్త విండోలో తెరుచుకుంటుంది) లీడర్బోర్డ్లో ఏ అత్యాధునిక మోడల్ కూడా మొదటి స్థాయిని మించి పరిష్కరించలేదు. మా హార్నెస్తో GPT‑5.6 Sol మొత్తం ఆరు స్థాయిలనూ పరిష్కరించింది.
ARC-AGI-3(కొత్త విండోలో తెరుచుకుంటుంది) బెంచ్మార్క్లో GPT‑5.6 Sol తక్కువ స్కోర్లు సాధించడాన్ని మొదట చూసినప్పుడు మాకు ఆశ్చర్యమేసింది.
GPT‑5.6 Sol గణితంలో చాలాకాలంగా పరిష్కారం కాని సైకిల్ డబుల్ కవర్ ఊహా ప్రతిపాదన(కొత్త విండోలో తెరుచుకుంటుంది) వంటి సమస్యలను పరిష్కరించింది, పోకెమాన్ ఫైర్రెడ్ వంటి గేమ్లను గెలిచింది. కానీ 2D పజిల్ గేమ్ల బెంచ్మార్క్ అయిన ARC-AGI-3లో GPT‑5.6 Sol కేవలం 7.8% స్కోర్ సాధించగా, GPT‑5.5 గేమ్లను ఆడటానికే చాలా ఇబ్బందిపడి కేవలం 0.4% సాధించింది.
మా మోడల్లకు 2D పజిల్ గేమ్లు అసాధారణంగా కష్టంగా ఉన్నాయా? లేదా ఇంకేదైనా కారణం ఉందా?
బెంచ్మార్క్లు AI మోడల్లను విడిగా కొలవడం చాలా అరుదు. API సెట్టింగ్లు, హార్నెస్ రూపకల్పన, ప్రాంప్టింగ్కు సంబంధించి అంతగా కనిపించని ఎంపికల ప్రభావాన్ని కూడా అవి కొలుస్తాయి. ARC-AGI-3 విషయంలో, ChatGPT మరియు Codexలో మేము ఉపయోగించే రెండు API సెట్టింగ్లైన రీజనింగ్ నిల్వ, కాంపాక్షన్లను ఆన్ చేయడంతో పబ్లిక్ టాస్క్ సెట్లో స్కోర్లు మూడు రెట్లు పెరిగి, అవుట్పుట్ టోకెన్లు ఆరు రెట్లు తగ్గాయని గుర్తించాం.
అధికారిక హార్నెస్తో, ARC-AGI-3 పబ్లిక్ సెట్లో GPT‑5.6 Sol 13.3% స్కోర్ సాధించింది. రీజనింగ్ను నిల్వ ఉంచి, కాంపాక్షన్ను ఉపయోగించడంతో 38.3% సాధించింది. స్కోర్లు సాపేక్ష మానవ చర్య సామర్థ్యాన్ని (RHAE(కొత్త విండోలో తెరుచుకుంటుంది))—అంటే మోడల్ పనితీరును మానవ ప్రామాణిక స్థాయితో పోల్చే కొలమానాన్ని—సూచిస్తాయి. అధికారిక గేమ్ప్లే లాగ్ల(కొత్త విండోలో తెరుచుకుంటుంది) ఆధారంగా, సగటు మానవ టెస్టర్ 48% స్కోర్ సాధించినట్లు అంచనా వేశాం. మోడల్లకు స్కోర్ను ఎలా లెక్కిస్తారో చెప్పరు, అలాగే ప్రక్రియలో తమ స్కోర్ను అవి చూడలేవు—చర్యలు ప్రతి ఫ్రేమ్కు సంబంధించిన టెక్స్ట్ రూపాన్ని, అవి ఉన్న స్థాయిని మాత్రమే అందిస్తాయి.
AI ఏజెంట్లు ఎంత బాగా నేర్చుకుని, రీజనింగ్ చేస్తాయో కొలవడానికి ARC-AGI-3 బెంచ్మార్క్ను రూపొందించారు. ఏజెంట్లు పరిచయం లేని 2D గేమ్లను పరిశీలించి, స్పష్టమైన సూచనలు లేకుండానే అవి ఎలా పనిచేస్తాయో అర్థం చేసుకుంటాయి. arcprize.org/tasks(కొత్త విండోలో తెరుచుకుంటుంది)లో మీరు 25 డెమో గేమ్లు ఆడవచ్చు.
ARC-AGI-3లో టూల్లు లేదా ప్రత్యేక ఫీచర్లు లేని, ఉద్దేశపూర్వకంగా సాధారణంగా ఉంచిన హార్నెస్ను ఉపయోగిస్తారు. సరళమైన హార్నెస్ మోడల్ లోపాలను మరింత స్పష్టంగా చూపడంతో పాటు, మోడల్ల మధ్య పోలికను మరింత న్యాయంగా చేస్తుందని ARC భావించింది. దీనికి భిన్నంగా, వాణిజ్య డెవలపర్లు ప్రతి మోడల్ ఫీచర్లు, ప్రత్యేక లక్షణాలకు అనుగుణంగా హార్నెస్లను మెరుగుపరుస్తారు.
గేమింగ్లో GPT‑5.6 Sol దృశ్య సమాచారం మాత్రమే ఉపయోగించే హార్నెస్తో పోకెమాన్ ఫైర్రెడ్ను (GPT_Plays_Pokemon(కొత్త విండోలో తెరుచుకుంటుంది) ప్రసారం చేసింది), Codex కంప్యూటర్ వినియోగంతో స్లే ది స్పైర్ను (EpochAI(కొత్త విండోలో తెరుచుకుంటుంది) ప్రసారం చేసింది), బాబా ఈజ్ యూ ప్రారంభ దశలను (పియోటర్ మిగ్డాల్ & పియోటర్ గ్రాబోవ్స్కీ(కొత్త విండోలో తెరుచుకుంటుంది) పంచుకున్నారు) గెలిచింది. ARC-AGI-3లో అంత భిన్నంగా ఉన్నది ఏమిటి?

GPT‑5.6 Sol నాలెడ్జ్ కటాఫ్ తర్వాత విడుదలైన స్లే ది స్పైర్ 2లో, Codexలోని GPT‑5.6 Sol యాదృచ్ఛిక రోజువారీ సవాలును గెలవడాన్ని ఈథన్ మాలిక్ చూపించారు(కొత్త విండోలో తెరుచుకుంటుంది).
GPT‑5.5 లోపాలపై ARC చేసిన విశ్లేషణ(కొత్త విండోలో తెరుచుకుంటుంది) స్ఫూర్తితో, GPT‑5.6 Sol చేసిన కొన్ని ప్రయత్నాలను పరిశీలించాం. ARC మాదిరిగానే, మోడల్ అంత తెలివిగా వ్యవహరించడం లేదని మేమూ గమనించాం. అది ప్రతి చర్యపై చాలాసేపు ఆలోచించినా, ముందుకు సాగడానికి ఇబ్బందిపడింది.
కానీ మరింత లోతుగా పరిశీలించినప్పుడు, మోడల్ గందరగోళానికి చాలావరకు దానిలోని సహజ పరిమితులు కాకుండా హార్నెస్ సెట్టింగ్లే కారణమని గుర్తించాం.
మొదటగా, ప్రతి గేమ్ చర్య తర్వాత ప్రైవేట్ రీజనింగ్ మొత్తాన్ని తొలగిస్తున్నట్లు గమనించాం. దీనివల్ల GPT‑5.6 Sol తన గత ఆలోచనలను గుర్తుంచుకోలేక, ప్రతి చర్యతో గేమ్ను మళ్లీ మొదటి నుంచి అర్థం చేసుకోవాల్సి వచ్చింది. గత కదలికల రికార్డును, వాటితో ఉన్న సంక్షిప్త గమనికలను మోడల్ చూడగలిగినా, వాటికి దారితీసిన ప్రణాళికలు, అంతర్దృష్టులు లేదా ఆలోచనలను చూడలేకపోయింది.
రెండోది, హార్నెస్ రోలింగ్ ట్రంకేషన్ విండోను ఉపయోగించడంతో చరిత్ర పెరిగే కొద్దీ పాత చర్యలు కనిపించకుండా పోతున్నాయని గమనించాం. అందువల్ల GPT‑5.6 Sol తన గత ఆలోచనలనే కాకుండా, గత చర్యలను కూడా మర్చిపోతూ వచ్చింది.
రీజనింగ్ను తొలగించడం, రోలింగ్ ట్రంకేషన్ అనే హార్నెస్లోని ఈ రెండు లక్షణాలు, కాలక్రమంలో నేర్చుకోవడానికి GPT‑5.6 Sol ఎందుకు ఇబ్బందిపడిందో వివరించాయి.
ప్రత్యుత్తరాలు లేదా టూల్ కాల్లను అవుట్పుట్ చేసే ముందు ప్రైవేట్ రీజనింగ్ సందేశాలతో ఆలోచించేలా మా మోడల్లకు శిక్షణ ఇచ్చాం. ఈ ప్రైవేట్ ఆలోచనా సందేశాలు సంభాషణ చరిత్రలో భాగంగా నిల్వ ఉంటాయి. సంభాషణ మరీ పొడవైతే, దాన్ని సంగ్రహించి కొనసాగిస్తాం.
మా మోడల్లకు ఈ విధంగానే శిక్షణ ఇస్తాం, ChatGPT మరియు Codexలోనూ ఇలాగే అమలు చేస్తాం. మా ప్రొడక్షన్ అమరికకు మరింత దగ్గరగా ఉండేలా, మా Responses API(కొత్త విండోలో తెరుచుకుంటుంది)తో ARC-AGI-3 హార్నెస్ను అమలు చేశాం. మా APIతో కాంటెక్స్ట్ను సులభంగా నిర్వహించవచ్చు. GPT‑5.6 కోసం మునుపటి రెస్పాన్స్ IDని పంపితే, టూల్ కాల్లు, సంభాషణ మలుపుల మధ్య రీజనింగ్ స్వయంచాలకంగా నిల్వ ఉంటుంది.
రీజనింగ్ను నిల్వ ఉంచినప్పుడు రెండు ప్రధాన మార్పులను గమనించాం. మొదటగా, ప్రతి మలుపులో గేమ్ను మొదటి నుంచి అర్థం చేసుకోవాల్సిన అవసరం లేకపోవడంతో GPT‑5.6 Sol ప్రతి చర్యకు ముందు ఆలోచించడానికి తక్కువ సమయం తీసుకుంది. రెండోది, గత ఆలోచనలను గుర్తుంచుకోగలిగినప్పుడు GPT‑5.6 Sol కాలక్రమంలో మరింత బాగా నేర్చుకుని, సమన్వయంతో కూడిన వ్యూహాలను అమలు చేసింది.
రోలింగ్ ట్రంకేషన్ స్థానంలో Responses APIలోని మరో సెట్టింగ్ అయిన కాంపాక్షన్ను(కొత్త విండోలో తెరుచుకుంటుంది) ఉపయోగించడం తదుపరి మెరుగుదల.
ARC-AGI-3 హార్నెస్ రోలింగ్ ట్రంకేషన్తో కాంటెక్స్ట్ పరిమితులను నిర్వహిస్తుంది. సంభాషణ కాంటెక్స్ట్ 175,000 అక్షరాలను మించినప్పుడు, అత్యంత పాత సందేశాలు తొలగించబడతాయి.
రోలింగ్ ట్రంకేషన్కు రెండు ప్రతికూలతలు ఉన్నాయి. మొదటగా, మోడల్ మునుపటి పరిశీలనలు, చర్యలను కోల్పోతుంది. రెండోది, టాస్క్లలో ఎక్కువ భాగం దాదాపు నిండిన కాంటెక్స్ట్ విండోతో పనిచేస్తుంది. దీనివల్ల పనితీరు స్వల్పంగా తగ్గవచ్చు.
ARC-AGI-3లో కాంపాక్షన్ను ఆన్ చేసినప్పుడు, సుదీర్ఘ రన్లలో ప్రతి గేమ్ గురించి నేర్చుకున్న విషయాలను GPT‑5.6 Sol మరింత బాగా నిలుపుకొని, తక్కువ అవుట్పుట్ టోకెన్లతో ఎక్కువ స్కోర్ సాధించింది.
రీజనింగ్ను నిల్వ ఉంచడం, కాంపాక్షన్ను ఆన్ చేయడం వల్ల కలిగే ప్రభావాన్ని చూపడానికి, ప్రతి హార్నెస్తో వరుస ARC-AGI-3 పజిల్లను పరిష్కరిస్తున్నప్పుడు GPT‑5.6 Solకు చెందిన 175K కాంటెక్స్ట్ విండోను చూపే యానిమేషన్ ఇక్కడ ఉంది.
ప్రతి హార్నెస్ మోడల్ కాంటెక్స్ట్ విండోను ఎలా భిన్నంగా ఉపయోగిస్తుందో మధ్యలోని రెండు నిలువు వరుసలు చూపుతాయి. తన గతాన్ని మెరుగ్గా గుర్తుంచుకోవడంతో GPT‑5.6 Sol ప్రతి చర్యకు తక్కువగా ఆలోచించి, మరింత వేగంగా ముందుకు సాగుతుంది. గమనిక: మా అమలులో అక్షరాలకు బదులుగా 175,000 టోకెన్ల పరిమితిని ఉపయోగిస్తాం. అయితే టెక్స్ట్లో అత్యధిక భాగం చర్యల గ్రిడ్లే కావడం, వాటిని మా టోకనైజర్ 1:1 నిష్పత్తిలో టోకెన్లుగా మార్చడం వల్ల రెండూ దాదాపు సమానంగానే ఉంటాయి.
రీజనింగ్ను నిల్వ ఉంచడం, కాంపాక్షన్ కలిసి GPT‑5.6 Sol (మ్యాక్స్)కు సుమారు మూడు రెట్ల స్కోర్ను, ఆరు రెట్లు తక్కువ అవుట్పుట్ టోకెన్లతో సాధ్యం చేస్తాయి.
మూల్యాంకనాలు మోడల్లను విడిగా కొలవడం చాలా అరుదని ఈ ప్రయోగాలు గుర్తుచేస్తాయని ఆశిస్తున్నాం. అవి API సెట్టింగ్లు, హార్నెస్ రూపకల్పన, ప్రాంప్టింగ్కు సంబంధించిన అంతగా కనిపించని ఎంపికల సమాహారాన్ని కూడా కొలుస్తాయి. పబ్లిక్ బెంచ్మార్క్లో తక్కువ స్కోర్లు చూసి మేము ఆశ్చర్యపోయి, ఆ తర్వాత మూల్యాంకన రన్నర్ రీజనింగ్ సందేశాలను తొలగించే సాధారణ హార్నెస్ను ఉపయోగిస్తోందని గుర్తించడం ఇదే మొదటిసారి కాదు.
మీరు పనితీరును గరిష్ఠ స్థాయికి తీసుకెళ్లాలనుకునే API డెవలపర్ అయితే, మా ఉత్పత్తుల్లో మేము అమలు చేసే సెట్టింగ్లనే ఉపయోగించాలని సిఫార్సు చేస్తున్నాం:
- మా పాత చాట్ కంప్లీషన్స్ APIకి బదులుగా Responses APIని ఉపయోగించండి
- రీజనింగ్ను నిల్వ ఉంచండి
- కాంపాక్షన్ను ఉపయోగించండి
మీరు మోడల్లను పోలుస్తుంటే, ChatGPT మరియు Codexలోని వాస్తవ వినియోగానికి అత్యంత దగ్గరగా ఉండే పై సెట్టింగ్లను ఉపయోగించే మూల్యాంకనాలపై ఆధారపడాలని సిఫార్సు చేస్తున్నాం.
AGI మూల్యాంకనంపై ఎన్నో ఏళ్లుగా సృజనాత్మకంగా కృషి చేసినందుకు, ఈ అంశాన్ని మరింత లోతుగా పరిశీలించడానికి మాకు స్ఫూర్తినిచ్చిన విశ్లేషణకు ARCకు కృతజ్ఞతలు.
అత్యాధునిక మోడల్లతో మీ సామర్థ్యాన్ని పరీక్షించుకోవాలనుకుంటే, arcprize.org/tasks(కొత్త విండోలో తెరుచుకుంటుంది)లోని పబ్లిక్ గేమ్లను మీరే ఆడి చూడండి.


