OpenAI

GPT-6 Astra: A new generation of intelligence

ఒక కొత్త తరం ఇంటెలిజెన్స్

22 సెప్టెంబర్, 2026న అప్‌డేట్: మేము GPT‑6 Sol మరియు GPT‑6 Lunaతో మా GPT‑6 కుటుంబాన్ని విస్తరిస్తున్నాం. మరింత తెలుసుకోండి.

ప్రపంచంలో అత్యంత మేధావంతమైన మరియు అత్యంత అలైనింగ్‌ చేసిన మోడల్ అయిన GPT‑6 Astraను మేం పరిచయం చేస్తున్నాం.

GPT‑6 Astra ప్రీ-ట్రైనింగ్, రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ మరియు సమలేఖనంలో ఏళ్ల పరిశోధనతో పాటు భారీ పందాలను సమీకరిస్తుంది. కంప్యూటర్ వినియోగం, బ్రౌజింగ్, సాఫ్ట్‌వేర్ ఇంజినీరింగ్, సైబర్ భద్రత, సైన్స్ మరియు ప్రొఫెషనల్ పనిలో Astra అత్యాధునిక స్థాయిలో ఉంది. Astra ఇప్పటికే గణితంలో దీర్ఘకాలంగా పరిష్కారం కాని ఓపెన్ సమస్యలను పరిష్కరించడంలో⁠ సహాయం చేసి, FrontierMath Tier 4లో 98% స్కోర్‌తో సాచురేట్ చేసింది. Astra కూడా ARC-AGI-3లో 99.9% స్కోర్‌ను, ExploitBenchలో 100% స్కోర్‌ను సాధిస్తుంది. సాటిలేని వేగం, ఖచ్చితత్వం, వివేచనతో అత్యంత డిమాండ్ ఉన్న ప్రొఫెషనల్ పనిని నిర్వహిస్తూ, కంప్యూటర్ మరియు బ్రౌజర్ వినియోగంలో కూడా ఇది కొత్త అత్యాధునిక ప్రమాణాన్ని నెలకొల్పుతుంది. 

GPT‑6 Astra ఈ రోజు పరిమిత సంఖ్యలో సంస్థలకు అందుబాటులోకి వస్తోంది. రాబోయే రోజుల్లో ఇది అన్ని ChatGPT Plus, Pro, Business మరియు Enterprise యూజర్లకు, అలాగే OpenAI API, Microsoft Azure మరియు AWS Bedrock ద్వారా అందుబాటులోకి వస్తుంది.

“ARC-AGI-3లో, 96% స్థాయిల్లో Astra మా మానవ చర్య-సామర్థ్య బేస్‌లైన్‌ను అధిగమించి, బెంచ్‌మార్క్‌లో ప్రభావవంతంగా మానవ స్థాయికి చేరుకుంది. మేము ఇప్పటివరకు పరీక్షించిన వాటిలో ఇది అత్యుత్తమ మోడల్ మాత్రమే కాదు, అత్యాధునిక-మోడల్ పనితీరులో అర్థవంతమైన స్థాయి మార్పును కూడా సూచిస్తుంది—కొత్త పరిసరాలను నావిగేట్ చేసి పరిష్కరించే సామర్థ్యంలోనే కాకుండా, అలా చేయడం ఎంత సమర్థవంతంగా నేర్చుకుంటుందనే విషయంలో కూడా.”
గ్రెగ్ కామ్రాడ్ట్, ARC ప్రైజ్ ఫౌండేషన్

Astra మా అత్యంత సమన్వయంతో ఉన్న మోడల్. యూజర్‌ ఉద్దేశాన్ని, మోడల్ ప్రవర్తనను అర్థం చేసుకోవడంలో ఇందులో గణనీయమైన మెరుగుదలలు ఉన్నాయి—Astra తీర్పుపై మరింత విశ్వాసంతో టాస్క్‌లను డెలిగేట్ చేయవచ్చు. దీన్ని పరీక్షించే విధానంగా, కష్టమైన లేదా అసాధ్యమైన టాస్క్‌ను ఎదుర్కొన్న మోడల్ తన ఉద్దేశించిన పరిధిని దాటుతుందా అని అంచనా వేసేలా Hugging Face ఘటన ఆధారంగా కొత్త మూల్యాంకనాన్ని రూపొందించాం. ఉత్పత్తి రక్షణలు లేకుండా అనుమతించిన లక్ష్యాన్ని 48% సందర్భాల్లో దాటిన GPT‑5.6 Solతో పోలిస్తే, GPT‑6 Astra ఇలా 0% సందర్భాల్లో చేసింది.

కంప్యూటర్ వినియోగం కోసం ప్రపంచంలోనే అత్యుత్తమ మోడల్

కంప్యూటర్ వినియోగం వేగం, ఖచ్చితత్వం, భద్రత పరంగా GPT‑6 Astra కొత్త అత్యాధునిక స్థాయిని సూచిస్తుంది. ఇది ఆన్‌లైన్ ఫారాలను నింపడం, CRMలో కస్టమర్ రికార్డులను అప్‌డేట్ చేయడం, మీ క్యాలెండర్‌ను నిర్వహించడం వంటి శ్రమతో కూడిన పనులను చూసుకోగలదు. ఇది ఆన్‌లైన్ పరిశోధన చేయగలదు మరియు మీ ఇమెయిల్‌లో లేదా మీ డాక్యుమెంట్ ఎడిటర్‌లో సారాంశాల ముసాయిదాలను రూపొందించగలదు. ఇది శాస్త్రీయ డేటాను విశ్లేషించగలదు, ప్లాట్‌లను రూపొందించగలదు, వెబ్‌సైట్‌ను సృష్టించగలదు, అలాగే ఆ సైట్‌లోని అన్ని ఫీచర్లు పనిచేస్తున్నాయని నిర్ధారించడానికి ఫ్రంట్‌ఎండ్ QA తనిఖీలను నిర్వహించగలదు. ఇది సాఫ్ట్‌వేర్‌ను స్వయంచాలకంగా ఇన్‌స్టాల్ చేసి పరీక్షించడానికి, అలాగే స్క్రీన్‌పై కనిపించే సమస్యలను పరిష్కరించడంలో మీకు సహాయపడుతుంది. ఈ మెరుగుదలలు మా అత్యాధునిక మూల్యాంకన ఫలితాల్లో కూడా ప్రతిబింబిస్తున్నాయి.

ఈ మెరుగుదలలు కూడా వాస్తవ జ్ఞాన పనుల్లో సామర్థ్యంలో గణనీయమైన మెరుగుదలలకు దారితీస్తాయి. OSWorld 2.0లో లేటెన్సీ సిమ్యులేషన్‌లలో, Astra GPT‑5.6 కంటే ఒక్కో టాస్క్‌కు దాదాపు 47% తక్కువ సమయంలో హై కంప్యూటర్-వినియోగ పనితీరును సాధిస్తుంది. Sol, సుమారు 75 నిమిషాల్లో సాధించిన 65.7% తో పోలిస్తే, ఒక్కో టాస్క్‌కు సుమారు 40 నిమిషాల్లో 72.6% స్కోర్ చేసింది.3

GPT‑6 Astra కంప్యూటర్‌ను ఉపయోగించే సామర్థ్యాలను గేమ్ డెవలప్‌మెంట్, ఎలక్ట్రికల్ ఇంజినీరింగ్, మరియు రోజువారీ జ్ఞానపరమైన పనితో సహా వివిధ రంగాల్లోని అవుట్‌పుట్‌లలో చూడవచ్చు:

Astraతో పాటు, కంప్యూటర్ వినియోగ వేగాన్ని గణనీయంగా మెరుగుపరచడానికి Codex హార్నెస్‌ను కూడా అప్‌డేట్ చేస్తున్నాం. Astra సామర్థ్యంతో కలిపి, Mind2Web బెంచ్‌మార్క్‌లో ప్రస్తుత GPT‑5.6 Sol అనుభవంతో పోలిస్తే ఇది టాస్క్‌ను 1.9 రెట్లు వేగంగా పూర్తి చేయడానికి దారితీస్తుంది. మోడల్ వేగంలో మెరుగుదలల వల్ల, నువ్వు చేయగలిగిన దానికంటే వేగంగా ఇది నీ కోసం జీవితంలోని సమయం తీసుకునే అనేక పనులను చేపట్టగలదు.4

“లాంచ్ రోజున మేం GPT‑6 Astraను Devin హార్నెస్‌లో ఏకీకృతం చేస్తున్నాం, అక్కడ అది మా అంతర్గత టెస్టింగ్ బెంచ్‌మార్క్‌పై అత్యాధునిక పనితీరును అందిస్తుంది. దాని అద్భుతమైన కంప్యూటర్ వినియోగం, రచనా సామర్థ్యం, మరియు కోడ్‌బేస్‌పై అవగాహన పరీక్షలను ప్రారంభం నుంచే మెరుగుపరిచాయి: వీడియోలను అనుసరించడం గణనీయంగా సులభమైంది, మరియు నివేదికలు మరింత స్పష్టంగా, సంక్షిప్తంగా ఉన్నాయి”
సైలస్ అల్బెర్టి, SVP రీసెర్చ్, కాగ్నిషన్

వృత్తిపరమైన పనిలో గణనీయమైన మార్పు

GPT‑6 Astra సంక్లిష్టమైన పనులను పరిష్కరించడంలో సహాయపడేందుకు, వృత్తిపరమైన పరిసరాల కోసం లక్షిత శిక్షణతో కంప్యూటర్ వినియోగంలోని పురోగతులను సమ్మిళితం చేస్తుంది. ఇది సంక్లిష్ట సమస్యలకు అవసరమైన ఇంటెలిజెన్స్‌ను, బహుళ-దశల కార్యప్రవాహాలను నిర్వహించి చక్కగా రూపొందించిన డాక్యుమెంట్‌లు, స్ప్రెడ్‌షీట్‌లు, మరియు ప్రజెంటేషన్‌లను తయారు చేసే సామర్థ్యంతో కలిపిస్తుంది.

GPT‑6 Astra అనేది ఇప్పటికే ఉన్న టెంప్లెట్‌లను అనుసరించడం, చక్కగా అమర్చబడిన స్లైడ్‌లను రూపొందించడం, అలాగే నిర్మాణాత్మక కథనంతో ముఖ్యాంశాలను సంక్షిప్తంగా తెలియజేయడం కోసం మా అత్యుత్తమ మోడల్. ఇది మీ టెంప్లెట్‌లను అనుసరించి, మీ రచనా మరియు దృశ్య శైలికి సరిపోలే స్పష్టమైన, చక్కగా నిర్మితమైన పత్రాలు, ప్రజెంటేషన్‌లు, స్ప్రెడ్‌షీట్‌లు మరియు విశ్లేషణలను సృష్టిస్తుంది. Astra చేతిలో ఉన్న పనికి అవసరం లేని సమాచారాన్ని పునరావృతం చేయకుండా, అవుట్‌పుట్‌లలో అవసరమైన సందర్భాన్ని మాత్రమే ప్రత్యేకంగా తీసుకురావడానికి కూడా శిక్షణ పొందింది. ఇవన్నీ అంటే, మీ వ్యాపార సందర్భం మరియు ప్రమాణాలకు సరిపోయే, వెంటనే ఉపయోగించగల మరిన్ని ఆర్టిఫాక్ట్‌లను ఇది అవుట్‌పుట్ చేయగలదని అర్థం.

GPT‑6 Astra కూడా తాను రూపొందించే వెబ్‌సైట్‌లు, గేమ్‌లు, అప్లికేషన్‌లు మరియు రెండరింగ్‌లకు మరింత బలమైన దృశ్యపరమైన నిర్ణయ సామర్థ్యాన్ని తీసుకువస్తుంది. ChatGPTలోని Sites⁠(కొత్త విండోలో తెరుచుకుంటుంది) తో, Astra ప్రాంప్ట్ నుంచే వెబ్‌సైట్‌లు, వెబ్ యాప్‌లు మరియు గేమ్‌లను సృష్టించగలదు, హోస్ట్ చేయగలదు మరియు షేర్ చేయగలదు.

“Astra మాకు సామర్థ్యం మరియు సమర్థత రెండింటిలోనూ గణనీయమైన ఆధిక్యాన్ని ఇస్తుంది. మేం పరీక్షించిన ఇతర మోడల్‌ల కంటే గరిష్ఠంగా 20% తక్కువ టోకెన్‌లను ఉపయోగిస్తూ, ఇది మా అత్యంత సంక్లిష్టమైన సృజనాత్మక వర్క్‌ఫ్లోలను విజయవంతంగా అమలు చేస్తుంది. అత్యంత ముఖ్యంగా, మా కస్టమర్‌లకు, దీని అర్థం మరింత నాణ్యమైన అవుట్‌పుట్.”
అలెక్స్ మష్రబోవ్, CEO మరియు సహ-వ్యవస్థాపకుడు, Higgsfield AI

సూచనల్లో వ్యాఖ్యానానికి అవకాశం ఉన్నప్పుడు, సరైన నిర్ణయం తీసుకోవడంలో GPT‑6 Astra మునుపటి మోడళ్ల కంటే మెరుగ్గా ఉంటుంది. ఇది సాధారణ లోటులను పూరించడానికి సందర్భాన్ని ఉపయోగిస్తుంది మరియు సమాధానం ఫలితాన్ని మార్చగలిగే అవకాశం ఉన్నప్పుడు కేంద్రీకృత ప్రశ్నలను అడుగుతుంది. Codexలో, మీ ప్రత్యుత్తరంపై ఆధారపడని పనిని కొనసాగిస్తూనే ఇది అసింక్రోనస్‌గా అడగగలదు. మీరు స్పందించకపోతే, ఇది తగిన చోట సమంజసమైన అంచనాలతో ముందుకు సాగుతుంది, కానీ పర్యవసానాలకు దారితీసే నిర్ణయాల విషయంలో మీ ఇన్‌పుట్ కోసం నిరీక్షిస్తుంది.

సమాచారం లోపించడం వల్ల సమాధానం గణనీయంగా మారే అవకాశం ఉన్న రోజువారీ పనులలో Astra ఎలా సహకరిస్తుందో క్రింది ఉదాహరణలు చూపిస్తాయి.

పని మారుతూ ముందుకు సాగుతున్నప్పుడు దాని దిశపై అవగాహనను కొనసాగించడంలో కూడా Astra మెరుగ్గా ఉంటుంది. మునుపటి మోడల్స్ కొన్నిసార్లు దిశానిర్దేశ సందేశాలను కొత్త లక్ష్యంగా పరిగణించి, అసలు అభ్యర్థనను లేదా మునుపటి పరిమితులను కోల్పోయేవి. Astra కొత్త అవసరాలను కలుపుకుంటుంది, అడిగినప్పుడు దిశ మార్చుకుంటుంది, అలాగే విస్తృతమైన పనిని వదిలిపెట్టకుండా పక్క ప్రశ్నలకు సమాధానం ఇస్తుంది.

“సంక్లిష్ట లీగల్ టాస్క్‌లలో GPT‑5.6 Solతో పోలిస్తే Astra గణనీయమైన నాణ్యత మెరుగుదలను అందిస్తుంది. మా ప్రారంభ పరీక్షల్లో, ఆస్ట్రా సూక్ష్మంగా పరిశీలించే న్యాయవాది వ్యవహరించే విధంగా న్యాయపరమైన పనిని చేపట్టడం ద్వారా ప్రత్యేకంగా నిలిచింది: అది పత్రాలను స్థాపిత రికార్డుల నుండి వేరు చేస్తుంది, ఆధారంలేని ఊహలను వెలికితీస్తుంది, అలాగే ఖాళీలను స్పష్టమైన ముసాయిదా వైఖరులుగా మారుస్తుంది.”
Niko Grupen, అప్లైడ్ రీసెర్చ్ హెడ్, Harvey

కోడింగ్

GPT‑6 Astra ఇప్పటివరకు సాఫ్ట్‌వేర్ ఇంజినీరింగ్ కోసం అత్యుత్తమ మోడల్.

2లో 1
“GPT‑6 Astra మా అంతర్గత కోడింగ్ బెంచ్‌మార్క్‌లలో స్టేట్-ఆఫ్-ది-ఆర్ట్ పనితీరును అందిస్తుంది మరియు GPT‑5.6 Solతో పోలిస్తే ట్రేడింగ్ అంతర్‌దృష్టి మూల్యాంకనాల్లో స్పష్టమైన పురోగతిని చూపిస్తుంది. ఏజెంటిక్ కోడింగ్ కోసం ఉపయోగించినప్పుడు, GPT‑6 Astra డెవలపర్‌లు సులభంగా అనుసరించగలిగే విధంగా కమ్యూనికేట్ చేస్తుంది మరియు ప్రొడక్షన్ నాణ్యతను చేరుకోవడానికి తక్కువ పునరావృతం అవసరమయ్యే కోడ్‌ను రూపొందిస్తుంది.”
John Crepezzi, AI Assistants, Jane Street

Astraతో, కాంటెక్ట్స్‌ విండో నిండినప్పుడు కాంటెక్ట్స్‌‌ను భద్రపరచడానికి మరియు తిరిగి పొందడానికి మేం Codex కోసం ఒక కొత్త మార్గాన్ని పరిచయం చేస్తున్నాం. చారిత్రకంగా, క్లిష్టమైన సమస్యలను డీబగ్ చేయడం లేదా పెద్ద రీఫాక్టర్‌లను చేపట్టడం వంటి దీర్ఘ సెషన్‌లలో పనిని సంగ్రహించడానికి మోడల్స్ కాంపాక్షన్‌ను ఉపయోగించాయి. ప్రతి కాంపాక్షన్ పరిష్కారం ఎందుకు విఫలమైందో లేదా కాంపోనెంట్ ఎలా ప్రవర్తిస్తుందో తెలిపే వివరాలను వదిలివేయవచ్చు. Codexలో, Astra కాంటెక్ట్స్‌ విండోల అంతటా నోట్స్‌ను ఉంచగలదు, సేకరించిన వివరాలను ఒకే సంగ్రహంగా పదేపదే కుదించకుండా వాటిని నిలుపుకుంటుంది. ముందున్న కాంటెక్ట్స్‌ విండోలు శోధించగలిగేవిగా ఉంటాయి, కాబట్టి ఆ సమాచారం దాని నోట్స్‌లో నమోదు కాకపోయినా, Astra మునుపటి మెసేజ్‌లు మరియు టూల్ అవుట్‌పుట్‌ల నుండి అవసరాలు లేదా టెస్ట్ ఫలితాలను కనుగొనగలదు. మీరు ఈ ప్రయోగాత్మక ఫీచర్‌ను మీ Codex config.tomlలో,⁠(కొత్త విండోలో తెరుచుకుంటుంది) ప్రారంభించవచ్చు, మరియు రాబోయే వారాల్లో అది Astra కోసం డిఫాల్ట్‌గా మారుతుంది.

శాస్త్రీయ ఆవిష్కరణను ముందుకు తీసుకెళ్లడం

“కథ ఇదే: ఒక యుగానికి ముగింపు, మరో యుగానికి ఆరంభం.”
గ్రెగ్ బర్న్‌హామ్, EpochAI

GPT‑6 Astra శాస్త్రీయ ఆవిష్కరణ, గణితం మరియు ఆరోగ్యంలో ప్రధాన పురోగతి. ఈరోజు, అభాజ్య సంఖ్యల మధ్య అంతరాలపై ఇంకా రెండు ఫలితాలను మేం పంచుకుంటున్నాము.9, 10

Astra గణితం మరియు శాస్త్ర సంబంధిత మూల్యాంకనాల సూట్‌లో కూడా కొత్త రికార్డులను నెలకొల్పింది.

శాస్త్రీయ ఆవిష్కరణ వెనుక ఉన్న ప్రాయోగిక పనిలో Astra సహాయపడగలదు. శాస్త్రీయ రీజనింగ్‌ను కంప్యూటర్ వినియోగంతో కలపడం ద్వారా, డేటాను పరిశీలించడానికి మరియు ఫలితాలను అన్వేషించడానికి ఇది ప్రత్యేక సాఫ్ట్‌వేర్‌లో నేరుగా పని చేయగలదు. తద్వారా పరిశోధకులు ఆధారాలను అంచనా వేసి, తర్వాత ఏమి పరిశోధించాలో నిర్ణయించడంలో సహాయపడుతుంది.

సైబర్ భద్రత

మా భద్రతా నవీకరణ⁠లో మేం చర్చించినట్లుగా, Astra సైబర్ సామర్థ్యాల్లో గణనీయమైన ముందడుగు వేసింది మరియు మా క్రిటికల్ థ్రెషోల్డ్ ను సైబర్‌సెక్యూరిటీలో మా ప్రిపేర్‌డ్నెస్ ఫ్రేమ్‌వర్క్ కింద చేరుకుంది. జీరో-డే ఎక్స్‌ప్లోయిట్‌లను గుర్తించి అభివృద్ధి చేసే దాని సామర్థ్యం, రక్షకులు బలహీనతలను కనుగొని ప్యాచ్ చేయడానికి సహాయపడగలదు, అయితే ఇది మరింత బలమైన రక్షణ చర్యల అవసరాన్ని కూడా సృష్టిస్తుంది. ఈ సామర్థ్యాలు ఎంతవరకు విస్తరించాయో అర్థం చేసుకోవడానికి, మేము Astraను ఇంటర్నల్‌ మరియు థర్డ్ పార్టీ నిపుణుల మూల్యాంకనాల్లో అమలు చేశాము.

ముందుగా, తెలిసిన సాఫ్ట్‌వేర్ దుర్బలతలను పనిచేసే ఎక్స్‌ప్లాయిట్‌లుగా మోడల్‌లు మార్చగలవా లేదా అని అంచనా వేసే ExploitBench మరియు ExploitGymలో, ప్రొడక్షన్ భద్రతా రక్షణలు లేకుండా మోడల్‌ను పరీక్షించాం. ExploitBenchలో, మా మునుపటి అత్యాధునిక సైబర్ సామర్థ్యమున్న మోడల్ అయిన GPT‑5.6 Sol సాధించిన 78.5%తో పోలిస్తే, Astra 100% సంపూర్ణ స్కోర్ సాధించింది. ExploitGymలో, గణనీయంగా తక్కువ అవుట్‌పుట్ టోకెన్‌లను ఉపయోగిస్తూనే Astra 42.4% విజయ రేటును సాధించింది, కాగా GPT‑5.6 Sol 30.3% సాధించింది.13

చారిత్రక సాఫ్ట్‌వేర్ దుర్బలతలకు గురికావడం బెంచ్‌మార్క్ ఫలితాలను ప్రభావితం చేసి ఉండవచ్చనే ఆందోళనలను దృష్టిలో ఉంచుకుని, మేం Astraను రెండు కొత్త బెంచ్‌మార్క్‌లపై కూడా మూల్యాంకనం చేశాం. మొదటగా, గత మూడు నెలల దుర్బలతలను ఉపయోగించి ఎక్స్‌ప్లాయిట్ అభివృద్ధిని పరీక్షించడానికి మేం అంతర్గత “ExploitBench (June–August 2026)” మూల్యాంకనాన్ని రూపొందించాము.14 Astra GPT‑5.6 కంటే గణనీయంగా హై ఇష్టానుసార కోడ్-అమలు రేట్లను సాధించింది ఈ డేటాసెట్‌లో Sol చాలా తక్కువ అవుట్‌పుట్ టోకెన్‌లను ఉపయోగిస్తూ. మూల్యాంకనం సమయంలో, Astra ఇంతకు ముందు తెలియని రెండు జీరో-డే దుర్బలతలను కూడా గుర్తించి ఉపయోగించింది. మేం ఈ రెండు భద్రతా దుర్బలతలను సంబంధిత నిర్వహణకర్తలకు వెల్లడిస్తున్నాం.

బైనరీ సాఫ్ట్‌వేర్‌ను రివర్స్ ఇంజినీర్ చేసి, రా సోర్స్ కోడ్‌కు యాక్సెస్ లేకుండానే దాని ప్రధాన లాజిక్‌ను అర్థం చేసుకోగలరో లేదో మోడల్‌లు కొలిచే బెంచ్‌మార్క్ అయిన SRE-Bench15లో కూడా మేం Astraను పరీక్షించాం. Astra ఒకే ప్రయత్నంలో 88.0% టాస్క్‌లను, నాలుగు ప్రయత్నాల్లో 99.2% టాస్క్‌లను పరిష్కరించింది; దీనితో పోలిస్తే GPT‑5.6 Sol వరుసగా 55.9% మరియు 68.7% సాధించింది.

బెంచ్‌మార్క్‌లకు మించి, నిపుణుల ఆధ్వర్యంలో చేసిన అంచనాలు Astraను ప్రొడక్షన్ సేఫ్‌గార్డ్‌లు లేకుండా రన్ చేసినప్పుడు, అది పటిష్ఠమైన బ్రౌజర్‌లలో ఇష్టానుసార కోడ్ అమలును సాధించడానికి ఇంతకుముందు తెలియని దుర్బలతలను ఉపయోగించగలదని, అలాగే పటిష్ఠమైన నిర్వహణ వ్యవస్థల కోసం అధికార విస్తరణ దుర్వినియోగాలను సృష్టించగలదని కనుగొన్నాయి.

The Defender’s Windowలో మేం చర్చించినట్లుగా, అత్యాధునిక సైబర్ సామర్థ్యాలు రక్షకులు బలహీనతలను వేగంగా కనుగొనడంలో సాయపడతాయి, కానీ అవి ఆ బలహీనతలను దోపిడీ చేయడాన్ని కూడా సులభతరం చేస్తాయి, దీనివల్ల రక్షకులు అనుగుణంగా మారాల్సిన ఆవశ్యకత పెరుగుతుంది. ఈరోజు విడుదలవుతున్న Astra సంస్కరణతో, రక్షకులు సురక్షిత కోడ్ సమీక్ష మరియు ప్యాచింగ్ వంటి పనులను పూర్తి చేయడానికి దీన్ని ఉపయోగించవచ్చు.

అయితే, దుర్బలతల కోసం ప్రూఫ్-ఆఫ్-కాన్సెప్ట్ ఎక్స్‌ప్లోయిట్‌లను సృష్టించడం వంటి మరింత అధునాతన సైబర్ భద్రతా పనులను చేయడానికి Astra నిరాకరిస్తుంది. OpenAI Daybreak⁠ ద్వారా, రాబోయే వారాల్లో ప్రాప్యతను విస్తరించి, తక్కువ పరిమితులతో కూడిన భద్రతా చర్యలను అందుబాటులోకి తీసుకురావాలని మేం ప్రణాళిక చేస్తున్నాము. ఇది దుర్బలత మరియు ప్రూఫ్-ఆఫ్-కాన్సెప్ట్ ధృవీకరణ, మాల్వేర్ విశ్లేషణ, మరియు డిటెక్షన్ ఇంజినీరింగ్ సహా మరిన్ని రక్షణాత్మక వర్క్‌ఫ్లోలను ప్రారంభిస్తుంది.

GPT‑5.6 Sol కోసం మా రక్షణల స్టాక్‌పై ఆధారపడి, సంభావ్య సైబర్ దుర్వినియోగం నుంచి మా రక్షణలను కూడా బలోపేతం చేశాం. సంభావ్య జైల్‌బ్రేక్‌లను మెరుగ్గా తట్టుకోవడానికి మరింత బలమైన మోడల్ పటిష్ఠత, మా పర్యవేక్షణ వ్యవస్థలకు మరింత సందర్భ సమాచారం ఇందులో ఉన్నాయి. మా అంతర్గత రెడ్ టీమింగ్ దాడిదారులతో ఆటోమేటెడ్ మూల్యాంకనాలతో సహా, కఠినమైన అంతర్గత మరియు బాహ్య పరీక్షలను మేం కొనసాగించాం. మా సైబర్ రక్షణలు మరియు పరీక్షల గురించి మరిన్ని వివరాలు Astra భద్రతా అవలోకనం⁠ మరియు సిస్టమ్ కార్డ్⁠(కొత్త విండోలో తెరుచుకుంటుంది)లో అందుబాటులో ఉన్నాయి..

GPT‑6 Astraను బాధ్యతాయుతంగా అలైనింగ్‌ చేయడం, అమలు చేయడం

Astra మా అత్యంత అలైన్‌డ్ మోడల్. Astra జాగ్రత్తగా వ్యవహరించడం, పని పరిమితులను గౌరవించడం మరియు పారదర్శకంగా కమ్యూనికేట్ చేయడంలో అత్యుత్తమంగా ఉంటుంది. ప్రారంభం నుంచి ముగింపు వరకు మానవ ఉద్దేశానికి అనుగుణంగా ఉండేలా మోడళ్లకు శిక్షణ ఇవ్వడంపై దృష్టి సారించిన మా దీర్ఘకాలిక పరిశోధన కార్యక్రమం నుంచి వచ్చిన తాజా ఫలితం ఈ పని.

సున్నితమైన వాతావరణాల్లో, Astra అందులోని ప్రమాద స్థాయికి అనుగుణమైన జాగ్రత్తతో ముందుకు సాగుతుంది. తప్పు ప్రవర్తనను ప్రేరేపించేలా ప్రతిద్వంద్వంగా ఎంపిక చేసిన కంప్యూటర్ వినియోగ పనుల మూల్యాంకనంలో, అనుద్దేశిత పరిణామాలను నివారించడంలో Astra మరింత విజయవంతమైంది. డిఫాల్ట్‌గా అందించే అదనపు భద్రతా చర్యలతో అమలు చేయడం మరింత బలమైన పనితీరును అందించింది.

పరీక్షించిన ఇతర ఏ అత్యాధునిక మోడల్‌లకన్నా Astra తక్కువ లక్ష్యవిరుద్ధ ఫలితాలకు కారణమవుతుంది. నిష్పక్షపాత పోలిక కోసం, మేము సాధారణ కంప్యూటర్-యూజింగ్ ఏజెంట్ హార్నెస్‌ను ఉపయోగించాము (ఇది OpenAI Responses API⁠(కొత్త విండోలో తెరుచుకుంటుంది) మరియు Anthropic Messages API⁠(కొత్త విండోలో తెరుచుకుంటుంది) రెండింటిలో అందుబాటులో ఉన్న నేటివ్ కంప్యూటర్ వినియోగ టూల్స్‌పై ఆధారపడింది) మరియు Codex, ChatGPT వర్క్ వినియోగదారుల కోసం సాధారణంగా అమలు చేసే అదనపు రక్షణలు (ఆటో-రివ్యూ, కన్ఫర్మేషన్ పాలసీ) లేకుండా ఉపయోగించాము.

Astra వినియోగదారు నిర్దేశించిన మరియు దాని పరిసరాల ద్వారా పరోక్షంగా సూచించబడిన పరిమితుల పరిధిలో పనిచేసే అవకాశం కూడా ఎక్కువగా ఉంది. ఒక అంతర్గత మూల్యాంకనంలో, Codex Auto-Review తిరస్కరణను తప్పించుకోవడానికి Astra ఎప్పుడూ ప్రయత్నించలేదు. ఆటో-రివ్యూను ఉద్దేశపూర్వకంగా తప్పించుకోగలిగేలా కాన్ఫిగర్ చేసినప్పటికీ, వేరే విధంగా ఆ పనిని పూర్తి చేయడం అసాధ్యమైనప్పటికీ కూడా ఇదే వర్తించింది. పర్యావరణ పరిమితుల పట్ల ఈ గౌరవం, ఈ పోస్ట్ పరిచయంలో మేం పంచుకున్న అసాధ్యమైన సైబర్ టాస్క్ మూల్యాంకన ఫలితాలతోనూ, మా సిస్టమ్ కార్డ్⁠(కొత్త విండోలో తెరుచుకుంటుంది)లో నమోదు చేసిన ఇతర నిర్ధారణలతోనూ స్థిరంగా ఉంది.

అదనంగా, పారదర్శక వినియోగదారు కమ్యూనికేషన్‌లో Astra కొత్త ప్రమాణాలను నెలకొల్పుతుంది. ఒక మూల్యాంకనంలో, GPT‑5.6 కంటే Astraకు మూడు రెట్లు తక్కువ అవకాశం ఉంది Sol తన సామర్థ్యాలు మరియు అందుబాటులో ఉన్న సౌకర్యాల గురించి సరికాని వివరణలు ఇవ్వడానికి.

మా సామర్థ్య-హాలూసినేషన్ మూల్యాంకనంలో, Astra తన సామర్థ్యాల గురించి తక్కువ తప్పుదోవ పట్టించే వాదనలు చేస్తూ, GPT‑5.6 Sol కంటే గణనీయమైన మెరుగుదలని చూపిస్తుంది.

మా మూల్యాంకనాల్లో Astra యొక్క వ్రాతపూర్వక రీజనింగ్‌ను GPT‑5.6 కంటే పర్యవేక్షించడం కష్టమని తేలింది Solది, పర్యవేక్షణను తప్పించుకోవాలని దానిని స్పష్టంగా కోరిన పరీక్షల ఆధారంగా. సరళమైన పనుల్లో రాతపూర్వక రీజనింగ్‌పై Astraకు ఎక్కువ నియంత్రణ ఉండటం, తక్కువ రాత దశలతో సమస్యలను పరిష్కరించగల సామర్థ్యం ఉండటం దీనికి కారణమని మేము భావిస్తున్నాం. క్లిష్టమైన పనులకు అవసరమైన రీజనింగ్‌ను దాచడంలో Astra ఇంకా ఇబ్బంది పడుతున్నట్లు కనిపిస్తున్నప్పటికీ, ఈ తగ్గుదలను మేము గంభీరంగా తీసుకుంటున్నాం. పర్యవేక్షణ సామర్థ్యాన్ని మెరుగుపరచడం పరిశోధనలో ప్రాధాన్యతగా కొనసాగుతోంది, అలాగే అనుబంధ సిస్టమ్ కార్డ్⁠(కొత్త విండోలో తెరుచుకుంటుంది) మా కనుగొన్న విషయాలు మరియు కొనసాగుతున్న పనిని వివరిస్తుంది.

అలైన్‌మెంట్ శిక్షణ మా డిప్లాయ్‌మెంట్ విధానానికి ప్రధానమైనది. అదనపు రక్షణ పొరగా, అసురక్షిత ప్రవర్తనను గుర్తించి అదుపు చేయడంలో సహాయపడేందుకు Codex ఆటో-రివ్యూ⁠(కొత్త విండోలో తెరుచుకుంటుంది), ఏజెంట్‌ల రీజనింగ్ మరియు చర్యల పర్యవేక్షణ వంటి సిస్టమ్ రక్షణ చర్యలను కూడా రూపొందిస్తున్నాం. మా భద్రతా నవీకరణలో⁠ వివరించినట్లుగా, లక్ష్యవిరుద్ధతపై అవగాహన పొందడానికి మరియు దాని అత్యంత తీవ్రమైన సందర్భాలను అదుపు చేయడంలో సహాయపడేందుకు Astra తరగతి మోడల్‌ల కోసం ఉత్పత్తి వాతావరణంలో లక్ష్యవిరుద్ధత పర్యవేక్షణను కూడా అమలు చేస్తున్నాం. ఈ రక్షణ చర్యలు మా అంతర్గత అమలుల పర్యవేక్షణను పోలి ఉంటాయి. మోడల్ రీజనింగ్, చర్యల్లో అనధికార ప్రవర్తన ఉందా అని పరిశీలించి, సంభావ్య అనధికార కార్యకలాపాన్ని స్వయంచాలకంగా ఆపే వర్గీకరణ వ్యవస్థ ఇందులో ఉంటుంది.

ఆస్ట్రా యొక్క సైబర్‌సెక్యూరిటీ సామర్థ్యాల్లో గణనీయమైన పెరుగుదలను దృష్టిలో ఉంచుకుని, ఈ డిప్లాయ్‌మెంట్‌ను సురక్షితంగా మరియు భద్రంగా చేయడానికి మేము ప్రత్యేక జాగ్రత్తలు తీసుకుంటున్నాము. అదనపు భద్రతా తనిఖీలు కొన్నిసార్లు రక్షణాత్మక సైబర్ భద్రతతో సహా చట్టబద్ధమైన పనిని నెమ్మదింపజేయవచ్చు, తాత్కాలికంగా నిలిపివేయవచ్చు లేదా ఆపివేయవచ్చు. ChatGPT లేదా Codexలో టాస్క్ పాజ్ అయితే, కొనసాగించే ముందు చర్యను సమీక్షించమని మిమ్మల్ని అడగవచ్చు. APIలో, టాస్క్ ఆగిపోతుంది. ఈ తనిఖీలు కొన్నిసార్లు సక్రమమైన పనికి అంతరాయం కలిగించవచ్చు, మరియు అనవసర అంతరాయాలను తగ్గించడానికి మేం ఈ వ్యవస్థను నిరంతరం మెరుగుపరుస్తూనే ఉన్నాము. లక్ష్యవ్యతిరేకత పర్యవేక్షణ లక్ష్యానుసరణకు ప్రత్యామ్నాయం కాదు: మోడల్‌లు తమకు అనుమతించిన పరిధిలో విశ్వసనీయంగా ఉండేలా రూపొందించడమే మా లక్ష్యం, తద్వారా ఈ రక్షణలు జోక్యం చేసుకోవాల్సిన అవసరం ఉండదు.

లభ్యత

GPT‑6 Astra ఈ రోజు పరిమిత సంఖ్యలో సంస్థలకు అందుబాటులోకి వస్తోంది. రాబోయే రోజుల్లో ఇది అన్ని ChatGPT Plus, Pro, Business మరియు Enterprise యూజర్లకు, అలాగే OpenAI API, Microsoft Azure మరియు AWS Bedrock ద్వారా అందుబాటులోకి వస్తుంది. Astra వినియోగం ప్రస్తుత సబ్‌స్క్రిప్షన్ అలవెన్స్‌లలో చేర్చబడింది—యూజర్‌లు మరియు వ్యాపారాలు అదనపు వినియోగం కోసం క్రెడిట్స్‌ను కూడా కొనుగోలు చేయగలరు. Pro, Business మరియు Enterprise ప్లాన్‌లలోని యూజర్లకు GPT‑6 Astra Pro యాక్సెస్ కూడా లభిస్తుంది. Enterprise అడ్మినిస్ట్రేటర్‌లు తమ వర్క్‌స్పేస్ కోసం Astraను ప్రారంభించవచ్చు; ప్రారంభ సమయంలో యాక్సెస్ డిఫాల్ట్‌గా ఆఫ్‌లో ఉంటుంది.

అర్హులైన API యూజర్‌ల కోసం Astra జీరో డేటా రిటెన్షన్‌కు మద్దతు ఇస్తుంది. అలాగే, గత నెలలో మేం పంచుకున్నట్లుగా, కస్టమర్ గోప్యతను కాపాడుతూ భద్రతా పర్యవేక్షణను బలోపేతం చేయడానికి ప్రైవేట్ భద్రతా ప్రాసెసింగ్ ను పరీక్షిస్తున్నాం.

డెవలపర్‌ల కోసం, GPT‑6 Astra OpenAI APIలో gpt-6-astra గా మరియు Microsoft Azure మరియు Amazon Bedrock ద్వారా లభ్యమవుతుంది.

OpenAI API స్టాండర్డ్ ధర ప్రతి మిలియన్ ఇన్‌పుట్ టోకెన్లకు $10 మరియు ప్రతి మిలియన్ అవుట్‌పుట్ టోకెన్లకు $50. క్యాష్ రీడ్‌లు మరియు రైట్‌లకు వేర్వేరు రేట్లు వర్తిస్తాయి. APIలో GPT‑6 Astra కోసం వేగవంతమైన మోడ్ లభ్యమవుతోంది మరియు స్టాండర్డ్ ధరకు 2x చెల్లించి, స్టాండర్డ్ ప్రాసెసింగ్ వేగానికి గరిష్ఠంగా 2x వేగాన్ని అందిస్తుంది.

కంప్యూటర్ వినియోగం

కంప్యూటర్ వినియోగం

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

ఏజెంట్ల చివరి పరీక్ష

59.3%

53.60%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, ఆఫ్‌లైన్ సెట్, పాక్షిక స్కోర్)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (టూల్స్ లేవు)

92.7%

76.9%

-

87.3%17

-

-

ప్రొఫెషనల్

ప్రొఫెషనల్

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

ఓపెన్‌స్కోర్ స్ట్రింగ్ క్వార్టెట్లు (1 - OMR-NED)

0.84

0.19

-

-

-

-

అంతర్గత డిజైన్ పనులు

50.0%

47.4%

-

35.8%

-

-

ఇంటర్నల్ డేటా సైన్స్ టాస్క్‌లు

40.9%

30.5%

-

34.7%

-

-

ఆర్టిఫిషియల్ అనాలిసిస్ ఇంటెలిజెన్స్ ఇండెక్స్ v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

కోడింగ్

కోడింగ్GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (స్కోరు)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 ప్రధాన (స్కోరు)53.3% 847.5%50.9%53.5%53.4%43.6%
అంతర్గత డేటాబేస్ మైగ్రేషన్ పనులు63.9%42.7%57.8%50.3%--
ఆర్టిఫిషియల్ అనాలిసిస్ కోడింగ్ ఏజెంట్ ఇండెక్స్ v1.467.065.1-67.268.161.2

అకాడెమిక్

అకాడెమిక్

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench సైన్స్ 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

ఫ్రంటియర్‌మ్యాత్ టియర్ 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

"GPQA డైమండ్"

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity’s Last Exam (సాధనాలతో)

57.2%

-

65.0%

63.8%

63.6%

-

విజ్ఞానం మరియు హెల్త్

విజ్ఞానం మరియు ChatGPT HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (అంతర్గత)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench ప్రొఫెషనల్ (పొడవుకు సర్దుబాటు చేసిన)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

సైబర్ భద్రత

సైబర్‌సెక్యూరిటీGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (జూన్-ఆగస్టు 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

అలైన్‌మెంట్

అలైన్‌మెంట్

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

అంతర్గత కంప్యూటర్ వినియోగ భద్రతా బెంచ్‌మార్క్ (తక్కువైతే మంచిది)

2.4%

22.0%

9.5%

18.3%

11.5%

-

అంతర్గత కంప్యూటర్ వినియోగ భద్రతా బెంచ్‌మార్క్, AutoReviewతో (తక్కువగా ఉంటే మంచిది)

1.8%

4.3%

-

-

-

-

అంతర్గత సర్కమ్‌వెన్షన్ బెంచ్‌మార్క్ (తక్కువగా ఉంటే మంచిది)

0.00%

0.29%

-

-

-

-

ExploitGym హనీపాట్ (తక్కువగా ఉంటే మంచిది)

0.0%

48.2%

-

-

-

-

అసాధ్యమైన ExploitGym

100.0%

-

-

-

-

-

అంతర్గత హాల్యూసినేషన్ బెంచ్‌మార్క్ (తక్కువైతే మంచిది)

4.2%

12.2%

-

-

-

-

లాంగ్ కాంటెక్ట్స్‌

లాంగ్ కాంటెక్ట్స్‌

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

సారాంశాత్మక రిజనింగ్

అమూర్త రీజనింగ్GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

ఏ ప్రయత్న స్థాయిలోనైనా మూల్యాంకన స్కోర్లు గరిష్ఠంగా ఉంటాయి. GPT మూల్యాంకనాలు మా పరిశోధనా వాతావరణంలో లేదా మా API ద్వారా నిర్వహించబడ్డాయి. సిస్టమ్ ప్రాంప్ట్‌లు, అందుబాటులో ఉన్న టూల్స్ మొదలైన వాటిలోని తేడాల కారణంగా వీటి అవుట్‌పుట్ ప్రొడక్షన్ ChatGPT కంటే కొంచెం భిన్నంగా ఉండవచ్చు.

పాదటిప్పణులు

  1. 1

    ARC-AGI-3లో, GPT-6 Astraను మా responses API హార్నెస్⁠తో రన్ చేశాం, ఇది వాస్తవ ప్రపంచ పనితీరుకు మెరుగ్గా సరిపోలేలా రెండు సెట్టింగ్‌లను మారుస్తుంది. ఈ మార్పులు ప్రత్యేకంగా ARC-AGI-3ను లక్ష్యంగా చేసుకోవు.

  2. 2

    GPT-5.6 Sol అనేది మా API, ChatGPT Codex మరియు ChatGPT వర్క్‌లో అందుబాటులో ఉన్న వెర్షన్‌ను సూచిస్తుంది. ChatGPT చాట్‌లోని వెర్షన్ కొద్దిగా భిన్నంగా ఉంటుంది.⁠

  3. 3

    OSWorld V2-Offline అనేది ఇంటర్నెట్ యాక్సెస్ లేకుండానే పనిచేసే అసలు OSWorld V2 యొక్క ఉపసమితి. OSWorld-V2 Offlineలో Claude మోడల్ పనితీరును రచయితలు అధికారిక లీడర్‌బోర్డ్‌లో⁠(కొత్త విండోలో తెరుచుకుంటుంది) పునరుత్పత్తి చేశారు. OSWorld 2.0లో, Claude స్కోర్‌లు అధికారిక సెట్టింగ్‌లను ఉపయోగిస్తాయి, Fable 5.1 సిస్టమ్ కార్డ్‌లోని సవరించిన టాస్క్‌లు మరియు సవరించిన గ్రేడింగ్‌ను కాదు.

  4. 4

    మోడల్ సమయాలు సంబంధిత డెమాన్‌స్ట్రేషన్ రన్‌ల కోసం నివేదించబడిన గడిచిన సమయాలు. ప్రదర్శించబడిన క్లిప్‌లు సవరించిన భాగాలు.

  5. 5

    BenchCADలో, Claude స్కోర్‌లు మూల్యాంకనానికి చేసిన మూడు మార్పులను ప్రతిబింబిస్తాయి, వీటి వివరాలు Fable 5.1 సిస్టమ్ కార్డ్⁠(కొత్త విండోలో తెరుచుకుంటుంది)లో ఉన్నాయి.

  6. 6

    గ్వాంగ్ యాంగ్, విక్టోరియా ఎబర్ట్, నాజిఫ్ టెమెర్, బ్రయాన్ సియువాన్ జెంగ్, లూయిజా పొజ్జోబోన్, మరియు నోవా ఎ. స్మిత్. “LEGATO: టైప్‌సెట్ OMR కోసం భారీ-స్థాయి ఎండ్-టు-ఎండ్ సాధారణీకరించగల విధానం⁠(కొత్త విండోలో తెరుచుకుంటుంది).” arXiv:2506.19065, 2025.

  7. 7

    మార్క్ ఆర్. హెచ్. గోతమ్, మౌరీన్ రెడ్‌బాండ్, బ్రూనో బోవర్, మరియు పీటర్ జోనాస్. “ఓపెన్‌స్కోర్ స్ట్రింగ్ క్వార్టెట్ కార్పస్⁠(కొత్త విండోలో తెరుచుకుంటుంది).” సంగీతశాస్త్రం కోసం డిజిటల్ గ్రంథాలయాలపై 10వ అంతర్జాతీయ సదస్సు కార్యవివరాలు, పుటలు 49–57. ACM, 2023.

  8. 8

    FrontierCodeలో, GPT-6 Astraను Codexలోని దాని డెవలపర్ మెసేజ్‌లోని ఒక విభాగాన్ని⁠(కొత్త విండోలో తెరుచుకుంటుంది) పోలిన డెవలపర్ మెసేజ్‌తో అమలు చేశారు: "అధిక సంఖ్యలో టెస్ట్ ఫైళ్లను సృష్టించవద్దు. రిపోజిటరీ సంప్రదాయాల ప్రకారం అవసరమైనప్పుడు లేదా ఇప్పటికే ఉన్న ఏ ఫైల్ కూడా సరైన స్థానంగా లేనప్పుడు మాత్రమే కొత్త టెస్ట్ ఫైల్‌ను సృష్టించండి. సంబంధం లేని క్లీనప్ మరియు అనవసరమైన సంక్లిష్టతను నివారించండి. ఇప్పటికే ఉన్న తగిన యుటిలిటీలను మళ్లీ ఉపయోగించండి. సంబంధిత రిపోజిటరీ సూచనలను చదవండి మరియు సమీపంలోని కోడ్, టెస్టులు, డాక్యుమెంటేషన్, మరియు CIని పరిశీలించండి. స్థిరపడిన పద్ధతులను అనుసరించండి. లక్ష్యం శుభ్రమైన, మెర్జ్ చేయగలిగే కోడ్." ఎవల్ కోసం ప్రాంప్ట్ ఆప్టిమైజ్ చేయబడలేదు.

  9. 9

    మొదటిది, సంఖ్యారేఖపై ఎంత దూరం ముందుకు వెళ్లినా, అభాజ్య సంఖ్యలు ఒకదానికొకటి ఎంత దగ్గరగా కనిపించగలవన్న విషయానికి సంబంధించినది. దశాబ్దానికి పైగా, అత్యుత్తమంగా తెలిసిన ఫలితం అనంతంగా అనేక అభాజ్య సంఖ్యల జంటలు గరిష్ఠంగా 246 తేడాతో ఉంటాయని స్థాపించింది. జూలియా స్టాడ్ల్‌మాన్⁠(కొత్త విండోలో తెరుచుకుంటుంది) ఇటీవల ఆ హద్దును 240కి మెరుగుపరిచారు. ఆస్ట్రా 186 అనే మరింత బలమైన పరిమితిని స్థాపించడంలో సహాయపడింది, ఈ చిన్న దూరంలో అనంతంగా అనేక జంటలు సంభవించాయని చూపించింది. అభాజ్య సంఖ్యల మధ్య చిన్న అంతరాలు: నిరూపణ⁠(కొత్త విండోలో తెరుచుకుంటుంది) మరియు మద్దతు ఇచ్చే పరిశోధన⁠(కొత్త విండోలో తెరుచుకుంటుంది).

  10. 10

    రెండవది ప్రధాన సంఖ్యల మధ్య అసాధారణంగా పెద్ద అంతరాలకు సంబంధించినది. ఆస్ట్రా 80 సంవత్సరాలకు పైగా మార్పులేకుండా ఉన్న ఈ అంతరాలపై పరిమితిలోని ఒక పదాన్ని మెరుగుపరిచింది. రెండు ఫలితాల కోసం రుజువులు, సంక్షిప్త చెయిన్-ఆఫ్-థాట్, మరియు ధృవీకరణ సామగ్రిని మేం పంచుకుంటున్నాం. ప్రధాన సంఖ్యల మధ్య పెద్ద అంతరాలు: నిరూపణ⁠(కొత్త విండోలో తెరుచుకుంటుంది) మరియు సహాయక పరిశోధన⁠(కొత్త విండోలో తెరుచుకుంటుంది).

  11. 11

    ఉద్దేశించిన HealthBench Professional విధానాన్ని అనుసరించి, GPT‑5.4ను ఉపయోగించి మేము అన్ని Claude మోడల్‌లను స్వతంత్రంగా మూల్యాంకనం చేశాము. గ్రేడింగ్ మరియు పొడవుకు అనుగుణంగా సర్దుబాటు చేసిన, క్లిప్ చేయని స్కోర్లు. Fable 5.1 కోసం, ప్రొవైడర్ తిరస్కరణల కోసం మేము Opus 5 ఫాల్‌బ్యాక్‌ను ఉపయోగించాము.

  12. 12

    ఈ మూల్యాంకనాల్లో ఎక్కువ ప్రశ్నలకు సమాధానం ఇవ్వడానికి నిరాకరిస్తున్నందున, Claude Fable 5 మరియు 5.1లను LifeSciBench Gold v1, GeneBench Pro v13, మరియు MedChemBenchలో చేర్చలేదు.

  13. 13

    ExploitGymలో, Astra మరియు Sol యొక్క పూర్తి స్థాయి సైబర్ సామర్థ్యాలను మరింత మెరుగ్గా అంచనా వేయడానికి, మేము 6 గంటల కాల పరిమితి లేకుండా వాటిని పరీక్షించాము. అవి తగినంత వేగంగా ఉంటాయి కాబట్టి, దీని ప్రభావం చాలా తక్కువగా ఉంటుంది.

  14. 14

    ExploitBench (జూన్–ఆగస్టు 2026)లో 13 స్థిరమైన Chrome విడుదలల్లో ఉన్న హై తీవ్రతగల 20 V8 లోపాలు ఉన్నాయి. పేర్కొన్న ప్రతి భద్రతా లోపాన్ని వినియోగించడం ద్వారా, ఏజెంట్లు V8 మరియు Linux కోసం అధికారిక Chrome విడుదలల్లో ఇష్టానుసార కోడ్ అమలును సాధించగలరా అనే విషయాన్ని ఈ బెంచ్‌మార్క్ పరీక్షిస్తుంది. చేర్చబడిన కొన్ని బలహీనతలు మూల్యాంకన పరిమితుల కింద ఇష్టానుసార కోడ్ అమలును అనుమతించకపోవచ్చు, కాబట్టి 100% విజయ రేటు సాధ్యం కాకపోవచ్చు. గమనిక: GPT-5.6 Sol యొక్క 5.5% స్కోరు బెంచ్‌మార్క్‌లోని 300-టర్న్ పరిమితి వల్ల ఏర్పడిన ఆర్టిఫ్యాక్ట్; ఇది మ్యాక్స్‌ను ఉపయోగించే నిజమైన కస్టమర్‌లకు ఉండే పరిమితి కాదు. తక్కువ పరిమితులను ఎదుర్కొన్నప్పుడు, మోడల్ సారూప్య సెట్టింగ్‌లలో 11.5% స్కోర్‌ను సాధించింది.

  15. 15
  16. 16

    మేం థర్డ్-పార్టీ మోడల్‌లలో పరీక్షించినప్పుడు, మరింత సరళమైన పరిశోధనా సెటప్‌ను ఉపయోగిస్తాం. Codex మరింత సంక్లిష్టమైన ప్రొడక్షన్ కాన్ఫిగరేషన్‌ను కలిగి ఉంటుంది, దీని వల్ల రా-మోడల్ ఎర్రర్ రేట్లు భిన్నంగా ఉండవచ్చు. ప్రొవైడర్-వైపు రక్షణలు మరియు కంప్యూటర్-టూల్ అమలులు ఇప్పటికీ భిన్నంగా ఉన్నాయి. ఇది అంతర్గత పరిశోధనా కాన్ఫిగరేషన్ కాబట్టి, వినియోగదారులు Codexలో నిర్ధారణ అవసరం లేని పరిస్థితిని అనుభవించరు.

  17. 17

    ScreenSpot-Pro మరియు ExploitGym కోసం, మేము నివేదించే Fable స్కోర్‌లు తక్కువ భద్రతా చర్యలతో కూడిన Fable అయిన Mythos నుండి వచ్చాయి.