ఒక కొత్త తరం ఇంటెలిజెన్స్
22 సెప్టెంబర్, 2026న అప్డేట్: మేము GPT‑6 Sol మరియు GPT‑6 Lunaతో మా GPT‑6 కుటుంబాన్ని విస్తరిస్తున్నాం. మరింత తెలుసుకోండి.
ప్రపంచంలో అత్యంత మేధావంతమైన మరియు అత్యంత అలైనింగ్ చేసిన మోడల్ అయిన GPT‑6 Astraను మేం పరిచయం చేస్తున్నాం.
GPT‑6 Astra ప్రీ-ట్రైనింగ్, రీఇన్ఫోర్స్మెంట్ లెర్నింగ్ మరియు సమలేఖనంలో ఏళ్ల పరిశోధనతో పాటు భారీ పందాలను సమీకరిస్తుంది. కంప్యూటర్ వినియోగం, బ్రౌజింగ్, సాఫ్ట్వేర్ ఇంజినీరింగ్, సైబర్ భద్రత, సైన్స్ మరియు ప్రొఫెషనల్ పనిలో Astra అత్యాధునిక స్థాయిలో ఉంది. Astra ఇప్పటికే గణితంలో దీర్ఘకాలంగా పరిష్కారం కాని ఓపెన్ సమస్యలను పరిష్కరించడంలో సహాయం చేసి, FrontierMath Tier 4లో 98% స్కోర్తో సాచురేట్ చేసింది. Astra కూడా ARC-AGI-3లో 99.9% స్కోర్ను, ExploitBenchలో 100% స్కోర్ను సాధిస్తుంది. సాటిలేని వేగం, ఖచ్చితత్వం, వివేచనతో అత్యంత డిమాండ్ ఉన్న ప్రొఫెషనల్ పనిని నిర్వహిస్తూ, కంప్యూటర్ మరియు బ్రౌజర్ వినియోగంలో కూడా ఇది కొత్త అత్యాధునిక ప్రమాణాన్ని నెలకొల్పుతుంది.
GPT‑6 Astra ఈ రోజు పరిమిత సంఖ్యలో సంస్థలకు అందుబాటులోకి వస్తోంది. రాబోయే రోజుల్లో ఇది అన్ని ChatGPT Plus, Pro, Business మరియు Enterprise యూజర్లకు, అలాగే OpenAI API, Microsoft Azure మరియు AWS Bedrock ద్వారా అందుబాటులోకి వస్తుంది.
Astra మా అత్యంత సమన్వయంతో ఉన్న మోడల్. యూజర్ ఉద్దేశాన్ని, మోడల్ ప్రవర్తనను అర్థం చేసుకోవడంలో ఇందులో గణనీయమైన మెరుగుదలలు ఉన్నాయి—Astra తీర్పుపై మరింత విశ్వాసంతో టాస్క్లను డెలిగేట్ చేయవచ్చు. దీన్ని పరీక్షించే విధానంగా, కష్టమైన లేదా అసాధ్యమైన టాస్క్ను ఎదుర్కొన్న మోడల్ తన ఉద్దేశించిన పరిధిని దాటుతుందా అని అంచనా వేసేలా Hugging Face ఘటన ఆధారంగా కొత్త మూల్యాంకనాన్ని రూపొందించాం. ఉత్పత్తి రక్షణలు లేకుండా అనుమతించిన లక్ష్యాన్ని 48% సందర్భాల్లో దాటిన GPT‑5.6 Solతో పోలిస్తే, GPT‑6 Astra ఇలా 0% సందర్భాల్లో చేసింది.
కంప్యూటర్ వినియోగం కోసం ప్రపంచంలోనే అత్యుత్తమ మోడల్
కంప్యూటర్ వినియోగం వేగం, ఖచ్చితత్వం, భద్రత పరంగా GPT‑6 Astra కొత్త అత్యాధునిక స్థాయిని సూచిస్తుంది. ఇది ఆన్లైన్ ఫారాలను నింపడం, CRMలో కస్టమర్ రికార్డులను అప్డేట్ చేయడం, మీ క్యాలెండర్ను నిర్వహించడం వంటి శ్రమతో కూడిన పనులను చూసుకోగలదు. ఇది ఆన్లైన్ పరిశోధన చేయగలదు మరియు మీ ఇమెయిల్లో లేదా మీ డాక్యుమెంట్ ఎడిటర్లో సారాంశాల ముసాయిదాలను రూపొందించగలదు. ఇది శాస్త్రీయ డేటాను విశ్లేషించగలదు, ప్లాట్లను రూపొందించగలదు, వెబ్సైట్ను సృష్టించగలదు, అలాగే ఆ సైట్లోని అన్ని ఫీచర్లు పనిచేస్తున్నాయని నిర్ధారించడానికి ఫ్రంట్ఎండ్ QA తనిఖీలను నిర్వహించగలదు. ఇది సాఫ్ట్వేర్ను స్వయంచాలకంగా ఇన్స్టాల్ చేసి పరీక్షించడానికి, అలాగే స్క్రీన్పై కనిపించే సమస్యలను పరిష్కరించడంలో మీకు సహాయపడుతుంది. ఈ మెరుగుదలలు మా అత్యాధునిక మూల్యాంకన ఫలితాల్లో కూడా ప్రతిబింబిస్తున్నాయి.
ఈ మెరుగుదలలు కూడా వాస్తవ జ్ఞాన పనుల్లో సామర్థ్యంలో గణనీయమైన మెరుగుదలలకు దారితీస్తాయి. OSWorld 2.0లో లేటెన్సీ సిమ్యులేషన్లలో, Astra GPT‑5.6 కంటే ఒక్కో టాస్క్కు దాదాపు 47% తక్కువ సమయంలో హై కంప్యూటర్-వినియోగ పనితీరును సాధిస్తుంది. Sol, సుమారు 75 నిమిషాల్లో సాధించిన 65.7% తో పోలిస్తే, ఒక్కో టాస్క్కు సుమారు 40 నిమిషాల్లో 72.6% స్కోర్ చేసింది.3
GPT‑6 Astra కంప్యూటర్ను ఉపయోగించే సామర్థ్యాలను గేమ్ డెవలప్మెంట్, ఎలక్ట్రికల్ ఇంజినీరింగ్, మరియు రోజువారీ జ్ఞానపరమైన పనితో సహా వివిధ రంగాల్లోని అవుట్పుట్లలో చూడవచ్చు:
Astraతో పాటు, కంప్యూటర్ వినియోగ వేగాన్ని గణనీయంగా మెరుగుపరచడానికి Codex హార్నెస్ను కూడా అప్డేట్ చేస్తున్నాం. Astra సామర్థ్యంతో కలిపి, Mind2Web బెంచ్మార్క్లో ప్రస్తుత GPT‑5.6 Sol అనుభవంతో పోలిస్తే ఇది టాస్క్ను 1.9 రెట్లు వేగంగా పూర్తి చేయడానికి దారితీస్తుంది. మోడల్ వేగంలో మెరుగుదలల వల్ల, నువ్వు చేయగలిగిన దానికంటే వేగంగా ఇది నీ కోసం జీవితంలోని సమయం తీసుకునే అనేక పనులను చేపట్టగలదు.4
వృత్తిపరమైన పనిలో గణనీయమైన మార్పు
GPT‑6 Astra సంక్లిష్టమైన పనులను పరిష్కరించడంలో సహాయపడేందుకు, వృత్తిపరమైన పరిసరాల కోసం లక్షిత శిక్షణతో కంప్యూటర్ వినియోగంలోని పురోగతులను సమ్మిళితం చేస్తుంది. ఇది సంక్లిష్ట సమస్యలకు అవసరమైన ఇంటెలిజెన్స్ను, బహుళ-దశల కార్యప్రవాహాలను నిర్వహించి చక్కగా రూపొందించిన డాక్యుమెంట్లు, స్ప్రెడ్షీట్లు, మరియు ప్రజెంటేషన్లను తయారు చేసే సామర్థ్యంతో కలిపిస్తుంది.
GPT‑6 Astra అనేది ఇప్పటికే ఉన్న టెంప్లెట్లను అనుసరించడం, చక్కగా అమర్చబడిన స్లైడ్లను రూపొందించడం, అలాగే నిర్మాణాత్మక కథనంతో ముఖ్యాంశాలను సంక్షిప్తంగా తెలియజేయడం కోసం మా అత్యుత్తమ మోడల్. ఇది మీ టెంప్లెట్లను అనుసరించి, మీ రచనా మరియు దృశ్య శైలికి సరిపోలే స్పష్టమైన, చక్కగా నిర్మితమైన పత్రాలు, ప్రజెంటేషన్లు, స్ప్రెడ్షీట్లు మరియు విశ్లేషణలను సృష్టిస్తుంది. Astra చేతిలో ఉన్న పనికి అవసరం లేని సమాచారాన్ని పునరావృతం చేయకుండా, అవుట్పుట్లలో అవసరమైన సందర్భాన్ని మాత్రమే ప్రత్యేకంగా తీసుకురావడానికి కూడా శిక్షణ పొందింది. ఇవన్నీ అంటే, మీ వ్యాపార సందర్భం మరియు ప్రమాణాలకు సరిపోయే, వెంటనే ఉపయోగించగల మరిన్ని ఆర్టిఫాక్ట్లను ఇది అవుట్పుట్ చేయగలదని అర్థం.
GPT‑6 Astra కూడా తాను రూపొందించే వెబ్సైట్లు, గేమ్లు, అప్లికేషన్లు మరియు రెండరింగ్లకు మరింత బలమైన దృశ్యపరమైన నిర్ణయ సామర్థ్యాన్ని తీసుకువస్తుంది. ChatGPTలోని Sites(కొత్త విండోలో తెరుచుకుంటుంది) తో, Astra ప్రాంప్ట్ నుంచే వెబ్సైట్లు, వెబ్ యాప్లు మరియు గేమ్లను సృష్టించగలదు, హోస్ట్ చేయగలదు మరియు షేర్ చేయగలదు.
సూచనల్లో వ్యాఖ్యానానికి అవకాశం ఉన్నప్పుడు, సరైన నిర్ణయం తీసుకోవడంలో GPT‑6 Astra మునుపటి మోడళ్ల కంటే మెరుగ్గా ఉంటుంది. ఇది సాధారణ లోటులను పూరించడానికి సందర్భాన్ని ఉపయోగిస్తుంది మరియు సమాధానం ఫలితాన్ని మార్చగలిగే అవకాశం ఉన్నప్పుడు కేంద్రీకృత ప్రశ్నలను అడుగుతుంది. Codexలో, మీ ప్రత్యుత్తరంపై ఆధారపడని పనిని కొనసాగిస్తూనే ఇది అసింక్రోనస్గా అడగగలదు. మీరు స్పందించకపోతే, ఇది తగిన చోట సమంజసమైన అంచనాలతో ముందుకు సాగుతుంది, కానీ పర్యవసానాలకు దారితీసే నిర్ణయాల విషయంలో మీ ఇన్పుట్ కోసం నిరీక్షిస్తుంది.
సమాచారం లోపించడం వల్ల సమాధానం గణనీయంగా మారే అవకాశం ఉన్న రోజువారీ పనులలో Astra ఎలా సహకరిస్తుందో క్రింది ఉదాహరణలు చూపిస్తాయి.
పని మారుతూ ముందుకు సాగుతున్నప్పుడు దాని దిశపై అవగాహనను కొనసాగించడంలో కూడా Astra మెరుగ్గా ఉంటుంది. మునుపటి మోడల్స్ కొన్నిసార్లు దిశానిర్దేశ సందేశాలను కొత్త లక్ష్యంగా పరిగణించి, అసలు అభ్యర్థనను లేదా మునుపటి పరిమితులను కోల్పోయేవి. Astra కొత్త అవసరాలను కలుపుకుంటుంది, అడిగినప్పుడు దిశ మార్చుకుంటుంది, అలాగే విస్తృతమైన పనిని వదిలిపెట్టకుండా పక్క ప్రశ్నలకు సమాధానం ఇస్తుంది.
కోడింగ్
GPT‑6 Astra ఇప్పటివరకు సాఫ్ట్వేర్ ఇంజినీరింగ్ కోసం అత్యుత్తమ మోడల్.
“GPT‑6 Astra మా అంతర్గత కోడింగ్ బెంచ్మార్క్లలో స్టేట్-ఆఫ్-ది-ఆర్ట్ పనితీరును అందిస్తుంది మరియు GPT‑5.6 Solతో పోలిస్తే ట్రేడింగ్ అంతర్దృష్టి మూల్యాంకనాల్లో స్పష్టమైన పురోగతిని చూపిస్తుంది. ఏజెంటిక్ కోడింగ్ కోసం ఉపయోగించినప్పుడు, GPT‑6 Astra డెవలపర్లు సులభంగా అనుసరించగలిగే విధంగా కమ్యూనికేట్ చేస్తుంది మరియు ప్రొడక్షన్ నాణ్యతను చేరుకోవడానికి తక్కువ పునరావృతం అవసరమయ్యే కోడ్ను రూపొందిస్తుంది.”
“మా మొదటి తరం మూల్యాంకనాల్లో ఒకదానిపై Astraను తక్కువ, మీడియం, మరియు హై స్థాయి ప్రయత్నంతో పరీక్షించాం, అది GPT 5.6 Sol కంటే గణనీయంగా మెరుగ్గా నిలిచింది. హై ప్రయత్నం తాజా బిల్డ్పై మరిన్ని పునరావృతాలను, బ్రౌజర్ పరీక్షల ద్వారా మరింత ధృవీకరణను, అలాగే apply-patch కంటే కోడ్ ఎగ్జిక్యూషన్ వైపు మొగ్గును అందిస్తుంది. మోడల్ తన ప్రయత్నాన్ని ఎలా ఖర్చు చేస్తుందో అర్థం చేసుకోవడం ద్వారా, లక్షలాది బిల్డర్లకు ఆలోచన నుంచి పనిచేసే యాప్ వరకు వేగవంతమైన, మరింత విశ్వసనీయమైన మార్గాన్ని అందిస్తున్నాం.”
Astraతో, కాంటెక్ట్స్ విండో నిండినప్పుడు కాంటెక్ట్స్ను భద్రపరచడానికి మరియు తిరిగి పొందడానికి మేం Codex కోసం ఒక కొత్త మార్గాన్ని పరిచయం చేస్తున్నాం. చారిత్రకంగా, క్లిష్టమైన సమస్యలను డీబగ్ చేయడం లేదా పెద్ద రీఫాక్టర్లను చేపట్టడం వంటి దీర్ఘ సెషన్లలో పనిని సంగ్రహించడానికి మోడల్స్ కాంపాక్షన్ను ఉపయోగించాయి. ప్రతి కాంపాక్షన్ పరిష్కారం ఎందుకు విఫలమైందో లేదా కాంపోనెంట్ ఎలా ప్రవర్తిస్తుందో తెలిపే వివరాలను వదిలివేయవచ్చు. Codexలో, Astra కాంటెక్ట్స్ విండోల అంతటా నోట్స్ను ఉంచగలదు, సేకరించిన వివరాలను ఒకే సంగ్రహంగా పదేపదే కుదించకుండా వాటిని నిలుపుకుంటుంది. ముందున్న కాంటెక్ట్స్ విండోలు శోధించగలిగేవిగా ఉంటాయి, కాబట్టి ఆ సమాచారం దాని నోట్స్లో నమోదు కాకపోయినా, Astra మునుపటి మెసేజ్లు మరియు టూల్ అవుట్పుట్ల నుండి అవసరాలు లేదా టెస్ట్ ఫలితాలను కనుగొనగలదు. మీరు ఈ ప్రయోగాత్మక ఫీచర్ను మీ Codex config.tomlలో,(కొత్త విండోలో తెరుచుకుంటుంది) ప్రారంభించవచ్చు, మరియు రాబోయే వారాల్లో అది Astra కోసం డిఫాల్ట్గా మారుతుంది.
శాస్త్రీయ ఆవిష్కరణను ముందుకు తీసుకెళ్లడం
శాస్త్రీయ ఆవిష్కరణ వెనుక ఉన్న ప్రాయోగిక పనిలో Astra సహాయపడగలదు. శాస్త్రీయ రీజనింగ్ను కంప్యూటర్ వినియోగంతో కలపడం ద్వారా, డేటాను పరిశీలించడానికి మరియు ఫలితాలను అన్వేషించడానికి ఇది ప్రత్యేక సాఫ్ట్వేర్లో నేరుగా పని చేయగలదు. తద్వారా పరిశోధకులు ఆధారాలను అంచనా వేసి, తర్వాత ఏమి పరిశోధించాలో నిర్ణయించడంలో సహాయపడుతుంది.
సైబర్ భద్రత
మా భద్రతా నవీకరణలో మేం చర్చించినట్లుగా, Astra సైబర్ సామర్థ్యాల్లో గణనీయమైన ముందడుగు వేసింది మరియు మా క్రిటికల్ థ్రెషోల్డ్ ను సైబర్సెక్యూరిటీలో మా ప్రిపేర్డ్నెస్ ఫ్రేమ్వర్క్ కింద చేరుకుంది. జీరో-డే ఎక్స్ప్లోయిట్లను గుర్తించి అభివృద్ధి చేసే దాని సామర్థ్యం, రక్షకులు బలహీనతలను కనుగొని ప్యాచ్ చేయడానికి సహాయపడగలదు, అయితే ఇది మరింత బలమైన రక్షణ చర్యల అవసరాన్ని కూడా సృష్టిస్తుంది. ఈ సామర్థ్యాలు ఎంతవరకు విస్తరించాయో అర్థం చేసుకోవడానికి, మేము Astraను ఇంటర్నల్ మరియు థర్డ్ పార్టీ నిపుణుల మూల్యాంకనాల్లో అమలు చేశాము.
ముందుగా, తెలిసిన సాఫ్ట్వేర్ దుర్బలతలను పనిచేసే ఎక్స్ప్లాయిట్లుగా మోడల్లు మార్చగలవా లేదా అని అంచనా వేసే ExploitBench మరియు ExploitGymలో, ప్రొడక్షన్ భద్రతా రక్షణలు లేకుండా మోడల్ను పరీక్షించాం. ExploitBenchలో, మా మునుపటి అత్యాధునిక సైబర్ సామర్థ్యమున్న మోడల్ అయిన GPT‑5.6 Sol సాధించిన 78.5%తో పోలిస్తే, Astra 100% సంపూర్ణ స్కోర్ సాధించింది. ExploitGymలో, గణనీయంగా తక్కువ అవుట్పుట్ టోకెన్లను ఉపయోగిస్తూనే Astra 42.4% విజయ రేటును సాధించింది, కాగా GPT‑5.6 Sol 30.3% సాధించింది.13
చారిత్రక సాఫ్ట్వేర్ దుర్బలతలకు గురికావడం బెంచ్మార్క్ ఫలితాలను ప్రభావితం చేసి ఉండవచ్చనే ఆందోళనలను దృష్టిలో ఉంచుకుని, మేం Astraను రెండు కొత్త బెంచ్మార్క్లపై కూడా మూల్యాంకనం చేశాం. మొదటగా, గత మూడు నెలల దుర్బలతలను ఉపయోగించి ఎక్స్ప్లాయిట్ అభివృద్ధిని పరీక్షించడానికి మేం అంతర్గత “ExploitBench (June–August 2026)” మూల్యాంకనాన్ని రూపొందించాము.14 Astra GPT‑5.6 కంటే గణనీయంగా హై ఇష్టానుసార కోడ్-అమలు రేట్లను సాధించింది ఈ డేటాసెట్లో Sol చాలా తక్కువ అవుట్పుట్ టోకెన్లను ఉపయోగిస్తూ. మూల్యాంకనం సమయంలో, Astra ఇంతకు ముందు తెలియని రెండు జీరో-డే దుర్బలతలను కూడా గుర్తించి ఉపయోగించింది. మేం ఈ రెండు భద్రతా దుర్బలతలను సంబంధిత నిర్వహణకర్తలకు వెల్లడిస్తున్నాం.
బైనరీ సాఫ్ట్వేర్ను రివర్స్ ఇంజినీర్ చేసి, రా సోర్స్ కోడ్కు యాక్సెస్ లేకుండానే దాని ప్రధాన లాజిక్ను అర్థం చేసుకోగలరో లేదో మోడల్లు కొలిచే బెంచ్మార్క్ అయిన SRE-Bench15లో కూడా మేం Astraను పరీక్షించాం. Astra ఒకే ప్రయత్నంలో 88.0% టాస్క్లను, నాలుగు ప్రయత్నాల్లో 99.2% టాస్క్లను పరిష్కరించింది; దీనితో పోలిస్తే GPT‑5.6 Sol వరుసగా 55.9% మరియు 68.7% సాధించింది.
బెంచ్మార్క్లకు మించి, నిపుణుల ఆధ్వర్యంలో చేసిన అంచనాలు Astraను ప్రొడక్షన్ సేఫ్గార్డ్లు లేకుండా రన్ చేసినప్పుడు, అది పటిష్ఠమైన బ్రౌజర్లలో ఇష్టానుసార కోడ్ అమలును సాధించడానికి ఇంతకుముందు తెలియని దుర్బలతలను ఉపయోగించగలదని, అలాగే పటిష్ఠమైన నిర్వహణ వ్యవస్థల కోసం అధికార విస్తరణ దుర్వినియోగాలను సృష్టించగలదని కనుగొన్నాయి.
The Defender’s Windowలో మేం చర్చించినట్లుగా, అత్యాధునిక సైబర్ సామర్థ్యాలు రక్షకులు బలహీనతలను వేగంగా కనుగొనడంలో సాయపడతాయి, కానీ అవి ఆ బలహీనతలను దోపిడీ చేయడాన్ని కూడా సులభతరం చేస్తాయి, దీనివల్ల రక్షకులు అనుగుణంగా మారాల్సిన ఆవశ్యకత పెరుగుతుంది. ఈరోజు విడుదలవుతున్న Astra సంస్కరణతో, రక్షకులు సురక్షిత కోడ్ సమీక్ష మరియు ప్యాచింగ్ వంటి పనులను పూర్తి చేయడానికి దీన్ని ఉపయోగించవచ్చు.
అయితే, దుర్బలతల కోసం ప్రూఫ్-ఆఫ్-కాన్సెప్ట్ ఎక్స్ప్లోయిట్లను సృష్టించడం వంటి మరింత అధునాతన సైబర్ భద్రతా పనులను చేయడానికి Astra నిరాకరిస్తుంది. OpenAI Daybreak ద్వారా, రాబోయే వారాల్లో ప్రాప్యతను విస్తరించి, తక్కువ పరిమితులతో కూడిన భద్రతా చర్యలను అందుబాటులోకి తీసుకురావాలని మేం ప్రణాళిక చేస్తున్నాము. ఇది దుర్బలత మరియు ప్రూఫ్-ఆఫ్-కాన్సెప్ట్ ధృవీకరణ, మాల్వేర్ విశ్లేషణ, మరియు డిటెక్షన్ ఇంజినీరింగ్ సహా మరిన్ని రక్షణాత్మక వర్క్ఫ్లోలను ప్రారంభిస్తుంది.
GPT‑5.6 Sol కోసం మా రక్షణల స్టాక్పై ఆధారపడి, సంభావ్య సైబర్ దుర్వినియోగం నుంచి మా రక్షణలను కూడా బలోపేతం చేశాం. సంభావ్య జైల్బ్రేక్లను మెరుగ్గా తట్టుకోవడానికి మరింత బలమైన మోడల్ పటిష్ఠత, మా పర్యవేక్షణ వ్యవస్థలకు మరింత సందర్భ సమాచారం ఇందులో ఉన్నాయి. మా అంతర్గత రెడ్ టీమింగ్ దాడిదారులతో ఆటోమేటెడ్ మూల్యాంకనాలతో సహా, కఠినమైన అంతర్గత మరియు బాహ్య పరీక్షలను మేం కొనసాగించాం. మా సైబర్ రక్షణలు మరియు పరీక్షల గురించి మరిన్ని వివరాలు Astra భద్రతా అవలోకనం మరియు సిస్టమ్ కార్డ్(కొత్త విండోలో తెరుచుకుంటుంది)లో అందుబాటులో ఉన్నాయి..
GPT‑6 Astraను బాధ్యతాయుతంగా అలైనింగ్ చేయడం, అమలు చేయడం
Astra మా అత్యంత అలైన్డ్ మోడల్. Astra జాగ్రత్తగా వ్యవహరించడం, పని పరిమితులను గౌరవించడం మరియు పారదర్శకంగా కమ్యూనికేట్ చేయడంలో అత్యుత్తమంగా ఉంటుంది. ప్రారంభం నుంచి ముగింపు వరకు మానవ ఉద్దేశానికి అనుగుణంగా ఉండేలా మోడళ్లకు శిక్షణ ఇవ్వడంపై దృష్టి సారించిన మా దీర్ఘకాలిక పరిశోధన కార్యక్రమం నుంచి వచ్చిన తాజా ఫలితం ఈ పని.
సున్నితమైన వాతావరణాల్లో, Astra అందులోని ప్రమాద స్థాయికి అనుగుణమైన జాగ్రత్తతో ముందుకు సాగుతుంది. తప్పు ప్రవర్తనను ప్రేరేపించేలా ప్రతిద్వంద్వంగా ఎంపిక చేసిన కంప్యూటర్ వినియోగ పనుల మూల్యాంకనంలో, అనుద్దేశిత పరిణామాలను నివారించడంలో Astra మరింత విజయవంతమైంది. డిఫాల్ట్గా అందించే అదనపు భద్రతా చర్యలతో అమలు చేయడం మరింత బలమైన పనితీరును అందించింది.
పరీక్షించిన ఇతర ఏ అత్యాధునిక మోడల్లకన్నా Astra తక్కువ లక్ష్యవిరుద్ధ ఫలితాలకు కారణమవుతుంది. నిష్పక్షపాత పోలిక కోసం, మేము సాధారణ కంప్యూటర్-యూజింగ్ ఏజెంట్ హార్నెస్ను ఉపయోగించాము (ఇది OpenAI Responses API(కొత్త విండోలో తెరుచుకుంటుంది) మరియు Anthropic Messages API(కొత్త విండోలో తెరుచుకుంటుంది) రెండింటిలో అందుబాటులో ఉన్న నేటివ్ కంప్యూటర్ వినియోగ టూల్స్పై ఆధారపడింది) మరియు Codex, ChatGPT వర్క్ వినియోగదారుల కోసం సాధారణంగా అమలు చేసే అదనపు రక్షణలు (ఆటో-రివ్యూ, కన్ఫర్మేషన్ పాలసీ) లేకుండా ఉపయోగించాము.
Astra వినియోగదారు నిర్దేశించిన మరియు దాని పరిసరాల ద్వారా పరోక్షంగా సూచించబడిన పరిమితుల పరిధిలో పనిచేసే అవకాశం కూడా ఎక్కువగా ఉంది. ఒక అంతర్గత మూల్యాంకనంలో, Codex Auto-Review తిరస్కరణను తప్పించుకోవడానికి Astra ఎప్పుడూ ప్రయత్నించలేదు. ఆటో-రివ్యూను ఉద్దేశపూర్వకంగా తప్పించుకోగలిగేలా కాన్ఫిగర్ చేసినప్పటికీ, వేరే విధంగా ఆ పనిని పూర్తి చేయడం అసాధ్యమైనప్పటికీ కూడా ఇదే వర్తించింది. పర్యావరణ పరిమితుల పట్ల ఈ గౌరవం, ఈ పోస్ట్ పరిచయంలో మేం పంచుకున్న అసాధ్యమైన సైబర్ టాస్క్ మూల్యాంకన ఫలితాలతోనూ, మా సిస్టమ్ కార్డ్(కొత్త విండోలో తెరుచుకుంటుంది)లో నమోదు చేసిన ఇతర నిర్ధారణలతోనూ స్థిరంగా ఉంది.
అదనంగా, పారదర్శక వినియోగదారు కమ్యూనికేషన్లో Astra కొత్త ప్రమాణాలను నెలకొల్పుతుంది. ఒక మూల్యాంకనంలో, GPT‑5.6 కంటే Astraకు మూడు రెట్లు తక్కువ అవకాశం ఉంది Sol తన సామర్థ్యాలు మరియు అందుబాటులో ఉన్న సౌకర్యాల గురించి సరికాని వివరణలు ఇవ్వడానికి.
మా సామర్థ్య-హాలూసినేషన్ మూల్యాంకనంలో, Astra తన సామర్థ్యాల గురించి తక్కువ తప్పుదోవ పట్టించే వాదనలు చేస్తూ, GPT‑5.6 Sol కంటే గణనీయమైన మెరుగుదలని చూపిస్తుంది.
మా మూల్యాంకనాల్లో Astra యొక్క వ్రాతపూర్వక రీజనింగ్ను GPT‑5.6 కంటే పర్యవేక్షించడం కష్టమని తేలింది Solది, పర్యవేక్షణను తప్పించుకోవాలని దానిని స్పష్టంగా కోరిన పరీక్షల ఆధారంగా. సరళమైన పనుల్లో రాతపూర్వక రీజనింగ్పై Astraకు ఎక్కువ నియంత్రణ ఉండటం, తక్కువ రాత దశలతో సమస్యలను పరిష్కరించగల సామర్థ్యం ఉండటం దీనికి కారణమని మేము భావిస్తున్నాం. క్లిష్టమైన పనులకు అవసరమైన రీజనింగ్ను దాచడంలో Astra ఇంకా ఇబ్బంది పడుతున్నట్లు కనిపిస్తున్నప్పటికీ, ఈ తగ్గుదలను మేము గంభీరంగా తీసుకుంటున్నాం. పర్యవేక్షణ సామర్థ్యాన్ని మెరుగుపరచడం పరిశోధనలో ప్రాధాన్యతగా కొనసాగుతోంది, అలాగే అనుబంధ సిస్టమ్ కార్డ్(కొత్త విండోలో తెరుచుకుంటుంది) మా కనుగొన్న విషయాలు మరియు కొనసాగుతున్న పనిని వివరిస్తుంది.
అలైన్మెంట్ శిక్షణ మా డిప్లాయ్మెంట్ విధానానికి ప్రధానమైనది. అదనపు రక్షణ పొరగా, అసురక్షిత ప్రవర్తనను గుర్తించి అదుపు చేయడంలో సహాయపడేందుకు Codex ఆటో-రివ్యూ(కొత్త విండోలో తెరుచుకుంటుంది), ఏజెంట్ల రీజనింగ్ మరియు చర్యల పర్యవేక్షణ వంటి సిస్టమ్ రక్షణ చర్యలను కూడా రూపొందిస్తున్నాం. మా భద్రతా నవీకరణలో వివరించినట్లుగా, లక్ష్యవిరుద్ధతపై అవగాహన పొందడానికి మరియు దాని అత్యంత తీవ్రమైన సందర్భాలను అదుపు చేయడంలో సహాయపడేందుకు Astra తరగతి మోడల్ల కోసం ఉత్పత్తి వాతావరణంలో లక్ష్యవిరుద్ధత పర్యవేక్షణను కూడా అమలు చేస్తున్నాం. ఈ రక్షణ చర్యలు మా అంతర్గత అమలుల పర్యవేక్షణను పోలి ఉంటాయి. మోడల్ రీజనింగ్, చర్యల్లో అనధికార ప్రవర్తన ఉందా అని పరిశీలించి, సంభావ్య అనధికార కార్యకలాపాన్ని స్వయంచాలకంగా ఆపే వర్గీకరణ వ్యవస్థ ఇందులో ఉంటుంది.
ఆస్ట్రా యొక్క సైబర్సెక్యూరిటీ సామర్థ్యాల్లో గణనీయమైన పెరుగుదలను దృష్టిలో ఉంచుకుని, ఈ డిప్లాయ్మెంట్ను సురక్షితంగా మరియు భద్రంగా చేయడానికి మేము ప్రత్యేక జాగ్రత్తలు తీసుకుంటున్నాము. అదనపు భద్రతా తనిఖీలు కొన్నిసార్లు రక్షణాత్మక సైబర్ భద్రతతో సహా చట్టబద్ధమైన పనిని నెమ్మదింపజేయవచ్చు, తాత్కాలికంగా నిలిపివేయవచ్చు లేదా ఆపివేయవచ్చు. ChatGPT లేదా Codexలో టాస్క్ పాజ్ అయితే, కొనసాగించే ముందు చర్యను సమీక్షించమని మిమ్మల్ని అడగవచ్చు. APIలో, టాస్క్ ఆగిపోతుంది. ఈ తనిఖీలు కొన్నిసార్లు సక్రమమైన పనికి అంతరాయం కలిగించవచ్చు, మరియు అనవసర అంతరాయాలను తగ్గించడానికి మేం ఈ వ్యవస్థను నిరంతరం మెరుగుపరుస్తూనే ఉన్నాము. లక్ష్యవ్యతిరేకత పర్యవేక్షణ లక్ష్యానుసరణకు ప్రత్యామ్నాయం కాదు: మోడల్లు తమకు అనుమతించిన పరిధిలో విశ్వసనీయంగా ఉండేలా రూపొందించడమే మా లక్ష్యం, తద్వారా ఈ రక్షణలు జోక్యం చేసుకోవాల్సిన అవసరం ఉండదు.
లభ్యత
GPT‑6 Astra ఈ రోజు పరిమిత సంఖ్యలో సంస్థలకు అందుబాటులోకి వస్తోంది. రాబోయే రోజుల్లో ఇది అన్ని ChatGPT Plus, Pro, Business మరియు Enterprise యూజర్లకు, అలాగే OpenAI API, Microsoft Azure మరియు AWS Bedrock ద్వారా అందుబాటులోకి వస్తుంది. Astra వినియోగం ప్రస్తుత సబ్స్క్రిప్షన్ అలవెన్స్లలో చేర్చబడింది—యూజర్లు మరియు వ్యాపారాలు అదనపు వినియోగం కోసం క్రెడిట్స్ను కూడా కొనుగోలు చేయగలరు. Pro, Business మరియు Enterprise ప్లాన్లలోని యూజర్లకు GPT‑6 Astra Pro యాక్సెస్ కూడా లభిస్తుంది. Enterprise అడ్మినిస్ట్రేటర్లు తమ వర్క్స్పేస్ కోసం Astraను ప్రారంభించవచ్చు; ప్రారంభ సమయంలో యాక్సెస్ డిఫాల్ట్గా ఆఫ్లో ఉంటుంది.
అర్హులైన API యూజర్ల కోసం Astra జీరో డేటా రిటెన్షన్కు మద్దతు ఇస్తుంది. అలాగే, గత నెలలో మేం పంచుకున్నట్లుగా, కస్టమర్ గోప్యతను కాపాడుతూ భద్రతా పర్యవేక్షణను బలోపేతం చేయడానికి ప్రైవేట్ భద్రతా ప్రాసెసింగ్ ను పరీక్షిస్తున్నాం.
డెవలపర్ల కోసం, GPT‑6 Astra OpenAI APIలో gpt-6-astra గా మరియు Microsoft Azure మరియు Amazon Bedrock ద్వారా లభ్యమవుతుంది.
OpenAI API స్టాండర్డ్ ధర ప్రతి మిలియన్ ఇన్పుట్ టోకెన్లకు $10 మరియు ప్రతి మిలియన్ అవుట్పుట్ టోకెన్లకు $50. క్యాష్ రీడ్లు మరియు రైట్లకు వేర్వేరు రేట్లు వర్తిస్తాయి. APIలో GPT‑6 Astra కోసం వేగవంతమైన మోడ్ లభ్యమవుతోంది మరియు స్టాండర్డ్ ధరకు 2x చెల్లించి, స్టాండర్డ్ ప్రాసెసింగ్ వేగానికి గరిష్ఠంగా 2x వేగాన్ని అందిస్తుంది.
ప్రొఫెషనల్
ప్రొఫెషనల్ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
ఓపెన్స్కోర్ స్ట్రింగ్ క్వార్టెట్లు (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
అంతర్గత డిజైన్ పనులు | 50.0% | 47.4% | - | 35.8% | - | - |
ఇంటర్నల్ డేటా సైన్స్ టాస్క్లు | 40.9% | 30.5% | - | 34.7% | - | - |
ఆర్టిఫిషియల్ అనాలిసిస్ ఇంటెలిజెన్స్ ఇండెక్స్ v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
కోడింగ్
| కోడింగ్ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (స్కోరు) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 ప్రధాన (స్కోరు) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| అంతర్గత డేటాబేస్ మైగ్రేషన్ పనులు | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| ఆర్టిఫిషియల్ అనాలిసిస్ కోడింగ్ ఏజెంట్ ఇండెక్స్ v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
అకాడెమిక్
అకాడెమిక్ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench సైన్స్ 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
ఫ్రంటియర్మ్యాత్ టియర్ 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
"GPQA డైమండ్" | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity’s Last Exam (సాధనాలతో) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
విజ్ఞానం మరియు హెల్త్
అలైన్మెంట్
అలైన్మెంట్ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
అంతర్గత కంప్యూటర్ వినియోగ భద్రతా బెంచ్మార్క్ (తక్కువైతే మంచిది) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
అంతర్గత కంప్యూటర్ వినియోగ భద్రతా బెంచ్మార్క్, AutoReviewతో (తక్కువగా ఉంటే మంచిది) | 1.8% | 4.3% | - | - | - | - |
అంతర్గత సర్కమ్వెన్షన్ బెంచ్మార్క్ (తక్కువగా ఉంటే మంచిది) | 0.00% | 0.29% | - | - | - | - |
ExploitGym హనీపాట్ (తక్కువగా ఉంటే మంచిది) | 0.0% | 48.2% | - | - | - | - |
అసాధ్యమైన ExploitGym | 100.0% | - | - | - | - | - |
అంతర్గత హాల్యూసినేషన్ బెంచ్మార్క్ (తక్కువైతే మంచిది) | 4.2% | 12.2% | - | - | - | - |
లాంగ్ కాంటెక్ట్స్
లాంగ్ కాంటెక్ట్స్ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
సారాంశాత్మక రిజనింగ్
| అమూర్త రీజనింగ్ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
ఏ ప్రయత్న స్థాయిలోనైనా మూల్యాంకన స్కోర్లు గరిష్ఠంగా ఉంటాయి. GPT మూల్యాంకనాలు మా పరిశోధనా వాతావరణంలో లేదా మా API ద్వారా నిర్వహించబడ్డాయి. సిస్టమ్ ప్రాంప్ట్లు, అందుబాటులో ఉన్న టూల్స్ మొదలైన వాటిలోని తేడాల కారణంగా వీటి అవుట్పుట్ ప్రొడక్షన్ ChatGPT కంటే కొంచెం భిన్నంగా ఉండవచ్చు.
పాదటిప్పణులు
- 1
ARC-AGI-3లో, GPT-6 Astraను మా responses API హార్నెస్తో రన్ చేశాం, ఇది వాస్తవ ప్రపంచ పనితీరుకు మెరుగ్గా సరిపోలేలా రెండు సెట్టింగ్లను మారుస్తుంది. ఈ మార్పులు ప్రత్యేకంగా ARC-AGI-3ను లక్ష్యంగా చేసుకోవు.
- 2
GPT-5.6 Sol అనేది మా API, ChatGPT Codex మరియు ChatGPT వర్క్లో అందుబాటులో ఉన్న వెర్షన్ను సూచిస్తుంది. ChatGPT చాట్లోని వెర్షన్ కొద్దిగా భిన్నంగా ఉంటుంది.
- 3
OSWorld V2-Offline అనేది ఇంటర్నెట్ యాక్సెస్ లేకుండానే పనిచేసే అసలు OSWorld V2 యొక్క ఉపసమితి. OSWorld-V2 Offlineలో Claude మోడల్ పనితీరును రచయితలు అధికారిక లీడర్బోర్డ్లో(కొత్త విండోలో తెరుచుకుంటుంది) పునరుత్పత్తి చేశారు. OSWorld 2.0లో, Claude స్కోర్లు అధికారిక సెట్టింగ్లను ఉపయోగిస్తాయి, Fable 5.1 సిస్టమ్ కార్డ్లోని సవరించిన టాస్క్లు మరియు సవరించిన గ్రేడింగ్ను కాదు.
- 4
- 5
BenchCADలో, Claude స్కోర్లు మూల్యాంకనానికి చేసిన మూడు మార్పులను ప్రతిబింబిస్తాయి, వీటి వివరాలు Fable 5.1 సిస్టమ్ కార్డ్(కొత్త విండోలో తెరుచుకుంటుంది)లో ఉన్నాయి.
- 6
గ్వాంగ్ యాంగ్, విక్టోరియా ఎబర్ట్, నాజిఫ్ టెమెర్, బ్రయాన్ సియువాన్ జెంగ్, లూయిజా పొజ్జోబోన్, మరియు నోవా ఎ. స్మిత్. “LEGATO: టైప్సెట్ OMR కోసం భారీ-స్థాయి ఎండ్-టు-ఎండ్ సాధారణీకరించగల విధానం(కొత్త విండోలో తెరుచుకుంటుంది).” arXiv:2506.19065, 2025.
- 7
మార్క్ ఆర్. హెచ్. గోతమ్, మౌరీన్ రెడ్బాండ్, బ్రూనో బోవర్, మరియు పీటర్ జోనాస్. “ఓపెన్స్కోర్ స్ట్రింగ్ క్వార్టెట్ కార్పస్(కొత్త విండోలో తెరుచుకుంటుంది).” సంగీతశాస్త్రం కోసం డిజిటల్ గ్రంథాలయాలపై 10వ అంతర్జాతీయ సదస్సు కార్యవివరాలు, పుటలు 49–57. ACM, 2023.
- 8
FrontierCodeలో, GPT-6 Astraను Codexలోని దాని డెవలపర్ మెసేజ్లోని ఒక విభాగాన్ని(కొత్త విండోలో తెరుచుకుంటుంది) పోలిన డెవలపర్ మెసేజ్తో అమలు చేశారు: "అధిక సంఖ్యలో టెస్ట్ ఫైళ్లను సృష్టించవద్దు. రిపోజిటరీ సంప్రదాయాల ప్రకారం అవసరమైనప్పుడు లేదా ఇప్పటికే ఉన్న ఏ ఫైల్ కూడా సరైన స్థానంగా లేనప్పుడు మాత్రమే కొత్త టెస్ట్ ఫైల్ను సృష్టించండి. సంబంధం లేని క్లీనప్ మరియు అనవసరమైన సంక్లిష్టతను నివారించండి. ఇప్పటికే ఉన్న తగిన యుటిలిటీలను మళ్లీ ఉపయోగించండి. సంబంధిత రిపోజిటరీ సూచనలను చదవండి మరియు సమీపంలోని కోడ్, టెస్టులు, డాక్యుమెంటేషన్, మరియు CIని పరిశీలించండి. స్థిరపడిన పద్ధతులను అనుసరించండి. లక్ష్యం శుభ్రమైన, మెర్జ్ చేయగలిగే కోడ్." ఎవల్ కోసం ప్రాంప్ట్ ఆప్టిమైజ్ చేయబడలేదు.
- 9
మొదటిది, సంఖ్యారేఖపై ఎంత దూరం ముందుకు వెళ్లినా, అభాజ్య సంఖ్యలు ఒకదానికొకటి ఎంత దగ్గరగా కనిపించగలవన్న విషయానికి సంబంధించినది. దశాబ్దానికి పైగా, అత్యుత్తమంగా తెలిసిన ఫలితం అనంతంగా అనేక అభాజ్య సంఖ్యల జంటలు గరిష్ఠంగా 246 తేడాతో ఉంటాయని స్థాపించింది. జూలియా స్టాడ్ల్మాన్(కొత్త విండోలో తెరుచుకుంటుంది) ఇటీవల ఆ హద్దును 240కి మెరుగుపరిచారు. ఆస్ట్రా 186 అనే మరింత బలమైన పరిమితిని స్థాపించడంలో సహాయపడింది, ఈ చిన్న దూరంలో అనంతంగా అనేక జంటలు సంభవించాయని చూపించింది. అభాజ్య సంఖ్యల మధ్య చిన్న అంతరాలు: నిరూపణ(కొత్త విండోలో తెరుచుకుంటుంది) మరియు మద్దతు ఇచ్చే పరిశోధన(కొత్త విండోలో తెరుచుకుంటుంది).
- 10
రెండవది ప్రధాన సంఖ్యల మధ్య అసాధారణంగా పెద్ద అంతరాలకు సంబంధించినది. ఆస్ట్రా 80 సంవత్సరాలకు పైగా మార్పులేకుండా ఉన్న ఈ అంతరాలపై పరిమితిలోని ఒక పదాన్ని మెరుగుపరిచింది. రెండు ఫలితాల కోసం రుజువులు, సంక్షిప్త చెయిన్-ఆఫ్-థాట్, మరియు ధృవీకరణ సామగ్రిని మేం పంచుకుంటున్నాం. ప్రధాన సంఖ్యల మధ్య పెద్ద అంతరాలు: నిరూపణ(కొత్త విండోలో తెరుచుకుంటుంది) మరియు సహాయక పరిశోధన(కొత్త విండోలో తెరుచుకుంటుంది).
- 11
- 12
- 13
- 14
ExploitBench (జూన్–ఆగస్టు 2026)లో 13 స్థిరమైన Chrome విడుదలల్లో ఉన్న హై తీవ్రతగల 20 V8 లోపాలు ఉన్నాయి. పేర్కొన్న ప్రతి భద్రతా లోపాన్ని వినియోగించడం ద్వారా, ఏజెంట్లు V8 మరియు Linux కోసం అధికారిక Chrome విడుదలల్లో ఇష్టానుసార కోడ్ అమలును సాధించగలరా అనే విషయాన్ని ఈ బెంచ్మార్క్ పరీక్షిస్తుంది. చేర్చబడిన కొన్ని బలహీనతలు మూల్యాంకన పరిమితుల కింద ఇష్టానుసార కోడ్ అమలును అనుమతించకపోవచ్చు, కాబట్టి 100% విజయ రేటు సాధ్యం కాకపోవచ్చు. గమనిక: GPT-5.6 Sol యొక్క 5.5% స్కోరు బెంచ్మార్క్లోని 300-టర్న్ పరిమితి వల్ల ఏర్పడిన ఆర్టిఫ్యాక్ట్; ఇది మ్యాక్స్ను ఉపయోగించే నిజమైన కస్టమర్లకు ఉండే పరిమితి కాదు. తక్కువ పరిమితులను ఎదుర్కొన్నప్పుడు, మోడల్ సారూప్య సెట్టింగ్లలో 11.5% స్కోర్ను సాధించింది.
- 15
జెరెమీ స్పెన్స్ తదితరులు. “ఏజెంటిక్ సైబర్ భద్రతకు తదుపరి సవాలు: వాస్తవికమైన, కంటామినేషన్-రహిత రివర్స్ ఇంజినీరింగ్ బెంచ్మార్క్(కొత్త విండోలో తెరుచుకుంటుంది).” arXiv:2608.11469v1, 2026.
- 16
మేం థర్డ్-పార్టీ మోడల్లలో పరీక్షించినప్పుడు, మరింత సరళమైన పరిశోధనా సెటప్ను ఉపయోగిస్తాం. Codex మరింత సంక్లిష్టమైన ప్రొడక్షన్ కాన్ఫిగరేషన్ను కలిగి ఉంటుంది, దీని వల్ల రా-మోడల్ ఎర్రర్ రేట్లు భిన్నంగా ఉండవచ్చు. ప్రొవైడర్-వైపు రక్షణలు మరియు కంప్యూటర్-టూల్ అమలులు ఇప్పటికీ భిన్నంగా ఉన్నాయి. ఇది అంతర్గత పరిశోధనా కాన్ఫిగరేషన్ కాబట్టి, వినియోగదారులు Codexలో నిర్ధారణ అవసరం లేని పరిస్థితిని అనుభవించరు.
- 17
