GPT‑6 Sol, Luna పరిచయం
మీ రోజువారీ పనిలో అత్యాధునిక ఇంటెలిజెన్స్ను ఉపయోగించడానికి మరిన్ని మార్గాలు.
ఈ నెల ప్రారంభంలో, ప్రపంచంలోనే అత్యంత తెలివైన, అత్యుత్తమంగా సమలేఖనం చేసిన మోడల్ అయిన GPT‑6 Astraను పరిచయం చేశాం. అత్యంత క్లిష్టమైన, ముఖ్యమైన ప్రాజెక్టులకు ఇప్పటికీ Astra పూర్తి సామర్థ్యం అవసరమైనప్పటికీ, పని వివిధ స్థాయులు, వేగాలు, బడ్జెట్లలో జరుగుతుంది.
అందుకే GPT‑6 Sol, GPT‑6 Lunaలను చేర్చి GPT‑6 పరిధిని విస్తరిస్తున్నాం. GPT‑6 Astra కొత్త తరం ఇంటెలిజెన్స్ను పరిచయం చేసింది. వ్యయ సామర్థ్యంలో అత్యాధునిక ప్రమాణాలను ముందుకు తీసుకెళ్లడం ద్వారా ఈ మోడల్లు ఆ ఇంటెలిజెన్స్ ప్రయోజనాలను మరింత విస్తృతంగా అందిస్తాయి. వృత్తిపరమైన పని, వాస్తవికత, కోడింగ్, కంప్యూటర్ వినియోగం, సమలేఖనంలో Astra అత్యాధునిక పనితీరుకు కారణమైన పురోగతిని వేగవంతమైన, తక్కువ ధర మోడల్లకు అందించేందుకు GPT‑6 Astraకు ఉపయోగించిన పద్ధతులనే GPT‑6 Sol, Luna శిక్షణకు కూడా ఉపయోగించాం.
GPT‑6 మోడల్లు వ్యయం–ఇంటెలిజెన్స్ పరిధి అంతటా అగ్రస్థానంలో ఉన్నాయి. ప్రతి శ్రేణిలో అసాధారణ సామర్థ్యాలను, వాటిని భారీ స్థాయిలో సమర్థంగా అందించే మౌలిక సదుపాయాలతో మేళవిస్తాయి. క్యాషింగ్, ఇన్ఫరెన్స్ మెరుగుదలలతో ఈ మోడల్లను తక్కువ ఖర్చుతో అందించగలుగుతున్నాం. GPT‑5.6 ప్రచార ధరలతో పోలిస్తే Sol, Luna ఏపీఐ ధరలను 50% తగ్గించడం ద్వారా ఆ ఆదాను నేరుగా వినియోగదారులు, కస్టమర్లకు అందిస్తున్నాం. ఈ మెరుగుదలలన్నీ కలిసి, మరిన్ని రోజువారీ పనులు, భారీ స్థాయి అనువర్తనాల్లో అధునాతన కృత్రిమ మేధ వినియోగాన్ని ఆచరణీయంగా చేస్తాయి.
మోడల్ | ఇన్పుట్ | అవుట్పుట్ | ధర తగ్గింపు |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% తక్కువ ధర |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% తక్కువ ధర |
ధరలు ప్రతి 10 లక్షల టోకెన్లకు వర్తిస్తాయి.
GPT‑6 Astra అన్ని అంశాల్లోనూ మా అత్యుత్తమ మోడల్గా కొనసాగుతోంది. అత్యుత్తమ ఫలితాలు, రాజీలేని అనుభవం కావాలంటే దీన్ని ఎంచుకోండి.
క్లిష్టమైన పనులను పూర్తి చేయడానికి అత్యంత ఉపయోగకరమైన సామర్థ్యాల్లో, మీకు ఇప్పటికే పరిచయమున్న మోడల్లకు GPT‑6 Sol, Luna మెరుగైన ఇంటెలిజెన్స్ను, వ్యయ సామర్థ్యాన్ని అందిస్తాయి.
GPT‑6 Sol క్లిష్టమైన పనులను నిర్వహించగలదు. అధిక వినియోగ పరిమితులు, తక్కువ ఖర్చుతో పునరావృతంగా మెరుగుపరచుకోవడానికి మీకు మరింత వెసులుబాటు ఇస్తూ, అదే ధరలోని పోటీ మోడల్ల కంటే ఎక్కువ ఇంటెలిజెన్స్ను, మెరుగైన ఫలితాలను అందిస్తుంది.
యాప్లలో వ్యాపార కార్యప్రవాహాలను పరీక్షించే AutomationBenchలో, ఎక్స్హై శ్రమతో GPT‑6 Sol, గరిష్ఠ శ్రమతో Claude Opus 5ను మించిపోతుంది. ప్రతి పనికి Opus 5 ఖర్చులో కేవలం 9% మాత్రమే అవుతుంది. హై శ్రమ వద్ద, GPT‑6 Luna తన మునుపటి మోడల్ కంటే 5.4 శాతం పాయింట్లు మెరుగైన ఫలితాన్ని, ప్రతి పనికి 58% తక్కువ ఖర్చుతో సాధిస్తుంది.
AutomationBench 1.0.6లో(కొత్త విండోలో తెరుచుకుంటుంది), విక్రయాలు, మార్కెటింగ్, కార్యకలాపాలు, మద్దతు, ఆర్థిక వ్యవహారాలు, మానవ వనరుల విభాగాల్లో 47 సాధనాలను ఉపయోగించే సమగ్ర కార్యప్రవాహాలపై కృత్రిమ మేధ ఏజెంట్లను పరీక్షిస్తారు. దాదాపు 40% పనుల్లో జరిగిన Opus 5 ప్రత్యామ్నాయ వినియోగ ఖర్చును మినహాయించినందున, Claude Fable 5.1 డేటా పాయింట్ దాని వాస్తవ ఖర్చును తక్కువగా చూపుతుంది.
GPT‑6 Sol ఎంతో తక్కువ ఖర్చుతో Claude Fable 5.1ను మించడమే కాకుండా, తక్కువ శ్రమతో పనిచేసే GPT‑6 Astra కంటే కూడా మెరుగ్గా పనిచేస్తుంది.
మోడల్ (మరియు శ్రమ) | స్కోర్ | ప్రతి పనికి ఖర్చు |
|---|---|---|
GPT‑6 Sol (ఎక్స్హై) | 33.2% | $0.27 |
GPT‑6 Astra (తక్కువ) | 30.3% | GPT‑6 Sol కంటే 3.9 రెట్లు |
Claude Opus 5 (మ్యాక్స్) | 26.9% | GPT‑6 Sol కంటే 11.1 రెట్లు |
Opus 5 ప్రత్యామ్నాయంతో Claude Fable 5.1 (మ్యాక్స్) | 31.4% | GPT‑6 Sol కంటే >8.9 రెట్లు (ప్రత్యామ్నాయ వినియోగ ఖర్చు నివేదించలేదు) |
క్లిష్టమైన వృత్తిపరమైన కార్యప్రవాహాల్లో ఏజెంట్లను అంచనా వేసే Agents’ Last Examలో, గరిష్ఠ శ్రమతో GPT‑6 Sol 56.4% స్కోర్ సాధించింది. ఇది మూల్యాంకనంలో Claude Opus 5 అత్యధిక స్కోర్ కంటే ఎక్కువ, అదీ ప్రతి పనికి 60% తక్కువ ఖర్చుతో.
Agents’ Last Exam V1లో(కొత్త విండోలో తెరుచుకుంటుంది), కంప్యూటర్పై నిర్వహించే వృత్తిపరమైన పనిలోని దాదాపు అన్ని ప్రధాన రంగాలను కవర్ చేసే 55 ఉపపరిశ్రమల్లో, సుదీర్ఘ వ్యవధి గల ఆర్థిక విలువ కలిగిన పనులపై కృత్రిమ మేధ ఏజెంట్లను అంచనా వేస్తారు.
సమాధానం ఉపయోగకరంగా ఉండటం వాస్తవాలు సరైనవిగా ఉండటంపై ఆధారపడి ఉంటుంది. వాస్తవిక విశ్వసనీయతను మెరుగుపరచడంలో మేం పురోగతిని కొనసాగిస్తున్నాం. మా మోడల్లు చేసిన తప్పులను వినియోగదారులు గుర్తించిన, వ్యక్తిగత గుర్తింపులు తొలగించిన వాస్తవ సంభాషణల ఆధారంగా నిర్వహించిన అంతర్గత వాస్తవికత మూల్యాంకనంలో, GPT‑6 Sol తన మునుపటి మోడల్తో పోలిస్తే దాదాపు సగం తప్పులే చేస్తూ, ఎంతో తక్కువ ఖర్చుతో Astra స్థాయి విశ్వసనీయతకు చేరువైంది. GPT‑6 Luna కూడా గణనీయంగా మెరుగైంది. అధిక శ్రమ స్థాయుల్లో, దాదాపు వందో వంతు ఖర్చుతో GPT‑5.6 Sol పనితీరును అందిస్తుంది.
ఇక్కడ, మునుపటి మోడల్ చేసిన వాస్తవిక తప్పును వినియోగదారులు గుర్తించిన, వ్యక్తిగత గుర్తింపులు తొలగించిన ChatGPT సంభాషణలపై వాస్తవికతను అంచనా వేస్తాం. తప్పులను ప్రేరేపించే ఈ సంభాషణలు సాధారణ వినియోగానికి ప్రాతినిధ్యం వహించవు. సాధారణ వినియోగంలో వాస్తవిక తప్పులు మరింత అరుదు. సమాధానాల నిడివిని నియంత్రించి స్కోర్లను లెక్కించలేదు. అయితే, విభిన్న నిడివులతో చేసిన మా పరీక్షల్లో సమాధానం పొడవుపై దాదాపు ఎలాంటి ఆధారపడటం కనిపించలేదు.
ఈ సంవత్సరం, కోడింగ్ ఏజెంట్లు గతంలో ఎన్నడూ లేనంత సంక్లిష్టత, విస్తృతి, వ్యవధి కలిగిన పనులను చేపట్టడం ప్రారంభించాయి. OpenAIలో మా అంతర్గత వినియోగం విపరీతంగా పెరిగింది. ఏపీఐ ధరల ప్రకారం లెక్కిస్తే, రోజువారీ టోకెన్ వినియోగం మధ్యస్థ పరిశోధకుడికి $600, 90వ పర్సెంటైల్లోని పరిశోధకులకు $7,000 దాటింది. (పరిశోధన వేగవంతం: OpenAIలో అంతర్గత దృశ్యం). కోడింగ్ ఏజెంట్లు సుదీర్ఘమైన, మరింత క్లిష్టమైన పనులను చేపడుతున్న కొద్దీ, నిరంతర వినియోగ వ్యయం మరింత ప్రాధాన్యం సంతరించుకుంటుంది. GPT‑6 Sol, Lunaలు బలమైన కోడింగ్ పనితీరును తక్కువ ఏపీఐ ధరలతో మేళవిస్తాయి. దీనివల్ల డెవలపర్లకు పునరావృతంగా మెరుగుపరచుకోవడానికి మరింత వెసులుబాటు, Codexకు అప్పగించే పనుల్లో మరింత ప్రతిష్ఠాత్మక లక్ష్యాలు పెట్టుకునే విశ్వాసం బృందాలకు లభిస్తాయి.
వాస్తవ కోడ్బేస్లలో విలీనం చేయడానికి సిద్ధంగా ఉన్న మార్పులను కోడింగ్ ఏజెంట్లు రూపొందిస్తాయా అని అంచనా వేసే FrontierCodeలో, GPT‑6 Sol, GPT‑5.6 Sol కంటే గణనీయంగా మెరుగుపడి, ఎంతో తక్కువ ఖర్చుతో Claude Fable 5.1 ఎక్స్హై పనితీరును అందిస్తుంది.
FrontierCode 1.1 Mainలో(కొత్త విండోలో తెరుచుకుంటుంది), కృత్రిమ మేధ ఏజెంట్లు కోడ్ను రాస్తాయి. దాన్ని కేవలం సవ్యత ఆధారంగానే కాకుండా, పరీక్షల నాణ్యత, పరిధి నియంత్రణ, కోడ్ శైలి, కోడ్బేస్ ప్రమాణాల అనుసరణ వంటి అంశాలతో కూడిన “విలీనయోగ్యత” ఆధారంగా కూడా మదింపు చేస్తారు.
వాస్తవ కోడ్బేస్లలో క్లిష్టమైన సాఫ్ట్వేర్ ఇంజినీరింగ్ పనులపై పనితీరును పరీక్షించే DeepSWE v1.1లో, గరిష్ఠ శ్రమతో GPT‑6 Sol 68.8% స్కోర్ సాధించింది. ఇది మూల్యాంకనంలో ఎక్స్హై శ్రమతో Claude Fable 5 సాధించిన అత్యధిక స్కోర్ 69.9% కంటే కేవలం 1.1 శాతం పాయింట్లు తక్కువ, అదీ ప్రతి పనికి దాదాపు 80% తక్కువ ఖర్చుతో.
గరిష్ఠ శ్రమతో GPT‑6 Luna 66.6% స్కోర్ సాధించింది. ఇది మీడియం శ్రమతో Claude Opus 5, Fable 5 పనితీరుతో సమానం. ఈ పోలికల్లో, ప్రతి పనికి Luna ఖర్చు Opus 5 కంటే 93%, Fable 5 కంటే 96% తక్కువ.
DeepSWE 1.1లో(కొత్త విండోలో తెరుచుకుంటుంది), కృత్రిమ మేధ ఏజెంట్లు సుదీర్ఘ వ్యవధి గల అసలైన సాఫ్ట్వేర్ ఇంజినీరింగ్ పనులను పరిష్కరిస్తాయి.
కంప్యూటర్ వినియోగంలో GPT‑6 Astra ప్రపంచంలోనే అత్యుత్తమ మోడల్గా కొనసాగుతుండగా, GPT‑6 Sol, Luna తమ మునుపటి మోడల్ల కంటే మెరుగైన వ్యయ సామర్థ్యంతో పనితీరును అందిస్తాయి. OSWorld 2.0 ఆఫ్లైన్లో, ఎక్స్హై శ్రమతో GPT‑6 Sol, మీడియం శ్రమతో Claude Opus 5 సాధించిన స్కోర్కు సమీపంగా 60.5% స్కోర్ సాధించింది. Opus స్కోర్ 60.3%. అదీ ప్రతి పనికి దాదాపు 80% తక్కువ ఖర్చుతో. GPT‑6 Luna (మ్యాక్స్), పదో వంతు ఖర్చుతో GPT‑5.6 Sol (మీడియం)ను మించగలదు.
OSWorld 2.0లో(కొత్త విండోలో తెరుచుకుంటుంది), రోజువారీ, వృత్తిపరమైన పనులతో కూడిన సుదీర్ఘ కంప్యూటర్ వినియోగ కార్యప్రవాహాలను కృత్రిమ మేధ ఏజెంట్లు నిర్వహించడానికి ప్రయత్నిస్తాయి. v2026.08.08 విడుదలలోని ఆఫ్లైన్ సమితిపై వచ్చిన పాక్షిక ప్రతిఫలాన్ని మేం నివేదిస్తున్నాం.
GPT‑6 Astraలో మెరుగుపరిచిన సంభాషణ శైలిని Sol, Lunaలకు కూడా అందించాం. ముఖ్యంగా సాంకేతిక, కోడింగ్ సంభాషణల్లో ఈ మార్పు స్పష్టంగా కనిపిస్తుందని భావిస్తున్నాం. సారాంశాన్ని కోల్పోకుండానే మరింత స్పష్టత, తక్కువ పరిభాష, తక్కువ అసహజ పదబంధాలు, తక్కువ విలువైన వివరాల తగ్గింపు, మొత్తంగా కాస్త సంక్షిప్తమైన సమాధానాలను ఆశించవచ్చు.
శైలి వ్యక్తిగత అభిరుచిపై ఆధారపడినప్పటికీ, ఇక్కడ GPT‑6 Sol సమాధానాన్నే మేం మెచ్చుకుంటాం. అది తొందరగా నిర్ధారణలకు రాదు, ప్రశ్నించినవారికి స్పష్టంగా తెలిసే వివరాలను మళ్లీ చెప్పడానికి తక్కువ సమయం వెచ్చిస్తుంది. ఉదాహరణకు, వెబ్సైట్లో నాలుగు పేజీలు ఉన్నాయని పునరుద్ఘాటించదు. “బెంటో అనుభూతి”, “ఆ వ్యవస్థ చుట్టూ పునర్నిర్మించడం” వంటి అస్పష్టమైన భాషను తక్కువగా వాడుతుంది, తాను తనిఖీ చేసినవాటిని, చేయనివాటిని మరింత స్పష్టంగా చెబుతుంది, తన చిత్ర సాధన ప్రాంప్ట్ వంటి అమలు వివరాలను అనవసరంగా పంచుకోదు.
టోకెన్ ధరలను తగ్గించడంతో పాటు, GPT‑6పై నిర్మించే డెవలపర్లు తమ అనువర్తనాలు తిరిగి ఉపయోగించే సందర్భ సమాచారంపై మరింత ఆదా చేయడానికి సహాయపడుతున్నాం. డిఫాల్ట్గా అధిక క్యాష్ హిట్ రేట్లు అందించేలా GPT‑6 ప్రాంప్ట్ క్యాషింగ్ను మెరుగుపరిచాం. దీంతో ఏజెంట్లు మరింత సందర్భ సమాచారాన్ని తిరిగి ఉపయోగించగలవు, వేగంగా స్పందించగలవు, క్యాష్ చేసిన ఇన్పుట్ టోకెన్ రీడ్లపై 90% రాయితీ పొందగలవు.
డెవలపర్లు తమ క్యాషింగ్ పనితీరును కొలవడానికి, మెరుగుపరచడానికి ఇప్పుడు మరిన్ని మార్గాలు ఉన్నాయి:
పర్యవేక్షించి, సమస్యను నిర్ధారించండి. ప్రాంప్ట్ క్యాషింగ్ డ్యాష్బోర్డ్(కొత్త విండోలో తెరుచుకుంటుంది) ఎంత ఇన్పుట్ క్యాష్ అయిందో, కాలక్రమంలో అది ఎలా మారుతుందో చూపుతుంది. రోగనిర్ధారణ సాధనం(కొత్త విండోలో తెరుచుకుంటుంది) క్యాషింగ్ అవకాశాలు ఎందుకు చేజారాయో, దేన్ని సరిచేయాలో వివరిస్తుంది.
క్యాష్కు అంతరాయం కలగకుండా రీజనింగ్ శ్రమను, సాధనాల లభ్యతను సర్దుబాటు చేయండి. క్లిష్టమైన పనులకు రీజనింగ్ శ్రమను(కొత్త విండోలో తెరుచుకుంటుంది) పెంచండి లేదా సరళమైన తదుపరి ప్రశ్నలకు తగ్గించండి. మీ ఏజెంట్ అవసరాలు మారే కొద్దీ సాధనాలను ప్రారంభించండి లేదా నిలిపివేయండి(కొత్త విండోలో తెరుచుకుంటుంది). ఇప్పుడు ఈ రెండు నియంత్రణలూ క్యాష్లో తిరిగి ఉపయోగించడానికి మునుపటి సందర్భ సమాచారాన్ని భద్రపరుస్తాయి.
ఏ ప్రిఫిక్స్లను క్యాష్ చేయాలో అనుకూలపరచండి. స్పష్టమైన విరామ బిందువులతో క్యాష్ చేసిన ప్రాంప్ట్ ప్రిఫిక్స్లు ఎక్కడ ముగియాలో డెవలపర్లు ఎంచుకోవచ్చు. దీనివల్ల క్యాష్ పునర్వినియోగంపై డెవలపర్లకు మరింత నియంత్రణ లభించి, పనితీరు మెరుగుపడవచ్చు.
గత కొన్ని నెలల్లో, OpenAI మోడల్లకు వచ్చిన వందల కోట్ల అభ్యర్థనల్లో కొత్తగా ప్రాసెస్ చేయాల్సిన ప్రాంప్ట్ టోకెన్ల వాటాను ఈ మెరుగుదలలు 50% కంటే ఎక్కువ తగ్గించాయని GitHub తెలిపింది. దీంతో Copilot వేగంగా స్పందించగలుగుతోంది.
ఇప్పటివరకు మా అత్యుత్తమ సమలేఖన మోడల్ అయిన Astraతో పరిచయం చేసిన సమలేఖన కృషిని GPT‑6 Sol, Luna మరింత ముందుకు తీసుకెళ్తాయి. మా సమలేఖన మూల్యాంకనాల్లో, Sol, Luna రెండూ తమ GPT‑5.6 మోడల్లతో పోలిస్తే మెరుగయ్యాయి. కోడింగ్ పనిపై తప్పుదారి పట్టించే వాదనలు చేసే రేట్లు కూడా తగ్గాయి.
దిగువ మూల్యాంకనాలు ఉద్దేశపూర్వకంగా క్లిష్టమైన పరిస్థితులను పరీక్షిస్తాయి. ఇవి సాధారణ వినియోగంలోని వైఫల్య రేట్లను కొలవవు. పూర్తి ఫలితాల కోసం సిస్టమ్ కార్డ్ను(కొత్త విండోలో తెరుచుకుంటుంది) చూడండి.
Plus, Pro, Business, Enterprise, Edu వినియోగదారులందరికీ GPT‑6 Sol, GPT‑6 Luna నేటి నుంచి ChatGPT వర్క్, Codexలో అందుబాటులో ఉన్నాయి. Free, Go వినియోగదారులు డెస్క్టాప్ యాప్లో GPT‑6 Lunaను ఉపయోగించవచ్చు. ఈ మోడల్లు ఇంకా చాట్లో అందుబాటులో లేవు. OpenAI ఏపీఐలో ఇవి gpt-6-sol, gpt-6-luna పేర్లతో అందుబాటులో ఉన్నాయి.
అందరికీ సేవ స్థిరంగా ఉండేలా, ఈ మోడల్లను రోజంతా దశలవారీగా ChatGPTలో అందుబాటులోకి తీసుకురావాలని భావిస్తున్నాం. ChatGPT వర్క్ లేదా Codexలో కొత్త మోడల్లు కనిపించకపోతే, దయచేసి కొంతసేపటి తర్వాత మళ్లీ ప్రయత్నించండి.
GPT మూల్యాంకనాలను మా పరిశోధన వాతావరణంలో లేదా మా ఏపీఐ ద్వారా నిర్వహించాం. సిస్టమ్ ప్రాంప్ట్లు, అందుబాటులో ఉన్న సాధనాలు మొదలైన వాటిలో తేడాల కారణంగా, ఉత్పత్తి ChatGPTతో పోలిస్తే ఇవి కాస్త భిన్నమైన అవుట్పుట్ను ఇవ్వవచ్చు. పోటీ మోడల్ల మూల్యాంకనాలను బహిరంగంగా అందుబాటులో ఉన్న నివేదికల నుంచి తీసుకున్నాం. Claude Fable 5.1 స్కోర్లు అందుబాటులో లేనప్పుడు Claude Fable 5 స్కోర్లను నివేదించాం.


