ప్రధాన కంటెంట్‌కి దాటండి
OpenAI

GPT-6.1Sol

ఐదో వంతు ధరకే Astraకు దగ్గరగా ఉండే మేధస్సుతో నిరంతర అత్యాధునిక పనితీరు

GPT‑6 Solకు మెరుగైన రూపమైన GPT‑6.1 Solను పరిచయం చేస్తున్నాం. ఇది ఏజెంటిక్ కోడింగ్‌తో పాటు కంప్యూటర్ వినియోగం, వృత్తిపరమైన పనుల్లో అసాధారణ పనితీరును అందిస్తుంది. Astra ప్రామాణిక ఇన్‌పుట్, అవుట్‌పుట్ టోకెన్ ధరల్లో ఐదో వంతుకే, కఠినమైన పనుల్లో Solను GPT‑6 Astraకు చేరువ చేస్తుంది. అదే బడ్జెట్‌లో సమర్థవంతమైన ఏజెంట్లను రూపొందించి నడిపేందుకు డెవలపర్లకు మరింత వెసులుబాటు ఇస్తుంది.

Sol ధరకే Astraకు దగ్గరగా ఉండే పనితీరును GPT‑6.1 Sol అందిస్తుంది. అందువల్ల నేడు అందుబాటులో ఉన్న వాటిలో, తన పనితీరుకు తగిన వ్యయ సామర్థ్యంలో ఇదే అత్యుత్తమ మోడల్. కాష్ చేసిన ఇన్‌పుట్‌కు పది లక్షల టోకెన్‌లకు కేవలం $0.10 ఖర్చవుతుంది—ప్రామాణిక ఇన్‌పుట్ ధరపై 95% తగ్గింపు. పదేపదే వచ్చే అభ్యర్థనల్లో సందర్భాన్ని తిరిగి వాడుకోవాల్సిన ఏజెంటిక్ పనులకు ఇది మరింత చవకగా ఉంటుంది.

మొత్తం మీద GPT‑6 Astra మా అత్యంత సమర్థవంతమైన అత్యాధునిక మోడల్‌గా కొనసాగుతుంది. వినియోగదారులు మరింత తరచుగా చేయాలనుకునే ముఖ్యమైన పనులకు, భారీ స్థాయిలో అప్లికేషన్‌లను రూపొందించి నడిపే API కస్టమర్లకు, సామర్థ్యం–ఖర్చు మధ్య GPT‑6.1 Sol కొత్త సమతుల్యతను అందిస్తుంది.

మూడు మోడల్ కార్డులు: GPT-6 Astra, ఉత్తమ ఫలితాల కోసం మా అత్యంత తెలివైన మోడల్, ఇన్‌పుట్ $10, అవుట్‌పుట్ $50, కాష్ చేసిన ఇన్‌పుట్ $1; GPT-6.1 Sol, ఐదో వంతు ధరకే Astraకు దగ్గరగా ఉండే మేధస్సు, ఇన్‌పుట్ $2, అవుట్‌పుట్ $10, కాష్ చేసిన ఇన్‌పుట్ $0.10; GPT-6 Luna, భారీ స్థాయిలో రోజువారీ పనులను వేగంగా, సమర్థంగా చేయడానికి, ఇన్‌పుట్ $0.10, అవుట్‌పుట్ $0.50, కాష్ చేసిన ఇన్‌పుట్ $0.01.

వివిధ పనుల్లో మరింత సమర్థవంతమైన Sol

కోడ్ రాయడం, లోపాలను సరిచేయడం నుంచి డాక్యుమెంట్లను అర్థం చేసుకోవడం, పలు దశల బిజినెస్ కార్యప్రవాహాలను అమలు చేయడం వరకు, సంక్లిష్ట వృత్తిపరమైన పనుల్లో GPT‑6 Sol కంటే GPT‑6.1 Sol గణనీయంగా మెరుగైంది. ఈ మూల్యాంకనాల్లో అనేక చోట్ల, ఎంతో తక్కువ ఖర్చుతో GPT‑6 Astra పనితీరుకు చేరువైంది.

కోడింగ్

వాస్తవ కోడ్‌బేస్‌లలో సంక్లిష్ట సాఫ్ట్‌వేర్ ఇంజినీరింగ్ పనులను మూల్యాంకనం చేసే DeepSWE v1.1లో, సుమారు ఐదో వంతు ఖర్చుతోనే GPT‑6.1 Sol, GPT‑6 Astraతో సమానంగా నిలిచింది. తక్కువ రీజనింగ్ ప్రయత్నం, ఖర్చుతోనే GPT‑6 Sol అత్యుత్తమ స్కోర్‌ను 6.4 శాతం పాయింట్లతో అధిగమించింది.

DeepSWE 1.1⁠⁠(కొత్త విండోలో తెరుచుకుంటుంది)లో కృత్రిమ మేధ ఏజెంట్లు కొత్తగా రూపొందించిన, సుదీర్ఘ ప్రక్రియతో కూడిన సాఫ్ట్‌వేర్ ఇంజినీరింగ్ పనులను పూర్తి చేస్తాయి.

వృత్తిపరమైన పని

పట్టికలు, చార్ట్‌లు, రేఖాచిత్రాలు, చిన్న అక్షరాల్లోని వివరాలతో కూడిన సంక్లిష్ట PDF డాక్యుమెంట్లను ఉపయోగించి వృత్తిపరమైన ప్రశ్నలకు మోడళ్లు ఎంత కచ్చితంగా జవాబిస్తాయో GDP.pdf కొలుస్తుంది. పరీక్షించిన రీజనింగ్ సెట్టింగ్‌లలో, ప్రత్యామ్నాయాలతో కూడిన Opus 5.5 కంటే GPT‑6.1 Sol అధిక స్కోర్ సాధించింది; ఒక్కో పనికి ఖర్చు సగం కంటే తక్కువే. అలాగే, ఒక్కో పనికి సుమారు ఐదో వంతు ఖర్చుతో GPT‑6 Astra అత్యుత్తమ పనితీరుకు చేరువైంది.

GDP.pdf⁠(కొత్త విండోలో తెరుచుకుంటుంది)లో ఆర్థిక, ఆరోగ్య సంరక్షణ, న్యాయ రంగాలతో పాటు మరో ఏడు వృత్తి రంగాల్లోని పని ప్రక్రియల నుంచి సేకరించిన సంక్లిష్ట పీడీఎఫ్‌లపై వాస్తవ పరిస్థితులకు సంబంధించిన ప్రశ్నలకు నమూనాలు సమాధానాలు ఇవ్వాలి.

ఏజెంట్లు పలు దశల బిజినెస్ కార్యప్రవాహాలను సరిగ్గా పూర్తి చేస్తాయో లేదో కొలిచే AutomationBenchలో, మీడియం రీజనింగ్ ప్రయత్న స్థాయిలో GPT‑6.1 Sol, Opus 5.5 కంటే 2.2 శాతం పాయింట్లు అధిక స్కోర్ సాధించింది. ఖర్చు సుమారు మూడో వంతే. అదే సెట్టింగ్‌లో GPT‑6 Sol కంటే కూడా ఈ స్కోర్ 4.8 శాతం పాయింట్లు ఎక్కువ.

In AutomationBench 1.0.6⁠⁠(కొత్త విండోలో తెరుచుకుంటుంది), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

కంప్యూటర్ వినియోగం

కంప్యూటర్ అప్లికేషన్‌లతో పనిచేయాల్సిన పనుల్లోనూ GPT‑6.1 Sol గణనీయమైన పురోగతి సాధించింది. కఠినమైన కంప్యూటర్ వినియోగ కార్యప్రవాహాలపై ఏజెంట్లను మూల్యాంకనం చేసే OSWorld 2.0 ఆఫ్‌లైన్ సమితిలో, గరిష్ఠ రీజనింగ్ ప్రయత్న స్థాయిలో GPT‑6.1 Sol, GPT‑6 Solను ఏడు శాతం పాయింట్లతో అధిగమించింది. ఖర్చు సగం కంటే తక్కువే. గరిష్ఠ రీజనింగ్ ప్రయత్న స్థాయిలో Astra స్కోర్‌కు కేవలం 2.1 శాతం పాయింట్ల తేడాలో నిలిచింది. ఒక్కో పనికి ఖర్చు సుమారు ఏడో వంతే.

In OSWorld 2.0⁠⁠(కొత్త విండోలో తెరుచుకుంటుంది), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

శాస్త్రీయ పరిశోధన

డేటా విశ్లేషణ, అనుకరణ, సిద్ధాంత నిరూపణ వంటి శాస్త్రీయ కార్యప్రవాహాలను మూల్యాంకనం చేసే Terminal-Bench Science 0.1లో, గరిష్ఠ రీజనింగ్ ప్రయత్న స్థాయిలో GPT‑6.1 Sol స్కోర్, GPT‑6 Sol స్కోర్‌కు రెట్టింపు కంటే ఎక్కువ. ఒక్కో పనికి ఖర్చు సగం కంటే తక్కువ. గరిష్ఠ ప్రయత్న స్థాయిలో, GPT‑6.1 Solకు ఒక్కో పనికి సగటున $5.47 ఖర్చవుతుంది. Opus 5.5కు $23.21, Astraకు $23.80 ఖర్చవుతుంది. ఈ రెండింటి కంటే 75%కు పైగా తక్కువ ఖర్చుతో గణనీయమైన శాస్త్రీయ సామర్థ్యాన్ని అందిస్తుంది.

పరీక్షించిన మోడళ్లలో GPT‑6 Astra ఇప్పటికీ 68.1%తో అత్యధిక స్కోర్ సాధించింది. అత్యంత కఠినమైన శాస్త్రీయ పరిశోధన పనులకు దీనినే ఉపయోగించాలి.

Terminal-Bench Science 0.1⁠(కొత్త విండోలో తెరుచుకుంటుంది)లో ఏజెంట్లు కోడ్, టెర్మినల్ సాధనాలను ఉపయోగించి శాస్త్రీయ పరిశోధన ప్రక్రియలను పూర్తి చేస్తాయి. వీటిలో దత్తాంశ విశ్లేషణ, అనుకరణలను అమలు చేయడం, నమూనాలను దత్తాంశానికి సరిపోల్చడం వంటివి ఉంటాయి.

వాస్తవ ఖచ్చితత్వం

కఠినమైన ప్రాంప్ట్‌లపై వాస్తవ ఖచ్చితత్వాన్ని కూడా GPT‑6.1 Sol మెరుగుపరుస్తుంది. అత్యధిక రీజనింగ్ ప్రయత్న స్థాయిలో, దీని వాస్తవపరమైన పొరపాట్ల రేటు 4.1%. అదే సెట్టింగ్‌లో GPT‑6 Sol రేటు 4.5% కంటే ఇది తక్కువ, Astra రేటు 4.0%కు మరింత దగ్గర. ఒక్కో పనికి ఖర్చు మాత్రం Astra కంటే సుమారు 83% తక్కువ.

గత మోడల్ పొరపాటును వినియోగదారులు గుర్తించిన సంభాషణల్లో గుర్తింపు వివరాలను తొలగించి, కనీసం ఒక వాస్తవపరమైన పొరపాటైనా ఉన్న సమాధానాల నిష్పత్తిని ఈ మూల్యాంకనం కొలుస్తుంది. ఉద్దేశపూర్వకంగా ఎంచుకున్న ఈ కఠినమైన ప్రాంప్ట్‌లు సాధారణ వినియోగానికి ప్రతినిధులు కావు.

గత మోడల్ చేసిన వాస్తవపరమైన పొరపాటును వినియోగదారులు గుర్తించిన ChatGPT సంభాషణల్లో, గుర్తింపు వివరాలను తొలగించి వాస్తవ ఖచ్చితత్వాన్ని మూల్యాంకనం చేస్తాం. పొరపాట్లకు దారితీసే ఈ సంభాషణలు సాధారణ వినియోగానికి ప్రతినిధులు కావు. సాధారణ వినియోగంలో వాస్తవపరమైన పొరపాట్లు మరింత అరుదు.

GPT‑6.1 Solను సురక్షితంగా అందుబాటులోకి తేవడం

మా ఉద్దేశానుగుణ ప్రవర్తన మూల్యాంకనాల్లో GPT‑6 Sol కంటే GPT‑6.1 Sol గణనీయంగా మెరుగై, GPT‑6 Astraకు చేరువైంది.

GPT‑6.1 Sol తన పరిమితుల గురించి మరింత పారదర్శకంగా ఉంటుంది. వినియోగదారు ఉద్దేశాన్ని, భద్రతా పరిమితులను గౌరవించడంలో మరింత నమ్మదగినదిగా ఉంటుంది. కఠినమైన మూల్యాంకనాల్లో, శోధన సాధనాలు పనిచేయడం లేదని వెల్లడించడం, స్పష్టమైన ఆంక్షలను గౌరవించడం, ఏజెంటిక్ పనుల్లో అనుమతి లేని ఫలితాలను నివారించడం వంటి అంశాల్లో GPT‑6 Sol కంటే దీని వైఫల్యాల రేటు తక్కువ. GPT‑6 Astra, GPT‑6 Sol మాదిరిగానే, ఆటోమేటెడ్ భద్రతా సమీక్షకుడిని దాటవేసే ప్రయత్నాలేవీ మేము గమనించలేదు.

కింది మూల్యాంకనాలు ఉద్దేశపూర్వకంగా కఠినమైన పరిస్థితులను పరీక్షిస్తాయి. ఇవి సాధారణ వినియోగంలో వైఫల్యాల రేటును కొలవవు.

ధరలు మరియు లభ్యత

నేటి నుంచి Plus, Pro, Business, Enterprise, Edu వినియోగదారులందరికీ ChatGPT వర్క్, Codexలో GPT‑6.1 Sol అందుబాటులో ఉంది. ఈ మోడళ్లు చాట్‌లో ఇంకా అందుబాటులో లేవు. డెవలపర్లు OpenAI API ద్వారా కూడా gpt-6.1-sol పేరుతో దీన్ని ఉపయోగించవచ్చు. దీని ప్రామాణిక ఏపీఐ ధరలు: పది లక్షల ఇన్‌పుట్ టోకెన్‌లకు $2, పది లక్షల కాష్ చేసిన ఇన్‌పుట్ టోకెన్‌లకు $0.10, పది లక్షల అవుట్‌పుట్ టోకెన్‌లకు $10.

దీనితో పాటు, GPT‑6 Astra కంటే 8 రెట్ల వరకు వేగవంతమైన, ప్రపంచంలోనే అత్యంత వేగవంతమైన అత్యాధునిక మోడల్ GPT‑6 Astra Ultrafastను, అలాగే GPT‑6.1 Sol Ultrafastను విడుదల చేస్తున్నాం. ఇవి APIలో అందుబాటులో ఉన్నాయి. నెలకు $500 ధరతో అత్యధిక వినియోగ పరిమితులు అందించే మా కొత్త Pro స్థాయిలోని వినియోగదారులకు ChatGPT వర్క్, Codexలో కూడా లభిస్తాయి. GPT‑6.1 Sol Ultrafastతో, డెవలపర్లు గతంలో GPT‑6 Astra APIకి వెచ్చించిన దాదాపు అదే ఖర్చుతో, 8 రెట్ల వరకు వేగంతో Astraకు దగ్గరగా ఉండే మేధస్సును పొందవచ్చు.

రచయిత

OpenAI

GPT మూల్యాంకనాలను మా పరిశోధనా వాతావరణంలో లేదా మా API ద్వారా నిర్వహించాం. సిస్టమ్ సూచనలు, అందుబాటులోని సాధనాలు, ప్రయత్న స్థాయులు మొదలైనవాటిలో తేడాల వల్ల, వాడుకలో ఉన్న ChatGPTతో పోలిస్తే వీటి సమాధానాలు కొద్దిగా భిన్నంగా ఉండవచ్చు. పోటీ మోడళ్ల మూల్యాంకనాలను బహిరంగంగా అందుబాటులో ఉన్న నివేదికల నుంచి తీసుకున్నాం.