ወደ ዋና ይዘት እለፍ
OpenAI

GPT-6.1Sol

ለዘላቂ ግንባር ቀደም አፈጻጸም፣ ወደ Astra የሚቀርብ ብልህነት በአንድ አምስተኛው ዋጋ

ከGPT‑6 Sol የተሻሻለውን GPT‑6.1 Sol እናስተዋውቃለን። በኤጀንቲክ ኮዲንግ፣ በኮምፒውተር አጠቃቀምና በሙያዊ ሥራ እጅግ ጠንካራ አፈጻጸም አለው። የAstra መደበኛ የግቤትና የውጤት token ዋጋዎች አንድ አምስተኛ ብቻ በሆነ ወጪ፣ በአስቸጋሪ ተግባራት ላይ የSol አፈጻጸምን ወደ GPT‑6 Astra ያቀርባል። ይህም ገንቢዎች በተመሳሳይ በጀት ውስጥ ብቁ ኤጀንቶችን ለመገንባትና ለማስኬድ ያላቸውን ዕድል ያሰፋል።

GPT‑6.1 Sol ወደ Astra የሚቀርብ አፈጻጸምን በSol ዋጋ ያቀርባል። ይህም ከሚሰጠው አፈጻጸም አንጻር ዛሬ ከሚገኙት ሞዴሎች ሁሉ በወጪ ቆጣቢነት ቀዳሚ ያደርገዋል። በመሸጎጫ የተቀመጠ ግቤት በአንድ ሚሊዮን token $0.10 ብቻ ያስከፍላል፤ ይህም ከመደበኛው የግቤት ዋጋ 95% ቅናሽ ነው። በተደጋጋሚ ጥያቄዎች ላይ ዐውድን መልሰው መጠቀም ለሚያስፈልጋቸው በኤጀንት ለሚከናወኑ ሥራዎች የበለጠ ተመጣጣኝ ያደርገዋል።

GPT‑6 Astra በአጠቃላይ ከፍተኛው ብቃት ያለው ግንባር ቀደም ሞዴላችን ሆኖ ይቀጥላል። GPT‑6.1 Sol፣ ተጠቃሚዎች በተደጋጋሚ ማከናወን ለሚፈልጉት ጠቃሚ ሥራ እንዲሁም መተግበሪያዎችን በስፋት ለሚገነቡና ለሚያስኬዱ የAPI ደንበኞች፣ አዲስ የብቃትና የወጪ ሚዛን ያቀርባል።

ሦስት የሞዴል ካርዶች፦ GPT-6 Astra፣ ምርጥ ውጤቶችን ለማግኘት ከሁሉ የበለጠ ብልህ ሞዴላችን፣ ግቤት $10፣ ውጤት $50፣ በመሸጎጫ የተቀመጠ ግቤት $1፤ GPT-6.1 Sol፣ ወደ Astra የሚቀርብ ብልህነት በአንድ አምስተኛው ዋጋ፣ ግቤት $2፣ ውጤት $10፣ በመሸጎጫ የተቀመጠ ግቤት $0.10፤ GPT-6 Luna፣ ሰፊ መጠን ያላቸውን ዕለታዊ ሥራዎች በፍጥነትና በብቃት ለማከናወን፣ ግቤት $0.10፣ ውጤት $0.50፣ በመሸጎጫ የተቀመጠ ግቤት $0.01።

በተለያዩ ተግባራት የበለጠ ብቁ የሆነ Sol

GPT‑6.1 Sol፣ ኮድ ከመጻፍና ስህተቶቹን ከማረም እስከ ሰነዶችን መረዳትና ባለብዙ ደረጃ የንግድ ሥራ ሂደቶችን መፈጸም ድረስ፣ በውስብስብ ሙያዊ ሥራዎች ላይ ከGPT‑6 Sol በእጅጉ የተሻሻለ አፈጻጸም ያሳያል። ከእነዚህ ግምገማዎች በብዙዎቹ፣ በእጅጉ ባነሰ ወጪ ወደ GPT‑6 Astra አፈጻጸም ይቀርባል።

ኮድ መጻፍ

በእውነተኛ የኮድ ስብስቦች ውስጥ ውስብስብ የሶፍትዌር ምህንድስና ተግባራትን በሚገመግመው DeepSWE v1.1 ላይ፣ GPT‑6.1 Sol በግምት በአንድ አምስተኛው ወጪ ከGPT‑6 Astra ጋር እኩል ውጤት ያስመዘግባል። በተጨማሪም ባነሰ የማመዛዘን ጥረትና ወጪ፣ የGPT‑6 Sol ምርጥ ውጤትን በ6.4 መቶኛ ነጥቦች ይበልጣል።

DeepSWE 1.1⁠⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ፣ የAI ወኪሎች አዳዲስ እና ለማጠናቀቅ ረጅም ጊዜ የሚወስዱ የሶፍትዌር ምሕንድስና ተግባራትን ይፈታሉ።

ሙያዊ ሥራ

GDP.pdf፣ ሞዴሎች ሠንጠረዦችን፣ ገበታዎችን፣ ንድፎችንና በጥቃቅን ፊደላት የተጻፉ ዝርዝሮችን የያዙ ውስብስብ የPDF ሰነዶችን ተጠቅመው ሙያዊ ጥያቄዎችን በምን ያህል ትክክለኛነት እንደሚመልሱ ይለካል። በዚህ ግምገማ፣ በተፈተኑት የማመዛዘን ቅንብሮች ሁሉ GPT‑6.1 Sol ከተተኪ አማራጮች ጋር ከሚሠራው Opus 5.5 የበለጠ ውጤት ያስመዘግባል፣ ለእያንዳንዱ ተግባር የሚያወጣውም ወጪ ከግማሽ ያነሰ ነው። በተጨማሪም፣ ለእያንዳንዱ ተግባር በግምት አንድ አምስተኛውን ወጪ ብቻ በማውጣት፣ ወደ GPT‑6 Astra ዘመናዊ ቀዳሚ አፈጻጸም ይቀርባል።

GDP.pdf⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ፣ ሞዴሎች ከፋይናንስ፣ ከጤና አጠባበቅ፣ ከሕግ እና ከሌሎች ሰባት ሙያዊ ዘርፎች የሥራ ሂደቶች የተወሰዱ ውስብስብ የPDF ሰነዶችን በተመለከተ በተጨባጭ የሥራ ሁኔታዎች ላይ ለተመሠረቱ ጥያቄዎች መልስ መስጠት አለባቸው።

ኤጀንቶች ባለብዙ ደረጃ የንግድ ሥራ ሂደቶችን በትክክል መጨረሳቸውን በሚለካው AutomationBench ላይ፣ GPT‑6.1 Sol በመካከለኛ የማመዛዘን ጥረት ከOpus 5.5 በ2.2 መቶኛ ነጥቦች የላቀ ውጤት ያስመዘግባል። ወጪውም በግምት አንድ ሦስተኛው ነው። ይህ ውጤት በተመሳሳይ ቅንብር ከGPT‑6 Sol ውጤት በ4.8 መቶኛ ነጥቦችም ከፍ ያለ ነው።

In AutomationBench 1.0.6⁠⁠(በአዲስ መስኮት ውስጥ ይክፈታል), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

ኮምፒውተርን መጠቀም

GPT‑6.1 Sol ከኮምፒውተር መተግበሪያዎች ጋር መሥራት በሚጠይቁ ተግባራት ላይም ከፍተኛ መሻሻል ያሳያል። ኤጀንቶችን በአስቸጋሪ የኮምፒውተር አጠቃቀም ሂደቶች የሚገመግመው OSWorld 2.0 ከመስመር ውጭ የሙከራ ስብስብ ላይ፣ GPT‑6.1 Sol በከፍተኛው የማመዛዘን ጥረት ከGPT‑6 Sol በሰባት መቶኛ ነጥቦች ይበልጣል። ይህን የሚያሳካውም ከግማሽ ባነሰ ወጪ ነው። በከፍተኛው የማመዛዘን ጥረት፣ ለእያንዳንዱ ተግባር በግምት አንድ ሰባተኛውን ወጪ ብቻ በማውጣት፣ የAstra ውጤትን በ2.1 መቶኛ ነጥቦች ልዩነት ይቀርባል።

In OSWorld 2.0⁠⁠(በአዲስ መስኮት ውስጥ ይክፈታል), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

ሳይንሳዊ ምርምር

የውሂብ ትንተናን፣ ማስመሰልንና ቴዎሬሞችን ማረጋገጥን ጨምሮ ሳይንሳዊ የሥራ ሂደቶችን በሚገመግመው Terminal-Bench Science 0.1 ላይ፣ GPT‑6.1 Sol በከፍተኛው የማመዛዘን ጥረት ከGPT‑6 Sol ውጤት ከእጥፍ በላይ ያስመዘግባል። ለእያንዳንዱ ተግባር የሚያወጣውም ወጪ ከግማሽ ያነሰ ነው። በከፍተኛው ጥረት፣ GPT‑6.1 Sol ለእያንዳንዱ ተግባር በአማካይ $5.47 ያስከፍላል፤ Opus 5.5 $23.21፣ Astra ደግሞ $23.80 ያስከፍላሉ። ይህም ከሁለቱም ሞዴሎች ከ75% በላይ ባነሰ ወጪ ከፍተኛ ሳይንሳዊ ብቃት ይሰጣል።

GPT‑6 Astra አሁንም ከተፈተኑት ሞዴሎች መካከል በ68.1% ከፍተኛውን ውጤት ያስመዘግባል፤ ስለዚህም እጅግ አስቸጋሪ ለሆኑ የሳይንስ ምርምር ተግባራት መጠቀም ያለበት ይህ ሞዴል ነው።

Terminal-Bench Science 0.1⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ፣ ወኪሎች ኮድ እና የተርሚናል መሣሪያዎችን ተጠቅመው ውሂብ መተንተንን፣ ማስመሰያዎችን ማስኬድን እና ሞዴሎችን ከውሂብ ጋር ማጣጣምን ጨምሮ ሳይንሳዊ የምርምር ሂደቶችን ያጠናቅቃሉ።

እውነታን መጠበቅ

GPT‑6.1 Sol ለአስቸጋሪ ጥያቄዎች በሚሰጣቸው መልሶች ውስጥ የእውነታ ትክክለኛነትንም ያሻሽላል። በእጅግ ከፍተኛ የማመዛዘን ጥረት፣ የእውነታ ስህተት መጠኑ 4.1% ነው። ይህም ከGPT‑6 Sol 4.5% ዝቅ ያለና በተመሳሳይ ቅንብር ወደ Astra 4.0% የቀረበ ሲሆን፣ ለእያንዳንዱ ተግባር ከAstra በግምት 83% ያነሰ ወጪ ያስከፍላል።

ይህ ግምገማ፣ ተጠቃሚዎች የቀድሞ ሞዴልን ስህተት ባመለከቱባቸው እና ማንነትን የሚለዩ መረጃዎች በተወገዱላቸው ውይይቶች ላይ፣ ቢያንስ አንድ የእውነታ ስህተት ያለባቸውን መልሶች ድርሻ ይለካል። እነዚህ ሆን ተብሎ አስቸጋሪ እንዲሆኑ የተመረጡ ጥያቄዎች መደበኛ አጠቃቀምን አይወክሉም።

እውነታን የመጠበቅ ብቃትን የምንገመግመው፣ ተጠቃሚዎች የቀድሞ ሞዴል የፈጸመውን የእውነታ ስህተት ባመለከቱባቸው እና ማንነትን የሚለዩ መረጃዎች በተወገዱላቸው የChatGPT ውይይቶች ላይ ነው። እነዚህ ስህተትን የሚቀሰቅሱ ውይይቶች፣ የእውነታ ስህተቶች ብዙም የማይከሰቱበትን መደበኛ አጠቃቀም አይወክሉም።

GPT‑6.1 Solን በደህና ለአገልግሎት ማቅረብ

ከታሰበው ዓላማና ገደብ ጋር መጣጣምን በሚመለከቱ ግምገማዎቻችን፣ GPT‑6.1 Sol ከGPT‑6 Sol ከፍተኛ መሻሻል በማሳየት ወደ GPT‑6 Astra ይቀርባል።

GPT‑6.1 Sol ስለ ውስንነቶቹ የበለጠ ግልጽ ሲሆን፣ የተጠቃሚውን ዓላማና የደህንነት ገደቦችን በማክበርም የበለጠ አስተማማኝ ነው። በአስቸጋሪ ግምገማዎች፣ የፍለጋ መሣሪያዎች ሲበላሹ በግልጽ ማሳወቅን፣ ግልጽ ገደቦችን ማክበርንና በኤጀንት ተግባራት ወቅት ያልተፈቀዱ ውጤቶችን ማስወገድን በተመለከተ፣ ከGPT‑6 Sol ያነሰ የውድቀት መጠን ያሳያል። እንደ GPT‑6 Astra እና GPT‑6 Sol ሁሉ፣ በራስ-ሰር የሚሠራውን የደህንነት ገምጋሚ ለማለፍ የተደረገ ምንም ሙከራ አላየንም።

ከዚህ በታች ያሉት ግምገማዎች ሆን ተብሎ አስቸጋሪ ሁኔታዎችን የሚፈትኑ ናቸው፤ በመደበኛ አጠቃቀም የሚከሰቱ ውድቀቶችን መጠን አይለኩም።

ዋጋና ተደራሽነት

GPT‑6.1 Sol ከዛሬ ጀምሮ ለሁሉም የPlus፣ Pro፣ Business፣ Enterprise እና Edu ተጠቃሚዎች በChatGPT ሥራ እና Codex ይገኛል። እነዚህ ሞዴሎች ገና በውይይት አይገኙም። ገንቢዎች በOpenAI API በኩልም gpt-6.1-sol በሚል ስም ሊጠቀሙበት ይችላሉ። መደበኛ የAPI ዋጋዎቹ በአንድ ሚሊዮን የግቤት token $2፣ በአንድ ሚሊዮን በመሸጎጫ የተቀመጡ የግቤት token $0.10 እና በአንድ ሚሊዮን የውጤት token $10 ናቸው።

ከዚህ ጋር በተያያዘ፣ ከGPT‑6 Astra እስከ 8 እጥፍ ፈጣን የሆነውንና በዓለም ፈጣኑን ግንባር ቀደም ሞዴል GPT‑6 Astra Ultrafast፣ እንዲሁም GPT‑6.1 Sol Ultrafastን እያቀረብን ነው። እነዚህ በAPI ይገኛሉ። እንዲሁም በወር $500 በሚያስከፍለው አዲሱና ከፍተኛውን የአጠቃቀም መጠን በሚሰጠው የPro ደረጃ ላይ ላሉ ተጠቃሚዎች በChatGPT ሥራ እና Codex ይገኛሉ። በGPT‑6.1 Sol Ultrafast፣ ገንቢዎች ቀደም ሲል ለGPT‑6 Astra API ያወጡት ከነበረው ጋር በግምት ተመሳሳይ ወጪ ወደ Astra የሚቀርብ ብልህነት እስከ 8 እጥፍ በሚደርስ ፍጥነት ማግኘት ይችላሉ።

ደራሲ

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.