GPT‑6 Sol እና Lunaን በማስተዋወቅ ላይ
ግንባር ቀደም አስተውሎትን ወደ ዕለታዊ ሥራዎ ለማምጣት ተጨማሪ መንገዶች።
በዚህ ወር መጀመሪያ የዓለማችን እጅግ ብልህና ከሰው ዓላማ ጋር የተጣጣመ ሞዴል የሆነውን GPT‑6 Astra አስተዋውቀናል። እጅግ ከባድና አስፈላጊ ፕሮጀክቶች አሁንም የAstraን ሙሉ ጥልቀት ቢፈልጉም፣ ሥራ በተለያዩ መጠኖች፣ ፍጥነቶችና በጀቶች ይከናወናል።
ለዚህም ነው የGPT‑6 ዓለምን በGPT‑6 Sol እና GPT‑6 Luna። የምናሰፋው። GPT‑6 Astra አዲስ የአስተውሎት ትውልድ አስተዋውቋል፤ እነዚህ ሞዴሎች በወጪ ቆጣቢነት ግንባር ቀደም ደረጃውን በማራመድ የዚያን አስተውሎት ጥቅሞች ለማስፋፋት ይረዳሉ። GPT‑6 Sol እና Lunaን ከGPT‑6 Astra ጋር በተመሳሳይ ዘዴ አሰልጥነናል፤ በሙያዊ ሥራ፣ በእውነታዊነት፣ በኮድ ሥራ፣ በኮምፒውተር አጠቃቀምና በአሰላለፍ ረገድ ለAstra እጅግ ዘመናዊ አፈጻጸም መሠረት የሆኑትን እድገቶች ወደ ፈጣንና ዋጋቸው ተመጣጣኝ ሞዴሎች አምጥተናል።
የGPT‑6 ሞዴሎች በወጪና በአስተውሎት ሚዛን ላይ ቀዳሚ ሲሆኑ፣ በእያንዳንዱ ደረጃ ያሉ ልዩ ችሎታዎችን በስፋትና በብቃት ከሚያቀርብ መሠረተ ልማት ጋር ያጣምራሉ። በመሸጎጫና በግምት ማስኬድ ላይ ያደረግናቸው ማሻሻያዎች እነዚህን ሞዴሎች በዝቅተኛ ወጪ እንድናቀርብ አስችለውናል፤ ከGPT‑5.6 የማስተዋወቂያ ዋጋቸው ጋር ሲነጻጸር የSol እና Luna API ዋጋን በ50% በመቀነስ ቁጠባውን በቀጥታ ለተጠቃሚዎችና ደንበኞች እያስተላለፍን ነው። እነዚህ ማሻሻያዎች በአንድነት የላቀ AIን ለብዙ ዕለታዊ ተግባራትና በስፋት ለሚሠሩ መተግበሪያዎች ተግባራዊ ያደርጉታል።
ሞዴል | ግብዓት | ውጤት | የዋጋ ቅናሽ |
GPT‑6 Sol | $4 → $2 | $20 → $10 | በ50% ርካሽ |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | በ50% ርካሽ |
ዋጋዎቹ ለ1 ሚሊዮን token ናቸው።
GPT‑6 Astra በሁሉም ዘርፍ ምርጥ ሞዴላችን ሆኖ ቀጥሏል። ምርጥ ውጤትና ያለምንም መደራደር የተሟላ ተሞክሮ ሲፈልጉ ይምረጡት።
GPT‑6 Sol እና Luna ውስብስብ ሥራን ለማጠናቀቅ እጅግ ጠቃሚ በሆኑ ችሎታዎች ላይ፣ ለሚያውቋቸውና ቀድሞውኑ ለሚጠቀሙባቸው ሞዴሎች የአስተውሎት ማሻሻያና ወጪ ቆጣቢነት ያመጣሉ።
GPT‑6 Sol ከፍተኛ የአጠቃቀም ገደቦችና ዝቅተኛ ወጪ በማቅረብ ደጋግመው ለማሻሻል የበለጠ ዕድል እየሰጠ ከባድ የሥራ ተግባራትን ሊወጣ ይችላል፤ ተመሳሳይ ዋጋ ካላቸው የተፎካካሪዎች ሞዴሎች የበለጠ አስተውሎትና የተሻለ ውጤት ይሰጣል።
በመተግበሪያዎች ውስጥ የንግድ የሥራ ፍሰቶችን በሚፈትነው AutomationBench ላይ፣ GPT‑6 Sol በxhigh ጥረት ከClaude Opus 5 የተግባር ወጪ 9% ብቻ በመጠቀም በmax ጥረት ያለውን Opus 5 ይበልጣል። በከፍተኛ ጥረት፣ GPT‑6 Luna ከቀዳሚው ሞዴል በ5.4 መቶኛ ነጥቦች ይሻሻላል፤ የተግባር ወጪውም በ58% ያነሰ ነው።
በAutomationBench 1.0.6(በአዲስ መስኮት ውስጥ ይክፈታል)፣ AI ወኪሎች በሽያጭ፣ ግብይት፣ ክዋኔ፣ ድጋፍ፣ ፋይናንስና የሰው ኃይል ዘርፎች 47 መሣሪያዎችን በሚጠቀሙ ከጫፍ እስከ ጫፍ የሥራ ፍሰቶች ይፈተናሉ። በ~40% ተግባራት ላይ የተከሰቱትን የOpus 5 ምትክ አጠቃቀሞች ወጪ ስለማያካትት፣ የClaude Fable 5.1 መረጃ ነጥብ ትክክለኛ ወጪውን አሳንሶ ያሳያል።
GPT‑6 Sol በእጅጉ ዝቅተኛ ወጪ Claude Fable 5.1ንም ይበልጣል፤ በዝቅተኛ ጥረት ያለውን GPT‑6 Astraን እንኳ ያሸንፋል።
ሞዴል (እና ጥረት) | ውጤት | የአንድ ተግባር ወጪ |
|---|---|---|
GPT‑6 Sol (እጅግ ከፍተኛ) | 33.2% | $0.27 |
GPT‑6 Astra (ዝቅተኛ) | 30.3% | ከGPT‑6 Sol 3.9x |
Claude Opus 5 (Max) | 26.9% | ከGPT‑6 Sol 11.1x |
Claude Fable 5.1 ከOpus 5 ምትክ ጋር (Max) | 31.4% | ከGPT‑6 Sol >8.9x (የምትክ ወጪ አልተዘገበም) |
ወኪሎችን በውስብስብ ሙያዊ የሥራ ፍሰቶች ላይ በሚገመግመው Agents’ Last Exam፣ GPT‑6 Sol በmax ጥረት 56.4% ያስመዘግባል፤ ይህም በግምገማው ከClaude Opus 5 ከፍተኛ ውጤት የላቀ ሲሆን የተግባር ወጪው በ60% ያነሰ ነው።
በAgents’ Last Exam V1(በአዲስ መስኮት ውስጥ ይክፈታል)፣ AI ወኪሎች 55 ንዑስ ኢንዱስትሪዎችንና በኮምፒውተር የሚከናወኑ አብዛኞቹን ዋና ዋና የሙያዊ ሥራ መስኮች በሚሸፍኑ፣ ረጅም ጊዜ በሚወስዱና ኢኮኖሚያዊ ዋጋ ባላቸው ተግባራት ይገመገማሉ።
የአንድ መልስ ጠቃሚነት እውነታዎቹ ትክክል በመሆናቸው ላይ የሚመረኮዝ ሲሆን፣ የእውነታ አስተማማኝነትን ማሻሻላችንን ቀጥለናል። ተጠቃሚዎች በሞዴሎቻችን የተፈጸሙ ስህተቶችን ምልክት ባደረጉባቸውና መለያቸው በተወገደ እውነተኛ ውይይቶች ላይ በተመሠረተው የውስጥ የእውነታዊነት ግምገማችን፣ GPT‑6 Sol ከቀዳሚው ሞዴል ግማሽ ያህል ስህተት ያነሰ ይሠራል፤ በእጅጉ ዝቅተኛ ወጪም ወደ Astra ደረጃ አስተማማኝነት ይቀርባል። GPT‑6 Lunaም በእጅጉ ተሻሽሏል፤ በከፍተኛ የጥረት ደረጃዎች ከGPT‑5.6 Sol ጋር ተመሳሳይ ውጤት በመቶኛ አንድ ያህል ወጪ ያስመዘግባል።
እዚህ፣ ተጠቃሚዎች ከቀዳሚ ሞዴል የእውነታ ስህተት ምልክት ባደረጉባቸውና መለያቸው በተወገደ የChatGPT ውይይቶች ላይ እውነታዊነትን እንገመግማለን። እነዚህ ስህተትን የሚያስከትሉ ውይይቶች የተለመደውን አጠቃቀም አይወክሉም፤ በተለመደው አጠቃቀም የእውነታ ስህተቶች የበለጠ ብርቅ ናቸው። ውጤቶቹ ርዝመትን ከግምት አላስገቡም፤ ሆኖም፣ የዝርዝርነት ፈተናዎቻችን በመልስ ርዝመት ላይ ያለው ጥገኝነት ከሞላ ጎደል የሌለ መሆኑን አሳይተዋል።
በዚህ ዓመት የኮድ ሥራ ወኪሎች ከመቼውም ጊዜ የበለጠ ውስብስብ፣ ሰፊና ረጅም ጊዜ የሚወስዱ ተግባራትን መፍታት ጀምረዋል። በOpenAI ውስጥ ያለው አጠቃቀማችን በፍጥነት አድጓል። በAPI ዋጋ ሲሰላ፣ ዕለታዊ የtoken አጠቃቀም ለመካከለኛው ተመራማሪ $600ን፣ በ90ኛ ፐርሰንታይል ላሉ ተመራማሪዎችም $7,000ን አልፏል (የምርምር ማፋጠን፦ ከOpenAI ውስጥ የቀረበ እይታ)። የኮድ ሥራ ወኪሎች ረዘም ያሉና ከባድ ተግባራትን ሲወስዱ፣ የቀጣይነት ያለው አጠቃቀም ወጪ ይበልጥ አስፈላጊ ይሆናል። GPT‑6 Sol እና Luna ጠንካራ የኮድ ሥራ አፈጻጸምን ከዝቅተኛ API ዋጋ ጋር በማጣመር፣ ገንቢዎች ደጋግመው እንዲያሻሽሉና ቡድኖችም Codex እንዲያከናውን በሚጠይቁት ሥራ ላይ የበለጠ ደፋር እንዲሆኑ ያስችላሉ።
የኮድ ሥራ ወኪሎች ወደ እውነተኛ የኮድ ማከማቻዎች ለማዋሃድ ዝግጁ የሆኑ ለውጦችን ያዘጋጁ እንደሆነ በሚገመግመው FrontierCode ላይ፣ GPT‑6 Sol ከGPT‑5.6 Sol በእጅጉ ተሻሽሏል፤ በእጅጉ ዝቅተኛ ወጪም በxhigh ያለውን Claude Fable 5.1 ያህል ውጤት ያስመዘግባል።
በFrontierCode 1.1 Main(በአዲስ መስኮት ውስጥ ይክፈታል)፣ AI ወኪሎች ትክክለኛነቱ ብቻ ሳይሆን «ለውህደት ዝግጁነቱም» የሚመዘን ኮድ ይጽፋሉ፤ ለምሳሌ፣ የፈተና ጥራት፣ የወሰን ጥብቅነት፣ የኮድ ስልትና የኮድ ማከማቻውን መስፈርቶች ማክበር።
በእውነተኛ የኮድ ማከማቻዎች ውስጥ ባሉ ውስብስብ የሶፍትዌር ምሕንድስና ተግባራት ላይ አፈጻጸምን በሚፈትነው DeepSWE v1.1 ላይ፣ GPT‑6 Sol በmax ጥረት 68.8% ያስመዘግባል፤ ይህም በግምገማው ከClaude Fable 5 ከፍተኛ ውጤት—በxhigh ጥረት 69.9%—በ1.1 መቶኛ ነጥብ ብቻ ያነሰ ሲሆን፣ የተግባር ወጪው በግምት 80% ያነሰ ነው።
GPT‑6 Luna በmax ጥረት 66.6% ያስመዘግባል፤ ይህም በመካከለኛ ጥረት ካሉ Claude Opus 5 እና Fable 5 ጋር ተመጣጣኝ ነው። በእነዚህ ንጽጽሮች፣ የLuna የተግባር ወጪ ከOpus 5 በ93%፣ ከFable 5 ደግሞ በ96% ያነሰ ነው።
በDeepSWE 1.1(በአዲስ መስኮት ውስጥ ይክፈታል)፣ AI ወኪሎች ኦሪጂናልና ረጅም ጊዜ የሚወስዱ የሶፍትዌር ምሕንድስና ተግባራትን ይፈታሉ።
GPT‑6 Astra ለኮምፒውተር አጠቃቀም የዓለማችን ምርጥ ሞዴል ሆኖ ሲቀጥል፣ GPT‑6 Sol እና Luna ከቀዳሚዎቻቸው የበለጠ ወጪ ቆጣቢ አፈጻጸም ይሰጣሉ። በOSWorld 2.0 offline፣ GPT‑6 Sol በxhigh ጥረት በመካከለኛ ጥረት ካለው Claude Opus 5 ጋር ተመሳሳይ ውጤት—60.5% ከ60.3% ጋር—ያስመዘግባል፤ የተግባር ወጪውም በግምት 80% ያነሰ ነው። GPT‑6 Luna (max) ከGPT‑5.6 Sol (መካከለኛ) በአንድ አስረኛ ወጪ ሊበልጥ ይችላል።
በOSWorld 2.0(በአዲስ መስኮት ውስጥ ይክፈታል)፣ AI ወኪሎች ዕለታዊና ሙያዊ ተግባራትን የሚሸፍኑ ረጅም ጊዜ የሚወስዱ የኮምፒውተር አጠቃቀም የሥራ ፍሰቶችን ለማከናወን ይሞክራሉ። ከv2026.08.08 ልቀት የመስመር ውጭ ስብስብ ያገኘውን ከፊል ሽልማት እናቀርባለን።
የGPT‑6 Astraን የተሻሻለ የመግባቢያ ስልት ወደ Sol እና Lunaም አምጥተነዋል፤ ይህም በተለይ በቴክኒክና በኮድ ሥራ ውይይቶች ውስጥ ጎልቶ እንደሚታይ እናምናለን። ይበልጥ ግልጽነት፣ ያነሰ ሙያዊ ቃላት፣ ያነሱ ያልተለመዱ አገላለጾች፣ ያነሱ ዝቅተኛ ዋጋ ያላቸው ዝርዝሮችና ዋና ይዘቱን ሳያጣ በአጠቃላይ በመጠኑ አጠር ያሉ መልሶችን ይጠብቁ።
ስልት ግላዊ ምርጫ ቢሆንም፣ እዚህ የGPT‑6 Solን ምላሽ እንመርጣለን። በፍጥነት ወደ ድምዳሜ አይደርስም፤ ለጠያቂው ግልጽ ሊሆኑ የሚችሉ ዝርዝሮችን በመድገም የሚያጠፋው ጊዜ ያነሰ ነው (ለምሳሌ፣ ድረ ገጹ አራት ገጾች እንዳሉት)፤ ግልጽ ያልሆነ ቋንቋን ያነሰ ይጠቀማል (ለምሳሌ፣ «የቤንቶ ስሜት»፣ «በዚያ ሥርዓት ዙሪያ… እንደገና መቅረጽ»)፤ የፈተሸውንና ያልፈተሸውን ይበልጥ በግልጽ ይናገራል፤ እንደ የምስል መሣሪያው እርምጃ ያሉ የትግበራ ዝርዝሮችንም ሳያስፈልግ አያጋራም።
ከዝቅተኛ የtoken ዋጋዎች በተጨማሪ፣ በGPT‑6 ላይ የሚገነቡ ገንቢዎች መተግበሪያዎቻቸው እንደገና በሚጠቀሙበት ዐውድ ላይ የበለጠ እንዲቆጥቡ እየረዳን ነው። ለGPT‑6 የጥያቄዎች መሸጎጫን በነባሪነት ከፍተኛ የመሸጎጫ ስኬት መጠን እንዲሰጥ አሻሽለነዋል፤ ይህም ወኪሎች ብዙ ዐውድን እንደገና እንዲጠቀሙ፣ ፈጥነው እንዲመልሱና ከመሸጎጫ በሚነበቡ የግብዓት tokenዎች ላይ የ90% ቅናሽ እንዲያገኙ ይረዳል።
ገንቢዎች የመሸጎጫ አፈጻጸማቸውን ለመለካትና ለማመቻቸት ተጨማሪ መንገዶችም አሏቸው፦
ይከታተሉ እና ችግሩን ይመርምሩ። የየጥያቄዎች መሸጎጫ ዳሽቦርድ(በአዲስ መስኮት ውስጥ ይክፈታል) ምን ያህል ግብዓት እንደተሸጎጠና ይህም በጊዜ ሂደት እንዴት እንደሚለወጥ ያሳያል። የምርመራ መሣሪያው(በአዲስ መስኮት ውስጥ ይክፈታል) ያመለጡ የመሸጎጥ ዕድሎችንና ምን መስተካከል እንዳለበት ለማብራራት ይረዳል።
መሸጎጫውን ሳያበላሹ የማመዛዘን ጥረትንና የመሣሪያ ተገኝነትን ያስተካክሉ። ለከባድ ተግባራት የማመዛዘን ጥረትን(በአዲስ መስኮት ውስጥ ይክፈታል) ይጨምሩ ወይም ለቀላል ተከታይ ጥያቄዎች ይቀንሱ፤ እንዲሁም የወኪልዎ ፍላጎት ሲለወጥ መሣሪያዎችን ያንቁ ወይም ያሰናክሉ(በአዲስ መስኮት ውስጥ ይክፈታል)። ሁለቱም መቆጣጠሪያዎች አሁን ቀደም ያለውን ዐውድ በመሸጎጫ እንደገና ለመጠቀም ያቆያሉ።
የትኞቹ ቅድመ ቅጥያዎች እንደሚሸጎጡ ያመቻቹ። ግልጽ መግቻ ነጥቦች ገንቢዎች የተሸጎጡ የእርምጃ ቅድመ ቅጥያዎች የት እንደሚያበቁ እንዲመርጡ ያስችላሉ። ይህም ገንቢዎች መሸጎጫን እንደገና በመጠቀም ላይ የበለጠ ቁጥጥር እንዲኖራቸው ያደርጋል፤ አፈጻጸምንም ሊያሻሽል ይችላል።
GitHub እንደዘገበው፣ ባለፉት በርካታ ወራት እነዚህ ማሻሻያዎች ወደ OpenAI ሞዴሎች በተላኩ በቢሊዮኖች በሚቆጠሩ ጥያቄዎች ውስጥ አዲስ ሂደት የሚያስፈልጋቸውን የእርምጃ tokenዎች ድርሻ ከ50% በላይ ቀንሰዋል፤ ይህም Copilot ፈጥኖ እንዲመልስ ረድቷል።
GPT‑6 Sol እና Luna እስካሁን ከሰው ዓላማ ጋር እጅግ የተጣጣመው ሞዴላችን ከሆነው Astra ጋር በተዋወቀው የአሰላለፍ ሥራ ላይ ይገነባሉ። በአሰላለፍ ግምገማዎቻችን፣ Sol እና Luna ሁለቱም ከGPT‑5.6 አቻዎቻቸው የተሻሉ ውጤቶችን ያሳያሉ፤ ይህም ስለ ኮድ ሥራቸው አሳሳች መግለጫዎችን የሚሰጡበት መጠን መቀነሱን ያካትታል።
ከታች ያሉት ግምገማዎች ከባድ ሁኔታዎችን ሆን ብለው የሚፈትኑ ሲሆን፣ በተለመደው አጠቃቀም የውድቀት መጠኖችን አይለኩም። ሙሉ ውጤቶቹን ለማየት የሥርዓት ካርዱን(በአዲስ መስኮት ውስጥ ይክፈታል) ይመልከቱ።
GPT‑6 Sol እና GPT‑6 Luna ከዛሬ ጀምሮ ለሁሉም Plus፣ Pro፣ Business፣ Enterprise እና Edu ተጠቃሚዎች በChatGPT ሥራ እና Codex ውስጥ ይገኛሉ። የFree እና Go ተጠቃሚዎች GPT‑6 Lunaን በዴስክቶፕ መተግበሪያው ማግኘት ይችላሉ። እነዚህ ሞዴሎች ገና በውይይት ውስጥ አይገኙም። በOpenAI API ውስጥ gpt-6-sol እና gpt-6-luna በሚሉ ስሞች ይገኛሉ።
አገልግሎቱ ለሁሉም የተረጋጋ ሆኖ እንዲቀጥል፣ እነዚህን ሞዴሎች በቀኑ ውስጥ ቀስ በቀስ በChatGPT ለማቅረብ አቅደናል። አዲሶቹን ሞዴሎች በChatGPT ሥራ ወይም Codex ውስጥ ካላዩ፣ እባክዎ ቆይተው እንደገና ይሞክሩ።
የGPT ግምገማዎች በምርምር አካባቢያችን ወይም በAPIያችን በኩል ተከናውነዋል፤ ይህም በሥርዓት እርምጃዎች፣ በሚገኙ መሣሪያዎችና በመሳሰሉት ልዩነቶች ምክንያት በምርት ላይ ካለው ChatGPT በመጠኑ የተለየ ውጤት ሊሰጥ ይችላል። የተፎካካሪ ሞዴሎች ግምገማዎች በይፋ ከሚገኙ ሪፖርቶች ተወስደዋል። የClaude Fable 5.1 ውጤቶች በማይገኙበት ጊዜ የClaude Fable 5 ውጤቶች ቀርበዋል።


