GPT‑6 Sol અને Lunaનો પરિચય
તમારા રોજિંદા કામમાં અત્યાધુનિક ઇન્ટેલિજન્સ લાવવાની વધુ રીતો.
આ મહિનાની શરૂઆતમાં અમે વિશ્વનું સૌથી બુદ્ધિશાળી અને સુસંગત મોડલ GPT‑6 Astra રજૂ કર્યું હતું. સૌથી પડકારજનક અને મહત્ત્વપૂર્ણ પ્રોજેક્ટ માટે હજુ પણ Astraની સંપૂર્ણ ઊંડાણપૂર્વકની ક્ષમતા જરૂરી છે, પરંતુ કામ વિવિધ સ્તર, ગતિ અને બજેટમાં થાય છે.
તેથી અમે GPT‑6 Sol અને GPT‑6 Luna. સાથે GPT‑6નું વિશ્વ વિસ્તારી રહ્યા છીએ. GPT‑6 Astraએ ઇન્ટેલિજન્સની નવી પેઢી રજૂ કરી હતી. આ મોડલ ખર્ચ-કાર્યક્ષમતામાં અત્યાધુનિક સ્તરને આગળ વધારીને તે ઇન્ટેલિજન્સના લાભ વધુ વ્યાપક બનાવે છે. અમે GPT‑6 Sol અને Lunaને GPT‑6 Astra જેવી જ પદ્ધતિઓથી તાલીમ આપી છે, જેથી વ્યાવસાયિક કામ, તથ્યાત્મકતા, કોડિંગ, કમ્પ્યુટરનો ઉપયોગ અને સુસંગતતામાં Astraના અદ્યતન પ્રદર્શન પાછળની પ્રગતિ વધુ ઝડપી અને કિફાયતી મોડલમાં ઉપલબ્ધ થાય.
GPT‑6 મોડલ ખર્ચ અને ઇન્ટેલિજન્સના સમગ્ર વળાંકમાં અગ્રેસર છે અને દરેક સ્તરે અસાધારણ ક્ષમતાઓને મોટા પાયે કાર્યક્ષમ રીતે પહોંચાડતા ઇન્ફ્રાસ્ટ્રક્ચર સાથે જોડે છે. કૅશિંગ અને અનુમાનમાં થયેલા સુધારાથી અમે આ મોડલ ઓછી કિંમતે ઉપલબ્ધ કરાવી શકીએ છીએ. GPT‑5.6ની પ્રમોશનલ કિંમતોની સરખામણીએ Sol અને Luna માટે APIની કિંમતોમાં 50% ઘટાડો કરીને અમે આ બચત સીધી વપરાશકર્તાઓ અને ગ્રાહકોને આપી રહ્યા છીએ. આ બધા સુધારા અદ્યતન AIને રોજિંદાં વધુ કાર્યો અને મોટા પાયાની એપ્લિકેશનો માટે વ્યવહારુ બનાવે છે.
મોડલ | ઇનપુટ | આઉટપુટ | કિંમતમાં ઘટાડો |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% સસ્તું |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% સસ્તું |
કિંમતો 10 લાખ ટોકન છે.
GPT‑6 Astra દરેક બાબતમાં અમારું શ્રેષ્ઠ મોડલ છે. શ્રેષ્ઠ પરિણામો અને કોઈ સમાધાન વિનાનો અનુભવ જોઈતો હોય ત્યારે તેને પસંદ કરો.
GPT‑6 Sol અને Luna જટિલ કામ પૂરું કરવા માટે સૌથી ઉપયોગી ક્ષમતાઓમાં તમે પહેલેથી ઓળખતા અને વાપરતા મોડલને વધુ ઇન્ટેલિજન્સ અને ખર્ચ-કાર્યક્ષમતા આપે છે.
GPT‑6 Sol મુશ્કેલ કામ સંભાળી શકે છે અને વધુ ઉપયોગ મર્યાદા તથા ઓછા ખર્ચથી તમને વારંવાર સુધારા કરવાની વધુ તક આપે છે. તે સમાન કિંમતનાં સ્પર્ધક મોડલ કરતાં વધુ ઇન્ટેલિજન્સ અને વધુ સારાં પરિણામો આપે છે.
એપ્લિકેશનોમાં વ્યવસાયિક કાર્યપ્રવાહની કસોટી કરતા AutomationBench પર xhigh પ્રયાસ સાથે GPT‑6 Sol, Max પ્રયાસવાળા Claude Opus 5 કરતાં વધુ સારું પ્રદર્શન કરે છે અને દરેક કાર્ય માટે તેનો ખર્ચ Opus 5ના ખર્ચના માત્ર 9% જેટલો છે. High પ્રયાસ પર GPT‑6 Luna તેના અગાઉના મોડલ કરતાં 5.4 ટકા પોઇન્ટ વધુ સારું પ્રદર્શન કરે છે અને દરેક કાર્યનો ખર્ચ 58% ઓછો છે.
AutomationBench 1.0.6 માં (નવી વિન્ડોમાં ખૂલે છે)વેચાણ, માર્કેટિંગ, કામગીરી, સહાય, નાણાં અને માનવ સંસાધન ક્ષેત્રોનાં 47 સાધનો વાપરતા શરૂઆતથી અંત સુધીના કાર્યપ્રવાહ પર AI એજન્ટનું પરીક્ષણ થાય છે. Claude Fable 5.1 નો ડેટા પોઇન્ટ તેનો વાસ્તવિક ખર્ચ ઓછો દર્શાવે છે, કારણ કે તેમાં લગભગ 40% કાર્યોમાં ઉપયોગમાં લેવાયેલી Opus 5 વૈકલ્પિક વ્યવસ્થાનો ખર્ચ સામેલ નથી.
GPT‑6 Sol ઘણાં ઓછા ખર્ચે Claude Fable 5.1ને પણ પાછળ પાડે છે અને ઓછા પ્રયાસવાળા GPT‑6 Astra કરતાં પણ વધુ સારું પ્રદર્શન કરે છે.
મોડલ અને પ્રયાસ | સ્કોર | દરેક કાર્યનો ખર્ચ |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (low) | 30.3% | GPT‑6 Sol કરતાં 3.9 ગણું |
Claude Opus 5 (Max) | 26.9% | GPT‑6 Sol કરતાં 11.1 ગણું |
Opus 5 વૈકલ્પિક વ્યવસ્થા સાથે Claude Fable 5.1 (Max) | 31.4% | GPT‑6 Sol કરતાં >8.9 ગણું (વૈકલ્પિક વ્યવસ્થાનો ખર્ચ જણાવાયો નથી) |
જટિલ વ્યાવસાયિક કાર્યપ્રવાહ પર એજન્ટનું મૂલ્યાંકન કરતી Agents’ Last Examમાં Max પ્રયાસ પર GPT‑6 Solનો સ્કોર 56.4% છે, જે મૂલ્યાંકનમાં Claude Opus 5ના હાઇ સ્કોર કરતાં વધુ છે અને દરેક કાર્યનો ખર્ચ 60% ઓછો છે.
Agents’ Last Exam V1(નવી વિન્ડોમાં ખૂલે છે)માં AI એજન્ટનું 55 પેટા-ઉદ્યોગોમાં ફેલાયેલાં, લાંબા ગાળાનાં અને આર્થિક રીતે મૂલ્યવાન કાર્યો પર મૂલ્યાંકન થાય છે. તેમાં કમ્પ્યુટર પર થતા વ્યાવસાયિક કામનાં મોટા ભાગનાં મુખ્ય ક્ષેત્રો આવરી લેવાય છે.
જવાબની ઉપયોગિતા હકીકતો સાચી હોવા પર આધાર રાખે છે અને અમે તથ્યાત્મક વિશ્વસનીયતામાં સતત પ્રગતિ કરી રહ્યા છીએ. અમારા આંતરિક તથ્યાત્મકતા મૂલ્યાંકનમાં GPT‑6 Sol તેના અગાઉના મોડલની સરખામણીએ લગભગ અડધી ભૂલો કરે છે અને ઘણાં ઓછા ખર્ચે Astra જેવી વિશ્વસનીયતા નજીક પહોંચે છે. આ મૂલ્યાંકન ઓળખ દૂર કરાયેલી વાસ્તવિક વાતચીત પર આધારિત છે, જેમાં વપરાશકર્તાઓએ અમારા મોડલની ભૂલો દર્શાવી હતી. GPT‑6 Lunaમાં પણ નોંધપાત્ર સુધારો થયો છે. વધુ પ્રયાસ સ્તરે તે લગભગ સોમા ભાગના ખર્ચે GPT‑5.6 Sol જેટલું પ્રદર્શન કરે છે.
અહીં અમે ઓળખ દૂર કરાયેલી એવી ChatGPT વાતચીત પર તથ્યાત્મકતાનું મૂલ્યાંકન કરીએ છીએ, જેમાં વપરાશકર્તાઓએ અગાઉના મોડલની તથ્યાત્મક ભૂલ દર્શાવી હતી. ભૂલ પ્રેરતી આ વાતચીત સામાન્ય ઉપયોગ દર્શાવતી નથી, જેમાં તથ્યાત્મક ભૂલો વધુ દુર્લભ હોય છે. સ્કોરમાં લંબાઈને નિયંત્રિત કરવામાં આવી નથી. જોકે, વિવિધ લંબાઈનાં અમારા પરીક્ષણોમાં જવાબની લંબાઈની લગભગ કોઈ અસર જોવા મળી નથી.
આ વર્ષે કોડિંગ એજન્ટે પહેલાં કરતાં વધુ જટિલ, વ્યાપક અને લાંબા ગાળાનાં કાર્યો હાથ ધરવાનું શરૂ કર્યું છે. OpenAI માં અમારો આંતરિક ઉપયોગ ઝડપથી અનેક ગણો વધ્યો છે. APIની કિંમતો પ્રમાણે મૂલ્યાંકન કરતાં, દૈનિક ટોકનનો ઉપયોગ મધ્યમ સંશોધક માટે $600 અને 90મા પર્સેન્ટાઇલના સંશોધકો માટે $7,000થી વધી ગયો છે (સંશોધનમાં વેગ: OpenAI ની અંદરનું દૃશ્ય). કોડિંગ એજન્ટ્સ વધુ લાંબા અને વધુ પડકારજનક કાર્યો હાથ ધરે છે તેમ, સતત ઉપયોગનો ખર્ચ વધુ મહત્ત્વનો બની જાય છે. GPT‑6 Sol અને Luna મજબૂત કોડિંગ કામગીરીને ઓછા API દરો સાથે જોડે છે, જેથી ડેવલપર્સને વારંવાર પ્રયત્નો અને સુધારા કરવા માટે વધુ તક મળે અને ટીમોને Codex ને વધુ મહત્ત્વાકાંક્ષી અને પડકારજનક કાર્યો સોંપવાનો વિશ્વાસ મળે.
FrontierCode પર, જે એ મૂલ્યાંકન કરે છે કે કોડિંગ એજન્ટ્સ વાસ્તવિક કોડબેઝમાં મર્જ કરવા માટે તૈયાર હોય તેવા ફેરફારો કરી શકે છે કે નહીં, GPT‑6 Sol, GPT‑5.6 Sol ની સરખામણીમાં નોંધપાત્ર સુધારો દર્શાવે છે અને ઘણી ઓછી કિંમતે Claude Fable 5.1 xhigh ની સમકક્ષ કામગીરી કરી શકે છે.
FrontierCode 1.1 Mainમાં(નવી વિન્ડોમાં ખૂલે છે)AI એજન્ટ કોડ લખે છે, જેનું મૂલ્યાંકન માત્ર ચોકસાઈ નહીં પણ “મર્જ કરવાની યોગ્યતા” પર પણ થાય છે. ઉદાહરણ તરીકે, પરીક્ષણની ગુણવત્તા, કાર્યક્ષેત્રની શિસ્ત, કોડની શૈલી અને કોડબેઝનાં ધોરણોનું પાલન.
વાસ્તવિક કોડબેઝમાં જટિલ સોફ્ટવેર એન્જિનિયરિંગ કાર્યોનું પરીક્ષણ કરતા DeepSWE v1.1 પર Max પ્રયાસ સાથે GPT‑6 Sol નો સ્કોર 68.8% છે. આ મૂલ્યાંકનમાં Claude Fable 5 ના એક્સ હાઇ પ્રયાસ—પરનો હાઈ સ્કોર—69.9%થી માત્ર 1.1 ટકા પોઇન્ટ ઓછો છે, જ્યારે દરેક કાર્યનો ખર્ચ લગભગ 80% ઓછો છે.
Max પ્રયાસ પર GPT‑6 Lunaનો સ્કોર 66.6% છે, જે મીડિયમ પ્રયાસવાળા Claude Opus 5 અને Fable 5ની સમકક્ષ છે. આ સરખામણીઓમાં દરેક કાર્ય માટે Luna નો ખર્ચ Opus 5 કરતાં 93% અને Fable 5 કરતાં 96% ઓછો છે.
DeepSWE 1.1(નવી વિન્ડોમાં ખૂલે છે)માં AI એજન્ટ લાંબા ગાળાનાં મૂળ સોફ્ટવેર એન્જિનિયરિંગ કાર્યો ઉકેલે છે.
GPT‑6 Astra કમ્પ્યુટર ઉપયોગ માટે વિશ્વનું શ્રેષ્ઠ મોડલ છે, જ્યારે GPT‑6 Sol અને Luna તેમના અગાઉના મોડલ કરતાં વધુ ખર્ચ-કાર્યક્ષમ પ્રદર્શન આપે છે. OSWorld 2.0 offline પર xhigh પ્રયાસ સાથે GPT‑6 Sol, મીડિયમ પ્રયાસવાળા Claude Opus 5 જેવો જ સ્કોર મેળવે છે, 60.5% સામે 60.3%, અને દરેક કાર્યનો ખર્ચ લગભગ 80% ઓછો છે. GPT‑6 Luna (Max) દસમા ભાગના ખર્ચે GPT‑5.6 Sol (મીડિયમ) કરતાં વધુ સારું પ્રદર્શન કરે છે.
OSWorld 2.0(નવી વિન્ડોમાં ખૂલે છે)માં AI એજન્ટ રોજિંદાં અને વ્યાવસાયિક કાર્યોમાં ફેલાયેલા લાંબા ગાળાના કમ્પ્યુટર-ઉપયોગ કાર્યપ્રવાહનો પ્રયાસ કરે છે. અમે v2026.08.08 પ્રકાશનના ઑફલાઇન સમૂહ માટે આંશિક પુરસ્કાર જણાવીએ છીએ.
અમે GPT‑6 Astraની સુધારેલી સંચાર શૈલી Sol અને Lunaમાં પણ ઉમેરી છે, જે ખાસ કરીને ટેકનિકલ અને કોડિંગ વાતચીતમાં વધુ સ્પષ્ટપણે અનુભવાશે. મુખ્ય સાર ગુમાવ્યા વિના વધુ સ્પષ્ટતા, ઓછા વિશિષ્ટ શબ્દો, ઓછા વિચિત્ર શબ્દપ્રયોગ, ઓછી બિનઉપયોગી વિગતો અને એકંદરે થોડા ટૂંકા જવાબોની અપેક્ષા રાખો.
શૈલી વ્યક્તિગત પસંદગીનો વિષય હોવા છતાં, અહીં અમને GPT‑6 Solનો જવાબ વધુ પસંદ છે. તે ઉતાવળે નિષ્કર્ષ પર પહોંચતો નથી, પૂછનારને સ્પષ્ટ હોઈ શકે તેવી વિગતોનું પુનરાવર્તન કરવામાં ઓછો સમય વિતાવે છે, જેમ કે વેબસાઇટમાં ચાર પેજ છે. તે “બેન્ટો જેવો દેખાવ” અને “તે સિસ્ટમને આધારે ફરી આકાર આપવો” જેવી અસ્પષ્ટ ભાષા ઓછી વાપરે છે, તેણે શું તપાસ્યું અને શું ન તપાસ્યું તે વધુ સ્પષ્ટ કહે છે અને તેના ઇમેજ સાધનના પ્રોમ્પ્ટ જેવી અમલીકરણ વિગતો બિનજરૂરી રીતે જણાવતો નથી.
ટોકનની ઓછી કિંમતો સાથે, અમે GPT‑6 પર નિર્માણ કરતા વિકાસકર્તાઓને તેમની એપ્લિકેશનો ફરી વાપરતા સંદર્ભ પર વધુ બચત કરવામાં મદદ કરી રહ્યા છીએ. અમે GPT‑6 માટે પ્રોમ્પ્ટ કૅશિંગ સુધાર્યું છે, જેથી મૂળભૂત રીતે વધુ કૅશ સફળતા દર મળે. તે એજન્ટને વધુ સંદર્ભ ફરી વાપરવા, ઝડપથી જવાબ આપવા અને કૅશ કરેલા ઇનપુટ-ટોકન વાંચન પર 90% છૂટ મેળવવામાં મદદ કરે છે.
વિકાસકર્તાઓ પાસે કૅશિંગનું પ્રદર્શન માપવા અને સુધારવાની વધુ રીતો પણ છે:
દેખરેખ રાખો અને નિદાન કરો. પ્રોમ્પ્ટ કૅશિંગ ડૅશબોર્ડ(નવી વિન્ડોમાં ખૂલે છે) કેટલું ઇનપુટ કૅશ થયું છે અને સમય સાથે તેમાં કેવો ફેરફાર થાય છે તે દર્શાવે છે. નિદાન સાધન(નવી વિન્ડોમાં ખૂલે છે) કૅશિંગની ચૂકી ગયેલી તકો અને શું સુધારવું તે સમજવામાં મદદ કરે છે.
કૅશને અસર કર્યા વિના રીઝનિંગના પ્રયાસનું સ્તર અને ટૂલ્સની ઉપલબ્ધતા ગોઠવો.વધુ મુશ્કેલ કાર્યો માટેરીઝનિંગના પ્રયાસનું(નવી વિન્ડોમાં ખૂલે છે)સ્તર વધારો અથવા સરળ ફોલો-અપ માટે તેને ઓછું કરો, તેમજ તમારા એજન્ટની જરૂરિયાત પ્રમાણે ટૂલ્સનેસક્ષમ અથવા અક્ષમ કરો(નવી વિન્ડોમાં ખૂલે છે)હવે બંને નિયંત્રણો કૅશના પુનઃઉપયોગ માટે અગાઉના સંદર્ભને જાળવી રાખે છે.
કયા ઉપસર્ગ કૅશ થાય તે વધુ અસરકારક બનાવો. સ્પષ્ટ વિરામબિંદુઓ વિકાસકર્તાઓને કૅશ કરેલા પ્રોમ્પ્ટના ઉપસર્ગ ક્યાં સમાપ્ત થાય તે પસંદ કરવા દે છે. આનાથી વિકાસકર્તાઓને કૅશના પુનઃઉપયોગ પર વધુ નિયંત્રણ મળે છે અને પ્રદર્શન સુધરી શકે છે.
GitHub જણાવે છે કે છેલ્લા કેટલાક મહિનામાં આ સુધારાઓએ OpenAI મોડલને કરાયેલી અબજો વિનંતીઓમાં નવેસરથી પ્રક્રિયા કરવાની જરૂર હોય તેવા પ્રોમ્પ્ટ ટોકનનો હિસ્સો 50%થી વધુ ઘટાડ્યો છે, જેથી Copilot ઝડપથી જવાબ આપી શકે છે.
GPT‑6 Sol અને Luna અત્યાર સુધીના અમારા સૌથી સુસંગત મોડલ Astra સાથે રજૂ કરાયેલા સુસંગતતા કાર્યને આગળ વધારે છે. અમારા સુસંગતતા મૂલ્યાંકનોમાં Sol અને Luna બંને તેમનાં GPT‑5.6 સમકક્ષ મોડલ કરતાં સુધારો દર્શાવે છે, જેમાં પોતાના કોડિંગ કાર્ય વિશેના ભ્રામક દાવાનો ઓછો દર પણ સામેલ છે.
નીચેનાં મૂલ્યાંકન જાણીજોઈને પડકારજનક પરિસ્થિતિઓનું પરીક્ષણ કરે છે અને સામાન્ય ઉપયોગમાં નિષ્ફળતાનો દર માપતાં નથી. સંપૂર્ણ પરિણામો માટે સિસ્ટમ કાર્ડ(નવી વિન્ડોમાં ખૂલે છે) જુઓ.
GPT‑6 Sol અને GPT‑6 Luna આજથી તમામ Plus, Pro, Business, Enterprise અને Edu વપરાશકર્તાઓ માટે ChatGPT કામ અને Codex માં ઉપલબ્ધ છે. Free અને Go વપરાશકર્તાઓ ડેસ્કટૉપ એપ્લિકેશનમાં GPT‑6 Luna વાપરી શકે છે. આ મોડલ હજી ચૅટ માં ઉપલબ્ધ નથી. OpenAI API માં તે gpt-6-sol અને gpt-6-luna તરીકે ઉપલબ્ધ છે.
દરેક માટે સેવા સ્થિર રાખવા અમે આ મોડલ આખા દિવસ દરમિયાન ધીમે ધીમે ChatGPTમાં ઉપલબ્ધ કરાવવાની યોજના ધરાવીએ છીએ. જો તમને ChatGPT કામ અથવા Codexમાં નવાં મોડલ ન દેખાય તો કૃપા કરીને થોડા સમય પછી ફરી પ્રયાસ કરો.
GPT નું મૂલ્યાંકન અમારા સંશોધન વાતાવરણમાં અથવા અમારી API દ્વારા કરવામાં આવ્યું હતું. સિસ્ટમ પ્રોમ્પ્ટ, ઉપલબ્ધ સાધનો વગેરેમાં તફાવતને કારણે તેનું આઉટપુટ કાર્યરત ChatGPT કરતાં થોડું અલગ હોઈ શકે છે. સ્પર્ધક મોડલનાં મૂલ્યાંકન જાહેરમાં ઉપલબ્ધ અહેવાલોમાંથી લેવામાં આવ્યાં હતાં. Claude Fable 5.1 ના સ્કોર ઉપલબ્ધ ન હોય ત્યારે Claude Fable 5 ના સ્કોર દર્શાવાયા છે.


