GPT-6.1Sol
સતત અત્યાધુનિક પ્રદર્શન માટે પાંચમા ભાગની કિંમતે Astraની નજીકની બુદ્ધિક્ષમતા
અમે રજૂ કરી રહ્યા છીએ GPT‑6.1 Sol, જે GPT‑6 Solનું ઉન્નત સંસ્કરણ છે અને એજન્ટિક કોડિંગ, કમ્પ્યુટરના ઉપયોગ તથા વ્યાવસાયિક કામમાં અસાધારણ રીતે સારું પ્રદર્શન કરે છે. તે પડકારજનક કાર્યોમાં Solને GPT‑6 Astraની વધુ નજીક લાવે છે, અને તે પણ Astraના પ્રમાણભૂત ઇનપુટ અને આઉટપુટ ટોકનના ભાવના પાંચમા ભાગની કિંમતે. આમ વિકાસકર્તાઓ એ જ બજેટમાં સક્ષમ એજન્ટ બનાવવા અને ચલાવવા માટે વધુ અવકાશ મેળવે છે.
GPT‑6.1 Sol, Solની કિંમતે Astraની નજીકનું પ્રદર્શન આપે છે, જેથી તે આજે ઉપલબ્ધ મોડલમાં તેના પ્રદર્શનની સરખામણીએ સૌથી વધુ કિફાયતી મોડલ બને છે. કૅશ કરેલા ઇનપુટનો ખર્ચ દસ લાખ ટોકનદીઠ માત્ર $0.10 છે—પ્રમાણભૂત ઇનપુટના ભાવ પર 95% છૂટ. આથી વારંવારની વિનંતીઓમાં સંદર્ભનો ફરી ઉપયોગ કરવાની જરૂર હોય તેવાં એજન્ટિક કાર્યો માટે તે વધુ સસ્તું પડે છે.
એકંદરે GPT‑6 Astra અમારું સૌથી સક્ષમ અત્યાધુનિક મોડલ છે. વપરાશકર્તાઓ વધુ વાર કરવા માગતા હોય તેવા મહત્ત્વના કામ માટે અને મોટા પાયે ઍપ્લિકેશનો બનાવતા તથા ચલાવતા API ગ્રાહકો માટે GPT‑6.1 Sol ક્ષમતા અને ખર્ચનું નવું સંતુલન આપે છે.

કોડ લખવા અને તેમાંની ભૂલો સુધારવાથી માંડીને દસ્તાવેજો સમજવા તથા અનેક તબક્કાવાળી વ્યવસાયિક કાર્યપ્રક્રિયાઓ અમલમાં મૂકવા સુધીનાં જટિલ વ્યાવસાયિક કામમાં GPT‑6.1 Sol, GPT‑6 Sol કરતાં નોંધપાત્ર સુધારા આપે છે. આમાંનાં કેટલાંક મૂલ્યાંકનોમાં તે નોંધપાત્ર રીતે ઓછા ખર્ચે GPT‑6 Astraના પ્રદર્શનની નજીક પહોંચે છે.
વાસ્તવિક કોડભંડારમાં જટિલ સૉફ્ટવેર એન્જિનિયરિંગ કાર્યોનું મૂલ્યાંકન કરતા DeepSWE v1.1 પર, GPT‑6.1 Sol આશરે પાંચમા ભાગના ખર્ચે GPT‑6 Astraની બરાબરી કરે છે. સાથે જ, ઓછા রিজনিং પ્રયત્ન અને ખર્ચે તે GPT‑6 Solના શ્રેષ્ઠ ગુણ કરતાં 6.4 ટકા અંક વધુ મેળવે છે.
DeepSWE 1.1(નવી વિન્ડોમાં ખૂલે છે)માં કૃત્રિમ બુદ્ધિમત્તાના એજન્ટો સોફ્ટવેર ઇજનેરીનાં મૌલિક અને લાંબા સમય સુધી કામ કરવાની જરૂર પડે એવાં કાર્યો ઉકેલે છે.
GDP.pdf એ માપે છે કે કોષ્ટકો, આલેખો, આકૃતિઓ અને ઝીણા અક્ષરોમાં આપેલી વિગતો ધરાવતા જટિલ PDF દસ્તાવેજોનો ઉપયોગ કરીને મોડલ વ્યાવસાયિક પ્રશ્નોના જવાબ કેટલી સચોટતાથી આપે છે. તેમાં પરીક્ષણ કરાયેલાં તમામ রিজনিং સેટિંગમાં GPT‑6.1 Sol, વૈકલ્પિક મોડલની મદદ લેતા Opus 5.5 કરતાં કાર્યદીઠ અડધાથી ઓછા ખર્ચે વધુ ગુણ મેળવે છે. તે કાર્યદીઠ આશરે પાંચમા ભાગના ખર્ચે GPT‑6 Astraના સર્વાધુનિક પ્રદર્શનની પણ નજીક પહોંચે છે.
GDP.pdf(નવી વિન્ડોમાં ખૂલે છે)માં મોડેલોએ નાણાં, આરોગ્યસંભાળ, કાયદો અને અન્ય સાત વ્યાવસાયિક ક્ષેત્રોની કાર્યપ્રક્રિયાઓમાંથી લીધેલી જટિલ PDF ફાઇલો વિશે વાસ્તવિક કામકાજને લગતા પ્રશ્નોના જવાબ આપવા પડે છે.
એજન્ટ અનેક તબક્કાવાળી વ્યવસાયિક કાર્યપ્રક્રિયાઓ યોગ્ય રીતે પૂર્ણ કરે છે કે નહીં તે માપતા AutomationBench પર, મીડિયમ রিজনিং પ્રયત્ન સાથે GPT‑6.1 Sol આશરે ત્રીજા ભાગના ખર્ચે Opus 5.5 કરતાં 2.2 ટકા અંક વધુ મેળવે છે. આ ગુણ એ જ સેટિંગ પર GPT‑6 Sol કરતાં પણ 4.8 ટકા અંક વધુ છે.
In AutomationBench 1.0.6(નવી વિન્ડોમાં ખૂલે છે), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
કમ્પ્યુટર ઍપ્લિકેશનો સાથે ક્રિયાપ્રતિક્રિયા જરૂરી હોય તેવાં કાર્યોમાં પણ GPT‑6.1 Sol નોંધપાત્ર પ્રગતિ કરે છે. કમ્પ્યુટરના ઉપયોગની પડકારજનક કાર્યપ્રક્રિયાઓ પર એજન્ટનું મૂલ્યાંકન કરતા OSWorld 2.0ના ઑફલાઇન સંચ પર, મહત્તમ রিজনিং પ્રયત્ન સાથે GPT‑6.1 Sol અડધાથી ઓછા ખર્ચે GPT‑6 Sol કરતાં સાત ટકા અંક વધુ મેળવે છે. મહત્તમ রিজনিং પ્રયત્ન સાથે તે કાર્યદીઠ આશરે સાતમા ભાગના ખર્ચે Astraના ગુણથી માત્ર 2.1 ટકા અંકના અંતરે પહોંચે છે.
In OSWorld 2.0(નવી વિન્ડોમાં ખૂલે છે), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
ડેટા વિશ્લેષણ, અનુકરણ અને પ્રમેય સાબિત કરવા સહિતની વૈજ્ઞાનિક કાર્યપ્રક્રિયાઓનું મૂલ્યાંકન કરતા Terminal-Bench Science 0.1 પર, મહત્તમ রিজনিং પ્રયત્ન સાથે GPT‑6.1 Sol કાર્યદીઠ અડધાથી ઓછા ખર્ચે GPT‑6 Sol કરતાં બમણાથી વધુ ગુણ મેળવે છે. મહત્તમ પ્રયત્ન પર GPT‑6.1 Solનો સરેરાશ ખર્ચ કાર્યદીઠ $5.47 છે, જ્યારે Opus 5.5નો $23.21 અને Astraનો $23.80 છે. આમ તે આ બંને મોડલ કરતાં 75%થી વધુ ઓછા ખર્ચે નોંધપાત્ર વૈજ્ઞાનિક ક્ષમતા આપે છે.
પરીક્ષણ કરાયેલાં મોડલમાં GPT‑6 Astra હજુ પણ 68.1% સાથે સૌથી વધુ ગુણ મેળવે છે અને સૌથી કઠિન વૈજ્ઞાનિક સંશોધન કાર્યો માટે તેનો ઉપયોગ કરવો જોઈએ.
Terminal-Bench Science 0.1(નવી વિન્ડોમાં ખૂલે છે)માં એજન્ટો કોડ અને ટર્મિનલનાં સાધનોનો ઉપયોગ કરીને વૈજ્ઞાનિક સંશોધનની કાર્યપ્રક્રિયાઓ પૂર્ણ કરે છે. આમાં માહિતીનું વિશ્લેષણ કરવું, અનુકરણો ચલાવવાં અને મોડેલોને માહિતી અનુસાર ગોઠવવાં સામેલ છે.
GPT‑6.1 Sol કઠિન પ્રોમ્પ્ટ પર તથ્યસચોટતામાં પણ સુધારો કરે છે. અતિ-ઉચ્ચ রিজনিং પ્રયત્ન પર તેનો તથ્યસંબંધિત ભૂલોનો દર 4.1% છે, જે GPT‑6 Solના 4.5% કરતાં ઓછો અને એ જ સેટિંગ પર Astraના 4.0%ની વધુ નજીક છે. સાથે જ તેનો કાર્યદીઠ ખર્ચ Astra કરતાં આશરે 83% ઓછો છે.
આ મૂલ્યાંકનમાં ઓળખસૂચક વિગતો દૂર કરેલી એવી વાતચીતો લેવાય છે, જેમાં વપરાશકર્તાઓએ અગાઉના મોડલની ભૂલ દર્શાવી હતી. તેમાં ઓછામાં ઓછી એક તથ્યસંબંધિત ભૂલ ધરાવતા જવાબોનું પ્રમાણ માપવામાં આવે છે. ઇરાદાપૂર્વક કઠિન રાખવામાં આવેલા આ પ્રોમ્પ્ટ સામાન્ય વપરાશનું પ્રતિનિધિત્વ કરતા નથી.
અમે ઓળખસૂચક વિગતો દૂર કરેલી એવી ChatGPT વાતચીતો પર તથ્યસચોટતાનું મૂલ્યાંકન કરીએ છીએ, જેમાં વપરાશકર્તાઓએ અગાઉના મોડલની તથ્યસંબંધિત ભૂલ દર્શાવી હતી. ભૂલો કરાવતી આ વાતચીતો સામાન્ય વપરાશનું પ્રતિનિધિત્વ કરતી નથી, જેમાં તથ્યસંબંધિત ભૂલો વધુ દુર્લભ હોય છે.
અમારા આશય અને મર્યાદાઓના પાલન અંગેના મૂલ્યાંકનોમાં GPT‑6.1 Sol, GPT‑6 Sol કરતાં નોંધપાત્ર સુધારા દર્શાવે છે અને GPT‑6 Astraની વધુ નજીક પહોંચે છે.
GPT‑6.1 Sol પોતાની મર્યાદાઓ વિશે વધુ પારદર્શક છે અને વપરાશકર્તાના આશય તથા સુરક્ષા મર્યાદાઓનું પાલન કરવામાં વધુ વિશ્વસનીય છે. પડકારજનક મૂલ્યાંકનોમાં, કામ ન કરતાં શોધ સાધનો વિશે પારદર્શક રહેવા, સ્પષ્ટ પ્રતિબંધોનું પાલન કરવા અને એજન્ટિક કાર્યો દરમિયાન અનધિકૃત પરિણામો ટાળવા બાબતે તેનો નિષ્ફળતા દર GPT‑6 Sol કરતાં ઓછો છે. GPT‑6 Astra અને GPT‑6 Solની જેમ, તેમાં પણ અમને સ્વચાલિત સુરક્ષા સમીક્ષકને ટાળીને આગળ વધવાના કોઈ પ્રયાસો જોવા મળ્યા નહીં.
નીચેનાં મૂલ્યાંકનો ઇરાદાપૂર્વક પડકારજનક પરિસ્થિતિઓનું પરીક્ષણ કરે છે અને સામાન્ય વપરાશમાં નિષ્ફળતાના દરને માપતાં નથી.
આજથી GPT‑6.1 Sol તમામ Plus, Pro, Business, Enterprise અને Edu વપરાશકર્તાઓ માટે ChatGPT કામ અને Codexમાં ઉપલબ્ધ છે. આ મોડલ હજી ચૅટમાં ઉપલબ્ધ નથી. વિકાસકર્તાઓ OpenAI API દ્વારા પણ તેનો gpt-6.1-sol તરીકે ઉપયોગ કરી શકે છે. તેના પ્રમાણભૂત API ભાવ દસ લાખ ઇનપુટ ટોકનદીઠ $2, દસ લાખ કૅશ કરેલા ઇનપુટ ટોકનદીઠ $0.10 અને દસ લાખ આઉટપુટ ટોકનદીઠ $10 છે.
સાથે જ, અમે GPT‑6 Astra Ultrafast રજૂ કરી રહ્યા છીએ. GPT‑6 Astra કરતાં 8 ગણા સુધી ઝડપી આ મોડલ વિશ્વનું સૌથી ઝડપી અત્યાધુનિક મોડલ છે. ઉપરાંત અમે GPT‑6.1 Sol Ultrafast પણ રજૂ કરી રહ્યા છીએ. આ મોડલ APIમાં તેમજ દર મહિને $500ના અમારા નવા, સૌથી વધુ વપરાશની છૂટ આપતા Pro સ્તરના વપરાશકર્તાઓ માટે ChatGPT કામ અને Codexમાં ઉપલબ્ધ છે. GPT‑6.1 Sol Ultrafast સાથે વિકાસકર્તાઓ અગાઉ GPT‑6 Astra માટે થતા API ખર્ચ જેટલા જ ખર્ચે 8 ગણી સુધીની ઝડપ સાથે Astraની નજીકની બુદ્ધિક્ષમતા મેળવી શકે છે.
લેખક
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

