અમે GPT‑5.6 સિરીઝનું મર્યાદિત પ્રિવ્યૂ શરૂ કરી રહ્યા છીએ: Sol, અમારું ફ્લેગશિપ મોડલ; Terra, રોજિંદા કામ માટે સંતુલિત મોડલ; અને Luna, એક ઝડપી અને પરવડે તેવું મોડલ. Terra, 2x સસ્તું હોવાની સાથે GPT‑5.5 ની તુલનામાં સ્પર્ધાત્મક પ્રદર્શન ધરાવે છે અને Luna અમારા સૌથી ઓછા ખર્ચે મજબૂત ક્ષમતા પ્રદાન કરે છે.
GPT‑5.6 Sol અમારા અત્યાર સુધીના સૌથી મજબૂત સુરક્ષા સ્ટેક સાથે લોન્ચ થઈ રહ્યું છે. અમે ઉચ્ચ-જોખમવાળી પ્રવૃત્તિ, સંવેદનશીલ સાયબર વિનંતીઓ અને વારંવાર થતા દુરુપયોગ માટે સુરક્ષા વધારી છે, અને નબળાઈઓ શોધવા, અમારી સિસ્ટમનું પ્રેશર-ટેસ્ટિંગ કરવા અને તેને વાસ્તવિક દુનિયાના હુમલાઓ સામે મજબૂત બનાવવા માટે અનેક અઠવાડિયાઓ ગાળ્યા છે.
અમે વ્યાપક ઍક્સેસમાં માનીએ છીએ, અને અમે આવનારા અઠવાડિયાઓમાં GPT‑5.6 Sol, Terra અને Luna ને સામાન્ય રીતે ઉપલબ્ધ બનાવવાનું આયોજન કરી રહ્યા છીએ. યુ.એસ. સરકાર સાથેના અમારા ચાલુ જોડાણના ભાગરૂપે, અમે આજના લોન્ચ પહેલાં અમારી યોજનાઓ અને મોડલ્સની ક્ષમતાઓનું પ્રિવ્યૂ આપ્યું હતું. તેમની વિનંતી પર, વધુ વ્યાપકપણે રિલીઝ કરતા પહેલા, અમે વિશ્વસનીય ભાગીદારોના એક નાના જૂથ માટે મર્યાદિત પ્રિવ્યૂથી શરૂઆત કરી રહ્યા છીએ, જેમની ભાગીદારી સરકાર સાથે શેર કરવામાં આવી છે. આ પ્રિવ્યૂ દરમિયાન, વધુ વ્યાપક ઉપલબ્ધતાની દિશામાં કામ કરતી વખતે અમે ભાગીદારો સાથે પરીક્ષણ અને નજીકથી સંકલન કરવાનું ચાલુ રાખીશું. અમારું માનવું નથી કે આ પ્રકારની સરકારી ઍક્સેસ પ્રક્રિયા લાંબા ગાળા માટે ડિફોલ્ટ બનવી જોઈએ. તે શ્રેષ્ઠ ટૂલ્સને એવા વપરાશકર્તા, ડેવલપર્સ, એન્ટરપ્રાઇઝિસ, સાયબર ડિફેન્ડર્સ અને વૈશ્વિક ભાગીદારોથી દૂર રાખે છે જેમને તેમની જરૂર છે. અમે આ ટૂંકા ગાળાનું પગલું ભરી રહ્યા છીએ કારણ કે અમારું માનવું છે કે આવનારા અઠવાડિયાઓમાં વધુ વ્યાપક ઉપલબ્ધતા માટે આ સૌથી મજબૂત માર્ગ છે, જ્યારે અમે સાયબર એક્ઝિક્યુટિવ ઓર્ડર ફ્રેમવર્ક અને ભવિષ્યના મોડલ રિલીઝ માટે પુનરાવર્તિત કરી શકાય તેવી પ્રક્રિયા વિકસાવવા માટે વહીવટીતંત્ર સાથે કામ કરીએ છીએ.
GPT‑5.6 Sol અમારું અત્યાર સુધીનું સૌથી મજબૂત મોડલ છે. મોડલના પ્રદર્શનનું પ્રિવ્યૂ આપવા માટે, અમે કોડિંગ, બાયોલોજી અને સાયબર સિક્યોરિટીમાં બહેતર એજન્ટિક ક્ષમતાઓને હાઇલાઇટ કરતા મૂલ્યાંકનોનો એક સમૂહ શેર કરીએ છીએ, જેમાં અમારા સિસ્ટમ કાર્ડ(નવી વિન્ડોમાં ખૂલે છે)માં ઉપલબ્ધ વધારાની સુરક્ષા અને સજ્જતાના મૂલ્યાંકનોનો સમાવેશ થાય છે. જ્યારે અમે મોડલને વ્યાપકપણે ઉપલબ્ધ કરાવીશું ત્યારે અમે મૂલ્યાંકન પરિણામોનો એક વિસ્તૃત સમૂહ શેર કરીશું.
GPT‑5.6 સાથે, Sol ને ઊંડાણપૂર્વક રિઝનિંગ કરવા માટે સૌથી વધુ સમય આપવા માટે અમે એક નવું `max` રિઝનિંગ પ્રયાસો રજૂ કરી રહ્યા છીએ. આ ઉપરાંત, અમે એક નવો `ultra` મોડ રજૂ કરી રહ્યા છીએ જે જટિલ કામને ઝડપી બનાવવા માટે સબ-એજન્ટ્સનો ઉપયોગ કરીને એક સિંગલ એજન્ટની ક્ષમતાઓ કરતાં પણ આગળ વધે છે.
કોડિંગ વર્કફ્લો માટે, GPT‑5.6 Sol Terminal‑Bench 2.1 પર નવું અત્યાધુનિક ધોરણ સ્થાપિત કરે છે, જે એવા કમાન્ડ-લાઇન વર્કફ્લોનું પરીક્ષણ કરે છે જેમાં આયોજન, પુનરાવર્તન અને ટૂલ સંકલનની જરૂર હોય છે.
GPT‑5.6 Sol બાયોલોજી વર્કફ્લોમાં પણ વ્યાપક સુધારાઓ દર્શાવે છે. GeneBench v1 પર, જે લાંબા ગાળાના જિનોમિક્સ અને ક્વોન્ટિટેટિવ-બાયોલોજી વિશ્લેષણોનું મૂલ્યાંકન કરે છે, તે ઓછા ટોકન્સનો ઉપયોગ કરીને GPT‑5.5 કરતાં વધુ મજબૂત પરિણામો પ્રાપ્ત કરે છે.
GPT‑5.6 Sol સાયબર સિક્યોરિટી માટે અમારું અત્યાર સુધીનું સૌથી સક્ષમ મોડલ છે. તે નબળાઈ સંશોધન અને શોષણ સહિત લાંબા ગાળાના સુરક્ષા કાર્યો માટે પ્રદર્શન-કાર્યક્ષમતાની સીમાને બદલે છે. ExploitBench² પર, માત્ર ~1/3 આઉટપુટ ટોકન્સનો ઉપયોગ કરીને GPT‑5.6 Sol એ Mythos પ્રિવ્યૂ સાથે સ્પર્ધાત્મક છે. UC બર્કલેના સંશોધકો દ્વારા OpenAI અને અન્ય અગ્રણી લેબ્સના સહયોગથી બનાવવામાં આવેલા બેન્ચમાર્ક, ExploitGym(નવી વિન્ડોમાં ખૂલે છે)3 પર, અમે જેમ જેમ રિઝનિંગ વધારીએ છીએ તેમ તેમ GPT‑5.6 Sol, Terra અને Luna બધાં જ મોડલ્સ સાયબર ક્ષમતાઓમાં મજબૂત સુધારા દર્શાવે છે.
અમે દરેક મોડલની ક્ષમતાઓને અનુરૂપ કન્ફિગરેશન સાથે, GPT‑5.6 Sol, Terra અને Luna ને અમારા અત્યાર સુધીના સૌથી મજબૂત સુરક્ષા ઉપાયો સાથે વિકસાવ્યા છે. જેમ જેમ મોડલ વધુ સક્ષમ બને છે, તેમ અમે કોડ રિવ્યૂ, વલ્નરેબિલિટી રિસર્ચ, પેચ ડેવલપમેન્ટ, ડિબગિંગ, સિક્યોરિટી એજ્યુકેશન અને ડિફેન્સિવ ટેસ્ટિંગ જેવા કાયદેસરના કામ માટે ઍક્સેસ જાળવી રાખીને, વાસ્તવિક દુનિયાના પ્રતિકૂળ દબાણ સામે વધુ સારી રીતે ટકી રહેવા માટે સુરક્ષા ઉપાયો ડિઝાઇન કરીએ છીએ. અમારું લક્ષ્ય આ ફાયદાકારક ઉપયોગોને બિનજરૂરી રીતે મર્યાદિત કર્યા વિના, પ્રતિબંધિત આક્રમક પ્રવૃત્તિઓને વધુ મુશ્કેલ, અનિશ્ચિત અને શોધી શકાય તેવી બનાવવાનું છે. મોડલ અને સુરક્ષા ઉપાયોના અમારા મૂલ્યાંકનના આધારે, અમે અપેક્ષા રાખીએ છીએ કે તે પ્રતિબંધિત આક્રમક ઉપયોગને સાર્થક રીતે નિયંત્રિત કરવાની સાથે સાથે કાયદેસરના રક્ષણાત્મક કામ માટે નોંધપાત્ર લાભ પ્રદાન કરશે.
વિશ્વસનીય રીતે એન્ડ-ટુ-એન્ડ હુમલાઓ કરવા કરતાં, GPT‑5.6 Sol લોકોને નબળાઈઓ શોધવામાં અને તેને સુધારવામાં મદદ કરવામાં વધુ સારું છે. જેમ જેમ આ ક્ષમતાઓ વધુ વિકસિત થતી જાય છે, તેમ તેમ અમારી પ્રાથમિકતા એ સુનિશ્ચિત કરવાની છે કે તે ડિફેન્ડર્સ સુધી પહોંચે અને તેમને ફાયદો થાય, જેઓ આ ટૂલ્સનો ઉપયોગ નબળાઈઓ શોધવા, પેચ વિકસાવવા અને સિસ્ટમને વધુ વ્યાપક રીતે મજબૂત કરવા માટે કરી શકે છે.
GPT‑5.6 Sol અમારા પ્રિપેર્ડનેસ ફ્રેમવર્ક હેઠળ સાયબર ક્રિટિકલ થ્રેશોલ્ડને પાર કરતું નથી. ક્રોમિયમ અને ફાયરફોક્સ સંકળાયેલા હોય તેવા મૂલ્યાંકનોમાં, તેણે બગ્સ અને એક્સપ્લોઇટેશન પ્રિમિટિવ્સ—જે એક્સપ્લોઇટના બિલ્ડિંગ બ્લોક્સ છે—ને ઓળખ્યા, પરંતુ પરીક્ષણ કરાયેલી શરતો હેઠળ સ્વાયત્ત રીતે કાર્યરત ફૂલ-ચેઇન એક્સપ્લોઇટ બનાવ્યું નથી. છતાં પણ, બેન્ચમાર્ક થ્રેશોલ્ડ્સ મોડલનો ઉપયોગ કરવાની અથવા તેને અન્ય ટૂલ્સ સાથે સાંકળવાની દરેક રીતને આવરી શકતા નથી. તે અનિશ્ચિતતા અને મોડલની ક્ષમતાઓમાં વ્યાપક ફેરફારને કારણે જ અમે મોડલની વધેલી ક્ષમતાઓને વધુ મજબૂત સુરક્ષા ઉપાયો અને તબક્કાવાર રિલીઝ સાથે જોડી રહ્યા છીએ. અમે GPT‑5.6 પ્રિવ્યૂ સિસ્ટમ કાર્ડ(નવી વિન્ડોમાં ખૂલે છે)માં અમારા સુરક્ષા ઉપાયો વિશે વધુ વિગતો શેર કરીએ છીએ.
દૃઢ અથવા અનુકૂલનશીલ દુરુપયોગ સામે કોઈ એક સેફગાર્ડ પૂરતો નથી. સમગ્ર GPT‑5.6 પ્રિવ્યૂમાં, અમે સ્તરીય સેફગાર્ડ્સનો ઉપયોગ કરીએ છીએ, જેના ચોક્કસ કોન્ફિગરેશન્સ અલગ-અલગ મોડલ્સમાં ભિન્ન હોય છે, અને વાસ્તવિક દુનિયાના હુમલાઓ સામે અમે તેમનું પ્રેશર-ટેસ્ટિંગ કરીએ છીએ. આમાં મોડલમાં ટ્રેઇન કરવામાં આવેલા પ્રોટેક્શન્સ, જનરેશન દરમિયાન રિયલ-ટાઇમ ચેક્સ, એકાઉન્ટ-લેવલ સિગ્નલ્સ, વિભેદક ઍક્સેસ, મોનિટરિંગ, અમલીકરણ અને સતત ટેસ્ટિંગનો સમાવેશ થાય છે.
GPT‑5.6 ને પ્રતિબંધિત સાયબર સહાયનો ઇનકાર કરવા માટે તાલીમ આપવામાં આવી છે, જેમાં વપરાશકર્તાઓ તેમના ઇરાદાને છુપાવવાનો અથવા મોડલને જેલબ્રેક કરવાનો પ્રયાસ કરે તેવા કિસ્સાઓનો પણ સમાવેશ થાય છે. આ મોડલ-સ્તરના સુરક્ષા ઉપાયો એ બાબતની પ્રથમ સીમા નક્કી કરે છે કે મોડલે શેમાં મદદ કરવી જોઈએ અને શેમાં મદદ ન કરવી જોઈએ.
રિયલ-ટાઇમ સાયબર અને બાયોલોજી મિસયૂઝ ક્લાસિફાયર્સ, આઉટપુટ જેમ જનરેટ થાય છે તેમ તેનું મૂલ્યાંકન કરીને અન્ય એક સ્તર પ્રદાન કરે છે. ઉચ્ચ જોખમવાળા કિસ્સાઓમાં, જો તેઓ કોઈ સંભવિત ઉલ્લંઘન શોધી કાઢે, તો એક મોટું રિઝનિંગ મોડલ વાતચીત અને તેના સંદર્ભની સમીક્ષા કરે ત્યાં સુધી જનરેશનને અટકાવી દેવામાં આવી શકે છે. જો આઉટપુટને અસ્વીકાર્ય તરીકે મૂલ્યાંકિત કરવામાં આવે, તો તે વપરાશકર્તા સુધી પહોંચે તે પહેલાં તેને રોકી લેવામાં આવે છે.
ફ્લેગ કરવામાં આવેલી પ્રવૃત્તિ, સામગ્રી જાળવણી અને સમીક્ષા સંબંધિત અમારી શરતો અને નીતિઓને સુસંગત રહીને, સંબંધિત વાતચીતો અને જોખમના સંકેતોમાં એકાઉન્ટ-સ્તરની સમીક્ષા પણ શરૂ કરી શકે છે. માત્ર એક જ વાતચીતથી આગળ જોવાથી અમારી સિસ્ટમને સતત દૂષિત વર્તન અને કાયદેસરના દ્વિ-ઉપયોગી સુરક્ષા કાર્ય વચ્ચે તફાવત કરવામાં મદદ મળે છે, જ્યાં સમાન તકનીકી વિભાવનાઓ તદ્દન અલગ સંદર્ભોમાં જોવા મળી શકે છે.
સંયુક્ત રીતે, આ સ્તરો એકંદર અભિગમને કોઈ એકલ સુરક્ષા ઉપાયની તુલનામાં વધુ મજબૂત બનાવે છે. મોડલનું વર્તન હાનિકારક પ્રતિસાદોની સંભાવના ઘટાડે છે, રિયલ-ટાઇમ સિસ્ટમ્સ જનરેશન દરમિયાન હસ્તક્ષેપ કરી શકે છે, એકાઉન્ટ-સ્તરની સમીક્ષા વ્યાપક પૅટર્નને ઓળખી શકે છે, અને વિભેદક ઍક્સેસ સૌથી સંવેદનશીલ ક્ષમતાઓને ડિફૉલ્ટ રૂપે વ્યાપકપણે ઉપલબ્ધ કરાવ્યા વિના મહત્વપૂર્ણ સંરક્ષણાત્મક કાર્યને જાળવી રાખે છે.
ખાસ કરીને પ્રિવ્યૂ દરમિયાન, વપરાશકર્તાઓને એવા સુરક્ષા ઉપાયોનો સામનો કરવો પડી શકે છે જે કેટલીક વિનંતીઓને અવરોધિત કરે છે અથવા તેનો ઇનકાર કરે છે. અન્ય વિનંતીઓમાં વધુ સમય લાગી શકે છે કારણ કે વધારાની સમીક્ષા માટે જનરેશનને અટકાવવામાં આવે છે. સુરક્ષા ઉપાયો ક્યારેક કાયદેસરના કાર્યમાં હસ્તક્ષેપ કરી શકે છે, ખાસ કરીને દ્વિ-ઉપયોગી ક્ષેત્રોમાં જ્યાં સંરક્ષણાત્મક અને આક્રમક પ્રવૃત્તિ શરૂઆતમાં સમાન દેખાઈ શકે છે.
આ એ બાબતનો જ એક ભાગ છે જેનું પરીક્ષણ કરવા માટે પ્રિવ્યૂ ડિઝાઇન કરવામાં આવ્યું છે. અમે માત્ર એ જ સમજવા માંગતા નથી કે સુરક્ષા ઉપાયો દુરુપયોગને નિયંત્રિત કરે છે કે કેમ, પરંતુ એ પણ જાણવા માંગીએ છીએ કે શું કાયદેસરના વપરાશકર્તાઓ હજુ પણ તેમનું સામાન્ય કાર્ય વિશ્વસનીય અને કાર્યક્ષમ રીતે પૂર્ણ કરી શકે છે કે કેમ. પ્રિવ્યૂ દરમિયાન મળતો પ્રતિસાદ અમને બિનજરૂરી અવરોધો અને વિલંબને ઘટાડવામાં, સુરક્ષા ઉપાયો સંદર્ભનું કેવી રીતે અર્થઘટન કરે છે તેમાં સુધારો કરવામાં અને વ્યાપક રિલીઝ પહેલાં વધુ સરળ અનુભવ ઊભો કરવામાં મદદ કરશે.
અમે એન્ટરપ્રાઇઝ ગ્રાહકો સાથે લાંબા ગાળાના અભિગમો પર પણ કામ કરી રહ્યા છીએ—જેમાં ગોપનીયતા જાળવી રાખતી તપાસ, ગ્રાહક દ્વારા સંચાલિત સુરક્ષા નિયંત્રણો, અને ગ્રાહક, વપરાશકર્તા અથવા વર્કલોડના જોખમના આધારે નિર્ધારિત ઍક્સેસનો સમાવેશ થાય છે—જેથી એન્ટરપ્રાઇઝની ગોપનીયતા જરૂરિયાતોને સમર્થન આપવાની સાથે સુરક્ષા વધારી શકાય.
જ્યારે હુમલાખોરો તેમની યુક્તિઓમાં ફેરફાર કરે ત્યારે સુરક્ષા ઉપાયો પણ અસરકારક રહેવા જરૂરી છે. માત્ર જાણીતા હુમલાઓના નિશ્ચિત સમૂહ પર જ કામ કરતી સુરક્ષા અત્યાધુનિક મોડલ માટે પૂરતી મજબૂત નથી.
તેથી જ અમે નબળાઈઓ શોધવા અને સુરક્ષા ઉપાયોને વધુ ઝડપથી સુધારવા માટે અમારા પોતાના મોડલ્સનો ઉપયોગ કરીને, સુરક્ષા માટે અગાઉ કરતાં વધુ ઇન્ટેલિજન્સ અને કમ્પ્યુટ લાગુ કરી રહ્યા છીએ. અમે સ્વચાલિત રેડ-ટીમિંગ માટે 700,000 થી વધુ A100-સમતુલ્ય GPU કલાકો ફાળવ્યા છે, જેનો હેતુ યુનિવર્સલ જેલબ્રેક્સ શોધવાનો છે: એવા હુમલાઓ કે જે માત્ર કોઈ એક સંકુચિત સેટિંગમાં જ નહીં, પરંતુ ઘણા પ્રોમ્પ્ટ્સ અથવા સંદર્ભોમાં કામ કરી શકે છે. આ વધુ કઠિન, વધુ વ્યાપક હુમલાઓ પર ધ્યાન કેન્દ્રિત કરવાથી અમે જાણીતી નિષ્ફળતાઓના નિશ્ચિત સમૂહથી આગળ વધીને સુરક્ષા ઉપાયોનું પરીક્ષણ કરી શક્યા છીએ. તે અમને માત્ર માનવીય પરીક્ષણ આવરી શકે તેના કરતાં હુમલાની ઘણી વધુ પેટર્નનું અન્વેષણ કરવાની, નિષ્ફળતાની પેટર્નને વહેલા ઓળખવાની અને નબળાઈ શોધવાથી લઈને તેનો ઉકેલ લાવવા સુધીના માર્ગને ટૂંકો કરવાની પણ મંજૂરી આપે છે.
સ્વચાલિત રેડ-ટીમિંગ ઉપરાંત, અમે વ્યાપક માનવીય નિષ્ણાત રેડ-ટીમિંગ હાથ ધરવા માટે થર્ડ-પાર્ટી ટેસ્ટર્સ સાથે કામ કર્યું છે, જે પ્રિવ્યૂ સમયગાળામાં ચાલુ રહેશે. માનવીય રેડ-ટીમિંગ એવા ક્રિએટિવ નિષ્ણાતો સામે સુરક્ષા ઉપાયોનું પરીક્ષણ કરીને ઓટોમેટેડ કાર્યને પૂરક બનાવે છે, જેઓ મોડલનો એવી રીતે દુરુપયોગ કરવાનો પ્રયાસ કરતા હોય જેની અમારી સિસ્ટમ્સ કદાચ અપેક્ષા ન રાખી શકે.
કોઈપણ મૂલ્યાંકન દરેક પ્રોડક્ટ કન્ફિગરેશન, મલ્ટિ-સ્ટેપ હુમલા અથવા વાસ્તવિક દુનિયાના વર્કફ્લોને રજૂ કરી શકતું નથી. તેથી અમે નવા શોધાયેલા જેલબ્રેક્સનું પુનઃસર્જન કરવા, આકારણી કરવા, પ્રાથમિકતા આપવા અને નિવારણ કરવા માટે એક ઝડપી પ્રતિભાવ પ્રક્રિયા જાળવીએ છીએ, ત્યારબાદ તેમને અમારા ચાલુ મૂલ્યાંકનોમાં ઉમેરીએ છીએ જેથી અમે ભવિષ્યમાં સમાન નિષ્ફળતાઓ સામે પરીક્ષણ કરી શકીએ.
પ્રિવ્યૂ દરમિયાન, GPT‑5.6 મોડલ્સ શરૂઆતમાં વિશ્વસનીય ભાગીદારો અને સંસ્થાઓના પસંદગીના જૂથ માટે API અને Codex દ્વારા ઉપલબ્ધ થશે. અમે ટૂંક સમયમાં ChatGPT, Codex અને API નો ઉપયોગ કરતા લોકો માટે તેમને વધુ વ્યાપકપણે ઉપલબ્ધ બનાવવાનું આયોજન કરી રહ્યા છીએ.
GPT‑5.6 સાથે રજૂ કરવામાં આવેલી આ નવી નામકરણ સિસ્ટમમાં, નંબર મોડલની જનરેશન દર્શાવે છે, જ્યારે Sol, Terra અને Luna એવા સ્થાયી ક્ષમતા સ્તરોને દર્શાવે છે જે તેમની પોતાની ગતિએ વિકસી શકે છે. એકસાથે, આ પરિવાર લોકોને અને ડેવલપર્સને બુદ્ધિમત્તા, ઝડપ અને ખર્ચ અંગે વધુ સ્પષ્ટ વિકલ્પો આપે છે.
GPT‑5.6 ની કિંમત ત્રણ મોડલ સાઇઝમાં 1M ટોકન દીઠ નક્કી કરવામાં આવી છે: Sol માટે $5 ઇનપુટ / $30 આઉટપુટ છે; Terra માટે $2.50 ઇનપુટ / $15 આઉટપુટ છે; અને Luna માટે $1 ઇનપુટ / $6 આઉટપુટ છે. GPT‑5.6 વધુ અનુમાનિત પ્રોમ્પ્ટ કેશિંગ પણ રજૂ કરે છે, જેમાં સ્પષ્ટ કેશ બ્રેકપોઇન્ટ્સ માટે સપોર્ટ અને 30-મિનિટના ન્યૂનતમ કેશ લાઇફનો સમાવેશ થાય છે. GPT‑5.6 અને પછીના મોડલ્સ માટે, કેશ રાઇટ્સનું બિલ મોડલના અનકેશ્ડ ઇનપુટ રેટ કરતાં 1.25x લેખે કરવામાં આવે છે, જ્યારે કેશ રીડ્સ પર 90% કેશ્ડ-ઇનપુટ ડિસ્કાઉન્ટ મળવાનું ચાલુ રહે છે.
અમે જુલાઈમાં Cerebras પર પ્રતિ સેકન્ડ 750 ટોકન્સ સુધીની ઝડપે GPT‑5.6 Sol પણ લોન્ચ કરી રહ્યા છીએ, જે ગ્રાહકો માટે અભૂતપૂર્વ ઝડપે અત્યાધુનિક બુદ્ધિમત્તા લાવશે. અમે ક્ષમતા વિસ્તારી રહ્યા હોવાથી, શરૂઆતમાં ઍક્સેસ પસંદગીના ગ્રાહકો માટે મર્યાદિત રહેશે.
અમે આ પ્રિવ્યૂ સમયગાળામાંથી શીખવાનું ચાલુ રાખવા અને ટૂંક સમયમાં GPT‑5.6 Sol, Terra અને Luna ને વધુ લોકો સુધી પહોંચાડવા માટે ઉત્સાહિત છીએ.
1. અમે અમારા મોડલ્સના પ્રોડક્શન વર્તનને ધ્યાનમાં લઈને અને ઑફલાઇન સિમ્યુલેટ કરીને લેટન્સી અને API ખર્ચનો અંદાજ લગાવીએ છીએ. આ અંદાજોમાં ટૂલ કૉલની વિગતો, સેમ્પલ કરેલા ટોકન્સ અને ઇનપુટ ટોકન્સને ધ્યાનમાં લેવામાં આવે છે. વાસ્તવિક દુનિયાનાં પરિણામો નોંધપાત્ર રીતે અલગ હોઈ શકે છે, અને તે એવા ઘણા પરિબળો પર આધાર રાખે છે જે અમારા સિમ્યુલેશનમાં આવરી લેવામાં આવ્યા નથી. અમે ઝડપી API સ્પીડ પર લેટન્સી, અને નિયમિત API કિંમત પર ખર્ચને સિમ્યુલેટ કરીએ છીએ.
2. બધા મોડલનું મૂલ્યાંકન ExploitBench API કાર્યપ્રણાલી સાથે 5 સીડ્સ અને રિઝનિંગ સતતતા વડે કરવામાં આવે છે.
3. અમે અમારા આલ્ફા API પર ExploitGym ચલાવ્યું, જે અમારા પબ્લિક API કરતાં વધુ ઝડપથી પ્રતિભાવો આપે છે, અને પછી અમારા પબ્લિક API સાથે મેળ ખાવા માટે તેને રિસ્કેલ કર્યું. અમારા પબ્લિક API માટે અપેક્ષિત ઝડપ મુજબ લેટન્સીને રિસ્કેલ કરતી વખતે, આના કારણે કેટલીક અંદાજિત લેટન્સી 2 કલાક અને 6 કલાકની સમય મર્યાદાને વટાવી જાય છે, જોકે મૂલ્યાંકન રનમાં તેનું યોગ્ય રીતે પાલન કરવામાં આવ્યું હતું. સમય-સંવેદનશીલ કામ માટે વધુ ઝડપ મેળવવા માટે, અમે API માં પ્રાયોરિટી પ્રોસેસિંગઅને Codex માં ફાસ્ટ મોડ ઑફરકરીએ છીએ.
4. જે મોડલ્સ માટે આઉટપુટ ટોકન્સ, લેટન્સી અથવા ખર્ચ રિપોર્ટ કરવામાં આવ્યા નથી, તેમને આડી ટપકાંવાળી રેખાઓ તરીકે પ્લોટ કરવામાં આવ્યા છે.

