ઇન્ટેલિજન્સની નવી પેઢી
22 સપ્ટેમ્બર, 2026નું અપડેટ: અમે GPT‑6 Sol અને GPT‑6 Luna સાથે અમારા GPT‑6 પરિવારનું વિસ્તરણ કરી રહ્યા છીએ. વધુ જાણો.
અમે GPT‑6 Astra રજૂ કરી રહ્યા છીએ, જે વિશ્વનું સૌથી બુદ્ધિશાળી અને સુસંગત મોડલ છે.
GPT‑6 Astra પ્રી-ટ્રેનિંગ, રીઇન્ફોર્સમેન્ટ લર્નિંગ અને સંરેખણમાં વર્ષોના સંશોધન અને મોટા દાવોને એકસાથે લાવે છે. Astra કમ્પ્યુટરનો ઉપયોગ, બ્રાઉઝિંગ, સૉફ્ટવેર એન્જિનિયરિંગ, સાઇબર સુરક્ષા, વિજ્ઞાન અને પ્રોફેશનલ કામમાં અત્યાધુનિક છે. Astra 98% સ્કોર સાથે FrontierMath Tier 4ને સંતૃપ્તી સ્તરે લઈ જાય છે અને તેણે ગણિતમાં લાંબા સમયથી વણઉકેલાયેલી ખુલ્લી સમસ્યાઓ ઉકેલવામાં પહેલેથી જ મદદ કરી છે. Astraએ 99.9%ના સ્કોર સાથે ARC-AGI-3ને અને 100%ના સ્કોર સાથે ExploitBenchને પણ સંતૃપ્તી સ્તરે લઈ ગયું. તે કમ્પ્યુટર અને બ્રાઉઝરના ઉપયોગમાં પણ એક નવો અત્યાધુનિક માપદંડ સ્થાપિત કરે છે અને અજોડ ઝડપ, ચોકસાઈ અને વિવેક સાથે સૌથી વધુ માંગવાળું પ્રોફેશનલ કામ સંભાળે છે.
GPT‑6 Astra આજે મર્યાદિત સંખ્યાની સંસ્થાઓ માટે અમલમાં આવી રહ્યું છે અને આગામી દિવસોમાં તે તમામ ChatGPT Plus, Pro, Business અને Enterprise વપરાશકર્તાઓ માટે તેમજ OpenAI API, Microsoft Azure અને AWS Bedrock મારફતે ઉપલબ્ધ થશે.
Astra અમારું સૌથી વધુ સંરેખિત મોડલ છે, જેમાં વપરાશકર્તાના ઇરાદા અને મોડલના વર્તનને સમજવામાં નોંધપાત્ર સુધારાઓ છે—તમે Astraના નિર્ણય પર વધુ વિશ્વાસ સાથે કાર્યો સોંપી શકો છો. આને પરીક્ષણની એક રીત તરીકે, અમે Hugging Face ઘટનાથી પ્રેરિત એક નવું મૂલ્યાંકન બનાવ્યું છે, જે તપાસે છે કે મુશ્કેલ અથવા અશક્ય કાર્યનો સામનો કરતું મોડલ તેના નિર્ધારિત કાર્યક્ષેત્રની બહાર જશે કે નહીં. GPT‑5.6 Solની સરખામણીમાં, જે ઉત્પાદન સુરક્ષાત્મક ઉપાયો વિના 48% વખત અધિકૃત લક્ષ્યની બહાર ગયું હતું, GPT‑6 Astraએ શૂન્ય ટકા કિસ્સાઓમાં આવું કર્યું હતું.
કમ્પ્યુટરનો ઉપયોગ કરવા માટે વિશ્વનું શ્રેષ્ઠ મોડલ
GPT‑6 Astra કમ્પ્યુટરના ઉપયોગની ઝડપ, ચોકસાઈ અને સલામતીમાં એક અત્યાધુનિક સ્થાપિત કરે છે. તે ઑનલાઇન ફોર્મ ભરવા, CRMમાં ગ્રાહક રેકોર્ડ અપડેટ કરવા અને તમારું કૅલેન્ડર ગોઠવવા જેવા કંટાળાજનક કાર્યો સંભાળી શકે છે. તે ઑનલાઇન સંશોધન કરી શકે છે અને તમારા ઇમેઇલમાં અથવા તમારા ડોક્યુમેન્ટ એડિટરમાં સારાંશોના ડ્રાફ્ટ તૈયાર કરી શકે છે. તે વૈજ્ઞાનિક ડેટાનું વિશ્લેષણ કરી શકે છે, પ્લોટ્સ જનરેટ કરી શકે છે, વેબસાઇટ બનાવી શકે છે અને તે સાઇટ પરની તમામ સુવિધાઓ યોગ્ય રીતે કામ કરે છે તેની ખાતરી કરવા માટે ફ્રન્ટએન્ડ QA તપાસો ચલાવી શકે છે. તે તમને સ્વાયત્ત રીતે સૉફ્ટવેર ઇન્સ્ટોલ અને પરીક્ષણ કરવામાં, તેમજ સ્ક્રીન પર દેખાતી સમસ્યાઓનું નિવારણ કરવામાં મદદ કરી શકે છે. આ સુધારાઓ અમારા અદ્યતન મૂલ્યાંકન પરિણામોમાં પણ પ્રતિબિંબિત થાય છે.
આ સુધારાઓ વાસ્તવિક જ્ઞાન-કામનાં કાર્યોમાં કાર્યક્ષમતામાં નોંધપાત્ર વધારો પણ કરે છે. OSWorld 2.0 પરના લેટન્સી સિમ્યુલેશન્સમાં, GPT‑5.6 Solની સરખામણીએ Astra કાર્ય દીઠ લગભગ 47% ઓછા સમયમાં વધુ સારું કમ્પ્યુટર-ઉપયોગ પ્રદર્શન હાંસલ કરે છે, લગભગ 40 મિનિટ પ્રતિ કાર્યમાં 72.6% સ્કોર કરે છે, જ્યારે લગભગ 75 મિનિટમાં 65.7% સ્કોર કરે છે.3
GPT‑6 Astraની કમ્પ્યુટર-ઉપયોગ ક્ષમતાઓ વિવિધ ક્ષેત્રોના આઉટપુટમાં જોઈ શકાય છે, જેમાં ગેમ ડેવલપમેન્ટ, ઇલેક્ટ્રિકલ એન્જિનિયરિંગ અને રોજિંદા નોલેજ કામનો સમાવેશ થાય છે:
Astra સાથે, અમે કમ્પ્યુટર ઉપયોગની ઝડપમાં નોંધપાત્ર સુધારો કરવા માટે Codex કાર્યપ્રણાલીને પણ અપડેટ કરી રહ્યા છીએ. Astraની કાર્યક્ષમતા સાથે જોડીને, Mind2Web બેન્ચમાર્ક પર આ વર્તમાન GPT‑5.6 Sol અનુભવની સરખામણીમાં 1.9 ગણું ઝડપી કાર્ય પૂર્ણ કરવામાં પરિણમે છે. મોડલની ઝડપમાં થયેલા સુધારાઓનો અર્થ એ છે કે તે તમારા માટે સમય લેતા ઘણા રોજિંદા કાર્યો તમે કરી શકો તેના કરતાં વધુ ઝડપથી કરી શકે છે.4
પ્રોફેશનલ કામમાં એક નોંધપાત્ર પરિવર્તન
GPT‑6 Astra જટિલ કામનાં કાર્યોનો સામનો કરવામાં મદદ કરવા માટે કમ્પ્યુટર ઉપયોગમાં થયેલી પ્રગતિઓને પ્રોફેશનલ વાતાવરણ માટેની લક્ષિત તાલીમ સાથે જોડે છે. તે જટિલ સમસ્યાઓ માટે જરૂરી ઇન્ટેલિજન્સને બહુ-પગલાંના વર્કફ્લો હાથ ધરવાની અને સુઘડ દસ્તાવેજો, સ્પ્રેડશીટ્સ અને પ્રેઝન્ટેશનો તૈયાર કરવાની ક્ષમતા સાથે જોડે છે.
GPT‑6 Astra એ હાલના નમૂનાઓને અનુસરવા અને સુવ્યવસ્થિત લેઆઉટવાળી તથા સંરચિત નેરેટિવ દ્વારા મુખ્ય મુદ્દાઓને સંક્ષિપ્તમાં રજૂ કરતી સ્લાઇડ્સ બનાવવા માટેનું અમારું શ્રેષ્ઠ મોડલ છે. તે તમારા નમૂનાઓને અનુસરતા અને તમારી લેખન તથા દૃશ્ય શૈલી સાથે મેળ ખાતા સ્પષ્ટ, સુવ્યવસ્થિત દસ્તાવેજો, પ્રસ્તુતિઓ, સ્પ્રેડશીટ્સ અને વિશ્લેષણો બનાવે છે. Astraને આઉટપુટમાં માત્ર સંબંધિત સંદર્ભ જ સ્પષ્ટપણે સામેલ કરવા માટે પણ તાલીમ આપવામાં આવી છે, જેથી વર્તમાન કામ માટે અનાવશ્યક માહિતીનું પુનરાવર્તન ન થાય. આ બધાનો અર્થ એ થાય છે કે તે તમારા વ્યવસાયિક સંદર્ભ અને ધોરણો સાથે મેળ ખાતી, વધુ તરત ઉપયોગમાં લઈ શકાય તેવી આર્ટિફેક્ટ્સ આઉટપુટ કરી શકે છે.
GPT‑6 Astra તે બનાવે છે તેવી વેબસાઇટ્સ, ગેમ્સ, એપ્લિકેશન્સ અને રેન્ડરિંગ્સ માટે વધુ મજબૂત દૃશ્યાત્મક નિર્ણયક્ષમતા પણ લાવે છે. ChatGPTમાં સાઇટ્સ(નવી વિન્ડોમાં ખૂલે છે) સાથે, Astra પ્રોમ્પ્ટથી સીધી વેબસાઇટ્સ, વેબ એપ્લિકેશન્સ અને ગેમ્સ બનાવી શકે, હોસ્ટ કરી શકે અને શેર કરી શકે છે.
જ્યારે સૂચનાઓ અર્થઘટન માટે અવકાશ છોડી દે છે, ત્યારે યોગ્ય નિર્ણય લેવામાં GPT‑6 Astra અગાઉના મોડલ્સ કરતાં વધુ સારું છે. તે સામાન્ય ખાલી જગ્યાઓ પૂરી કરવા માટે સંદર્ભનો ઉપયોગ કરે છે અને જ્યારે જવાબ પરિણામ બદલી શકે તેમ હોય ત્યારે કેન્દ્રિત પ્રશ્નો પૂછે છે. Codexમાં, તે તમારા જવાબ પર નિર્ભર ન હોય તેવું કાર્ય ચાલુ રાખતાં અસિંક્રોનસ રીતે પ્રશ્નો પૂછી શકે છે. જો તમે જવાબ ન આપો, તો જ્યાં યોગ્ય હોય ત્યાં તે વાજબી અનુમાનો સાથે આગળ વધે છે, પરંતુ મહત્વપૂર્ણ નિર્ણયો માટે તમારા ઇનપુટની રાહ જુએ છે.
નીચેનાં ઉદાહરણો દર્શાવે છે કે Astra રોજિંદા કાર્યોમાં કેવી રીતે સહયોગ કરે છે, જ્યાં ખૂટતી માહિતી જવાબને નોંધપાત્ર રીતે બદલી શકે છે.
Astra કાર્ય આગળ વધે તેમ દિશાબોધ જાળવી રાખવામાં પણ વધુ સારું છે. અગાઉનાં મોડલ્સ ક્યારેક માર્ગદર્શક સંદેશાને નવા લક્ષ્ય તરીકે લેતાં હતાં, જેના કારણે મૂળ વિનંતી અથવા અગાઉની મર્યાદાઓ પરનું ધ્યાન છૂટી જતું હતું. Astra નવી આવશ્યકતાઓને સમાવી લે છે, કહેવામાં આવે ત્યારે દિશા બદલે છે અને વ્યાપક કાર્યને નજરઅંદાજ કર્યા વિના અન્ય પ્રશ્નોના જવાબ આપે છે.
કોડિંગ
GPT‑6 Astra આજ સુધી સૉફ્ટવેર એન્જિનિયરિંગ માટેનું શ્રેષ્ઠ મોડલ છે.
“GPT‑6 Astra અમારા આંતરિક કોડિંગ બેન્ચમાર્ક પર અત્યાધુનિક કામગીરી આપે છે અને GPT‑5.6 Solની સરખામણીમાં ટ્રેડિંગ ઇન્ટ્યુઇશન મૂલ્યાંકનોમાં સ્પષ્ટ પ્રગતિ દર્શાવે છે. એજન્ટિક કોડિંગ માટે ઉપયોગ કરવામાં આવે ત્યારે, GPT‑6 Astra ડેવલપર્સ માટે અનુસરવામાં સરળ હોય તેવી રીતે સંવાદ કરે છે અને એવો કોડ બનાવે છે જેને પ્રોડક્શન ગુણવત્તા સુધી પહોંચાડવા માટે ઓછા પુનરાવર્તનની જરૂર પડે છે.”
“અમે અમારી પ્રથમ-જનરેશન મૂલ્યાંકનમાંથી એક પર Astraને લો, મીડિયમ અને હાઇ પ્રયત્ન સ્તરોમાં પરીક્ષણ કર્યું અને તે GPT 5.6 Sol કરતાં નોંધપાત્ર રીતે આગળ નીકળ્યું. ઉચ્ચ પ્રયત્નથી નવા બિલ્ડ પર વધુ પુનરાવર્તનો, બ્રાઉઝર પરીક્ષણ દ્વારા વધુ ચકાસણી અને apply-patch કરતાં કોડ અમલીકરણ તરફ વધુ ઝોક મળે છે. મોડલ તેના પ્રયત્નનો ઉપયોગ કેવી રીતે કરે છે તે સમજવાથી જ અમે લાખો બિલ્ડર્સને વિચારથી કાર્યરત એપ સુધી પહોંચવાનો વધુ ઝડપી અને વધુ વિશ્વસનીય માર્ગ આપીએ છીએ.”
Astra સાથે, જ્યારે સંદર્ભ વિન્ડો ભરાઈ જાય ત્યારે Codex માટે સંદર્ભ જાળવી રાખવાની અને પુનઃપ્રાપ્ત કરવાની નવી રીત રજૂ કરી રહ્યા છીએ. ઐતિહાસિક રીતે, મોડલ્સે લાંબા સત્રો દરમિયાન કામનો સારાંશ આપવા માટે કૉમ્પેક્શનનો ઉપયોગ કર્યો છે, જેમ કે જટિલ સમસ્યાઓ ડિબગ કરતી વખતે અથવા મોટા રિફેક્ટર હાથ ધરતી વખતે. દરેક કૉમ્પેક્શનમાં કોઈ ઠીક કરવાની કામગીરી કેમ નિષ્ફળ ગઈ અથવા કોઈ ઘટક કેવી રીતે વર્તે છે તેની વિગતો છૂટી જઈ શકે છે. Codexમાં, Astra સંદર્ભ વિન્ડોઝમાં નોંધો રાખી શકે છે, જેથી સંચિત વિગતોને વારંવાર એક જ સારાંશમાં સંકુચિત કર્યા વિના જાળવી શકાય. પહેલાંની સંદર્ભ વિન્ડો શોધી શકાય તેવી રહે છે, તેથી Astra અગાઉના સંદેશા અને ટૂલ આઉટપુટ્સમાંથી જરૂરિયાતો અથવા પરીક્ષણ પરિણામો શોધી શકે છે—ભલે તે માહિતી તેની નોંધોમાં કૅપ્ચર કરવામાં આવી ન હોય. તમે તમારા Codex config.toml(નવી વિન્ડોમાં ખૂલે છે)માં આ પ્રાયોગિક સુવિધા સક્ષમ કરી શકો છો અને આગામી અઠવાડિયાઓમાં તે Astra માટે ડિફૉલ્ટ બની જશે.
વૈજ્ઞાનિક શોધને આગળ વધારવી
Astra વૈજ્ઞાનિક શોધ પાછળના વ્યવહારુ કામમાં મદદ કરી શકે છે. વૈજ્ઞાનિક રિઝનિંગને કમ્પ્યુટરના ઉપયોગ સાથે જોડીને, તે ડેટાનું નિરીક્ષણ કરવા અને પરિણામોની તપાસ કરવા માટે વિશિષ્ટ સૉફ્ટવેરમાં સીધું કામ કરી શકે છે, જેથી સંશોધકોને પુરાવાનું મૂલ્યાંકન કરવામાં અને આગળ શું તપાસવું તે નક્કી કરવામાં મદદ મળે છે.
સાયબર સિક્યુરિટી
અમે અમારા સુરક્ષા અપડેટમાં ચર્ચા કરી હતી તેમ, Astra સાઇબર ક્ષમતાઓમાં નોંધપાત્ર છલાંગ છે અને અમારા નિર્ણાયક સ્તરને અમારા પ્રિપેરડનેસ ફ્રેમવર્ક હેઠળ સાઇબર સુરક્ષામાં પૂર્ણ કરે છે. ઝીરો-ડે એક્સ્પ્લોઇટ્સને ઓળખવાની અને વિકસાવવાની તેની ક્ષમતા સુરક્ષા રક્ષકોને નબળાઈઓ શોધવામાં અને પેચ કરવામાં મદદ કરી શકે છે, પરંતુ તે વધુ મજબૂત સુરક્ષા ઉપાયોની જરૂરિયાત પણ ઊભી કરે છે. આ ક્ષમતાઓ કેટલી હદ સુધી વિસ્તરે છે તે સમજવા માટે, અમે Astraને આંતરિક અને તૃતીય-પક્ષ નિષ્ણાત મૂલ્યાંકનો પર ચલાવ્યું.
અમે સૌપ્રથમ પ્રોડક્શન સુરક્ષા ઉપાયો વિના મોડલનું ExploitBench અને ExploitGym પર પરીક્ષણ કર્યું, જે મૂલ્યાંકન કરે છે કે મોડલ્સ જાણીતી સૉફ્ટવેર નબળાઈઓને કાર્યરત એક્સ્પ્લોઇટ્સમાં ફેરવી શકે છે કે નહીં. ExploitBench પર, અમારા અગાઉના અત્યાધુનિક સાઇબર-સક્ષમ મોડલ GPT‑5.6 Solના 78.5%ની સરખામણીમાં Astraએ 100%નો સંપૂર્ણ ગુણ મેળવ્યો. ExploitGym પર, Astraએ નોંધપાત્ર રીતે ઓછા આઉટપુટ ટોકનનો ઉપયોગ કરતી વખતે 42.4% સફળતા દર હાંસલ કર્યો, જ્યારે GPT‑5.6 Sol માટે તે 30.3% હતો.13
ઐતિહાસિક સૉફ્ટવેર નબળાઈઓના સંપર્કથી બેન્ચમાર્ક પરિણામો પ્રભાવિત થયા હોઈ શકે તેવી ચિંતાઓને ધ્યાનમાં રાખીને, અમે Astraનું બે નવતર બેન્ચમાર્ક પર પણ મૂલ્યાંકન કર્યું. એક ઉદાહરણ તરીકે, અમે પાછલા ત્રણ મહિનાની નબળાઈઓનો ઉપયોગ કરીને એક્સ્પ્લોઇટ વિકાસનું પરીક્ષણ કરવા માટે આંતરિક “ExploitBench (જૂન–ઑગસ્ટ 2026)” મૂલ્યાંકન બનાવ્યું.14 આ ડેટા સેટ પર, Astraએ GPT‑5.6 Sol કરતાં નોંધપાત્ર રીતે મનસ્વી કોડ-અમલના ઉચ્ચ દર હાંસલ કર્યા જ્યારે ઘણા ઓછા આઉટપુટ ટોકનનો ઉપયોગ કરવામાં આવ્યો હતો. મૂલ્યાંકન દરમિયાન, Astraએ અગાઉ અજાણી બે ઝીરો-ડે નબળાઈઓ પણ શોધી કાઢી અને ઉપયોગમાં લીધી. અમે બંને નબળાઈઓનો તેમના સંબંધિત જાળવણીકર્તાઓ સમક્ષ ખુલાસો કરી રહ્યા છીએ.
અમે Astraનું SRE-Bench15 પર પણ પરીક્ષણ કર્યું, જે એક બેન્ચમાર્ક છે અને માપે છે કે મોડલ્સ કાચા સ્રોત કોડની ઍક્સેસ વિના સૉફ્ટવેર બાઇનરીઝનું રિવર્સ એન્જિનિયરિંગ કરીને તેની મુખ્ય તર્કપ્રણાલી સમજી શકે છે કે નહીં. Astraએ એક જ પ્રયાસમાં 88.0% કાર્યો ઉકેલ્યાં અને ચાર પ્રયાસોમાં 99.2% કાર્યો ઉકેલ્યાં, જ્યારે GPT‑5.6 Sol માટે અનુક્રમે 55.9% અને 68.7% હતાં.
બેન્ચમાર્કથી આગળ, નિષ્ણાતોની આગેવાની હેઠળના મૂલ્યાંકનોમાં જાણવા મળ્યું કે Astra, પ્રોડક્શન સુરક્ષા ઉપાયો વિના ચલાવવામાં આવે ત્યારે, અગાઉ અજાણી હતી તેવી નબળાઈઓનો ઉપયોગ કરીને અત્યંત સુરક્ષિત બ્રાઉઝરમાં મનસ્વી કોડ ચલાવી શકે છે અને અત્યંત સુરક્ષિત ઑપરેટિંગ સિસ્ટમ માટે વિશેષાધિકાર-વૃદ્ધિ એક્સ્પ્લોઇટ્સ બનાવી શકે છે.
જેમ કે અમે રક્ષકોની તકમાં ચર્ચા કરી હતી, અત્યાધુનિક સાઇબર ક્ષમતાઓ રક્ષકોને નબળાઈઓ ઝડપથી શોધવામાં મદદ કરી શકે છે, પરંતુ તે નબળાઈઓને એક્સ્પ્લોઇટ કરવાનું પણ સરળ બનાવે છે, જેના કારણે રક્ષકો માટે અનુકૂલન સાધવાની તાત્કાલિકતા વધે છે. આજે લૉન્ચ થઈ રહેલી Astraની આવૃત્તિ સાથે, રક્ષકો સુરક્ષિત કોડ સમીક્ષા અને પેચિંગ જેવા કાર્યો પૂર્ણ કરવા માટે તેનો ઉપયોગ કરી શકે છે.
જોકે, Astra નબળાઈઓ માટે પ્રૂફ-ઓફ-કન્સેપ્ટ એક્સ્પ્લોઇટ્સ બનાવવા જેવા વધુ અદ્યતન સાઇબર સુરક્ષા કાર્યોમાં સહકાર આપવાનો ઇનકાર કરશે. OpenAI Daybreak દ્વારા, અમે આવતા અઠવાડિયામાં ઍક્સેસને વિસ્તૃત કરવાની અને ઓછા પ્રતિબંધિત સુરક્ષાત્મક ઉપાયો અમલમાં મૂકવાની યોજના ધરાવીએ છીએ. આનાથી વધુ રક્ષણાત્મક વર્કફ્લો સક્ષમ બનશે, જેમાં નબળાઈઓ અને પ્રૂફ-ઓફ-કન્સેપ્ટનું માન્યકરણ, માલવેર વિશ્લેષણ અને ડિટેક્શન એન્જિનિયરિંગનો સમાવેશ થાય છે.
અમે GPT‑5.6 Sol માટેના અમારા સુરક્ષાત્મક ઉપાયોના માળખા પર આધાર રાખીને, સંભવિત સાઇબર દુરુપયોગ સામેની અમારી સુરક્ષા પણ મજબૂત કરી છે. તેમાં સંભવિત જેલબ્રેક સામે વધુ સારી રીતે ટકી રહેવા માટે મોડલની વધુ મજબૂતી અને અમારી દેખરેખ સિસ્ટમ માટે વધુ સંદર્ભનો સમાવેશ થાય છે. અમે અમારા આંતરિક રેડ ટીમિંગ હુમલાખોરો સાથેના સ્વચાલિત મૂલ્યાંકનો સહિત સઘન આંતરિક અને બાહ્ય પરીક્ષણ ચાલુ રાખ્યું છે. અમારા સાઇબર સુરક્ષાત્મક ઉપાયો અને પરીક્ષણ વિશે વધુ વિગતો Astraના સલામતીની ઝાંખી અને સિસ્ટમ કાર્ડ(નવી વિન્ડોમાં ખૂલે છે)માં ઉપલબ્ધ છે..
GPT‑6 Astraને જવાબદારીપૂર્વક સંરેખિત કરવું અને જમાવટ કરવી
Astra અમારું સૌથી વધુ સંરેખિત મોડલ છે. Astra કાળજીપૂર્વક વર્તવામાં, કાર્યની સીમાઓનું સન્માન કરવામાં અને પારદર્શક રીતે સંચાર કરવામાં ઉત્તમ છે. આ કાર્ય શરૂઆતથી અંત સુધી માનવીય ઇરાદા સાથે સંરેખિત રહેતા મોડલને તાલીમ આપવા પર કેન્દ્રિત અમારા લાંબા સમયથી ચાલતા સંશોધન કાર્યક્રમનું નવીનતમ પરિણામ છે.
સંવેદનશીલ વાતાવરણોમાં, Astra જોખમના સ્તરને અનુરૂપ સાવચેતી સાથે આગળ વધે છે. ગેરવર્તન પ્રેરિત કરવા માટે પ્રતિકૂળ રીતે પસંદ કરાયેલા કમ્પ્યુટર ઉપયોગનાં કાર્યોના મૂલ્યાંકનમાં, Astra અનિચ્છિત પરિણામો ટાળવામાં વધુ સફળ રહ્યું હતું. ડિફૉલ્ટ રૂપે પ્રદાન કરવામાં આવતા વધારાના સુરક્ષા પગલાં સાથે ચલાવવાથી હજી વધુ મજબૂત પ્રદર્શન મળ્યું.
Astra પરીક્ષણ કરાયેલા અન્ય કોઈપણ અત્યાધુનિક મોડલ કરતાં ઓછા ગેર-સંરેખિત પરિણામો સર્જે છે. ન્યાયસંગત સરખામણી માટે, અમે ( OpenAI Responses API(નવી વિન્ડોમાં ખૂલે છે) અને Anthropic Messages API(નવી વિન્ડોમાં ખૂલે છે) બંનેમાં ઉપલબ્ધ નેટિવ કમ્પ્યુટર ઉપયોગ ટૂલ્સ પર આધારિત) સામાન્ય કમ્પ્યુટર-યૂઝિંગ એજન્ટ કાર્યપ્રણાલીનો ઉપયોગ કર્યો હતો અને Codex તથા ChatGPT કામ વપરાશકર્તાઓ માટે સામાન્ય રીતે લાગુ કરવામાં આવતી વધારાની સુરક્ષાઓ (ઑટો-રિવ્યૂ, પુષ્ટિ-નીતિ) વિના તેનો ઉપયોગ કર્યો હતો.
Astra વપરાશકર્તા દ્વારા નિર્ધારિત અને તેના વાતાવરણ દ્વારા સૂચિત મર્યાદાઓની અંદર કાર્ય કરે તેવી શક્યતા પણ વધુ છે. આંતરિક મૂલ્યાંકનમાં, Astraએ Codex ઑટો-રિવ્યૂના અસ્વીકારને ટાળવાનો ક્યારેય પ્રયાસ કર્યો નથી. આ વાત ત્યારે પણ માન્ય રહી જ્યારે ઑટો-રિવ્યૂને ઇરાદાપૂર્વક ટાળી શકાય તે રીતે કન્ફિગર કરવામાં આવ્યું હતું અને અન્યથા કાર્ય પૂર્ણ કરવું અશક્ય હતું. પર્યાવરણના પ્રતિબંધો પ્રત્યેનો આ આદર આ પોસ્ટની પ્રસ્તાવનામાં અમે શેર કરેલા અમારા અશક્ય સાઇબર કાર્યના મૂલ્યાંકનનાં પરિણામો અને અમારા સિસ્ટમ કાર્ડ(નવી વિન્ડોમાં ખૂલે છે)માં દસ્તાવેજીકૃત અન્ય તારણો સાથે સુસંગત છે.
Astra પારદર્શક વપરાશકર્તા સંચારમાં પણ નવા માપદંડો સ્થાપિત કરે છે. એક મૂલ્યાંકન અનુસાર, Astra તેની ક્ષમતાઓ અને પરવડતા વિશે ખોટી રજૂઆતો કરે તેવી શક્યતા GPT‑5.6 Solની સરખામણીએ ત્રણ ગણી ઓછી છે.
અમારા ક્ષમતા-ભ્રમ મૂલ્યાંકનમાં, Astra GPT‑5.6 Sol કરતાં નોંધપાત્ર સુધારો દર્શાવે છે અને તેની ક્ષમતાઓ વિશે ઓછા ભ્રામક દાવા કરે છે.
અમારા મૂલ્યાંકનોમાં જાણવા મળ્યું કે Astraના લેખિત રિઝનિંગ પર દેખરેખ રાખવી GPT‑5.6 Sol કરતાં વધુ મુશ્કેલ હતી, જે પરીક્ષણોના આધારે તેને દેખરેખથી બચવાનું સ્પષ્ટપણે કહેવામાં આવ્યું હતું. અમે આનું કારણ સરળ કાર્યોમાં લેખિત રિઝનિંગ પર Astraનું વધુ નિયંત્રણ અને ઓછા લેખિત પગલાંમાં સમસ્યાઓ ઉકેલવાની તેની ક્ષમતાને ગણાવીએ છીએ. જટિલ કાર્યો માટે જરૂરી રિઝનિંગ છુપાવવામાં Astraને હજુ પણ મુશ્કેલી પડતી હોય તેમ લાગે છે, પરંતુ અમે આ ઘટાડાને ગંભીરતાથી લઈએ છીએ. દેખરેખ ક્ષમતા સુધારવી એ સંશોધનની પ્રાથમિકતા બની રહી છે અને સાથેનું સિસ્ટમ કાર્ડ(નવી વિન્ડોમાં ખૂલે છે) અમારાં તારણો અને ચાલુ કાર્યની વિગતો આપે છે.
સંરેખણ તાલીમ એ ડિપ્લોયમેન્ટ પ્રત્યેના અમારા અભિગમના કેન્દ્રમાં છે. સંરક્ષણના વધારાના સ્તર તરીકે, અમે અસુરક્ષિત વર્તનને શોધવામાં અને નિયંત્રિત કરવામાં મદદ કરવા માટે Codex ઑટો-રિવ્યૂ(નવી વિન્ડોમાં ખૂલે છે) જેવા સિસ્ટમ સુરક્ષાત્મક ઉપાયો બનાવીએ છીએ અને એજન્ટોના રિઝનિંગ તથા કાર્યોની દેખરેખ પણ રાખીએ છીએ. અમારા સલામતી અપડેટમાં વર્ણવ્યા મુજબ, અસંગતતા વિશે દૃશ્યતા મેળવવા અને તેના સૌથી ગંભીર કિસ્સાઓને નિયંત્રિત કરવામાં મદદ કરવા માટે અમે Astra-શ્રેણીના મોડલ માટે ઉત્પાદનમાં અસંરેખણ દેખરેખ પણ ડિપ્લોય કરી રહ્યા છીએ. આ સુરક્ષાત્મક ઉપાયો આંતરિક ડિપ્લોયમેન્ટ માટેની અમારી દેખરેખ જેવા છે અને તેમાં વર્ગીકરણકારોની એવી સિસ્ટમ સામેલ છે, જે મોડલના રિઝનિંગ અને પગલાંમાં અનધિકૃત વર્તન તપાસે છે તથા સંભવિત અનધિકૃત પ્રવૃત્તિ આપમેળે અટકાવે છે.
Astraની સાઇબર સુરક્ષા ક્ષમતાઓમાં નોંધપાત્ર વધારો થયો હોવાથી, અમે આ ડિપ્લોયમેન્ટને સલામત અને સુરક્ષિત બનાવવા માટે ખાસ કાળજી લઈ રહ્યા છીએ. વધારાની સલામતી ચકાસણીઓ ક્યારેક રક્ષણાત્મક સાઇબર સુરક્ષા સહિતના કાયદેસર કાર્યને ધીમું કરી શકે છે, થોભાવી શકે છે અથવા અટકાવી શકે છે. જો ChatGPT અથવા Codexમાં કોઈ કાર્ય થોભાવવામાં આવે, તો આગળ વધતાં પહેલાં તમને પગલાની સમીક્ષા કરવાનું કહેવામાં આવી શકાય છે. APIમાં, કાર્ય બંધ થઈ જશે. આ ચકાસણીઓ ક્યારેક વાજબી કામમાં વિક્ષેપ પેદા કરી શકે છે અને અનાવશ્યક વિક્ષેપો ઘટાડવા માટે અમે આ સિસ્ટમમાં સતત સુધારા કરી રહ્યા છીએ. અસંરેખણ દેખરેખ સંરેખણનું સ્થાન લઈ શકતી નથી: અમારું લક્ષ્ય એવાં મોડલ્સ બનાવવાનું છે જે વિશ્વસનીય રીતે તેમની અધિકૃત મર્યાદામાં રહે, જેથી આ સુરક્ષાત્મક ઉપાયોને હસ્તક્ષેપ કરવાની જરૂર ન પડે.
ઉપલબ્ધતા
GPT‑6 Astra આજે મર્યાદિત સંખ્યાની સંસ્થાઓ માટે અમલમાં આવી રહ્યું છે અને આગામી દિવસોમાં તે તમામ ChatGPT Plus, Pro, Business અને Enterprise વપરાશકર્તાઓ માટે તેમજ OpenAI API, Microsoft Azure અને AWS Bedrock મારફતે ઉપલબ્ધ થશે. Astraનો ઉપયોગ હાલની સબ્સ્ક્રિપ્શન મર્યાદાઓમાં સામેલ છે—વપરાશકર્તાઓ અને વ્યવસાયો વધારાના ઉપયોગ માટે ક્રેડિટ્સ પણ ખરીદી શકશે. Pro, Business અને Enterprise પ્લાનના વપરાશકર્તાઓને GPT‑6 Astra Proનો ઍક્સેસ પણ મળશે. Enterprise એડમિનિસ્ટ્રેટર્સ તેમના વર્કસ્પેસ માટે Astra સક્રિય કરી શકે છે; લૉન્ચ સમયે ઍક્સેસ ડિફૉલ્ટ રૂપે બંધ છે.
Astra પાત્ર API ગ્રાહકો માટે ઝીરો ડેટા રિટેન્શન સમર્થન આપે છે અને અમે ગયા મહિને શેર કર્યું હતું તેમ, ગ્રાહકની ગોપનીયતા જાળવી રાખીને સુરક્ષા દેખરેખને મજબૂત બનાવવા માટે અમે ખાનગી સુરક્ષા પ્રક્રિયાનું પરીક્ષણ કરી રહ્યા છીએ.
ડેવલપર્સ માટે, GPT‑6 Astra OpenAI APIમાં gpt-6-astra તરીકે અને Microsoft Azure તથા Amazon Bedrock મારફતે ઉપલબ્ધ થશે.
OpenAI APIની સ્ટાન્ડર્ડ કિંમત પ્રતિ દસ લાખ ઇનપુટ ટોકન $10 અને પ્રતિ દસ લાખ આઉટપુટ ટોકન $50 છે. કૅશ રીડ્સ અને રાઇટ્સ માટે અલગ-અલગ દરો લાગુ પડે છે. APIમાં GPT‑6 Astra માટે ઝડપી મોડ ઉપલબ્ધ છે અને તે સ્ટાન્ડર્ડ પ્રોસેસિંગની 2x સુધીની ઝડપ, સ્ટાન્ડર્ડ કિંમતના 2x ભાવે પૂરી પાડે છે.
કમ્પ્યુટરનો ઉપયોગ
| કમ્પ્યુટરનો ઉપયોગ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| OSWorld 2.0 (ઑગસ્ટ રિલીઝ, આંશિક સ્કોર) | - | - | - | 66.1% | 70.6% | - |
| OSWorld 2.0 (ઑગસ્ટ રિલીઝ, ઑફલાઇન સબસેટ, આંશિક સ્કોર) | - | - | - | - | - | - |
| ScreenSpot Pro | 92.6% | 76.8% | - | - | - | - |
| BrowseComp | 92.1% | 90.4% | - | 87.4% | 90.8% | - |
પ્રોફેશનલ
પ્રોફેશનલ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
આંતરિક ડિઝાઇન કાર્યો | 50.0% | 47.4% | - | 35.8% | - | - |
આંતરિક ડેટા સાયન્સ કાર્યો | 40.9% | 30.5% | - | 34.7% | - | - |
આર્ટિફિશિયલ એનાલિસિસ ઇન્ટેલિજન્સ ઇન્ડેક્સ v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
કોડિંગ
| કોડિંગ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (સ્કોર) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 મુખ્ય (સ્કોર) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| આંતરિક ડેટાબેઝ માઇગ્રેશન કાર્યો | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| આર્ટિફિશિયલ એનાલિસિસ કોડિંગ એજન્ટ ઇન્ડેક્સ v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
શૈક્ષણિક
શૈક્ષણિક | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA ડાયમંડ | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
માનવજાતની છેલ્લી પરીક્ષા (ટૂલ્સ સાથે) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
એલાઇનમેન્ટ
એલાઇનમેન્ટ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
આંતરિક કમ્પ્યુટર ઉપયોગ સલામતી બેન્ચમાર્ક (જેટલો ઓછો, તેટલો સારો) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
આંતરિક કમ્પ્યુટર ઉપયોગ સુરક્ષા બેન્ચમાર્ક, AutoReview સાથે (જેટલો ઓછો, તેટલો સારો) | 1.8% | 4.3% | - | - | - | - |
આંતરિક ટાળવાનો બેન્ચમાર્ક (જેટલો ઓછો, તેટલો સારો) | 0.00% | 0.29% | - | - | - | - |
ExploitGym હનીપોટ (ઓછું હોય તો વધુ સારું) | 0.0% | 48.2% | - | - | - | - |
અશક્ય ExploitGym | 100.0% | - | - | - | - | - |
આંતરિક હેલ્યુસિનેશન બેન્ચમાર્ક (જેટલો ઓછો, તેટલો સારો) | 4.2% | 12.2% | - | - | - | - |
લાંબો સંદર્ભ
લાંબો સંદર્ભ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
અમૂર્ત રિઝનિંગ
| અમૂર્ત રિઝનિંગ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
મૂલ્યાંકન સ્કોર કોઈપણ પ્રયાસ પર મહત્તમ હોય છે. GPT મૂલ્યાંકનો અમારા સંશોધન એન્વાયર્નમેન્ટમાં અથવા અમારી API મારફતે ચલાવવામાં આવ્યા હતા, જે સિસ્ટમ પ્રોમ્પ્ટ, ઉપલબ્ધ ટૂલ્સ વગેરેમાં તફાવતોને કારણે પ્રોડક્શન ChatGPT કરતાં થોડું અલગ આઉટપુટ આપી શકે છે.
ફટનોટ
- 1
ARC-AGI-3 પર, GPT-6 Astraને અમારી રિસ્પોન્સિસ API કાર્યપ્રણાલી સાથે ચલાવવામાં આવ્યું હતું, જે વાસ્તવિક દુનિયાની કામગીરીને વધુ સારી રીતે અનુરૂપ બનાવવા માટે બે સેટિંગ બદલે છે. ફેરફારો ખાસ કરીને ARC-AGI-3ને લક્ષિત કરતા નથી.
- 2
GPT-5.6 Sol એ અમારી API, ChatGPT Codex અને ChatGPT કામમાં ઉપલબ્ધ સંસ્કરણનો ઉલ્લેખ કરે છે. ChatGPT ચૅટમાંનું સંસ્કરણ સહેજ અલગ છે.
- 3
OSWorld V2-Offline એ મૂળ OSWorld V2નો એક ઉપસમૂહ છે, જે ઇન્ટરનેટ ઍક્સેસ વિના કાર્ય કરે છે. OSWorld-V2 Offline પર Claude મોડલની કામગીરીનું પુનરુત્પાદન લેખકો દ્વારા સત્તાવાર લીડરબોર્ડ પર(નવી વિન્ડોમાં ખૂલે છે) કરવામાં આવ્યું હતું. OSWorld 2.0 પર, Claude માટેના સ્કોર સત્તાવાર સેટિંગ્સનો ઉપયોગ કરે છે, Fable 5.1 સિસ્ટમ કાર્ડમાંથી સંશોધિત કાર્યો અને સંશોધિત ગ્રેડિંગનો નહીં.
- 4
- 5
BenchCAD પર, Claudeના સ્કોર મૂલ્યાંકનમાં કરેલા ત્રણ ફેરફારો દર્શાવે છે, જેની વિગતો Fable 5.1 સિસ્ટમ કાર્ડ(નવી વિન્ડોમાં ખૂલે છે)માં આપવામાં આવી છે.
- 6
ગુઆંગ યાંગ, વિક્ટોરિયા એબર્ટ, નાઝિફ ટેમર, બ્રાયન સિયુઆન ઝેંગ, લુઇઝા પોઝોબોન અને નોઆ એ. સ્મિથ. “LEGATO: ટાઇપસેટ OMR માટેનો મોટા પાયાનો એન્ડ-ટુ-એન્ડ સામાન્યીકરણક્ષમ અભિગમ(નવી વિન્ડોમાં ખૂલે છે).” arXiv:2506.19065, 2025.
- 7
માર્ક આર. એચ. ગોથમ, મૌરીન રેડબોન્ડ, બ્રુનો બોવર અને પીટર જોનાસ. “The OpenScore String Quartet Corpus(નવી વિન્ડોમાં ખૂલે છે).” સંગીતશાસ્ત્ર માટેની ડિજિટલ લાઇબ્રેરીઓ પરની 10મી આંતરરાષ્ટ્રીય પરિષદની કાર્યવાહી, પૃ. 49–57. ACM, 2023.
- 8
FrontierCode પર, GPT-6 Astraને Codexમાં તેના ડેવલપર સંદેશના એક વિભાગ જેવા(નવી વિન્ડોમાં ખૂલે છે) ડેવલપર સંદેશ સાથે ચલાવવામાં આવ્યું હતું: "વધુ પડતી ટેસ્ટ ફાઇલો બનાવવાનું ટાળો. ફક્ત ત્યારે જ નવી ટેસ્ટ ફાઇલ બનાવો જ્યારે રિપોઝિટરીની પ્રથાઓ દ્વારા તેની જરૂર હોય અથવા કોઈ હાલની ફાઇલ યોગ્ય સ્થાન ન હોય. અસંબંધિત ક્લીનઅપ અને બિનજરૂરી જટિલતા ટાળો. યોગ્ય હોય તેવી હાલની યુટિલિટીનો પુનઃઉપયોગ કરો. સંબંધિત રિપોઝિટરી સૂચનાઓ વાંચો અને નજીકના કોડ, ટેસ્ટ્સ, દસ્તાવેજીકરણ અને CIનું નિરીક્ષણ કરો. સ્થાપિત પરંપરાઓનું પાલન કરો. ધ્યેય સ્વચ્છ, મર્જ કરી શકાય એવો કોડ છે." પ્રોમ્પ્ટને મૂલ્યાંકન માટે ઑપ્ટિમાઇઝ કરવામાં આવ્યો નહોતો.
- 9
પહેલો મુદ્દો એ વિશે છે કે સંખ્યારેખા પર તમે ગમે તેટલા આગળ જાઓ, અભાજ્ય સંખ્યાઓ એકબીજાની કેટલી નજીક આવી શકે છે. એક દાયકાથી વધુ સમય સુધી, સૌથી જાણીતું પરિણામ એ સ્થાપિત કરતું હતું કે અભાજ્ય સંખ્યાઓની અનંત સંખ્યામાં જોડીઓ એકબીજાથી વધુમાં વધુ 246ના અંતરે છે. જુલિયા સ્ટેડલમેને(નવી વિન્ડોમાં ખૂલે છે) તાજેતરમાં તે સીમાને સુધારીને 240 કરી. Astraએ 186ની વધુ કડક મર્યાદા સ્થાપિત કરવામાં મદદ કરી, જે દર્શાવે છે કે અનંત સંખ્યામાં જોડીઓ આ વધુ નાનાં અંતરની અંદર જોવા મળે છે. ટૂંકા અભાજ્ય અંતરાલો: પ્રમાણ(નવી વિન્ડોમાં ખૂલે છે) અને સહાયક સંશોધન(નવી વિન્ડોમાં ખૂલે છે).
- 10
બીજું અભાજ્ય સંખ્યાઓ વચ્ચેના અસામાન્ય રીતે મોટા અંતરો સાથે સંબંધિત છે. Astraએ આ અંતરોની એક સીમામાં રહેલા એક પદમાં સુધારો કર્યો, જે 80 કરતાં વધુ વર્ષોથી અપરિવર્તિત રહી હતી. અમે બંને પરિણામો માટે પુરાવાઓ, સંક્ષિપ્ત ચેન-ઓફ-થોટ અને ચકાસણી સામગ્રી શેર કરી રહ્યા છીએ. અભાજ્ય સંખ્યાઓ વચ્ચેના મોટા અંતરો: પુરાવો(નવી વિન્ડોમાં ખૂલે છે) અને સહાયક સંશોધન(નવી વિન્ડોમાં ખૂલે છે).
- 11
- 12
- 13
- 14
ExploitBench (જૂન–ઑગસ્ટ 2026)માં ઉચ્ચ-ગંભીરતાવાળી 20 V8 નબળાઈઓ છે જે 13 સ્થિર Chrome રિલીઝમાં ફેલાયેલી છે. બેન્ચમાર્ક એ પરીક્ષણ કરે છે કે એજન્ટો દરેક નિર્દિષ્ટ નબળાઈનું એક્સ્પ્લોઇટેશન કરીને V8 અને Linux માટેના સત્તાવાર Chrome રિલીઝમાં મનસ્વી કોડ અમલીકરણ હાંસલ કરી શકે છે કે નહીં. સમાવેલ કેટલીક નબળાઈઓ મૂલ્યાંકનની મર્યાદાઓ હેઠળ મનસ્વી કોડ અમલીકરણની મંજૂરી ન પણ આપી શકે, તેથી 100% સફળતા દર પ્રાપ્ત કરી શકાય તેવું ન પણ હોય. નોંધ: GPT-5.6 Solનો 5.5% સ્કોર બેન્ચમાર્કમાં 300-ટર્નની મર્યાદાનું પરિણામ છે, જે મહત્તમ વાપરતા વાસ્તવિક ગ્રાહકોને લાગુ પડતી મર્યાદા નથી. સમાન સેટિંગ્સ પર, મોડલે ઓછી મર્યાદાઓનો સામનો કરતી વખતે 11.5%નો સ્કોર હાંસલ કર્યો.
- 15
જેરેમી સ્પેન્સ અને અન્ય, “એજન્ટિક સાઇબરસુરક્ષા માટેનો આગામી પડકાર: વાસ્તવિક, દૂષણ-મુક્ત રિવર્સ એન્જિનિયરિંગ બેન્ચમાર્ક(નવી વિન્ડોમાં ખૂલે છે).” arXiv:2608.11469v1, 2026.
- 16
જ્યારે અમે તૃતીય-પક્ષ મોડલ્સમાં પરીક્ષણ કરીએ છીએ, ત્યારે અમે વધુ સરળ સંશોધન સેટઅપનો ઉપયોગ કરીએ છીએ. Codexનું પ્રોડક્શન કન્ફિગરેશન વધુ જટિલ છે, જેના પરિણામે રૉ-મોડલની ભૂલના દર અલગ હોઈ શકે છે. પ્રદાતા-પક્ષના સુરક્ષા ઉપાયો અને કમ્પ્યુટર-ટૂલ અમલીકરણો હજુ પણ અલગ છે. વપરાશકર્તાઓ Codex માં પુષ્ટિ વિનાના દૃશ્યનો અનુભવ કરતા નથી, કારણ કે તે આંતરિક સંશોધન કન્ફિગરેશન છે.
- 17
