OpenAI

GPT-6 Astra: A new generation of intelligence

ઇન્ટેલિજન્સની નવી પેઢી

22 સપ્ટેમ્બર, 2026નું અપડેટ: અમે GPT‑6 Sol અને GPT‑6 Luna સાથે અમારા GPT‑6 પરિવારનું વિસ્તરણ કરી રહ્યા છીએ. વધુ જાણો.

અમે GPT‑6 Astra રજૂ કરી રહ્યા છીએ, જે વિશ્વનું સૌથી બુદ્ધિશાળી અને સુસંગત મોડલ છે.

GPT‑6 Astra પ્રી-ટ્રેનિંગ, રીઇન્ફોર્સમેન્ટ લર્નિંગ અને સંરેખણમાં વર્ષોના સંશોધન અને મોટા દાવોને એકસાથે લાવે છે. Astra કમ્પ્યુટરનો ઉપયોગ, બ્રાઉઝિંગ, સૉફ્ટવેર એન્જિનિયરિંગ, સાઇબર સુરક્ષા, વિજ્ઞાન અને પ્રોફેશનલ કામમાં અત્યાધુનિક છે. Astra 98% સ્કોર સાથે FrontierMath Tier 4ને સંતૃપ્તી સ્તરે લઈ જાય છે અને તેણે ગણિતમાં લાંબા સમયથી વણઉકેલાયેલી ખુલ્લી સમસ્યાઓ ઉકેલવામાં⁠ પહેલેથી જ મદદ કરી છે. Astraએ 99.9%ના સ્કોર સાથે ARC-AGI-3ને અને 100%ના સ્કોર સાથે ExploitBenchને પણ સંતૃપ્તી સ્તરે લઈ ગયું. તે કમ્પ્યુટર અને બ્રાઉઝરના ઉપયોગમાં પણ એક નવો અત્યાધુનિક માપદંડ સ્થાપિત કરે છે અને અજોડ ઝડપ, ચોકસાઈ અને વિવેક સાથે સૌથી વધુ માંગવાળું પ્રોફેશનલ કામ સંભાળે છે. 

GPT‑6 Astra આજે મર્યાદિત સંખ્યાની સંસ્થાઓ માટે અમલમાં આવી રહ્યું છે અને આગામી દિવસોમાં તે તમામ ChatGPT Plus, Pro, Business અને Enterprise વપરાશકર્તાઓ માટે તેમજ OpenAI API, Microsoft Azure અને AWS Bedrock મારફતે ઉપલબ્ધ થશે.

“ARC-AGI-3 પર, Astraએ 96% સ્તરોમાં અમારી માનવ ક્રિયા-કાર્યક્ષમતા આધારરેખાને વટાવી, અને અસરકારક રીતે આ માપદંડ પર માનવ સમકક્ષતા હાંસલ કરી. આ માત્ર અમે ક્યારેય પરીક્ષણ કરેલું શ્રેષ્ઠ મોડલ જ નથી, પરંતુ તે અત્યાધુનિક મોડલના પ્રદર્શનમાં એક અર્થપૂર્ણ પરિવર્તન પણ દર્શાવે છે - માત્ર નવા પર્યાવરણોમાં માર્ગ શોધવાની અને ઉકેલવાની તેની ક્ષમતામાં જ નહીં, પરંતુ તે કેટલા કાર્યક્ષમ રીતે આમ કરવાનું શીખે છે તેમાં પણ.
ગ્રેગ કેમ્રાડ્ટ, ARC પ્રાઇઝ ફાઉન્ડેશન

Astra અમારું સૌથી વધુ સંરેખિત મોડલ છે, જેમાં વપરાશકર્તાના ઇરાદા અને મોડલના વર્તનને સમજવામાં નોંધપાત્ર સુધારાઓ છે—તમે Astraના નિર્ણય પર વધુ વિશ્વાસ સાથે કાર્યો સોંપી શકો છો. આને પરીક્ષણની એક રીત તરીકે, અમે Hugging Face ઘટનાથી પ્રેરિત એક નવું મૂલ્યાંકન બનાવ્યું છે, જે તપાસે છે કે મુશ્કેલ અથવા અશક્ય કાર્યનો સામનો કરતું મોડલ તેના નિર્ધારિત કાર્યક્ષેત્રની બહાર જશે કે નહીં. GPT‑5.6 Solની સરખામણીમાં, જે ઉત્પાદન સુરક્ષાત્મક ઉપાયો વિના 48% વખત અધિકૃત લક્ષ્યની બહાર ગયું હતું, GPT‑6 Astraએ શૂન્ય ટકા કિસ્સાઓમાં આવું કર્યું હતું.

કમ્પ્યુટરનો ઉપયોગ કરવા માટે વિશ્વનું શ્રેષ્ઠ મોડલ

GPT‑6 Astra કમ્પ્યુટરના ઉપયોગની ઝડપ, ચોકસાઈ અને સલામતીમાં એક અત્યાધુનિક સ્થાપિત કરે છે. તે ઑનલાઇન ફોર્મ ભરવા, CRMમાં ગ્રાહક રેકોર્ડ અપડેટ કરવા અને તમારું કૅલેન્ડર ગોઠવવા જેવા કંટાળાજનક કાર્યો સંભાળી શકે છે. તે ઑનલાઇન સંશોધન કરી શકે છે અને તમારા ઇમેઇલમાં અથવા તમારા ડોક્યુમેન્ટ એડિટરમાં સારાંશોના ડ્રાફ્ટ તૈયાર કરી શકે છે. તે વૈજ્ઞાનિક ડેટાનું વિશ્લેષણ કરી શકે છે, પ્લોટ્સ જનરેટ કરી શકે છે, વેબસાઇટ બનાવી શકે છે અને તે સાઇટ પરની તમામ સુવિધાઓ યોગ્ય રીતે કામ કરે છે તેની ખાતરી કરવા માટે ફ્રન્ટએન્ડ QA તપાસો ચલાવી શકે છે. તે તમને સ્વાયત્ત રીતે સૉફ્ટવેર ઇન્સ્ટોલ અને પરીક્ષણ કરવામાં, તેમજ સ્ક્રીન પર દેખાતી સમસ્યાઓનું નિવારણ કરવામાં મદદ કરી શકે છે. આ સુધારાઓ અમારા અદ્યતન મૂલ્યાંકન પરિણામોમાં પણ પ્રતિબિંબિત થાય છે.

આ સુધારાઓ વાસ્તવિક જ્ઞાન-કામનાં કાર્યોમાં કાર્યક્ષમતામાં નોંધપાત્ર વધારો પણ કરે છે. OSWorld 2.0 પરના લેટન્સી સિમ્યુલેશન્સમાં, GPT‑5.6 Solની સરખામણીએ Astra કાર્ય દીઠ લગભગ 47% ઓછા સમયમાં વધુ સારું કમ્પ્યુટર-ઉપયોગ પ્રદર્શન હાંસલ કરે છે, લગભગ 40 મિનિટ પ્રતિ કાર્યમાં 72.6% સ્કોર કરે છે, જ્યારે લગભગ 75 મિનિટમાં 65.7% સ્કોર કરે છે.3

GPT‑6 Astraની કમ્પ્યુટર-ઉપયોગ ક્ષમતાઓ વિવિધ ક્ષેત્રોના આઉટપુટમાં જોઈ શકાય છે, જેમાં ગેમ ડેવલપમેન્ટ, ઇલેક્ટ્રિકલ એન્જિનિયરિંગ અને રોજિંદા નોલેજ કામનો સમાવેશ થાય છે:

Astra સાથે, અમે કમ્પ્યુટર ઉપયોગની ઝડપમાં નોંધપાત્ર સુધારો કરવા માટે Codex કાર્યપ્રણાલીને પણ અપડેટ કરી રહ્યા છીએ. Astraની કાર્યક્ષમતા સાથે જોડીને, Mind2Web બેન્ચમાર્ક પર આ વર્તમાન GPT‑5.6 Sol અનુભવની સરખામણીમાં 1.9 ગણું ઝડપી કાર્ય પૂર્ણ કરવામાં પરિણમે છે. મોડલની ઝડપમાં થયેલા સુધારાઓનો અર્થ એ છે કે તે તમારા માટે સમય લેતા ઘણા રોજિંદા કાર્યો તમે કરી શકો તેના કરતાં વધુ ઝડપથી કરી શકે છે.4

“લોન્ચના દિવસે અમે GPT‑6 Astraને ડેવિનની કાર્યપ્રણાલીમાં એકીકૃત કરી રહ્યા છીએ, જ્યાં તે અમારા આંતરિક પરીક્ષણ બેન્ચમાર્ક પર અત્યાધુનિક પ્રદર્શન આપે છે. કમ્પ્યુટરનો ઉત્તમ ઉપયોગ કરવાની, લખવાની અને કોડબેઝને સમજવાની તેની ક્ષમતાએ શરૂઆતથી જ ટેસ્ટિંગમાં સુધારો કર્યો: વિડિયો નોંધપાત્ર રીતે અનુસરવામાં વધુ સરળ છે, અને રિપોર્ટ્સ વધુ સ્પષ્ટ તથા વધુ સંક્ષિપ્ત છે”
સિલાસ આલ્બર્ટી, SVP સંશોધન, Cognition

પ્રોફેશનલ કામમાં એક નોંધપાત્ર પરિવર્તન

GPT‑6 Astra જટિલ કામનાં કાર્યોનો સામનો કરવામાં મદદ કરવા માટે કમ્પ્યુટર ઉપયોગમાં થયેલી પ્રગતિઓને પ્રોફેશનલ વાતાવરણ માટેની લક્ષિત તાલીમ સાથે જોડે છે. તે જટિલ સમસ્યાઓ માટે જરૂરી ઇન્ટેલિજન્સને બહુ-પગલાંના વર્કફ્લો હાથ ધરવાની અને સુઘડ દસ્તાવેજો, સ્પ્રેડશીટ્સ અને પ્રેઝન્ટેશનો તૈયાર કરવાની ક્ષમતા સાથે જોડે છે.

GPT‑6 Astra એ હાલના નમૂનાઓને અનુસરવા અને સુવ્યવસ્થિત લેઆઉટવાળી તથા સંરચિત નેરેટિવ દ્વારા મુખ્ય મુદ્દાઓને સંક્ષિપ્તમાં રજૂ કરતી સ્લાઇડ્સ બનાવવા માટેનું અમારું શ્રેષ્ઠ મોડલ છે. તે તમારા નમૂનાઓને અનુસરતા અને તમારી લેખન તથા દૃશ્ય શૈલી સાથે મેળ ખાતા સ્પષ્ટ, સુવ્યવસ્થિત દસ્તાવેજો, પ્રસ્તુતિઓ, સ્પ્રેડશીટ્સ અને વિશ્લેષણો બનાવે છે. Astraને આઉટપુટમાં માત્ર સંબંધિત સંદર્ભ જ સ્પષ્ટપણે સામેલ કરવા માટે પણ તાલીમ આપવામાં આવી છે, જેથી વર્તમાન કામ માટે અનાવશ્યક માહિતીનું પુનરાવર્તન ન થાય. આ બધાનો અર્થ એ થાય છે કે તે તમારા વ્યવસાયિક સંદર્ભ અને ધોરણો સાથે મેળ ખાતી, વધુ તરત ઉપયોગમાં લઈ શકાય તેવી આર્ટિફેક્ટ્સ આઉટપુટ કરી શકે છે.

GPT‑6 Astra તે બનાવે છે તેવી વેબસાઇટ્સ, ગેમ્સ, એપ્લિકેશન્સ અને રેન્ડરિંગ્સ માટે વધુ મજબૂત દૃશ્યાત્મક નિર્ણયક્ષમતા પણ લાવે છે. ChatGPTમાં સાઇટ્સ⁠(નવી વિન્ડોમાં ખૂલે છે) સાથે, Astra પ્રોમ્પ્ટથી સીધી વેબસાઇટ્સ, વેબ એપ્લિકેશન્સ અને ગેમ્સ બનાવી શકે, હોસ્ટ કરી શકે અને શેર કરી શકે છે.

“Astra અમને ક્ષમતા અને કાર્યક્ષમતા બંનેમાં નોંધપાત્ર લાભ આપે છે. અમે ચકાસેલા અન્ય મોડલ્સ કરતાં 20% સુધી ઓછા ટોકનનો ઉપયોગ કરીને તે અમારા સૌથી જટિલ સર્જનાત્મક વર્કફ્લો સફળતાપૂર્વક ચલાવે છે. સૌથી મહત્વની વાત એ છે કે, અમારા ગ્રાહકો માટે તેનો અર્થ વધુ ઉચ્ચ ગુણવત્તાવાળું આઉટપુટ છે.”
એલેક્સ મશરાબોવ, CEO અને સહ-સ્થાપક, Higgsfield AI

જ્યારે સૂચનાઓ અર્થઘટન માટે અવકાશ છોડી દે છે, ત્યારે યોગ્ય નિર્ણય લેવામાં GPT‑6 Astra અગાઉના મોડલ્સ કરતાં વધુ સારું છે. તે સામાન્ય ખાલી જગ્યાઓ પૂરી કરવા માટે સંદર્ભનો ઉપયોગ કરે છે અને જ્યારે જવાબ પરિણામ બદલી શકે તેમ હોય ત્યારે કેન્દ્રિત પ્રશ્નો પૂછે છે. Codexમાં, તે તમારા જવાબ પર નિર્ભર ન હોય તેવું કાર્ય ચાલુ રાખતાં અસિંક્રોનસ રીતે પ્રશ્નો પૂછી શકે છે. જો તમે જવાબ ન આપો, તો જ્યાં યોગ્ય હોય ત્યાં તે વાજબી અનુમાનો સાથે આગળ વધે છે, પરંતુ મહત્વપૂર્ણ નિર્ણયો માટે તમારા ઇનપુટની રાહ જુએ છે.

નીચેનાં ઉદાહરણો દર્શાવે છે કે Astra રોજિંદા કાર્યોમાં કેવી રીતે સહયોગ કરે છે, જ્યાં ખૂટતી માહિતી જવાબને નોંધપાત્ર રીતે બદલી શકે છે.

Astra કાર્ય આગળ વધે તેમ દિશાબોધ જાળવી રાખવામાં પણ વધુ સારું છે. અગાઉનાં મોડલ્સ ક્યારેક માર્ગદર્શક સંદેશાને નવા લક્ષ્ય તરીકે લેતાં હતાં, જેના કારણે મૂળ વિનંતી અથવા અગાઉની મર્યાદાઓ પરનું ધ્યાન છૂટી જતું હતું. Astra નવી આવશ્યકતાઓને સમાવી લે છે, કહેવામાં આવે ત્યારે દિશા બદલે છે અને વ્યાપક કાર્યને નજરઅંદાજ કર્યા વિના અન્ય પ્રશ્નોના જવાબ આપે છે.

“જટિલ કાનૂની કાર્યોમાં Astra એ GPT‑5.6 Sol કરતાં ગુણવત્તામાં નોંધપાત્ર સુધારો છે. અમારા પ્રારંભિક પરીક્ષણમાં, Astra કાનૂની કામને એક સૂઝબૂઝ ધરાવતા વકીલની જેમ હાથ ધરીને વિશેષ રીતે ઊભરી આવ્યું: તે દસ્તાવેજોને સ્થાપિત રેકોર્ડ્સથી અલગ પાડે છે, આધાર વિનાની ધારણાઓને ઉજાગર કરે છે અને ખામીઓને નક્કર ડ્રાફ્ટિંગ સ્થિતિઓમાં રૂપાંતરિત કરે છે.”
નિકો ગ્રુપેન, એપ્લાઇડ રિસર્ચના વડા, Harvey

કોડિંગ

GPT‑6 Astra આજ સુધી સૉફ્ટવેર એન્જિનિયરિંગ માટેનું શ્રેષ્ઠ મોડલ છે.

2માંથી 1
“GPT‑6 Astra અમારા આંતરિક કોડિંગ બેન્ચમાર્ક પર અત્યાધુનિક કામગીરી આપે છે અને GPT‑5.6 Solની સરખામણીમાં ટ્રેડિંગ ઇન્ટ્યુઇશન મૂલ્યાંકનોમાં સ્પષ્ટ પ્રગતિ દર્શાવે છે. એજન્ટિક કોડિંગ માટે ઉપયોગ કરવામાં આવે ત્યારે, GPT‑6 Astra ડેવલપર્સ માટે અનુસરવામાં સરળ હોય તેવી રીતે સંવાદ કરે છે અને એવો કોડ બનાવે છે જેને પ્રોડક્શન ગુણવત્તા સુધી પહોંચાડવા માટે ઓછા પુનરાવર્તનની જરૂર પડે છે.”
જૉન ક્રેપેઝી, આર્ટિફિશિયલ ઇન્ટેલિજન્સ સહાયકો, Jane Street

Astra સાથે, જ્યારે સંદર્ભ વિન્ડો ભરાઈ જાય ત્યારે Codex માટે સંદર્ભ જાળવી રાખવાની અને પુનઃપ્રાપ્ત કરવાની નવી રીત રજૂ કરી રહ્યા છીએ. ઐતિહાસિક રીતે, મોડલ્સે લાંબા સત્રો દરમિયાન કામનો સારાંશ આપવા માટે કૉમ્પેક્શનનો ઉપયોગ કર્યો છે, જેમ કે જટિલ સમસ્યાઓ ડિબગ કરતી વખતે અથવા મોટા રિફેક્ટર હાથ ધરતી વખતે. દરેક કૉમ્પેક્શનમાં કોઈ ઠીક કરવાની કામગીરી કેમ નિષ્ફળ ગઈ અથવા કોઈ ઘટક કેવી રીતે વર્તે છે તેની વિગતો છૂટી જઈ શકે છે. Codexમાં, Astra સંદર્ભ વિન્ડોઝમાં નોંધો રાખી શકે છે, જેથી સંચિત વિગતોને વારંવાર એક જ સારાંશમાં સંકુચિત કર્યા વિના જાળવી શકાય. પહેલાંની સંદર્ભ વિન્ડો શોધી શકાય તેવી રહે છે, તેથી Astra અગાઉના સંદેશા અને ટૂલ આઉટપુટ્સમાંથી જરૂરિયાતો અથવા પરીક્ષણ પરિણામો શોધી શકે છે—ભલે તે માહિતી તેની નોંધોમાં કૅપ્ચર કરવામાં આવી ન હોય. તમે તમારા Codex config.toml⁠(નવી વિન્ડોમાં ખૂલે છે)માં આ પ્રાયોગિક સુવિધા સક્ષમ કરી શકો છો અને આગામી અઠવાડિયાઓમાં તે Astra માટે ડિફૉલ્ટ બની જશે.

વૈજ્ઞાનિક શોધને આગળ વધારવી

“વાત એવી છે: એક યુગનો અંત, બીજા યુગની શરૂઆત.”
ગ્રેગ બર્નહામ, EpochAI

GPT‑6 Astra વૈજ્ઞાનિક શોધખોળ, ગણિત અને આરોગ્ય માટે એક મહત્ત્વપૂર્ણ પ્રગતિ છે. આજે, અમે અવિભાજ્ય સંખ્યાઓ વચ્ચેના અંતરો અંગેના બે વધુ પરિણામો શેર કરી રહ્યા છીએ.9, 10

Astra ગણિત અને વિજ્ઞાન મૂલ્યાંકનોના સમૂહમાં પણ નવા રેકોર્ડ સ્થાપે છે.

Astra વૈજ્ઞાનિક શોધ પાછળના વ્યવહારુ કામમાં મદદ કરી શકે છે. વૈજ્ઞાનિક રિઝનિંગને કમ્પ્યુટરના ઉપયોગ સાથે જોડીને, તે ડેટાનું નિરીક્ષણ કરવા અને પરિણામોની તપાસ કરવા માટે વિશિષ્ટ સૉફ્ટવેરમાં સીધું કામ કરી શકે છે, જેથી સંશોધકોને પુરાવાનું મૂલ્યાંકન કરવામાં અને આગળ શું તપાસવું તે નક્કી કરવામાં મદદ મળે છે.

સાયબર સિક્યુરિટી

અમે અમારા સુરક્ષા અપડેટ⁠માં ચર્ચા કરી હતી તેમ, Astra સાઇબર ક્ષમતાઓમાં નોંધપાત્ર છલાંગ છે અને અમારા નિર્ણાયક સ્તરને અમારા પ્રિપેરડનેસ ફ્રેમવર્ક હેઠળ સાઇબર સુરક્ષામાં પૂર્ણ કરે છે. ઝીરો-ડે એક્સ્પ્લોઇટ્સને ઓળખવાની અને વિકસાવવાની તેની ક્ષમતા સુરક્ષા રક્ષકોને નબળાઈઓ શોધવામાં અને પેચ કરવામાં મદદ કરી શકે છે, પરંતુ તે વધુ મજબૂત સુરક્ષા ઉપાયોની જરૂરિયાત પણ ઊભી કરે છે. આ ક્ષમતાઓ કેટલી હદ સુધી વિસ્તરે છે તે સમજવા માટે, અમે Astraને આંતરિક અને તૃતીય-પક્ષ નિષ્ણાત મૂલ્યાંકનો પર ચલાવ્યું.

અમે સૌપ્રથમ પ્રોડક્શન સુરક્ષા ઉપાયો વિના મોડલનું ExploitBench અને ExploitGym પર પરીક્ષણ કર્યું, જે મૂલ્યાંકન કરે છે કે મોડલ્સ જાણીતી સૉફ્ટવેર નબળાઈઓને કાર્યરત એક્સ્પ્લોઇટ્સમાં ફેરવી શકે છે કે નહીં. ExploitBench પર, અમારા અગાઉના અત્યાધુનિક સાઇબર-સક્ષમ મોડલ GPT‑5.6 Solના 78.5%ની સરખામણીમાં Astraએ 100%નો સંપૂર્ણ ગુણ મેળવ્યો. ExploitGym પર, Astraએ નોંધપાત્ર રીતે ઓછા આઉટપુટ ટોકનનો ઉપયોગ કરતી વખતે 42.4% સફળતા દર હાંસલ કર્યો, જ્યારે GPT‑5.6 Sol માટે તે 30.3% હતો.13

ઐતિહાસિક સૉફ્ટવેર નબળાઈઓના સંપર્કથી બેન્ચમાર્ક પરિણામો પ્રભાવિત થયા હોઈ શકે તેવી ચિંતાઓને ધ્યાનમાં રાખીને, અમે Astraનું બે નવતર બેન્ચમાર્ક પર પણ મૂલ્યાંકન કર્યું. એક ઉદાહરણ તરીકે, અમે પાછલા ત્રણ મહિનાની નબળાઈઓનો ઉપયોગ કરીને એક્સ્પ્લોઇટ વિકાસનું પરીક્ષણ કરવા માટે આંતરિક “ExploitBench (જૂન–ઑગસ્ટ 2026)” મૂલ્યાંકન બનાવ્યું.14 આ ડેટા સેટ પર, Astraએ GPT‑5.6 Sol કરતાં નોંધપાત્ર રીતે મનસ્વી કોડ-અમલના ઉચ્ચ દર હાંસલ કર્યા જ્યારે ઘણા ઓછા આઉટપુટ ટોકનનો ઉપયોગ કરવામાં આવ્યો હતો. મૂલ્યાંકન દરમિયાન, Astraએ અગાઉ અજાણી બે ઝીરો-ડે નબળાઈઓ પણ શોધી કાઢી અને ઉપયોગમાં લીધી. અમે બંને નબળાઈઓનો તેમના સંબંધિત જાળવણીકર્તાઓ સમક્ષ ખુલાસો કરી રહ્યા છીએ.

અમે Astraનું SRE-Bench15 પર પણ પરીક્ષણ કર્યું, જે એક બેન્ચમાર્ક છે અને માપે છે કે મોડલ્સ કાચા સ્રોત કોડની ઍક્સેસ વિના સૉફ્ટવેર બાઇનરીઝનું રિવર્સ એન્જિનિયરિંગ કરીને તેની મુખ્ય તર્કપ્રણાલી સમજી શકે છે કે નહીં. Astraએ એક જ પ્રયાસમાં 88.0% કાર્યો ઉકેલ્યાં અને ચાર પ્રયાસોમાં 99.2% કાર્યો ઉકેલ્યાં, જ્યારે GPT‑5.6 Sol માટે અનુક્રમે 55.9% અને 68.7% હતાં.

બેન્ચમાર્કથી આગળ, નિષ્ણાતોની આગેવાની હેઠળના મૂલ્યાંકનોમાં જાણવા મળ્યું કે Astra, પ્રોડક્શન સુરક્ષા ઉપાયો વિના ચલાવવામાં આવે ત્યારે, અગાઉ અજાણી હતી તેવી નબળાઈઓનો ઉપયોગ કરીને અત્યંત સુરક્ષિત બ્રાઉઝરમાં મનસ્વી કોડ ચલાવી શકે છે અને અત્યંત સુરક્ષિત ઑપરેટિંગ સિસ્ટમ માટે વિશેષાધિકાર-વૃદ્ધિ એક્સ્પ્લોઇટ્સ બનાવી શકે છે.

જેમ કે અમે રક્ષકોની તકમાં ચર્ચા કરી હતી, અત્યાધુનિક સાઇબર ક્ષમતાઓ રક્ષકોને નબળાઈઓ ઝડપથી શોધવામાં મદદ કરી શકે છે, પરંતુ તે નબળાઈઓને એક્સ્પ્લોઇટ કરવાનું પણ સરળ બનાવે છે, જેના કારણે રક્ષકો માટે અનુકૂલન સાધવાની તાત્કાલિકતા વધે છે. આજે લૉન્ચ થઈ રહેલી Astraની આવૃત્તિ સાથે, રક્ષકો સુરક્ષિત કોડ સમીક્ષા અને પેચિંગ જેવા કાર્યો પૂર્ણ કરવા માટે તેનો ઉપયોગ કરી શકે છે.

જોકે, Astra નબળાઈઓ માટે પ્રૂફ-ઓફ-કન્સેપ્ટ એક્સ્પ્લોઇટ્સ બનાવવા જેવા વધુ અદ્યતન સાઇબર સુરક્ષા કાર્યોમાં સહકાર આપવાનો ઇનકાર કરશે. OpenAI Daybreak⁠ દ્વારા, અમે આવતા અઠવાડિયામાં ઍક્સેસને વિસ્તૃત કરવાની અને ઓછા પ્રતિબંધિત સુરક્ષાત્મક ઉપાયો અમલમાં મૂકવાની યોજના ધરાવીએ છીએ. આનાથી વધુ રક્ષણાત્મક વર્કફ્લો સક્ષમ બનશે, જેમાં નબળાઈઓ અને પ્રૂફ-ઓફ-કન્સેપ્ટનું માન્યકરણ, માલવેર વિશ્લેષણ અને ડિટેક્શન એન્જિનિયરિંગનો સમાવેશ થાય છે.

અમે GPT‑5.6 Sol માટેના અમારા સુરક્ષાત્મક ઉપાયોના માળખા પર આધાર રાખીને, સંભવિત સાઇબર દુરુપયોગ સામેની અમારી સુરક્ષા પણ મજબૂત કરી છે. તેમાં સંભવિત જેલબ્રેક સામે વધુ સારી રીતે ટકી રહેવા માટે મોડલની વધુ મજબૂતી અને અમારી દેખરેખ સિસ્ટમ માટે વધુ સંદર્ભનો સમાવેશ થાય છે. અમે અમારા આંતરિક રેડ ટીમિંગ હુમલાખોરો સાથેના સ્વચાલિત મૂલ્યાંકનો સહિત સઘન આંતરિક અને બાહ્ય પરીક્ષણ ચાલુ રાખ્યું છે. અમારા સાઇબર સુરક્ષાત્મક ઉપાયો અને પરીક્ષણ વિશે વધુ વિગતો Astraના સલામતીની ઝાંખી⁠ અને સિસ્ટમ કાર્ડ⁠(નવી વિન્ડોમાં ખૂલે છે)માં ઉપલબ્ધ છે..

GPT‑6 Astraને જવાબદારીપૂર્વક સંરેખિત કરવું અને જમાવટ કરવી

Astra અમારું સૌથી વધુ સંરેખિત મોડલ છે. Astra કાળજીપૂર્વક વર્તવામાં, કાર્યની સીમાઓનું સન્માન કરવામાં અને પારદર્શક રીતે સંચાર કરવામાં ઉત્તમ છે. આ કાર્ય શરૂઆતથી અંત સુધી માનવીય ઇરાદા સાથે સંરેખિત રહેતા મોડલને તાલીમ આપવા પર કેન્દ્રિત અમારા લાંબા સમયથી ચાલતા સંશોધન કાર્યક્રમનું નવીનતમ પરિણામ છે.

સંવેદનશીલ વાતાવરણોમાં, Astra જોખમના સ્તરને અનુરૂપ સાવચેતી સાથે આગળ વધે છે. ગેરવર્તન પ્રેરિત કરવા માટે પ્રતિકૂળ રીતે પસંદ કરાયેલા કમ્પ્યુટર ઉપયોગનાં કાર્યોના મૂલ્યાંકનમાં, Astra અનિચ્છિત પરિણામો ટાળવામાં વધુ સફળ રહ્યું હતું. ડિફૉલ્ટ રૂપે પ્રદાન કરવામાં આવતા વધારાના સુરક્ષા પગલાં સાથે ચલાવવાથી હજી વધુ મજબૂત પ્રદર્શન મળ્યું.

Astra પરીક્ષણ કરાયેલા અન્ય કોઈપણ અત્યાધુનિક મોડલ કરતાં ઓછા ગેર-સંરેખિત પરિણામો સર્જે છે. ન્યાયસંગત સરખામણી માટે, અમે ( OpenAI Responses API⁠(નવી વિન્ડોમાં ખૂલે છે) અને Anthropic Messages API⁠(નવી વિન્ડોમાં ખૂલે છે) બંનેમાં ઉપલબ્ધ નેટિવ કમ્પ્યુટર ઉપયોગ ટૂલ્સ પર આધારિત) સામાન્ય કમ્પ્યુટર-યૂઝિંગ એજન્ટ કાર્યપ્રણાલીનો ઉપયોગ કર્યો હતો અને Codex તથા ChatGPT કામ વપરાશકર્તાઓ માટે સામાન્ય રીતે લાગુ કરવામાં આવતી વધારાની સુરક્ષાઓ (ઑટો-રિવ્યૂ, પુષ્ટિ-નીતિ) વિના તેનો ઉપયોગ કર્યો હતો.

Astra વપરાશકર્તા દ્વારા નિર્ધારિત અને તેના વાતાવરણ દ્વારા સૂચિત મર્યાદાઓની અંદર કાર્ય કરે તેવી શક્યતા પણ વધુ છે. આંતરિક મૂલ્યાંકનમાં, Astraએ Codex ઑટો-રિવ્યૂના અસ્વીકારને ટાળવાનો ક્યારેય પ્રયાસ કર્યો નથી. આ વાત ત્યારે પણ માન્ય રહી જ્યારે ઑટો-રિવ્યૂને ઇરાદાપૂર્વક ટાળી શકાય તે રીતે કન્ફિગર કરવામાં આવ્યું હતું અને અન્યથા કાર્ય પૂર્ણ કરવું અશક્ય હતું. પર્યાવરણના પ્રતિબંધો પ્રત્યેનો આ આદર આ પોસ્ટની પ્રસ્તાવનામાં અમે શેર કરેલા અમારા અશક્ય સાઇબર કાર્યના મૂલ્યાંકનનાં પરિણામો અને અમારા સિસ્ટમ કાર્ડ⁠(નવી વિન્ડોમાં ખૂલે છે)માં દસ્તાવેજીકૃત અન્ય તારણો સાથે સુસંગત છે.

Astra પારદર્શક વપરાશકર્તા સંચારમાં પણ નવા માપદંડો સ્થાપિત કરે છે. એક મૂલ્યાંકન અનુસાર, Astra તેની ક્ષમતાઓ અને પરવડતા વિશે ખોટી રજૂઆતો કરે તેવી શક્યતા GPT‑5.6 Solની સરખામણીએ ત્રણ ગણી ઓછી છે.

અમારા ક્ષમતા-ભ્રમ મૂલ્યાંકનમાં, Astra GPT‑5.6 Sol કરતાં નોંધપાત્ર સુધારો દર્શાવે છે અને તેની ક્ષમતાઓ વિશે ઓછા ભ્રામક દાવા કરે છે.

અમારા મૂલ્યાંકનોમાં જાણવા મળ્યું કે Astraના લેખિત રિઝનિંગ પર દેખરેખ રાખવી GPT‑5.6 Sol કરતાં વધુ મુશ્કેલ હતી, જે પરીક્ષણોના આધારે તેને દેખરેખથી બચવાનું સ્પષ્ટપણે કહેવામાં આવ્યું હતું. અમે આનું કારણ સરળ કાર્યોમાં લેખિત રિઝનિંગ પર Astraનું વધુ નિયંત્રણ અને ઓછા લેખિત પગલાંમાં સમસ્યાઓ ઉકેલવાની તેની ક્ષમતાને ગણાવીએ છીએ. જટિલ કાર્યો માટે જરૂરી રિઝનિંગ છુપાવવામાં Astraને હજુ પણ મુશ્કેલી પડતી હોય તેમ લાગે છે, પરંતુ અમે આ ઘટાડાને ગંભીરતાથી લઈએ છીએ. દેખરેખ ક્ષમતા સુધારવી એ સંશોધનની પ્રાથમિકતા બની રહી છે અને સાથેનું સિસ્ટમ કાર્ડ⁠(નવી વિન્ડોમાં ખૂલે છે) અમારાં તારણો અને ચાલુ કાર્યની વિગતો આપે છે.

સંરેખણ તાલીમ એ ડિપ્લોયમેન્ટ પ્રત્યેના અમારા અભિગમના કેન્દ્રમાં છે. સંરક્ષણના વધારાના સ્તર તરીકે, અમે અસુરક્ષિત વર્તનને શોધવામાં અને નિયંત્રિત કરવામાં મદદ કરવા માટે Codex ઑટો-રિવ્યૂ⁠(નવી વિન્ડોમાં ખૂલે છે) જેવા સિસ્ટમ સુરક્ષાત્મક ઉપાયો બનાવીએ છીએ અને એજન્ટોના રિઝનિંગ તથા કાર્યોની દેખરેખ પણ રાખીએ છીએ. અમારા સલામતી અપડેટ⁠માં વર્ણવ્યા મુજબ, અસંગતતા વિશે દૃશ્યતા મેળવવા અને તેના સૌથી ગંભીર કિસ્સાઓને નિયંત્રિત કરવામાં મદદ કરવા માટે અમે Astra-શ્રેણીના મોડલ માટે ઉત્પાદનમાં અસંરેખણ દેખરેખ પણ ડિપ્લોય કરી રહ્યા છીએ. આ સુરક્ષાત્મક ઉપાયો આંતરિક ડિપ્લોયમેન્ટ માટેની અમારી દેખરેખ જેવા છે અને તેમાં વર્ગીકરણકારોની એવી સિસ્ટમ સામેલ છે, જે મોડલના રિઝનિંગ અને પગલાંમાં અનધિકૃત વર્તન તપાસે છે તથા સંભવિત અનધિકૃત પ્રવૃત્તિ આપમેળે અટકાવે છે.

Astraની સાઇબર સુરક્ષા ક્ષમતાઓમાં નોંધપાત્ર વધારો થયો હોવાથી, અમે આ ડિપ્લોયમેન્ટને સલામત અને સુરક્ષિત બનાવવા માટે ખાસ કાળજી લઈ રહ્યા છીએ. વધારાની સલામતી ચકાસણીઓ ક્યારેક રક્ષણાત્મક સાઇબર સુરક્ષા સહિતના કાયદેસર કાર્યને ધીમું કરી શકે છે, થોભાવી શકે છે અથવા અટકાવી શકે છે. જો ChatGPT અથવા Codexમાં કોઈ કાર્ય થોભાવવામાં આવે, તો આગળ વધતાં પહેલાં તમને પગલાની સમીક્ષા કરવાનું કહેવામાં આવી શકાય છે. APIમાં, કાર્ય બંધ થઈ જશે. આ ચકાસણીઓ ક્યારેક વાજબી કામમાં વિક્ષેપ પેદા કરી શકે છે અને અનાવશ્યક વિક્ષેપો ઘટાડવા માટે અમે આ સિસ્ટમમાં સતત સુધારા કરી રહ્યા છીએ. અસંરેખણ દેખરેખ સંરેખણનું સ્થાન લઈ શકતી નથી: અમારું લક્ષ્ય એવાં મોડલ્સ બનાવવાનું છે જે વિશ્વસનીય રીતે તેમની અધિકૃત મર્યાદામાં રહે, જેથી આ સુરક્ષાત્મક ઉપાયોને હસ્તક્ષેપ કરવાની જરૂર ન પડે.

ઉપલબ્ધતા

GPT‑6 Astra આજે મર્યાદિત સંખ્યાની સંસ્થાઓ માટે અમલમાં આવી રહ્યું છે અને આગામી દિવસોમાં તે તમામ ChatGPT Plus, Pro, Business અને Enterprise વપરાશકર્તાઓ માટે તેમજ OpenAI API, Microsoft Azure અને AWS Bedrock મારફતે ઉપલબ્ધ થશે. Astraનો ઉપયોગ હાલની સબ્સ્ક્રિપ્શન મર્યાદાઓમાં સામેલ છે—વપરાશકર્તાઓ અને વ્યવસાયો વધારાના ઉપયોગ માટે ક્રેડિટ્સ પણ ખરીદી શકશે. Pro, Business અને Enterprise પ્લાનના વપરાશકર્તાઓને GPT‑6 Astra Proનો ઍક્સેસ પણ મળશે. Enterprise એડમિનિસ્ટ્રેટર્સ તેમના વર્કસ્પેસ માટે Astra સક્રિય કરી શકે છે; લૉન્ચ સમયે ઍક્સેસ ડિફૉલ્ટ રૂપે બંધ છે.

Astra પાત્ર API ગ્રાહકો માટે ઝીરો ડેટા રિટેન્શન સમર્થન આપે છે અને અમે ગયા મહિને શેર કર્યું હતું તેમ, ગ્રાહકની ગોપનીયતા જાળવી રાખીને સુરક્ષા દેખરેખને મજબૂત બનાવવા માટે અમે ખાનગી સુરક્ષા પ્રક્રિયાનું પરીક્ષણ કરી રહ્યા છીએ.

ડેવલપર્સ માટે, GPT‑6 Astra OpenAI APIમાં gpt-6-astra તરીકે અને Microsoft Azure તથા Amazon Bedrock મારફતે ઉપલબ્ધ થશે.

OpenAI APIની સ્ટાન્ડર્ડ કિંમત પ્રતિ દસ લાખ ઇનપુટ ટોકન $10 અને પ્રતિ દસ લાખ આઉટપુટ ટોકન $50 છે. કૅશ રીડ્સ અને રાઇટ્સ માટે અલગ-અલગ દરો લાગુ પડે છે. APIમાં GPT‑6 Astra માટે ઝડપી મોડ ઉપલબ્ધ છે અને તે સ્ટાન્ડર્ડ પ્રોસેસિંગની 2x સુધીની ઝડપ, સ્ટાન્ડર્ડ કિંમતના 2x ભાવે પૂરી પાડે છે.

કમ્પ્યુટરનો ઉપયોગ

કમ્પ્યુટરનો ઉપયોગGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (ઑગસ્ટ રિલીઝ, આંશિક સ્કોર)---66.1%70.6%-
OSWorld 2.0 (ઑગસ્ટ રિલીઝ, ઑફલાઇન સબસેટ, આંશિક સ્કોર)------
ScreenSpot Pro92.6%76.8%----
BrowseComp92.1%90.4%-87.4%90.8%-

પ્રોફેશનલ

પ્રોફેશનલ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

આંતરિક ડિઝાઇન કાર્યો

50.0%

47.4%

-

35.8%

-

-

આંતરિક ડેટા સાયન્સ કાર્યો

40.9%

30.5%

-

34.7%

-

-

આર્ટિફિશિયલ એનાલિસિસ ઇન્ટેલિજન્સ ઇન્ડેક્સ v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

કોડિંગ

કોડિંગGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (સ્કોર)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 મુખ્ય (સ્કોર)53.3% 847.5%50.9%53.5%53.4%43.6%
આંતરિક ડેટાબેઝ માઇગ્રેશન કાર્યો63.9%42.7%57.8%50.3%--
આર્ટિફિશિયલ એનાલિસિસ કોડિંગ એજન્ટ ઇન્ડેક્સ v1.467.065.1-67.268.161.2

શૈક્ષણિક

શૈક્ષણિક

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA ડાયમંડ

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

માનવજાતની છેલ્લી પરીક્ષા (ટૂલ્સ સાથે)

57.2%

-

65.0%

63.8%

63.6%

-

વિજ્ઞાન અને હેલ્થ

વિજ્ઞાન અને ChatGPT હેલ્થGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (આંતરિક)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (લંબાઈ-સમાયોજિત)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

સાયબર સિક્યુરિટી

સાઇબર સુરક્ષાGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (જૂન-ઑગસ્ટ 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

એલાઇનમેન્ટ

એલાઇનમેન્ટ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

આંતરિક કમ્પ્યુટર ઉપયોગ સલામતી બેન્ચમાર્ક (જેટલો ઓછો, તેટલો સારો)

2.4%

22.0%

9.5%

18.3%

11.5%

-

આંતરિક કમ્પ્યુટર ઉપયોગ સુરક્ષા બેન્ચમાર્ક, AutoReview સાથે (જેટલો ઓછો, તેટલો સારો)

1.8%

4.3%

-

-

-

-

આંતરિક ટાળવાનો બેન્ચમાર્ક (જેટલો ઓછો, તેટલો સારો)

0.00%

0.29%

-

-

-

-

ExploitGym હનીપોટ (ઓછું હોય તો વધુ સારું)

0.0%

48.2%

-

-

-

-

અશક્ય ExploitGym

100.0%

-

-

-

-

-

આંતરિક હેલ્યુસિનેશન બેન્ચમાર્ક (જેટલો ઓછો, તેટલો સારો)

4.2%

12.2%

-

-

-

-

લાંબો સંદર્ભ

લાંબો સંદર્ભ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

અમૂર્ત રિઝનિંગ

અમૂર્ત રિઝનિંગGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

મૂલ્યાંકન સ્કોર કોઈપણ પ્રયાસ પર મહત્તમ હોય છે. GPT મૂલ્યાંકનો અમારા સંશોધન એન્વાયર્નમેન્ટમાં અથવા અમારી API મારફતે ચલાવવામાં આવ્યા હતા, જે સિસ્ટમ પ્રોમ્પ્ટ, ઉપલબ્ધ ટૂલ્સ વગેરેમાં તફાવતોને કારણે પ્રોડક્શન ChatGPT કરતાં થોડું અલગ આઉટપુટ આપી શકે છે.

ફટનોટ

  1. 1

    ARC-AGI-3 પર, GPT-6 Astraને અમારી રિસ્પોન્સિસ API કાર્યપ્રણાલી⁠ સાથે ચલાવવામાં આવ્યું હતું, જે વાસ્તવિક દુનિયાની કામગીરીને વધુ સારી રીતે અનુરૂપ બનાવવા માટે બે સેટિંગ બદલે છે. ફેરફારો ખાસ કરીને ARC-AGI-3ને લક્ષિત કરતા નથી.

  2. 2

    GPT-5.6 Sol એ અમારી API, ChatGPT Codex અને ChatGPT કામમાં ઉપલબ્ધ સંસ્કરણનો ઉલ્લેખ કરે છે. ChatGPT ચૅટમાંનું સંસ્કરણ સહેજ અલગ છે.⁠

  3. 3

    OSWorld V2-Offline એ મૂળ OSWorld V2નો એક ઉપસમૂહ છે, જે ઇન્ટરનેટ ઍક્સેસ વિના કાર્ય કરે છે. OSWorld-V2 Offline પર Claude મોડલની કામગીરીનું પુનરુત્પાદન લેખકો દ્વારા સત્તાવાર લીડરબોર્ડ પર⁠(નવી વિન્ડોમાં ખૂલે છે) કરવામાં આવ્યું હતું. OSWorld 2.0 પર, Claude માટેના સ્કોર સત્તાવાર સેટિંગ્સનો ઉપયોગ કરે છે, Fable 5.1 સિસ્ટમ કાર્ડમાંથી સંશોધિત કાર્યો અને સંશોધિત ગ્રેડિંગનો નહીં.

  4. 4

    મોડલ સમય એ સંબંધિત પ્રદર્શન રન માટે નોંધાયેલા વીતી ગયેલા સમય છે. બતાવવામાં આવેલી ક્લિપ્સ સંપાદિત અંશો છે.

  5. 5

    BenchCAD પર, Claudeના સ્કોર મૂલ્યાંકનમાં કરેલા ત્રણ ફેરફારો દર્શાવે છે, જેની વિગતો Fable 5.1 સિસ્ટમ કાર્ડ⁠(નવી વિન્ડોમાં ખૂલે છે)માં આપવામાં આવી છે.

  6. 6

    ગુઆંગ યાંગ, વિક્ટોરિયા એબર્ટ, નાઝિફ ટેમર, બ્રાયન સિયુઆન ઝેંગ, લુઇઝા પોઝોબોન અને નોઆ એ. સ્મિથ. “LEGATO: ટાઇપસેટ OMR માટેનો મોટા પાયાનો એન્ડ-ટુ-એન્ડ સામાન્યીકરણક્ષમ અભિગમ⁠(નવી વિન્ડોમાં ખૂલે છે).” arXiv:2506.19065, 2025.

  7. 7

    માર્ક આર. એચ. ગોથમ, મૌરીન રેડબોન્ડ, બ્રુનો બોવર અને પીટર જોનાસ. “The OpenScore String Quartet Corpus⁠(નવી વિન્ડોમાં ખૂલે છે).” સંગીતશાસ્ત્ર માટેની ડિજિટલ લાઇબ્રેરીઓ પરની 10મી આંતરરાષ્ટ્રીય પરિષદની કાર્યવાહી, પૃ. 49–57. ACM, 2023.

  8. 8

    FrontierCode પર, GPT-6 Astraને Codexમાં તેના ડેવલપર સંદેશના એક વિભાગ જેવા⁠(નવી વિન્ડોમાં ખૂલે છે) ડેવલપર સંદેશ સાથે ચલાવવામાં આવ્યું હતું: "વધુ પડતી ટેસ્ટ ફાઇલો બનાવવાનું ટાળો. ફક્ત ત્યારે જ નવી ટેસ્ટ ફાઇલ બનાવો જ્યારે રિપોઝિટરીની પ્રથાઓ દ્વારા તેની જરૂર હોય અથવા કોઈ હાલની ફાઇલ યોગ્ય સ્થાન ન હોય. અસંબંધિત ક્લીનઅપ અને બિનજરૂરી જટિલતા ટાળો. યોગ્ય હોય તેવી હાલની યુટિલિટીનો પુનઃઉપયોગ કરો. સંબંધિત રિપોઝિટરી સૂચનાઓ વાંચો અને નજીકના કોડ, ટેસ્ટ્સ, દસ્તાવેજીકરણ અને CIનું નિરીક્ષણ કરો. સ્થાપિત પરંપરાઓનું પાલન કરો. ધ્યેય સ્વચ્છ, મર્જ કરી શકાય એવો કોડ છે." પ્રોમ્પ્ટને મૂલ્યાંકન માટે ઑપ્ટિમાઇઝ કરવામાં આવ્યો નહોતો.

  9. 9

    પહેલો મુદ્દો એ વિશે છે કે સંખ્યારેખા પર તમે ગમે તેટલા આગળ જાઓ, અભાજ્ય સંખ્યાઓ એકબીજાની કેટલી નજીક આવી શકે છે. એક દાયકાથી વધુ સમય સુધી, સૌથી જાણીતું પરિણામ એ સ્થાપિત કરતું હતું કે અભાજ્ય સંખ્યાઓની અનંત સંખ્યામાં જોડીઓ એકબીજાથી વધુમાં વધુ 246ના અંતરે છે. જુલિયા સ્ટેડલમેને⁠(નવી વિન્ડોમાં ખૂલે છે) તાજેતરમાં તે સીમાને સુધારીને 240 કરી. Astraએ 186ની વધુ કડક મર્યાદા સ્થાપિત કરવામાં મદદ કરી, જે દર્શાવે છે કે અનંત સંખ્યામાં જોડીઓ આ વધુ નાનાં અંતરની અંદર જોવા મળે છે. ટૂંકા અભાજ્ય અંતરાલો: પ્રમાણ⁠(નવી વિન્ડોમાં ખૂલે છે) અને સહાયક સંશોધન⁠(નવી વિન્ડોમાં ખૂલે છે).

  10. 10

    બીજું અભાજ્ય સંખ્યાઓ વચ્ચેના અસામાન્ય રીતે મોટા અંતરો સાથે સંબંધિત છે. Astraએ આ અંતરોની એક સીમામાં રહેલા એક પદમાં સુધારો કર્યો, જે 80 કરતાં વધુ વર્ષોથી અપરિવર્તિત રહી હતી. અમે બંને પરિણામો માટે પુરાવાઓ, સંક્ષિપ્ત ચેન-ઓફ-થોટ અને ચકાસણી સામગ્રી શેર કરી રહ્યા છીએ. અભાજ્ય સંખ્યાઓ વચ્ચેના મોટા અંતરો: પુરાવો⁠(નવી વિન્ડોમાં ખૂલે છે) અને સહાયક સંશોધન⁠(નવી વિન્ડોમાં ખૂલે છે).

  11. 11

    અમે GPT‑5.4 ગ્રેડિંગ અને લંબાઈ-વ્યવસ્થિત, અનક્લિપ્ડ સ્કોરનો ઉપયોગ કરીને, ઇચ્છિત HealthBench Professional પ્રક્રિયાને અનુસરીને બધા Claude મોડલનું સ્વતંત્ર રીતે મૂલ્યાંકન કર્યું. Fable 5.1 માટે, અમે પ્રદાતાના અસ્વીકારો માટે Opus 5 ફૉલબૅકનો ઉપયોગ કર્યો.

  12. 12

    Claude Fable 5 અને 5.1નો LifeSciBench Gold v1, GeneBench Pro v13 અને MedChemBenchમાં સમાવેશ કરવામાં આવ્યો નથી કારણ કે તેઓ આ મૂલ્યાંકનોમાં મોટાભાગના પ્રશ્નોના જવાબ આપવાનો ઇનકાર કરે છે.

  13. 13

    ExploitGym પર, અમે Astra અને Solનું છ કલાકની સમય મર્યાદા વિના પરીક્ષણ કર્યું, જેથી તેમની સંપૂર્ણ સાઇબર ક્ષમતાઓનું વધુ સારી રીતે મૂલ્યાંકન કરી શકાય. તે પૂરતા ઝડપી છે કે તેની બહુ ઓછી અસર પડે છે.

  14. 14

    ExploitBench (જૂન–ઑગસ્ટ 2026)માં ઉચ્ચ-ગંભીરતાવાળી 20 V8 નબળાઈઓ છે જે 13 સ્થિર Chrome રિલીઝમાં ફેલાયેલી છે. બેન્ચમાર્ક એ પરીક્ષણ કરે છે કે એજન્ટો દરેક નિર્દિષ્ટ નબળાઈનું એક્સ્પ્લોઇટેશન કરીને V8 અને Linux માટેના સત્તાવાર Chrome રિલીઝમાં મનસ્વી કોડ અમલીકરણ હાંસલ કરી શકે છે કે નહીં. સમાવેલ કેટલીક નબળાઈઓ મૂલ્યાંકનની મર્યાદાઓ હેઠળ મનસ્વી કોડ અમલીકરણની મંજૂરી ન પણ આપી શકે, તેથી 100% સફળતા દર પ્રાપ્ત કરી શકાય તેવું ન પણ હોય. નોંધ: GPT-5.6 Solનો 5.5% સ્કોર બેન્ચમાર્કમાં 300-ટર્નની મર્યાદાનું પરિણામ છે, જે મહત્તમ વાપરતા વાસ્તવિક ગ્રાહકોને લાગુ પડતી મર્યાદા નથી. સમાન સેટિંગ્સ પર, મોડલે ઓછી મર્યાદાઓનો સામનો કરતી વખતે 11.5%નો સ્કોર હાંસલ કર્યો.

  15. 15
  16. 16

    જ્યારે અમે તૃતીય-પક્ષ મોડલ્સમાં પરીક્ષણ કરીએ છીએ, ત્યારે અમે વધુ સરળ સંશોધન સેટઅપનો ઉપયોગ કરીએ છીએ. Codexનું પ્રોડક્શન કન્ફિગરેશન વધુ જટિલ છે, જેના પરિણામે રૉ-મોડલની ભૂલના દર અલગ હોઈ શકે છે. પ્રદાતા-પક્ષના સુરક્ષા ઉપાયો અને કમ્પ્યુટર-ટૂલ અમલીકરણો હજુ પણ અલગ છે. વપરાશકર્તાઓ Codex માં પુષ્ટિ વિનાના દૃશ્યનો અનુભવ કરતા નથી, કારણ કે તે આંતરિક સંશોધન કન્ફિગરેશન છે.

  17. 17

    ScreenSpot-Pro અને ExploitGym માટે, અમે જે Fable સ્કોરની જાણ કરીએ છીએ તે Mythosમાંથી આવે છે, જે ઓછી સુરક્ષા-વ્યવસ્થાઓ સાથેનું Fable છે.