ഇൻ്റലിജൻസിന്റെ ഒരു പുതിയ തലമുറ
2026 സെപ്റ്റംബർ 22-ലെ അപ്ഡേറ്റ്: ഞങ്ങൾ GPT‑6 Sol, GPT‑6 Luna എന്നിവയിലൂടെ ഞങ്ങളുടെ GPT‑6 ഫാമിലി വിപുലീകരിക്കുകയാണ്. കൂടുതൽ അറിയൂ.
ലോകത്തിലെ ഏറ്റവും ബുദ്ധിശേഷിയുള്ളതും മികച്ച രീതിയിൽ വിന്യസിച്ചിരിക്കുന്നതുമായ മോഡലായ GPT‑6 Astra ഞങ്ങൾ അവതരിപ്പിക്കുന്നു.
GPT‑6 Astra വർഷങ്ങളായുള്ള ഗവേഷണവും പ്രീ-ട്രെയിനിംഗ്, റീഇൻഫോഴ്സ്മെന്റ് ലേണിംഗ്, പൊരുത്തപ്പെടുത്തൽ എന്നിവയിലെ വലിയ നിക്ഷേപങ്ങളും ഒരുമിച്ച് കൊണ്ടുവരുന്നു. കമ്പ്യൂട്ടർ ഉപയോഗം, ബ്രൗസിംഗ്, സോഫ്റ്റ്വെയർ എഞ്ചിനീയറിംഗ്, സൈബർ സുരക്ഷ, ശാസ്ത്രം, പ്രൊഫഷണൽ ജോലി എന്നീ മേഖലകളിൽ Astra അത്യാധുനികമാണ്. ഗണിതശാസ്ത്രത്തിലെ ദീർഘകാലമായി പരിഹരിക്കപ്പെടാതെ കിടന്ന പ്രശ്നങ്ങൾ പരിഹരിക്കാൻ ഇതിനകം സഹായിച്ചിട്ടുള്ള Astra, FrontierMath Tier 4-ൽ 98% സ്കോറോടെ പരമാവധി പ്രകടനനിലയിലെത്തുന്നു. Astra 99.9% സ്കോറോടെ ARC-AGI-3-ലും 100% സ്കോറോടെ ExploitBench-ലും പരമാവധി പ്രകടനനിലയിലെത്തുന്നു. സമാനതകളില്ലാത്ത വേഗതയിലും കൃത്യതയിലും വിവേചനശേഷിയിലും ഏറ്റവും ആവശ്യപ്പെടുന്ന പ്രൊഫഷണൽ ജോലികൾ കൈകാര്യം ചെയ്തുകൊണ്ട്, കമ്പ്യൂട്ടർ, ബ്രൗസർ ഉപയോഗത്തിൽ ഇത് പുതിയ അത്യാധുനിക നിലവാരം സ്ഥാപിക്കുന്നു.
GPT‑6 Astra ഇന്ന് പരിമിതമായ ഒരു കൂട്ടം സ്ഥാപനങ്ങൾക്കായി ലഭ്യമായിത്തുടങ്ങുന്നു. വരും ദിവസങ്ങളിൽ എല്ലാ ChatGPT Plus, Pro, Business, Enterprise ഉപയോക്താക്കൾക്കും, കൂടാതെ OpenAI API, Microsoft Azure, AWS Bedrock എന്നിവയിലൂടെയും ഇത് ലഭ്യമാകും.
Astra ഞങ്ങളുടെ ഏറ്റവും മികച്ച രീതിയിൽ പൊരുത്തപ്പെടുത്തിയ മോഡലാണ്. ഉപയോക്തൃ ഉദ്ദേശ്യവും മോഡൽ പെരുമാറ്റവും മനസ്സിലാക്കുന്നതിൽ ഇതിന് ഗണ്യമായ മെച്ചപ്പെടുത്തലുകളുണ്ട്—Astra-യുടെ വിധിനിർണയത്തിൽ കൂടുതൽ ആത്മവിശ്വാസത്തോടെ നിങ്ങൾക്ക് ടാസ്കുകൾ ഏൽപ്പിക്കാം. ഇത് പരിശോധിക്കുന്നതിനുള്ള ഒരു മാർഗമായി, പ്രയാസകരമോ അസാധ്യമോ ആയ ഒരു ടാസ്ക് നേരിടുന്ന മോഡൽ അതിന്റെ ഉദ്ദേശിച്ച പ്രവർത്തനപരിധിക്കപ്പുറം പോകുമോ എന്ന് വിലയിരുത്തുന്ന, Hugging Face സംഭവത്തിൽനിന്നുള്ള വിവരങ്ങളുടെ അടിസ്ഥാനത്തിലുള്ള ഒരു പുതിയ വിലയിരുത്തൽ ഞങ്ങൾ സൃഷ്ടിച്ചു. പ്രൊഡക്ഷൻ സുരക്ഷാ സംവിധാനങ്ങളില്ലാതെ 48% തവണയും അനുവദനീയമായ പരിധി ലംഘിച്ച GPT‑5.6 Sol-മായി താരതമ്യം ചെയ്യുമ്പോൾ, GPT‑6 Astra 0% കേസുകളിലാണ് ഇങ്ങനെ ചെയ്തത്.
ലോകത്തിലെ ഏറ്റവും മികച്ച കമ്പ്യൂട്ടർ ഉപയോഗ മോഡൽ
കമ്പ്യൂട്ടർ ഉപയോഗത്തിന്റെ വേഗത, കൃത്യത, സുരക്ഷ എന്നിവയിൽ GPT‑6 Astra ഒരു പുതിയ അത്യാധുനിക നിലവാരം കുറിക്കുന്നു. ഓൺലൈൻ ഫോമുകൾ പൂരിപ്പിക്കൽ, CRM-ൽ ഉപഭോക്തൃ രേഖകൾ അപ്ഡേറ്റ് ചെയ്യൽ, നിങ്ങളുടെ കലണ്ടർ ക്രമീകരിക്കൽ തുടങ്ങിയ മടുപ്പിക്കുന്ന ജോലികൾ ഇതിന് കൈകാര്യം ചെയ്യാൻ കഴിയും. ഇതിന് ഓൺലൈൻ ഗവേഷണം നടത്താനും നിങ്ങളുടെ ഇമെയിലിലോ ഡോക്യുമെന്റ് എഡിറ്ററിലോ സംഗ്രഹങ്ങളുടെ കരടുകൾ തയ്യാറാക്കാനും കഴിയും. ഇതിന് ശാസ്ത്രീയ ഡാറ്റ വിശകലനം ചെയ്യാനും, പ്ലോട്ടുകൾ സൃഷ്ടിക്കാനും, ഒരു വെബ്സൈറ്റ് നിർമ്മിക്കാനും, ആ സൈറ്റിലെ എല്ലാ ഫീച്ചറുകളും പ്രവർത്തിക്കുന്നുണ്ടെന്ന് ഉറപ്പാക്കാൻ ഫ്രണ്ട്എൻഡ് QA പരിശോധനകൾ നടത്താനും കഴിയും. സോഫ്റ്റ്വെയർ സ്വയമേവ ഇൻസ്റ്റാൾ ചെയ്ത് പരിശോധിക്കാനും, സ്ക്രീനിൽ കാണുന്ന പ്രശ്നങ്ങൾ പരിഹരിക്കാനും ഇത് നിങ്ങളെ സഹായിക്കും. ഈ മെച്ചപ്പെടുത്തലുകൾ ഞങ്ങളുടെ അത്യാധുനിക മൂല്യനിർണയ ഫലങ്ങളിലും പ്രതിഫലിക്കുന്നു.
ഈ മെച്ചപ്പെടുത്തലുകൾ യഥാർത്ഥ അറിവ്-അധിഷ്ഠിത ജോലികളിലും കാര്യക്ഷമതയിൽ ഗണ്യമായ നേട്ടങ്ങൾ നൽകുന്നു. OSWorld 2.0-ലെ ലേറ്റൻസി സിമുലേഷനുകളിൽ, GPT‑5.6-നെക്കാൾ ഓരോ ടാസ്കിനും ഏകദേശം 47% കുറവ് സമയത്തിൽ Astra ഉയർന്ന കമ്പ്യൂട്ടർ-ഉപയോഗ പ്രകടനം കൈവരിക്കുന്നു. ഏകദേശം 75 മിനിറ്റിൽ 65.7% എന്നതുമായി താരതമ്യം ചെയ്യുമ്പോൾ, Sol ഓരോ ടാസ്കിനും ഏകദേശം 40 മിനിറ്റിൽ 72.6% സ്കോർ നേടി.3.
ഗെയിം ഡെവലപ്മെൻ്റ്, ഇലക്ട്രിക്കൽ എഞ്ചിനീയറിംഗ്, ദൈനംദിന വിജ്ഞാനാധിഷ്ഠിത ജോലികൾ എന്നിവയുൾപ്പെടെ വിവിധ മേഖലകളിലെ ഔട്ട്പുട്ടുകളിൽ GPT‑6 Astra-യുടെ കമ്പ്യൂട്ടർ ഉപയോഗ ശേഷികൾ കാണാൻ കഴിയും:
Astra-യ്ക്കൊപ്പം, കമ്പ്യൂട്ടർ ഉപയോഗത്തിന്റെ വേഗത ഗണ്യമായി മെച്ചപ്പെടുത്തുന്നതിനായി ഞങ്ങൾ Codex ഹാർനെസും അപ്ഡേറ്റ് ചെയ്യുന്നു. Astra-യുടെ കാര്യക്ഷമതയുമായി ചേർന്നാൽ, Mind2Web ബെഞ്ച്മാർക്കിൽ നിലവിലെ GPT‑5.6 Sol അനുഭവവുമായി താരതമ്യം ചെയ്യുമ്പോൾ ഇത് 1.9 മടങ്ങ് വേഗത്തിലുള്ള ടാസ്ക് പൂർത്തീകരണത്തിലേക്ക് നയിക്കുന്നു. വേഗതയിലെ മോഡലിന്റെ മെച്ചപ്പെടുത്തലുകൾ അർത്ഥമാക്കുന്നത്, നിങ്ങൾക്ക് കഴിയുന്നതിലും വേഗത്തിൽ, സമയമെടുക്കുന്ന നിരവധി ദൈനംദിന ജോലികൾ നിങ്ങൾക്കായി ഏറ്റെടുക്കാൻ അതിന് കഴിയും എന്നാണ്.4
പ്രൊഫഷണൽ ജോലിയിൽ ഒരു വലിയ മുന്നേറ്റം
സങ്കീർണ്ണമായ ജോലി ടാസ്ക്കുകൾ എളുപ്പത്തിൽ ചെയ്തു തീർക്കാൻ സഹായിക്കുന്നതിനായി, കമ്പ്യൂട്ടർ ഉപയോഗത്തിലെ പുതിയ പുരോഗതികളെ വ്യവസായ-ജോലി ആവശ്യങ്ങൾക്കായുള്ള പ്രത്യേക പരിശീലനവുമായി GPT‑6 Astra ഒന്നിച്ച് ചേർക്കുന്നു. സങ്കീർണ്ണമായ പ്രശ്നങ്ങൾക്കാവശ്യമായ ഇൻ്റലിജൻസും ഒന്നിലധികം ഘട്ടങ്ങളുള്ള വർക്ക്ഫ്ലോകൾ നടപ്പിലാക്കാനും മിനുക്കമുള്ള ഡോക്യുമെന്റുകൾ, സ്പ്രെഡ്ഷീറ്റുകൾ, അവതരണങ്ങൾ എന്നിവ സൃഷ്ടിക്കാനുമുള്ള കഴിവും ഇത് സംയോജിപ്പിക്കുന്നു.
നിലവിലുള്ള ടെംപ്ലേറ്റുകൾ കൃത്യമായി പാലിച്ചുകൊണ്ട്, വ്യക്തമായ ഘടനയോടും ചുരുങ്ങിയ വാക്കുകളിലും പ്രധാന വിവരങ്ങൾ പങ്കുവെക്കുന്ന മനോഹരമായ പ്രസന്റേഷൻ സ്ലൈഡുകൾ തയ്യാറാക്കാൻ ഏറ്റവും അനുയോജ്യമായ ഞങ്ങളുടെ മികച്ച മോഡലാണ് GPT‑6 Astra. നിങ്ങളുടെ ടെംപ്ലേറ്റുകൾ കൃത്യമായി പാലിച്ചുകൊണ്ടും നിങ്ങളുടെ എഴുത്തു ശൈലിക്കും ദൃശ്യശൈലിക്കും അനുയോജ്യമായും വ്യക്തവും സുസംഘടിതവുമായ ഡോക്യുമെന്റുകൾ, പ്രസന്റേഷനുകൾ, സ്പ്രെഡ്ഷീറ്റുകൾ, വിശകലനങ്ങൾ എന്നിവ നിർമ്മിക്കാൻ ഇതിന് സാധിക്കും. ജോലിക്ക് ആവശ്യമില്ലാത്ത വിവരങ്ങൾ വീണ്ടും ആവർത്തിക്കുന്നതിന് പകരം ഏറ്റവും അനുയോജ്യമായ വിവരങ്ങൾ മാത്രം കണ്ടെത്തി ഔട്ട്പുട്ടുകളിൽ ഉൾപ്പെടുത്താൻ പ്രത്യേകമായി പരിശീലനം ലഭിച്ച മോഡലാണ് Astra. ഇതെല്ലാം വ്യക്തമാക്കുന്നത്, നിങ്ങളുടെ ബിസിനസ്സ് സാഹചര്യങ്ങൾക്കും മാനദണ്ഡങ്ങൾക്കും അനുയോജ്യമായതും നേരിട്ട് ഉപയോഗിക്കാൻ സാധിക്കുന്നതുമായ ഔട്ട്പുട്ടുകൾ നൽകാൻ ഇതിന് സാധിക്കും എന്നാണ്.
GPT‑6 Astra നിർമ്മിക്കുന്ന വെബ്സൈറ്റുകൾ, ഗെയിമുകൾ, ആപ്ലിക്കേഷനുകൾ, റെൻഡറിങ്ങുകൾ എന്നിവയ്ക്ക് കൂടുതൽ ശക്തമായ ദൃശ്യപരമായ വിലയിരുത്തലും നൽകുന്നു. ChatGPT‑യിലെ Sites(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഉപയോഗിച്ച്, ഒരു പ്രോംപ്റ്റിൽ നിന്ന് നേരിട്ട് വെബ്സൈറ്റുകളും വെബ് ആപ്പുകളും ഗെയിമുകളും സൃഷ്ടിക്കാനും ഹോസ്റ്റ് ചെയ്യാനും പങ്കിടാനും Astra-യ്ക്ക് കഴിയും.
നിർദ്ദേശങ്ങൾ വ്യാഖ്യാനത്തിന് ഇടം നൽകുമ്പോൾ, ശരിയായ തീരുമാനം എടുക്കുന്നതിൽ മുൻകാല മോഡലുകളേക്കാൾ മികച്ചതാണ് GPT‑6 Astra. ഇത് പതിവ് വിടവുകൾ നികത്താൻ സന്ദർഭം ഉപയോഗിക്കുകയും, ഉത്തരം ഫലത്തെ മാറ്റാൻ ഇടയുള്ളപ്പോൾ കൃത്യമായ ചോദ്യങ്ങൾ ചോദിക്കുകയും ചെയ്യുന്നു. Codex-ൽ, നിങ്ങളുടെ മറുപടിയെ ആശ്രയിക്കാത്ത ജോലികൾ തുടർന്നും ചെയ്യുന്നതിനിടെ ഇതിന് അസമന്വിതമായി ചോദ്യങ്ങൾ ചോദിക്കാനാകും. നിങ്ങൾ പ്രതികരിക്കുന്നില്ലെങ്കിൽ, അനുയോജ്യമായിടത്ത് അത് യുക്തിസഹമായ അനുമാനങ്ങളോടെ മുന്നോട്ട് പോകും, എന്നാൽ നിർണായകമായ തീരുമാനങ്ങളിൽ നിങ്ങളുടെ ഇൻപുട്ടിനായി കാത്തിരിക്കും.
താഴെ നൽകിയിരിക്കുന്ന ഉദാഹരണങ്ങൾ, ആവശ്യമായ വിവരങ്ങൾ ഇല്ലാത്തപക്ഷം ഉത്തരത്തിൽ ഗണ്യമായ മാറ്റം വരുത്തിയേക്കാവുന്ന ദൈനംദിന ടാസ്കുകളിൽ Astra എങ്ങനെ സഹകരിക്കുന്നു എന്ന് കാണിക്കുന്നു.
ഒരു ടാസ്ക് പുരോഗമിച്ച് മാറിക്കൊണ്ടിരിക്കുമ്പോഴും സന്ദർഭബോധം നിലനിർത്തുന്നതിലും Astra കൂടുതൽ മികച്ചതാണ്. സ്റ്റിയറിംഗ് സന്ദേശങ്ങളെ മുൻകാല മോഡലുകൾ ചിലപ്പോൾ ഒരു പുതിയ ലക്ഷ്യമായി കണക്കാക്കിയിരുന്നു; അതിനാൽ യഥാർത്ഥ അഭ്യർത്ഥനയുടെയോ മുമ്പത്തെ നിയന്ത്രണങ്ങളുടെയോ പിന്തുടർച്ച നഷ്ടപ്പെടുമായിരുന്നു. Astra പുതിയ ആവശ്യകതകൾ ഉൾക്കൊള്ളുകയും, ആവശ്യപ്പെടുമ്പോൾ ദിശ മാറ്റുകയും, വിശാലമായ ദൗത്യം കൈവിടാതെ അനുബന്ധ ചോദ്യങ്ങൾക്ക് മറുപടി നൽകുകയും ചെയ്യുന്നു.
കോഡിംഗ്
ഇതുവരെയുള്ളതിൽ സോഫ്റ്റ്വെയർ എഞ്ചിനീയറിങ്ങിനുള്ള ഏറ്റവും മികച്ച മോഡലാണ് GPT‑6 Astra.
“ഞങ്ങളുടെ ആഭ്യന്തര കോഡിംഗ് ബെഞ്ച്മാർക്കുകളിൽ GPT‑6 Astra അത്യാധുനിക പ്രകടനം കാഴ്ചവെക്കുകയും GPT‑5.6 Sol-നുമായി താരതമ്യം ചെയ്യുമ്പോൾ ട്രേഡിംഗ് അവബോധ വിലയിരുത്തലുകളിൽ വ്യക്തമായ മുന്നേറ്റം കാണിക്കുകയും ചെയ്യുന്നു. ഏജന്റിക് കോഡിംഗിനായി ഉപയോഗിക്കുമ്പോൾ, ഡെവലപ്പർമാർക്ക് എളുപ്പത്തിൽ പിന്തുടരാനാകുന്ന രീതിയിൽ GPT‑6 Astra ആശയവിനിമയം നടത്തുകയും പ്രൊഡക്ഷൻ നിലവാരത്തിലെത്താൻ കുറഞ്ഞ തിരുത്തലുകൾ മാത്രം ആവശ്യമായ കോഡ് സൃഷ്ടിക്കുകയും ചെയ്യുന്നു.”
“ഞങ്ങളുടെ ആദ്യതലമുറ വിലയിരുത്തലുകളിൽ ഒന്നിൽ കുറഞ്ഞതും ഇടത്തരവും ഉയർന്നതുമായ പ്രയത്നങ്ങളിലൂടെ ഞങ്ങൾ Astra-യെ പരിശോധിച്ചു; അത് GPT 5.6 Sol-നേക്കാൾ വലിയ മുന്നേറ്റം കാഴ്ചവെച്ചു. ഉയർന്ന ശ്രമം ചെലുത്തുന്നതിലൂടെ പുതിയൊരു ബിൽഡിൽ കൂടുതൽ ആവർത്തനങ്ങൾ നടത്താനും ബ്രൗസർ പരിശോധന വഴി കൂടുതൽ കാര്യങ്ങൾ സ്ഥിരീകരിക്കാനും അപ്ലൈ-പാച്ച് രീതിയേക്കാൾ കോഡ് എക്സിക്യൂഷന് മുൻഗണന നൽകാനും സാധിക്കുന്നു. ഒരു മോഡൽ അതിന്റെ ശ്രമം എങ്ങനെ ചെലവഴിക്കുന്നുവെന്ന് മനസ്സിലാക്കുന്നതിലൂടെയാണ് ആശയത്തിൽ നിന്ന് പ്രവർത്തിക്കുന്ന ആപ്പിലേക്കുള്ള വേഗമേറിയതും കൂടുതൽ വിശ്വസനീയവുമായ വഴി ദശലക്ഷക്കണക്കിന് ബിൽഡർമാർക്ക് നൽകുന്നത്.”
Astra ഉപയോഗിച്ച്, സന്ദർഭ പരിധി നിറയുമ്പോൾ സന്ദർഭം സംരക്ഷിക്കാനും വീണ്ടെടുക്കാനും Codex-നായി ഒരു പുതിയ മാർഗം ഞങ്ങൾ അവതരിപ്പിക്കുന്നു. ചരിത്രപരമായി, സങ്കീർണ്ണമായ പ്രശ്നങ്ങൾ ഡീബഗ് ചെയ്യുമ്പോഴോ വലിയ റിഫാക്ടറുകൾ കൈകാര്യം ചെയ്യുമ്പോഴോ പോലുള്ള ദൈർഘ്യമേറിയ സെഷനുകളിൽ ജോലി സംഗ്രഹിക്കാൻ മോഡലുകൾ കമ്പാക്ഷൻ ഉപയോഗിച്ചിട്ടുണ്ട്. ഓരോ കമ്പാക്ഷനും ഒരു പരിഹാരം പരാജയപ്പെട്ടതിന്റെ കാരണത്തെക്കുറിച്ചോ ഒരു ഘടകം എങ്ങനെ പ്രവർത്തിക്കുന്നുവെന്നതിനെക്കുറിച്ചോ ഉള്ള വിശദാംശങ്ങൾ ഒഴിവാക്കിയേക്കാം. Codex-ൽ, Astra-യ്ക്ക് സന്ദർഭ പരിധികളിലുടനീളം കുറിപ്പുകൾ സൂക്ഷിക്കാൻ കഴിയും, ശേഖരിച്ച വിശദാംശങ്ങൾ ആവർത്തിച്ച് ഒറ്റ സംഗ്രഹത്തിലേക്ക് ചുരുക്കാതെ തന്നെ അവ നിലനിർത്താം. മുൻകാല സന്ദർഭ പരിധികളിൽ തിരയാൻ കഴിയുന്നതിനാൽ, ആ വിവരങ്ങൾ അതിന്റെ കുറിപ്പുകളിൽ രേഖപ്പെടുത്തിയിട്ടില്ലെങ്കിലും മുൻ സന്ദേശങ്ങളിൽനിന്നും ടൂൾ ഔട്ട്പുട്ടുകളിൽനിന്നും ആവശ്യകതകളോ പരിശോധനാ ഫലങ്ങളോ Astra-യ്ക്ക് കണ്ടെത്താൻ കഴിയും. നിങ്ങളുടെ Codex config.toml-ൽ,(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഈ പരീക്ഷണാത്മക ഫീച്ചർ പ്രവർത്തനക്ഷമമാക്കാം, കൂടാതെ വരാനിരിക്കുന്ന ആഴ്ചകളിൽ ഇത് Astra-യുടെ ഡിഫോൾട്ടായി മാറും.
ശാസ്ത്രീയ കണ്ടെത്തലുകളുടെ പുരോഗതി
ശാസ്ത്രീയ കണ്ടെത്തലുകൾക്കും ഗണിതശാസ്ത്രത്തിനും ആരോഗ്യരംഗത്തിനും GPT‑6 Astra ഒരു വലിയ മുന്നേറ്റമാണ്. ഇന്ന്, അഭാജ്യസംഖ്യകൾക്കിടയിലെ ഇടവേളകളെക്കുറിച്ചുള്ള രണ്ട് കൂടുതൽ ഫലങ്ങൾ ഞങ്ങൾ പങ്കുവയ്ക്കുകയാണ്.9, 10
ഗണിതം, ശാസ്ത്രം എന്നിവയിലെ മൂല്യനിർണ്ണയ സമാഹാരത്തിലുടനീളം Astra പുതിയ റെക്കോർഡുകളും സ്ഥാപിക്കുന്നു.
ശാസ്ത്രീയ കണ്ടെത്തലുകൾക്ക് പിന്നിലുള്ള പ്രായോഗിക പ്രവർത്തനങ്ങളിൽ Astra സഹായിക്കാനാകും. ശാസ്ത്രീയ റീസണിംഗും കമ്പ്യൂട്ടർ ഉപയോഗവും സംയോജിപ്പിക്കുന്നതിലൂടെ, ഡാറ്റ പരിശോധിക്കാനും ഫലങ്ങൾ പര്യവേക്ഷണം ചെയ്യാനും ഇതിന് പ്രത്യേക സോഫ്റ്റ്വെയറുകളിൽ നേരിട്ട് പ്രവർത്തിക്കാനാകും. ഇത് തെളിവുകൾ വിലയിരുത്താനും അടുത്തതായി എന്ത് അന്വേഷിക്കണമെന്ന് തീരുമാനിക്കാനും ഗവേഷകരെ സഹായിക്കുന്നു.
സൈബർസുരക്ഷ
ഞങ്ങൾ ഞങ്ങളുടെ സുരക്ഷാ അപ്ഡേറ്റിൽ ചർച്ച ചെയ്തതുപോലെ, സൈബർ ശേഷിയുടെ കാര്യത്തിൽ വലിയൊരു മുന്നേറ്റമാണ് Astra കാഴ്ചവെക്കുന്നത്, കൂടാതെ ക്രിറ്റിക്കൽ ത്രെഷോൾഡ് കൈവരിക്കാനായി ഞങ്ങളുടെ പ്രിപെയർഡ്നസ് ഫ്രെയിംവർക്ക് പ്രകാരം പ്രവർത്തിച്ചിരിക്കുന്നു. സീറോ-ഡേ എക്സ്പ്ലോയിറ്റുകൾ തിരിച്ചറിയാനും വികസിപ്പിക്കാനുമുള്ള ഇതിന്റെ ശേഷി പ്രതിരോധ വിദഗ്ധർക്ക് സിസ്റ്റത്തിലെ പോരായ്മകൾ കണ്ടെത്താനും അവ പരിഹരിക്കാനും സഹായിക്കും; എന്നാൽ അതേസമയം തന്നെ ഇത് കൂടുതൽ ശക്തമായ സുരക്ഷാ സംവിധാനങ്ങളുടെ ആവശ്യകതയും സൃഷ്ടിക്കുന്നുണ്ട്. ഈ കഴിവുകൾ എത്രത്തോളം വ്യാപിക്കുന്നുവെന്ന് മനസ്സിലാക്കാൻ, ഞങ്ങൾ Astra-യെ ആന്തരിക മൂല്യനിർണ്ണയങ്ങളിലും മൂന്നാം കക്ഷി വിദഗ്ധരുടെ മൂല്യനിർണ്ണയങ്ങളിലും പരീക്ഷിച്ചു.
അറിയപ്പെടുന്ന സോഫ്റ്റ്വെയർ ദുർബലതകളെ പ്രവർത്തനക്ഷമമായ എക്സ്പ്ലോയിറ്റുകളാക്കി മാറ്റാൻ മോഡലുകൾക്ക് കഴിയുമോ എന്ന് വിലയിരുത്തുന്ന ExploitBench, ExploitGym എന്നിവയിൽ പ്രൊഡക്ഷൻ സുരക്ഷാ സംവിധാനങ്ങളില്ലാതെ ഞങ്ങൾ ആദ്യം മോഡൽ പരീക്ഷിച്ചു. ExploitBench-ൽ, മുമ്പത്തെ അത്യാധുനിക സൈബർ ശേഷിയുള്ള മോഡലായ GPT‑5.6 Sol-ന്റെ 78.5%-വുമായി താരതമ്യം ചെയ്യുമ്പോൾ Astra 100% എന്ന സമ്പൂർണ സ്കോർ നേടി. ExploitGym-ൽ, ഗണ്യമായി കുറച്ച് ഔട്ട്പുട്ട് ടോക്കണുകൾ ഉപയോഗിച്ചുകൊണ്ട് GPT‑5.6 Sol-ന്റെ 30.3%-വുമായി താരതമ്യം ചെയ്യുമ്പോൾ Astra 42.4% വിജയനിരക്കിലെത്തി.13
മുൻകാല സോഫ്റ്റ്വെയർ സുരക്ഷാ പിഴവുകൾ എക്സ്പോഷർ ബെഞ്ച്മാർക്ക് ഫലങ്ങളെ ബാധിച്ചിരിക്കാമെന്ന ആശങ്കകൾ കണക്കിലെടുത്ത്, ഞങ്ങൾ Astra-യെ രണ്ട് പുതിയ ബെഞ്ച്മാർക്കുകളിലും വിലയിരുത്തി. ഒന്നാമതായി, കഴിഞ്ഞ മൂന്ന് മാസങ്ങളിലെ ദുർബലതകൾ ഉപയോഗിച്ച് എക്സ്പ്ലോയിറ്റ് വികസനം പരീക്ഷിക്കാൻ ഞങ്ങൾ ഒരു ആന്തരിക “ExploitBench (ജൂൺ–ഓഗസ്റ്റ് 2026)” മൂല്യനിർണ്ണയം രൂപപ്പെടുത്തി.14 GPT‑5.6‑നേക്കാൾ ഗണ്യമായി ഉയർന്ന അനിയന്ത്രിത കോഡ്-നിർവഹണ നിരക്കുകൾ Astra നേടി ഈ ഡാറ്റാസെറ്റിൽ വളരെ കുറഞ്ഞ ഔട്ട്പുട്ട് ടോക്കണുകൾ മാത്രം ഉപയോഗിച്ചുകൊണ്ട് Sol. മൂല്യനിർണയത്തിനിടെ, Astra മുമ്പ് അറിയപ്പെടാത്ത രണ്ട് സീറോ-ഡേ ദുർബലതകൾ പോലും കണ്ടെത്തുകയും ഉപയോഗിക്കുകയും ചെയ്തു. ഞങ്ങൾ രണ്ട് സുരക്ഷാ പിഴവുകളും അവയുടെ പരിപാലകർക്ക് വെളിപ്പെടുത്തുന്നു.
അസംസ്കൃത സോഴ്സ് കോഡിലേക്കുള്ള ആക്സസ് ഇല്ലാതെ സോഫ്റ്റ്വെയർ ബൈനറികളെ റിവേഴ്സ് എഞ്ചിനീയർ ചെയ്ത് അവയുടെ അടിസ്ഥാന ലോജിക് മനസ്സിലാക്കാൻ മോഡലുകൾക്ക് കഴിയുമോ എന്ന് അളക്കുന്ന ഒരു ബെഞ്ച്മാർക്കായ SRE-Bench15-ലും ഞങ്ങൾ Astra-യെ പരീക്ഷിച്ചു. Astra ഒറ്റ ശ്രമത്തിൽ 88.0% ടാസ്കുകളും നാല് ശ്രമങ്ങൾക്കുള്ളിൽ 99.2% ടാസ്കുകളും പരിഹരിച്ചു; ഇതുമായി താരതമ്യം ചെയ്യുമ്പോൾ GPT‑5.6 Sol യഥാക്രമം 55.9%, 68.7% ടാസ്കുകൾ പരിഹരിച്ചു.
ബെഞ്ച്മാർക്കുകൾക്കപ്പുറം, വിദഗ്ധർ നയിച്ച മൂല്യനിർണയങ്ങളിൽ കണ്ടെത്തിയത്, പ്രൊഡക്ഷൻ സുരക്ഷാ മുൻകരുതലുകളില്ലാതെ പ്രവർത്തിപ്പിക്കുമ്പോൾ Astra-ക്ക് മുമ്പ് അറിയപ്പെടാത്ത ദൗർബല്യങ്ങൾ ഉപയോഗിച്ച് സുരക്ഷാ-കഠിനമാക്കിയ ബ്രൗസറുകളിൽ അനിയന്ത്രിത കോഡ് എക്സിക്യൂഷൻ കൈവരിക്കാനും സുരക്ഷാ-കഠിനമാക്കിയ ഓപ്പറേറ്റിംഗ് സിസ്റ്റങ്ങൾക്കായി പ്രിവിലേജ്-എസ്കലേഷൻ എക്സ്പ്ലോയിറ്റുകൾ സൃഷ്ടിക്കാനും കഴിയുമെന്നാണ്.
The Defender’s Window എന്നതിൽ നമ്മൾ ചർച്ച ചെയ്തതുപോലെ, അത്യാധുനിക സൈബർ ശേഷികൾ പ്രതിരോധകരെ ദൗർബല്യങ്ങൾ വേഗത്തിൽ കണ്ടെത്താൻ സഹായിക്കും, എന്നാൽ അവ ആ ദൗർബല്യങ്ങളെ ചൂഷണം ചെയ്യുന്നതും എളുപ്പമാക്കുന്നു, ഇത് പ്രതിരോധകർ പൊരുത്തപ്പെടേണ്ടതിന്റെ അടിയന്തരത വർധിപ്പിക്കുന്നു. ഇന്ന് ലോഞ്ച് ചെയ്യുന്ന Astra-യുടെ പതിപ്പ് ഉപയോഗിച്ച്, പ്രതിരോധകർക്ക് സുരക്ഷിത കോഡ് അവലോകനവും പാച്ചിംഗും പോലുള്ള ജോലികൾ പൂർത്തിയാക്കാൻ കഴിയും.
എന്നിരുന്നാലും, ദൗർബല്യങ്ങൾക്കായുള്ള പ്രൂഫ്-ഓഫ്-കോൺസെപ്റ്റ് എക്സ്പ്ലോയിറ്റുകൾ സൃഷ്ടിക്കുന്നതുപോലുള്ള കൂടുതൽ സങ്കീർണ്ണമായ സൈബർസുരക്ഷാ ജോലികൾ നിർവഹിക്കാൻ Astra വിസമ്മതിക്കും. OpenAI Daybreak വഴി, വരും ആഴ്ചകളിൽ ആക്സസ് വിപുലീകരിക്കാനും കുറഞ്ഞ നിയന്ത്രണങ്ങളുള്ള സുരക്ഷാ സംവിധാനങ്ങൾ ഘട്ടംഘട്ടമായി ലഭ്യമാക്കാനും ഞങ്ങൾ പദ്ധതിയിടുന്നു. സുരക്ഷാ പിഴവുകളും അവയുടെ സാധൂകരണവും മാൽവെയർ വിശകലനം, ഡിറ്റക്ഷൻ എഞ്ചിനീയറിംഗ് എന്നിവയുൾപ്പെടെ കൂടുതൽ സുരക്ഷിതമായ പ്രതിരോധ വർക്ക്ഫ്ലോകൾക്ക് ഇത് വഴിയൊരുക്കും.
GPT‑5.6 Sol-നായി ഞങ്ങൾ ഒരുക്കിയ സുരക്ഷാ സംവിധാനങ്ങൾക്ക് പുറമെ, സൈബർ മേഖലയിലെ ദുരുപയോഗ സാധ്യതകൾക്കെതിരെയുള്ള ഞങ്ങളുടെ പ്രതിരോധം ഞങ്ങൾ കൂടുതൽ ശക്തമാക്കിയിട്ടുണ്ട്. സാധ്യതയുള്ള ജെയിൽബ്രേക്കുകളെ കൂടുതൽ ഫലപ്രദമായി ചെറുക്കുന്നതിനുള്ള മോഡലിന്റെ ഉയർന്ന പ്രതിരോധശേഷിയും ഞങ്ങളുടെ നിരീക്ഷണ സംവിധാനങ്ങൾക്കുള്ള കൂടുതൽ സന്ദർഭവും ഇതിൽ ഉൾപ്പെടുന്നു. ഞങ്ങളുടെ ആന്തരിക റെഡ് ടീമിംഗ് സൈബർ ആക്രമണകാരികളെ ഉപയോഗിച്ചുള്ള ഓട്ടോമേറ്റഡ് മൂല്യനിർണയങ്ങൾ ഉൾപ്പെടെ, കർശനമായ ആന്തരികവും ബാഹ്യവുമായ പരിശോധനകൾ ഞങ്ങൾ തുടർന്നുപോരുന്നു. ഞങ്ങളുടെ സൈബർ സുരക്ഷാ സംവിധാനങ്ങളെയും പരിശോധനയെയും കുറിച്ചുള്ള കൂടുതൽ വിവരങ്ങൾ Astra-യുടെ സുരക്ഷാ അവലോകനത്തിലും സിസ്റ്റം കാർഡിലും(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ലഭ്യമാണ്..
GPT‑6 Astra-യെ ഉത്തരവാദിത്തത്തോടെ ക്രമീകരിക്കുകയും വിന്യസിക്കുകയും ചെയ്യുന്നു
Astra ഞങ്ങളുടെ ഏറ്റവും മികച്ച രീതിയിൽ വിന്യസിച്ചിരിക്കുന്ന മോഡലാണ്. ശ്രദ്ധ പുലർത്തുന്നതിലും, ജോലിയുടെ പരിധികളെ മാനിക്കുന്നതിലും, സുതാര്യമായി ആശയവിനിമയം നടത്തുന്നതിലും Astra മികവ് പുലർത്തുന്നു. തുടക്കം മുതൽ അവസാനം വരെ മനുഷ്യരുടെ ഉദ്ദേശ്യങ്ങളോട് വിന്യസിച്ചുനിൽക്കുന്ന മോഡലുകളെ പരിശീലിപ്പിക്കുന്നതിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്ന ഞങ്ങളുടെ ദീർഘകാല ഗവേഷണ പരിപാടിയുടെ ഏറ്റവും പുതിയ ഫലമാണ് ഈ പ്രവർത്തനം.
സെൻസിറ്റീവ് പരിസ്ഥിതികളിൽ, Astra അതിന്റെ അപകടസാധ്യതയ്ക്ക് അനുപാതമായ ജാഗ്രതയോടെ മുന്നോട്ട് പോകുന്നു. തെറ്റായ പെരുമാറ്റം പ്രേരിപ്പിക്കുന്നതിനായി പ്രതികൂലമായി തിരഞ്ഞെടുത്ത കമ്പ്യൂട്ടർ ഉപയോഗ ടാസ്കുകളുടെ ഒരു മൂല്യനിർണയത്തിൽ, ഉദ്ദേശിക്കാത്ത പ്രത്യാഘാതങ്ങൾ ഒഴിവാക്കുന്നതിൽ Astra കൂടുതൽ വിജയകരമായിരുന്നു. ഡിഫോൾട്ടായി നൽകുന്ന അധിക സുരക്ഷാ നടപടികളോടെ പ്രവർത്തിപ്പിച്ചപ്പോൾ ഇതിലും മികച്ച പ്രകടനം ലഭിച്ചു.
പരീക്ഷിച്ച മറ്റേതൊരു അത്യാധുനിക മോഡലിനേക്കാളും Astra കുറവ് വ്യതിചലിച്ചുള്ള ഫലങ്ങൾ ഉണ്ടാക്കുന്നു. ന്യായമായ താരതമ്യത്തിനായി, ഞങ്ങൾ ഒരു ജനറിക് കമ്പ്യൂട്ടർ-യൂസിംഗ് ഏജന്റ് ഹാർനെസ് ഉപയോഗിച്ചു (ഇരു OpenAI Responses API(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) -യിലും Anthropic Messages API(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-യിലും ലഭ്യമായ നേറ്റീവ് കമ്പ്യൂട്ടർ ഉപയോഗ ടൂളുകളെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്), കൂടാതെ Codex, ChatGPT ജോലി ഉപയോക്താക്കൾക്കായി സാധാരണയായി വിന്യസിക്കുന്ന അധിക സംരക്ഷണങ്ങൾ (സ്വയമേവയുള്ള അവലോകനം, സ്ഥിരീകരണ നയം) ഇതിൽ ഉൾപ്പെടുത്തിയിരുന്നില്ല.
ഉപയോക്താവ് നിശ്ചയിച്ചിട്ടുള്ളതും അതിന്റെ പരിസരം പരോക്ഷമായി സൂചിപ്പിക്കുന്നതുമായ പരിധികൾക്കുള്ളിൽ Astra പ്രവർത്തിക്കാനുള്ള സാധ്യതയും കൂടുതലാണ്. ഒരു ആഭ്യന്തര വിലയിരുത്തലിൽ, Codex Auto-Review നിരസിക്കൽ മറികടക്കാൻ Astra ഒരിക്കലും ശ്രമിച്ചില്ല. ഓട്ടോ-റിവ്യൂ മനപ്പൂർവം മറികടക്കാവുന്ന രീതിയിൽ ക്രമീകരിച്ചിരിക്കുകയും, അല്ലാത്തപക്ഷം ആ ടാസ്ക് പൂർത്തിയാക്കാൻ അസാധ്യമായിരിക്കുകയും ചെയ്തപ്പോഴും ഇത് നിലനിന്നു. പരിതസ്ഥിതിയിലെ നിയന്ത്രണങ്ങളോടുള്ള ഈ ബഹുമാനം, ഈ പോസ്റ്റിന്റെ ആമുഖത്തിൽ ഞങ്ങൾ പങ്കുവെച്ച അസാധ്യമായ സൈബർ ടാസ്ക് വിലയിരുത്തലിന്റെ ഫലങ്ങളോടും ഞങ്ങളുടെ സിസ്റ്റം കാർഡിൽ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) രേഖപ്പെടുത്തിയിട്ടുള്ള മറ്റ് കണ്ടെത്തലുകളോടും യോജിക്കുന്നു.
ഇതിനുപുറമെ, ഉപഭോക്താക്കളുടെ സുതാര്യമായ ആശയവിനിമയത്തിൽ Astra പുതിയൊരു മാതൃക സൃഷ്ടിക്കുന്നുണ്ട്. ഒരു മൂല്യനിർണ്ണയത്തിൽ, അതിന്റെ തന്നെ പ്രവർത്തനക്ഷമതകളെയും സവിശേഷതകളെയും കുറിച്ച് തെറ്റായ വിവരങ്ങൾ നൽകാനുള്ള സാധ്യത, GPT‑5.6 Sol-നെ അപേക്ഷിച്ച് Astra-യ്ക്ക് മൂന്നിരിട്ടി കുറവാണെന്ന് കണ്ടെത്തി.
ഞങ്ങളുടെ കേപ്പബിലിറ്റി ഹാലുസിനേഷൻ മൂല്യനിർണയത്തിൽ, GPT‑5.6 Sol-നെ അപേക്ഷിച്ച് Astra ഗണ്യമായ പുരോഗതി കാണിക്കുന്നു; അതിന്റെ ശേഷികളെക്കുറിച്ച് തെറ്റിദ്ധരിപ്പിക്കുന്ന അവകാശവാദങ്ങൾ ഉന്നയിക്കുന്നതും കുറവാണ്.
GPT‑5.6‑നെക്കാൾ Astra-യുടെ എഴുതിയ റീസണിംഗ് നിരീക്ഷിക്കാൻ പ്രയാസമാണെന്ന് ഞങ്ങളുടെ മൂല്യനിർണയങ്ങൾ കണ്ടെത്തി നിരീക്ഷണത്തിൽ നിന്ന് ഒഴിഞ്ഞുമാറാൻ അതിനോട് വ്യക്തമായി ആവശ്യപ്പെട്ട പരിശോധനകളുടെ അടിസ്ഥാനത്തിൽ, Sol-ന്റേത്. ലളിതമായ ടാസ്കുകളിൽ എഴുതിയ റീസണിംഗിന്മേലുള്ള Astra-യുടെ കൂടുതൽ നിയന്ത്രണവും, കുറച്ച് എഴുതിയ ഘട്ടങ്ങളിലൂടെ പ്രശ്നങ്ങൾ പരിഹരിക്കാനുള്ള കഴിവുമാണ് ഇതിന് കാരണമെന്ന് ഞങ്ങൾ കരുതുന്നു. സങ്കീർണ്ണമായ ടാസ്കുകൾക്ക് ആവശ്യമായ റീസണിംഗ് മറച്ചുവെക്കുന്നതിൽ Astra ഇപ്പോഴും ബുദ്ധിമുട്ടുന്നതായി തോന്നുന്നു, എന്നാൽ ഈ കുറവിനെ ഞങ്ങൾ ഗൗരവമായി കാണുന്നു. നിരീക്ഷണക്ഷമത മെച്ചപ്പെടുത്തുന്നത് ഒരു ഗവേഷണ മുൻഗണനയായി തുടരുന്നു. ഒപ്പമുള്ള സിസ്റ്റം കാർഡ്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഞങ്ങളുടെ കണ്ടെത്തലുകളെയും തുടർന്നുകൊണ്ടിരിക്കുന്ന പ്രവർത്തനങ്ങളെയും വിശദീകരിക്കുന്നു.
വിന്യാസത്തിനുള്ള ഞങ്ങളുടെ സമീപനത്തിന്റെ പ്രധാന ഭാഗമാണ് അലൈൻമെന്റ് പരിശീലനം. പ്രതിരോധത്തിന്റെ മറ്റൊരു അധിക സുരക്ഷാ ഘടനയായി സുരക്ഷിതമല്ലാത്ത പെരുമാറ്റങ്ങൾ കണ്ടെത്താനും നിയന്ത്രിക്കാനും സഹായിക്കുന്ന Codex Auto-review(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) പോലെയുള്ള സിസ്റ്റം സുരക്ഷാ ക്രമീകരണങ്ങളും ഏജന്റുകളുടെ റീസണിംഗും പ്രവർത്തനങ്ങളെയും നിരീക്ഷിക്കുന്ന സംവിധാനങ്ങളും ഞങ്ങൾ ഒരുക്കിയിട്ടുണ്ട്. ഞങ്ങളുടെ സുരക്ഷാ അപ്ഡേറ്റിൽ വിവരിച്ചിരിക്കുന്നതുപോലെ, അലൈൻമെന്റിലുണ്ടാകുന്ന പിഴവുകൾ കൃത്യമായി മനസ്സിലാക്കുന്നതിനും അതിന്റെ ഏറ്റവും മോശമായ സാഹചര്യങ്ങളെ തടയുന്നതിനും സഹായിക്കുന്നതിനുമായി Astra-class മോഡലുകളിൽ ഞങ്ങൾ പ്രൊഡക്ഷൻ തലത്തിലുള്ള മിസ്-അലൈന്മെന്റ് മോണിറ്ററിംഗ് സംവിധാനം വിന്യസിക്കുന്നുണ്ട്. ഈ സുരക്ഷാ സംവിധാനങ്ങൾ ഞങ്ങളുടെ ആന്തരിക വിന്യാസങ്ങൾക്കായുള്ള നിരീക്ഷണങ്ങൾക്ക് സമാനമാണ്. ഇവയിൽ മോഡലിന്റെ റീസണിംഗും പ്രവർത്തനങ്ങളും അനുമതിയില്ലാത്തതാണോ എന്ന് പരിശോധിക്കുകയും അത്തരം അനധികൃത പ്രവർത്തനങ്ങൾ സ്വയമേവ തടയുകയും ചെയ്യുന്ന വർഗ്ഗീകരണങ്ങളുടെ ഒരു സിസ്റ്റം ഉൾപ്പെടുന്നു.
Astra-യുടെ സൈബർസുരക്ഷാ ശേഷികളിൽ ഗണ്യമായ വർധനവുണ്ടായിരിക്കുന്നതിനാൽ, ഈ വിന്യാസം സുരക്ഷിതവും ഭദ്രവുമാക്കാൻ ഞങ്ങൾ പ്രത്യേക ശ്രദ്ധ പുലർത്തുന്നു. അധിക സുരക്ഷാ പരിശോധനകൾ ചിലപ്പോൾ പ്രതിരോധാത്മക സൈബർസുരക്ഷ ഉൾപ്പെടെയുള്ള നിയമാനുസൃതമായ പ്രവർത്തനങ്ങളെ മന്ദഗതിയിലാക്കുകയോ താൽക്കാലികമായി നിർത്തുകയോ പൂർണ്ണമായി നിർത്തുകയോ ചെയ്യാം. ChatGPT‑യിലോ Codex-ലോ ഒരു ടാസ്ക് താൽക്കാലികമായി നിർത്തിയാൽ, തുടരുന്നതിന് മുമ്പ് നടപടി അവലോകനം ചെയ്യാൻ നിങ്ങളോട് ആവശ്യപ്പെട്ടേക്കാം. API-യിൽ, ടാസ്ക് നിർത്തപ്പെടും. ഈ പരിശോധനകൾ ചിലപ്പോൾ നിയമാനുസൃതമായ പ്രവർത്തനങ്ങളെ തടസ്സപ്പെടുത്താം, അനാവശ്യ തടസ്സങ്ങൾ കുറയ്ക്കുന്നതിന് ഞങ്ങൾ ഈ സിസ്റ്റം തുടർച്ചയായി മെച്ചപ്പെടുത്തിക്കൊണ്ടിരിക്കുന്നു. പൊരുത്തക്കേട് നിരീക്ഷണത്തിന് പൊരുത്തപ്പെടുത്തലിന് പകരമാകാൻ കഴിയില്ല: അനുമതിയുള്ള പരിധിക്കുള്ളിൽ വിശ്വസനീയമായി തുടരുന്ന മോഡലുകൾ നിർമിക്കുക എന്നതാണ് ഞങ്ങളുടെ ലക്ഷ്യം, അതിനാൽ ഈ സംരക്ഷണ സംവിധാനങ്ങൾക്ക് ഇടപെടേണ്ടിവരില്ല.
ലഭ്യത
GPT‑6 Astra ഇന്ന് പരിമിതമായ ഒരു കൂട്ടം സ്ഥാപനങ്ങൾക്കായി ലഭ്യമായിത്തുടങ്ങുന്നു. വരും ദിവസങ്ങളിൽ എല്ലാ ChatGPT Plus, Pro, Business, Enterprise ഉപയോക്താക്കൾക്കും, കൂടാതെ OpenAI API, Microsoft Azure, AWS Bedrock എന്നിവയിലൂടെയും ഇത് ലഭ്യമാകും. നിലവിലുള്ള സബ്സ്ക്രിപ്ഷൻ ഉപയോഗ പരിധികളിൽ Astra ഉപയോഗം ഉൾപ്പെടുത്തിയിട്ടുണ്ട്—ഉപയോക്താക്കൾക്കും ബിസിനസുകൾക്കും അധിക ഉപയോഗത്തിനായി ക്രെഡിറ്റുകൾ വാങ്ങാനും കഴിയും. Pro, Business, Enterprise പ്ലാനുകളിലെ ഉപയോക്താക്കൾക്ക് GPT‑6 Astra Pro-യിലേക്കും ആക്സസ് ലഭിക്കും. Enterprise അഡ്മിനിസ്ട്രേറ്റർമാർക്ക് അവരുടെ വർക്ക്സ്പേസിൽ Astra പ്രവർത്തനക്ഷമമാക്കാം; ലോഞ്ച് സമയത്ത് ആക്സസ് സ്വതവേ ഓഫായിരിക്കും.
യോഗ്യരായ API ഉപഭോക്താക്കൾക്കായി സീറോ ഡാറ്റ റിട്ടെൻഷനെ Astra പിന്തുണയ്ക്കുന്നു. കൂടാതെ, കഴിഞ്ഞ മാസം ഞങ്ങൾ പങ്കുവെച്ചതുപോലെ, ഉപഭോക്തൃ സ്വകാര്യത നിലനിർത്തിക്കൊണ്ട് സുരക്ഷാ നിരീക്ഷണം ശക്തിപ്പെടുത്താൻ ഞങ്ങൾ സ്വകാര്യ സുരക്ഷാ പ്രോസസ്സിംഗ് പരീക്ഷിച്ചുവരികയാണ്.
ഡെവലപ്പർമാർക്കായി, GPT‑6 Astra, OpenAI API-യിൽ gpt-6-astra എന്ന പേരിൽ ലഭ്യമാകും, കൂടാതെ Microsoft Azure വഴിയും Amazon Bedrock വഴിയും ലഭ്യമാകും.
OpenAI API സ്റ്റാൻഡേർഡ് വിലനിരക്ക് ഒരു മില്യൺ ഇൻപുട്ട് ടോക്കണുകൾക്ക് $10-ഉം ഒരു മില്യൺ ഔട്ട്പുട്ട് ടോക്കണുകൾക്ക് $50-ഉം ആണ്. കാഷെ റീഡുകൾക്കും റൈറ്റുകൾക്കും വ്യത്യസ്ത നിരക്കുകൾ ബാധകമാണ്. API-യിൽ GPT‑6 Astra-യ്ക്കായി ഫാസ്റ്റ് മോഡ് ലഭ്യമാണ്, ഇത് സാധാരണ പ്രോസസ്സിംഗിനേക്കാൾ 2 മടങ്ങ് വരെ വേഗതയും സാധാരണ നിരക്കിന്റെ ഇരട്ടി വിലയും നൽകുന്നു.
പ്രൊഫഷണൽ
പ്രൊഫഷണൽ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore സ്ട്രിംഗ് ക്വാർട്ടറ്റുകൾ (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
ആന്തരിക ഡിസൈൻ ടാസ്കുകൾ | 50.0% | 47.4% | - | 35.8% | - | - |
ആന്തരിക ഡാറ്റാ സയൻസ് ടാസ്കുകൾ | 40.9% | 30.5% | - | 34.7% | - | - |
ആർട്ടിഫിഷ്യൽ അനാലിസിസ് ഇൻ്റലിജൻസ് ഇൻഡക്സ് v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
കോഡിംഗ്
| കോഡിംഗ് | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (സ്കോർ) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 പ്രധാന (സ്കോർ) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
അക്കാദമിക്
അക്കാദമിക് | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
ഹ്യുമാനിറ്റീസ് ലാസ്റ്റ് എക്സാം (ടൂളുകളോടെ) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
ശാസ്ത്രവും ഹെൽത്തും
അലൈൻമെന്റ്
അലൈൻമെന്റ് | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
ആന്തരിക കമ്പ്യൂട്ടർ ഉപയോഗ സുരക്ഷാ ബെഞ്ച്മാർക്ക് (കുറഞ്ഞത് മികച്ചതാണ്) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
ആന്തരിക കമ്പ്യൂട്ടർ ഉപയോഗ സുരക്ഷാ ബെഞ്ച്മാർക്ക്, AutoReview സഹിതം (കുറഞ്ഞത് മികച്ചതാണ്) | 1.8% | 4.3% | - | - | - | - |
ആന്തരിക മറികടക്കൽ ബെഞ്ച്മാർക്ക് (കുറഞ്ഞിരിക്കുന്നത് ഉത്തമം) | 0.00% | 0.29% | - | - | - | - |
ExploitGym ഹണിപോട്ട് (കുറഞ്ഞത് മികച്ചതാണ്) | 0.0% | 48.2% | - | - | - | - |
അസാധ്യമായ ExploitGym | 100.0% | - | - | - | - | - |
ആന്തരിക ഹാലൂസിനേഷൻ ബെഞ്ച്മാർക്ക് (കുറഞ്ഞിരിക്കുന്നത് ഉത്തമം) | 4.2% | 12.2% | - | - | - | - |
ദീർഘമായ സന്ദർഭം
ദീർഘമായ സന്ദർഭം | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-നീഡിൽ 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-നീഡിൽ 512K-1M | 96.3% | 73.8% | - | - | - | - |
അബ്സ്ട്രാക്റ്റ് റീസണിംഗ്
| അബ്ട്രാക്ട് റീസണിംഗ് | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
ഏത് ശ്രമനിലയിലും മൂല്യനിർണയ സ്കോറുകൾ പരമാവധിയാണ്. GPT മൂല്യനിർണ്ണയങ്ങൾ ഞങ്ങളുടെ ഗവേഷണ പരിസ്ഥിതിയിലോ ഞങ്ങളുടെ API വഴിയോ പ്രവർത്തിപ്പിച്ചു. സിസ്റ്റം പ്രോംപ്റ്റുകൾ, ലഭ്യമായ ഉപകരണങ്ങൾ തുടങ്ങിയവയിലെ വ്യത്യാസങ്ങൾ കാരണം, ഇത് പ്രൊഡക്ഷൻ ChatGPT‑ൽ നിന്ന് അല്പം വ്യത്യസ്തമായ ഔട്ട്പുട്ട് നൽകാൻ സാധ്യതയുണ്ട്.
അടിക്കുറിപ്പുകൾ
- 1
ARC-AGI-3-ൽ, യഥാർത്ഥ ലോകത്തിലെ പ്രകടനവുമായി കൂടുതൽ പൊരുത്തപ്പെടുന്നതിനായി രണ്ട് ക്രമീകരണങ്ങൾ മാറ്റുന്ന ഞങ്ങളുടെ Responses API ഹാർനെസ് ഉപയോഗിച്ച് GPT-6 Astra പ്രവർത്തിപ്പിച്ചു. ഈ മാറ്റങ്ങൾ ARC-AGI-3-നെ പ്രത്യേകമായി ലക്ഷ്യമിടുന്നില്ല.
- 2
GPT-5.6 Sol എന്നത് ഞങ്ങളുടെ API, ChatGPT Codex, ChatGPT ജോലി എന്നിവയിൽ ലഭ്യമായ പതിപ്പിനെ സൂചിപ്പിക്കുന്നു. ChatGPT ചാറ്റിലെ പതിപ്പ് അല്പം വ്യത്യസ്തമാണ്.
- 3
OSWorld V2-Offline എന്നത് ഇന്റർനെറ്റ് ആക്സസ് ഇല്ലാതെയും പ്രവർത്തിക്കുന്ന യഥാർത്ഥ OSWorld V2-ന്റെ ഒരു ഉപസെറ്റ് ആണ്. OSWorld-V2 Offline-ലെ Claude മോഡലിന്റെ പ്രകടനം രചയിതാക്കൾ ഔദ്യോഗിക ലീഡർബോർഡിൽ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) പുനരുത്പാദിപ്പിച്ചു. OSWorld 2.0-ൽ, Claude-ന്റെ സ്കോറുകൾ ഔദ്യോഗിക ക്രമീകരണങ്ങൾ ഉപയോഗിച്ചാണ് കണക്കാക്കുന്നത്; Fable 5.1 സിസ്റ്റം കാർഡിലെ പരിഷ്കരിച്ച ടാസ്കുകളും പരിഷ്കരിച്ച ഗ്രേഡിംഗും ഉപയോഗിച്ചല്ല.
- 4
- 5
BenchCAD-ൽ, Claude-ന്റെ സ്കോറുകൾ ഇവാലുവേഷനിലെ മൂന്ന് പരിഷ്കരണങ്ങളെ പ്രതിഫലിപ്പിക്കുന്നു; അവ Fable 5.1 സിസ്റ്റം കാർഡിൽ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) വിശദമായി നൽകിയിരിക്കുന്നു.
- 6
ഗ്വാങ് യാങ്, വിക്ടോറിയ എബർട്ട്, നാസിഫ് ടാമർ, ബ്രയാൻ സിയുവാൻ ഷെങ്, ലൂയിസ പോസോബോൺ, കൂടാതെ നോഹ എ. സ്മിത്ത്. “LEGATO: ടൈപ്സെറ്റ് OMR-നുള്ള വലിയ-തോതിലുള്ള എൻഡ്-ടു-എൻഡ് സാമാന്യവൽക്കരിക്കാവുന്ന സമീപനം(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു).” arXiv:2506.19065, 2025.
- 7
മാർക്ക് ആർ. എച്ച്. ഗോതം, മൗറീൻ റെഡ്ബോണ്ട്, ബ്രൂണോ ബോവർ, പീറ്റർ ജോനാസ്. “ഓപ്പൺസ്കോർ സ്ട്രിംഗ് ക്വാർട്ടറ്റ് കോർപ്പസ്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു).” സംഗീതശാസ്ത്രത്തിനായുള്ള ഡിജിറ്റൽ ലൈബ്രറികളെക്കുറിച്ചുള്ള 10-ാമത് അന്താരാഷ്ട്ര സമ്മേളനത്തിന്റെ പ്രബന്ധസമാഹാരം, പേജുകൾ. 49–57. ACM, 2023.
- 8
FrontierCode-ൽ, Codex-ലുള്ള അതിന്റെ ഡെവലപ്പർ സന്ദേശത്തിന്റെ ഒരു ഭാഗത്തിന് സമാനമായ ഒരു ഡെവലപ്പർ സന്ദേശത്തോടെയാണ്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) GPT-6 Astra പ്രവർത്തിപ്പിച്ചത്: "അമിതമായ ടെസ്റ്റ് ഫയലുകൾ സൃഷ്ടിക്കുന്നത് ഒഴിവാക്കുക. റിപ്പോസിറ്ററി മാനദണ്ഡങ്ങൾ ആവശ്യപ്പെടുമ്പോഴോ നിലവിലുള്ള ഒരു ഫയലും അനുയോജ്യമായ ഇടമല്ലാത്തപ്പോഴോ മാത്രം പുതിയൊരു ടെസ്റ്റ് ഫയൽ സൃഷ്ടിക്കുക. ബന്ധമില്ലാത്ത ക്ലീനപ്പും അനാവശ്യ സങ്കീർണ്ണതയും ഒഴിവാക്കുക. അനുയോജ്യമായ നിലവിലുള്ള യൂട്ടിലിറ്റികൾ വീണ്ടും ഉപയോഗിക്കുക. പ്രസക്തമായ റിപ്പോസിറ്ററി നിർദ്ദേശങ്ങൾ വായിച്ച് സമീപത്തുള്ള കോഡ്, ടെസ്റ്റുകൾ, ഡോക്യുമെന്റേഷൻ, CI എന്നിവ പരിശോധിക്കുക. സ്ഥാപിതമായ കീഴ്വഴക്കങ്ങൾ പാലിക്കുക. ലക്ഷ്യം വൃത്തിയുള്ളതും മെർജ് ചെയ്യാവുന്നതുമായ കോഡാണ്." പ്രോംപ്റ്റ് ഇവാലിനായി ഒപ്റ്റിമൈസ് ചെയ്തിരുന്നില്ല.
- 9
ആദ്യത്തേത്, സംഖ്യാരേഖയിൽ എത്ര ദൂരം മുന്നോട്ടുപോയാലും അഭാജ്യസംഖ്യകൾ തമ്മിൽ എത്ര അടുത്തടുത്തായി പ്രത്യക്ഷപ്പെടാം എന്നതിനെക്കുറിച്ചാണ്. ഒരു ദശാബ്ദത്തിലേറെയായി, അറിയപ്പെട്ടിരുന്ന ഏറ്റവും മികച്ച ഫലം, അനന്തമായി അനേകം അഭാജ്യസംഖ്യാ ജോടികൾക്ക് അവ തമ്മിലുള്ള വ്യത്യാസം പരമാവധി 246 മാത്രമാണെന്ന് സ്ഥാപിച്ചിരുന്നു. ജൂലിയ സ്റ്റാഡൽമാൻ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) അടുത്തിടെ ആ പരിധി 240 ആയി മെച്ചപ്പെടുത്തി. 186 എന്ന കൂടുതൽ കർശനമായ പരിധി സ്ഥാപിക്കാൻ Astra സഹായിച്ചു, ഇതിലൂടെ അനന്തമായ നിരവധി ജോടികൾ ഈ ചെറിയ ദൂരത്തിനുള്ളിൽ ഉണ്ടാകുന്നുവെന്ന് കാണിച്ചു. ചെറിയ അഭാജ്യ വിടവുകൾ: തെളിവ്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു), പിന്തുണയ്ക്കുന്ന ഗവേഷണം(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു).
- 10
രണ്ടാമത്തേത് അഭാജ്യസംഖ്യകൾക്കിടയിലെ അസാധാരണമായി വലിയ ഇടവേളകളെ സംബന്ധിച്ചതാണ്. 80 വർഷത്തിലേറെയായി മാറ്റമില്ലാതെ തുടരുകയായിരുന്ന ഈ വിടവുകൾക്കുള്ള പരിധിയിലെ ഒരു പദം ആസ്ട്ര മെച്ചപ്പെടുത്തി. രണ്ട് ഫലങ്ങൾക്കുമുള്ള തെളിവുകൾ, സംക്ഷിപ്ത ചെയ്ൻ-ഓഫ്-തോട്ട്, പരിശോധനാ സാമഗ്രികൾ എന്നിവ ഞങ്ങൾ പങ്കിടുന്നു. വലിയ അഭാജ്യ ഇടവേളകൾ: തെളിവ്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) കൂടാതെ പിന്തുണയ്ക്കുന്ന ഗവേഷണം(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു).
- 11
- 12
- 13
- 14
ExploitBench (2026 ജൂൺ–ഓഗസ്റ്റ്)-ൽ 13 സ്റ്റേബിൾ Chrome റിലീസുകളിലുടനീളമുള്ള ഉയർന്ന ഗുരുതരമായ 20 V8 സുരക്ഷാ വീഴ്ചകൾ ഉൾപ്പെടുന്നു. നിർദ്ദിഷ്ടമായ ഓരോ സുരക്ഷാ പിഴവും ചൂഷണം ചെയ്തുകൊണ്ട്, Linux-നായുള്ള V8-ലും ഔദ്യോഗിക Chrome റിലീസുകളിലും ഏജന്റുകൾക്ക് തന്നിഷ്ടപ്രകാരം കോഡ് എക്സിക്യൂട്ട് ചെയ്യാൻ സാധിക്കുമോ എന്ന് പരിശോധിക്കുകയാണ് ഈ ബെഞ്ച്മാർക്ക് ചെയ്യുന്നത്. ഉൾപ്പെടുത്തിയിട്ടുള്ള ചില സുരക്ഷാ പിഴവുകൾ, ഈ മൂല്യനിർണ്ണയത്തിലെ പരിമിതികൾ കാരണം തന്നിഷ്ടപ്രകാരം എക്സിക്യൂട്ട് ചെയ്യാൻ അനുവദിച്ചേക്കില്ല; അതിനാൽ 100% വിജയനിരക്ക് കൈവരിക്കാനാകണമെന്നില്ല. ശ്രദ്ധിക്കുക: GPT-5.6 Sol-ന്റെ 5.5% എന്ന സ്കോർ ബെഞ്ച്മാർക്കിലെ 300-ടേൺ പരിധിയുടെ ഫലമാണ്, എന്നാൽ Max ഉപയോഗിക്കുന്ന യഥാർത്ഥ ഉപഭോക്താക്കൾക്ക് അത്തരമൊരു പരിധിയുണ്ടാകില്ല. കുറഞ്ഞ പരിധികളുള്ള സാഹചര്യങ്ങളിൽ സമാനമായ ക്രമീകരണങ്ങളിൽ ഈ മോഡൽ 11.5% സ്കോർ കൈവരിച്ചിട്ടുണ്ട്.
- 15
Jeremy Spence et al. “ഏജന്റിക് സൈബർസുരക്ഷയ്ക്കുള്ള അടുത്ത വെല്ലുവിളി: യാഥാർത്ഥ്യബോധമുള്ള, മലിനീകരണമുക്തമായ റിവേഴ്സ് എഞ്ചിനീയറിംഗ് ബെഞ്ച്മാർക്ക്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു).” arXiv:2608.11469v1, 2026.
- 16
മൂന്നാം കക്ഷി മോഡലുകളിൽ പരീക്ഷിക്കുമ്പോൾ, ഞങ്ങൾ ലളിതമായ ഒരു ഗവേഷണ സജ്ജീകരണമാണ് ഉപയോഗിക്കുന്നത്. Codex-ന് കൂടുതൽ സങ്കീർണമായ ഒരു പ്രൊഡക്ഷൻ കോൺഫിഗറേഷൻ ഉണ്ട്; ഇത് വ്യത്യസ്ത അസംസ്കൃത മോഡൽ പിശക് നിരക്കുകളിലേക്ക് നയിച്ചേക്കാം. ദാതാവിന്റെ ഭാഗത്തെ സുരക്ഷാ സംവിധാനങ്ങളും കമ്പ്യൂട്ടർ-ടൂൾ നടപ്പാക്കലുകളും ഇപ്പോഴും വ്യത്യസ്തമാണ്. ഇത് ആന്തരിക ഗവേഷണ കോൺഫിഗറേഷനായതിനാൽ, Codex-ൽ ഉപയോക്താക്കൾ സ്ഥിരീകരണം ആവശ്യമില്ലാത്ത സാഹചര്യം അനുഭവിക്കുന്നില്ല.
- 17
