ഞങ്ങൾ GPT‑5.6 സീരീസിന്റെ ഒരു ലിമിറ്റഡ് പ്രിവ്യൂ ആരംഭിക്കുകയാണ്: ഞങ്ങളുടെ ഫ്ലാഗ്ഷിപ്പ് മോഡലായ Sol; ദൈനംദിന ജോലികൾക്കായുള്ള സന്തുലിതമായ മോഡലായ Terra; വേഗമേറിയതും താങ്ങാവുന്ന നിരക്കിലുള്ളതുമായ മോഡലായ Luna. 2 മടങ്ങ് കുറഞ്ഞ ചിലവിൽ ലഭ്യമാകുമ്പോൾ തന്നെ GPT‑5.5‑നോട് കിടപിടിക്കുന്ന പ്രകടനം Terra കാഴ്ചവെയ്ക്കുന്നു, കൂടാതെ ഞങ്ങളുടെ ഏറ്റവും കുറഞ്ഞ നിരക്കിൽ മികച്ച കഴിവുകൾ Luna നൽകുന്നു.
ഇതുവരെയുള്ള ഞങ്ങളുടെ ഏറ്റവും കരുത്തുറ്റ സേഫ്റ്റി സ്റ്റാക്കോടു കൂടിയാണ് GPT‑5.6 Sol പുറത്തിറങ്ങുന്നത്. ഉയർന്ന അപകടസാധ്യതയുള്ള പ്രവർത്തനങ്ങൾ, സെൻസിറ്റീവായ സൈബർ അഭ്യർത്ഥനകൾ, ആവർത്തിച്ചുള്ള ദുരുപയോഗം എന്നിവയ്ക്കെതിരെയുള്ള പരിരക്ഷകൾ ഞങ്ങൾ കൂടുതൽ ശക്തമാക്കിയിട്ടുണ്ട്. കൂടാതെ, പോരായ്മകൾ കണ്ടെത്തുന്നതിനും, ഞങ്ങളുടെ സിസ്റ്റം പ്രഷർ-ടെസ്റ്റ് ചെയ്യുന്നതിനും, യഥാർത്ഥ ലോകത്തിലെ ആക്രമണങ്ങൾക്കെതിരെ അതിനെ കരുത്തുറ്റതാക്കുന്നതിനുമായി ഒന്നിലധികം ആഴ്ചകൾ ഞങ്ങൾ ചിലവഴിച്ചു.
വിപുലമായ ആക്സസ് നൽകുന്നതിൽ ഞങ്ങൾ വിശ്വസിക്കുന്നു, കൂടാതെ വരും ആഴ്ചകളിൽ GPT‑5.6 Sol, Terra, Luna എന്നിവ പൊതുവായി ലഭ്യമാക്കാൻ ഞങ്ങൾ പദ്ധതിയിടുന്നു. യു.എസ്. ഗവൺമെന്റുമായുള്ള ഞങ്ങളുടെ നിരന്തരമായ ഇടപെടലുകളുടെ ഭാഗമായി, ഇന്നത്തെ ലോഞ്ചിന് മുന്നോടിയായി ഞങ്ങളുടെ പദ്ധതികളും മോഡലുകളുടെ കഴിവുകളും ഞങ്ങൾ അവർക്ക് പ്രിവ്യൂ ചെയ്തു നൽകിയിരുന്നു. കൂടുതൽ വ്യാപകമായി പുറത്തിറക്കുന്നതിന് മുമ്പ്, അവരുടെ അഭ്യർത്ഥനപ്രകാരം, പങ്കാളിത്തം ഗവൺമെന്റുമായി പങ്കുവെക്കപ്പെട്ടിട്ടുള്ള ഒരു ചെറിയ കൂട്ടം വിശ്വസ്ത പങ്കാളികൾക്കായി ഞങ്ങൾ ഒരു ലിമിറ്റഡ് പ്രിവ്യൂ ആരംഭിക്കുകയാണ്. ഈ പ്രിവ്യൂ കാലയളവിൽ, കൂടുതൽ വ്യാപകമായ ലഭ്യതയ്ക്കായി പ്രവർത്തിക്കുന്നതിനോടൊപ്പം തന്നെ, ഞങ്ങൾ ടെസ്റ്റിംഗ് തുടരുകയും പങ്കാളികളുമായി അടുത്ത് ഏകോപനം നടത്തുകയും ചെയ്യും.ഇത്തരത്തിലുള്ള ഗവൺമെന്റ് ആക്സസ് പ്രക്രിയ ഒരു ദീർഘകാല ഡിഫോൾട്ടായി മാറണമെന്ന് ഞങ്ങൾ വിശ്വസിക്കുന്നില്ല. ഇത് ആവശ്യമുള്ള ഉപയോക്താക്കൾ, ഡെവലപ്പർമാർ, സംരംഭങ്ങൾ, സൈബർ പ്രതിരോധകർ, ആഗോള പങ്കാളികൾ എന്നിവരിൽ നിന്ന് മികച്ച ടൂളുകളെ അകറ്റി നിർത്തുന്നു. ഭാവിയിലെ മോഡൽ റിലീസുകൾക്കായി ഒരു സൈബർ എക്സിക്യൂട്ടീവ് ഓർഡർ ഫ്രെയിംവർക്കും ആവർത്തിക്കാവുന്ന ഒരു പ്രക്രിയയും വികസിപ്പിക്കുന്നതിനായി ഞങ്ങൾ ഭരണകൂടവുമായി ചേർന്ന് പ്രവർത്തിക്കുമ്പോൾ തന്നെ, വരും ആഴ്ചകളിൽ കൂടുതൽ വ്യാപകമായ ലഭ്യത ഉറപ്പാക്കാനുള്ള ഏറ്റവും മികച്ച മാർഗ്ഗമാണിതെന്ന് വിശ്വസിക്കുന്നതിനാലാണ് ഞങ്ങൾ ഈ ഹ്രസ്വകാല നടപടി സ്വീകരിക്കുന്നത്.
GPT‑5.6 Sol ആണ് ഞങ്ങളുടെ ഇതുവരെയുള്ളതിൽ വെച്ച് ഏറ്റവും ശക്തമായ മോഡൽ. മോഡലിന്റെ പ്രകടനത്തിന്റെ ഒരു പ്രിവ്യൂ നൽകുന്നതിനായി, കോഡിംഗ്, ബയോളജി, സൈബർസെക്യൂരിറ്റി എന്നിവയിൽ മെച്ചപ്പെടുത്തിയ ഏജന്റിക് കഴിവുകൾ എടുത്തുകാണിക്കുന്ന ഒരു കൂട്ടം ഇവാല്യുവേഷനുകൾ ഞങ്ങൾ പങ്കുവെക്കുന്നു. ഇതിനുപുറമെ, കൂടുതൽ സുരക്ഷാ-തയ്യാറെടുപ്പ് ഇവാല്യുവേഷനുകൾ ഞങ്ങളുടെ സിസ്റ്റം കാർഡിൽ (പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)ലഭ്യമാണ്. മോഡൽ കൂടുതൽ വ്യാപകമായി ലഭ്യമാക്കുമ്പോൾ, ഇവാല്യുവേഷൻ ഫലങ്ങളുടെ കൂടുതൽ വിപുലമായ വിവരങ്ങൾ ഞങ്ങൾ പങ്കുവെക്കുന്നതാണ്.
GPT‑5.6‑ലൂടെ, കാര്യങ്ങൾ ആഴത്തിൽ മനസ്സിലാക്കാൻ Sol-ന് ഏറ്റവും കൂടുതൽ സമയം നൽകുന്നതിനായി പുതിയൊരു max റീസണിംഗ് എഫർട്ട് ഞങ്ങൾ അവതരിപ്പിക്കുകയാണ്. കൂടാതെ, സങ്കീർണ്ണമായ ജോലികൾ വേഗത്തിലാക്കുന്നതിനായി സബ്ഏജന്റുകളെ പ്രയോജനപ്പെടുത്തിക്കൊണ്ട്, ഒരു സിംഗിൾ ഏജന്റിന്റെ കഴിവുകൾക്കുമപ്പുറം പ്രവർത്തിക്കുന്ന പുതിയൊരു ultra മോഡും ഞങ്ങൾ അവതരിപ്പിക്കുന്നു.
കോഡിംഗ് വർക്ക്ഫ്ലോകൾക്കായി, erminal-Bench 2.1-ൽ TGPT‑5.6 Sol പുതിയൊരു സ്റ്റേറ്റ്-ഓഫ്-ദി-ആർട്ട് (state of the art) നിലവാരം സ്ഥാപിക്കുന്നു. പ്ലാനിംഗ്, ഐറ്ററേഷൻ, ടൂൾ കോർഡിനേഷൻ എന്നിവ ആവശ്യമായ കമാൻഡ്-ലൈൻ വർക്ക്ഫ്ലോകളെയാണ് ഇത് വിലയിരുത്തുന്നത്.
ജീവശാസ്ത്ര വർക്ക്ഫ്ലോകളിലും GPT‑5.6 Sol വ്യാപകമായ മെച്ചപ്പെടുത്തലുകൾ കാണിക്കുന്നു. ദീർഘകാല ജീനോമിക്സും ക്വാണ്ടിറ്റേറ്റീവ്-ബയോളജി വിശകലനങ്ങളും വിലയിരുത്തുന്ന GeneBench v1-ൽ, കുറച്ച് ടോക്കണുകൾ ഉപയോഗിച്ചുകൊണ്ട് ഇത് GPT‑5.5-നേക്കാൾ മികച്ച ഫലങ്ങൾ നേടാൻ ഇതിന് കഴിയുന്നു.
സൈബർ സുരക്ഷയ്ക്കായുള്ള ഞങ്ങളുടെ ഇതുവരെയുള്ള ഏറ്റവും മികച്ച മോഡലാണ് GPT‑5.6 Sol. വൾനറബിലിറ്റി റിസർച്ച്, എക്സ്പ്ലോയിറ്റേഷൻ എന്നിവയുൾപ്പെടെയുള്ള ദീർഘകാല സുരക്ഷാ ജോലികൾക്കുള്ള പ്രകടന-കാര്യക്ഷമതാ അതിരുകളെ ഇത് മാറ്റിമറിക്കുന്നു. ExploitBench²-ൽ, മൂന്നിലൊന്ന് ഔട്ട്പുട്ട് ടോക്കണുകൾ മാത്രം ഉപയോഗിച്ചുകൊണ്ട് Mythos Preview-വിനോട് കിടപിടിക്കുന്ന പ്രകടനം GPT‑5.6 Sol കാഴ്ചവെയ്ക്കുന്നു. OpenAI-യുമായും മറ്റ് ഫ്രോണ്ടിയർ ലാബുകളുമായും സഹകരിച്ച് യു.സി ബെർക്ക്ലി ഗവേഷകർ സൃഷ്ടിച്ച ഒരു ബെഞ്ച്മാർക്കായ ExploitGym(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)3-ൽ, ഞങ്ങൾ റീസണിംഗ് വർദ്ധിപ്പിക്കുമ്പോൾ GPT‑5.6 Sol, Terra, Luna മോഡലുകളെല്ലാം സൈബർ കഴിവുകളിൽ വലിയ മുന്നേറ്റം പ്രകടമാക്കുന്നുണ്ട്.
ഓരോ മോഡലിന്റെയും കഴിവുകൾക്കനുസരിച്ചുള്ള ക്രമീകരണങ്ങളോടെ, ഞങ്ങളുടെ ഇതുവരെയുള്ള ഏറ്റവും ശക്തമായ സുരക്ഷാ സംവിധാനങ്ങൾ ഉൾപ്പെടുത്തിയാണ് ഞങ്ങൾ GPT‑5.6 Sol, Terra, Luna എന്നിവ വികസിപ്പിച്ചിരിക്കുന്നത്. മോഡലിന്റെ കഴിവുകൾ വർദ്ധിക്കുന്നതിനനുസരിച്ച്, കോഡ് റിവ്യൂ, വൾനറബിലിറ്റി റിസർച്ച്, പാച്ച് ഡെവലപ്മെന്റ്, ഡീബഗ്ഗിംഗ്, സെക്യൂരിറ്റി എജ്യുക്കേഷൻ, ഡിഫൻസീവ് ടെസ്റ്റിംഗ് തുടങ്ങിയ നിയമാനുസൃതമായ ജോലികൾ സുഗമമായി ചെയ്യാൻ അനുവദിക്കുമ്പോൾ തന്നെ, യഥാർത്ഥ ലോകത്തിലെ പ്രതികൂല ഇടപെടലുകളെ ശക്തമായി പ്രതിരോധിക്കാൻ കഴിയുന്ന തരത്തിലാണ് ഞങ്ങൾ സുരക്ഷാ സംവിധാനങ്ങൾ രൂപകൽപ്പന ചെയ്യുന്നത്. ഇത്തരം പ്രയോജനകരമായ ഉപയോഗങ്ങളെ അനാവശ്യമായി പരിമിതപ്പെടുത്താതെ തന്നെ, നിരോധിതവും ആക്രമണാത്മകവുമായ പ്രവർത്തനങ്ങൾ കൂടുതൽ ബുദ്ധിമുട്ടുള്ളതും അനിശ്ചിതമായതും കണ്ടെത്താൻ കഴിയുന്നതുമാക്കി മാറ്റുക എന്നതാണ് ഞങ്ങളുടെ ലക്ഷ്യം. മോഡലിന്റെയും സുരക്ഷാ ക്രമീകരണങ്ങളുടെയും ഞങ്ങളുടെ വിലയിരുത്തലിന്റെ അടിസ്ഥാനത്തിൽ, നിരോധിതമായ ആക്രമണാത്മക ഉപയോഗങ്ങളെ ഗണ്യമായി നിയന്ത്രിക്കുമ്പോൾ തന്നെ, നിയമാനുസൃതമായ പ്രതിരോധ ജോലികൾക്ക് കാര്യമായ പ്രയോജനം ലഭിക്കുമെന്ന് ഞങ്ങൾ പ്രതീക്ഷിക്കുന്നു.
കൃത്യമായി എൻഡ്-ടു-എൻഡ് ആക്രമണങ്ങൾ നടത്തുന്നതിനേക്കാൾ, വൾനറബിലിറ്റികൾ കണ്ടെത്തുന്നതിനും പരിഹരിക്കുന്നതിനും ആളുകളെ സഹായിക്കുന്നതിലാണ് GPT‑5.6 Sol കൂടുതൽ മികച്ചത്. ഈ കഴിവുകൾ തുടർന്നും വികസിക്കുമ്പോൾ, പോരായ്മകൾ കണ്ടെത്താനും പാച്ചുകൾ വികസിപ്പിക്കാനും സിസ്റ്റങ്ങളെ കൂടുതൽ വ്യാപകമായി ശക്തമാക്കാനും ഈ ടൂളുകൾ ഉപയോഗിക്കാൻ കഴിയുന്ന ഡിഫൻഡർമാർക്ക് ഇവ ലഭ്യമാകുകയും പ്രയോജനം ലഭിക്കുകയും ചെയ്യുന്നുവെന്ന് ഉറപ്പാക്കുക എന്നതാണ് ഞങ്ങളുടെ മുൻഗണന.
ഞങ്ങളുടെ പ്രിപെയർഡ്നസ് ഫ്രെയിംവർക്ക് പ്രകാരമുള്ള സൈബർ ക്രിട്ടിക്കൽ പരിധി GPT‑5.6 Sol മറികടക്കുന്നില്ല. ക്രോമിയം, ഫയർഫോക്സ് എന്നിവ ഉൾപ്പെടുന്ന വിലയിരുത്തലുകളിൽ, ഒരു —എക്സ്പ്ലോയിറ്റിന്റെ അടിസ്ഥാന ഘടകങ്ങളായ— ബഗുകളും എക്സ്പ്ലോയിറ്റേഷൻ പ്രിമിറ്റീവുകളും കണ്ടെത്താൻ ഇതിനായെങ്കിലും, പരിശോധിച്ച സാഹചര്യങ്ങളിൽ സ്വന്തമായി പ്രവർത്തിക്കുന്ന ഒരു ഫുൾ-ചെയിൻ എക്സ്പ്ലോയിറ്റ് നിർമ്മിക്കാൻ ഇതിന് കഴിഞ്ഞില്ല. എന്നിരുന്നാലും, ഒരു മോഡൽ ഏതൊക്കെ രീതികളിൽ ഉപയോഗിക്കാമെന്നോ മറ്റ് ടൂളുകളുമായി എങ്ങനെ സംയോജിപ്പിക്കാമെന്നോ ഉള്ള എല്ലാ സാധ്യതകളും പൂർണ്ണമായി ഉൾക്കൊള്ളാൻ ബെഞ്ച്മാർക്ക് പരിധികൾക്ക് കഴിയില്ല. ആ അനിശ്ചിതത്വവും മോഡലിന്റെ കഴിവുകളിലുണ്ടായ വലിയ മാറ്റങ്ങളുമാണ്, വർദ്ധിച്ച കഴിവുകൾക്കൊപ്പം കൂടുതൽ ശക്തമായ സുരക്ഷാ സംവിധാനങ്ങളും ഘട്ടം ഘട്ടമായുള്ള റിലീസും ഉൾപ്പെടുത്താൻ ഞങ്ങളെ പ്രേരിപ്പിക്കുന്നത്. ഞങ്ങളുടെ സുരക്ഷാ സംവിധാനങ്ങളെക്കുറിച്ചുള്ള കൂടുതൽ വിവരങ്ങൾ GPT‑5.6 Preview സിസ്റ്റം കാർഡിൽ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഞങ്ങൾ പങ്കുവെക്കുന്നുണ്ട്.
സ്ഥിരനിശ്ചയത്തോടെയുള്ളതോ പുതിയ സാഹചര്യങ്ങൾക്കനുസരിച്ച് മാറുന്നതോ ആയ ദുരുപയോഗങ്ങൾക്കെതിരെ ഒരൊറ്റ സുരക്ഷാ സംവിധാനം മാത്രം മതിയാകില്ല. GPT‑5.6 പ്രിവ്യൂവിലുടനീളം, ഞങ്ങൾ പല തട്ടുകളിലുള്ള സുരക്ഷാ സംവിധാനങ്ങൾ ഉപയോഗിക്കുന്നു. മോഡലുകൾക്കനുസരിച്ച് കൃത്യമായ ക്രമീകരണങ്ങളിൽ വ്യത്യാസമുണ്ടാകാം. യഥാർത്ഥ ലോകത്തിലെ ആക്രമണങ്ങളെ നേരിടാൻ ഇവ പ്രാപ്തമാണോ എന്ന് പരിശോധിക്കുകയും ചെയ്യുന്നുണ്ട്. മോഡലിൽ ഉൾപ്പെടുത്തിയിട്ടുള്ള സുരക്ഷാ പരിശീലനങ്ങൾ, കാര്യങ്ങൾ തയ്യാറാക്കുന്ന സമയത്തുള്ള തത്സമയ പരിശോധനകൾ, അക്കൗണ്ട് അടിസ്ഥാനമാക്കിയുള്ള സിഗ്നലുകൾ, വ്യത്യസ്ത തലത്തിലുള്ള ആക്സസ്, നിരീക്ഷണം, നിയമങ്ങൾ നടപ്പിലാക്കൽ, തുടർന്നും നടത്തിക്കൊണ്ടിരിക്കുന്ന പരിശോധനകൾ എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു.
GPT‑5.6‑നെ നിരോധിത സൈബർ സഹായങ്ങൾ നൽകുന്നതിൽ നിന്ന് വിട്ടുനിൽക്കുന്നതിനായി പരിശീലിപ്പിച്ചിരിക്കുന്നു. ഉപയോക്താക്കൾ തങ്ങളുടെ ഉദ്ദേശം മറച്ചുവെക്കാനോ മോഡലിനെ ജയിൽബ്രേക്ക് ചെയ്യാൻ ശ്രമിക്കുന്ന സന്ദർഭങ്ങളിൽ ഉൾപ്പെടെ ഇത് ബാധകമാണ്. മോഡൽ എന്തിനെയൊക്കെ സഹായിക്കണം, എന്തിനെയൊക്കെ സഹായിക്കരുത് എന്ന കാര്യത്തിൽ ഈ മോഡൽ-തല സുരക്ഷാ സംവിധാനങ്ങൾ ഒരു പ്രാഥമിക അതിർവരമ്പ് സ്ഥാപിക്കുന്നു.
സൈബർ, ബയോളജി മേഖലകളിലെ ദുരുപയോഗങ്ങൾ തിരിച്ചറിയാനുള്ള തത്സമയ ക്ലാസിഫയറുകൾ ഔട്ട്പുട്ട് ഉൽപാദിപ്പിക്കപ്പെടുമ്പോൾ തന്നെ വിലയിരുത്തി മറ്റൊരു സുരക്ഷാ പാളി നൽകുന്നു. ഉയർന്ന അപകടസാധ്യതയുള്ള സന്ദർഭങ്ങളിൽ, ഒരു ലംഘനം നടന്നതായി സംശയിച്ചാൽ, സംഭാഷണത്തെയും അതിന്റെ സന്ദർഭത്തെയും ഒരു വലിയ റീസണിംഗ് മോഡൽ പരിശോധിക്കുന്നത് വരെ ജനറേഷൻ താൽക്കാലികമായി നിർത്തിവെച്ചേക്കാം. ഔട്ട്പുട്ട് അനുവദനീയമല്ലെന്ന് വിലയിരുത്തപ്പെട്ടാൽ, അത് ഉപയോക്താവിന്റെ അടുത്തെത്തുന്നതിന് മുമ്പ് തന്നെ തടഞ്ഞുവെക്കുന്നു.
ഫ്ലാഗ് ചെയ്യപ്പെട്ട പ്രവർത്തനങ്ങൾ, ഉള്ളടക്കം സൂക്ഷിക്കുന്നതിനെയും പരിശോധിക്കുന്നതിനെയും കുറിച്ചുള്ള ഞങ്ങളുടെ നിബന്ധനകൾക്കും നയങ്ങൾക്കും അനുസൃതമായി, ബന്ധപ്പെട്ട സംഭാഷണങ്ങളിലും റിസ്ക് സിഗ്നലുകളിലും അക്കൗണ്ട്-തല പരിശോധനയ്ക്ക് കാരണമായേക്കാം. ഒരു സംഭാഷണത്തിന് അപ്പുറത്തേക്ക് പരിശോധിക്കുന്നത്, സമാനമായ സാങ്കേതിക ആശയങ്ങൾ വളരെ വ്യത്യസ്തമായ സന്ദർഭങ്ങളിൽ പ്രത്യക്ഷപ്പെടുന്ന ഇടങ്ങളിൽ, നിരന്തരമായ ദുരുദ്ദേശ്യപരമായ പെരുമാറ്റത്തെയും നിയമാനുസൃതമായ ഡ്യുവൽ-യൂസ് സെക്യൂരിറ്റി ജോലികളെയും തമ്മിൽ വേർതിരിച്ചറിയാൻ ഞങ്ങളുടെ സിസ്റ്റങ്ങളെ സഹായിക്കുന്നു.
ഒന്നിച്ച് ചേരുമ്പോൾ, ഈ സുരക്ഷാ പാളികൾ മൊത്തത്തിലുള്ള സമീപനത്തെ ഏതെങ്കിലും ഒരു സുരക്ഷാ സംവിധാനത്തേക്കാൾ കൂടുതൽ കരുത്തുറ്റതാക്കുന്നു. മോഡലിന്റെ പെരുമാറ്റം ദോഷകരമായ പ്രതികരണങ്ങൾ ഉണ്ടാകാനുള്ള സാധ്യത കുറയ്ക്കുന്നു, കാര്യങ്ങൾ ഉൽപ്പാദിപ്പിക്കുമ്പോൾ തന്നെ തത്സമയ സിസ്റ്റങ്ങൾക്ക് ഇടപെടാൻ സാധിക്കുന്നു, അക്കൗണ്ട്-തല പരിശോധനയിലൂടെ വിശാലമായ പാറ്റേണുകൾ തിരിച്ചറിയാൻ കഴിയുന്നു, കൂടാതെ ഏറ്റവും സെൻസിറ്റീവായ കഴിവുകൾ സാധാരണക്കാർക്ക് ലഭ്യമാക്കാതെ തന്നെ സുപ്രധാനമായ പ്രതിരോധ പ്രവർത്തനങ്ങൾ സംരക്ഷിക്കാൻ വ്യത്യസ്ത തലത്തിലുള്ള ആക്സസ് സൗകര്യമൊരുക്കുന്നു.
പ്രത്യേകിച്ച് ഈ പ്രിവ്യൂ സമയത്ത്, ചില അഭ്യർത്ഥനകൾ തടയുകയോ നിരസിക്കുകയോ ചെയ്യുന്ന സുരക്ഷാ സംവിധാനങ്ങൾ ഉപയോക്താക്കൾക്ക് നേരിടേണ്ടി വന്നേക്കാം. കൂടുതൽ പരിശോധനയ്ക്കായി ജനറേഷൻ താൽക്കാലികമായി നിർത്തിവെക്കുന്നതിനാൽ മറ്റ് അഭ്യർത്ഥനകൾ പൂർത്തിയാകാൻ കൂടുതൽ സമയമെടുത്തേക്കാം. സുരക്ഷാ സംവിധാനങ്ങൾ ചിലപ്പോൾ നിയമാനുസൃതമായ ജോലികളിൽ പോലും ഇടപെട്ടേക്കാം; പ്രത്യേകിച്ച് പ്രതിരോധ പ്രവർത്തനങ്ങളും ആക്രമണാത്മക പ്രവർത്തനങ്ങളും തുടക്കത്തിൽ ഒരേപോലെ തോന്നിപ്പിക്കുന്ന 'ഡ്യുവൽ-യൂസ്' മേഖലകളിൽ ഇത് സംഭവിക്കാം.
പ്രിവ്യൂ ഘട്ടത്തിന്റെ പ്രധാന ലക്ഷ്യം തന്നെ ഇതാണ്. സുരക്ഷാ സംവിധാനങ്ങൾ ദുരുപയോഗത്തെ തടയുന്നുണ്ടോ എന്ന് മാത്രമല്ല, നിയമാനുസൃതമായ ഉപയോക്താക്കൾക്ക് തങ്ങളുടെ ദൈനംദിന ജോലികൾ വിശ്വസനീയമായും കാര്യക്ഷമമായും പൂർത്തിയാക്കാൻ സാധിക്കുന്നുണ്ടോ എന്ന് കൂടി മനസ്സിലാക്കാൻ ഞങ്ങൾ ആഗ്രഹിക്കുന്നു. പ്രിവ്യൂ സമയത്ത് ലഭിക്കുന്ന പ്രതികരണങ്ങൾ, അനാവശ്യമായ തടസ്സങ്ങളും കാലതാമസവും കുറയ്ക്കാനും, സന്ദർഭത്തിനനുസരിച്ച് സുരക്ഷാ സംവിധാനങ്ങൾ കാര്യങ്ങൾ മനസ്സിലാക്കുന്ന രീതി മെച്ചപ്പെടുത്താനും, കൂടുതൽ ആളുകളിലേക്ക് ഈ മോഡൽ എത്തുന്നതിന് മുൻപ് കൂടുതൽ സുഗമമായ അനുഭവം ഉറപ്പാക്കാനും ഞങ്ങളെ സഹായിക്കും.
എന്റർപ്രൈസ് ഉപഭോക്താക്കളുടെ സ്വകാര്യതാ ആവശ്യങ്ങളെ പിന്തുണയ്ക്കുമ്പോൾ തന്നെ സുരക്ഷാ മുൻകരുതലുകൾ മെച്ചപ്പെടുത്തുന്നതിനായി, ഞങ്ങൾ ദീർഘകാലാടിസ്ഥാനത്തിലുള്ള ചില സമീപനങ്ങളിലും പ്രവർത്തിക്കുന്നുണ്ട്. ഇതിൽ —സ്വകാര്യതയെ ബാധിക്കാത്ത രീതിയിലുള്ള കണ്ടെത്തലുകൾ, ഉപഭോക്താക്കൾക്ക് നിയന്ത്രിക്കാവുന്ന സുരക്ഷാ ക്രമീകരണങ്ങൾ, കൂടാതെ ഒരു ഉപഭോക്താവിന്റെയോ, ഉപയോക്താവിന്റെയോ അല്ലെങ്കിൽ കൈകാര്യം ചെയ്യുന്ന ജോലിയുടെയോ— അപകടസാധ്യതയ്ക്കനുസരിച്ച് ക്രമീകരിച്ചിരിക്കുന്ന ആക്സസ് സംവിധാനങ്ങൾ എന്നിവ ഉൾപ്പെടുന്നു.
ആക്രമണകാരികൾ അവരുടെ തന്ത്രങ്ങൾ മാറ്റുമ്പോഴും സുരക്ഷാ സംവിധാനങ്ങൾ ഫലപ്രദമായി തുടരേണ്ടതുണ്ട്. അറിയപ്പെടുന്ന ഒരു കൂട്ടം നിശ്ചിത ആക്രമണങ്ങളിൽ മാത്രം പ്രവർത്തിക്കുന്ന ഒരു പ്രതിരോധം ഒരു ഫ്രോണ്ടിയർ മോഡലിന് വേണ്ടത്ര കരുത്തുനൽകില്ല.
അതുകൊണ്ടാണ് ദൗർബല്യങ്ങൾ കണ്ടെത്താനും സുരക്ഷാ സംവിധാനങ്ങൾ വേഗത്തിൽ മെച്ചപ്പെടുത്താനും ഞങ്ങളുടെ സ്വന്തം മോഡലുകൾ തന്നെ ഉപയോഗിച്ചുകൊണ്ട്, സുരക്ഷയ്ക്കായി മുമ്പത്തേക്കാളും കൂടുതൽ ഇന്റലിജൻസും കമ്പ്യൂട്ടും ഞങ്ങൾ പ്രയോഗിക്കുന്നത്. യൂണിവേഴ്സൽ ജയിൽബ്രേക്കുകൾ കണ്ടെത്തുന്നതിന് ലക്ഷ്യമിട്ടുള്ള ഓട്ടോമേറ്റഡ് റെഡ് ടീമിംഗിനായി ഞങ്ങൾ 700,000-ത്തിലധികം A100-ന് തുല്യമായ GPU മണിക്കൂറുകൾ നീക്കിവച്ചു: ഒരു ചെറിയ സാഹചര്യത്തിൽ മാത്രം ഒതുങ്ങിനിൽക്കാതെ, ഒന്നിലധികം പ്രോംപ്റ്റുകളിലോ സന്ദർഭങ്ങളിലോ പ്രവർത്തിക്കാൻ കഴിയുന്ന ആക്രമണങ്ങളാണിവ. കൂടുതൽ കഠിനവും പൊതുവായതുമായ ഇത്തരം ആക്രമണങ്ങളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നത്, നേരത്തെ അറിയപ്പെടുന്ന പ്രശ്നങ്ങളുടെ ഒരു നിശ്ചിത ഗണത്തിന് അപ്പുറം സുരക്ഷാ സംവിധാനങ്ങൾ പരിശോധിക്കാൻ ഞങ്ങളെ സഹായിക്കുന്നു. കൂടാതെ, മനുഷ്യർ മാത്രം നടത്തുന്ന പരിശോധനകൾക്ക് കണ്ടെത്താൻ കഴിയുന്നതിനേക്കാൾ കൂടുതൽ ആക്രമണ രീതികൾ പര്യവേക്ഷണം ചെയ്യാനും, തകരാറുകളുടെ പാറ്റേണുകൾ നേരത്തെ തിരിച്ചറിയാനും, ഒരു ദൗർബല്യം കണ്ടെത്തുന്നതിൽ നിന്ന് അത് പരിഹരിക്കുന്നതിലേക്കുള്ള സമയം കുറയ്ക്കാനും ഇത് ഞങ്ങളെ അനുവദിക്കുന്നു.
ഓട്ടോമേറ്റഡ് റെഡ്-ടീമിംഗിന് പുറമേ, വിപുലമായ ഹ്യൂമൻ എക്സ്പർട്ട് റെഡ് ടീമിംഗ് നടത്തുന്നതിനായി ഞങ്ങൾ തേർഡ്-പാർട്ടി ടെസ്റ്റർമാരുമായി ചേർന്ന് പ്രവർത്തിച്ചു, ഇത് പ്രിവ്യൂ കാലയളവിലും തുടരും. ഞങ്ങളുടെ സിസ്റ്റങ്ങൾക്ക് മുൻകൂട്ടി കാണാൻ കഴിഞ്ഞേക്കാത്ത രീതികളിൽ മോഡൽ ദുരുപയോഗം ചെയ്യാൻ ശ്രമിക്കുന്ന ക്രിയേറ്റീവ് വിദഗ്ധർക്കെതിരെ സുരക്ഷാ സംവിധാനങ്ങൾ പരിശോധിച്ചുകൊണ്ട്, ഓട്ടോമേറ്റഡ് ജോലികൾക്ക് ഹ്യൂമൻ റെഡ്-ടീമിംഗ് കൂടുതൽ പൂർണ്ണത നൽകുന്നു.
ഒരു മൂല്യനിർണ്ണയത്തിനും എല്ലാ ഉൽപ്പന്ന കോൺഫിഗറേഷനുകളേയോ, ഒന്നിലധികം ഘട്ടങ്ങളുള്ള ആക്രമണങ്ങളെയോ, യഥാർത്ഥ ലോകത്തിലെ പ്രവർത്തന രീതികളെയോ പ്രതിനിധീകരിക്കാൻ കഴിയില്ല. അതിനാൽ, പുതുതായി കണ്ടെത്തുന്ന ജയിൽബ്രേക്കുകൾ പുനർനിർമ്മിക്കാനും, വിലയിരുത്താനും, മുൻഗണന നൽകി പരിഹരിക്കാനും ഞങ്ങൾ ഒരു അതിവേഗ പ്രതികരണ പ്രക്രിയ നിലനിർത്തുന്നു. ഭാവിയിൽ സമാനമായ തകരാറുകൾ ഉണ്ടോയെന്ന് പരിശോധിക്കാൻ കഴിയുന്നതിനായി ഞങ്ങൾ അവയെ ഞങ്ങളുടെ നിലവിലെ മൂല്യനിർണ്ണയങ്ങളിൽ ഉൾപ്പെടുത്തുകയും ചെയ്യുന്നു.
പ്രിവ്യൂ കാലയളവിൽ, തിരഞ്ഞെടുത്ത വിശ്വസ്തരായ പങ്കാളികൾക്കും സംഘടനകൾക്കും API വഴിയും Codex വഴിയും GPT‑5.6 മോഡലുകൾ ആദ്യം ലഭ്യമാകും. തുടർന്ന് ChatGPT, Codex, API എന്നിവ ഉപയോഗിക്കുന്നവർക്കായി ഇത് കൂടുതൽ വ്യാപകമായി ലഭ്യമാക്കാൻ ഞങ്ങൾ പദ്ധതിയിടുന്നു.
GPT‑5.6‑യ്ക്കൊപ്പം അവതരിപ്പിച്ച ഈ പുതിയ നാമകരണ സംവിധാനത്തിൽ, മോഡലിന്റെ തലമുറയെ സൂചിപ്പിക്കുന്നത് സംഖ്യയാണ്. അതേസമയം, സോൾ, ടെറ, ലൂണ എന്നിവ അവരുടേതായ വേഗതയിൽ പുരോഗമിക്കാൻ കഴിയുന്ന, നിലനിൽക്കുന്ന ശേഷി തലങ്ങളെ വ്യക്തമാക്കുന്നു. ചുരുക്കത്തിൽ, ഇന്റലിജൻസ്, വേഗത, ചെലവ് എന്നിവ പ്രകാരം വ്യക്തമായ തിരഞ്ഞെടുപ്പുകൾ നടത്താൻ ഈ ഗണം ഉപയോക്താക്കളെയും ഡെവലപ്പർമാരെയും സഹായിക്കുന്നു.
മൂന്ന് മോഡൽ വലിപ്പങ്ങളിലായി 1M ടോക്കണുകൾക്ക് എന്ന നിരക്കിലാണ് GPT‑5.6‑ന്റെ വില നിശ്ചയിച്ചിരിക്കുന്നത്: Sol-ന് ഇൻപുട്ടിന് $5 / ഔട്ട്പുട്ടിന് $30; Terra-യ്ക്ക് ഇൻപുട്ടിന് $2.50 / ഔട്ട്പുട്ടിന് $15; കൂടാതെ Luna-യ്ക്ക് ഇൻപുട്ടിന് $1 / ഔട്ട്പുട്ടിന് $6. കൃത്യമായ കാഷെ ബ്രേക്ക്പോയിന്റുകൾക്കും കുറഞ്ഞത് 30 മിനിറ്റ് കാഷെ ലൈഫിനുമുള്ള പിന്തുണയുൾപ്പെടെ, കൂടുതൽ എളുപ്പത്തിൽ കണക്കാക്കാൻ കഴിയുന്ന പ്രോംപ്റ്റ് കാഷിംഗ് രീതിയും GPT‑5.6 അവതരിപ്പിക്കുന്നു. GPT‑5.6‑ലും അതിനുശേഷമുള്ള മോഡലുകളിലും, കാഷെ റൈറ്റുകൾക്ക് മോഡലിന്റെ അൺകാഷ്ഡ് ഇൻപുട്ട് നിരക്കിന്റെ 1.25 ഇരട്ടിയാണ് ഈടാക്കുക, അതേസമയം കാഷെ റീഡുകൾക്ക് നിലവിലുള്ള 90% കാഷ്ഡ്-ഇൻപുട്ട് ഡിസ്കൗണ്ട് തുടർന്നും ലഭിക്കും.
Cerebras-ൽ GPT‑5.6 Sol-ഉം ഞങ്ങൾ ജൂലൈയിൽ പുറത്തിറക്കുകയാണ്: സെക്കൻഡിൽ 750 ടോക്കണുകൾ വരെയുള്ള വേഗതയിൽ ഉപഭോക്താക്കളിലേക്ക് മുമ്പെങ്ങുമില്ലാത്ത വേഗതയിൽ ഫ്രോണ്ടിയർ ഇന്റലിജൻസ് എത്തിക്കുന്നകയാണ് ലക്ഷ്യം. ഞങ്ങളുടെ ശേഷി വിപുലീകരിക്കുന്നതിനാൽ, തുടക്കത്തിൽ തിരഞ്ഞെടുത്ത ഉപഭോക്താക്കൾക്ക് മാത്രമായിരിക്കും ഇതിലേക്ക് ആക്സസ് ലഭിക്കുക.
ഈ പ്രിവ്യൂ കാലയളവിൽ നിന്ന് തുടർന്നും പഠിക്കാനും, കൂടാതെ GPT‑5.6 Sol, Terra, Luna എന്നിവ ഉടൻ തന്നെ കൂടുതൽ ആളുകളിലേക്ക് എത്തിക്കാനും കഴിയുന്നതിൽ ഞങ്ങൾ ആവേശഭരിതരാണ്.
1. ഞങ്ങളുടെ മോഡലുകളുടെ പ്രൊഡക്ഷൻ പെരുമാറ്റം പരിശോധിക്കുകയും ഓഫ്ലൈനായി സിമുലേറ്റ് ചെയ്യുകയും ചെയ്താണ് ഞങ്ങൾ ലേറ്റൻസിയും API ചെലവും കണക്കാക്കുന്നത്. ഈ കണക്കുകളിൽ ടൂൾ കോൾ വിശദാംശങ്ങൾ, സാമ്പിൾ ചെയ്ത ടോക്കണുകൾ, ഇൻപുട്ട് ടോക്കണുകൾ എന്നിവ ഉൾപ്പെടുന്നു. എന്നാൽ യഥാർത്ഥ ഉപയോഗത്തിൽ ഫലങ്ങളിൽ കാര്യമായ വ്യത്യാസങ്ങളുണ്ടാകാം, കാരണം ഞങ്ങളുടെ സിമുലേഷനിൽ ഉൾപ്പെടാത്ത നിരവധി ഘടകങ്ങളെ ഇത് ആശ്രയിച്ചിരിക്കുന്നു. വേഗതയേറിയ API വേഗതയിലാണ് ഞങ്ങൾ ലേറ്റൻസി സിമുലേറ്റ് ചെയ്യുന്നത്, അതേസമയം ചിലവ് കണക്കാക്കുന്നത് സാധാരണ API നിരക്കുകളിലാണ്.
2. എല്ലാ മോഡലുകളും 5 സീഡുകളും റീസണിംഗ് തുടർച്ചയും ഉപയോഗിച്ച് ExploitBench API ഹാർനെസ് ഉപയോഗിച്ചാണ് മൂല്യനിർണയം ചെയ്യുന്നത്.
3. ഞങ്ങളുടെ പബ്ലിക് API-യേക്കാൾ വേഗത്തിൽ പ്രതികരണങ്ങൾ നൽകുന്ന ആൽഫാ API-യിലാണ് (alpha API) ഞങ്ങൾ ExploitGym പ്രവർത്തിപ്പിച്ചത്, തുടർന്ന് ഞങ്ങളുടെ പബ്ലിക് API-യുമായി പൊരുത്തപ്പെടുത്തുന്നതിനായി അത് റീസ്കെയിൽ ചെയ്തു. പബ്ലിക് API-യ്ക്ക് പ്രതീക്ഷിക്കുന്ന വേഗതയ്ക്കനുസരിച്ച് ലേറ്റൻസികൾ റീസ്കെയിൽ ചെയ്യുമ്പോൾ, ഇവാല്യുവേഷൻ റണ്ണിൽ സമയപരിധികൾ കൃത്യമായി പാലിക്കപ്പെട്ടിരുന്നുവെങ്കിലും, കണക്കാക്കിയ ചില ലേറ്റൻസികൾ 2 മണിക്കൂർ, 6 മണിക്കൂർ സമയപരിധികൾ മറികടക്കാൻ ഇത് കാരണമാകുന്നു. സമയബന്ധിതമായ ജോലികൾക്ക് കൂടുതൽ വേഗത ലഭിക്കുന്നതിനായി, ഞങ്ങൾ API-യിൽ പ്രയോറിറ്റി പ്രോസസ്സിംഗും Codex-ൽ ഫാസ്റ്റ് മോഡും നൽകുന്നു.
4. റിപ്പോർട്ട് ചെയ്ത ഔട്ട്പുട്ട് ടോക്കണുകളോ ലേറ്റൻസിയോ ചെലവോ ഇല്ലാത്ത മോഡലുകൾ തിരശ്ചീന ഡോട്ടഡ് ലൈനുകളായി പ്ലോട്ട് ചെയ്തിരിക്കുന്നു.

