મુખ્ય વિષય-સામગ્રી પર જાવો
OpenAI
લોડિંગ…

આજે અમે GPT‑6 Astra રજૂ કરી રહ્યા છીએ, જે અમે વ્યાપક રીતે અમલમાં મૂકેલું અત્યાર સુધીનું સૌથી સક્ષમ મોડલ છે. Astra અમારું પ્રથમ મોડલ છે, જે પ્રિપેરડનેસ ફ્રેમવર્ક હેઠળ સાયબર સુરક્ષા ક્ષમતાના ક્રિટિકલ સ્તરે પહોંચ્યું છે.

આ રજૂઆતની સલામતી વિશે જાણવા જેવી સૌથી મહત્ત્વની બાબતો આ પ્રમાણે છે:

  1. GPT‑6 Astra સાયબર ક્ષમતાઓમાં નોંધપાત્ર પ્રગતિ છે અને અમારા ક્રિટિકલ સ્તરના માપદંડને પૂર્ણ કરે છે. એનો અર્થ એ છે કે યોગ્ય સાધનો અને ઍક્સેસ મળતાં GPT‑6 Astra અગાઉ અજાણી સુરક્ષા ખામીઓ શોધી શકે છે અને દરેક પગલે માનવીના માર્ગદર્શન વિના ઘણી સારી રીતે સુરક્ષિત સિસ્ટમોમાં તેમનો લાભ લેવાની નવી રીતો વિકસાવી શકે છે. તેથી, દુરુપયોગ કે અસંગતતાને કારણે મોડલ હાનિકારક સાયબર કાર્યવાહી ન કરે તે માટે અમે સુરક્ષા નોંધપાત્ર રીતે મજબૂત કરી છે. અમે Astra અને તેના જેવાં મોડલના આંતરિક વિકાસ અને અમલીકરણને સુરક્ષિત કરવા માટે પણ પગલાં લીધાં છે. એમાં વધુ કડક અલગીકરણ, ચેકપૉઇન્ટ એન્ક્રિપ્શન, ચેન-ઓફ-થોટ (CoT) સહિત સમગ્ર પ્રક્રિયાનું સર્વવ્યાપી નિરીક્ષણ અને આંતરિક ઉપયોગ પહેલાં અવરોધક સંરેખણ મૂલ્યાંકનનો સમાવેશ થાય છે.
  2. GPT‑6 Astra તેના પુરોગામી મોડલ કરતાં નોંધપાત્ર રીતે વધુ મજબૂત છે. મજબૂતાઈ માટેની નવી સલામતી તાલીમ પદ્ધતિઓને સામેલ કરવાથી GPT‑6 Astra લાંબી પ્રક્રિયાઓમાં પણ GPT‑5.6 Sol કરતાં જેલબ્રેક સામે નોંધપાત્ર રીતે વધુ મજબૂત છે. ઑફલાઇન પરીક્ષણો અને સઘન આંતરિક તથા બાહ્ય જેલબ્રેક પરીક્ષણ અને નિવારણ કાર્યક્રમથી અમને આ જાણ થઈ છે. સંભવિતપણે વધુ જોખમી તરીકે ચિહ્નિત વપરાશકર્તાઓ માટે અમે મોડલની ઇનકાર-સીમાને વધુ સાવચેત બનાવીને દ્વિ-ઉપયોગનાં વધુ જોખમો આવરી લેવાની ક્ષમતાની વધારાની તાલીમ આપી છે. અગાઉના પરીક્ષણોમાં મળેલા જેલબ્રેક સામે Astra મજબૂત રહે તેની ખાતરી કરવા અમે રિગ્રેશન પરીક્ષણ કરીએ છીએ. સુધારાની ચકાસણી માટે અમારા નવીનતમ આંતરિક રેડ ટીમિંગ હુમલાખોરો સાથે સ્વચાલિત રેડ ટીમિંગના નવા તબક્કા પણ હાથ ધર્યા છે.
  3. GPT‑6 Astra, GPT‑5.6 Sol કરતાં વધુ સારી રીતે સંરેખિત છે. Astra મોડલ સંરેખણમાં નોંધપાત્ર પ્રગતિ છે. એમાં પ્રી-ટ્રેનિંગ ડેટાની રચનાથી લઈને રીઇન્ફોર્સમેન્ટ લર્નિંગ દરમિયાનના અમારા મૂલ્યાંકન સુધીના સુધારા સામેલ છે. અમે સંરેખણ મૂલ્યાંકનોનો નવો સમૂહ(નવી વિન્ડોમાં ખૂલે છે) રજૂ કર્યો છે અને જાણ્યું છે કે GPT‑6 Astra સલામતી તથા સુરક્ષાની સીમાઓનું પાલન કરવામાં અને અધિકૃત કાર્યક્ષેત્રમાં રહેવામાં વધુ મજબૂત છે. 54,000થી વધુ આંતરિક Codex કાર્યો(નવી વિન્ડોમાં ખૂલે છે)ના અનુકરણમાં પણ Astraને Solની સરખામણીએ વધુ ગંભીર અસંગત વર્તન માટે લગભગ અડધા ચિહ્નો મળ્યા.
  4. અમે અસંગતતા નિરીક્ષણનો વ્યાપક અમલ કરી રહ્યા છીએ. અમારા મોડલના સંભવિત અસંગત વર્તનને રોકવા માટે અમે મોડલ સંરેખણને મુખ્ય ઉપાય માનીએ છીએ. જોકે, નિરીક્ષણ અત્યાધુનિક મોડલના વર્તનની વ્યાપક જાણકારી આપે છે અને સંરેખણ તથા સલામતી વધુ સુધારવાની તકો દર્શાવે છે. ઉપરાંત, નિરીક્ષણ શોધાયેલા અસંગત વર્તન સામે સુરક્ષાનું વધારાનું સ્તર પૂરું પાડે છે. આ કારણોથી, ગણતરીનો નોંધપાત્ર ખર્ચ થવા છતાં Astraના બાહ્ય અમલીકરણમાં સાધનો વાપરતા દરેક અનુમાન માટે અમે અસંગતતા નિરીક્ષણ પણ ઉમેર્યું છે. આ સિસ્ટમ અમારી આંતરિક વ્યવસ્થાને અનુરૂપ છે.
  5. GPT‑5.6 Solની સરખામણીએ GPT‑6 Astraની નિરીક્ષણક્ષમતા ઘટી છે. અમે GPT‑6 Astraની નિરીક્ષણક્ષમતા(નવી વિન્ડોમાં ખૂલે છે) અને નિયંત્રણક્ષમતા(નવી વિન્ડોમાં ખૂલે છે) અંગે વ્યાપક તપાસ કરી છે. અમને જાણવા મળ્યું છે કે GPT‑6 Astra પોતાના CoTને GPT‑5.6 Sol કરતાં વધુ સારી રીતે નિયંત્રિત કરી શકે છે અને તેના CoTમાં દોષ સૂચવતી માહિતી સામેલ થવાની સંભાવના ઓછી છે. પ્રતિકૂળ પરિસ્થિતિઓમાં (જ્યારે અમે મોડલને અમારા નિરીક્ષકોથી બચવા પ્રેરિત કરીએ છીએ) મૂલ્યાંકનોમાં વ્યૂહાત્મક રીતે ઓછું પ્રદર્શન કરતી વખતે તે શોધાયા વિના રહી શકે છે (આ સેન્ડબેગિંગ કહેવાય છે). ઉપરાંત, અમુક ભાંગફોડનાં કાર્યો(નવી વિન્ડોમાં ખૂલે છે) કરવા કહેવાય ત્યારે તે ક્યારેક અમારા આંતરિક નિરીક્ષકોથી બચી શકે છે. અમને સ્ટેગનોગ્રાફિક CoT રિઝનિંગ, (જેમ કે સામાન્ય અને દેખીતી રીતે અસંબંધિત લખાણમાં છુપાયેલું રિઝનિંગ સંતાડવું, હોવાના પુરાવા મળ્યા નથી) આ સૂચવે છે કે નિરીક્ષણથી બચવાનું જોખમ મોટાભાગે ઓછા રિઝનિંગવાળાં કાર્યો સુધી મર્યાદિત હોઈ શકે છે.
    • આ તારણો સૂચવે છે કે પ્રતિકૂળ પરિસ્થિતિઓમાં Astra શ્રેણીનાં મોડલ અમારા CoT નિરીક્ષકોથી બચી શકે છે. હાલમાં આ તારણો મુખ્યત્વે પ્રતિકૂળ મૂલ્યાંકનો પર આધારિત છે (જેમ કે જ્યારે અમે મોડલને નિરીક્ષણથી બચવાની સૂચના આપીએ છીએ) અને એકંદરે અમારા સંરેખણ મૂલ્યાંકનો દર્શાવે છે કે GPT‑5.6 Solની સરખામણીએ Astra દ્વારા સુરક્ષા અને સલામતી નિયંત્રણોના ઉલ્લંઘનની સંભાવના ઓછી છે.
    • જોકે, અમે આ વલણને ગંભીરતાથી લઈએ છીએ. અમારાં મોડલ વધુ સક્ષમ બનતાં જાય તેમ અમે આ તારણો અને નિરીક્ષણક્ષમતા પર તેમની અસરોની તપાસ ચાલુ રાખીશું. OpenAIએ વિચાર-શૃંખલાના નિરીક્ષણને જાળવવા અને ઉપયોગમાં લેવા માટે કામ કર્યું છે. CoT નિરીક્ષણક્ષમતા જાળવવી આ સંશોધન કાર્યક્રમનો મુખ્ય ઉદ્દેશ છે. જોકે, આ પરિણામો મોડલની ચેન-ઓફ-થોટની તપાસથી આગળ વધીને સંરેખણના ઑડિટ માટેની પદ્ધતિઓ વિકસાવવાનું મહત્ત્વ પણ દર્શાવે છે.
  6. GPT‑6 Astra બ્રાઉઝિંગ અને કાર્યસ્થળની પરિસ્થિતિઓને વધુ જવાબદારીપૂર્વક સંભાળે છે: GPT‑6 Astra, GPT‑5.6 Sol કરતાં પ્રોમ્પ્ટ ઇન્જેક્શન સામે નોંધપાત્ર રીતે વધુ મજબૂત છે. અમે વાસ્તવિક બ્રાઉઝિંગ અને વ્યાવસાયિક કમ્પ્યુટર વાતાવરણમાં મોડલના વર્તનનું પણ પરીક્ષણ કર્યું છે. GPT‑5.6 Solની સરખામણીએ આ મોડલ દ્વારા અસંગત અને સંભવિત વિનાશક કાર્યવાહી, જેમ કે અનધિકૃત વ્યવહારો, ડેટાની ખોટ, અતિશય ઍક્સેસ અથવા નિયંત્રણો ટાળવા, થવાની સંભાવના નોંધપાત્ર રીતે ઓછી છે. સ્વાયત્ત એજન્ટ તરીકે કામ કરતી વખતે હાનિકારક વિનંતીઓ, જેમ કે હિંસક હુમલાનું આયોજન કરવામાં મદદ કરવી અથવા છેતરપિંડી કરવી, સંભાળતી વખતે પણ તે વધુ સુરક્ષિત રીતે વર્તે છે.
  7. GPT‑6 Astra વધુ જોખમી પરિસ્થિતિઓમાં નોંધપાત્ર રીતે વધુ સુરક્ષિત છે. ઉત્પાદન વાતાવરણ અને માનવીય પ્રતિકૂળ રેડ ટીમિંગમાંથી લેવાયેલી પડકારજનક વિનંતીઓનો GPT‑6 Astra, GPT‑5.6 Sol કરતાં વધુ સુરક્ષિત જવાબ આપે છે. અસુરક્ષિત વિનંતીઓ સુરક્ષિત રીતે પૂર્ણ કરવામાં અને હાનિરહિત વિનંતીઓનો બિનજરૂરી ઇનકાર ટાળવામાં Astra પેરેટો સુધારો હાંસલ કરે છે. આ સુધારા એવી અત્યંત ગંભીર પરિસ્થિતિઓને પણ આવરી લે છે, જ્યાં હાનિનું જોખમ સ્પષ્ટ વિનંતીને બદલે વ્યાપક સંદર્ભમાંથી ઉદ્ભવે છે. Astra 18 વર્ષથી ઓછી ઉંમરના વપરાશકર્તાઓ માટે વયને અનુરૂપ સલામતી સીમાઓ પણ વધુ સુસંગત રીતે લાગુ કરે છે.