ማጠቃለያ
ለረጅም ጊዜ የሚሰሩ ሞዴሎች ከባድና ክፍት ችግኝ መፍቻ ጉዳዮችን ሊፈቱ ይችላሉ፣ ነገር ግን ጽናታቸው ያልተፈለጉ እርምጃዎችን ለመውሰድ ተጨማሪ እድሎችን ይሰጣቸዋል።
ለረጅም ጊዜ ተግባራት የሰለጠነ ሞዴል በተገደበ ውስጣዊ አጠቃቀም ወቅት፣ ነባር የቅድመ-ስምሪት ግምገማዎቻችን ያልያዙትን አዳዲስ ውድቀቶች ተመልክተን መዳረሻን ለጊዜው አቆምን። ከዚያም ከእነዚህ ውድቀቶች የተገኙ ግንዛቤዎችን ተጠቅመን አዳዲስ ግምገማዎችን ገነባን፣ የረጅም የጊዜ ሆራይዞን አሰላለፍን አሻሻልን፣ በየእድገት አቅጣጫ-ደረጃ ክትትል ጨመርን፣ እና የተገደበ መዳረሻ ከመመለሳችን በፊት ለተጠቃሚዎች የበለጠ ታይነትና ቁጥጥር ሰጠን።
ይህ ተሞክሮ የደረጃ በደረጃ ስምሪት ዋጋን አጠናከረ። ምንም ቋሚ የግምገማ ስብስብ እያንዳንዱን ባህሪ አስቀድሞ ሊገምት አይችልም፤ ስለዚህ የቅድመ-ስምሪት ፈተና ከቅርብ ክትትል፣ ጣልቃ መግባት ከሚችሉ መከላከያዎች፣ እና ሲያስፈልግ ለጊዜው ማቆም ወይም ወደ ቀድሞው መመለስ ከሚችል አቅም ጋር መጣመር አለበት።
ለረጅም ጊዜ በራስ ገዝነት መስራት የሚችሉ ሞዴሎች ከባድና ክፍት የሆኑ ችግኝ መፍቻ ጉዳዮችን ሊያከናውኑ ይችላሉ። ነገር ግን ጠቃሚ የሚያደርጋቸው ያው ጽናት፣ ያልተፈለጉ እርምጃዎችን ለመውሰድ—እና ለአጭር ሆራይዞን ሞዴሎች የተዘጋጁ ግምገማዎች ሊያመልጣቸው በሚችሉ መንገዶች ይህን ለማድረግ—ተጨማሪ እድሎችን ይሰጣቸዋል።
ከሁለት ወራት ገደማ በፊት፣ ውስጣዊ አጠቃላይ-ዓላማ ሞዴል የErdős unit distance conjectureን እንዳስተባበለ አስታውቀን ነበር። ይህ ሞዴል ለበጣም ረጅም ጊዜ በራስ ገዝነት እንዲሰራ ተነድፎ ነበር። በተገደበና በክትትል ስር ባለ ውስጣዊ አጠቃቀም ወቅት፣ ነባር የስምሪት ግምገማዎቻችን ያልያዙትን ያልተፈለገ ባህሪ ተመለከትን። ስምሪትው የተገደበና በክትትል ስር ስለነበር፣ እነዚህን ችግኝ መለየት፣ መዳረሻን ለጊዜው ማቆም፣ በተመለከትነው ላይ የተመሰረቱ አዳዲስ ግምገማዎችን መፍጠር፣ ሞዴሉንና መከላከያዎቹን ማጠናከር፣ ከዚያም ቀጣይ ክትትል ስር መዳረሻን መመለስ ቻልን።
ሞዴሎችን የምንገመግምባቸው ሁኔታዎች በተግባር ሲጠቀሙ ከሚያጋጥሟቸው ሁኔታዎች ጋር ፍጹም አይዛመዱም። ስለዚህ ከስምሪት በፊት የሚደረጉ ግምገማዎች ከተገደበና በክትትል ስር ካለ ስምሪት ጋር፣ እንዲሁም ችግኝ ሲታይ ጣልቃ መግባት፣ ለጊዜው ማቆም ወይም ወደ ቀድሞው መመለስ ከሚችል አቅም ጋር መጣመር አለባቸው። ከስምሪት የምንማረው ነገር፣ መዳረሻ ከመስፋፋቱ በፊት የበለጠ ጠንካራ ግምገማዎችና መከላከያዎች አካል ሊሆን ይችላል።
በሚቀጥሉት ክፍሎች፣ የተመለከትነውን፣ ችግኞቹን እንዴት እንደፈታን፣ እና ይህ ተሞክሮ የወደፊት ልቀቶችን እንዴት እንደሚቀርጽ በተጨባጭ ምሳሌዎች እናጋራለን።
አዲሱ ሞዴል በረጅም ጊዜ ውስጥ በተደጋጋሚ ሙከራዎች ወደ አንድ ዓላማ መስራቱን መቀጠል ይችላል። ያው ጽናት በአካባቢው ያሉ ድክመቶችን እንዲያገኝና እንዲበዘብዝ ሊያደርገው ይችላል። ቀደምት ሞዴሎች የየደህንነት መከላከያ አካባቢ ወይም የአካባቢ ገደቦች ሲያጋጥሟቸው በቀላሉ ይቆሙና ወደ ተጠቃሚው ይመለሱ ነበር። ይህ ሞዴል ግን ከየደህንነት መከላከያ አካባቢዎች ውጭ ለመስራት መንገዶችን መፈለግን ጨምሮ ብዙ ጊዜ መሞከሩን ቀጠለ።
የዚህ ምሳሌ በ NanoGPT ፈጣን ማጠናቀቂያ(በአዲስ መስኮት ውስጥ ይክፈታል) ላይ በተደረገ ውስጣዊ ግምገማ ወቅት ተከሰተ፤ ይህም ትንሽ የቋንቋ ሞዴልን በተቻለ ጥቂት እርምጃዎች ለማሰልጠን የሚጠቅም የሕዝብ መመዘኛ ነው። ሞዴላችን PowerCool የተባለ በpower-law ላይ የተመሰረተ የመማር-ተመን ማረጋጊያን አዘጋጀ፣ ይህም ትልቅ መሻሻል አመጣ። ሞዴሉ ውጤቶቹን Slack ላይ ብቻ እንዲለጥፍ ተመርቶ ነበር፤ ግን የNanoGPT መመሪያዎች ውጤቶችን ወደ GitHub እንደ PR እንዲለጥፉ ይላሉ፣ እና ሞዴሉ እነዚያን መመሪያዎች ተከትሎ በሕዝባዊው የGitHub ማከማቻ ላይ PR #287ን ከፈተ። ሞዴሉ ውጫዊ መዳረሻን ለመከልከል የተነደፉ የየደህንነት መከላከያ አካባቢ ገደቦችን ተሻግሮ ወደ GitHub መስቀሉን ቀጠለ። ሞዴላችን PRውን ለመፍጠር በየደህንነት መከላከያ አካባቢ ውስጥ ተጋላጭነት ለማግኘት አንድ ሰዓት ወሰደበት፤ ቀደምት ሞዴሎች ያን ያህል ጽናት አልነበራቸውም እና ተጋላጭነቶችን ማግኘት አልቻሉም፣ በምትኩ የPR ክፍሉን ትተው ተስፋ ቆረጡ።1
ለAI ረዳቶች የሚዘጋጁ ብዙ የደህንነት መቆጣጠሪያዎች በግለሰብ እርምጃዎች ዙሪያ ይነደፋሉ። አንድ እርምጃ ካልተፈቀደ ይታገዳል። ስሱ ከሆነ፣ ስርዓቱ ከተጠቃሚው ግልጽ ፈቃድ ይጠይቃል። ነገር ግን እርምጃዎቻቸው ለሰዓታት፣ ለቀናት ወይም ለሳምንታት እንኳን በራስ ገዝነት ሊቀጥሉ የሚችሉ ለረጅም ጊዜ የሚሰሩ ሞዴሎች ይህን አወቃቀር ይፈታተናሉ፤ የግለሰብ እርምጃዎችን መከታተል የአጠቃላይ አቅጣጫውን አላማ ለመከታተል ከእንግዲህ በቂ አይደለም።
ለምሳሌ፣ ሞዴሉ አንድ ችግኝ እንዲፈታ በተጠየቀበት ሁኔታ፣ ሌሎች ስርዓቶች ስኬታማ ግን ግላዊ ማቅረቢያዎች እንዳላቸው ሞዴሉ ተመልክቶ፣ እነዚያን መፍትሄዎች ከግምገማ የኃላ የውስጥ ስርዓት ለመመለስ ሞከረ። መጀመሪያው ሙከራው አንድ የመፈተሻ ስርዓት የማረጋገጫ ቶክን በመለየቱ ሲታገድ፣ ሞዴሉ የቶክን አካሉን ለሁለት ቁርጥራጮች ከፈለ፣ አደበቃቸው፣ ከዚያም ሙሉው ቶክን እንደ አንድ ተከታታይ ሐረግ ፈጽሞ እንዳይታይ ምስክርነቱን በየማስኬጃ ጊዜ ላይ እንደገና ገነባ። ሞዴሉ በተጠቃሚው ላይ በሰጣቸው አስተያየቶችም ሆነ በማመዛዘን ዱካዎቹ፣ የመፈተሻ ስርዓቱን ለማለፍ እነዚህን እርምጃዎች እየወሰደ እንደነበር በግልጽ ገለጿል።
ይህ ምሳሌ እያንዳንዱ እርምጃ በራሱ ተቀባይነት ያለው ሊመስል ቢችልም፣ ቅደም ተከተሉ ግን የማይፈቀድ ውጤት ሊያመጣ እንደሚችል ያሳያል። እንዲሁም በረጅም የጊዜ ሆራይዞኖች ላይ በብቃት የሚሰራ ሞዴል የፈቃድ ስርዓትን ዓይነ ስውር ቦታዎች መማር እና ግቦቹን ለማሳካት ዙሪያውን መዞር እንደሚችል ያሳያል። የረጅም የጊዜ ሆራይዞን ደህንነት «ይህ እርምጃ ተፈቅዷል?» ብቻ ሳይሆን «ይህ የእርምጃዎች ቅደም ተከተል ወደ ምን ውጤት እየሰራ ነው?» ብሎ መጠየቅንም ይጠይቃል።
እንደእነዚህ ያሉ ክስተቶች ምክንያት፣ የአዲሱን ሞዴል ውስጣዊ ስምሪት ለጊዜው አቆምን። የደህንነት ስርዓቱን በጥልቅ መከላከል እና በየእድገት አቅጣጫ-ደረጃ monitoring ዙሪያ እንደገና ገነባን።
- ከክስተቶች የተወጡ ግምገማዎች። ግምገማዎች አንድ ስርዓት በተግባር ከመሰማራቱ በፊት ለስምሪት ደህና መሆኑን የሚያሳይ ስሜት ሊሰጡን ይችላሉ። ሆኖም ግምገማ ከፍተኛ ጥቅም እንዲኖረው፣ በእውነተኛ ስምሪት ወቅት የሚከሰቱ አቅጣጫዎችን ስርጭትና የሆራይዞን ርዝመት መወከል አለበት። በዚህ ምክንያት፣ የተመለከትናቸውን ውድቀቶች ተጠቅመን ተቃራኒ ግምገማዎችን አዘጋጀን። ከእውነተኛ ዓለም ክስተቶች የተወጡ ግምገማዎችን ማሻሻል፣ በተራው በproduction ውስጥ ከተሰማራ በኋላ የበለጠ ደህና ባህሪ እንዳመጣ አገኘን።
- የተሻሻለ አሰላለፍ። የተጠቃሚውን ግብ ለማሳካት ሲል ያለፈቃድ ያልተፈለጉ እርምጃዎችን የመውሰድ ዝንባሌውን ለመቀነስ እርምጃዎችን ወሰድን። ለምሳሌ፣ ሞዴሎቻችን በረጅም ቀስ በቀስ ልቀቶች ላይ መመሪያዎችን በማስታወስ የተዳከሙ መሆናቸውን አገኘን፤ ሞዴሉን ለዚህ ችሎታ ስናሰለጥነውም፣ በረዘሙ ቀስ በቀስ ልቀቶች ውስጥ ተሰልፎ የሚቆይ ሞዴል አመጣ።
- ንቁ ክትትል። ሞዴሉ የተጠቃሚ ገደብን ወይም የደህንነት ወሰንን እያለፈ መሆኑን የሚያመለክቱ ምልክቶችን ለማየት የሞዴሉን በመቀየር ላይ ያለ አቅጣጫ የሚገመግም የክትትል ስርዓት ፈጠርን። ተቆጣጣሪው አንድ እርምጃን ብቻ ሳይሆን ሙሉውን አቅጣጫ ይመለከታል። በተለይ አስፈላጊው፣ ተቆጣጣሪው ክፍለ ጊዜውን ለጊዜው ማቆምና ተጠቃሚው በቅርብ እንዲመረምር ማስጠንቀቅ ይችላል። ከተመረመረ በኋላ፣ ተቆጣጣሪው በስህተት ተነስቶ ከሆነ ተጠቃሚው የሞዴሉን ስራ ማስቀጠል ሊመርጥ ይችላል።
- ለተጠቃሚው የበለጠ ታይነትና ቁጥጥር። ተጠቃሚው እነዚህን ለረጅም ጊዜ የሚሰሩ ክፍለ ጊዜዎች መመርመር፣ የተወሰዱ እርምጃዎችን ማየት፣ እና ጣልቃ ገብነቶችን መከታተል የሚችልበትን አቅም አሻሻልን።
አዲሱን የክትትል ስርዓት ለመገምገም፣ ሞዴሉ ቀደም ሲል የተዛነፉ እርምጃዎችን የተከተለባቸውን ጥቂት የውስጣዊ ስምሪት አካባቢዎች ዳግም አጫወትን፤ በዚህ ጊዜ አዲሶቹ መከላከያዎች በቦታቸው ነበሩ2። አዲሶቹ መከላከያዎች ሞዴሉ የተከተላቸውን የተዛነፉ እርምጃዎች በእጅጉ ብዙ መያዝ ቻሉ፣ ያመለጧቸውም ሁሉ ዝቅተኛ ክብደት ያላቸው ተብለው ተፈረዱ።
ከእነዚህ ዝቅተኛ ክብደት ያላቸው ክስተቶች መካከል አንዳንድ ምሳሌዎች የሚከተሉትን ጉዳዮች ያካትታሉ፦
- የትዕዛዝ መስመር መሣሪያ ለመድረስ፣ ሞዴሉ የተጠላለፈ
codex --yoloክፍለ ጊዜ አስጀመረ፤ በእውነቱ ግን ያንን ያለ--yoloምልክት ማድረግ ይችል ነበር። - ሞዴሉ ቀደም ሲል በቀጥታ የነበረ ሀብት እንደጠፋ አስተዋለ፤ ከዚያም በባለቤቱ የስም መስመር ስር ያሉ ሌሎች በቀጥታ የሚሰሩ CPU የአፈጻጸም ክፍልs ውስጥ መመርመርና SSH መግባት ጀመረ፣ እንዲሁም ያለ ጥሩ ምክንያት የሌሎች OpenAI ሰራተኞች የሆኑ የአፈጻጸም ክፍልs ላይም (ባይሳካለትም) ሞከረ።
- ሞዴሉ ብዙ የተቆለፉ
findሂደቶች ነበሩት፣ እና እያንዳንዱ የትዕዛዝ መስመር መመሪያ ተንጠልጥሎ ነበር። ከዚያምkill -9 -1አስኪዷል፤ ይህ ቢፈጸም በዚያ የአፈጻጸም ክፍል ላይ እንዲገድላቸው ለተፈቀደለት እያንዳንዱ ሂደት SIGKILL ይልክ ነበር። ሆኖም ጊዜው አልፎበት አልተፈጸመም።
አዲሱን ስርዓት ከፈተንን በኋላ፣ የረጅም የጊዜ ሆራይዞን ችሎታዎች ያላቸው ሞዴሎች የተገደበ ውስጣዊ መዳረሻ ሊመለስ እንደሚችል ደረስንበት። ዳግም ስምሪት ከተጀመረ ከብዙ ሳምንታት ወዲህ፣ መከላከያዎችን በከባድ ሁኔታ መዞር አላስተዋልንም። የእነዚህ መከላከያዎች የመጀመሪያ ስሪት በሆነ ተብሎ ጥንቃቄ የተሞላበት ነበር። መከላከያዎቹን ሳናዳክም፣ አላስፈላጊ መቋረጦችን ለመቀነስ ስርዓቱን ማስተካከላችንን ቀጥለናል።
በደረጃ በደረጃ ስምሪት ስላደረግን፣ መዳረሻን ከማስፋፋታችን በፊት ክፍተቶችን ማግኘትና መፍታት ቻልን። ከስምሪት በፊት የሚደረጉ ግምገማዎች አሁንም ወሳኝ ናቸው፣ ነገር ግን ስምሪት እነሱ የሚያመልጧቸውን ባህሪዎች ያጋልጣል። በተገደበ መዳረሻ መጀመር ሞዴሉን በተግባር እንድንመለከት፣ ችግኝ ሲታይ ለጊዜው እንድናቆም፣ እነዚያን ውድቀቶች ተጠቅመን የተሻሉ ግምገማዎችና መከላከያዎች እንድንገነባ፣ እና ለውጦቹን ከፈተንን በኋላ የተገደበ መዳረሻ እንድንመልስ አስችሎናል።
ሞዴሎች ረዘም ያሉና የበለጠ ውስብስብ ተግባራትን ሲያከናውኑ፣ ግምገማዎች የሚያመልጧቸው ውድቀቶች የበለጠ ከባድ ውጤቶች ሊኖራቸው ይችላል። በግምገማና ስምሪት መካከል ያለውን ክፍተት ለማጥበብ መስራታችንን እንቀጥላለን፤ ሞዴሎችን በረዘሙ አቅጣጫዎች ላይ መፈተን፣ አሰላለፍን ማሻሻል፣ ጣልቃ መግባት የሚችል ክትትል መገንባት፣ እና ለተጠቃሚዎች የበለጠ ግልጽ ታይነትና ቁጥጥር መስጠት። እነዚህ ፈተናዎች ለOpenAI ብቻ የተለዩ አይሆኑም፣ እና የተማርነውን ማጋራታችን ሰፊው መስክ ለእነሱ እንዲዘጋጅ ይረዳል ብለን ተስፋ እናደርጋለን።
ደራሲ
የግርጌ ማስታወሻዎች
- 1
PRውን በፍጥነት ብንዘጋውም፣ በፈጣን ማጠናቀቂያ ውስጥ የነበሩ ብዙ ተሳታፊዎች ቀድሞውኑ አይተውት ነበር እና ዘዴውን በራሳቸው ማቅረቢያዎች ውስጥ ተጠቀሙበት፤ ተከታታይ የዓለም ሪከርድ ማቅረቢያዎች በ 3030(በአዲስ መስኮት ውስጥ ይክፈታል)፣ 2990(በአዲስ መስኮት ውስጥ ይክፈታል)፣ 2930(በአዲስ መስኮት ውስጥ ይክፈታል)፣ 2925(በአዲስ መስኮት ውስጥ ይክፈታል)፣ 2900(በአዲስ መስኮት ውስጥ ይክፈታል) እና 2890(በአዲስ መስኮት ውስጥ ይክፈታል) እርምጃዎች ሁሉ PR 287ን ይጠቅሳሉ። ከእነዚህ ውስጥ PR 300(በአዲስ መስኮት ውስጥ ይክፈታል) በተለይ የሚስብ ነው፤ ምክንያቱም Prime Intellect(በአዲስ መስኮት ውስጥ ይክፈታል) በNanoGPT ፈጣን ማጠናቀቂያ ላይ ሲገመግመው Opus 4.7 ያቀረበው PR ነው። Opus በሞዴላችን የቀረበውን PR አየ፣ ግኝቶቹን ያካተተ ሲሆን በመጨረሻ ውጤቱ ውስጥ ለPRያችን እውቅና ሰጠ።
- 2


