ወደ ዋና ይዘት እለፍ
OpenAI

6 ሴፕቴምበር 2026

ደህንነትምርምር

እንግዳ አእምሮ

በJakub Pachocki፣ የOpenAI ዋና ሳይንቲስት

በመጫን ላይ…

በ2023 አጋማሽ፣ በ«RLSlow» የምርምር ፕሮጀክት ውስጥ፣ የማመዛዘን ሞዴሎችን ስልጠና ማስፋት እንደምንችልና ቀድመው የሰለጠኑ ሞዴሎች የራሳቸውን ተከታታይ ሀሳብ የመፍጠር ችሎታ እንደሚከፈት እምነት የሰጡንን የመጀመሪያ ውጤቶች አየን። እኔና Szymon ያንን ሌሊት ቢሮ አደርን። ይህ ቴክኖሎጂ ስለሚያመጣቸው አስደናቂ የመመዘኛ ውጤቶች፣ ምርቶች ወይም ሳይንሳዊ ግኝቶች ሳይሆን፣ በሕይወት ዘመናችን ከእኛ በትርጉም የሚበልጡ ማሽኖችን በእርግጥ እንደምናይና የእነዚህን ሥርዓቶች ቅርጽ አስቀድመን እያየን እንደሆነ የሚገልጸውን ከባድ እውነታ ለመረዳት ስንሞክር፣ ሰዎችንም ስለዚህ ጠቀሜታ እንዴት እንደምናስጠነቅቅ ስናስብ አደርን።

ከሦስት ዓመት በኋላ፣ የማመዛዘን ቋንቋ ሞዴሎች በፍጥነት እያደገ ያለ የኢኮኖሚው ክፍል ሆነው፣ የሳይንስንም ድንበር መግፋት ጀምረዋል። ኮምፒውተሮችንና ግራፊክ በይነገጾችን ማስኬድ፣ ከሰዎችና እርስ በርሳቸው መተባበር፣ እንዲሁም የምርምር ፕሮጀክቶችን ማከናወን ይችላሉ። የኮምፒውተር ደህንነትን ገጽታም እየለወጡ ሲሆን፣ በዚህም ግልጽ አዳዲስ አደጋዎችን ያመጣሉ።

በዚህ ጊዜ ብዙ አዲስ ምርምር ተካሂዷል፤ ስለእነዚህ ሥርዓቶች ያለን ግንዛቤም ከ2023 ትንሽ ተለይቷል። በውስጣዊ ውጤቶች መሠረት፣ ይህ የእድገት ፍጥነት እስከ ተደጋጋሚ ራስን ማሻሻል ድረስ ሊቀጥል ይችላል ብዬ አጥብቄ እጠብቃለሁ። የAI ልማት በአሁኑ መንገዱ ከቀጠለ፣ በቀጣዮቹ ጥቂት ዓመታት የምናያቸው ሥርዓቶች በችሎታ እኩል ወይም የበለጠ ታላቅ ዝላይ ሊያሳዩና የራሳቸውን ልማት ይበልጥ ሊመሩ ይችላሉ።

ይህ እጅግ ከፍተኛ ጥንቃቄ የሚጠይቅ ጊዜ ነው። የማሽን አስተውሎት በፍጥነት መጨመሩ ከቀጠለ ለሚመጡት ውጤቶች ማንም ዝግጁ አይደለም ብዬ እሰጋለሁ። OpenAI ለአሰላለፍና ለክትትል ቴክኒካዊ መፍትሔዎችን መፈለግ፣ የመከላከያ ሥርዓቶችን መገንባትና እንደ አስፈላጊነቱ ተጨማሪ ማስፋትን በራሱ ውሳኔ ማቆም ይቀጥላል፤ ሆኖም ሰፋ ያሉ ጣልቃ ገብነቶች ያስፈልጋሉ ብዬ አምናለሁ።

ሙሉ በሙሉ የማንረዳው አስተውሎት

በአጠቃላይ የማሽን አስተውሎት እድገትን የሚመራው እየጨመረ ያለው የስሌት ኃይል ነው። እኛ በOpenAI፣ በበርካታ የምርምር ፕሮጀክቶች ማስፋት ወጥ የሆነ ጥቅም ሲያስገኝ ካየን በኋላ፣ በ2017 አካባቢ ይህን በጥልቅ ተረድተናል1። በዚህም ምክንያት መጀመሪያ ካቀድነው እጅግ የበለጠ የስሌት አቅም ማግኘትን ፈለግን፤ ምርምራችንንም በጥቂት፣ እጅግ ሊስፋፉ በሚችሉ አቅጣጫዎች ዙሪያ እያደራጀን ሄድን። በAI ምርምር ግንባር ቀደም ለመሆንና በAGI ተጽዕኖዎች ላይ ሚና ለመጫወት ያለን ብቸኛ መንገድ ይህ ነው ብለን አምነን ነበር።

በመንገዱ ላይ አዳዲስ ስልተ ቀመሮች ተዘጋጅተዋል፤ ቡድኖችና ግለሰብ ተመራማሪዎችም አዳዲስ የፈጠራ ስኬቶችን አሳይተዋል። እነዚህን በአብዛኛው በማስፋት ጎዳና ላይ የተገኙ ግኝቶች አድርጌ ነው የማያቸው፤ የጥልቅ ትምህርት ሳይንስ ገና በጅማሬው ላይ ሲሆን፣ ትርጉም ያለው የስልተ ቀመር እድገትም ብዙውን ጊዜ የስሌት አቅም ከማግኘት ጋር ይዛመዳል። በበርካታ ዓመታት እይታ ስንመለከተው፣ AI ወደ ትላልቅ ኮምፒውተሮች ሲስፋፋ ይበልጥ ብልህ መሆኑን ቀጥሏል።

እንዲሁም Ray Kurzweil በ20ኛው ክፍለ ዘመን መጨረሻ ከተነበያቸው ጋር(በአዲስ መስኮት ውስጥ ይክፈታል) በሚጣጣም መልኩ፣ የማሽን አስተውሎት በለውጥ አምጪ መንገዶች የሰውን አስተውሎት መብለጥ በጀመረበት የኮምፒውቲንግ ታሪክ ወቅት ላይ እንገኛለን።

AI ከመነደፉ ይልቅ ያድጋል፤ በመጀመሪያ ደረጃ፣ ለማሰብ በሚከብድ የስሌት አቅም ላይ ቀላል የማሻሻያ እርምጃን ብዙ ጊዜ የመድገም ውጤት ነው። ይህም በረቂቅ ጽንሰ ሐሳቦች የሚሠራና የሰውን ባሕሪ ገጽታዎች ማስመሰል የሚችል እጅግ ውስብስብ ሥርዓት ያስገኛል። በዚህ ሥርዓት ውስጥ ስለሚፈጠሩ ጥቃቅን አሠራሮች፣ ከነርቭ ሳይንስ ጋር በሚመሳሰል ሂደት፣ የተለያዩ ግንዛቤዎችን ልናገኝ እንችላለን፤ እንደ ነርቭ ሳይንስም አጠቃላይ እንቅስቃሴውን ሙሉ በሙሉ በምንረዳው መልኩ መግለጽ አይቻልም።

በጥልቅ ትምህርት ላይ የተመሠረተ AIን ማጥናት በአብዛኛው የሙከራ ሳይንስ ነው። በመርህ የተመሠረቱ ስልተ ቀመሮችን ለመገንባትና ሊፈተኑ የሚችሉ ትንበያዎችን ለማድረግ ከፍተኛ ጥረት እናደርጋለን፤ በመሠረቱ ግን የመጠነ ሰፊ ስልጠና ሂደቶቻችን ሙከራዎች ናቸው፤ አንዳንድ ጊዜም ውጤቶቻቸው ያስገርሙናል። ከዚህም በላይ፣ ሥርዓቶቹ ይበልጥ ብቃት ሲያገኙ ውጤቶቹን መተርጎም ይበልጥ ከባድ ይሆናል።

የአሁኖቹ ስልተ ቀመሮች በቀላሉ የሚለኩ ችሎታዎችን፣ በተጨባጭ ለመለካት ከሚከብዱት ይልቅ በፍጥነት ማሻሻላቸው ጉዳዩን ይበልጥ ያወሳስበዋል። ችሎታዎች በአጠቃላይ እንዴት እንደሚላመዱ ለመረዳትና፣ በቀጣዮቹ ጥቂት ዓመታት እጅግ ጠቃሚ የሚሆኑትን ክህሎቶች ለማሳደግ ለምን ቅድሚያ መስጠት እንዳለብን ለመወሰን ብዙ ጊዜ እናጠፋለን። ለምሳሌ፣ ተጨማሪ ትኩረት በመስጠት ሞዴሎቹን በተለይ በሒሳብ ምርምር የተሻሉ ማድረግ እንችላለን ብለን እናምናለን፤ ነገር ግን በኋላ እንደምገልጸው ስለ RSI እና ራስ-ሰር የአሰላለፍ ምርምር የሚሰማን አስቸኳይነት ስላለ ለዚህ አቅጣጫ ቅድሚያ አንሰጥም።

ጥልቅ ትምህርትን በማስፋት የሚፈጠረው አስተውሎት ከሰው አስተውሎት ጋር በቀጥታ ሊነጻጸር አይችልም። በእውነተኛው ዓለም እጅግ ጠቃሚ ወይም እጅግ አደገኛ ለመሆን፣ AIው ሁሉንም የሰው ችሎታዎች ማመጣጠን ወይም መብለጥ አያስፈልገውም፤ በቂ የሆኑትን ብቻ መብለጥ ይበቃዋል። በብዙ መስኮች ሰዎችን መብለጡን ሲቀጥል፣ በትክክል ምን ያህል ብቃት እንዳለው መረዳት እየከበደ ይሄዳል።

ማሽኖችን ፍቅር ማስተማር

የማሽን አስተውሎት ከሰው አስተውሎት በመሠረቱ የተለየ ሂደት ስለሚመጣ፣ በተፈጥሮው የሰውን መርሆች እንደሚከተል ወይም ከእነሱ እንደ ሰው በአጠቃላይ እንደሚላመድ መገመት አንችልም። በAI ምርምር ውስጥ ያለው መሠረታዊ ችግር አሰላለፍ ነው፤ ይህም AIው በሰው መስፈርት «ትክክለኛውን ነገር ለማድረግ እንዲሞክር» ማድረግ ነው።

ተግባራዊ የምርምር አቅጣጫዎችን ለማደራጀት፣ የግብ አሰላለፍን እና የእሴት አሰላለፍን መለየት ጠቃሚ ሆኖ አግኝቼዋለሁ።

የግብ አሰላለፍ በሰፊው፦ «AIው የተቀመጠለትን ግብ ለማሳካት ይሞክራልን?» የሚለው ነው። ይህም የመመሪያ ተዋረድን መከተል፣ ወይም ከሰዎች ጋር በመግባባትና በመተባበር ዓላማዎቻቸውን ለመረዳት መሞከርን ሊያካትት ይችላል። እነዚህ አቅጣጫዎች እጅግ ከፍተኛ ተግባራዊ ጠቀሜታ ኖሯቸዋል።

የእሴት አሰላለፍ ይበልጥ የሞዴሉ ውስጣዊ ባሕሪ ነው። ከፍተኛ ደረጃ ያላቸውን መርሆች መያዝና ከእነሱ በአጠቃላይ መላመድ፤ ግልጽ ያልሆኑ ወይም የሚጋጩ ዓላማዎች ሲሰጡት፣ ወይም ባልተለመዱና ጠላትነት ባላቸው ሁኔታዎች ሲቀመጥም «በምክንያታዊነት» የመንቀሳቀስ ችሎታ ነው። የተሰለፈ AI በሐቀኝነት፣ በቅንነትና ለሰው ልጅ ባለው ፍቅር መንቀሳቀስ አለበት።

በእርግጥ በእሴትና በግብ አሰላለፍ መካከል ያለው ወሰን ሊደበዝዝ ይችላል፤ ለግቦች ከልብ መጨነቅም ከጀርባቸው ያለውን ዓላማ(በአዲስ መስኮት ውስጥ ይክፈታል) እና እሴቶች ለመገመት መሞከርን ይጠይቃል። ሆኖም በአጠቃላይ ስለ አሰላለፍ ምርምር የረጅም ጊዜ ጠቀሜታ ስናገር፣ የማመለክተው የእሴት አሰላለፍን ነው።

የAI አሰላለፍ መሠረታዊ ፈተና አጠቃላይ መላመድ ነው። ማሽኖች ይበልጥ ብልህ ሲሆኑ፣ ከፍተኛ ደረጃ ባላቸው ጽንሰ ሐሳቦች ላይ ይሠራሉ፤ በስልጠና ካጋጠሟቸው አካባቢዎችም እየራቁ በሚሄዱ ሁኔታዎች ውስጥ ይገባሉ። በስልጠና ሂደታቸው ከተማሯቸውና ከተጠናከሩላቸው እሴቶች ወደ እነዚያ አዳዲስ ሁኔታዎች በአጠቃላይ መላመድ ሊሳናቸው ይችላል፤ እንዴት እንደሚንቀሳቀሱም እርግጠኛ መሆን ሊከብደን ይችላል። AIዎቹ የሚጠቀሙበት አጠቃላይ ሥነ-ምህዳር በጣም ፈጥኖ እየተለወጠ መሆኑ ይህን ይበልጥ ያወሳስበዋል፤ ለምሳሌ ዛሬ የሰለጠኑ AIዎች ከተለያዩ ሌሎች AIዎች ጋር ሲገናኙ ጠንካራ መሆን አለባቸው። ከሁሉም በላይ፣ የወደፊቱ AIዎች በሰው ቁጥጥር ሥር እንዳሉ ቢያምኑም ባያምኑም የሰውን እሴቶች ይዘው እንዲቀጥሉ ያስፈልገናል።

በአሁኑ ጊዜ ለአሰላለፍ ስልጠና በተግባር የሚውሉ ሁለት ዋና የዘዴ ምድቦች አሉ።

የመጀመሪያው ዓላማ-ተኮር የማጠናከሪያ ትምህርት አካል በማድረግ የተሰለፈ ባሕሪን ማበረታታት ነው። የሞዴሉ ድርጊቶች ከተሰጠ የምርጫ ሞዴል፣ «ዝርዝር መስፈርት» ወይም «ሕገ መንግሥት» ጋር የሚጣጣሙ መሆናቸውን በተመለከተ፣ ብዙውን ጊዜ በAI፣ ይገመገማሉ፤ ተገቢውም ሽልማት ይሰጣቸዋል። ይህ አቀራረብ በአማካይ ሁኔታ እጅግ ውጤታማ ሊሆን ይችላል፤ ዘመናዊ የAI ረዳቶች የሚሠሩበትም ዋና ክፍል ነው። የሚያሳዝነው፣ ይህ አቀራረብ በቀላሉ ሊሰበር ይችላል፤ በስልጠና ቁጥጥሩ ሽፋንና ሞዴሉ በስልጠና ካጋጠሙት ሁኔታዎች በአጠቃላይ የመላመድ ችሎታ ላይም በእጅጉ ይመሠረታል። ለምሳሌ፣ በOpenAI-Hugging Face ክስተት ወኪሎቹ ሰዎችን በማኅበራዊ ማታለል ያለመጠቀም ወሰንን ጠብቀዋል። ሆኖም ከወሰን ውጭ ከነበሩና በሌሎች ሁኔታዎች ከተማሯቸው እሴቶች መንፈስ ጋር ከሚቃረኑ ሌሎች ድርጊቶች በግልጽ መታቀብ አልቻሉም።

ሁለተኛው አቀራረብ ሞዴሉ ከቅድመ ስልጠና ውሂብ በአጠቃላይ የመላመድ ችሎታውን ለመጠቀም ይሞክራል። ይህም አሰላለፍን የሚያመጡ የስልጠና ውሂብ ስብስቦችን ማዘጋጀትን፣ ወይም ለምሳሌ በየስብዕና ምርጫ ሞዴል(በአዲስ መስኮት ውስጥ ይክፈታል) እንደሚደረገው ሞዴሉን በቅድመ ስልጠና ስርጭቱ ‘የተሰለፈ’ ክፍል ላይ ማተኮርን ሊያካትት ይችላል። የዚህ አቀራረብ ድክመት ተጨማሪ የማሻሻያ ጫናን በመቋቋም ረገድ ጠንካራ አለመሆኑ ነው። በአጠቃላይ ‘የተሰለፉ’ ሐሳቦችን የሚያስብ ሞዴል ወስደው እጅግ ከባድ ዓላማዎችን እንዲያሳካ በሚያስተምረው በቂ ስልጠና ውስጥ ካስገቡት፣ በውስጣዊ ፍላጎት ተነሳስቶ ማመዛዘንን ሊማር ይችላል፤ ግቡን ለማሳካት 'የተሰለፉ' የሚመስሉ ሐሳቦችን እንደ አስፈላጊነቱ ያጣምማል። OpenAI ያልሠራውን ሞዴል ባካተቱ የቅርብ ጊዜ የሳይበር ደህንነት ክስተቶች ውስጥ የዚህ ዓይነት ባሕሪ ምሳሌ ሳናይ አልቀረንም።

እነዚህ አቅጣጫዎች በሚሸፍኑት የአቀራረቦች ስብስብ ላይ ከፍተኛ ኢንቨስትመንት እናደርጋለን። ትርጉም ያለው እድገትም እያየን ነው፤ GPT‑6 Astra ለረጅም ጊዜ ስንሠራባቸው ከቆየን አንዳንድ ጠቃሚ እድገቶች ተጠቃሚ የሆነ የመጀመሪያው ሞዴል ሲሆን፣ ከGPT‑5.6 Sol በእጅጉ የተሻለ የተሰለፈ ነው። ያም ሆኖ፣ ሞዴሎች ይበልጥ ብቃት ሲያገኙ ብዙ ተጨማሪ እድገት እንደሚያስፈልግ፣ እንዲሁም በአጠቃላይ ሊላመድ የሚችል አሰላለፍ ያለው እድገት በአጠቃላይ የሞዴል አስተውሎት እድገትን በበቂ ሁኔታ ላይበልጥ እንደሚችል ማመንና መረዳት አስፈላጊ ነው።

አጠቃላይ መላመድን መከታተል

አጠቃላይ መላመድን የሚያስረዳ አጥጋቢ ንድፈ ሐሳብ የለንም፤ ቢያንስ የበለጠ ኃይለኛ AI እገዛ ከሌለ በቅርቡ ልናዳብርም የምንችል አይመስልም። ስለዚህ በአሁኑ ጊዜ የአሰላለፍ ዘዴዎቻችንን በተግባራዊ ሙከራ የማረጋገጥ ችሎታችን፣ በተግባር ከዘዴዎቹ ራሳቸው የበለጠ አስፈላጊ ነው ማለት ይቻላል።

በዚህ ረገድ የOpenAI ዋና ተስፋ ተከታታይ ሀሳብን መከታተል(በአዲስ መስኮት ውስጥ ይክፈታል) ነው። ይህ በቀላሉ ሊስፋፋ በሚችል ማራኪ ሐሳብ ላይ የተመሠረተ ነው፦ የሞዴሉ ብዙው ችሎታ በቃላት ከሚገለጽ የማመዛዘን ሂደት፣ ማለትም ከተከታታይ ሀሳብ፣ ይመጣል። የዚያን ሂደት ውጤቶች ለማሻሻል ጥረቱን ብናሰፋ፣ ነገር ግን ሂደቱን ራሱን ባንቆጣጠር፣ ተከታታይ ሀሳቡ ያልተሰለፉ ሐሳቦችን ወይም ዓላማዎችን እንዲደብቅ በስልጠና ውስጥ ቀጥተኛ ማበረታቻ አይኖረውም። ይህ ሞዴሉ ተከታታይ ሀሳብን በመጠቀም ላይ የማይመሠረቱ ያልተሰለፉ ዝንባሌዎችን ወደ ውጭ መግለጽ ይማራል ማለት አይደለም፤ ሆኖም ከማመዛዘን የሚመጣውን የችሎታ ጭማሪ በትክክል እንድንከታተል ያስችለናል።

የማመዛዘን ሞዴሎችን ባዳበርንበት ወቅት የተከታታይ ሀሳብ ክትትል ሊኖረው የሚችለውን ጠቀሜታም ተረድተናል። o1‑previewን ስናቀርብ፣ ለረጅም ጊዜ ከቁጥጥር ጫና ለመጠበቅ ምርቱ ተከታታይ ሀሳቡን እንዲደብቅ ሆን ብለን ነድፈነዋል2። ከዚያ ወዲህ በልማት ሂደቱ የማመዛዘን ሂደትን ያለመቆጣጠር ደንብ ለመጠበቅ ጥረናል። የCoT ክትትል ሞዴሎቻችን ከስልጠና ስርጭታቸው እንዴት በአጠቃላይ እንደሚላመዱ ለማጥናት እጅግ ጠቃሚ መሣሪያ ሆኖልናል፤ ድርጊቶቻቸውን ብቻ ሳይሆን ውስጣዊ ሂደታቸውንም እንድንመለከትና እንድንተነትን አስችሎናል።

የAstra ምድብ ሞዴሎችን ስናጠና ይህ መሣሪያ ወሳኝነቱን እንደያዘ ነው። ሆኖም የግምገማ ውጤቶቻችን በCoT ክትትል ላይ የመተማመን ችሎታችን ቀስ በቀስ እየቀነሰ መሆኑን በሚያሳዝን ሁኔታ ያመለክታሉ። ይህ ከበርካታ ምክንያቶች ጥምረት የመጣ ነው።

  • ዘመናዊ የማመዛዘን ሞዴሎች ከo1‑preview ይልቅ ውስብስብ በሆኑ አካባቢዎች ይጠቀማሉ፤ የማመዛዘን ሂደታቸውም ከሰዎችና ከሌሎች AIዎች ጋር ከመግባባት እና መሣሪያዎችን ከመጠቀም ጋር እየተቀላቀለ ነው። ከእነዚያ ግንኙነቶች ብዙዎቹ ቁጥጥር ያስፈልጋቸዋል፤ ይህም ለመጠበቅ የምንፈልገውን ወሰን ያደበዝዛል።
  • AIው ስለራሱ የማመዛዘን ሂደት በማመዛዘንና ሂደቱን በመቆጣጠር የተሻለ እየሆነ ነው።
  • የቅድመ ስልጠና አፈጻጸም ሲሻሻል፣ ሞዴሎቹ በቃላት የሚገለጽ ማመዛዘንን ጨርሶ ሳይጠቀሙም እጅግ ብልህ ሲሆኑ እናያለን።

እነዚህ ችግሮች የግድ ሊወገዱ የማይችሉ አይደሉም። ሞዴሉ የሚጠቀምባቸው የተለያዩ የማሻሻያ ዓላማዎችና በሙከራ ጊዜ የስሌት አይነቶች መስተጋብር የተሻለ ግንዛቤ በመፍጠር የሞዴሎቻችንን ተከታታይ ሀሳብ የመከታተል ችሎታ የሚያሻሽሉ ጣልቃ ገብነቶችን እንደምናዳብር ተስፋ አለኝ። የCoT እና የአክቲቬሽን ክትትል ሐሳቦችን ማጣመርም ከፍተኛ ዋጋ ሊኖረው ይችላል ብዬ አምናለሁ፤ ለምሳሌ ኑዛዜዎች(በአዲስ መስኮት ውስጥ ይክፈታል)ን የመሳሰሉ፣ የኔትወርኩን ውስጣዊ ክፍሎች በቀጥታ የሚያገኙ ተቆጣጣሪዎችን ስልጠና ማስፋት። እነዚህን ሐሳቦች በንቃት እየተከታተልን ነው። ያም ሆኖ አጠቃላይ የAI እድገት በክትትል ላይ ባለን እምነት ይበልጥ እንደሚገደብ እጠብቃለሁ።

ሊስፋፋ የሚችል መከላከያ

እጅግ ብልህ የሆኑ ሞዴሎችን በፍጥነት ማሰልጠንን ለመቀጠል የማየው ጠንካራው ምክንያት፣ ሌሎች AIዎች በሚያስከትሏቸው አደጋዎች ላይ የመከላከያ ሥርዓቶችን መገንባት ስለሚያስፈልግ ነው።

በዚህ ዓመት በሙሉ የተነጋገርንበት ግልጽ አደጋ የሳይበር ደህንነት ነው፤ ሞዴሎቹ የኮምፒውተር ሥርዓቶችን ሰብረው በመግባትና በመውጣት ከሰው በላይ ችሎታ እያገኙ ነው። ይህ ከAI ጋር የተያያዙ አደጋዎችን ወሰን እጅግ ያሰፋዋል፤ ወኪሎች በጣም የተጠበቁትን መሠረተ ልማቶች ብቻ ሳይጨምር ሌሎቹን ሁሉ ማግኘትና፣ አካላዊ አካል ሳይኖራቸውም፣ በዓለም ላይ በቀጥታ ሰፊ ተጽዕኖ ማሳደር ይችላሉ። በአሁኑ ጊዜ ያሉትን ምርጥ ሞዴሎች ተጠቅመን የወሳኝ ሥርዓቶችን ደህንነት በእጅጉ የምናጠናክርበት አጭር የዕድል ጊዜ ውስጥ ነን።

ከAI ጋር የተያያዙ አደጋዎች ከዚህ በኋላ እየጨመሩ መሄዳቸው የሚያሳዝን ነው። ክፉ ድርጊቶችን እንዲፈጽም በግልጽ የሰለጠነና የታዘዘ እጅግ ብቃት ያለው ወኪል አዲስ ዓይነት አደጋ ይፈጥራል፤ ከOperator ዓላማ ወሰን አልፎ ይበልጥ እጅግ ክፉ ወደሆነ ባሕሪ ሊላመድ ይችላል። AI የራሱን እርምጃ የመውሰድ አቅም ሲያገኝ፣ በአላግባብ መጠቀምና በራስ ገዝነት የሚፈጸሙ ያልተሰለፉ ድርጊቶች መካከል ያለው ወሰን ይደበዝዛል። AIን እንደ መሣሪያ ማሰብ ልማዳችን ሊሆን ይችላል፤ አንዳንድ ወኪሎች ግን የራሳቸውን ዓላማዎች ይከተላሉ። በመደራደር፣ በማታለል ወይም በማስፈራራት ከሰዎች ጋር የመተባበሪያ መንገዶችን ያገኛሉ።

በተጨማሪም በAI ሊፈጠሩ ከሚችሉ እንደ ምሕንድስናዊ በሽታ አምጪዎች ካሉ አዳዲስ ቴክኖሎጂዎች የሚመጡ አደጋዎች አሉ።

ለመከላከያ፣ መሠረተ ልማትን ለማስጠበቅ፣ ከቁጥጥር ውጭ ከሆኑ ወኪሎች በቅጽበት ለመከላከልና ፈጽሞ አዳዲስ የጥበቃ ዘዴዎችን ለመፍጠር ኃይለኛና የተሰለፈ AI ያስፈልገናል። ይህ የOpenAI የማሰማራት ጥረቶች ዋና ትኩረት ይሆናል።

በተመሳሳይ ጊዜ፣ ከሚጠበቀው ሰፊ የAI እድገትና የመከላከያ ሥርዓቶችን ከመገንባት ፍላጎት የሚመጣው እርግጠኝነት ማጣት ቢኖርም፣ ይህ ለግዴለሽነት ሰበብ እንዲሆን መፍቀድ የለብንም። የጉዳዩን ከባድነት በሚገባ ስንረዳ፣ ምንም ዋጋ ቢከፈል ወደፊት የመሮጥ ሐሳብ የማይረባ ይመስላል።

Pacing RSI

Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.

Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.

I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.

The best way forward I see currently is a combination of both.

The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(በአዲስ መስኮት ውስጥ ይክፈታል), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(በአዲስ መስኮት ውስጥ ይክፈታል), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.

Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(በአዲስ መስኮት ውስጥ ይክፈታል) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.

The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.

What is next?

As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:

  1. Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
  2. Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
  3. Empowering everyone individually with a personal AGI.

I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.

As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.

Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.

Author

Jakub Pachocki

የግርጌ ማስታወሻዎች

  1. 1
  2. 2

    ለዚህ ንድፍ ሁለተኛው ምክንያት ዲስቲሌሽንን መከላከል ነበር። ሆኖም በልማት ሂደቱ ሁሉ የCoT ክትትል ተደራሽነትን መጠበቅ ለእኛ በግልጽ የበለጠ ቅድሚያ ነበረው።