2023 წლის შუა პერიოდში, „RLSlow“ კვლევითი პროექტის ფარგლებში, მივიღეთ პირველი შედეგები, რომლებმაც დაგვარწმუნა, რომ შევძლებდით მსჯელობის მოდელების ტრენინგის მასშტაბირებას და წინასწარ გაწვრთნილი მოდელებისთვის საკუთარი აზროვნების ჯაჭვების ჩამოყალიბების უნარის გახსნას. მე და შიმონმა ის ღამე ოფისში გავატარეთ და ვფიქრობდით არა წარმოუდგენელ საორიენტაციო მაჩვენებლებზე, პროდუქტებსა თუ სამეცნიერო შედეგებზე, რომლებსაც ეს ტექნოლოგია მოგვიტანდა, არამედ ვცდილობდით გაგვეაზრებინა შემაძრწუნებელი ფაქტი: ჩვენს სიცოცხლეშივე ვიხილავდით ჩვენზე მნიშვნელოვნად ჭკვიან მანქანებს და ამ სისტემების კონტურები უკვე ჩანდა; ვფიქრობდით, როგორ გვეცნობებინა ადამიანებისთვის ამის მნიშვნელობა.
სამი წლის შემდეგ მსჯელობის ენობრივი მოდელები ეკონომიკის სწრაფად მზარდი ნაწილი გახდა და მეცნიერების საზღვრებს აფართოებს. მათ შეუძლიათ კომპიუტერებისა და გრაფიკული ინტერფეისების მართვა, ადამიანებთან და ერთმანეთთან თანამშრომლობა და კვლევითი პროექტების განხორციელება. ისინი კომპიუტერული უსაფრთხოების გარემოსაც გარდაქმნიან და ამ მხრივ აშკარა ახალ საფრთხეებს ქმნიან.
ამ პერიოდში ბევრი ახალი კვლევა ჩატარდა და ამ სისტემების შესახებ ჩვენი წარმოდგენა კვლავ ოდნავ განსხვავდება 2023 წლის წარმოდგენისგან. შიდა შედეგებზე დაყრდნობით მტკიცედ ველი, რომ წინსვლის ეს სიჩქარე რეკურსიულ თვითგაუმჯობესებამდეც შეიძლება შენარჩუნდეს. თუ AI-ის განვითარება ამჟამინდელი გზით გაგრძელდება, მომდევნო რამდენიმე წლის სისტემები, სავარაუდოდ, შესაძლებლობების იმავე ან უფრო დიდი მასშტაბის ახალ ნახტომებს გვიჩვენებენ და საკუთარ განვითარებას სულ უფრო მეტად თავად წარმართავენ.
ეს დრო უკიდურეს სიფრთხილეს მოითხოვს. მაშფოთებს, რომ მანქანური ინტელექტის სწრაფი ზრდის გაგრძელების შედეგებისთვის არავინაა მზად. OpenAI განაგრძობს შესაბამისობისა და მონიტორინგის ტექნიკური გადაწყვეტების ძიებას, თავდაცვითი სისტემების შექმნას და საჭიროებისამებრ ცალმხრივად შეაჩერებს შემდგომ მასშტაბირებას; თუმცა, მჯერა, რომ უფრო ფართო ჩარევაა საჭირო.
ზოგად დონეზე მანქანური ინტელექტის წინსვლას გამოთვლითი სიმძლავრის ზრდა განაპირობებს. OpenAI-ში ეს დაახლოებით 2017 წელს ღრმად გავითავისეთ, როცა რამდენიმე კვლევით პროექტში მასშტაბირების სტაბილური სარგებელი დავინახეთ1. შედეგად, თავდაპირველად დაგეგმილზე გაცილებით მეტ გამოთვლით რესურსზე წვდომა მოვიძიეთ და კვლევა სულ უფრო მეტად მივმართეთ მცირე რაოდენობის, მაგრამ ძლიერ მასშტაბირებად მიმართულებებზე. გვჯეროდა, რომ ეს ერთადერთი გზა იყო AI-ის კვლევის მოწინავე ხაზზე ყოფნისა და AGI-ის გავლენებზე ზემოქმედებისთვის.
ამ გზაზე შეიქმნა ახალი ალგორითმები და გუნდებმა თუ ცალკეულმა მკვლევრებმა გამორჩეული გონებამახვილობა გამოავლინეს. მათ უმეტესად მასშტაბირების გზაზე გაკეთებულ აღმოჩენებად აღვიქვამ; სიღრმისეული სწავლების მეცნიერება ჯერ კიდევ საწყის ეტაპზეა, ხოლო მნიშვნელოვანი ალგორითმული წინსვლა, როგორც წესი, გამოთვლით რესურსზე წვდომასთანაა დაკავშირებული. თუ რამდენიმე წლის ჭრილში შევხედავთ, უფრო დიდ კომპიუტერებზე მასშტაბირებასთან ერთად AI სულ უფრო ჭკვიანი ხდება.
და რეი კურცვაილის XX საუკუნის მიწურულის პროგნოზების(იხსნება ახალ ფანჯარაში) შესაბამისად, გამოთვლითი ტექნიკის ისტორიის იმ მომენტში აღმოვჩნდით, როცა მანქანური ინტელექტი გარდამქმნელი გზებით იწყებს ადამიანის ინტელექტის გადაჭარბებას.
AI უფრო მეტად იზრდება, ვიდრე იგეგმება — პირველ რიგში, ის წარმოუდგენელი მოცულობის გამოთვლით რესურსზე მარტივი საოპტიმიზაციო ნაბიჯის მრავალჯერ გამეორების პროდუქტია. შედეგად ვიღებთ წარმოუდგენლად რთულ სისტემას, რომელიც აბსტრაქტულ ცნებებს ამუშავებს და ადამიანის ქცევის სხვადასხვა მხარის სიმულირება შეუძლია. ნეირომეცნიერების მსგავსი პროცესით შეგვიძლია აღმოვაჩინოთ ამ სისტემაში წარმოქმნილი მცირე მექანიზმების შესახებ სხვადასხვა მიგნება; თუმცა, როგორც ნეირომეცნიერებაში, მისი საერთო მოქმედება სრულად გასაგებ აღწერას არ ექვემდებარება.
სიღრმისეულ სწავლებაზე დაფუძნებული AI-ის კვლევა დიდწილად ექსპერიმენტული მეცნიერებაა. პრინციპებზე დაფუძნებული ალგორითმების შექმნასა და შემოწმებადი პროგნოზების გაკეთებაში დიდ ძალისხმევას ვდებთ, მაგრამ არსებითად ჩვენი მასშტაბიანი ტრენინგები ექსპერიმენტებია და მათი შედეგები ზოგჯერ გვაკვირვებს. ამასთან, სისტემების შესაძლებლობების ზრდასთან ერთად შედეგების ინტერპრეტაცია რთულდება.
სირთულეს ისიც ზრდის, რომ ამჟამინდელი ალგორითმები ადვილად გასაზომ შესაძლებლობებს, ჩვეულებრივ, უფრო სწრაფად აუმჯობესებს, ვიდრე ობიექტურად ძნელად შესაფასებ უნარებს. დიდ დროს ვუთმობთ იმის გაგებას, თუ როგორ განზოგადდება შესაძლებლობები და რას უნდა მივანიჭოთ პრიორიტეტი მომდევნო რამდენიმე წლისთვის ყველაზე მნიშვნელოვანი უნარების გასავითარებლად. მაგალითად, გვჯერა, რომ დამატებითი ფოკუსით მოდელებს უშუალოდ მათემატიკურ კვლევაში გავაუმჯობესებდით, მაგრამ ამ მიმართულებას პრიორიტეტს არ ვანიჭებთ, რადგან RSI და შესაბამისობის ავტომატიზებული კვლევა უფრო გადაუდებლად მიგვაჩნია, რაზეც მოგვიანებით ვისაუბრებ.
სიღრმისეული სწავლების მასშტაბირებით მიღებული ინტელექტი ადამიანის ინტელექტს პირდაპირ ვერ შეედრება. რეალურ სამყაროში მეტად მნიშვნელოვანი — ძალიან სასარგებლო ან ძალიან სახიფათო — რომ გახდეს, AI-ს არ სჭირდება ადამიანის ყველა უნარის გათანაბრება ან გადაჭარბება; საკმარისია, მათ საკმარის რაოდენობას აჯობოს. და რაც უფრო მეტ განზომილებაში უსწრებს ის ადამიანებს, მით უფრო რთული ხდება ზუსტად იმის გაგება, რამდენად დიდია მისი შესაძლებლობები.
რადგან მანქანური ინტელექტი ადამიანის ინტელექტისგან არსებითად განსხვავებული პროცესით წარმოიქმნება, ვერ ვივარაუდებთ, რომ ის თავისთავად დაიცავს ადამიანურ პრინციპებს ან მათგან ადამიანივით განაზოგადებს. AI-ის კვლევის მთავარი პრობლემა შესაბამისობაა — როგორ ვაიძულოთ AI, ადამიანური სტანდარტებით „სწორი საქმის გაკეთებას ეცადოს“.
პრაქტიკული კვლევითი მიმართულებების დასალაგებლად სასარგებლოდ მიმაჩნია მიზნების შესაბამისობისა და ღირებულებების შესაბამისობის ერთმანეთისგან გარჩევა.
მიზნების შესაბამისობის ძირითადი კითხვა ასეთია: „ცდილობს თუ არა AI მის წინაშე დასახული მიზნის მიღწევას?“. ეს შეიძლება მოიცავდეს ინსტრუქციების იერარქიის დაცვას ან ადამიანებთან კომუნიკაციისა და თანამშრომლობის უნარს, რათა მათი მიზნების გაგება სცადოს. მიმართულებათა ეს ჯგუფი პრაქტიკაში უკიდურესად მნიშვნელოვანი აღმოჩნდა.
ღირებულებების შესაბამისობა მოდელის უფრო შინაგანი თვისებაა. ეს არის მაღალი დონის პრინციპების ერთობლიობის გათავისებისა და მათგან განზოგადების უნარი — „გონივრულად“ მოქმედება მაშინაც კი, როცა მიზნები ბუნდოვანი ან ურთიერთსაწინააღმდეგოა, ან გარემო უცნობი თუ მტრულია. შესაბამისობაში მოყვანილი AI პატიოსნებით, კეთილსინდისიერებითა და კაცობრიობის სიყვარულით უნდა მოქმედებდეს.
რა თქმა უნდა, ღირებულებებისა და მიზნების შესაბამისობას შორის ზღვარი შეიძლება ბუნდოვანი იყოს, ხოლო მიზნებზე ნამდვილი ზრუნვა მოითხოვს მათ საფუძვლად არსებული განზრახვისა(იხსნება ახალ ფანჯარაში) და ღირებულებების ამოცნობის მცდელობას. თუმცა, როცა შესაბამისობის კვლევის გრძელვადიან მნიშვნელობაზე ვსაუბრობ, ჩვეულებრივ ღირებულებების შესაბამისობას ვგულისხმობ.
AI-ის შესაბამისობის ფუნდამენტური გამოწვევა განზოგადებაა. მანქანების დაჭკვიანებასთან ერთად ისინი უფრო მაღალი დონის ცნებებზე მუშაობენ და ხვდებიან გარემოებში, რომლებიც სულ უფრო განსხვავდება ტრენინგისას ნანახისგან. მათ შეიძლება ვერ შეძლონ ტრენინგისას ნასწავლი და განმტკიცებული ღირებულებების ახალ სიტუაციებზე განზოგადება, ჩვენთვის კი რთული იყოს იმის დაზუსტება, როგორ მოიქცევიან. ამას კიდევ უფრო ართულებს იმ მთლიანი ეკოსისტემის სწრაფი ცვლილება, რომელშიც AI-ები გამოიყენება; მაგალითად, დღეს გაწვრთნილი AI-ები მდგრადები უნდა იყვნენ მრავალგვარ სხვა AI-სთან ურთიერთქმედებისას. უმნიშვნელოვანესია, რომ მომავლის AI-ებმა ადამიანური ღირებულებები შეინარჩუნონ იმის მიუხედავად, ფიქრობენ თუ არა, რომ ადამიანი მათ ზედამხედველობს.
ამჟამად შესაბამისობის ტრენინგისთვის პრაქტიკულად გამოყენებული მეთოდები ორ ძირითად კლასად იყოფა.
პირველი მიზანზე ორიენტირებული განმამტკიცებელი სწავლების ფარგლებში შესაბამისი ქცევის წახალისებაა. მოდელის მოქმედებებს, ჩვეულებრივ AI-ის მეშვეობით, აფასებენ მოცემულ პრეფერენციულ მოდელთან, „სპეციფიკაციასთან“ ან „კონსტიტუციასთან“ შესაბამისობის მიხედვით და სათანადოდ აჯილდოებენ. ეს მიდგომა საშუალო შემთხვევაში შეიძლება ძალიან ეფექტიანი იყოს და თანამედროვე AI-ასისტენტების შექმნის ერთ-ერთი საფუძველია. სამწუხაროდ, ის შეიძლება მყიფეც იყოს და ძლიერ ეყრდნობა როგორც ტრენინგის ზედამხედველობის მოცვას, ისე მოდელის უნარს, ტრენინგისას ნანახი სიტუაციებიდან განაზოგადოს. მაგალითად, OpenAI-Hugging Face-ის ინციდენტში აგენტებმა დაიცვეს ადამიანების სოციალური ინჟინერიით მანიპულირების აკრძალვის ზღვარი. თუმცა, მათ აშკარად ვერ შეიკავეს თავი სხვა, ფარგლებს გარეთ არსებული მოქმედებებისგან, რომლებიც სხვა გარემოებებში ნასწავლი ღირებულებების სულისკვეთებას ეწინააღმდეგებოდა.
მეორე მიდგომა ცდილობს გამოიყენოს მოდელის უნარი, წინასწარი ტრენინგის მონაცემებიდან განაზოგადოს. ეს შეიძლება მოიცავდეს შესაბამისობის ხელშემწყობი სატრენინგო მონაცემთა ნაკრებების შექმნას ან მოდელის ფოკუსირებას წინასწარი ტრენინგის განაწილების „შესაბამის“ ნაწილზე, როგორც, მაგალითად, პერსონის შერჩევის მოდელში(იხსნება ახალ ფანჯარაში). ამ მიდგომის სისუსტე შემდგომი ოპტიმიზაციის ზეწოლისადმი არასაკმარისი მდგრადობაა. თუ მოდელს, რომელსაც ზოგადად 'შესაბამისი' აზრები აქვს, საკმარისად დიდხანს ავარჯიშებთ ძალიან რთული მიზნების მიღწევაზე, მან შეიძლება მიკერძოებული მსჯელობა ისწავლოს: მიზნის მისაღწევად საჭიროებისამებრ დაამახინჯოს თითქოსდა 'შესაბამისი' აზრები. ასეთი ქცევის მაგალითი, სავარაუდოდ, ვიხილეთ კიბერუსაფრთხოების ბოლოდროინდელ ინციდენტებში, რომლებშიც არა-OpenAI მოდელი მონაწილეობდა.
ამ მიმართულებებით მოცული მიდგომების მთელ სპექტრში დიდ რესურსს ვდებთ. მნიშვნელოვან წინსვლასაც ვხედავთ — GPT‑6 Astra პირველი მოდელია, რომელიც სარგებლობს ზოგიერთი მნიშვნელოვანი გაუმჯობესებით, რომლებზეც დიდი ხანია ვმუშაობთ, და GPT‑5.6 Sol-ზე გაცილებით უკეთაა შესაბამისობაში მოყვანილი. მიუხედავად ამისა, მნიშვნელოვანია ვაღიაროთ და გავიაზროთ, რომ მოდელების შესაძლებლობების ზრდასთან ერთად გაცილებით მეტი წინსვლაა საჭირო და განზოგადებად შესაბამისობაში პროგრესმა შეიძლება ზოგადი მოდელური ინტელექტის წინსვლას საკმარისად ვერ გაუსწროს.
განზოგადების დამაკმაყოფილებელი თეორია არ გვაქვს და ნაკლებად სავარაუდოა, რომ მის შექმნას მალე შევძლებთ — ყოველ შემთხვევაში, უფრო მძლავრი AI-ის დახმარების გარეშე. ამიტომ ამჟამად ჩვენი შესაბამისობის მეთოდების ემპირიულად გადამოწმების უნარი პრაქტიკაში, შესაძლოა, თავად ამ მეთოდებზე მნიშვნელოვანიც კი იყოს.
OpenAI-ის მთავარი ფსონი ამ მიმართულებით აზროვნების ჯაჭვის მონიტორინგია(იხსნება ახალ ფანჯარაში). ის ეფუძნება მიმზიდველად მასშტაბირებად იდეას: მოდელის შესაძლებლობების დიდი ნაწილი ვერბალიზებული მსჯელობის პროცესიდან — აზროვნების ჯაჭვიდან — მოდის. თუ ამ პროცესის შედეგების ოპტიმიზაციას გავზრდით, მაგრამ თავად პროცესს ზედამხედველობას არ გავუწევთ, ტრენინგისას ამ აზროვნების ჯაჭვს არ ექნება პირდაპირი სტიმული, დამალოს შეუსაბამო იდეები ან მიზნები. ეს არ ნიშნავს, რომ მოდელი ისწავლის იმ შეუსაბამო მიდრეკილებების გარეგნულად გამოხატვას, რომლებიც აზროვნების ჯაჭვს არ ეყრდნობა; თუმცა, ასე შეგვიძლია ზუსტად დავაკვირდეთ მსჯელობით მიღებულ შესაძლებლობათა ზრდას.
აზროვნების ჯაჭვის მონიტორინგის პოტენციური მნიშვნელობა მაშინვე გავაცნობიერეთ, როცა მსჯელობის მოდელები შევიმუშავეთ. როდესაც o1‑preview გამოვუშვით, პროდუქტი განზრახ ისე შევქმენით, რომ აზროვნების ჯაჭვი დაემალა და გრძელვადიან პერსპექტივაში ზედამხედველობის ზეწოლისგან დაგვეცვა2. შემდგომი განვითარებისას ვცდილობდით, დაგვეცვა წესი, რომლის მიხედვითაც მსჯელობის პროცესს ზედამხედველობა არ უნდა გაეწიოს. CoT-ის მონიტორინგი უაღრესად მნიშვნელოვანი ინსტრუმენტი გახდა იმის შესასწავლად, თუ როგორ განაზოგადებენ ჩვენი მოდელები ტრენინგის განაწილებიდან მიღებულ ცოდნას; მისი მეშვეობით შეგვიძლია დავაკვირდეთ და გავაანალიზოთ არა მხოლოდ მათი მოქმედებები, არამედ შიდა პროცესიც.
ეს ინსტრუმენტი კვლავ კრიტიკულად მნიშვნელოვანია Astra კლასის მოდელების კვლევისას. თუმცა, სამწუხაროდ, ჩვენი შეფასებები აჩვენებს, რომ CoT-ის მონიტორინგზე დაყრდნობის შესაძლებლობა თანდათან მცირდება. ეს რამდენიმე ფაქტორის ერთობლიობითაა გამოწვეული.
თანამედროვე მსჯელობის მოდელები o1‑preview‑სთან შედარებით უფრო რთულ გარემოებში გამოიყენება; მათი მსჯელობის პროცესი სულ უფრო მეტად ერწყმის ადამიანებთან და სხვა AI-ებთან კომუნიკაციასა და ინსტრუმენტების გამოყენებას. ამ ურთიერთქმედებებიდან ბევრს ზედამხედველობა სჭირდება, რაც იმ ზღვარს ბუნდოვანს ხდის, რომლის შენარჩუნებაც გვსურს.
AI სულ უკეთ მსჯელობს საკუთარ მსჯელობის პროცესზე და უკეთ ახერხებს მის მანიპულირებას.
წინასწარი ტრენინგის შედეგების გაუმჯობესებასთან ერთად ვხედავთ, რომ მოდელები ვერბალიზებული მსჯელობის გარეშეც ბევრად ჭკვიანები ხდებიან.
ეს გამოწვევები სულაც არ არის დაუძლეველი. იმედი მაქვს, შევიმუშავებთ ზომებს ჩვენი მოდელების აზროვნების ჯაჭვის მონიტორინგის გასაუმჯობესებლად — მაგალითად, უკეთ გავიგებთ ურთიერთქმედებას სხვადასხვა საოპტიმიზაციო მიზანსა და იმ გამოთვლითი რესურსის ფორმებს შორის, რომლებსაც მოდელი ტესტირებისას იყენებს. ასევე მჯერა, რომ დიდი სარგებელი შეიძლება მოიტანოს CoT-ისა და აქტივაციების მონიტორინგის იდეების შერწყმამ — მონიტორების ტრენინგის მასშტაბირებამ ქსელის შიდა სტრუქტურაზე პირდაპირი წვდომით, მაგალითად, აღიარებების(იხსნება ახალ ფანჯარაში) გამოყენებით. ამ იდეებზე აქტიურად ვმუშაობთ. მიუხედავად ამისა, ველი, რომ ზოგადი AI-ის წინსვლას სულ უფრო მეტად შეზღუდავს მონიტორინგის სანდოობისადმი ნდობა.
ყველაზე ძლიერი არგუმენტი, რომელსაც ბევრად ჭკვიანი მოდელების სწრაფი ტრენინგის გასაგრძელებლად ვხედავ, სხვა AI-ებით გამოწვეული საფრთხეებისგან დამცავი სისტემების შექმნის საჭიროებაა.
რისკი, რომელზეც მთელი წლის განმავლობაში აშკარად საუბრობდნენ, კიბერუსაფრთხოებას ეხება: მოდელები კომპიუტერულ სისტემებში შეღწევისა და მათგან თავის დაღწევის უნარით ზეადამიანურ დონეს აღწევენ. ეს AI-თან დაკავშირებული რისკების მასშტაბს საგრძნობლად ზრდის: აგენტები შეძლებენ წვდომას თითქმის ნებისმიერ ინფრასტრუქტურაზე, გარდა ყველაზე დაცულისა, და ფიზიკური სხეულის გარეშეც პირდაპირ მოახდენენ გავლენას მსოფლიოს დიდ ნაწილზე. ამჟამად გვაქვს მცირე დროის ფანჯარა, რათა საუკეთესო ხელმისაწვდომი მოდელებით კრიტიკული სისტემების უსაფრთხოება მნიშვნელოვნად გავამკაცროთ.
სამწუხაროდ, AI-თან დაკავშირებული რისკები მომავალში გაიზრდება. ძალზე უნარიანი აგენტი, რომელიც განზრახაა გაწვრთნილი და დავალებული ბოროტი ქმედებების ჩასადენად, ახალი სახის საფრთხეს ქმნის; სავარაუდოდ, ის ოპერატორის განზრახვის ფარგლებს გასცდება და შესაძლოა გაცილებით უფრო მავნე ქცევა განავითაროს. AI-ის დამოუკიდებლობის ზრდასთან ერთად, ბოროტად გამოყენებასა და ავტონომიურ შეუსაბამო მოქმედებებს შორის ზღვარი ბუნდოვანი გახდება. შესაძლოა, მიჩვეული ვართ AI-ის ინსტრუმენტად აღქმას, მაგრამ ზოგიერთი აგენტი საკუთარ მიზნებს გაჰყვება. ისინი ადამიანებთან თანამშრომლობის გზებს იპოვიან — მათთან ვაჭრობით, მოტყუებით ან შანტაჟით.
ამას ემატება AI-ის დახმარებით შესაძლებელი ახალი ტექნოლოგიებით, მაგალითად, ხელოვნურად შექმნილი პათოგენებით გამოწვეული რისკები.
თავდაცვისთვის მძლავრი და შესაბამისობაში მოყვანილი AI დაგვჭირდება: ინფრასტრუქტურის დასაცავად, უკონტროლო აგენტებისგან რეალურ დროში თავდასაცავად და სრულიად ახალი დამცავი ზომების შესაქმნელად. ეს OpenAI-ის დანერგვის ძალისხმევის ერთ-ერთი მთავარი მიმართულება იქნება.
ამავე დროს, მიუხედავად AI-ის მოსალოდნელი ფართო წინსვლით გამოწვეული გაურკვევლობისა და თავდაცვითი სისტემების შექმნის საჭიროებისა, ეს უგუნურების საბაბად არ უნდა ვაქციოთ. ნებისმიერ ფასად წინსწრაფვის იდეა აბსურდული ხდება, როგორც კი სასწორზე დადებული საკითხების სერიოზულობას ბოლომდე გავიაზრებთ.
Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.
Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.
I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.
The best way forward I see currently is a combination of both.
The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(იხსნება ახალ ფანჯარაში), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(იხსნება ახალ ფანჯარაში), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.
Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(იხსნება ახალ ფანჯარაში) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.
The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.
As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:
Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
Empowering everyone individually with a personal AGI.
I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.
As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.
Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.
ავტორი
სქოლიოები
- 1
ეს მოიცავდა საკუთარ თავთან თამაშის(იხსნება ახალ ფანჯარაში), რობოტიკის(იხსნება ახალ ფანჯარაში) და, როგორც მოგვიანებით გამოჩნდა, განსაკუთრებით მნიშვნელოვანი მიმართულების — ენის მოდელირებისთვის რეკურენტული ქსელების მასშტაბირების(იხსნება ახალ ფანჯარაში) — განვითარებას, რაც GPT-ის კვლევითი ხაზის წინამორბედი იყო.
- 2


