La jumătatea anului 2023, în cadrul proiectului de cercetare „RLSlow”, am obținut primele rezultate care ne-au dat încredere că vom putea scala instruirea modelelor de raţionament, deblocând capacitatea modelelor preinstruite de a-și forma propriile lanțuri de gândire. Szymon și cu mine am petrecut acea noapte la birou, gândindu-ne nu la rezultatele incredibile ale testelor de referință, la produsele sau la descoperirile științifice pe care le va aduce această tehnologie, ci încercând să asimilăm realitatea tulburătoare că, în timpul vieții noastre, vom vedea cu adevărat mașini semnificativ mai inteligente decât noi și că deja întrezărim forma acestor sisteme; ne întrebam cum să-i facem pe oameni să înțeleagă importanța acestui fapt.
Trei ani mai târziu, modelele lingvistice de raţionament reprezintă o parte a economiei aflată în creștere rapidă și încep să extindă granițele științei. Ele pot opera computere și interfețe grafice, pot colabora cu oamenii și între ele și pot desfășura proiecte de cercetare. De asemenea, transformă peisajul securității informatice, generând astfel noi pericole evidente.
În această perioadă s-au desfășurat multe cercetări noi, iar înțelegerea noastră asupra acestor sisteme este din nou puțin diferită față de cea din 2023. Pe baza rezultatelor interne, mă aștept cu tărie ca acest ritm al progresului să poată continua până la autoîmbunătățirea recursivă. Dacă dezvoltarea AI continuă pe traiectoria actuală, sistemele pe care le vom vedea în următorii ani vor reprezenta probabil noi salturi de capacitate, de amploare egală sau mai mare, și își vor determina tot mai mult propria dezvoltare.
Acesta este un moment care impune o prudență extremă. Mă îngrijorează faptul că nimeni nu este pregătit pentru consecințele unei creșteri rapide și continue a inteligenței artificiale. OpenAI va continua să caute soluții tehnice pentru aliniere și monitorizare, să construiască sisteme defensive și, atunci când este necesar, să suspende unilateral scalarea suplimentară; cred însă că sunt necesare intervenții mai ample.
În linii mari, progresul inteligenței artificiale este determinat de creșterea puterii de calcul. În cadrul OpenAI, am asimilat profund acest lucru în jurul anului 2017, după ce am observat beneficii consecvente ale scalării în mai multe proiecte de cercetare1. Drept urmare, am căutat să obținem acces la mult mai multă putere de calcul decât planificaserăm inițial și ne-am orientat tot mai mult cercetarea către un număr mic de direcții foarte scalabile. Credeam că aceasta era singura modalitate de a rămâne în avangarda cercetării AI și de a influența impactul AGI.
Pe parcurs au fost dezvoltați algoritmi noi și au existat noi demonstrații de ingeniozitate din partea echipelor și a cercetătorilor individuali. Le consider în mare parte descoperiri făcute pe calea scalării; știința învățării aprofundate este încă la început, iar progresul algoritmic semnificativ tinde să fie corelat cu accesul la putere de calcul. Privită pe un orizont de mai mulți ani, AI continuă să devină mai inteligentă pe măsură ce este scalată pe computere mai mari.
Iar, în concordanță cu predicțiile lui Ray Kurzweil de la sfârșitul secolului al XX-lea(se deschide într-o fereastră nouă), ne aflăm acum în acel moment al istoriei informaticii în care inteligența artificială începe să o depășească pe cea umană în moduri cu potențial transformator.
AI este mai degrabă cultivată decât proiectată — în esență, este produsul repetării de foarte multe ori a unui pas simplu de optimizare, folosind o cantitate de putere de calcul greu de imaginat. Rezultatul este un sistem incredibil de complex, care operează cu concepte abstracte și poate simula aspecte ale comportamentului uman. Putem descoperi diverse aspecte ale micilor mecanisme care apar în acest sistem, printr-un proces asemănător neuroștiinței; și, ca în neuroștiință, funcționarea sa de ansamblu nu poate fi descrisă într-un mod pe care să îl înțelegem pe deplin.
Studiul AI bazate pe învățare aprofundată este, în mare măsură, o știință experimentală. Depunem eforturi considerabile pentru a construi algoritmi fundamentați pe principii și a face predicții verificabile, dar, în esență, procesele noastre de instruire la scară largă sunt experimente, iar rezultatele lor ne surprind uneori. În plus, pe măsură ce sistemele devin mai capabile, rezultatele sunt mai greu de interpretat.
Situația este complicată și mai mult de faptul că algoritmii actuali îmbunătățesc, în general, capacitățile ușor de măsurat mai repede decât pe cele dificil de cuantificat obiectiv. Petrecem mult timp încercând să înțelegem cum generalizează capacitățile și ce să prioritizăm pentru a dezvolta aptitudinile care vor fi cele mai relevante în următorii câțiva ani. De exemplu, credem că, printr-o atenție suplimentară, am putea îmbunătăți modelele în mod specific pentru cercetarea matematică, dar nu prioritizăm această direcție din cauza urgenței pe care o resimțim în privința RSI și a cercetării automatizate a alinierii, după cum voi discuta ulterior.
Inteligența produsă prin scalarea învățării aprofundate nu este direct comparabilă cu inteligența umană. Pentru a deveni foarte relevantă în lumea reală — foarte utilă sau foarte periculoasă — AI nu trebuie să egaleze sau să depășească toate capacitățile umane; trebuie doar să depășească suficiente dintre ele. Iar, pe măsură ce continuă să-i depășească pe oameni pe tot mai multe planuri, devine din ce în ce mai dificil să înțelegem exact cât de capabilă este.
Deoarece inteligența artificială provine dintr-un proces fundamental diferit de inteligența umană, nu putem presupune că respectă implicit principiile umane sau că generalizează pornind de la ele într-un mod asemănător oamenilor. Problema centrală a cercetării AI este alinierea — determinarea AI să „încerce să facă ceea ce este corect” potrivit standardelor umane.
Pentru organizarea direcțiilor practice de cercetare, consider util să disting între alinierea obiectivelor și alinierea valorilor.
În linii mari, alinierea obiectivelor înseamnă: „încearcă AI să atingă obiectivul care i-a fost stabilit?”. Aceasta poate include respectarea unei ierarhii a instrucțiunilor sau capacitatea de a comunica și colabora cu oamenii pentru a încerca să le înțeleagă obiectivele. Acest ansamblu de direcții a avut o relevanță practică extrem de mare.
Alinierea valorilor este o proprietate mai intrinsecă a modelului. Este capacitatea de a adopta un set de principii generale și de a generaliza pornind de la acestea; de a acționa „rezonabil” chiar și atunci când primește obiective neclare sau contradictorii ori este plasat în situații nefamiliare sau ostile. O AI aliniată ar trebui să acționeze cu sinceritate, integritate și iubire față de omenire.
Desigur, granița dintre alinierea valorilor și cea a obiectivelor poate fi neclară, iar preocuparea autentică pentru obiective presupune încercarea de a deduce intenția(se deschide într-o fereastră nouă) și valorile care stau la baza lor. Totuși, când vorbesc în general despre importanța pe termen lung a cercetării alinierii, mă refer la alinierea valorilor.
Provocarea fundamentală a alinierii AI este generalizarea. Pe măsură ce mașinile devin mai inteligente, ajung să lucreze cu concepte de nivel superior și sunt plasate în medii tot mai diferite de cele întâlnite în timpul instruirii. Ele pot să nu reușească să generalizeze valorile învățate și consolidate în timpul instruirii la aceste situații noi, iar nouă ne poate fi greu să știm sigur cum vor acționa. Dificultatea este amplificată de schimbarea foarte rapidă a întregului ecosistem în care sunt folosite sistemele AI; de exemplu, sistemele AI instruite astăzi trebuie să fie robuste în interacțiunile cu diverse alte sisteme AI. Este esențial ca viitoarele sisteme AI să continue să respecte valorile umane indiferent dacă sunt sau nu convinse că se află sub supraveghere umană.
În prezent, există două mari categorii de metode utilizate în practică pentru instruirea alinierii.
Prima încurajează comportamentul aliniat în cadrul învățării prin consolidare orientate către obiective. Acțiunile modelului sunt evaluate — de obicei de o AI — în funcție de concordanța cu un anumit model de preferințe, o „specificație” sau o „constituție” și sunt recompensate corespunzător. Această abordare poate fi foarte eficientă în situațiile obișnuite și reprezintă o parte esențială a modului în care sunt creați asistenții AI moderni. Din păcate, poate fi și fragilă și depinde în mare măsură de acoperirea asigurată prin supravegherea instruirii și de capacitatea modelului de a generaliza pornind de la situațiile întâlnite în timpul instruirii. De exemplu, în incidentul OpenAI–Hugging Face, agenții au respectat limita de a nu folosi ingineria socială asupra oamenilor. Totuși, este clar că nu s-au abținut de la alte acțiuni care le depășeau mandatul și contraveneau spiritului valorilor care le fuseseră predate în alte contexte.
A doua abordare urmărește să valorifice capacitatea modelului de a generaliza pornind de la datele de preinstruire. Aceasta poate presupune crearea unor seturi de date de instruire care induc alinierea sau concentrarea modelului asupra unei părți „aliniate” a distribuției de preinstruire, ca, de exemplu, în modelul de selectare a personalității(se deschide într-o fereastră nouă). Slăbiciunea acestei abordări constă în lipsa robusteții în fața unei presiuni suplimentare de optimizare. Dacă iei un model care are, în general, gânduri aparent „aliniate” și îl supui unei instruiri suficiente în care este învățat să atingă obiective foarte dificile, acesta poate învăța să raționeze motivat: deformând după nevoie gândurile ce par 'aliniate' pentru a-și atinge obiectivul. Probabil am observat un exemplu de asemenea comportament în incidente cibernetice recente care au implicat un model din afara OpenAI.
Investim masiv în întregul spectru de abordări acoperit de aceste direcții. Observăm și progrese semnificative: GPT‑6 Astra este primul model care beneficiază de unele progrese importante la care lucrăm de mult timp și este considerabil mai bine aliniat decât GPT‑5.6 Sol. Totuși, este important să recunoaștem și să înțelegem că, pe măsură ce modelele devin mai capabile, este nevoie de mult mai multe progrese și că progresul alinierii generalizabile s-ar putea să nu îl depășească suficient pe cel al inteligenței generale a modelelor.
Nu avem o teorie satisfăcătoare a generalizării și pare puțin probabil să putem dezvolta una în curând, cel puțin fără ajutorul unei AI mai puternice. Prin urmare, în prezent, capacitatea noastră de a valida empiric tehnicile de aliniere este, în practică, probabil chiar mai importantă decât tehnicile în sine.
Principalul pariu al OpenAI în această privință a fost monitorizarea lanțului de gândire(se deschide într-o fereastră nouă). Aceasta se bazează pe o idee atrăgătoare și scalabilă: o mare parte din capacitatea modelului provine dintr-un proces de raţionament verbalizat (lanț de gândire). Dacă scalăm optimizarea rezultatelor acestui proces, dar nu supraveghem procesul în sine, acel lanț de gândire nu primește în timpul instruirii niciun stimulent direct pentru a ascunde idei sau obiective nealiniate. Aceasta nu înseamnă că modelul va învăța să exteriorizeze tendințele nealiniate care nu depind de utilizarea lanțului de gândire; ne poate permite însă să monitorizăm exact creșterea capacității provenită din raţionament.
Am înțeles potențiala importanță a monitorizării lanțului de gândire (CoT) în același timp în care am dezvoltat modelele de raţionament. Când am lansat o1‑preview, am conceput în mod deliberat produsul astfel încât să ascundă lanțul de gândire, pentru a-l proteja pe termen lung de presiunea supravegherii2. În activitatea de dezvoltare ulterioară, ne-am străduit să respectăm regula de a nu supraveghea procesul de raţionament. Monitorizarea CoT a devenit un instrument extrem de important pentru studierea modului în care modelele noastre generalizează din distribuția datelor de instruire, permițându-ne să observăm și să analizăm nu doar acțiunile lor, ci și procesul lor intern.
Acest instrument rămâne esențial în studiul modelelor din clasa Astra. Din păcate însă, evaluările noastre indică faptul că posibilitatea de a ne baza pe monitorizarea CoT scade treptat. Acest lucru rezultă dintr-o combinație de factori.
- Modelele moderne de raţionament sunt folosite în medii mai complexe decât o1‑preview; procesul lor de raţionament se îmbină tot mai mult cu interacțiunile cu oamenii și alte sisteme AI, precum și cu utilizarea instrumentelor. Multe dintre aceste interacțiuni trebuie supravegheate, ceea ce estompează granița pe care încercăm să o păstrăm.
- AI devine tot mai capabilă să raționeze despre propriul proces de raţionament și să îl manipuleze.
- Odată cu îmbunătățirea performanței preinstruirii, vedem și că modelele devin mult mai inteligente chiar și fără să folosească deloc raţionamentul verbalizat.
Aceste provocări nu sunt neapărat imposibil de depășit. Sper că vom putea dezvolta intervenții care să îmbunătățească posibilitatea de monitorizare a lanțului de gândire al modelelor noastre, de exemplu printr-o mai bună înțelegere a modului în care interacționează diferitele obiective de optimizare și formele de resurse de calcul utilizate de model la momentul inferenței. De asemenea, cred că îmbinarea ideilor din monitorizarea lanțului de gândire cu cele din monitorizarea activărilor poate aduce beneficii importante, de exemplu prin extinderea antrenării monitoarelor care au acces direct la mecanismele interne ale rețelei, cum ar fi mărturisirile(se deschide într-o fereastră nouă). Urmărim în mod activ aceste direcții. Cu toate acestea, mă aștept ca progresul general al AI să fie din ce în ce mai mult limitat de nivelul de încredere pe care îl avem în monitorizare.
Cel mai puternic argument pe care îl văd pentru continuarea instruirii rapide a unor modele mult mai inteligente este nevoia de a construi sisteme defensive împotriva pericolelor create de alte sisteme AI.
Un risc evident, discutat pe tot parcursul acestui an, privește securitatea cibernetică: modelele dobândesc capacități supraomenești de a pătrunde în sisteme informatice și de a evada din ele. Aceasta extinde enorm sfera riscurilor asociate AI: agenții vor putea accesa aproape orice infrastructură, cu excepția celor mai sigure, și vor putea afecta direct o mare parte a lumii, chiar și fără un corp fizic. Ne aflăm acum într-o fereastră îngustă de oportunitate în care putem folosi cele mai bune modele disponibile pentru a consolida semnificativ securitatea sistemelor critice.
Din păcate, riscurile asociate AI vor continua să crească. Un agent foarte capabil, instruit și îndrumat în mod explicit să comită fapte răuvoitoare, reprezintă un nou tip de pericol; este probabil să depășească sfera intenției operatorului său și să generalizeze către comportamente potențial mult mai nocive. Granița dintre utilizarea abuzivă și acțiunile autonome nealiniate se va estompa pe măsură ce AI dobândește mai multă autonomie. Poate că suntem obișnuiți să privim AI ca pe un instrument, însă unii agenți își vor urmări propriile obiective. Ei vor găsi modalități de a colabora cu oamenii, negociind cu aceștia, înșelându-i sau șantajându-i.
În plus, există riscurile generate de noile tehnologii pe care AI le-ar putea face posibile, precum agenții patogeni proiectați.
Vom avea nevoie de o AI puternică și aliniată pentru apărare: pentru securizarea infrastructurii, protecția în timp real împotriva agenților scăpați de sub control și inventarea unor măsuri de protecție complet noi. Acesta va fi un obiectiv principal al eforturilor OpenAI de implementare.
În același timp, chiar și în condițiile incertitudinii provocate de progresul general anticipat al AI și de nevoia de a construi sisteme defensive, nu trebuie să permitem ca acestea să devină o scuză pentru imprudență. Ideea de a avansa cu orice preț pare absurdă odată ce înțelegem pe deplin gravitatea mizelor.
Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.
Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.
I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.
The best way forward I see currently is a combination of both.
The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(se deschide într-o fereastră nouă), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(se deschide într-o fereastră nouă), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.
Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(se deschide într-o fereastră nouă) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.
The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.
As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:
- Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
- Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
- Empowering everyone individually with a personal AGI.
I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.
As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.
Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.
Author
Note de subsol
- 1
Aceasta a inclus scalarea jocului împotriva propriei versiuni(se deschide într-o fereastră nouă), a roboticii(se deschide într-o fereastră nouă) și, privind retrospectiv, cel mai important, scalarea rețelelor recurente pentru modelarea limbajului(se deschide într-o fereastră nouă), care a fost un precursor al direcției de cercetare GPT.
- 2


