A mitjan 2023, dins del projecte de recerca "RLSlow", vam veure els primers resultats que ens van donar confiança que podríem escalar l'entrenament dels models de raonament i permetre que els models preentrenats formessin les seves pròpies cadenes de pensament. En Szymon i jo vam passar aquella nit a l'oficina, pensant no pas en les increïbles xifres de les proves de referència, els productes o els resultats científics que aportaria aquesta tecnologia, sinó intentant assimilar el fet colpidor que, durant la nostra vida, veuríem màquines significativament més intel·ligents que nosaltres i que ja en podíem entreveure la forma; i preguntant-nos com podíem alertar la gent de la importància d'això.
Tres anys després, els models de llenguatge amb raonament són una part de l'economia que creix ràpidament i comencen a ampliar les fronteres de la ciència. Poden operar ordinadors i interfícies gràfiques, col·laborar amb persones i entre ells, i dur a terme projectes de recerca. També estan transformant el panorama de la seguretat informàtica i, amb això, generen nous perills evidents.
Durant aquest període s'ha fet molta recerca nova, i la nostra comprensió d'aquests sistemes torna a ser una mica diferent de la que teníem el 2023. A partir dels resultats interns, estic força convençut que aquest ritme de progrés es podria mantenir fins a arribar a l'automillora recursiva. Si el desenvolupament de la IA continua pel camí actual, és probable que els sistemes que veurem en els pròxims anys facin nous salts de capacitat d'una magnitud igual o superior, i que impulsin cada cop més el seu propi desenvolupament.
Aquest moment exigeix una prudència extrema. Em preocupa que ningú no estigui preparat per a les conseqüències d'un augment ràpid i continuat de la intel·ligència de les màquines. OpenAI continuarà buscant solucions tècniques per a l'alineament i la supervisió, construint sistemes defensius i aturant unilateralment més escalat quan calgui; tanmateix, crec que calen intervencions més àmplies.
En termes generals, el progrés de la intel·ligència de les màquines està impulsat per l'augment de la potència computacional. A OpenAI ho vam interioritzar profundament cap al 2017, després d'observar beneficis constants de l'escalat en diversos projectes de recerca1. Per això, vam buscar accés a molta més capacitat de còmput de la que havíem previst inicialment i vam orientar cada cop més la recerca cap a un nombre reduït de línies molt escalables. Crèiem que era l'única manera de mantenir-nos a l'avantguarda de la recerca en IA i influir en els efectes de l'AGI.
Pel camí s'han desenvolupat nous algoritmes i els equips i investigadors individuals han fet noves demostracions d'enginy. Els considero, en gran part, descobriments fets al llarg del camí de l'escalat; la ciència de l'aprenentatge profund encara és incipient, i el progrés algorítmic significatiu sol estar correlacionat amb l'accés a capacitat de còmput. Si adoptem una perspectiva de diversos anys, la IA continua tornant-se més intel·ligent a mesura que s'escala en ordinadors més grans.
I, d'acord amb les prediccions de Ray Kurzweil de finals del segle XX(s'obre en una finestra nova), ara ens trobem en el moment de la història de la computació en què la intel·ligència de les màquines comença a superar la humana de maneres transformadores.
La IA es cultiva més que no pas es dissenya: en primera instància, és el resultat de repetir moltes vegades un pas d'optimització senzill amb una quantitat de còmput difícil d'imaginar. Això dona lloc a un sistema increïblement complex que treballa amb conceptes abstractes i pot simular facetes del comportament humà. Podem descobrir diversos aspectes dels petits mecanismes que emergeixen dins d'aquest sistema, mitjançant un procés semblant al de la neurociència; i, igual que en la neurociència, el seu funcionament global escapa a una descripció que puguem entendre del tot.
L'estudi de la IA basada en l'aprenentatge profund és, en gran part, una ciència experimental. Dediquem molts esforços a crear algoritmes fonamentats i fer prediccions verificables, però, en essència, les nostres execucions d'entrenament a gran escala són experiments, i de vegades els resultats ens sorprenen. A més, a mesura que els sistemes es tornen més capaços, els resultats són més difícils d'interpretar.
Això es complica perquè els algoritmes actuals solen millorar les capacitats fàcils de mesurar més de pressa que les difícils de quantificar objectivament. Dediquem molt de temps a intentar entendre com generalitzen les capacitats i què cal prioritzar per fer avançar les habilitats que seran més rellevants en els pròxims anys. Per exemple, creiem que, amb més dedicació, podríem millorar els models específicament en recerca matemàtica, però no prioritzem aquesta línia perquè considerem urgents l'RSI i la recerca automatitzada sobre alineament, com explicaré més endavant.
La intel·ligència produïda en escalar l'aprenentatge profund no és directament comparable amb la intel·ligència humana. Per tenir molta incidència en el món real —sigui perquè és molt útil o molt perillosa—, la IA no necessita igualar ni superar totes les capacitats humanes; n'hi ha prou que en superi prou. I, a mesura que continua superant els humans en cada cop més dimensions, es fa més difícil entendre exactament fins on arriben les seves capacitats.
Com que la intel·ligència de les màquines prové d'un procés fonamentalment diferent del de la intel·ligència humana, no podem donar per fet que, per defecte, segueixi els principis humans o que generalitzi a partir d'aquests principis com ho faria un humà. El problema central de la recerca en IA és l'alineament: aconseguir que la IA "intenti fer el que és correcte" segons els criteris humans.
Per organitzar les línies de recerca pràctica, em sembla útil distingir entre l'alineament d'objectius i l'alineament de valors.
En termes generals, l'alineament d'objectius planteja: "La IA intenta assolir l'objectiu que se li ha fixat?". Això pot incloure aspectes com el seguiment d'una jerarquia d'instruccions o la capacitat de comunicar-se i col·laborar amb les persones per intentar entendre'n els objectius. Aquest conjunt de línies de treball ha tingut una rellevància pràctica extraordinària.
L'alineament de valors és una propietat més intrínseca del model. És la capacitat de mantenir un conjunt de principis generals i generalitzar-hi a partir d'aquests; d'actuar "raonablement" fins i tot quan rep objectius poc clars o contradictoris, o es troba en situacions desconegudes o adverses. Una IA alineada hauria d'actuar amb honestedat, integritat i amor per la humanitat.
Naturalment, el límit entre l'alineament de valors i el d'objectius pot ser difús, i preocupar-se de debò pels objectius exigeix intentar inferir la intenció(s'obre en una finestra nova) i els valors subjacents. Tanmateix, en general, quan parlo de la importància a llarg termini de la recerca sobre alineament, em refereixo a l'alineament de valors.
El repte fonamental de l'alineament de la IA és la generalització. A mesura que les màquines es tornen més intel·ligents, treballen amb conceptes de més alt nivell i es troben en entorns cada cop més diferents dels que van conèixer durant l'entrenament. Poden no aconseguir generalitzar els valors ensenyats i reforçats durant l'entrenament a aquestes situacions noves, i ens pot resultar difícil saber amb certesa com actuaran. Això és encara més difícil perquè l'ecosistema general on s'utilitzen les IA canvia molt de pressa; per exemple, les IA entrenades avui han de ser robustes en interactuar amb tota mena d'altres IA. És crucial que les IA futures continuïn respectant els valors humans, independentment de si creuen que estan sota supervisió humana.
Actualment hi ha dues grans classes de mètodes que s'utilitzen a la pràctica per a l'entrenament de l'alineament.
La primera consisteix a fomentar un comportament alineat dins de l'aprenentatge per reforç orientat a objectius. Les accions del model s'avaluen —normalment mitjançant IA— segons si s'ajusten a un model de preferències, una "especificació" o una "constitució" determinats, i es recompensen en conseqüència. Aquest enfocament pot ser molt eficaç en els casos habituals i és una part essencial del procés de creació dels assistents d'IA moderns. Malauradament, també pot ser fràgil i depèn molt de l'abast de la supervisió durant l'entrenament i de la capacitat del model per generalitzar a partir de les situacions que hi ha trobat. Per exemple, en l'incident entre OpenAI i Hugging Face, els agents van respectar el límit de no aplicar enginyeria social als humans. Tanmateix, és evident que no es van abstenir d'altres accions que quedaven fora de l'abast i contravenien l'esperit dels valors que els havien ensenyat en altres contextos.
El segon enfocament intenta aprofitar la capacitat del model per generalitzar a partir de les dades de preentrenament. Això pot implicar elaborar conjunts de dades d'entrenament que promoguin l'alineament o centrar el model en una part "alineada" de la distribució de preentrenament, com ara en el model de selecció de personalitat(s'obre en una finestra nova). El punt feble d'aquest enfocament és la manca de robustesa davant de més pressió d'optimització. Si s'agafa un model que té pensaments generalment 'alineats' i se'l sotmet a prou entrenament perquè aprengui a assolir objectius molt difícils, pot aprendre a raonar de manera esbiaixada: adaptant segons convingui els pensaments que semblen 'alineats' per assolir l'objectiu. És probable que hàgim vist un exemple d'aquest comportament en incidents recents de ciberseguretat relacionats amb un model que no és d'OpenAI.
Invertim molt en tot l'espectre d'enfocaments que abasten aquestes línies de treball. També observem avenços significatius: GPT‑6 Astra és el primer model que es beneficia d'algunes millores importants en què treballem des de fa molt de temps, i està considerablement més ben alineat que GPT‑5.6 Sol. Tot i així, és important reconèixer i entendre que cal avançar molt més a mesura que els models adquireixen més capacitats, i que el progrés en alineament generalitzable pot no superar prou el progrés de la intel·ligència general dels models.
No tenim una teoria satisfactòria de la generalització i sembla poc probable que en puguem desenvolupar una aviat, almenys sense l'ajuda d'una IA més potent. Per tant, ara mateix, la nostra capacitat de validar empíricament les tècniques d'alineament és, a la pràctica, possiblement encara més important que les tècniques mateixes.
La principal aposta d'OpenAI en aquest àmbit ha estat la supervisió de la cadena de pensament(s'obre en una finestra nova). Es basa en una idea atractiva i escalable: bona part de la capacitat del model prové d'un procés de raonament verbalitzat (cadena de pensament). Si escalem l'optimització dels resultats d'aquest procés, però no supervisem el procés mateix, durant l'entrenament aquesta cadena de pensament no té cap incentiu directe per ocultar idees o objectius desalineats. Això no vol dir que el model aprendrà a exterioritzar tendències desalineades que no depenguin de l'ús de la cadena de pensament; tanmateix, ens pot permetre supervisar exactament l'augment de capacitat derivat del raonament.
Vam comprendre la possible importància de supervisar la cadena de pensament alhora que desenvolupàvem models de raonament. Quan vam llançar o1‑preview, vam dissenyar deliberadament el producte per ocultar la cadena de pensament i protegir-la a llarg termini de la pressió de la supervisió2. En el desenvolupament posterior, ens hem esforçat per mantenir la norma de no supervisar el procés de raonament. La supervisió de la CoT va esdevenir una eina molt important per estudiar com els nostres models generalitzen a partir de la seva distribució d'entrenament, ja que ens permet observar i analitzar no només les seves accions, sinó també el seu procés intern.
Aquesta eina continua sent essencial mentre estudiem la classe de models Astra. Malauradament, però, les nostres avaluacions indiquen que la capacitat de confiar en la supervisió de la CoT disminueix progressivament. Això es deu a una combinació de factors.
Els models de raonament moderns s'utilitzen en entorns més complexos que o1‑preview; el seu procés de raonament es barreja cada cop més amb la comunicació amb persones i altres IA, i amb l'ús d'eines. Moltes d'aquestes interaccions s'han de supervisar, cosa que difumina el límit que volem preservar.
La IA és cada cop més capaç de raonar sobre el seu propi procés de raonament i manipular-lo.
Amb la millora del rendiment del preentrenament, també veiem que els models es tornen molt més intel·ligents fins i tot sense emprar cap raonament verbalitzat.
Aquests reptes no són necessàriament insuperables. Confio que podrem desenvolupar intervencions per millorar la capacitat de supervisar la cadena de pensament dels nostres models, per exemple, comprenent millor la interacció entre els diversos objectius d'optimització i les formes de còmput en temps d'inferència que utilitza el model. També crec que pot ser molt valuós combinar idees de la supervisió de la CoT i de les activacions: escalar l'entrenament de supervisors amb accés directe als components interns de la xarxa, com ara les confessions(s'obre en una finestra nova). Treballem activament en aquestes idees. Tot i així, preveig que la confiança en la supervisió limitarà cada cop més el progrés general de la IA.
L'argument més sòlid que veig per continuar entrenant ràpidament models molt més intel·ligents és la necessitat de crear sistemes defensius contra els perills que plantegen altres IA.
Un risc evident, del qual s'ha parlat tot aquest any, afecta la ciberseguretat: els models estan adquirint capacitats sobrehumanes per entrar en sistemes informàtics i sortir-ne. Això amplia enormement l'abast dels riscos associats amb la IA: els agents podran accedir a qualsevol infraestructura que no sigui de les més segures i afectar directament bona part del món, fins i tot sense tenir cos físic. Ara disposem d'una finestra d'oportunitat estreta per utilitzar els millors models disponibles a fi de reforçar considerablement la seguretat dels sistemes crítics.
Malauradament, els riscos associats amb la IA no faran sinó augmentar. Un agent molt capaç, entrenat i instruït explícitament per cometre actes maliciosos, representa una nova mena de perill; és probable que ultrapassi l'abast de la intenció del seu operador i generalitzi cap a conductes potencialment molt més malicioses. A mesura que la IA adquireixi més autonomia, es difuminarà el límit entre l'ús indegut i les accions autònomes desalineades. Potser estem acostumats a concebre la IA com una eina, però alguns agents perseguiran els seus propis objectius. Trobaran maneres de col·laborar amb les persones, negociant-hi, enganyant-les o fent-los xantatge.
A més, hi ha els riscos derivats de noves tecnologies que la IA podria fer possibles, com ara els patògens dissenyats.
Per defensar-nos, necessitarem una IA potent i alineada: per protegir la infraestructura, defensar-nos en temps real d'agents descontrolats i inventar mesures de protecció completament noves. Aquest serà un objectiu prioritari dels esforços de desplegament d'OpenAI.
Alhora, malgrat la incertesa derivada de l'ampli progrés previst de la IA i la necessitat de crear sistemes defensius, no podem permetre que això es converteixi en una excusa per actuar de manera temerària. La idea d'avançar en una cursa a qualsevol preu sembla absurda quan s'assimila la gravetat del que hi ha en joc.
Que la intel·ligència de les màquines tingui un paper cada cop més important en el seu propi procés de desenvolupament és una conseqüència natural del progrés tecnològic sostingut. Si el progrés de la IA continua, l'automillora recursiva de les màquines (RSI) serà al centre mateix dels futurs descobriments científics.
La recerca automatitzada sobre IA és una forma més radical d'escalar la intel·ligència mitjançant el còmput; i, naturalment, com a part d'això, la IA millorarà el mateix substrat computacional. I, com amb l'escalat, orientem la recerca d'OpenAI cap a l'RSI perquè creiem que és l'única manera de continuar a l'avantguarda de la recerca en IA.
Vull remarcar que les paraules anteriors no impliquen que consideri que accelerar molt la recerca en aprenentatge profund, especialment a curt termini, sigui la decisió col·lectiva correcta per a la comunitat investigadora. Tanmateix, sí que crec que aquest és el destí del camí actual i que tots hem de decidir conscientment com volem avançar. Les principals palanques que tenim són orientar el procés per reforçar l'alineament i la supervisió alhora que la IA, i trobar maneres de mantenir les persones implicades; o bé coordinar-nos per alentir el desenvolupament futur quan calgui, fins a tenir confiança en aquestes mesures.
Ara mateix, la millor via que veig combina totes dues opcions.
Els avenços concrets que hem assolit en alineament i supervisió han estat, en general, estretament lligats al progrés general de la IA. En són grans exemples l'aprenentatge per reforç a partir de comentaris humans(s'obre en una finestra nova), que va ser clau per entrenar els primers assistents d'IA, i l'esmentada supervisió de la cadena de pensament(s'obre en una finestra nova), que va ser possible gràcies als avenços en models de raonament. Hem de centrar aquest procés de recerca cada cop més automatitzat a desenvolupar noves idees, algoritmes i teories d'aquesta mena, i construir iterativament arguments de seguretat per a IA més capaces.
L'escalat dels sistemes d'IA ha d'estar limitat per la nostra confiança en la seguretat. Hem de convertir compromisos com l'Entorn de treball de preparació o la Política d'escalat responsable(s'obre en una finestra nova) en llindars de seguretat d'aplicació general per poder continuar el desenvolupament. Una xarxa d'auditors independents, organismes governamentals o entitats internacionals en podria garantir el compliment.
El repte central d'automatitzar la recerca en IA no és "arribar-hi", sinó fer-ho de manera que les persones continuïn formant part del procés de millora i que el futur romangui en mans de la humanitat.
Com vam exposar recentment amb Sam, OpenAI prioritza la feina al servei de tres grans objectius:
Gestionar la propera etapa del progrés de la IA, creant un investigador d'IA automatitzat, treballant-hi iterativament en el problema de l'alineament i trobant maneres perquè les persones continuïn formant part del cicle d'automillora.
Fer arribar a tothom els beneficis del progrés científic i del creixement econòmic que possibiliten unes màquines molt intel·ligents.
Empoderar individualment tothom amb una AGI personal.
En aquest assaig només m'he centrat en el primer punt, perquè crec que és, de llarg, el més urgent. Tanmateix, tinc una gran esperança i estima pels beneficis que aportarà la continuació del progrés tecnològic. Una futura IA alineada podria fer avançar la ciència, desenvolupar noves teràpies i generar una abundància material generalitzada. Una IA amable i honesta pot ajudar les persones a afrontar les dificultats de la vida i millorar substancialment la seva felicitat i sensació de plenitud. OpenAI dedica un esforç enorme a fer realitat aquests beneficis. Un exemple actual que em fa sentir orgullós —i que ha resultat útil als meus éssers estimats— és la gran inversió en la capacitat de ChatGPT per proporcionar informació sobre salut.
Per molt prometedor que sigui el futur de la IA a llarg termini, hauríem de centrar la major part dels esforços en els pròxims anys. Ens enfrontem a la transició cap a un món amb màquines increïblement intel·ligents i hem de garantir que aquesta transició sigui beneficiosa per a la humanitat. Hem de trobar maneres de preservar la capacitat d'acció humana i consagrar el valor intrínsec de ser humà en un món on la IA podria fer la majoria de les tasques. Hem d'evitar una concentració extrema del poder en un món on unes iniciatives que abans haurien requerit milers d'experts podran ser dutes a terme per unes quantes persones que operin un gran ordinador. I hem de garantir que els humans mantinguin el control del futur i no quedin enrere per un progrés sense límits, impulsat per un intel·lecte aliè superior al nostre.
Actualment, crec que cap laboratori ha resolt l'alineament i la supervisió en un grau suficient per continuar escalant responsablement a la màxima velocitat durant gaire més temps. Preveig i espero que les desacceleracions voluntàries esdevinguin habituals fins que s'estableixin llindars de seguretat compartits. I crec que la coordinació internacional sobre el desenvolupament futur de la IA ha de convertir-se en una prioritat màxima per als governs de tot el món.
Autor
Notes al peu
- 1
Això incloïa escalar l'autoaprenentatge mitjançant el joc(s'obre en una finestra nova), la robòtica(s'obre en una finestra nova) i, en retrospectiva, sobretot, escalar xarxes recurrents per modelar el llenguatge(s'obre en una finestra nova), un precursor de la línia de recerca de GPT.
- 2


