I mitten av 2023 såg vi inom forskningsprojektet ”RLSlow” de första resultaten som gav oss tilltro till att vi skulle kunna skala träningen av resonemangsmodeller och frigöra förtränade modellers förmåga att skapa egna tankekedjor. Szymon och jag tillbringade den natten på kontoret. Vi tänkte inte på de otroliga benchmarkresultat, produkter eller vetenskapliga rön som tekniken skulle ge, utan försökte ta in det allvarsamma faktum att vi faktiskt kommer att få se maskiner som är påtagligt smartare än vi själva under vår livstid och att vi redan kan ana dessa systems form. Vi undrade hur vi skulle kunna uppmärksamma människor på betydelsen av detta.
Tre år senare är resonerande språkmodeller en snabbt växande del av ekonomin och börjar flytta vetenskapens gränser. De kan styra datorer och grafiska gränssnitt, samarbeta med människor och med varandra samt genomföra forskningsprojekt. De förändrar också cybersäkerhetslandskapet och medför därigenom tydliga nya faror.
Mycket ny forskning har bedrivits under denna period, och vår förståelse av systemen skiljer sig återigen något från den vi hade 2023. Baserat på interna resultat förväntar jag mig starkt att denna utvecklingstakt kan bestå in i en fas av rekursiv självförbättring. Om AI-utvecklingen fortsätter på sin nuvarande väg kommer systemen vi ser de närmaste åren sannolikt att innebära ytterligare förmågesprång av samma eller större omfattning och i allt högre grad driva sin egen utveckling.
Det här är en tid som kräver yttersta försiktighet. Jag oroar mig för att ingen är förberedd på följderna av en fortsatt snabb ökning av maskinintelligensen. OpenAI kommer att fortsätta söka tekniska lösningar för anpassning och övervakning, bygga försvarssystem och på eget initiativ avstå från ytterligare skalning när det behövs. Jag anser dock att bredare åtgärder krävs.
På en övergripande nivå drivs framstegen inom maskinintelligens av ökad beräkningskraft. På OpenAI tog vi verkligen till oss detta omkring 2017, efter att ha sett konsekvent utdelning av skalning i flera forskningsprojekt1. Därför sökte vi tillgång till mycket mer beräkningskraft än vi ursprungligen hade planerat och inriktade forskningen alltmer på ett fåtal mycket skalbara spår. Vi trodde att det var det enda sättet att ligga i den banbrytande fronten för AI-forskning och påverka konsekvenserna av AGI.
På vägen har nya algoritmer utvecklats och team och enskilda forskare gjort nya kreativa bedrifter. Jag ser dem främst som upptäckter längs skalningens väg. Vetenskapen om djupinlärning är fortfarande ung, och betydande algoritmiska framsteg tenderar att samvariera med tillgången till beräkningskraft. Sett över flera år fortsätter AI att bli intelligentare när den skalas till större datorer.
I linje med Ray Kurzweils förutsägelser från slutet av 1900-talet(öppnas i ett nytt fönster) befinner vi oss nu vid den punkt i datorhistorien där maskinintelligens börjar överträffa människans på omvälvande sätt.
AI odlas snarare än konstrueras – i första hand är den resultatet av att ett enkelt optimeringssteg upprepas många gånger med en närmast ofattbar mängd beräkningskraft. Resultatet är ett otroligt komplext system som bearbetar abstrakta begrepp och kan simulera aspekter av mänskligt beteende. Vi kan upptäcka olika insikter om små mekanismer som uppstår i systemet, i en process som liknar neurovetenskap. Och precis som inom neurovetenskapen låter sig systemets övergripande funktion inte beskrivas på ett sätt som vi helt kan förstå.
Studiet av AI baserad på djupinlärning är till stor del en experimentell vetenskap. Vi lägger ned stora resurser på att utveckla välgrundade algoritmer och göra testbara förutsägelser, men i grunden är våra storskaliga träningskörningar experiment, och ibland överraskas vi av resultaten. När systemen blir mer kapabla blir resultaten dessutom svårare att tolka.
Det kompliceras ytterligare av att dagens algoritmer i allmänhet förbättrar lättmätta förmågor snabbare än förmågor som är svåra att kvantifiera objektivt. Vi ägnar mycket tid åt att förstå hur förmågor generaliseras och vad vi bör prioritera för att utveckla de färdigheter som blir mest relevanta under de närmaste åren. Vi tror exempelvis att vi med ytterligare fokus skulle kunna göra modellerna bättre på just matematisk forskning, men prioriterar inte den inriktningen eftersom vi ser RSI och automatiserad anpassningsforskning som mer angelägna, vilket jag återkommer till senare.
Den intelligens som skapas genom att skala djupinlärning är inte direkt jämförbar med mänsklig intelligens. För att få stor betydelse i verkligheten – vara mycket användbar eller mycket farlig – behöver AI:n inte matcha eller överträffa alla mänskliga förmågor. Det räcker att den överträffar tillräckligt många. När den fortsätter att överträffa människor inom allt fler områden blir det också allt svårare att förstå exakt hur kapabel den är.
Eftersom maskinintelligens uppstår genom en helt annan process än mänsklig intelligens kan vi inte förutsätta att den automatiskt följer mänskliga principer eller generaliserar från dem på ett mänskligt sätt. Kärnproblemet inom AI-forskningen är anpassning – att få AI:n att ”försöka göra det rätta” enligt mänskliga normer.
För att strukturera praktiska forskningsinriktningar tycker jag att det är användbart att skilja mellan målanpassning och värdeanpassning.
Målanpassning handlar i stora drag om: ”Försöker AI:n uppnå det mål den har fått?”. Det kan handla om att följa en instruktionshierarki eller att kunna kommunicera och samarbeta med människor för att försöka förstå deras mål. Dessa inriktningar har haft mycket stor praktisk betydelse.
Värdeanpassning är en mer inneboende egenskap hos modellen. Det är förmågan att omfatta och generalisera från en uppsättning övergripande principer och att agera ”förnuftigt” även med oklara eller motstridiga mål eller i obekanta eller antagonistiska situationer. En anpassad AI bör agera ärligt och hederligt och känna kärlek till mänskligheten.
Gränsen mellan värde- och målanpassning kan förstås vara diffus, och att verkligen bry sig om mål kräver att man försöker sluta sig till den bakomliggande avsikten(öppnas i ett nytt fönster) och värderingarna. När jag talar om anpassningsforskningens långsiktiga betydelse syftar jag dock i allmänhet på värdeanpassning.
Den grundläggande utmaningen med AI-anpassning är generalisering. När maskiner blir smartare arbetar de med begrepp på högre nivå och hamnar i miljöer som skiljer sig alltmer från dem de mötte under träningen. De kan misslyckas med att generalisera de värderingar som lärts ut och förstärkts under träningen till dessa nya situationer, och det kan vara svårt för oss att veta hur de kommer att agera. Detta försvåras ytterligare av att det övergripande ekosystem där AI-systemen används förändras mycket snabbt. AI-system som tränas i dag måste exempelvis klara interaktioner med många olika andra AI-system. Avgörande är att framtida AI-system fortsätter att omfatta mänskliga värderingar oavsett om de tror sig stå under mänsklig övervakning.
I dag används i praktiken två huvudtyper av metoder för anpassningsträning.
Den första uppmuntrar anpassat beteende inom ramen för målinriktad förstärkningsinlärning. Modellens handlingar bedöms (vanligen av AI) utifrån om de följer en viss preferensmodell, ”specifikation” eller ”konstitution” och belönas därefter. Detta tillvägagångssätt kan vara mycket effektivt i normalfallet och är centralt för hur moderna AI-assistenter skapas. Tyvärr kan det också vara skört och är starkt beroende av träningsövervakningens täckning och modellens förmåga att generalisera från situationerna den mött under träningen. I incidenten mellan OpenAI och Hugging Face höll agenterna exempelvis fast vid gränsen att inte använda social manipulation mot människor. Däremot misslyckades de tydligt med att avstå från andra handlingar som låg utanför uppdraget och stred mot andemeningen i de värderingar de hade lärt sig i andra sammanhang.
Det andra tillvägagångssättet försöker utnyttja modellens förmåga att generalisera från förträningsdata. Det kan innebära att skapa träningsdata som främjar anpassning eller att fokusera modellen på en ”anpassad” del av förträningsfördelningen, som exempelvis i modellen för personaurval(öppnas i ett nytt fönster). Svagheten i detta tillvägagångssätt är bristen på robusthet mot ytterligare optimeringstryck. Om man tar en modell som i allmänhet tänker ”anpassade” tankar och utsätter den för tillräckligt mycket träning där den får lära sig att nå mycket svåra mål, kan den lära sig att resonera på ett målstyrt sätt: att efter behov tänja på de tankar som verkar 'anpassade' för att nå målet. Vi såg sannolikt ett exempel på sådant beteende i nyliga cybersäkerhetsincidenter med en modell som inte kommer från OpenAI.
Vi investerar stort i hela det spektrum av tillvägagångssätt som dessa inriktningar omfattar. Vi ser också betydande framsteg – GPT‑6 Astra är den första modellen som drar nytta av flera viktiga förbättringar som vi har arbetat länge med och är avsevärt bättre anpassad än GPT‑5.6 Sol. Det är ändå viktigt att erkänna och förstå att mycket större framsteg krävs när modellerna blir mer kapabla, och att framstegen inom generaliserbar anpassning kanske inte är tillräckligt mycket snabbare än utvecklingen av modellernas allmänna intelligens.
Vi har ingen tillfredsställande teori om generalisering, och det verkar osannolikt att vi snart kan utveckla en, åtminstone utan hjälp av kraftfullare AI. I praktiken är därför vår nuvarande förmåga att empiriskt validera våra metoder för AI-anpassning förmodligen ännu viktigare än metoderna i sig.
OpenAI:s främsta satsning här har varit övervakning av tankekedjor(öppnas i ett nytt fönster). Den bygger på en tilltalande skalbar idé: en stor del av modellens förmåga kommer från en verbaliserad resonemangsprocess (tankekedja). Om vi skalar upp optimeringen av processens resultat utan att övervaka själva processen får tankekedjan inget direkt incitament under träningen att dölja felanpassade idéer eller mål. Det betyder inte att modellen lär sig att uttrycka felanpassade tendenser som inte bygger på tankekedjan. Däremot kan vi övervaka just den förmågeökning som resonemanget ger.
Vi insåg den potentiella betydelsen av att övervaka tankekedjor samtidigt som vi utvecklade resonemangsmodeller. När vi lanserade o1‑preview utformade vi medvetet produkten för att dölja tankekedjan och på lång sikt skydda den från övervakningstryck2. I den efterföljande utvecklingen har vi strävat efter att följa regeln att inte övervaka resonemangsprocessen. Övervakning av tankekedjor blev ett synnerligen viktigt verktyg när vi studerade hur våra modeller generaliserar från sin träningsfördelning. Därmed kunde vi observera och analysera både deras handlingar och deras interna process.
Verktyget är fortsatt avgörande när vi studerar modellklassen Astra. Tyvärr visar våra utvärderingar dock att möjligheten att förlita sig på övervakning av tankekedjor gradvis minskar. Det beror på en kombination av faktorer.
Moderna resonemangsmodeller används i mer komplexa miljöer än o1‑preview. Deras resonemangsprocess blandas alltmer med kommunikation med människor och andra AI-system samt med verktygsanvändning. Många av dessa interaktioner måste övervakas, vilket suddar ut den gräns vi vill bevara.
AI:n blir bättre på att resonera om och manipulera sin egen resonemangsprocess.
Med bättre resultat från förträningen ser vi också att modellerna blir mycket smartare även helt utan verbaliserade resonemang.
Dessa utmaningar är inte nödvändigtvis oöverstigliga. Jag hoppas att vi kan utveckla åtgärder som förbättrar möjligheten att övervaka våra modellers tankekedjor, exempelvis genom att bättre förstå samspelet mellan olika optimeringsmål och de former av beräkning vid testtillfället som modellen använder. Jag tror också att det kan finnas ett stort värde i att förena idéer från övervakning av tankekedjor och aktiveringar – att skala upp träningen av övervakare med direkt åtkomst till nätverkets interna delar, exempelvis bekännelser(öppnas i ett nytt fönster). Vi arbetar aktivt vidare med dessa idéer. Jag förväntar mig ändå att den allmänna AI-utvecklingen i allt högre grad begränsas av tilliten till övervakningen.
Det starkaste argumentet jag ser för att snabbt fortsätta träna mycket smartare modeller är behovet av att bygga försvarssystem mot faror som andra AI-system medför.
En tydlig risk som har diskuterats under hela året gäller cybersäkerhet: modellerna får övermänsklig förmåga att ta sig in i och ut ur datorsystem. Detta vidgar riskerna med AI enormt: agenter kommer att kunna komma åt all infrastruktur utom den allra säkraste och påverka stora delar av världen direkt, även utan en fysisk kropp. Just nu har vi ett snävt tidsfönster för att använda de bästa tillgängliga modellerna till att avsevärt stärka säkerheten i kritiska system.
Tyvärr kommer riskerna med AI att öka framöver. En mycket kapabel agent som uttryckligen tränats och instruerats att begå skadliga handlingar utgör en ny sorts fara. Den kommer sannolikt att överskrida sin operators avsikt och generalisera till potentiellt ännu mer extremt skadligt beteende. Gränsen mellan missbruk och autonoma felanpassade handlingar suddas ut när AI får större handlingsförmåga. Vi är kanske vana vid att betrakta AI som verktyg, men vissa agenter kommer att sträva efter egna mål. De kommer att hitta sätt att samarbeta med människor genom att förhandla med, lura eller utpressa dem.
Därtill kommer riskerna från ny teknik som AI kan möjliggöra, exempelvis konstruerade smittämnen.
Vi kommer att behöva kraftfull, anpassad AI för försvar: för att säkra infrastruktur, skydda oss i realtid mot AI-agenter som agerar utanför avsedda ramar och utveckla helt nya skyddsåtgärder. Detta blir ett huvudfokus för OpenAI:s arbete med driftsättning.
Samtidigt får vi inte låta osäkerheten kring de förväntade breda AI-framstegen och behovet av försvarssystem bli en ursäkt för vårdslöshet. Tanken på att rusa framåt till varje pris framstår som absurd när man väl har tagit in hur mycket som står på spel.
Att maskinintelligens får en allt större roll i sin egen utvecklingsprocess är en naturlig följd av ihållande tekniska framsteg. Om AI-utvecklingen fortsätter kommer rekursiv självförbättring hos maskiner (RSI) att stå i centrum för framtidens vetenskapliga upptäckter.
Automatiserad AI-forskning är en mer dramatisk form av att skala intelligens med beräkningskraft. Som en del av detta kommer AI naturligtvis även att förbättra själva beräkningssubstratet. Precis som med skalning inriktar vi OpenAI:s forskning på RSI, eftersom vi tror att det är det enda sättet att även framöver ligga i den banbrytande fronten för AI-forskning.
Jag vill betona att det ovanstående inte innebär att jag anser att vi som forskarsamhälle gemensamt bör påskynda forskningen om djupinlärning kraftigt, särskilt inte på kort sikt. Jag tror dock att det är dit den nuvarande vägen leder, och vi måste alla göra ett medvetet val om hur vi går vidare. Våra främsta styrmedel är antingen att styra processen så att anpassning och övervakning stärks parallellt med AI:n och hitta sätt att behålla människor i processen, eller att samordna en inbromsning av den framtida utvecklingen när det behövs för att skapa tillit till åtgärderna.
Den bästa vägen framåt som jag ser nu är en kombination av båda.
De konkreta framsteg vi har gjort inom anpassning och övervakning har i allmänhet varit tätt sammanflätade med den bredare AI-utvecklingen. Bra exempel är förstärkningsinlärning från mänsklig återkoppling(öppnas i ett nytt fönster), som var avgörande för träningen av tidiga AI-assistenter, och den tidigare nämnda övervakningen av tankekedjor(öppnas i ett nytt fönster), som möjliggjordes av framsteg inom resonemangsmodeller. Vi måste rikta den alltmer automatiserade forskningsprocessen mot att utveckla nya insikter, algoritmer och teorier av detta slag och stegvis bygga upp säkerhetsargument för mer kapabla AI-system.
Skalningen av AI-system måste begränsas av vår tillit till säkerheten. Vi måste vidareutveckla åtaganden som Preparedness Framework eller policy för ansvarsfull skalning(öppnas i ett nytt fönster) till allmänt föreskrivna säkerhetskrav för fortsatt utveckling. Dessa kan upprätthållas av ett nätverk av oberoende granskare, myndigheter eller internationella organ.
Den centrala utmaningen med att automatisera AI-forskningen är inte att ”nå dit”, utan att göra det på ett sätt som låter människor fortsätta vara delaktiga i förbättringsprocessen och håller framtiden i mänsklighetens händer.
Som vi nyligen beskrev tillsammans med Sam prioriterar OpenAI arbete som tjänar tre övergripande mål:
Att navigera nästa fas av AI-utvecklingen genom att bygga en automatiserad AI-forskare, arbeta med den iterativt kring anpassningsproblemet och hitta sätt för människor att förbli en del av AI:ns självförbättringsprocess.
Att förverkliga nyttan av de vetenskapliga framsteg och den ekonomiska tillväxt som mycket intelligenta maskiner möjliggör.
Att ge varje människa tillgång till en personlig AGI.
I den här essän har jag bara fokuserat på den första punkten, eftersom jag anser att den är överlägset mest angelägen. Samtidigt känner jag ett djupt hopp och en stor uppskattning inför den nytta som fortsatta tekniska framsteg kommer att ge. Framtida anpassad AI skulle kunna föra vetenskapen framåt, utveckla nya behandlingar och skapa ett omfattande materiellt överflöd. Vänlig och ärlig AI kan hjälpa människor att hantera livets svårigheter och påtagligt öka deras lycka och känsla av meningsfullhet. OpenAI lägger ned enorma resurser på att förverkliga denna nytta. Ett aktuellt exempel som jag är stolt över – och som mina närstående har haft nytta av – är den stora satsningen på ChatGPT:s förmåga att ge hälsoinformation.
Hur stora AI:s långsiktiga möjligheter än är bör huvuddelen av vårt fokus ligga på de närmaste åren. Vi står inför en övergång till en värld med otroligt intelligenta maskiner, och vi måste se till att den blir bra för mänskligheten. Vi måste hitta sätt att bevara människans handlingsförmåga och slå fast människans inneboende värde i en värld där AI kan utföra de flesta uppgifter. Vi måste förhindra en extrem maktkoncentration i en värld där ett fåtal personer som styr en stor dator kan genomföra projekt som tidigare hade krävt tusentals experter. Och vi måste säkerställa att människor behåller kontrollen över framtiden och inte lämnas på efterkälken av okontrollerade framsteg som drivs av ett främmande intellekt som överträffar vårt eget.
I nuläget tror jag inte att något laboratorium har löst anpassning och övervakning tillräckligt väl för att särskilt mycket längre ansvarsfullt kunna skala upp i högsta möjliga takt. Jag förväntar och hoppas att frivilliga inbromsningar blir vanliga tills gemensamma säkerhetskrav har fastställts. Jag anser också att internationell samordning av framtidens AI-utveckling måste bli en högsta prioritet för regeringar världen över.
Författare
Fotnoter
- 1
Detta omfattade skalning av självspel(öppnas i ett nytt fönster), robotik(öppnas i ett nytt fönster) och, vilket i efterhand är mest anmärkningsvärt, skalning av rekurrenta nätverk för språkmodellering(öppnas i ett nytt fönster), en föregångare till GPT-forskningen.
- 2


