Ugrás a fő tartalomra
OpenAI

Gyorsuló kutatás: az OpenAI belső tapasztalatai

Betöltés…

Úgy véljük, az AGI csak demokratikus irányítás mellett szolgálhatja az egész emberiség javát. Ehhez tájékozott társadalmi vita kell a fejlett MI-rendszerek képességeiről, kockázatairól és védelmi intézkedéseiről. Az embereknek világszerte érteniük kell az élvonalbeli MI várható fejlődési irányát, hogy érdemben beleszólhassanak az alakulásába.

A konkrét kockázatok, incidensek és védelmi intézkedések átláthatósága szükséges, de nem elégséges. A nyilvánosságnak azt is értenie kell, hogyan fejlődnek és segítik a kutatást a legfejlettebb rendszerek az élvonalbeli laborokban.

Célunk egy automatizált MI-kutató biztonságos létrehozása, amely emberi felügyelettel, iteratívan segíti a mély tanulás és az emberi célokhoz való igazodás kutatását. Méréseink szerint már elértük a tavaly ősszel bejelentett⁠(új ablakban nyílik meg) célt: idén szeptemberre legyen egy automatizált kutatógyakornokunk. „Kutatógyakornokon” olyan rendszert értünk, amely emberi irányítással jól meghatározott kutatási feladatokat végez el, akár olyanokat is, amelyek egy képzett kutatónak több napba telnének. Jól haladunk afelé, hogy 2028 márciusára létrehozzunk egy automatizált MI-kutatót.

Idén jelentősen átalakult az OpenAI kutatóinak napi munkája. Egész nap használnak programozó ügynököket, gyakran párhuzamos munkamenetekben. Az összhasználat gyorsan nő, az OpenAI más csapatainál is gyorsabban. A kutatók gyorsabban készítenek kódot és több kísérletet futtatnak. Az ügynökök használata is változik: egyre összetettebb feladatokat kapnak, és gyakrabban járnak sikerrel. Az MI-kutatás összetett, sok lehetséges szűk keresztmetszettel, így az általános fejlődés várhatóan nem tart lépést ezekkel a konkrét mutatókkal. Az eredmények mégis összhangban vannak sokunk belső tapasztalatával: az ügynökalapú eszközök érdemben gyorsítják a kutatást. Továbbra is emberek szabják meg a kutatási prioritásokat, választják ki a továbbviendő ötleteket és eredményeket, döntenek a rendszerek bővítéséről, szüneteltetéséről vagy bevezetéséről.

Úgy véljük, a felelősen végzett automatizált MI-kutatás az emberi jólétet közvetlenül javító, az OpenAI küldetését szolgáló modelleket eredményez. Csökkentheti a fejlett intelligencia költségét, hogy abból világszerte részesülhessenek az emberek. Részben azért dolgozunk ezen, mert az automatizált kutatás segíthet megoldani az emberi célokhoz való igazodást és védekezni az egyre fejlettebb MI ellen. Egy automatizált MI-kutató a biztonságot vagy az emberi célokhoz való igazodást is kutathatja. A fejlettebb, emberi célokhoz igazodó rendszerek segíthetnek védeni a kritikus infrastruktúrát, elhárítani a veszélyes MI-ügynököket és új védelmi megoldásokat kidolgozni.

Mindez indokolja a hasznos automatizált kutatási képességek fejlesztését, de nem jelenti, hogy feltétlenül a gyors RSI-re kell törekednünk. A folytatásról és annak módjáról az emberi kontroll megőrizhetősége, valamint az előnyökről és kockázatokról hozott tájékozott demokratikus döntések alapján kell határozni.

Még nem tudjuk, hogyan juthatunk el biztonságosan az emberi célokhoz igazodó, teljes RSI-ig. Dolgozunk azon, hogy a képességekkel együtt az igazodási és biztonsági intézkedéseket is bővítsük. De nem feltételezhetjük, hogy ezek fejlődése lépést tart, és a fejlettebb rendszereket nehezebb lehet felügyelni. Munkánk középpontjában az alapos igazodási és biztonsági kutatás áll, kezdve az ügynökalapú programozás rendszereiben ma látható biztonsági problémák mérésével és enyhítésével. Ha a folytatás elfogadhatatlan biztonsági kockázattal járna, megfelelően lépünk: akár lassítjuk vagy leállítjuk azon rendszerek fejlesztését, bevezetését, amelyekhez nem tudunk elégséges védelmet biztosítani.

A közelmúltbeli Hugging Face-incidens után ennek megfelelően cselekedtünk⁠: szüneteltettük a bevezetésre szánt legújabb modellek megerősítéses tanulását (RL), miközben tovább erősítettük és támadásszimulációkkal teszteltük kutatási környezeteink védelmét, és bővítettük felügyeleti rendszereink lefedettségét. Nem állt le minden kutatás: egyes munkaterhelések erősebb védelem mellett újraindultak, mások szüneteltek. Emeltük biztonsági és igazodási követelményeinket, és a modell teljes életciklusába beépítettük a biztonsági munkát: a tanítás során végig erősebb bizonyítékot várunk az emberi célokhoz igazodó viselkedésre.

Ma részletes pillanatképet adunk arról, hogyan segítették az ügynökalapú rendszerek az RSI felé haladást az elmúlt hónapokban. Ezek a rendszerek újak és gyorsan változnak; méréseink még kezdeti szakaszban járnak. A korai eredmények és módszerek megosztásával tájékoztatni szeretnénk a nyilvánosságot, ösztönözni a nyílt beszámolás gyakorlatát és a közös mérési szabványok kialakulását.

Ahogy az élvonalbeli MI-re vonatkozó szakpolitikai tervünkben⁠ írtuk, szerintünk minket és más vállalatokat is kötelezni kellene az RSI felé haladás nyilvános nyomon követésére. Ilyen előírás nélkül is átláthatóan kívánunk beszámolni az RSI felé tett előrelépéseinkről. Átláthatósági gyakorlatunkat méréseink és ismereteink fejlődésével alakítjuk, a biztonság és az üzleti titkok védelmét is szem előtt tartva.

1. A programozó ügynökök átalakítják az OpenAI kutatóinak napi munkáját

Az év elején a használat szerint rangsorolt OpenAI-kutatók közül a medián kutató még csak szerény mértékben használt programozó ügynököket. Augusztus közepére már naponta építette be őket a munkájába, API-áron számolva napi több mint 600 dollárnyi következtetést használva. Kutatási szervezetünk 90. percentilisébe eső felhasználója már napi több mint 7000 dollár értékű tokent használ.

2026 júniusa előtt az ügynökök teljes futásideje még elmaradt a kutatási szervezet összes emberi munkaidejétől. Ez azóta megváltozott. Nyolcórás munkanappal számolva augusztus közepén a kutatási szervezet minden emberi munkanapra összesen 3,1 ügynöki munkanapot használt fel.

Másik megközelítés, ha azt nézzük, hány kutató használ erősen párhuzamos munkafolyamatokat, például futtat egyszerre legalább 4 ügynököt. Az alábbiak szerint ez a szám nő. Az adatok a felhasználó által közvetlenül indított ügynökök és az ezekből létrehozott alügynökök napi csúcsértékeit is tartalmazzák.

2. A kutatók több kódot írnak és több kísérletet futtatnak

Az MI-kutatás jelentős része munkaigényes folyamat, amelynek célja egy új, intelligenciát vagy teljesítményt javító fejlesztés beépítése valamelyik fő modellünkbe. A képességek fejlődéséhez minden lépésnek sikerülnie kell: új fejlesztések tervezése, modellértékelések írása, nagyléptékű tesztinfrastruktúra készítése, hibák és veszélyes vagy nem igazodó viselkedés felismerése tanítás közben, majd a bevált ötletek beépítése egy fő tanítási futtatásba. Bármely lépés kudarca visszafoghatja az egész kutatási ciklust.

A kódírás és a kísérletezés a kutatók két fő tevékenysége; az adatok mindkettő gyorsulására utalnak.

Ezeket viszonylag könnyű mérni, de nehéz értelmezni. Az automatizálással a legkevésbé automatizálható feladatok kötik majd le a kutatói munka nagyobb részét, és válnak a fejlődés fő szűk keresztmetszeteivé. A számítási kapacitás szintén korlátozó tényező, és más akadályok enyhülésével egyre fontosabbá válhat.

2026 során nőtt az aktív kísérletezőnkénti kísérletszám; augusztusban a mérés 2025. januári kezdete óta a legmagasabb lett. Ez együtt jár a Codex terjedésével, de 2025 óta a számítási kapacitásunk is jelentősen nőtt.

3. Változik, milyen munkát bíznak a kutatók az ügynökökre

A tapasztalatok és belső adatok szerint változik a programozó ügynökökre bízott feladatok összetétele: egyre gyakoribbak a magasabb szintű, hosszabb időtávú feladatok.

A trend tisztázásához az Epoch AI nemrég közzétett taxonómiájával⁠(új ablakban nyílik meg) elemeztük a kutatási szervezet közelmúltbeli használatát. Ez az MI kutatás-fejlesztési életciklusának munkatípusait osztályozza. A munkatípusokat régóta osztályozó O*NET által ihletett taxonómia kifejezetten az élvonalbeli MI kutatás-fejlesztésére készült, és hat fő szakaszt különít el:

  1. Döntés: min dolgozzunk, mit folytassunk, hová osszunk erőforrást

  2. Tervezés: kutatási ötletek és műszaki specifikációk

  3. Építés: kód és adatkészletek

  4. Futtatás: tanítás, értékelés, hardver, kiszolgálás

  5. Elemzés: kísérletek, modellek, bevezetés, külső munkák

  6. Kommunikáció: eredmények, visszajelzések, állapot, döntések

Alább e taxonómia szerint osztályozzuk a programozó ügynökök tokenjeit.

2026 januárja és augusztusa között minden kutatási kategória bővült. Januárban a kutatási és infrastrukturális kód dominált. Ez is bővült, de más kategóriákban, különösen a technikai segítségben és a futtatások felügyeletében is jelentős a növekedés. A magas szintű tervezés továbbra is az ügynökök kimeneti tokenjeinek elenyésző része.

Kollégáink szerint a programozó ügynökök kiválóan kezelik a belső kutatási infrastruktúra hibáit, enyhítve a kutatás egyik fontos szűk keresztmetszetét. Több, korábban kísérleti hibaelhárítási konzultációt tartó csapat csökkenő részvételt észlelt 2026-ban. Egyikük meg is szüntette ezeket, hogy más rendszerfejlesztésekre összpontosítson.

Itt az új témanyitó bejegyzések napi számát ábrázoljuk az egyik fő belső csatornán, ahol a kutatók más csapatoktól kérnek technikai segítséget. Tudomásunk szerint a csökkenést nem ellensúlyozta a kérdések átterelődése más, emberek által működtetett támogatási csatornára. A forgalom csökkenése illeszkedik ehhez az átfogó változáshoz.

Azt is vizsgálhatjuk, sikerrel végzik-e el a programozó ügynökök a kutatók feladatait. Ügynökalapú osztályozónk szerint januártól júliusig több nehézségi csoportban is nőtt a sikerarány az ismert tényleges kimenetelű feladatoknál. A nehézséget a becsült emberi feladatvégzési idővel közelítettük. Az ügynökök sikeréhez azonban még jelentős emberi irányítás kell, különösen összetettebb feladatoknál. Az elmúlt 6 hónapban a sikeres, 4–8 órás feladatok több mint fele legalább egy beavatkozást igényelt.

A kutatói feladatok sikeraránya idővel nőtt. A grafikon nem tartalmazza a bizonytalan kimenetelű besorolásokat, illetve az <50 munkamenethez vagy <50 egyedi felhasználóhoz tartozó pontokat.

A feladatok sikerességi és beavatkozási aránya januártól júliusig, időtáv szerinti bontásban. A bizonytalan kimenetelű besorolások nélkül.

4. A modellfejlesztés ütemezése

A biztonságos és hasznos AGI-t szolgáló, egyre fejlettebb rendszerek felé vezető haladás az ehhez szükséges védelmi intézkedésektől is függ. A szükséges védelmi intézkedések megítélése változhat, ahogy egyre többet tudunk meg a kockázatokról.

Ahogy korábban ismertettük,⁠ nemrég frissítettük a felügyeletre, az emberi célokhoz való igazodásra és a védelemre vonatkozó követelményeinket. Itt bemutatjuk, hogyan hatottak a közelmúltbeli korlátozások a kutatási tevékenység egyik területére.

*Az itt ábrázolt, július 20. és augusztus 6. közötti Astra-számítási kapacitás nagy része a biztonsági és védelmi fejlesztések megvalósításának tesztelését szolgálta.

Július 20-án, miután felfedeztük, hogy ügynökök feltörték a kutatási infrastruktúránkat, ideiglenesen leállítottuk a tanításhoz használt konténerszolgáltatást, majd jelentős további korlátozásokkal újraindítottuk.

Emiatt meredeken csökkent az RL-tanításhoz használt számítási kapacitás, amíg a csapatok az erősebb védelemmel ellátott kutatási környezethez igazították a munkafolyamataikat. A fenti ábra azt a kéthetes szünetet is tartalmazza, amely alatt felfüggesztettük a bevezetésre szánt legújabb modelljeink megerősítéses tanulását. A július 20. és augusztus 6. közötti Astra-osztályú RL-kísérletek futtatásainak többsége – a GPU-allokáció alapján – a biztonsági és védelmi fejlesztések megvalósításának tesztelését szolgálta.

Augusztus 7-én előzetes bizonyítékok utaltak arra, hogy az Astra a Felkészültségi keretrendszer⁠(új ablakban nyílik meg) szerint kritikus kiberképességekkel rendelkezhet⁠. Ez további modellspecifikus védelmi korlátozásokhoz vezetett: az Astra modellt magasabb biztonsági szintű kutatási környezetekben kellett futtatni. A következő héten az Astra-osztály GPU-allokációja további 59,2 százalékkal csökkent, míg a többi modellosztályé 17,2 százalékkal nőtt. Ez a növekedés ellensúlyozta az Astra-osztály csökkenésének mintegy 85 százalékát, így az elemzett RL-munkaterhelések teljes allokációja nagyrészt változatlan maradt. Ez a mintázat összhangban van azzal, hogy az Astrával végzett munka korlátozása idején a tanítás és a kísérletezés egy részét más modellekre helyezték át. Egybevág azokkal a kutatói beszámolókkal is, amelyek szerint új felhasználási módot találtak az új korlátozások alá eső munkaterhelésekhez már nem használható számítási kapacitásnak.

Ezek az adatok hasznos támpontot adnak a tanításról és a biztonságról folyó párbeszédhez: új szabályozó intézkedések bevezetésekor a számítási kapacitás továbbra is értékes és rugalmas erőforrás marad, amelyet a kutatási szervezet természetes módon más célokra irányít át. Hosszabb távon az MI fejlődési üteméről szóló párbeszédnek arra is ki kell térnie, hogyan használható fel a legjobban az új vagy tervezett korlátozások alá eső számítási kapacitás.

5. Az előttünk álló út

Küldetésünk szempontjából fontos, hogy haladjunk az emberi célokhoz igazodó RSI felé, és megértsük ezt a fejlődést. Tovább finomítjuk módszereinket, beszámolunk bővülő ismereteinkről, és a tájékozott társadalmi vitáért, valamint az élvonalbeli rendszerek érdemi demokratikus irányításáért dolgozunk.

Függelék: a bejegyzésben alkalmazott módszereink

Az ügynökökkel támogatott MI-kutatás még új terület, és még tanuljuk, hogyan mérjük. Egyes mutatók, például a kutatócsapataink által előállított kód mennyisége, viszonylag könnyen gyűjthetők, de nehezen értelmezhetők, mert bizonytalan a kapcsolatuk a kutatás előrehaladásával. A kutatás előrehaladását közvetlenebbül mérő mutatók – például hogy az ügynökök milyen gyakran oldják meg sikeresen a kutatóktól kapott feladatokat – hasznosabbak lehetnek, de kidolgozásuk és validálásuk összetett. További nehézség, hogy a kutatók által használt eszközök és rendszerek gyorsan fejlődnek. A kutatás gyorsulásának mélyebb megértése az OpenAI egészében kiemelt terület.

Az elemzésekben, eltérő jelzés hiányában:

  • A „kutató” tág fogalom: kutatási szervezetünk minden tagját jelöli, beleértve azokat is, akik kutatási infrastruktúrát építenek, kutatási projekteket irányítanak vagy más módon támogatják a tevékenységet.

  • A programozó ügynökök használati mutatói a használat nagy részét lefedik, de nem az egészét, mivel a kutatók eszközei és rendszerei gyorsan változnak.