Ugrás a fő tartalomra
OpenAI

2026. szeptember 22.

Biztonság

A hatékony külső értékelések prioritásai és alapelvei

Betöltés…

Az élvonalbeli MI-laboratóriumokra óriási felelősség hárul a modellek biztonságos betanítása, értékelése és üzembe helyezése terén. A külső értékelések kulcsszerepet játszanak e felelősség kiegyensúlyozásában: több lehetőséget teremtenek az MI-biztonsággal kapcsolatos vélemények megfogalmazására, tájékoztatják a világot, és számonkérhetővé teszik a laboratóriumokat az egyértelmű, függetlenül alátámasztott biztonsági állítások alapján.

Az élvonal fejlődésével lépést tartó erőfeszítéseink részeként az OpenAI elkötelezett a független értékelések támogatása mellett, mélyreható hozzáférést biztosítva a betanítás, az értékelés és az üzembe helyezés során. E hozzáférésnek lehetővé kell tennie, hogy az értékelők megkérdőjelezzék feltételezéseinket, azonosítsák az általunk esetleg figyelmen kívül hagyott kockázatokat, és önálló következtetéseket vonjanak le védelmi intézkedéseink hatékonyságáról.

Régóta együttműködünk külső értékelőkkel a modellfejlesztési és üzembehelyezési folyamat különböző szakaszaiban. A külső értékeléseket a Felkészültségi keretrendszerünk gyakorlataiba is beépítettük, és olyan szervezeteket és jogszabályokat támogattunk, amelyek szigorúbb és elszámoltathatóbb folyamatot szorgalmaznak. Ezen együttműködések során mélyreható hozzáférést biztosítottunk többek között műszaki védelmi intézkedéseink adataihoz, a látható gondolatmenethez, valamint korábban példa nélküli mértékben bizalmas adatokhoz és belső üzembehelyezési környezetekhez az incidenskezelés és a monitorok támadásszimulációja céljából. Az itt ismertetett prioritások és alapelvek arra összpontosítanak, hogyan működünk együtt a magán- és nonprofit szektor független értékelő szervezeteivel a műszaki biztonsági értékelésekben. Ezek kiegészítik a tesztelés és értékelés terén a kormányokkal végzett munkánkat, ahol az eltérő szerepek és felelősségi körök más megközelítéseket tehetnek szükségessé.

A hatékony értékelésekhez erős függetlenségi mechanizmusokra, tudományos szigorra, megbízható biztonsági gyakorlatokra és egyértelmű felelősségi körökre van szükség. A laboratóriumok feladata, hogy lehetővé tegyék az érdemi ellenőrzést, miközben védik az érzékeny információkat. A megfelelő megvalósítás közös felelőssége a laboratóriumoknak és a független értékelőknek, akiknek a biztonsági gyakorlatokra vonatkozó közös nemzetközi szabványok szerint kell működniük. Az alábbiakban négy kiemelt területet javaslunk a mélyrehatóbb értékeléshez, valamint alapelveket a szigorú, biztonságos és független munkához.

Az értékelés kiemelt területei

A külső értékelések akkor a leghasznosabbak, ha konkrét, lényeges kérdésekre keresnek választ: alátámasztják-e a bizonyítékok a laboratórium biztonsági érvelését és biztonsági állításait? Megfelelően vizsgálják-e az értékelések azokat a kockázatokat, amelyek mérésére szolgálnak? Működnek-e a védelmi intézkedések valósághű körülmények között?

Az itt ismertetett értékelések a vizsgált biztonsági kérdésektől függően eltérő formát ölthetnek. Várhatóan több értékelést támogatunk párhuzamosan, eltérő időtávokon: egyesek hetekig, mások több hónapig tartanak majd. Bár a külső értékelések az üzembe helyezést megelőző munka részét is képezhetik, és befolyásolhatják az üzembehelyezési döntéseket, az itt ismertetett munka általában hosszabb távú, és nem kötődik konkrét bevezetéshez: célja egyes biztonsági állítások időben elmélyült vizsgálata.

Kiemelt területeink és alapelveink ismertetése során biztonsági állításokra és biztonsági érvelésekre hivatkozunk. E fogalmak alatt a következőket értjük:

Biztonsági állítás: Egy modell vagy rendszer képességeire, viselkedésére vagy védelmi intézkedéseire vonatkozó konkrét kijelentés, amely biztonsági szempontból releváns, és bizonyítékok alapján értékelhető. Az állításnak meg kell határoznia az érintett kockázatokat és feltételeket, valamint a vonatkozó feltételezéseket és korlátokat.

Biztonsági érvelés: Bizonyítékokkal alátámasztott, strukturált érvelés arról, hogy egy modell vagy rendszer kockázatait miért kezelik megfelelően egy meghatározott tevékenység – például betanítás, értékelés vagy üzembe helyezés – során. A biztonsági érvelés összekapcsolja az egyes biztonsági állításokat az azokat alátámasztó bizonyítékokkal, és egyértelművé teszi a következtetéseket befolyásoló feltételezéseket, bizonytalanságokat és fennmaradó kockázatokat.

Négy kiemelt területet javaslunk a mélyrehatóbb értékeléshez, valamint alapelveket a szigorú, biztonságos és független munkához.

  1. A betanításra, az értékelésre, valamint a belső és külső üzembe helyezésre kiterjedő biztonsági érvelések független értékelése.

    A biztonsági érvelések értékeléséhez szakértelem szükséges az összehangolás, az ellenőrzési módszerek – például a monitorozás –, a kiberbiztonság, a biológiai és vegyi visszaélések, valamint a támadásszimuláció terén. A biztonsági érvelések többek között a betanításra, a képességértékelésekre és a védelmi intézkedésekre vonatkozó állításokból állnak, amelyek együtt vagy külön-külön is értékelhetők (lásd alább a 2. és 3. prioritást). Az érvelések különböző részeit valószínűleg több értékelőnek kell megvizsgálnia, saját szakterületére támaszkodva. Értékeléseiknek együttesen többek között a következő kérdésekre kell választ adniuk:

    1. Megfelelően alátámasztottak-e a betanításra, az értékelésre és az üzembe helyezésekre vonatkozó biztonsági érvelések bizonyítékai? Betartották-e a biztonsági érvelésben meghatározott feltételeket a betanítás, az értékelés és az üzembe helyezés során?

    2. Lefedik-e biztonsági érveléseink az értékelés során azonosított legsürgetőbb kockázatokat? Alátámasztják-e a biztonsági állítások az átfogó biztonsági érvelést? Vannak-e hiányosságok vagy fejlesztendő területek?

    3. Hatékony módszerekkel azonosítják és csökkentik-e a betanítás során azokat az ösztönzőket, amelyek jutalmazhatják a megtévesztést, a jutalommanipulációt, a romboló cselekedeteket vagy a korlátozások megkerülését?

  2. A kritikus védelmi intézkedések értékelése a belső és külső üzembe helyezések során

    Védelmi rendszerünket folyamatosan fejlesztjük, hogy lépést tartson a változó képességekkel és környezettel. Védelmi intézkedéseink a betanításra, valamint a belső és külső üzembe helyezésre is kiterjednek. Jelenleg modell-, végrehajtási és biztonsági szintű védelmi intézkedéseket, valamint az összehangolatlanságot figyelő monitorokat alkalmazunk. Ezek a kockázatok széles körét fedik le, például az irányítás elvesztését, illetve a kiber-, biológiai és vegyi visszaéléseket. A műszaki partnerségek már most feltárhatják a védelmi intézkedések gyenge pontjait, miközben javítják az értékelési módszereket és felgyorsítják a szabványok kidolgozását. Ez szilárdabb műszaki alapot teremt az élvonallal lépést tartó jövőbeli közpolitikákhoz, különösen a belső üzembe helyezéseknél, ahol a biztonsági szabványok még kialakulóban vannak.

    A független értékeléseknek meg kell vizsgálniuk, mennyire hatékonyak ezek a védelmi intézkedések, és hol lehetnek hiányosságaik, például:

    1. „Szürke dobozos” hozzáférés mellett ellenállnak-e a védelmi intézkedések az ellenséges tesztelésnek (jailbreakeknek), és kellő védelmet nyújtanak-e a képességek növekedésével szemben a nagy kockázatú területeken (például a kiber- és biológiai területen)? Lefedi-e ellenséges tesztelésünk és támadásszimulációnk a legfontosabb kockázatokat?

    2. Hogyan lépnek kapcsolatba az ügynökök az olyan kibervédelmi megoldásokkal, mint a hozzáférés-vezérlés, az elkülönített futtatókörnyezet és az észlelési, illetve reagálási rendszerek, ha engedélyezett tesztelés zajlik valósághű működési körülmények között? Mely védelmi megoldások előzik meg, észlelik vagy tartják kordában a káros cselekedeteket, és hol vallanak kudarcot?

    3. Vannak-e az összehangolatlanságot figyelő monitorainknak olyan kritikus hiányosságai, amelyek az irányítás elvesztéséhez vagy súlyos összehangolatlansághoz vezethetnek a belső és a külső üzembe helyezések során? A modellképességek fejlődésével mennyire megbízható bizonyítékforrás a gondolatmenet monitorozása a biztonság vagy az összehangoltság szempontjából?

    4. Minden releváns betanítási, értékelési és üzembehelyezési folyamatban megfelelő, nehezen kikapcsolható monitorozást alkalmazunk-e?

    5. A képességekkel arányos védelmi intézkedéseket alkalmazunk-e?

  3. A Felkészültségi keretrendszer kockázati kategóriáira (vegyi és biológiai kockázatok, kiberbiztonság, az MI önfejlesztése) kiterjedő képességértékelések, valamint az összehangolatlansági kockázatokra vonatkozó összehangoltsági értékelések vizsgálata

    Felkészültségi keretrendszerünk előírja, hogy az értékelések vizsgálják a legfontosabb határkockázati területeket. A küszöbértékek átlépésével és az értékelések telítődésével fontos rendszeresen megújítani a Felkészültségi keretrendszer kockázati területein vizsgált képességértékeléseket, biztosítani azok megfelelő lefedettségét és minőségét, valamint ugyanezt megtenni a súlyos összehangolatlansági kockázatokat vizsgáló összehangoltsági értékelésekkel.

    A releváns kérdések közé tartoznak a következők:

    1. A Felkészültségi keretrendszer kockázatait vizsgáló értékelések megfelelően lefedik-e az e kockázatokhoz tartozó küszöbértékek meghatározását? Megfelelően határozták-e meg ezen értékelések küszöbértékeit?

    2. Frissítik-e az értékeléseket, amikor a modellek tartósan a legmagasabb pontszámokat érik el, és az új tesztek érdemben mérik-e a fejlettebb képességeket?

    3. Megfelelően lefedik-e összehangoltsági értékeléseink a súlyos összehangolatlansági kockázatokat, és milyen fontos viselkedéseket vagy körülményeket hagyhatnak figyelmen kívül?

  4. A kritikus összehangolatlansági incidensek független kivizsgálása

    A független kivizsgálás számos kritikus MI-biztonsági incidens esetén értékes lehet. Itt a modellek összehangolatlanságára összpontosítunk, ideértve az engedély nélkül cselekvő vagy a felügyeletet kijátszó modelleket is. Ezek szándékos visszaélés nélkül is feltárhatják az összehangolási módszerek és a védelmi intézkedések gyenge pontjait.

    Bizonyos esetekben – mint az OpenAI Hugging Face-incidensénél – előnyös lehet független külső felet bevonni az összehangolatlansági incidens független kivizsgálásába. Alapvető fontosságú, hogy az incidensek kivizsgálásában részt vevő külső felek rendelkezzenek a szükséges vizsgálati szakértelemmel. Ez adott esetben kiberforenzikai és összehangolási szakértelmet, nagy léptékű gondolatmenet-elemzési képességet, valamint a kivizsgálás időben történő elvégzéséhez szükséges személyzetet és erőforrásokat jelent. Az incidenskezelés érzékeny belső és külső felektől származó adatokhoz való hozzáféréssel járhat, ezért egyes részletek közzététele vagy hozzáférhetővé tétele kockázatos lehet. A független vizsgálatok megállapításai a modell biztonsági érveléséhez is felhasználhatók: bizonyítékot nyújthatnak az összehangoltságára, valamint a korábban megfigyelt összehangolatlanság orvoslására tett intézkedések hatékonyságára vonatkozó állítások értékeléséhez.

    Az összehangolatlansági incidensek kapcsán a következőkre irányuló független értékeléseket tekintjük kiemeltnek:

    1. Milyen modellviselkedés vagy összehangolatlansági probléma jelentkezett az incidens során, és melyek voltak az elsődleges kiváltó tényezők?

    2. A védelmi és helyreállító intézkedések hatékonyan enyhítenék-e a hasonló jövőbeli incidenseket?

A hatékony értékelések alapelvei

  • Egyértelműen körülhatárolt, közösen elfogadott értékelési állítások: Az értékeléseket közösen elfogadott hatókör meghatározásával kell kezdeni, majd világosan megfogalmazott biztonsági állításokat kell előzetesen regisztrálni az értékelési tevékenységek megkezdése előtt. A külső feleknek és a laboratóriumoknak tisztázniuk kell, hogy az értékelendő vállalat által előterjesztett állításokról van-e szó, vagy olyanokról, amelyeket a külső értékelő önállóan kíván vizsgálni, és amelyek szerinti értékeléshez a laboratórium hozzájárul. Egyes állítások számos okból kívül eshetnek a hatókörön: például a külső felek nem férhetnek hozzá az adatokhoz, az értékelő nem rendelkezik elegendő szakértelemmel, vagy sürgős értékelés esetén indokolt időbeli korlátok állnak fenn. A laboratóriumoknak és az értékelőknek eljárást kell kialakítaniuk az eredeti hatókörön kívül azonosított jelentős kockázatok mérlegelésére, beleértve annak eldöntését, hogy szükséges-e további vizsgálat. A következtetésekből egyértelműen ki kell derülnie, hogy a közösen elfogadott hatókör tekintetében mit értékeltek és mit nem.

  • Arányos hozzáférés: Az értékelőknek lehetőség szerint, a jogi, biztonsági és szellemitulajdon-védelmi korlátokon belül az elfogadott állítások vizsgálatához mérten arányos hozzáférést kell kapniuk. Ha a közvetlen hozzáférés nem praktikus vagy nem lehetséges, az értékelők együttműködhetnek a vállalat kijelölt képviselőjével, illetve közvetett vagy a magánszférát védő hozzáférési megoldásokat alkalmazhatnak az alapul szolgáló információk védelmében.

  • Átlátható módszertan és szabványok: Az értékelőknek ismertetniük kell módszereiket, értékelési szempontjaikat és a bizonytalanságokat, és ahol lehet, elfogadott szabványokra kell támaszkodniuk. Ahol még nincsenek szabványok, egyértelműen meg kell indokolniuk az alkalmazott szempontokat. A jelentéseknek el kell különíteniük a közvetlen megállapításokat az értelmezéstől, ismertetniük kell a bizonytalanságot, és egyértelművé kell tenniük, hogy a bizonyítékok mely következtetéseket támasztják alá.

  • Szakértelem és függetlenség: Az értékelőknek igazolniuk kell a szükséges műszaki szakértelmet, továbbá azonosítaniuk, nyilvánosságra hozniuk és kezelniük kell a szervezeti és egyéni összeférhetetlenségeket, köztük a pénzügyi ösztönzőket, a fejlesztőkkel fennálló kapcsolatokat és az értékelt munkában való korábbi részvételt. A védelmi intézkedéseket úgy kell kialakítani, hogy az üzleti nyomás és a díjazási megállapodások ne befolyásolják a megállapításokat; ezek az intézkedések magukban foglalhatják az ügytől való visszalépést vagy megfelelő kizárási időszakokat.

  • Biztonság és titoktartás: Az értékelőknek igazolniuk kell, hogy az általuk és munkatársaik által alkalmazott információbiztonsági gyakorlatok és kikényszeríthető titoktartási garanciák arányban állnak a hozzáférhető rendszerek és információk érzékenységével. E védelemnek ki kell terjednie a szellemi tulajdonra, az érzékeny információkra és az értékelési nyilvántartásokra. Ha az értékelők saját környezetükben nem tudják teljesíteni a biztonsági követelményeket, vagy a hozzáférhető adatok különösen érzékenyek, indokolt lehet a vállalat által felügyelt eszközökön vagy helyszíneken hozzáférést biztosítani.

  • Hasznosítható megállapítások és idő a hibák elhárítására: Az értékeléseknek konkrét hiányosságokat kell azonosítaniuk, és elegendő részletet kell nyújtaniuk ahhoz, hogy a laboratóriumok orvosolhassák őket. Indokolt esetben a laboratóriumoknak a közzététel előtt észszerű időt kell kapniuk a problémák orvoslására. Ahol releváns, a jelentéseknek az ügynökök fejlesztői, üzemeltetői és védelmezői számára levonható tanulságokat is ismertetniük kell, gyakorlati megvalósítási javaslatokkal együtt.

  • Felelős közzétételi gyakorlatok: Az értékelési jelentéseket bizonyítékokra kell alapozni, és a lehető legnyíltabban kell megosztani, az érzékeny és bizalmas információk védelme mellett. Ha a teljes nyilvánosságra hozatal nem lehetséges, az illetékes felügyeleti szerveknek – például irányító testületeknek vagy vállalati igazgatóságoknak – küldött bizalmas jelentések elősegíthetik az elszámoltathatóságot. A függetlenség és a titoktartás egyensúlyának megőrzése érdekében elvszerű kitakarási garanciákra és szabályzatokra, valamint a visszajelzésekkel és a pontatlanságok javításával kapcsolatos egyértelmű elvárásokra van szükség. Az értékelőknek meg kell őrizniük szerkesztői függetlenségüket, miközben gondoskodnak a titoktartási és szellemitulajdon-védelmi garanciák fenntartásáról. Az értékelőknek egyértelmű kitakarási szabályzatokat kell elfogadniuk, amelyek alapján a laboratóriumok kérhetik az érzékeny információk kitakarását, az értékelők pedig jelezhetik, hol történt érdemi kitakarás, és ez hogyan befolyásolta értékelési jelentésüket.

A következő lépések

Elkötelezettek vagyunk a független értékelők támogatása és a hatékony külső értékelésekre vonatkozó, egyértelműbb közös nemzetközi szabványok kialakítása mellett, mind jövőbeli jogszabályok, mind magánirányítási intézmények révén. Bár a független értékelések ökoszisztémája még fejlődik, növekedését az élvonalbeli MI biztonsági kérdéseiben alapos szakértelemmel rendelkező független értékelők sokszínű közösségének támogatásával és a velük való együttműködéssel segítjük. Egyetlen külső fél sem képes és nem is hivatott átfogóan lefedni az élvonalbeli MI sürgető biztonsági kérdéseit. Megfontoltan és céltudatosan bővítjük kapacitásunkat, és segítjük a növekvő külső ökoszisztémát abban, hogy közös nevezőre jusson a bevált gyakorlatokról és alapelvekről. Több külső féllel is tárgyalunk a fenti kiemelt területekhez igazodó javaslatokról.