Gå direkt till huvudinnehåll
OpenAI

22 september 2026

Säkerhet

Prioriteringar och principer för effektiva tredjepartsgranskningar

Laddar …

Laboratorier för banbrytande AI har ett enormt ansvar för att träna, utvärdera och driftsätta Modeller på ett säkert sätt. Tredjepartsgranskningar är avgörande för att balansera detta ansvar, skapa fler möjligheter till synpunkter på AI-säkerhet, hålla omvärlden informerad och se till att laboratorier kan ställas till svars utifrån tydliga och oberoende underbyggda säkerhetspåståenden.

Som en del av vårt arbete med att hålla jämna steg med den banbrytande AI-utvecklingen åtar sig OpenAI att stödja oberoende granskningar med omfattande åtkomst under träning, utvärdering och driftsättning. Den åtkomsten bör göra det möjligt för granskare att ifrågasätta våra antaganden, identifiera risker som vi kan ha förbisett och dra egna slutsatser om hur effektiva våra skyddsåtgärder är.

Vi har länge samarbetat med tredjepartsgranskare i olika skeden av utvecklingen och driftsättningen av Modeller. Vi har också införlivat tredjepartsgranskningar i våra rutiner enligt Preparedness Framework och stött organisationer och lagstiftning som verkar för en mer rigorös process med tydligare ansvarsutkrävande. I dessa samarbeten har vi gett omfattande åtkomst, bland annat till information om våra tekniska skyddsåtgärder, synliga tankekedjor samt tidigare oöverträffade mängder konfidentiella data och intern driftsåtkomst för incidenthantering och red teaming av övervakningssystem. Prioriteringarna och principerna här gäller vårt samarbete med oberoende granskningsorganisationer i den privata och ideella sektorn kring tekniska säkerhetsgranskningar. De kompletterar vårt arbete med myndigheter kring testning och utvärdering, där andra roller och ansvarsområden kan kräva andra tillvägagångssätt.

Effektiva granskningar kräver starka mekanismer för oberoende, vetenskaplig stringens, robusta säkerhetsrutiner och tydliga ansvarsområden. Laboratorier ansvarar för att möjliggöra meningsfull granskning samtidigt som känsliga uppgifter skyddas. Laboratorier och oberoende granskare delar ansvaret för att detta görs rätt och bör arbeta utifrån gemensamma internationella standarder för säkerhetsrutiner. Nedan föreslår vi fyra prioriterade områden för djupare granskning samt principer för ett rigoröst, säkert och oberoende arbete.

Prioriterade granskningsområden

Tredjepartsgranskningar är mest användbara när de behandlar specifika frågor med stor betydelse: Stöder beläggen ett laboratoriums säkerhetsargumentation och säkerhetspåståenden? Prövar utvärderingarna de risker som de är avsedda att mäta på ett tillfredsställande sätt? Fungerar skyddsåtgärderna under realistiska förhållanden?

Granskningarna som beskrivs här är avsedda att utformas på olika sätt beroende på vilka säkerhetsfrågor som undersöks. Vi räknar med att stödja flera parallella granskningar under olika tidsperioder, där vissa pågår i veckor och andra i flera månader. Tredjepartsgranskningar kan också ingå i arbetet före driftsättning och påverka beslut om driftsättning. Arbetet som beskrivs här är dock i allmänhet mer långsiktigt och oberoende av lanseringar, med fokus på att över tid djupgranska specifika säkerhetspåståenden.

I våra prioriterade områden och principer hänvisar vi till säkerhetspåståenden och säkerhetsargumentationer. Med dessa begrepp menar vi följande:

Säkerhetspåstående: Ett specifikt påstående om en Modells eller ett systems förmågor, beteende eller skyddsåtgärder som har betydelse för säkerheten och kan bedömas utifrån belägg. Ett påstående bör ange vilka risker och förhållanden det gäller samt relevanta antaganden och begränsningar.

Säkerhetsargumentation: Ett strukturerat och belagt resonemang som förklarar varför riskerna med en Modell eller ett system hanteras på ett tillfredsställande sätt för en viss aktivitet, exempelvis träning, utvärdering eller driftsättning. En säkerhetsargumentation kopplar enskilda säkerhetspåståenden till beläggen för dem och tydliggör de antaganden, osäkerheter och kvarstående risker som kan påverka slutsatserna.

Vi föreslår fyra prioriterade områden för djupare granskning samt principer för ett rigoröst, säkert och oberoende arbete.

  1. Oberoende granskning av säkerhetsargumentationer som omfattar träning, utvärdering samt intern och extern driftsättning.

    Granskning av säkerhetsargumentationer kräver sakkunskap inom alignment, kontrollmetoder såsom övervakning, cybersäkerhet, biologiskt och kemiskt missbruk samt red teaming. Säkerhetsargumentationer består av påståenden om bland annat träning, förmågeutvärderingar och skyddsåtgärder. Dessa kan bedömas som helhet eller var för sig (se prioritering 2 och 3 nedan). Flera granskare kommer sannolikt att behöva undersöka olika delar av argumentationerna utifrån sina respektive expertområden. Tillsammans bör deras granskningar besvara frågor som:

    1. Är beläggen för säkerhetsargumentationerna om träning, utvärdering och driftsättning väl underbyggda? Följdes villkoren i säkerhetsargumentationen under träning, utvärdering och driftsättning?

    2. Omfattar våra säkerhetsargumentationer de mest brådskande risker som identifieras under en granskning? Stöder säkerhetspåståendena den övergripande säkerhetsargumentationen? Finns det några brister eller förbättringsområden?

    3. Används effektiva metoder för att identifiera och minska incitament i träningen som kan belöna vilseledande beteende, belöningsmanipulation, destruktiva handlingar eller kringgående av begränsningar?

  2. Granskning av kritiska skyddsåtgärder vid intern och extern driftsättning

    Vår uppsättning skyddsåtgärder utvecklas ständigt i takt med förändrade förmågor och omvärldsförhållanden. Våra skyddsåtgärder omfattar träning samt intern och extern driftsättning. De omfattar för närvarande skydd på Modellnivå, efterlevnadsskydd och säkerhetsskydd samt övervakning av bristande alignment. Tillsammans täcker de många olika risker, exempelvis förlorad kontroll och missbruk kopplat till cyberrisker samt biologiska och kemiska risker. Tekniska partnerskap kan identifiera dagens svagheter i skyddsåtgärderna, förbättra granskningsmetoder och påskynda standardutvecklingen. Det ger en starkare teknisk grund för framtida offentlig politik som håller jämna steg med den banbrytande AI-utvecklingen, särskilt vid intern driftsättning där säkerhetsstandarderna fortfarande är i sin linda.

    Oberoende granskningar bör undersöka hur väl skyddsåtgärderna fungerar och var de kan brista, exempelvis:

    1. Är skyddsåtgärderna robusta mot antagonistiska tester (jailbreaks) vid åtkomst enligt principen ”grå låda”, och skyddar de tillräckligt mot förmågehöjningar inom högriskområden, exempelvis cyber och biologi? Omfattar våra antagonistiska tester och vår red teaming de viktigaste riskerna?

    2. Hur samverkar agenter vid auktoriserade tester under realistiska driftförhållanden med cyberförsvar såsom åtkomstkontroller, sandlådor samt system för identifiering och hantering? Vilka försvar förhindrar, upptäcker eller begränsar skadliga handlingar, och var brister de?

    3. Har våra övervakningssystem för bristande alignment några kritiska luckor som kan leda till förlorad kontroll eller allvarlig bristande alignment vid intern eller extern driftsättning? Hur tillförlitlig är övervakning av Tankekedjor som belägg för säkerhet eller alignment när Modellernas förmågor förbättras?

    4. Finns lämplig övervakning i all relevant träning, utvärdering och driftsättning, på ett sätt som inte enkelt kan inaktiveras?

    5. Är skyddsåtgärderna anpassade efter förmågorna?

  3. Granskning av förmågeutvärderingar som omfattar Preparedness-riskkategorierna (kemiska och biologiska risker, cybersäkerhet och AI-självförbättring) samt alignmentutvärderingar av risker för bristande alignment

    Vårt Preparedness Framework kräver utvärderingar av centrala områden med Frontlinjerisk. När tröskelvärden passeras och utvärderingar når mättnad är det viktigt att kontinuerligt förnya och säkerställa täckningen och kvaliteten hos utvärderingar av förmågor inom Preparedness-riskområden och hos alignmentutvärderingar som bedömer risker för allvarlig bristande alignment.

    Relevanta frågor är bland annat:

    1. Täcker utvärderingar av Preparedness-risker definitionen av tröskelvärdena för dessa risker på ett tillfredsställande sätt? Är tröskelvärdena för dessa utvärderingar korrekt fastställda?

    2. Uppdateras utvärderingarna när Modeller konsekvent når de högsta resultaten, och mäter de nya testerna mer avancerade förmågor på ett meningsfullt sätt?

    3. Täcker våra alignmentutvärderingar riskerna för allvarlig bristande alignment tillräckligt väl, och vilka viktiga beteenden eller förhållanden kan de missa?

  4. Oberoende utredning av kritiska incidenter med bristande alignment

    Oberoende utredningar kan vara värdefulla vid många typer av kritiska AI-säkerhetsincidenter. Här fokuserar vi på bristande alignment hos Modeller, inklusive när Modeller agerar utan tillstånd eller undviker tillsyn. Sådana händelser kan avslöja svagheter i metoder och skyddsåtgärder för alignment även utan avsiktligt missbruk.

    Under vissa omständigheter, som vid OpenAI-incidenten på Hugging Face, kan det vara värdefullt att anlita en oberoende tredje part för oberoende utredningar av incidenter med bristande alignment. Det är avgörande att tredje parter som deltar i incidentutredningar har den sakkunskap som krävs. Beroende på omständigheterna kan det omfatta cyberforensik, alignment, storskalig analys av Tankekedjor samt tillräcklig personal och tillräckliga resurser för att genomföra utredningen i tid. Incidenthantering kan kräva åtkomst till känsliga interna data och data från tredje part. Därför kan vissa uppgifter vara för känsliga för att publiceras eller göras tillgängliga. Resultat från oberoende utredningar kan också bidra till en Modells säkerhetsargumentation genom att ge belägg för bedömning av påståenden om dess alignment och hur effektiva åtgärderna mot tidigare observerad bristande alignment har varit.

    Vid incidenter med bristande alignment prioriterar vi oberoende granskningar av följande frågor:

    1. Vilka Modellbeteenden eller problem med bristande alignment uppstod under incidenten, och vilka var de främsta bidragande faktorerna?

    2. Skulle skyddsåtgärder och korrigerande åtgärder effektivt begränsa liknande incidenter i framtiden?

Principer för effektiva granskningar

  • Tydligt avgränsade och gemensamt överenskomna påståenden för granskning: Granskningar bör inledas med en gemensamt överenskommen avgränsning, följd av tydligt definierade säkerhetspåståenden som registreras innan granskningen påbörjas. Tredje parter och laboratorier bör klargöra om det rör sig om påståenden som företaget som granskas vill lägga fram för bedömning, eller om påståenden som den oberoende granskaren vill bedöma och som laboratoriet samtycker till att granskas mot. Det finns många skäl till att vissa påståenden kan falla utanför avgränsningen, bland annat att tredje parter inte kan få tillgång till data, att granskaren saknar tillräcklig sakkunskap eller att tiden rimligen är begränsad när en granskning är brådskande. Laboratorier och granskare bör införa en process för att hantera betydande risker som identifieras utanför den ursprungliga avgränsningen, inklusive att avgöra om vidare utredning behövs. Slutsatserna bör tydligt ange vad som granskades respektive inte granskades i förhållande till den gemensamt överenskomna avgränsningen.

  • Proportionerlig åtkomst: Granskare bör där det är möjligt få den åtkomst som krävs för att bedöma de överenskomna påståendena, inom ramen för juridiska krav samt säkerhets- och immaterialrättsliga begränsningar. När direkt åtkomst är opraktisk eller omöjlig kan granskare samarbeta med en utsedd företagsrepresentant eller undersöka indirekta eller integritetsbevarande åtkomstmetoder för att skydda den bakomliggande informationen.

  • Transparent metodik och tydliga standarder: Granskare bör redogöra för sina metoder, bedömningskriterier och osäkerheter och använda etablerade standarder där sådana finns. Om standarder ännu saknas bör granskarna tydligt motivera de kriterier de använder. Rapporter bör skilja direkta iakttagelser från tolkningar, förklara osäkerheten och tydliggöra vilka slutsatser som stöds av beläggen.

  • Sakkunskap och oberoende: Granskare bör kunna visa relevant teknisk sakkunskap samt identifiera, redovisa och hantera organisatoriska och individuella intressekonflikter, inklusive ekonomiska incitament, relationer med utvecklare och tidigare medverkan i det arbete som granskas. Skyddsåtgärder bör utformas så att kommersiella påtryckningar och ersättningsupplägg inte påverkar resultaten. Det kan bland annat innebära att någon avstår från medverkan eller att lämpliga karensperioder tillämpas.

  • Säkerhet och konfidentialitet: Granskare bör kunna visa att de tillämpar informationssäkerhet och rättsligt bindande sekretesskydd för sin personal, i proportion till hur känsliga de berörda systemen och uppgifterna är. Skyddet bör omfatta immateriella rättigheter, känsliga uppgifter och granskningsdokumentation. Om granskarna inte kan uppfylla säkerhetskraven i sina egna miljöer, eller om uppgifterna är särskilt känsliga, kan åtkomst via företagsadministrerade enheter eller i företagets lokaler vara lämplig.

  • Åtgärdsbara resultat och tid för korrigering: Granskningar bör identifiera konkreta brister och ge laboratorierna tillräckligt med information för att åtgärda dem. När det är lämpligt bör laboratorier få skälig tid att åtgärda problemen före publicering. När det är relevant bör rapporterna även beskriva lärdomar för utvecklare, driftsättare och försvarare av agenter samt ge praktiska rekommendationer för genomförandet.

  • Ansvarsfull publicering: Granskningsrapporter bör bygga på belägg och delas så öppet som möjligt, samtidigt som känsliga och konfidentiella uppgifter skyddas. När fullständig offentlig redovisning inte är möjlig kan konfidentiell rapportering till lämpliga tillsynsorgan, exempelvis styrande organ eller företagsstyrelser, bidra till ansvarsutkrävande. Det bör finnas principbaserade skydd och riktlinjer för maskning samt tydliga förväntningar på återkoppling och rättelse av felaktigheter, så att balansen mellan oberoende och konfidentialitet bevaras. Granskare bör behålla sitt redaktionella oberoende och samtidigt säkerställa att sekretessen och skyddet för immateriella rättigheter upprätthålls. Granskare bör anta tydliga riktlinjer för maskning som låter laboratorier begära att känsliga uppgifter maskas, samtidigt som granskarna kan ange var väsentliga maskningar har gjorts och hur de påverkar granskningsrapporten.

Vägen framåt

Vi är fast beslutna att stödja oberoende granskare och ta fram tydligare, gemensamma internationella standarder – både genom framtida lagstiftning och privata styrningsinstitutioner – för effektiva tredjepartsgranskningar. Ekosystemet för oberoende utvärdering växer fortfarande. Vi kommer att bidra till utvecklingen genom att stödja och samarbeta med en mångsidig grupp oberoende granskare med djup sakkunskap inom frågor om säkerheten hos banbrytande AI. Ingen enskild tredje part kan eller bör ensam täcka alla brådskande frågor om säkerheten hos banbrytande AI. Vi kommer att arbeta genomtänkt och målmedvetet för att stärka vår kapacitet och hjälpa det växande tredjepartsekosystemet att enas om bästa praxis och gemensamma principer. Vi för samtal med flera tredje parter om förslag som ligger i linje med de prioriterade områdena ovan.