Gå direkt till huvudinnehåll
OpenAI

28 september 2026

Säkerhet

Mot säkerhetsargumentation för träning av banbrytande AI

Laddar …

Vi tror att vi går in i en ny era där strukturerad säkerhetsdokumentation bör krävas innan någon banbrytande träningskörning med förstärkningsinlärning får fortsätta. Helst skulle sådan dokumentation uppfylla kraven för ”säkerhetsargumentation” – omfattande, strukturerade och evidensbaserade resonemang om risker av det slag som används i andra säkerhetskritiska branscher. Vi ser säkerhetsargumentation som en vägledande målbild att arbeta mot. Samtidigt är vi medvetna om hur svårt det är att göra den lika stringent för AI-modeller som för flyg eller kärnkraft, eftersom varje ny nivå av AI-förmåga medför ny, framväxande komplexitet. Vi arbetar med ett ramverk för att formalisera dessa arbetssätt.

Nedan följer några inledande riktlinjer som vi anser bör ingå i sådan säkerhetsargumentation vid träning av banbrytande AI. Dessa rekommenderade arbetssätt speglar våra hittillsvarande lärdomar. Vi räknar med att de utvecklas i takt med att vi fortsätter förfina våra interna processer för omsorgsfull utveckling. Vi delar dem nu för att ge insyn i hur vi tänker i dag och välkomnar synpunkter från omvärlden. Observera att det här dokumentet fokuserar på banbrytande träning med förstärkningsinlärning. Vid intern och extern driftsättning behöver man beakta betydligt fler egenskaper som rör målanpassning.

1. Tekniska skyddsåtgärder

Säkerhetsargumentationen bör omfatta tre aspekter av den tekniska miljön: målanpassningsträning, isolering och övervakning. Dessa skyddsåtgärder bidrar till att säkerställa att modellen inte försöker agera i strid med de avsedda målen. Även om den skulle göra det, ska isoleringen vara svår att bryta sig ur och övervakningen upptäcka det innan någon skada kan uppstå.

  • Målanpassning av modeller: Den första försvarslinjen bör vara att träna modeller så att de är målanpassade, det vill säga att de tillförlitligt agerar på det sätt vi avser. Detta kan omfatta:

    • Träningsmiljöer och bedömning: Minska risken för att modeller utvecklar beteenden som strider mot de avsedda målen genom att förhindra positiv förstärkning av belöningsmanipulation under träningen. Detta kan omfatta:

      • Automatiserad granskning av dataset: Använd agenter för att hitta och åtgärda bristfälliga RL-miljöer där handlingssekvenser som strider mot de avsedda målen kan få hög belöning genom att utnyttja sårbarheter i stället för att uppvisa avsett beteende. Det minskar möjligheterna att förstärka bristande målanpassning under träningen.

      • Manuell granskning av dataset: Komplettera automatiserad red teaming med manuell granskning och kvalitetskontroller av dataset för att identifiera bristfälliga uppgifter som oavsiktligt kan förstärka beteenden som strider mot de avsedda målen.

      • Justering av bedömningssystem: Justera bedömningssystem så att modellens försök att utnyttja sårbarheter eller hacka RL-miljöer under träningen ger avdrag.

      • Analys av tidigare körningar: Använd klassificerare på körspår från tidigare experiment för att säkerställa att bedömningssystemen fungerar som avsett.

    • Mätning av målanpassning: Genomför utvärderingar som följer modellens benägenhet till bristande målanpassning för att mäta hur effektiv målanpassningsträningen är. Detta kan omfatta:

      • Offlineutvärderingar av målanpassning: Genomför målanpassningsutvärderingar under banbrytande träningskörningar för att bedöma om träningen fungerar som avsett, och utred alla väsentliga försämringar.

      • Testning mot historiska data: Testa målanpassningsutvärderingar mot tidigare incidenter för att bekräfta att de upptäcker tidigare bristfälligt målanpassade modeller och inte överanpassas till enskilda incidenter.

      • Övervaka manipulation av utvärderingar: Övervaka utvärderingsmedvetenhet eller metaspel (att modeller inser att de testas) som kan leda till beteendeförändringar, med tydliga trösklar för blockering. Aktivera exempelvis övervakning av utvärderingsmedvetenhet och metaspel vid målanpassningsutvärderingar.

      • Stresstester av värsta tänkbara fall: Framkalla värsta tänkbara felbeteende och kontrollera att minst en utvärdering skulle upptäcka det.

    • Förhindra träning på tankekedjan: Låt inte automatiserade bedömningssystem se tankekedjan under förstärkningsinlärning. Det förhindrar att modeller utvecklas till att kringgå övervakning av tankekedjan.

  • Isolering: Se till att sandlådeisolering och säkerhet är tillräckligt starka för att förhindra skadliga handlingar om en modell skulle bli bristfälligt målanpassad. Detta kan omfatta:

    • Flera lager av infrastruktursäkerhet: Investera kraftigt i att härda både sandlådan som modellen körs i och den forskningsinfrastruktur som sandlådan ligger på. Det ger oss ett extra skyddslager om modellen skulle bryta sig ur sandlådan.

    • Red teaming av isoleringen: Förbättra säkerheten i sandlådan, forskningsinfrastrukturen och skalskyddet genom upprepad red teaming av dessa system med hjälp av kontrollpunkter från banbrytande träningskörningar. Arbetet ska föregås av en säkerhetsanalys och syfta till att hitta och täppa till eventuella luckor. Genomför även red teaming av alla tjänster som modellen kan komma åt under träningen (t.ex. internetcache).

    • Kommunikation mellan samplingar: Begränsa kommunikation med hög bandbredd mellan samplingar till godkända vägar, såsom verktyg för flera agenter. Stäng sidokanaler i infrastrukturen som har hög bandbredd och är lätta för agenter att upptäcka.

    • Oföränderliga konversationsloggar: Spara agenternas konversationsloggar i oföränderligt format under en rimlig tid (t.ex. i lagringskonton med engångsskrivning) för all RL-träning, utvärdering och intern driftsättning. Det möjliggör tillförlitliga incidentutredningar och förhindrar oavsiktliga ändringar.

  • Övervakning: Ha ett övervakningssystem i realtid som kan upptäcka eventuell bristande målanpassning om modeller börjar agera i strid med de avsedda målen, och åtgärda prioriterade problem snabbt innan en allvarlig incident kan inträffa. Detta kan omfatta:

    • Kräv övervakningsbarhet: Säkerställ att modeller förblir övervakningsbara, mätt genom utvärderingar av övervakningsbarhet och kringgående av övervakning med tydliga tröskelvärden, så att oroande beteenden upptäcks tidigt.

    • Hög detektionsgrad för kända problem: Säkerställ att övervakningssystemet upptäcker en hög andel av tidigare incidenter i en utvärdering med data som hållits utanför träningen.

    • Aktuella utvärderingar av övervakningen: Skapa datapunkter för utvärdering som representerar helt nya risker i nya körningar, så att måtten på övervakningens detektionsgrad och precision inte blir inaktuella.

    • Snabb respons: Inför prioriterade larm som leder till åtgärder inom ett fastställt SLA, antingen genom att larma en jourhavande person eller genom att automatiskt pausa den berörda körningen innan modellen orsakar skada. Larma exempelvis säkerhetsjouren och den körningsansvariga vid incidenter dagtid, och pausa körningar automatiskt vid okvitterade larm nattetid.

2. Operativa riktlinjer

Utöver rekommendationer om tekniska skyddsåtgärder har vi arbetat med operativa arbetssätt för säkerhetsargumentation vid träningskörningar med banbrytande AI. Dessa kan omfatta:

  • Invändningar (förhandsanalyser av tänkbara misslyckanden): När ett utkast till säkerhetsargumentation har tagits fram bör en medarbetare från ett annat team skriva en invändning för att hitta eventuella luckor och ge en välavvägd riskbedömning. Träningsteamet bör sedan bemöta detta för att stärka säkerhetsargumentationen.

  • Godkännanden: Säkerhetsargumentationen bör granskas av personer i den högsta ledningen, som var och en bör kunna lägga in veto mot körningen. Det säkerställer flera interna kontrollinstanser för körningen (t.ex. forskningsorganisationens chef eller forskningsdirektören, säkerhetschefen och den vetenskapliga chefen).

  • Ansvarsutkrävande: Den person i den högsta ledningen som ansvarar för en träningskörning (t.ex. forskningsorganisationens chef eller forskningsdirektören) bör hållas ansvarig för säkerhetsargumentationen och eventuell incidenthantering, även vid prestationsbedömningar. Det ger också träningsteamen incitament att driva arbetet med säkerhet och målanpassning.

  • Pausning: Om problem upptäcks som skulle ogiltigförklara säkerhetsargumentationen (t.ex. ett nytt säkerhetsproblem) ska det finnas körinstruktioner, tekniska kontroller och servicenivåavtal (SLA) för att pausa alla berörda körningar.

  • Intern transparens: Säkerhetsargumentationen bör göras tillgänglig för interna tillsynsgrupper (t.ex. Säkerhets- och skyddskommittén).

  • Revisioner: Revisorer bör ges tillräcklig åtkomst för att verifiera att påståendena i säkerhetsargumentationen är giltiga och välgrundade, och för att påtala eventuella brister.

  • Eskalering: Det bör finnas en tydlig process för att eskalera problem med bristande målanpassning, med en tabell över definierade allvarlighetsnivåer och en jourfunktion för målanpassningsproblem som kan larma ledningen (t.ex. vd) när en körning når en viss allvarlighetsnivå.

  • Tekniska kontroller: Det bör vara svårt för människor och agenter att starta körningar som inte uppfyller kraven. Säkerhetsfunktioner som övervakning och automatisk pausning bör blockera fortsatt drift om de slutar fungera. Det bör exempelvis inte gå att starta körningar utan att lämplig övervakning är aktiverad, eller att inaktivera övervakningen inifrån RL-träning, utvärdering eller en intern driftsättning.

  • Möjlighet att återställa: Det bör vara enkelt att identifiera all efterföljande användning av en bristfälligt målanpassad modell i träningsprocessen (t.ex. datagenerering eller bedömning). Då kan effekterna av utdata som strider mot de avsedda målen vid behov upphävas.

  • Fullständig redovisning av kvarstående risker: Säkerhetsargumentationen bör innehålla en så heltäckande förteckning som möjligt över kvarstående risker som inte täcks av befintliga riskreducerande åtgärder, så att beslut om riskacceptans kan fattas på goda grunder.

Detta är våra nuvarande rekommendationer, som vi håller på att införa på OpenAI. Vi räknar med att våra arbetssätt fortsätter att utvecklas under de kommande veckorna.

3. Utredning av incidenter med bristande målanpassning

Vi har också arbetat fram rekommenderade arbetssätt för att utreda allvarliga incidenter med bristande målanpassning hos AI. AI-labb bör sträva efter att lära sig så mycket som möjligt av enskilda incidenter, i likhet med utredningsrutinerna⁠(öppnas i ett nytt fönster) i andra branscher där mycket står på spel, för att kunna förhindra liknande händelser i framtiden. Exempel på sådana åtgärder:

  • Intern transparens: Eftersom en utredning kan ta lång tid bör regelbundna lägesuppdateringar om incidentutredningar presenteras internt (t.ex. dagliga uppdateringar för pågående utredningar). Det bör finnas fastställda vägar för anställda att få utökad åtkomst, bland annat till oredigerade konversationsloggar och till sampling från bristfälligt målanpassade modeller, om det är säkert och relevant för deras arbete.

  • Grundorsaker till bristande målanpassning: Forskare bör analysera grundorsaker i träningsdynamiken (t.ex. genom riktade ablationsstudier eller omsamplingsexperiment) för att förstå hur beteenden som strider mot de avsedda målen uppstod. Det ger bättre vetenskaplig förståelse för bristande målanpassning och bättre möjligheter att förebygga den.

  • Efteranalys: En efteranalys av operativa och kulturella faktorer bör genomföras för att förstå alla bidragande orsaker till incidenten, exempelvis varför problem uppstod och varken upptäcktes eller eskalerades före incidenten.

  • Upptäckt: Vi bör utveckla testmetoder för målanpassning som kan upptäcka benägenheten att orsaka incidenten, utan att stegvis optimera dem direkt utifrån information från incidenten (t.ex. konversationsloggar eller incidentsammanfattningar). Utvärderingar baserade på incidenter bör tas fram som ”regressionstester” för att säkerställa att framtida modeller inte visar en benägenhet till bristande målanpassning i mycket likartade incidenter.

  • Offentlig redovisning: Utredningsresultat, efteranalyser och operativa förändringar bör delas med allmänheten när utredningen har avslutats. Berörda tredje parter bör underrättas så snart som möjligt.

Författare

OpenAI