Gå til hovedindhold
OpenAI

28. september 2026

Sikkerhed

Mod sikkerhedsargumentation for træning af banebrydende AI

Indlæser ...

Vi mener, at vi er på vej ind i en ny æra, hvor struktureret sikkerhedsdokumentation bør være et krav, før man fortsætter nogen træningskørsel med forstærkende læring for banebrydende modeller. Ideelt set bør denne dokumentation leve op til kravene til »sikkerhedsargumentationer« – omfattende, strukturerede og evidensbaserede argumenter om risiko, som anvendes i andre sikkerhedskritiske brancher. Vi ser sikkerhedsargumentationer som en ambitiøs ledestjerne, vi arbejder hen imod. Samtidig anerkender vi udfordringerne ved at gøre dem lige så stringente for AI-modeller som inden for luftfart eller atomkraft, fordi der opstår ny kompleksitet, hver gang AI når et nyt kapabilitetsniveau. Vi arbejder på en ramme, der skal formalisere denne praksis.

Nedenfor er nogle indledende retningslinjer, som vi mener bør indgå i sådanne sikkerhedsargumentationer for træning af banebrydende AI. Denne bedste praksis afspejler vores nuværende erfaringer. Vi forventer, at den vil udvikle sig, efterhånden som vi videreudvikler vores interne processer for omhyggelig udvikling. Vi deler retningslinjerne nu for at skabe gennemsigtighed om vores aktuelle overvejelser og invitere til feedback fra fagmiljøet. Bemærk, at dette dokument fokuserer på træning med forstærkende læring for banebrydende modeller. Intern og ekstern implementering kræver, at man tager højde for en langt bredere vifte af alignment-egenskaber.

1. Tekniske sikkerhedsforanstaltninger

Sikkerhedsargumentationer bør dække tre aspekter af den tekniske stak: alignment-træning, inddæmning og overvågning. Disse sikkerhedsforanstaltninger hjælper med at sikre, at modellen ikke forsøger at handle i strid med de tilsigtede mål. Hvis den alligevel gør det, skal det være svært at bryde ud af inddæmningen, og overvågningen skal opdage det, før der kan ske skade.

  • Alignment af modeller: Den første forsvarslinje bør være at træne modeller til alignment, dvs. til pålideligt at handle, som vi har til hensigt. Det kan omfatte:

    • Træningsmiljøer og bedømmelse: Reducer risikoen for, at modeller udvikler adfærd i strid med de tilsigtede mål, ved at forhindre positiv forstærkning af udnyttelse af belønningssystemet under træning. Det kan omfatte:

      • Automatisk gennemgang af datasæt: Brug agenter til at finde og rette fejlbehæftede RL-miljøer, hvor handlingsforløb i strid med de tilsigtede mål kan opnå høj belønning ved at udnytte svagheder frem for at udvise tilsigtet adfærd. Det mindsker mulighederne for at forstærke manglende alignment under træningen.

      • Manuel gennemgang af datasæt: Suppler automatisk red-teaming med manuel gennemgang og kvalitetskontrol af datasæt for at identificere fejlbehæftede opgaver, som utilsigtet kan forstærke adfærd i strid med de tilsigtede mål.

      • Justering af bedømmelsessystemer: Juster bedømmelsessystemer, så de giver strafpoint, når modellen forsøger at udnytte svagheder i eller hacke RL-miljøer under træningen.

      • Analyse af tidligere kørsler: Kør klassifikatorer på spor fra tidligere forsøg for at sikre, at bedømmelsessystemerne fungerer efter hensigten.

    • Måling af alignment: Kør evalueringer, der følger modellens tilbøjelighed til manglende alignment, for at måle effekten af alignment-træningen. Det kan omfatte:

      • Offline-evalueringer af alignment: Kør alignment-evalueringer under træningskørsler med banebrydende modeller for at vurdere, om træningen virker efter hensigten, og undersøg alle væsentlige forringelser.

      • Test på historiske data: Test alignment-evalueringer på tidligere hændelser for at bekræfte, at de opdager modeller, som tidligere har udvist manglende alignment, og ikke overtilpasses bestemte hændelser.

      • Overvåg manipulation af evalueringer: Hold øje med, om modeller er evalueringsbevidste eller udviser metagaming (genkender, at de bliver testet), hvilket kan medføre adfærdsændringer. Aktivér f.eks. overvågning af disse forhold ved alignment-evalueringer med specifikke tærskler for blokering.

      • Stresstest af værst tænkelige scenarier: Fremkald den værst tænkelige fejladfærd, og kontroller, at mindst én evaluering ville opdage den.

    • Undgå træning på tankerækker: Lad ikke automatiske bedømmelsessystemer se tankerækken under forstærkende læring. Det skal forhindre modeller i at udvikle evnen til at undvige overvågning af tankerækker.

  • Inddæmning: Sørg for, at sandbox-isolationen og sikkerheden er stærk nok til at forhindre skadelige handlinger, hvis en model udvikler manglende alignment. Det kan omfatte:

    • Flere lag af infrastruktursikkerhed: Invester massivt i at styrke både den sandbox, modellen kører i, og den forskningsinfrastruktur, der er vært for den. Det sikrer et ekstra beskyttelseslag, hvis modellen bryder ud af sin sandbox.

    • Red-teaming af inddæmningen: Styrk sikkerheden i sandboxen, forskningsinfrastrukturen og perimeteren gennem gentagen red-teaming af disse systemer med kontrolpunkter fra træningskørsler med banebrydende modeller, under forudsætning af en sikkerhedsanalyse, for at finde og lukke eventuelle huller. Udfør også red-teaming af alle tjenester, som modellen kan komme i kontakt med under træningen (f.eks. internetcachen).

    • Kommunikation på tværs af samples: Begræns kommunikation med høj båndbredde på tværs af samples til godkendte kanaler, f.eks. værktøjer til flere agenter. Luk sidekanaler i infrastrukturen, som har høj båndbredde og er lette for agenter at opdage.

    • Uforanderlige transskriptioner: Gem agenters transskriptioner i uforanderlig form i et passende tidsrum (f.eks. på lagerkonti, hvor der kun kan skrives én gang) for al RL-træning, evaluering og intern implementering. Det muliggør pålidelig undersøgelse af hændelser og forhindrer utilsigtede ændringer.

  • Overvågning: Hav et overvågningssystem i realtid, som kan opdage tegn på manglende alignment, hvis modeller begynder at handle i strid med de tilsigtede mål, og sørg for hurtigt at håndtere højt prioriterede problemer, før der kan opstå en alvorlig hændelse. Det kan omfatte:

    • Håndhæv krav om overvågningsegnethed: Sørg for, at modeller fortsat kan overvåges, målt ved evalueringer af overvågningsegnethed og omgåelse af overvågning med klare tærskler, så bekymrende adfærd opdages tidligt.

    • Høj genfinding af kendte problemer: Sørg for, at overvågningssystemet genfinder en høj andel af tidligere hændelser i en evaluering, hvis data er holdt adskilt fra træningen.

    • Opdaterede evalueringer af overvågning: Opret evalueringsdatapunkter, som repræsenterer helt nye risici ved nye kørsler, så målene for overvågningens genfinding og præcision ikke bliver forældede.

    • Hurtig reaktion: Indfør prioriterede alarmer, der udløser handling inden for en fastlagt SLA, enten ved at alarmere en vagtansvarlig eller ved automatisk at sætte den berørte kørsel på pause, før modellen forvolder skade. Alarmér f.eks. sikkerhedsvagten og den kørselsansvarlige ved hændelser om dagen, og sæt automatisk kørsler på pause ved ubekræftede alarmer om natten.

2. Operationelle retningslinjer

Ud over anbefalinger om tekniske sikkerhedsforanstaltninger har vi arbejdet på bedste operationelle praksis for sikkerhedsargumentation ved træningskørsler med banebrydende AI. Det kan omfatte:

  • Modargumenter (forhåndsanalyser af mulige fejl): Når sikkerhedsargumentationen er udarbejdet, bør et medlem af et andet team skrive modargumenter for at afdække mulige huller og give en afbalanceret risikovurdering. Træningsteamet bør derefter forholde sig til dette for at styrke sikkerhedsargumentationen.

  • Godkendelser: Sikkerhedsargumentationen bør gennemgås af medlemmer af topledelsen, som hver især bør kunne nedlægge veto mod kørslen. Det sikrer flere interne kontrolinstanser for kørslen (f.eks. forskningsområdets leder eller direktør, sikkerhedschefen og den videnskabelige chef).

  • Ansvarsplacering: Den leder i topledelsen, der er ansvarlig for en træningskørsel (f.eks. forskningsområdets leder eller forskningsdirektøren), bør stå til ansvar for sikkerhedsargumentationen og enhver hændelseshåndtering, også ved præstationsvurderinger. På den måde får træningsteams også et incitament til at fremme sikkerhed og alignment.

  • Pausering: Hvis der opdages problemer, som gør sikkerhedsargumentationen ugyldig (f.eks. et nyt sikkerhedsproblem), skal der være driftsvejledninger, tekniske kontrolmekanismer og serviceniveauaftaler (SLA'er) for at sætte alle omfattede kørsler på pause.

  • Intern gennemsigtighed: Sikkerhedsargumentationer bør være tilgængelige for interne tilsynsgrupper (f.eks. Sikkerhedsudvalget).

  • Revisioner: Revisorer bør have tilstrækkelig adgang til at kontrollere, at påstandene i sikkerhedsargumentationen er gyldige og velfunderede, og til at påpege eventuelle mangler.

  • Eskalering: Der bør være en klar proces for eskalering af problemer med manglende alignment, en tabel med definerede alvorlighedsniveauer og en vagtansvarlig for alignment, der kan alarmere ledelsen (f.eks. den administrerende direktør), når en kørsel når et bestemt alvorlighedsniveau.

  • Tekniske kontrolmekanismer: Det bør være vanskeligt for mennesker og agenter at starte kørsler, som ikke overholder kravene. Sikkerhedsfunktioner som overvågning og automatisk pausering bør blokere kørslen ved fejl. Det bør f.eks. ikke være muligt at starte kørsler uden passende overvågning eller at deaktivere overvågningen inde fra RL-træning, evaluering eller en intern implementering.

  • Mulighed for tilbagerulning: Det bør være let at identificere alle efterfølgende anvendelser af en model med manglende alignment i træningsprocessen (f.eks. datagenerering eller bedømmelse), så effekten af output med manglende alignment kan omgøres, hvis det er nødvendigt.

  • Fuldstændig kortlægning af resterende risici: Sikkerhedsargumentationer bør indeholde en så udtømmende liste som muligt over resterende risici, som de nuværende afværgeforanstaltninger ikke dækker. Det skal gøre det muligt at træffe informerede beslutninger om risikoaccept.

Dette er vores nuværende anbefalinger, som vi er ved at implementere hos OpenAI. Vi forventer, at vores praksis vil fortsætte med at udvikle sig i de kommende uger.

3. Undersøgelse af hændelser med manglende alignment

Vi har også arbejdet på bedste praksis for at undersøge alvorlige hændelser med manglende alignment i AI. AI-laboratorier bør forsøge at lære så meget som muligt af de enkelte hændelser, ligesom man gør med undersøgelsespraksis⁠(åbner i et nyt vindue) i andre brancher, hvor meget står på spil, så lignende hændelser kan forebygges. Sådanne tiltag kan f.eks. omfatte:

  • Intern gennemsigtighed: Da en undersøgelse kan tage lang tid, bør der regelmæssigt gives interne statusopdateringer om hændelsesundersøgelser (f.eks. daglige opdateringer om igangværende undersøgelser). Medarbejdere bør have klart definerede muligheder for at få udvidet adgang, herunder til rå transskriptioner og sampling fra modeller med manglende alignment, hvis det er sikkert og relevant for deres arbejde.

  • Grundårsager til manglende alignment: Forskere bør afdække grundårsagerne i træningsdynamikken (f.eks. gennem målrettede ablations- eller resamplingforsøg) for at forstå, hvordan adfærd med manglende alignment opstod. Det skal styrke den videnskabelige forståelse af manglende alignment og gøre det lettere at forebygge fremover.

  • Efteranalyse: Der bør gennemføres en operationel og kulturel efteranalyse for at forstå alle medvirkende årsager til hændelsen, herunder hvorfor problemer opstod og ikke blev opdaget eller eskaleret inden hændelsen.

  • Opdagelse: Vi bør udvikle metoder til at teste alignment, som kan opdage tilbøjeligheden til at forårsage hændelsen, uden direkte at optimere metoderne ud fra oplysninger fra hændelsen (f.eks. transskriptioner eller hændelsesresuméer). Evalueringer baseret på hændelser bør oprettes som »regressionstest« for at sikre, at fremtidige modeller ikke udviser tilbøjelighed til manglende alignment ved meget lignende hændelser.

  • Offentliggørelse: Undersøgelsesresultater, efteranalyser og operationelle ændringer bør deles med offentligheden, når undersøgelsen er afsluttet. Berørte tredjeparter bør underrettes hurtigst muligt.

Forfatter

OpenAI