Mot sikkerhetsargumentasjon for trening av banebrytende KI
Vi mener at vi er på vei inn i en ny æra der strukturert sikkerhetsdokumentasjon bør være et krav før enhver treningskjøring med forsterkende læring for banebrytende modeller kan fortsette. Ideelt sett bør slik dokumentasjon holde samme nivå som «sikkerhetsargumentasjon»: omfattende, strukturerte og evidensbaserte argumenter om risiko, slik de brukes i andre sikkerhetskritiske bransjer. Vi ser på sikkerhetsargumentasjon som et ambisiøst mål vi arbeider mot. Samtidig erkjenner vi at det er utfordrende å gjøre den like stringent for KI-modeller som for luftfart eller kjernekraft, fordi nye nivåer av KI-kapasitet gir opphav til ny kompleksitet. Vi arbeider med et rammeverk for å formalisere denne praksisen.
Nedenfor følger noen foreløpige retningslinjer vi mener bør inngå i sikkerhetsargumentasjonen for trening av banebrytende KI. Denne beste praksisen gjenspeiler det vi har lært så langt. Vi forventer at den vil utvikle seg etter hvert som vi forbedrer interne prosesser for varsom utvikling. Vi deler dette nå for å være åpne om hvordan vi tenker, og inviterer til tilbakemeldinger fra fagmiljøet. Merk at dette dokumentet handler om trening av banebrytende modeller med forsterkende læring. Intern og ekstern bruk krever at man vurderer et langt bredere spekter av egenskaper knyttet til målsamsvar.
Sikkerhetsargumentasjonen bør dekke tre deler av den tekniske stakken: trening for målsamsvar, isolering og overvåking. Disse sikkerhetstiltakene bidrar til å sikre at modellen ikke forsøker å handle i strid med våre mål. Selv om den skulle gjøre det, skal det være vanskelig å bryte ut av det isolerte miljøet, og overvåkingen skal oppdage det før skade kan oppstå.
Modellenes målsamsvar: Første forsvarslinje bør være å trene modeller til målsamsvar, det vil si at de pålitelig handler slik vi har til hensikt. Dette kan omfatte:
Treningsmiljøer og poengsetting: Reduser risikoen for at modeller utvikler atferd med målavvik, ved å hindre at utnyttelse av belønningssystemet får positiv forsterkning under trening. Dette kan omfatte:
Automatisert gjennomgang av datasett: Bruk agenter til å finne og rette feil i miljøer for forsterkende læring som kan gi handlingsforløp med målavvik høy belønning gjennom utnyttelse av svakheter fremfor tiltenkt atferd. Dette reduserer mulighetene for at målavvik forsterkes under trening.
Manuell gjennomgang av datasett: Suppler automatisert red teaming med manuell gjennomgang og kvalitetskontroll av datasett for å identifisere mangelfulle oppgaver som utilsiktet kan forsterke atferd med målavvik.
Justering av poengsettingssystemer: Juster poengsettingssystemene slik at de gir trekk når modellen prøver å utnytte svakheter eller hacke miljøer for forsterkende læring under trening.
Analyse av tidligere kjøringer: Kjør klassifikatorer på spor fra tidligere eksperimenter for å sikre at poengsettingssystemene fungerer som tiltenkt.
Måling av målsamsvar: Gjennomfør evalueringer som følger modellens tilbøyelighet til målavvik, for å måle hvor effektiv treningen for målsamsvar er. Dette kan omfatte:
Frakoblede evalueringer av målsamsvar: Gjennomfør evalueringer av målsamsvar under treningskjøringer med banebrytende modeller for å vurdere om treningen fungerer som tiltenkt, og undersøk alle vesentlige forverringer.
Testing mot historiske data: Test evalueringene av målsamsvar mot tidligere hendelser for å bekrefte at de fanger opp modeller som tidligere har vist målavvik, og ikke er overtilpasset bestemte hendelser.
Overvåk manipulering av evalueringer: Følg med på evalueringsbevissthet eller metaspill (at modeller gjenkjenner at de blir testet) som kan føre til atferdsendringer. Aktiver for eksempel overvåking av evalueringsbevissthet og metaspill i evalueringer av målsamsvar, med konkrete terskler for blokkering.
Stresstester av verst tenkelige scenarioer: Fremprovoser den verst tenkelige uønskede atferden, og kontroller at minst én evaluering ville oppdaget den.
Hindre trening på tankerekker: Ikke la automatiserte poengsettingssystemer se tankerekken under forsterkende læring. Dette hindrer at modeller utvikler evnen til å omgå overvåking av tankerekker.
Isolering: Sørg for at sandkasseisoleringen og sikkerheten er sterke nok til å hindre skadelige handlinger dersom en modell utvikler målavvik. Dette kan omfatte:
Flere lag med infrastruktursikkerhet: Invester tungt i å herde både sandkassen modellen kjører i, og forskningsinfrastrukturen som huser den. Slik får vi et ekstra beskyttelseslag dersom modellen bryter ut av sandkassen.
Red teaming av isoleringen: Forbedre sikkerheten i sandkassen, forskningsinfrastrukturen og nettverksperimeteren gjennom gjentatt red teaming av disse systemene. Bruk kontrollpunkter fra treningskjøringer med banebrytende modeller, underlagt en sikkerhetsanalyse, for å finne og tette eventuelle hull. Gjennomfør også red teaming av alle tjenester modellen kan komme i kontakt med under trening (f.eks. internettbufferen).
Kommunikasjon mellom samplinger: Begrens kommunikasjon med høy båndbredde mellom samplinger til godkjente kanaler, for eksempel verktøy for flere agenter. Steng sidekanaler i infrastrukturen som har høy båndbredde og er lette for agenter å oppdage.
Uforanderlige transkripsjoner: Lagre agenttranskripsjoner slik at de ikke kan endres, i et rimelig tidsrom (for eksempel i lagringskontoer som bare tillater én skriving). Dette bør gjelde all trening med forsterkende læring, evaluering og intern bruk, for å muliggjøre pålitelig gransking av hendelser og hindre utilsiktede endringer.
Overvåking: Ha et system for sanntidsovervåking som fanger opp mulige målavvik dersom modeller begynner å handle i strid med våre mål, og håndter høyt prioriterte problemer raskt før en alvorlig hendelse kan oppstå. Dette kan omfatte:
Still krav om mulighet for overvåking: Sørg for at modeller fortsatt lar seg overvåke, målt gjennom evalueringer av overvåkbarhet og omgåelse av overvåking med tydelige terskler, slik at bekymringsfull atferd oppdages tidlig.
Høy gjenfinningsgrad for kjente problemer: Sørg for at overvåkingssystemet fanger opp en høy andel av tidligere hendelser i en evaluering med data som er holdt utenfor treningen.
Oppdaterte evalueringer av overvåkingen: Lag evalueringsdatapunkter som er representative for helt nye risikoer ved nye kjøringer, slik at målene på overvåkingens gjenfinningsgrad og presisjon ikke blir utdaterte.
Rask respons: Innfør prioriterte varsler som fører til handling innen fristen i en definert tjenestenivåavtale (SLA), enten ved å varsle en vakthavende eller ved automatisk å sette den berørte kjøringen på pause før modellen forårsaker skade. Varsle for eksempel sikkerhetsvakten og den kjøringsansvarlige om hendelser på dagtid, og sett kjøringer automatisk på pause ved ubekreftede varsler om natten.
I tillegg til anbefalinger om tekniske sikkerhetstiltak har vi arbeidet med operasjonell beste praksis for sikkerhetsargumentasjon ved treningskjøringer med banebrytende KI. Dette kan omfatte:
Motargumenter (forhåndsanalyser av mulige feil): Når et utkast til sikkerhetsargumentasjon foreligger, bør et medlem av et annet team skrive motargumenter for å avdekke mulige svakheter og gi en nyansert risikovurdering. Treningsteamet bør deretter følge opp disse innspillene for å styrke sikkerhetsargumentasjonen.
Godkjenninger: Sikkerhetsargumentasjonen bør gjennomgås av medlemmer av toppledelsen. Hver av dem bør kunne nedlegge veto mot kjøringen, slik at den er underlagt flere interne kontrollinstanser (f.eks. forskningsdirektøren, sikkerhetssjefen og sjefsforskeren).
Ansvarliggjøring: Lederen med ansvar for en treningskjøring (f.eks. forskningsdirektøren) bør holdes ansvarlig for sikkerhetsargumentasjonen og eventuell hendelseshåndtering, også i prestasjonsvurderinger. Slik får også treningsteamene insentiver til å prioritere sikkerhet og målsamsvar.
Stans: Hvis det avdekkes forhold som undergraver sikkerhetsargumentasjonen (f.eks. et nytt sikkerhetsproblem), må det finnes prosedyrer, tekniske kontrolltiltak og tjenestenivåavtaler (SLA-er) for å sette alle omfattede kjøringer på pause.
Intern åpenhet: Sikkerhetsargumentasjonen bør gjøres tilgjengelig for interne tilsynsorganer (f.eks. Sikkerhets- og vernekomiteen).
Revisjoner: Revisorer bør få tilstrekkelig tilgang til å kontrollere at påstandene i sikkerhetsargumentasjonen er gyldige og godt underbygget, og til å påpeke eventuelle mangler.
Eskalering: Det bør finnes en tydelig prosess for å eskalere saker om målavvik, med en tabell over definerte alvorlighetsgrader og en vaktordning som kan varsle ledelsen (f.eks. administrerende direktør) når en kjøring når et bestemt alvorlighetsnivå.
Tekniske kontrolltiltak: Det bør være vanskelig for mennesker og agenter å starte kjøringer som ikke oppfyller kravene. Sikkerhetsfunksjoner som overvåking og automatisk stans bør blokkere videre drift ved feil. Det bør for eksempel ikke være mulig å starte kjøringer uten at egnet overvåking er aktivert, eller å deaktivere overvåkingen fra innsiden under trening med forsterkende læring, evaluering eller intern bruk.
Mulighet for tilbakestilling: Det bør være enkelt å identifisere all videre bruk av en modell med målavvik i treningsprosessen (for eksempel datagenerering eller poengsetting), slik at effekten av utdata med målavvik kan reverseres ved behov.
Fullstendig oversikt over restrisiko: Sikkerhetsargumentasjonen bør så langt som mulig inneholde en uttømmende liste over gjenværende risikoer som ikke dekkes av iverksatte risikoreduserende tiltak. Dette gir et informert grunnlag for å avgjøre hvilken risiko som kan aksepteres.
Dette er våre nåværende anbefalinger, som vi er i ferd med å innføre i OpenAI. Vi forventer at praksisen vår vil fortsette å utvikle seg i ukene som kommer.
Vi har også utviklet beste praksis for å granske alvorlige hendelser med målavvik i KI. KI-laboratorier bør forsøke å lære mest mulig av enkelthendelser, på samme måte som granskingspraksisen(åpnes i et nytt vindu) i andre bransjer der mye står på spill, for å hindre at slike hendelser skjer igjen. Eksempler på tiltak kan være:
Intern åpenhet: Ettersom gransking kan ta lang tid, bør det gis regelmessige interne oppdateringer om fremdriften (f.eks. daglige oppdateringer om pågående granskinger). Ansatte bør ha definerte måter å få utvidet tilgang på, inkludert til rå transkripsjoner og sampling fra modeller med målavvik, dersom det er trygt og relevant for arbeidet deres.
Rotårsaker til målavvik: Forskere bør analysere treningsdynamikken for å finne rotårsakene (f.eks. gjennom målrettede ablasjons- eller resamplingseksperimenter) og forstå hvordan atferd med målavvik oppsto. Dette vil styrke den vitenskapelige forståelsen av målavvik og gjøre det lettere å forebygge dem.
Etteranalyse: Det bør gjennomføres en operasjonell og kulturell etteranalyse for å forstå alle medvirkende årsaker til hendelsen, for eksempel hvorfor problemer oppsto og ikke ble oppdaget eller eskalert før hendelsen.
Oppdagelse: Vi bør utvikle testmetoder for målsamsvar som kan avdekke tilbøyeligheten til å forårsake hendelsen, uten å optimalisere direkte mot informasjon fra hendelsen (f.eks. transkripsjoner eller hendelsessammendrag). Evalueringer basert på hendelser bør utformes som «regresjonstester» for å sikre at fremtidige modeller ikke viser tilbøyelighet til målavvik i svært lignende hendelser.
Offentliggjøring: Granskingsresultater, etteranalyser og operasjonelle endringer bør deles med offentligheten etter at granskingen er avsluttet. Berørte tredjeparter bør varsles så snart som mulig.


