Prioriteringer og prinsipper for effektive tredjepartsvurderinger
Laboratorier som utvikler banebrytende KI, har et enormt ansvar for å trene, evaluere og rulle ut modeller på en trygg måte. Tredjepartsvurderinger er avgjørende for å ivareta dette ansvaret, gi flere mulighet til å bidra til KI-sikkerheten, holde verden orientert og holde laboratoriene ansvarlige for tydelige og uavhengig underbygde sikkerhetspåstander.
Som en del av arbeidet vårt med å holde tritt med utviklingen i front vil OpenAI støtte uavhengige vurderinger med omfattende tilgang til trening, evaluering og utrulling. Denne tilgangen bør gjøre det mulig for vurdererne å utfordre antakelsene våre, avdekke risikoer vi kan ha oversett, og trekke egne konklusjoner om hvor effektive sikkerhetstiltakene våre er.
Vi har lenge samarbeidet med tredjepartsvurderere i ulike faser av utviklingen og utrullingen av modeller. Vi har også innarbeidet tredjepartsvurderinger i praksisen knyttet til Preparedness Framework og støttet organisasjoner og lovgivning som fremmer en mer grundig og ansvarlig prosess. Gjennom dette samarbeidet har vi gitt omfattende tilgang, blant annet til informasjon om de tekniske sikkerhetstiltakene våre, synlige tankerekker og enestående mengder konfidensielle data og intern tilgang til utrullinger for hendelseshåndtering og red teaming av overvåkingssystemer. Prioriteringene og prinsippene som presenteres her, gjelder samarbeidet vårt med uavhengige vurderingsorganisasjoner i privat og ideell sektor om tekniske sikkerhetsvurderinger. De utfyller samarbeidet vårt med myndigheter om testing og evaluering, der ulike roller og ansvarsområder kan kreve andre tilnærminger.
Effektive vurderinger krever solide mekanismer for uavhengighet, vitenskapelig grundighet, robust sikkerhetspraksis og tydelige ansvarsområder. Laboratoriene har ansvar for å legge til rette for reell kontroll og samtidig beskytte sensitive opplysninger. Laboratorier og uavhengige vurderere har et felles ansvar for å gjøre dette riktig og bør følge felles internasjonale standarder for sikkerhetspraksis. Nedenfor foreslår vi fire prioriterte områder for grundigere vurdering, sammen med prinsipper for grundig, sikkert og uavhengig arbeid.
Tredjepartsvurderinger er mest nyttige når de tar for seg konkrete spørsmål med betydelige konsekvenser: Underbygger dokumentasjonen laboratoriets sikkerhetsargument og sikkerhetspåstander? Tester evalueringene i tilstrekkelig grad risikoene de er ment å måle? Fungerer sikkerhetstiltakene under realistiske forhold?
Vurderingene som beskrives her, skal ha ulike former avhengig av hvilke sikkerhetsspørsmål som undersøkes. Vi forventer å støtte flere parallelle vurderinger over ulike tidsperioder, der noen varer i uker og andre i flere måneder. Tredjepartsvurderinger kan også inngå i arbeidet før utrulling og påvirke beslutninger om utrulling, men arbeidet som beskrives her, er generelt mer langsiktig og uavhengig av lanseringer. Det skal undersøke bestemte sikkerhetspåstander grundig over tid.
I de prioriterte områdene og prinsippene våre viser vi til sikkerhetspåstander og sikkerhetsargumenter. Med disse begrepene mener vi følgende:
Sikkerhetspåstand: En konkret påstand om egenskapene, atferden eller sikkerhetstiltakene til en modell eller et system, som har betydning for sikkerheten og kan vurderes opp mot dokumentasjon. En påstand bør angi hvilke risikoer og forhold den gjelder, samt relevante antakelser og begrensninger.
Sikkerhetsargument: En strukturert og dokumentert argumentasjon som forklarer hvorfor risikoene ved en modell eller et system er tilstrekkelig håndtert for en bestemt aktivitet, for eksempel trening, evaluering eller utrulling. Et sikkerhetsargument knytter de enkelte sikkerhetspåstandene til dokumentasjonen som underbygger dem, og gjør rede for antakelsene, usikkerheten og den gjenværende risikoen som kan påvirke konklusjonene.
Vi foreslår fire prioriterte områder for grundigere vurdering, sammen med prinsipper for grundig, sikkert og uavhengig arbeid.
Uavhengig vurdering av sikkerhetsargumenter for trening, evaluering samt intern og ekstern utrulling.
Vurdering av sikkerhetsargumenter krever kompetanse på tilpasning, kontrollmetoder som overvåking, cybersikkerhet, biologisk og kjemisk misbruk samt red teaming. Sikkerhetsargumenter består av påstander om blant annet trening, evaluering av egenskaper og sikkerhetstiltak. Disse kan vurderes samlet eller hver for seg (se prioritering 2 og 3 nedenfor). Flere vurderere må trolig undersøke ulike deler av argumentene med utgangspunkt i sin respektive kompetanse. Samlet bør vurderingene deres besvare spørsmål som:
Er dokumentasjonen for sikkerhetsargumentene knyttet til trening, evaluering og utrulling tilstrekkelig underbygd? Ble vilkårene i sikkerhetsargumentet fulgt under trening, evaluering og utrulling?
Dekker sikkerhetsargumentene våre de mest presserende risikoene som ble avdekket under vurderingen? Underbygger sikkerhetspåstandene det overordnede sikkerhetsargumentet? Finnes det mangler eller områder som kan forbedres?
Brukes det effektive metoder for å avdekke og redusere insentiver i treningen som kan belønne bedrag, belønningshacking, destruktive handlinger eller omgåelse av begrensninger?
Vurdering av kritiske sikkerhetstiltak ved intern og ekstern utrulling
Sikkerhetstiltakene våre videreutvikles kontinuerlig i takt med endringer i egenskaper og risikobildet. Sikkerhetstiltakene våre omfatter trening samt intern og ekstern utrulling. De omfatter for tiden sikkerhetstiltak på modellnivå, håndhevingstiltak og sikkerhetstiltak samt overvåking av feiltilpasning. Tiltakene dekker en rekke risikoer, som tap av kontroll og misbruk knyttet til cyberangrep og biologiske og kjemiske trusler. Tekniske partnerskap kan avdekke svakheter i dagens sikkerhetstiltak, samtidig som de forbedrer vurderingsmetodene og fremskynder utviklingen av standarder. Dette gir et sterkere teknisk grunnlag for fremtidig offentlig politikk som skal holde tritt med utviklingen i front – særlig ved intern utrulling, der sikkerhetsstandardene fortsatt er lite utviklet.
Uavhengige vurderinger bør undersøke hvor godt disse sikkerhetstiltakene fungerer, og hvor de eventuelt kommer til kort, for eksempel:
Er sikkerhetstiltakene robuste mot angrepstesting (jailbreaks) ved tilgang som «grå boks», og beskytter de godt nok mot økt kapasitet på høyrisikoområder, for eksempel cyber og biologi? Dekker angrepstestingen og red teaming-arbeidet vårt de viktigste risikoene?
Hvordan samhandler agenter med cyberforsvar som tilgangskontroll, sandkasser og systemer for deteksjon og respons under autorisert testing i realistiske driftsforhold? Hvilke forsvarstiltak forhindrer, oppdager eller begrenser skadelige handlinger, og hvor svikter de?
Har systemene våre for overvåking av feiltilpasning kritiske mangler som kan føre til tap av kontroll eller alvorlig feiltilpasning ved intern eller ekstern utrulling? Hvor pålitelig er overvåking av tankerekker som dokumentasjonskilde for sikkerhet eller tilpasning etter hvert som modellenes egenskaper forbedres?
Er egnet overvåking innført for all relevant trening, evaluering og utrulling på en måte som gjør den vanskelig å deaktivere?
Er sikkerhetstiltakene tilpasset egenskapene?
Vurdering av kapasitetsevalueringer som dekker risikokategoriene i Preparedness Framework (kjemiske og biologiske risikoer, cybersikkerhet og selvforbedring av KI), samt tilpasningsevalueringer for risiko for feiltilpasning
Preparedness Framework krever evalueringer av sentrale områder med grenserisiko. Når terskler overskrides og evalueringer mettes, er det viktig å oppdatere evalueringene jevnlig og sikre at de holder høy kvalitet og dekker egenskaper innenfor risikoområdene i Preparedness Framework. Det samme gjelder tilpasningsevalueringer som skal vurdere risiko for alvorlig feiltilpasning.
Relevante spørsmål er blant annet:
Dekker evalueringene av Preparedness-risikoer terskeldefinisjonene for disse risikoene i tilstrekkelig grad? Er tersklene for disse evalueringene riktig fastsatt?
Oppdateres evalueringene når modellene jevnlig oppnår de høyeste poengsummene, og måler de nye testene mer avanserte egenskaper på en meningsfull måte?
Dekker tilpasningsevalueringene våre risikoen for alvorlig feiltilpasning godt nok, og hvilke viktige atferdsmønstre eller forhold kan de overse?
Uavhengig gransking av kritiske hendelser med feiltilpasning
Uavhengig gransking kan være verdifull ved en rekke kritiske KI-sikkerhetshendelser. Her fokuserer vi på feiltilpasning av modeller, blant annet modeller som handler uten tillatelse eller unngår tilsyn. Dette kan avdekke svakheter i tilpasningsmetoder og sikkerhetstiltak, selv uten tilsiktet misbruk.
I enkelte tilfeller, som ved OpenAI-hendelsen hos Hugging Face, kan det være nyttig å hente inn en uavhengig tredjepart for en uavhengig gransking av en feiltilpasningshendelse. Det er avgjørende at tredjeparter som deltar i hendelsesgranskingen, har nødvendig kompetanse. Dette kan omfatte cyberkriminalteknikk, tilpasning, analyse av tankerekker i stor skala samt tilstrekkelig personell og ressurser til å gjennomføre granskingen raskt. Hendelseshåndtering kan innebære tilgang til sensitive interne data og tredjepartsdata. Derfor kan enkelte opplysninger være for sensitive til å publiseres eller gjøres tilgjengelige. Funn fra uavhengige granskinger kan også inngå i sikkerhetsargumentet for en modell ved å gi dokumentasjon til vurdering av påstander om modellens tilpasning og effekten av tiltak mot tidligere observert feiltilpasning.
Ved hendelser med feiltilpasning prioriterer vi uavhengige vurderinger av:
Hvilken modellatferd eller hvilke feiltilpasningsproblemer oppsto under hendelsen, og hva var de viktigste medvirkende faktorene?
Vil sikkerhetstiltak og utbedringer effektivt redusere risikoen for lignende hendelser i fremtiden?
Tydelig avgrensede og gjensidig avtalte påstander som skal vurderes: Vurderinger bør begynne med en gjensidig avtalt avgrensning, etterfulgt av klart definerte sikkerhetspåstander som forhåndsregistreres før vurderingsarbeidet starter. Tredjeparter og laboratorier bør avklare om dette er påstander som selskapet som vurderes, ønsker å fremme for vurdering, eller påstander tredjepartsvurdereren ønsker å vurdere uavhengig, og som laboratoriet godtar å bli vurdert opp mot. Det kan være mange grunner til at enkelte påstander faller utenfor avgrensningen, blant annet at tredjeparter ikke kan få tilgang til data, at vurdereren mangler nødvendig kompetanse, eller at en hastesak gir rimelige tidsbegrensninger. Laboratorier og vurderere bør etablere en prosess for å behandle vesentlige risikoer som avdekkes utenfor den opprinnelige avgrensningen, herunder om de bør undersøkes nærmere. Konklusjonene bør tydelig vise hva som ble og ikke ble vurdert innenfor den gjensidig avtalte avgrensningen.
Forholdsmessig tilgang: Vurderere bør så langt det er mulig få tilstrekkelig tilgang til å vurdere de avtalte påstandene, innenfor juridiske, sikkerhetsmessige og immaterialrettslige begrensninger. Når direkte tilgang er upraktisk eller umulig, kan vurdererne samarbeide med en utpekt representant i selskapet eller utforske indirekte eller personvernbevarende tilgangsmekanismer som beskytter den underliggende informasjonen.
Åpen metodikk og tydelige standarder: Vurdererne bør forklare metodene, vurderingskriteriene og usikkerhetene sine og bygge på etablerte standarder der slike finnes. Der standarder ennå ikke finnes, bør de gi en tydelig begrunnelse for kriteriene de bruker. Rapportene bør skille direkte funn fra tolkninger, forklare usikkerheten og tydeliggjøre hvilke konklusjoner dokumentasjonen underbygger.
Kompetanse og uavhengighet: Vurdererne bør dokumentere relevant teknisk kompetanse og identifisere, opplyse om og håndtere organisatoriske og individuelle interessekonflikter, herunder økonomiske insentiver, forbindelser til utviklere og tidligere deltakelse i arbeidet som vurderes. Sikkerhetsmekanismer bør utformes slik at kommersielt press og godtgjørelsesordninger ikke påvirker funnene, og kan omfatte habilitetsfratreden eller hensiktsmessige karanteneperioder.
Sikkerhet og konfidensialitet: Vurdererne bør dokumentere praksis for informasjonssikkerhet og rettslig bindende konfidensialitetsvern for personellet sitt, tilpasset hvor sensitive systemene og opplysningene de får tilgang til, er. Dette vernet bør omfatte immaterielle rettigheter, sensitive opplysninger og dokumentasjon fra vurderingen. Når vurdererne ikke kan oppfylle sikkerhetskravene i sine egne miljøer, eller dataene er særlig sensitive, kan det være hensiktsmessig å gi tilgang via selskapets enheter eller lokaler.
Praktisk anvendelige funn og tid til utbedring: Vurderingene bør avdekke konkrete mangler og gi laboratoriene tilstrekkelig informasjon til å rette dem. Der det er hensiktsmessig, bør laboratoriene få rimelig tid til å rette opp problemer før publisering. Der det er relevant, bør rapportene også beskrive læringspunkter for agentutviklere, de som ruller ut agenter, og forsvarsaktører, med praktiske anbefalinger for gjennomføring.
Ansvarlig publiseringspraksis: Vurderingsrapporter bør bygge på dokumentasjon og deles så åpent som mulig, samtidig som sensitive og konfidensielle opplysninger beskyttes. Når full offentliggjøring ikke er mulig, kan konfidensiell rapportering til relevante tilsynsorganer, for eksempel styringsorganer eller selskapsstyrer, bidra til ansvarliggjøring. Det bør finnes prinsipielle verneregler og retningslinjer for sladding, samt tydelige forventninger til tilbakemeldinger og retting av feil, for å bevare balansen mellom uavhengighet og konfidensialitet. Vurdererne bør bevare sin redaksjonelle uavhengighet og samtidig opprettholde konfidensialitet og vern av immaterielle rettigheter. Vurdererne bør innføre tydelige retningslinjer for sladding som lar laboratorier be om at sensitive opplysninger sladdes, samtidig som vurdererne kan opplyse om vesentlige sladdinger og hvordan disse påvirker vurderingsrapporten.
Vi vil støtte uavhengige vurderere og etablere tydeligere, felles internasjonale standarder – både gjennom fremtidig lovgivning og private styringsinstitusjoner – for effektive tredjepartsvurderinger. Økosystemet for uavhengige evalueringer er fortsatt i vekst. Vi vil bidra ved å støtte og samarbeide med et mangfoldig fellesskap av uavhengige vurderere med dyptgående kompetanse på sikkerhetsspørsmål knyttet til banebrytende KI. Ingen enkelt tredjepart kan eller bør dekke alle presserende sikkerhetsspørsmål knyttet til banebrytende KI. Vi vil gå planmessig og målrettet frem for å øke kapasiteten vår og gjøre det mulig for det voksende tredjepartsøkosystemet å samles om beste praksis og prinsipper. Vi er i dialog med flere tredjeparter om forslag som samsvarer med de prioriterte områdene ovenfor.


