Gå til hovedindhold
OpenAI

22. september 2026

Sikkerhed

Prioriteter og principper for effektive tredjepartsvurderinger

Indlæser ...

Laboratorier for banebrydende AI har et enormt ansvar for at træne, evaluere og udrulle modeller sikkert. Tredjepartsvurderinger er afgørende for at løfte dette ansvar, skabe flere muligheder for input om AI-sikkerhed, holde omverdenen orienteret og holde laboratorier ansvarlige for klare og uafhængigt underbyggede sikkerhedspåstande.

Som led i vores arbejde med at holde trit med frontlinjen er OpenAI fast besluttet på at støtte uafhængige vurderinger med omfattende adgang til træning, evaluering og udrulning. Denne adgang bør gøre det muligt for vurderere at udfordre vores antagelser, identificere risici, vi kan have overset, og nå frem til deres egne konklusioner om vores sikkerhedsforanstaltningers effektivitet.

Vi har længe samarbejdet med tredjepartsvurderere på forskellige trin i udviklingen og udrulningen af modeller. Vi har også indarbejdet tredjepartsvurderinger i vores praksis for Preparedness Framework og støttet organisationer og lovgivning, der arbejder for en mere stringent og ansvarlig proces. I disse samarbejder har vi givet omfattende adgang, herunder til oplysninger om vores tekniske sikkerhedsforanstaltninger, synlige tankerækker samt hidtil uset adgang til fortrolige data og interne udrulninger med henblik på hændelseshåndtering og red-teaming af overvågning. De prioriteter og principper, vi præsenterer her, vedrører vores samarbejde med uafhængige vurderingsorganisationer i den private og almennyttige sektor om tekniske sikkerhedsvurderinger. De supplerer vores samarbejde med myndigheder om test og evaluering, hvor forskellige roller og ansvarsområder kan kræve andre tilgange.

Effektive vurderinger kræver stærke mekanismer til at sikre uafhængighed, videnskabelig stringens, robust sikkerhedspraksis og klare ansvarsområder. Laboratorier har ansvar for at muliggøre reel kontrol og samtidig beskytte følsomme oplysninger. Laboratorier og uafhængige vurderere deler ansvaret for at gøre dette rigtigt og bør arbejde ud fra fælles internationale standarder for sikkerhedspraksis. Nedenfor foreslår vi fire prioriterede områder til mere dybdegående vurdering samt principper for stringent, sikkert og uafhængigt arbejde.

Prioriterede vurderingsområder

Tredjepartsvurderinger er mest nyttige, når de behandler konkrete spørgsmål med væsentlige konsekvenser: Understøtter evidensen et laboratoriums sikkerhedsargumentation og sikkerhedspåstande? Tester evalueringerne i tilstrækkelig grad de risici, de skal måle? Fungerer sikkerhedsforanstaltningerne under realistiske forhold?

De vurderinger, der beskrives her, skal have forskellige former afhængigt af de sikkerhedsspørgsmål, som undersøges. Vi forventer at støtte flere vurderinger parallelt og over forskellige tidsrum, hvor nogle varer i uger og andre i flere måneder. Selvom tredjepartsvurderinger også kan indgå i arbejdet før udrulning og danne grundlag for beslutninger om udrulning, er det her beskrevne arbejde generelt mere langsigtet og uafhængigt af lanceringer – med fokus på at undersøge bestemte sikkerhedspåstande grundigt over tid.

I vores prioriterede områder og principper henviser vi til sikkerhedspåstande og sikkerhedsargumentationer. Med disse begreber mener vi følgende:

Sikkerhedspåstand: En konkret påstand om et models eller systems egenskaber, adfærd eller sikkerhedsforanstaltninger, som har betydning for dets sikkerhed og kan vurderes ud fra evidens. En påstand bør angive de risici og forhold, den vedrører, samt relevante antagelser og begrænsninger.

Sikkerhedsargumentation: En struktureret og evidensunderbygget argumentation, der forklarer, hvorfor risiciene ved et model eller system håndteres tilstrækkeligt i forbindelse med en bestemt aktivitet såsom træning, evaluering eller udrulning. En sikkerhedsargumentation forbinder de enkelte sikkerhedspåstande med den evidens, der understøtter dem, og tydeliggør de antagelser, usikkerheder og resterende risici, som kan påvirke konklusionerne.

Vi foreslår fire prioriterede områder til mere dybdegående vurdering samt principper for stringent, sikkert og uafhængigt arbejde.

  1. Uafhængig vurdering af sikkerhedsargumentationer på tværs af træning, evaluering samt intern og ekstern udrulning.

    Vurdering af sikkerhedsargumentationer kræver ekspertise inden for alignment, kontrolmetoder såsom overvågning, cybersikkerhed, biologisk og kemisk misbrug samt red-teaming. Sikkerhedsargumentationer består af påstande om blandt andet træning, evaluering af egenskaber og sikkerhedsforanstaltninger, som kan vurderes samlet eller enkeltvis (se prioritet 2 og 3 nedenfor). Flere vurderere vil sandsynligvis skulle undersøge forskellige dele af argumentationerne ud fra deres respektive ekspertiseområder. Tilsammen bør deres vurderinger besvare spørgsmål som:

    1. Er evidensen for sikkerhedsargumentationerne vedrørende træning, evaluering og udrulning underbygget? Blev betingelserne i sikkerhedsargumentationen overholdt under træning, evaluering og udrulning?

    2. Dækker vores sikkerhedsargumentationer de mest presserende risici, der blev identificeret under en vurdering? Understøtter sikkerhedspåstandene den samlede sikkerhedsargumentation? Er der mangler eller områder, der kan forbedres?

    3. Anvendes der effektive metoder til at identificere og reducere incitamenter i træningen, som kan belønne bedrag, belønningshacking, destruktive handlinger eller omgåelse af begrænsninger?

  2. Vurdering af kritiske sikkerhedsforanstaltninger ved intern og ekstern udrulning

    Vores samlede sikkerhedsforanstaltninger udvikler sig løbende i takt med ændringer i egenskaber og risikobillede. Vores sikkerhedsforanstaltninger omfatter træning samt intern og ekstern udrulning. De omfatter i øjeblikket sikkerhedsforanstaltninger på modelniveau, håndhævelses- og sikkerhedsforanstaltninger samt overvågning af manglende alignment – og dækker en lang række risici såsom kontroltab og misbrug inden for cyberområdet samt biologiske og kemiske områder. Tekniske partnerskaber kan identificere aktuelle svagheder i sikkerhedsforanstaltningerne og samtidig forbedre vurderingsmetoderne og fremskynde udviklingen af standarder. Det skaber et stærkere teknisk grundlag for fremtidig offentlig regulering, der kan holde trit med frontlinjen – især ved interne udrulninger, hvor standarderne for sikkerhed stadig er på et tidligt stadie.

    Uafhængige vurderinger bør undersøge, hvor godt disse sikkerhedsforanstaltninger fungerer, og hvor de eventuelt kommer til kort, for eksempel:

    1. Er sikkerhedsforanstaltningerne ved adgang efter »grey box«-princippet robuste over for adversarial test (jailbreaks), og beskytter de tilstrækkeligt mod øgede egenskaber på højrisikoområder såsom cyber og biologi? Dækker vores adversarial test og red-teaming de vigtigste risici?

    2. Hvordan interagerer agenter under autoriserede test og realistiske driftsforhold med cyberforsvar såsom adgangskontrol, sandboxing samt systemer til registrering og respons? Hvilke forsvarsmekanismer forebygger, registrerer eller inddæmmer skadelige handlinger, og hvor svigter de?

    3. Har vores overvågning af manglende alignment kritiske mangler, som kan føre til kontroltab eller alvorlig manglende alignment ved både intern og ekstern udrulning? Hvor pålidelig er overvågning af tankerækker som evidenskilde for sikkerhed eller alignment, efterhånden som modellernes egenskaber forbedres?

    4. Er der implementeret passende overvågning på tværs af al relevant træning, evaluering og udrulning på en måde, som ikke let kan deaktiveres?

    5. Er sikkerhedsforanstaltningerne implementeret i et omfang, der svarer til egenskaberne?

  3. Vurdering af egenskabsevalueringer, der dækker risikokategorierne i Preparedness Framework (kemiske og biologiske risici, cybersikkerhed og AI-selvforbedring), samt alignment-evalueringer af risici ved manglende alignment

    Vores Preparedness Framework kræver evaluering af centrale risikoområder for banebrydende AI. Når tærskler overskrides, og evalueringer mættes, er det vigtigt løbende at forny og sikre dækningen og kvaliteten af evalueringer af egenskaber inden for risikoområderne i Preparedness Framework samt alignment-evalueringer, der skal vurdere alvorlige risici ved manglende alignment.

    Relevante spørgsmål omfatter:

    1. Dækker evalueringer af risici i Preparedness Framework i tilstrækkelig grad definitionen af risikotærsklerne i Preparedness Framework? Er tærsklerne for disse evalueringer fastsat korrekt?

    2. Opdateres evalueringerne, når modeller konsekvent opnår de højeste resultater, og måler de nye test mere avancerede egenskaber på en meningsfuld måde?

    3. Dækker vores alignment-evalueringer i tilstrækkelig grad alvorlige risici ved manglende alignment, og hvilke vigtige adfærdsmønstre eller forhold kan de overse?

  4. Uafhængig undersøgelse af kritiske hændelser med manglende alignment

    Uafhængige undersøgelser kan være værdifulde i forbindelse med en række kritiske AI-sikkerhedshændelser. Her fokuserer vi på manglende alignment i modeller, herunder modeller, der handler uden tilladelse eller unddrager sig tilsyn. Det kan afsløre svagheder i alignment-metoder og sikkerhedsforanstaltninger, selv når der ikke er tale om forsætligt misbrug.

    Under visse omstændigheder, som ved OpenAI-hændelsen på Hugging Face, kan det være en fordel at inddrage en uafhængig tredjepart til en uafhængig undersøgelse af hændelser med manglende alignment. Det er afgørende, at tredjeparter, der deltager i en hændelsesundersøgelse, har den nødvendige undersøgelsesekspertise, herunder, hvor det er relevant, ekspertise i cyberforensik og alignment, analyse af tankerækker i stor skala samt tilstrækkeligt personale og tilstrækkelige ressourcer til at gennemføre undersøgelsen rettidigt. Hændelseshåndtering kan kræve adgang til følsomme interne data og tredjepartsdata, og derfor kan visse oplysninger være for følsomme til at offentliggøre eller give adgang til. Resultater fra uafhængige undersøgelser kan også indgå i et models sikkerhedsargumentation ved at levere evidens til vurdering af påstande om dets alignment og effektiviteten af tiltag til at afhjælpe tidligere observeret manglende alignment.

    I forbindelse med hændelser med manglende alignment prioriterer vi uafhængige vurderinger af:

    1. Hvilken modeladfærd eller hvilke problemer med manglende alignment opstod under hændelsen, og hvad var de primære medvirkende faktorer?

    2. Vil sikkerhedsforanstaltninger og afhjælpende tiltag effektivt begrænse lignende hændelser i fremtiden?

Principper for effektive vurderinger

  • Klart afgrænsede og gensidigt aftalte påstande til vurdering: Vurderinger bør begynde med en gensidigt aftalt afgrænsning efterfulgt af klart definerede sikkerhedspåstande, som registreres, før vurderingsaktiviteterne går i gang. Tredjeparter og laboratorier bør afklare, om der er tale om påstande, som den evaluerede virksomhed ønsker vurderet, eller påstande, som tredjepartsvurdereren ønsker at vurdere uafhængigt, og som laboratoriet accepterer at blive vurderet ud fra. Der kan være mange grunde til, at visse påstande falder uden for afgrænsningen, herunder at tredjeparter ikke kan få adgang til data, at vurdereren ikke har tilstrækkelig ekspertise, eller at der er rimelige tidsbegrænsninger ved en hastende vurdering. Laboratorier og vurderere bør etablere en proces til håndtering af væsentlige risici, der identificeres uden for den oprindelige afgrænsning, herunder tage stilling til, om de bør undersøges nærmere. Konklusionerne bør tydeligt angive, hvad der blev og ikke blev vurderet i forhold til den gensidigt aftalte afgrænsning.

  • Forholdsmæssig adgang: Vurderere bør så vidt muligt have adgang i et omfang, der står mål med vurderingen af de aftalte påstande, inden for de juridiske, sikkerhedsmæssige og immaterialretlige begrænsninger. Når direkte adgang er upraktisk eller umulig, kan vurderere samarbejde med en udpeget virksomhedsrepræsentant eller undersøge indirekte eller privatlivsbeskyttende adgangsmekanismer, der beskytter de underliggende oplysninger.

  • Gennemsigtig metode og standarder: Vurderere bør redegøre for deres metoder, vurderingskriterier og usikkerheder og benytte etablerede standarder, hvor de findes. Hvor der endnu ikke findes standarder, bør de tydeligt begrunde de anvendte kriterier. Rapporter bør skelne mellem direkte resultater og fortolkning, redegøre for usikkerhed og tydeliggøre, hvilke konklusioner evidensen understøtter.

  • Ekspertise og uafhængighed: Vurderere bør dokumentere relevant teknisk ekspertise samt identificere, oplyse om og håndtere organisatoriske og individuelle interessekonflikter, herunder økonomiske incitamenter, relationer til udviklere og tidligere medvirken i det arbejde, der vurderes. Sikkerhedsforanstaltninger bør sikre, at kommercielt pres og honoraraftaler ikke påvirker resultaterne, og kan omfatte inhabilitet eller passende karensperioder.

  • Sikkerhed og fortrolighed: Vurderere bør dokumentere praksis for informationssikkerhed og håndhævelig beskyttelse af fortroligheden for deres personale, som står mål med følsomheden af de systemer og oplysninger, de får adgang til. Denne beskyttelse bør omfatte immaterielle rettigheder, følsomme oplysninger og vurderingsmateriale. Hvis vurderere ikke kan opfylde sikkerhedskravene i deres egne miljøer, eller hvis de tilgåede data er særligt følsomme, kan adgang via virksomhedens enheder eller lokaler være hensigtsmæssig.

  • Handlingsanvisende resultater og tid til afhjælpning: Vurderinger bør identificere konkrete mangler og indeholde tilstrækkelige oplysninger til, at laboratorierne kan afhjælpe dem. Hvor det er relevant, bør laboratorier have en rimelig frist til at afhjælpe problemer inden offentliggørelse. Hvor det er relevant, bør rapporter også beskrive erfaringer for udviklere og udrullere af agenter samt forsvarsspecialister og give praktiske anbefalinger til implementering.

  • Ansvarlig offentliggørelsespraksis: Vurderingsrapporter bør være baseret på evidens og deles så åbent som muligt, samtidig med at følsomme og fortrolige oplysninger beskyttes. Hvor fuld offentliggørelse ikke er mulig, kan fortrolig rapportering til relevante tilsynsorganer, såsom ledelsesorganer eller virksomhedsbestyrelser, understøtte ansvarlighed. Der bør være principbaseret beskyttelse og klare retningslinjer for redigering samt klare forventninger til feedback og rettelse af unøjagtigheder, så balancen mellem uafhængighed og fortrolighed bevares. Vurderere bør bevare deres redaktionelle uafhængighed og samtidig sikre fortroligheden og beskyttelsen af immaterielle rettigheder. Vurderere bør indføre klare retningslinjer for redigering, så laboratorier kan anmode om, at følsomme oplysninger fjernes, mens vurdererne kan oplyse, hvor der er foretaget væsentlige redigeringer, og hvilken betydning de har for vurderingsrapporten.

Vejen frem

Vi vil støtte uafhængige vurderere og etablere tydeligere, fælles internationale standarder – både gennem kommende lovgivning og private forvaltningsinstitutioner – for effektive tredjepartsvurderinger. Selvom økosystemet for uafhængig evaluering stadig er under udvikling, vil vi bidrage til dets vækst ved at støtte og samarbejde med en mangfoldig gruppe af uafhængige vurderere med dyb ekspertise i sikkerhedsspørgsmål om banebrydende AI. Ingen enkelt tredjepart kan eller bør dække alle presserende sikkerhedsspørgsmål om banebrydende AI. Vi vil arbejde målrettet og velovervejet på at øge vores kapacitet og gøre det muligt for det voksende tredjepartsøkosystem at samles om bedste praksis og fælles principper. Vi drøfter forslag, der er i tråd med ovenstående prioriterede områder, med flere tredjeparter.