Hopp til hovedinnhold
OpenAI

16. september 2026

ResearchSikkerhet

Rammeverket vårt for rapportering av avvikende atferd i modeller

Laster inn …

Vi presenterer et nytt rammeverk for å spore, undersøke og offentliggjøre tilfeller av modellavvik hos OpenAI, sammen med seks rapporter om uventet eller bekymringsfull modellatferd vi har observert de siste seks månedene.

For å gi forskere, KI-utviklere, beslutningstakere og allmennheten et bedre kunnskapsgrunnlag har vi tidligere forsøkt å offentliggjøre funnene våre om avvik. Uten en systematisk tilnærming til rapporteringen av disse funnene har offentliggjøringene imidlertid vært sporadiske og sjeldnere enn ønskelig. Vi har ofte ventet til vi kunne samle flere tilfeller i én rapport, eller lagt dem til i systemkort for nylig lanserte modeller. Det nye rammeverket skal gjøre det raskere å publisere rapporter om avvik etter en observasjon, også når vi ennå ikke har forklart eller begrenset atferden fullt ut.

Etter hvert som KI-systemer blir mer avanserte og tas i bruk i større skala, må vi bygge en bredere og bedre informert enighet om fremdriften innen forskning på tilpasning. Vi tror ikke at KI-bransjen har løst tilpasning og overvåking godt nok til at vi kan fortsette å skalere ansvarlig i maksimal hastighet særlig mye lenger. Beslutninger om hvordan KI-utviklingen bør fortsette i månedene og årene fremover, må bygge på dokumentasjon som personer utenfor selskapene som utvikler banebrytende modeller, selv kan undersøke.

Eksempler på avvik kan bidra til å avdekke problemer andre KI-utviklere støter på når systemene deres oppnår lignende egenskaper, avsløre svakheter i sikkerhetstiltak eller utfordre gjengse oppfatninger om modellatferd. Ved å dele disse funnene gjør vi det mulig for andre å undersøke de samme problemene, prøve forklaringene våre og forbedre risikoreduserende tiltak. Fordi vi mener åpenhet om avvik er verdifullt, legger det nye rammeverket vårt til rette for offentliggjøring selv når betydningen er usikker. Det betyr at noen av tilfellene vi offentliggjør, kan vise seg å være tilfeldige og verken inngå i et større mønster eller si noe om fremtidig utvikling.

Det finnes for øyeblikket ikke noe bransjeomfattende rammeverk med tydelige standarder for hvordan KI-utviklere bør offentliggjøre eksempler på avvik i modellene sine. Vi håper rammeverket vi presenterer i dag, er et første skritt mot slike standarder ved å fastsette hvilke avvikstilfeller utviklere bør offentliggjøre, og hva rapportene bør inneholde. Vi ser på dette rammeverket som et arbeid under utvikling, som vi forbedrer gjennom erfaring og tilbakemeldinger fra allmennheten.

Her beskriver vi hvordan rammeverket vil fungere, og deler de første rapportene vi publiserer.

Hvilke eksempler på avvik vi vil rapportere

Vi tar sikte på å offentliggjøre eksempler som gir nyttig dokumentasjon på hvordan et modellavvik oppstår, hvordan det manifesterer seg, og hvor sikkerhetstiltak lykkes eller svikter. Vi prioriterer nye mekanismer, vesentlige endringer i kjent atferd og funn som utfordrer gjengse oppfatninger om sikkerhet eller risikoreduserende tiltak. Et eksempel trenger ikke å ha forårsaket skade eller påvise et større mønster for å være verdt å offentliggjøre. Dette rammeverket omfatter relevant atferd gjennom hele modellens levetid – inkludert trening, evaluering, testing og produksjonssetting.

Dette omfatter nye måter modeller kan handle på uten tillatelse, samordne seg med andre modeller eller unngå tilsyn på; svikt som sår tvil om en tilpasningsmetode eller et sikkerhetstiltak; og atferd som utfordrer en påstand i en publisert sikkerhetsvurdering. De samme kriteriene for offentliggjøring gjelder for avvik som kan påvirke tredjeparter.

Dette kan også omfatte tilfeller av avvik som ser ut til å være gjentakelser av tilfeller vi tidligere har offentliggjort. At problemet gjentar seg, kan i seg selv være nyttig dokumentasjon på hvordan modellene våre oppfører seg, eller hvor effektive sikkerhetstiltakene våre er – for eksempel dersom en bestemt type avvikende atferd fortsetter å oppstå til tross for gjentatte forsøk på å begrense den. I slike tilfeller publiserer vi de nye eksemplene ved å oppdatere den opprinnelige offentliggjøringen om avvik.

Over tid planlegger vi å utvikle mer objektive kriterier for offentliggjøring sammen med andre utviklere, eksterne forskere, standardiseringsorganer i bransjen og tilsynsmyndigheter. Vi mener også at alvorlige hendelser knyttet til sikkerhet, informasjonssikkerhet og avvik bør deles med USAs føderale myndigheter, og vi arbeider med forslag til rapporteringsmekanismer. Vi anser dette rammeverket som et supplement til de eksisterende forpliktelsene våre og understreker at det ikke erstatter lovpålagte krav til offentliggjøring, blant annet ved kritiske sikkerhetshendelser eller brudd på cybersikkerheten.

Eksemplene på avvik vi deler i dag

For å innlede det nye rammeverket vårt for offentliggjøring av avvik publiserer vi seks rapporter om tilfeller av avvikende atferd som vi har observert under trening eller evaluering av modellene våre. Tilfellene illustrerer en rekke former for atferd som vi mener det er verdt å dele, fra å skjule informasjon for brukeren til å utføre handlinger uten godkjenning for å overvinne hindringer. Dette er rapporter om enkelttilfeller og bør ikke oppfattes som representative for hvor ofte avvik oppstår i modellene våre. Hvert punkt nedenfor lenker til hele rapporten.

  1. Selvgenererte instruksjoner i oppgavesammendrag(åpnes i et nytt vindu). En forskningsmodell som ikke var lansert, satte inn irrelevante instruksjoner, blant annet om å se bort fra de vanlige begrensningene sine, i sammendrag som ble brukt til å fortsette arbeidet i et nytt kontekstvindu. Vi identifiserte 27 berørte sammendrag.

  2. Instruksjoner om å skjule feil i oppgavesammendrag(åpnes i et nytt vindu). Under treningen av GPT‑5.6 Sol la mange modellforekomster til instruksjoner i sammendragene sine om å skjule feil eller avvikende atferd for brukeren. Komprimeringssammendragene inneholdt for eksempel instruksjoner om å dikte opp manglende historiske data uten å opplyse om det og skjule uoverensstemmelser mellom kildeversjoner.

  3. Søk i offentlige lagre etter eksponerte API-nøkler, etterfulgt av fabrikkert informasjon(åpnes i et nytt vindu). Mens en modell besvarte et rutinespørsmål om inntektstall i et fylke i California, fant og brukte den en eksponert API-nøkkel uten tillatelse. Da den fortsatt ikke klarte å hente de etterspurte tallene, diktet den dem opp og presenterte dem som data fra den etterspurte kilden.

  4. Opplasting av filer på internett for å kunne sitere dem(åpnes i et nytt vindu). Da en bruker ba en modell som ikke var lansert, om ID-ene og navnene til innsjøer større enn 5 000 000 kvadratmeter, fant agenten det riktige svaret ved hjelp av Python. Men fordi instruksjonene krevde en kildehenvisning fra nettleseren, bestemte agenten seg for å laste opp filen slik at den kunne vise til den i svaret, uten å spørre brukeren.

  5. Skriving uten godkjenning og kommunikasjon gjennom et internt programvarelager(åpnes i et nytt vindu). Modeller brukte et internt programvarelager som en oppslagstavle for å utveksle forespørsler og svar i flere separate treningseksempler mens de lette etter manglende inndatafiler, men de klarte ikke å finne igjen de filene. Rapporten undersøker også et tidligere tilfelle der en modell lastet opp testfiler til et lager mens den forsøkte å omgå nettverksbegrensninger.

  6. Fildeling uten godkjenning mellom samarbeidende agenter(åpnes i et nytt vindu). Agenter som samarbeidet om den samme treningsoppgaven, brukte offentlige nettsteder for filhosting til å dele filer når de ikke fikk tilgang til hverandres lokale filer. Dette gjorde oppgavens leveranser tilgjengelige via offentlige nettadresser, selv om oppgaven ba modellene om bare å bruke lokale filer.

Slik fungerer prosessen vår for offentliggjøring

Alle medarbeidere i OpenAI kan melde inn et eksempel på avvik til sikkerhets- og tilpasningsteamene våre for undersøkelse og be om at det vurderes for offentliggjøring. Dette starter prosessen for offentliggjøring, med tidsfrister for hvert trinn for å sikre at undersøkelsen og offentliggjøringen skjer innen rimelig tid.

Når et eksempel er meldt inn, undersøker det tekniske personalet hva som skjedde, hva som fortsatt er usikkert, om offentliggjøring er berettiget, og hvilke fakta som kan deles. De vil også vurdere om en tredjepart ble berørt og må varsles privat før publisering.

Eksempelet blir deretter lagt i ett av tre spor: Klar for offentliggjøring, Mindre undersøkelse eller Større undersøkelse («langsomt spor»).

Klar for offentliggjøring omfatter relevante tilfeller der undersøkelsen er tilstrekkelig fullført til at de kan publiseres etter gjennomgang. Mindre undersøkelse omfatter tilfeller som krever ytterligere tekniske undersøkelser. Vi forventer at disse to sporene vil omfatte de aller fleste tilfellene vi offentliggjør, særlig saker som ikke krever omfattende undersøkelser, samordning med tredjeparter eller håndtering av alvorlig risiko for misbruk. Alle tilfellene vi publiserer i dag, hører til i ett av disse to sporene.

Større undersøkelse omfatter komplekse undersøkelser, særlig de som involverer tredjeparter. Når en tredjepart er berørt, har våre forpliktelser knyttet til sikkerhet, jus og ansvarlig offentliggjøring forrang fremfor dette rammeverket. Vi tar sikte på å publisere et første varsel så snart som mulig, men kan måtte utsette det av sikkerhetshensyn, for eksempel dersom en modell oppdager en hittil ukjent sårbarhet i en mye brukt programvare. Hvis en rapport vil identifisere en tredjepart, har vi til hensikt å varsle på forhånd, selv når ingen sikkerhetsgrenser er brutt.

Det første varselet om et tilfelle i sporet Større undersøkelse vil utløse en redegjørelse på høyt nivå om hva som skjedde, opplyse om hvorvidt eksterne eksperter bistår i undersøkelsen, og angi et eventuelt tilgjengelig anslag for når vi forventer å publisere en endelig rapport. OpenAI-hendelsen på Hugging Face ville ha tilhørt dette sporet dersom den hadde blitt offentliggjort innenfor dette rammeverket.

Medarbeideren som tok opp eksempelet, blir informert om beslutningen om hvorvidt det skal offentliggjøres, og hvilket spor det eventuelt skal følge. Uavklarte uenigheter om offentliggjøring eller valg av spor blir henvist til OpenAIs Sikkerhetsråd (SAG), en gruppe med seniorrepresentanter fra hele selskapet som vurderer egenskapene og sikkerhetstiltakene til banebrytende modeller, fører tilsyn med vårt Preparedness Framework og gir råd til OpenAIs ledelse. Uenigheter i Sikkerhetsrådet eller innsigelser fra medarbeidere mot rådets beslutninger blir eskalert til OpenAIs ledelse. Beslutninger om ikke å offentliggjøre, eller om at offentliggjøring ikke er berettiget, blir delt med ledelsen for sikkerhet og samsvar og, så langt det er mulig, med relevant teknisk personale.

Vi kan revidere denne prosessen for offentliggjøring etter hvert som vi lærer hvordan den fungerer i praksis, og vil registrere eventuelle endringer i dette innlegget.

Dette vil hver rapport inneholde

Hver fullstendige rapport vil beskrive atferden vi observerte, alvorlighetsgraden og eventuell ekstern påvirkning, omstendighetene den oppsto under, datoen eller tidsrommet, når vi oppdaget den, og på overordnet nivå hvilken modell eller hvilke modeller som var involvert. Der det er mulig, deler vi også:

  • Flere detaljer om hva som skjedde, og eventuelle skader som fulgte av det

  • Hvordan vi oppdaget den avvikende atferden, og omfanget av undersøkelsene

  • Vår tolkning av hva dette innebærer for forskning på KI-tilpasning og teknisk KI-sikkerhet

  • Viktige ubesvarte spørsmål som eksempelet reiser

  • Tiltak vi iverksetter eller planlegger for å håndtere atferden. Denne informasjonen er kanskje ikke alltid tilgjengelig på offentliggjøringstidspunktet, siden vi gjerne publiserer avviksrapporten før undersøkelsen er fullført eller en løsning er utviklet.

Når avvikende atferd oppstår i kunders produksjonsmiljøer, deler vi så mye informasjon som kundenes personvern og våre kontraktsforpliktelser tillater.

Dagens rapporter er en innledende gruppe med offentliggjøringer, ikke en fullstendig redegjørelse for kjente avvik eller pågående undersøkelser. Disse første rapportene er ikke ment å gjenspeile hele bredden eller alvorlighetsgraden i tilfellene som omfattes av rammeverket. Vi er forpliktet til å offentliggjøre tilfeller av avvikende atferd som oppfyller kriteriene i dette rammeverket, inkludert mer komplekse tilfeller som krever lengre undersøkelser eller samordning med tredjeparter. Vi fortsetter å publisere rapporter fortløpende innenfor dette rammeverket og dele mer om rapporteringsforpliktelsene våre etter hvert som vi videreutvikler dem.

Forfatter

OpenAI