Het Hugging Face-incident en andere gevolgen van verkeerd afgestemde modellen voor derden
Naarmate AI-systemen krachtiger en autonomer worden, kan verkeerd afgestemd gedrag leiden tot ingrijpende acties in de echte wereld, waaronder cyberbeveiligingsincidenten en andere gevolgen die ontwikkelaars mogelijk niet hadden voorzien. Begrijpen hoe dit gedrag ontstaat en escaleert en hoe het kan worden gedetecteerd en aangepakt, wordt daarom een steeds belangrijker onderdeel van het veilig ontwikkelen en implementeren van geavanceerde AI-systemen.
Aanvankelijk beschouwden we het Hugging Face-incident vooral als een beveiligingsprobleem, omdat er sprake was van een inbreuk op platformniveau. Het blijft de ernstigste activiteit van dit type die we tot nu toe bij onze modellen hebben vastgesteld. De belangrijkste drijvende kracht was een zeer krachtig onderzoeksmodel dat uitsluitend intern werd gebruikt. Sindsdien hebben we vastgesteld dat deze inbraak werd veroorzaakt doordat modellen hun toevlucht namen tot verkeerd afgestemde strategieën om moeilijke taken op te lossen, zoals beschreven in het technische rapport over Hugging Face. Cyberbeveiligingsincidenten zijn één uiting van dat risico. Verkeerde afstemming kan ook leiden tot ander onverwacht of zorgwekkend gedrag dat buiten traditionele beveiligingscategorieën valt, zoals wanneer onze modellen berichten plaatsen op websites van derden. Dit noemen we "agentspam". En we moeten beide aanpakken.
We zijn bredere activiteiten blijven beoordelen. Daarbij geven we prioriteit aan de ernstigere incidenten en breiden we de beoordeling uit naar verkeerd afgestemde activiteiten met een lagere ernst, waaronder agentspam.
Op deze pagina bundelen we onze rapporten en updates over het Hugging Face-incident, aanverwant onderzoek en openbare presentaties, andere activiteiten die we hebben vastgesteld, wat we hebben geleerd over de rol van verkeerde modelafstemming en de maatregelen waarmee we onze systemen versterken. We werken deze pagina bij naarmate onze onderzoeken vorderen.
Activiteiten met gevolgen voor derden
Om de omvang van dit onverwachte gedrag beter te begrijpen, voeren we een brede beoordeling uit van de internetactiviteiten van onze modellen tijdens training en evaluatie. Als onderdeel van onze beoordeling identificeren en informeren we doorlopend derden. We beginnen met gevallen waarin:
Onze modellen mogelijk de beveiligingsmaatregelen van een derde hebben omzeild of de beschikbaarheid van een onlinedienst hebben aangetast; of
Gevallen van verkeerde afstemming negatieve gevolgen hadden voor websites of diensten van derden.
Op basis van onze beoordeling tot nu toe hebben we aan de hand van bovenstaande criteria tientallen derden geïnformeerd. Onze beoordeling van eerdere activiteiten loopt nog en zal veel tijd en middelen vergen. Naarmate dit werk vordert, informeren we meer derden.
Hieronder publiceren we geanonimiseerde samenvattingen van de soorten verkeerd afgestemde activiteiten die we hebben waargenomen. We werken deze beschrijvingen bij naarmate we meer derden informeren en ons inzicht zich verder ontwikkelt. Daarnaast delen we relevante updates over de voortgang van de beoordeling. Waar nodig laten we doorgaans namen en andere identificerende gegevens weg om getroffen partijen te beschermen. Geïnformeerde partijen kunnen er echter voor kiezen de informatie die we hun verstrekken openbaar te delen.
Samenvattingen van de waargenomen activiteiten
Onze beoordelings- en meldingsprocedure heeft tot nu toe de volgende categorieën activiteiten aan het licht gebracht:
Omzeiling van toegangscontrole: Agents krijgen toegang tot informatie of functies waarvoor normaal een identiteitscontrole, specifieke toestemming, een abonnement of een account vereist is. Zo gebruikte een agent een ander webadres, wijzigde deze gegevens in een verzoek of maakte deze gebruik van een aanmeldsessie die meer toegang gaf dan verwacht.
Gebruik van blootgestelde inloggegevens: Agents vonden openbaar gemaakte aanmeldgegevens of toegangssleutels en gebruikten deze om toegang tot een dienst te krijgen.
Query- of commando-injectie: Agents voerden tekst in op een website of bij een dienst die deze als instructie behandelde in plaats van als gewone invoer. Hierdoor kon de dienst een databasequery, applicatiecode of een opdracht op de server uitvoeren.
Toegang tot interne runtime-onderdelen: Agents lazen bestanden met de implementatie van een dienst of communiceerden met een achterliggend systeem dat voor intern gebruik was bedoeld. In deze gevallen bereikte de agent delen van de dienst waartoe deze geen toegang hoorde te hebben.
Agentspam: Agents plaatsen informatie op websites van derden, waardoor informatie op die websites kan worden gewijzigd en opschoning nodig kan zijn. Een voorbeeld is het gebruik van openbare wikipagina's als gedeelde prikborden.