Cyberoperacja: wsparcie phishingu i tworzenia skryptów
OpenAI zablokowało konta, których aktywność pokrywała się z działaniami publicznie opisywanych grup cyberzagrożeń i nosiła znamiona zgodne z potrzebami wywiadu ChRL. AI wykorzystywano do phishingu i tworzenia skryptów.
To studium przypadku opublikowano pierwotnie w raporcie OpenAI z października 2025 r.(otwiera nowe okno)
Sprawcy
Zidentyfikowaliśmy i zablokowaliśmy grupę kont ChatGPT uczestniczących w działaniach pokrywających się z publicznie opisywaną aktywnością grup cyberzagrożeń, które branża śledzi pod nazwami UNK_DROPPITCH (Proofpoint) i UTA0388 (Volexity). W co najmniej jednym przypadku adres e-mail użyty do rejestracji konta ChatGPT miał również służyć do wysyłania wiadomości phishingowych.
Działania sprawców korzystających z tych kont nosiły znamiona cyberoperacji prowadzonych na potrzeby wywiadu ChRL: posługiwali się językiem chińskim i atakowali tajwański sektor półprzewodników, amerykańskie środowiska akademickie i think tanki oraz organizacje związane z grupami etnicznymi i politycznymi krytycznymi wobec Komunistycznej Partii Chin, określanymi niekiedy mianem „pięciu trucizn”.
Nasz model nie zapewnił żadnych nowych zdolności ofensywnych. Wygląda na to, że operatorzy korzystali z naszych modeli głównie po to, by usprawnić istniejące procesy — zwłaszcza tworzenie treści phishingowych oraz debugowanie i modyfikowanie swoich narzędzi.
Działania
Sprawcy wykorzystywali ChatGPT do dwóch głównych zadań: generowania treści na potrzeby wielojęzycznych kampanii phishingowych — między innymi po chińsku w zapisie uproszczonym i tradycyjnym, angielsku oraz japońsku — a także do pomocy w tworzeniu narzędzi i złośliwego oprogramowania. Ich prace programistyczne wskazywały na sprawcę kompetentnego technicznie, lecz niezbyt zaawansowanego. Omawiali na przykład różne aspekty i niuanse użycia AES do zabezpieczenia ruchu C2, ale nadal stosowali prosty, statyczny klucz.
Schemat tworzenia treści phishingowych był szczegółowy i szablonowy, co wskazywało na atakowanie ściśle określonej grupy odbiorców. Zazwyczaj generowali zwięzłą, uprzejmą i formalną wiadomość e-mail, której nadawca podawał się za przedstawiciela środowiska akademickiego, branży lub organizatora konferencji. Sprawcy często prosili o zmianę tonu, zastąpienie terminów ich regionalnymi odpowiednikami lub dodanie konkretnych odniesień do instytucji. Choć te precyzyjne, drobne poprawki świadczą o skoordynowanych wysiłkach na rzecz podniesienia jakości pierwotnych treści, sprawcy nie poprawili niektórych zdradzających ich szczegółów, takich jak niewiarygodne przykładowe dane kontaktowe w stopkach wiadomości.
Prosili o fragmenty kodu i listy kontrolne, które przyspieszyłyby wykonywanie rutynowych zadań. Prosili o kod do testowania szyfrowanego transportu (HTTPS, TLS) na potrzeby prostego odpytywania typu beacon, opracowywali fragmenty kodu w Go i PowerShellu do wyliczania procesów, zatrzymywania ich według nazwy pliku wykonywalnego lub zbierania informacji o środowisku, a także integrowali powszechnie dostępne skanery ze skryptami opakowującymi w bashu i PowerShellu.
Prosili też model o sugestie dotyczące prostych technik zaciemniania i drobnych usprawnień bezpieczeństwa operacyjnego (OPSEC), takich jak zmiana nazw funkcji, modyfikowanie nagłówków czy ukrywanie ciągów znaków. Podczas wielu sesji dążyli do stworzenia podstawowych prototypów systemów dowodzenia i kontroli, typowych dla złośliwego oprogramowania o niskim lub średnim stopniu zaawansowania. Obejmowały one pętle keep-alive, minimalny mechanizm zlecania zadań przez HTTP(S) oraz komunikaty z zadaniami i wynikami oparte na JSON.
Szczegóły implementacji niektórych prac sprawców prowadzonych w Go pokrywają się z branżowymi doniesieniami o złośliwym oprogramowaniu śledzonym pod nazwą GOVERSHELL (Volexity) lub HealthKick (Proofpoint). Sugeruje to, że sprawcy próbowali wykorzystywać modele do wspierania prac nad swoim głównym złośliwym oprogramowaniem.
Oprócz tworzenia fałszywych person i rozwijania narzędzi operatorzy badali możliwości dalszej automatyzacji za pomocą DeepSeek. Działania te przypominały prace rozpoznawcze nad automatyzacją phishingu na masową skalę, na przykład poprzez analizowanie treści internetowych w celu automatycznego tworzenia listy adresatów wiadomości e-mail oraz generowania treści, które mogłyby zainteresować każdego zidentyfikowanego potencjalnego celu. Nie jesteśmy w stanie niezależnie potwierdzić, czy sprawcy wdrożyli którąkolwiek z tych automatyzacji, a jeśli tak — którego modelu ostatecznie użyli.
Wyniki
Sprawcy próbowali wykorzystywać nasze modele do planowania i kolejnych iteracji szyfrowanych komponentów C2, procesów zdalnego wykonywania poleceń oraz komunikacji dostosowanej kulturowo. Najważniejsze były dla nich szybkość i lokalizacja, a nie uzyskanie nowych zdolności ofensywnych. Wygenerowali za pomocą modeli wyniki, które najwyraźniej miały wspierać działania poza naszą platformą w kilku obszarach operacyjnych:
Szyfrowane C2 i zdalne wykonywanie poleceń: prośby o napisanie lub naprawienie kodu klient–serwer w Go z szyfrowaniem wiadomości, na przykład AES-GCM, ponownym uzgadnianiem kluczy sesji, beaconami przekazującymi informacje o systemie oraz konsolą serwera do wydawania poleceń PowerShell przez standardowe protokoły internetowe lub kanał oparty na WebSocket.
Ochrona ruchu i usprawnienia OPSEC: prośby obejmowały kod umożliwiający przejście ze zwykłych połączeń WebSocket na bezpieczne połączenia WebSocket (wss://) oraz z HTTP na HTTPS, wyłączenie weryfikacji certyfikatów w niektórych testach, maskowanie ruchu za pomocą warstwy pośredniej CDN/TLS, a także obsługę większych wiadomości bez powodowania awarii klienta.
Rozpoznanie i kontrola procesów: prośby o informacje dotyczące wykrywania oprogramowania antywirusowego za pomocą PowerShella, wyliczania procesów oraz kończenia określonych procesów Edge/WebView2.
Konfiguracja powszechnie dostępnych skanerów: pomoc w instalowaniu i używaniu narzędzi open source, takich jak nuclei i fscan, w komercyjnej infrastrukturze linuksowej oraz zapisywaniu wyników do późniejszej analizy.
Treści phishingowe i komunikacja: tworzenie przekonujących, wielojęzycznych wiadomości e-mail do kontaktów ze środowiska akademickiego lub branży, w tym tematów wiadomości i stylu dostosowanego do lokalnych norm.
Działania te odpowiadają kategoriom LLM ATT&CK, takim jak LLM-Optimized Payload Crafting, LLM-Enhanced Anomaly-Detection Evasion, LLM-Assisted Post-Compromise Activity, LLM-Assisted Reconnaissance and Discovery oraz LLM-Assisted Social Engineering.
Skutki
Wyłączyliśmy wszystkie konta powiązane z tymi działaniami i przekazaliśmy odpowiednie wskaźniki partnerom z branży. Sprawcy dążyli głównie do usprawnienia istniejących procesów, między innymi poprzez tworzenie gotowych do wysłania wiadomości phishingowych oraz skrócenie cykli kolejnych modyfikacji rutynowego kodu i automatyzacji. Nie znaleźliśmy dowodów na to, by wyniki generowane przez model zapewniły możliwości wykraczające poza dobrze udokumentowane techniki publiczne. Nasz model nie zapewnił żadnych nowych zdolności ofensywnych. Przewaga operacyjna, którą sprawcy próbowali uzyskać dzięki modelom, wynikała z biegłości językowej, lokalizacji i możliwości wytrwałego poprawiania rezultatów: prawdopodobnie popełniali mniej błędów językowych, szybciej tworzyli kod integracyjny i sprawniej wprowadzali poprawki, gdy coś nie działało.