Pereiti prie pagrindinio turinio
OpenAI

Atnaujinta: 2025 m. balandžio 30 d.

Kaip kuriami „ChatGPT“ ir mūsų pamatiniai modeliai

Sužinokite daugiau, kaip kuriame modelius ir naudojame juos tokiuose produktuose kaip „ChatGPT“

„OpenAI“ pamatiniai modeliai, įskaitant „ChatGPT“ naudojamus modelius, kuriami naudojant tris pagrindinius informacijos šaltinius: 1) informaciją, kuri yra viešai prieinama internete, 2) informaciją, kurią norėdami pasiekti bendradarbiaujame su trečiosiomis šalimis, ir 3) informaciją, kurią teikia ar kuria mūsų naudotojai ar instruktoriai ir tyrėjai.

Šiame straipsnyje apžvelgiama viešai prieinama informacija, kurią naudojame kurdami šiuos modelius, ir aprašoma, kaip renkame bei naudojame šią informaciją laikydamiesi privatumo apsaugos teisės aktų. Norėdami suprasti, kaip iš savo paslaugų naudotojų renkame ir naudojame informaciją, įskaitant tai, kaip atsisakyti, kad „ChatGPT“ pokalbiai būtų naudojami padėti mūsų modeliams mokytis, žr. mūsų Privatumo politiką ir šį straipsnį.

Kas yra ir kaip veikia „ChatGPT“?

„ChatGPT“ – dirbtiniu intelektu pagrįsta paslauga, kurią galima pasiekti internetu. „ChatGPT“ galite naudoti įvairioms užduotims atlikti, pavyzdžiui, informacijai tvarkyti ar apibendrinti, vertimams atlikti, vaizdams analizuoti ar kurti, kūrybinei veiklai įkvėpti ir idėjoms sužadinti, taip pat kasdienėms užduotims atlikti. „ChatGPT“ sukurta taip, kad galėtų suprasti naudotojo klausimus ir nurodymus bei į juos reaguoti. Tam peržiūrimas didelis kiekis esamos informacijos, pavyzdžiui, tekstų, vaizdų, garso ar vaizdo įrašų, ir mokomasi iš informacijos sąsajų. Pavyzdžiui, šis modelis mokosi, kaip žodžiai dažniausiai sutinkami kitų žodžių kontekste, ir pagal tai, ką išmoko, nuspėja kitą labiausiai tikėtiną žodį, kuris gali atsirasti atsakant į naudotojo užklausą, ir kiekvieną paskesnį žodį. Tokie modeliai taip pat gali išmokti kurti kitų formų informaciją, pavyzdžiui, vaizdus, mokydamiesi, kaip vaizdus iš mokymo duomenų sudarantys pikseliai yra susiję tarpusavyje ir su juos apibūdinančiomis antraštėmis.

Pavyzdžiui, modelio mokymosi proceso (vadinamo „mokymusi“) metu modelis gali bandyti užbaigti sakinį: „Užuot pasukusi į kairę, ji pasuko ___“. Prieš mokydamasis modelis atsako atsitiktiniais žodžiais, tačiau skaitydamas ir mokydamasis iš daugelio teksto eilučių jis geriau supras tokio tipo sakinius ir galės tiksliau nuspėti kitą žodį. Tada jis šį procesą pakartos daugybėje sakinių.

Kadangi šiame sakinyje gali būti daug žodžių, kurie eitų po „pasuko“ (pavyzdžiui, užuot pasukusi į kairę, ji pasuko „dešinėn“, „aplink“ arba „atgal“), modelio atsakymas yra atsitiktinis, todėl daugeliu atvejų mūsų modeliai į tą patį klausimą atsakys skirtingai.

Mašininio mokymosi modeliai sudaryti iš didelių skaičių eilučių, vadinamų „svertais“ arba „parametrais“, ir kodo, kuris interpretuoja ir vykdo tuos skaičius. Modeliuose nėra informacijos, iš kurios jie mokosi, kopijų. Vietoj to, kai modelis mokosi, kai kurie modelį sudarantys skaičiai šiek tiek keičiasi, kad atspindėtų tai, ką jis išmoko. Pirmiau pateiktame pavyzdyje modelis peržiūrėjo informaciją, kuri padėjo jam tobulėti nuo atsitiktinių netikslių žodžių iki tikslesnių žodžių numatymo, tačiau viskas, kas iš tikrųjų atsitiko pačiame modelyje, buvo tai, kad šiek tiek pasikeitė skaičiai. Modelis neįrašė ir nekopijavo peržiūrėtų sakinių, vaizdų ar garso įrašų.

Kokio tipo informacija naudojama mokant „ChatGPT“?

Kaip minėta pirmiau, „ChatGPT“ ir kitos mūsų paslaugos kuriamos naudojant 1) informaciją, kuri yra viešai prieinama internete, 2) informaciją, kurią norėdami pasiekti bendradarbiaujame su trečiosiomis šalimis, ir 3) informaciją, kurią teikia ar kuria mūsų naudotojai ar instruktoriai ir tyrėjai. Šiame straipsnyje pagrindinis dėmesys skiriamas pirmajai grupei – informacijai, kuri yra viešai prieinama internete.

Šiai informacijos grupei naudojame tik viešai prieinamą informaciją, kuri yra laisvai ir atvirai prieinama internete – pavyzdžiui, neieškome mokamos informacijos ar informacijos iš „tamsiojo“ interneto. Naudojame filtrus ir pašaliname informaciją, iš kurios nenorime, kad mūsų modeliai mokytųsi, ar rezultatą, pvz., neapykantą kurstančią kalbą, suaugusiesiems skirtą turinį, svetaines, kuriose daugiausia kaupiama asmeninė informacija, ir šlamštą. Tada šią informaciją naudojame savo modeliams mokyti.

Ar mokant „ChatGPT“ naudojama asmeninė informacija?

Didelis duomenų kiekis internete yra susijęs su žmonėmis, todėl mūsų mokymosi informacijoje atsitiktinai gali būti ir asmeninės informacijos. Savo modeliams mokyti asmeninės informacijos aktyviai neieškome.

Mokymosi informaciją naudojame tik tam, kad išmokytume modelius intelekto, pavyzdžiui, gebėjimo nuspėti, samprotauti ir spręsti problemas. Mes nenaudojame ir nenaudosime jokios asmeninės informacijos mokymosi informacijoje, kad galėtume kurti žmonių profilius, su jais susisiekti, jiems reklamuotis, bandyti jiems ką nors parduoti ar parduoti pačią informaciją.

Mūsų modeliai gali mokytis iš asmeninės informacijos, kad suprastų, kaip tokie elementai kaip vardai ir adresai dera kalboje ir sakiniuose, arba sužinotų apie žinomus žmones ir visuomenės veikėjus. Dėl to mūsų modeliai geriau pateikia tinkamus atsakymus.

Mokydami savo modelius, taip pat imamės veiksmų, kad sumažintume asmeninės informacijos apdorojimą. Pavyzdžiui, pašaliname svetaines, kuriose renkama daug asmeninės informacijos, ir mokome savo modelius atmesti užklausas dėl privačios ar neskelbtinos informacijos apie žmones.

Kaip „ChatGPT“ kūrimas atitinka privatumo apsaugos įstatymus?

Mokymosi informaciją naudojame teisėtai. Mūsų pamatiniai modeliai turi daugybę pritaikymo būdų, kurie teikia didelę naudą ir jau padeda žmonėms kurti turinį, gerinti klientų aptarnavimą, kurti programinę įrangą, individualizuoti mokymąsi, padeda moksliniams tyrimams ir dar daugiau. Šios naudos neįmanoma realizuoti be didelio kiekio informacijos, reikalingos modeliams išmokyti. Be to, mūsų mokymosi informacijos naudojimas neturi neigiamo poveikio asmenims, o pirminiai šios mokymosi informacijos šaltiniai jau yra viešai prieinami. Dėl šių priežasčių asmeninę informaciją, kuri įtraukta į mokymosi informaciją, renkame ir naudojame teisėtais interesais vadovaudamiesi privatumo apsaugos teisės aktais, pavyzdžiui, BDAR, kaip išsamiau paaiškinta mūsų Privatumo politikoje. Taip pat atlikome poveikio duomenų apsaugai vertinimą, kad padėtume užtikrinti šios informacijos teisėtą ir atsakingą rinkimą ir naudojimą.

Reaguojame į prieštaravimus ir panašias teises. Mokantis kalbos, į „ChatGPT“ atsakymus kartais gali būti įtraukiama asmeninė informacija apie asmenis, kurių asmeninė informacija viešajame internete pasirodo ne kartą (pavyzdžiui, vieši asmenys). Asmenys tam tikrose jurisdikcijose gali prieštarauti, kad mūsų modeliai apdorotų jų asmeninę informaciją, arba pateikti kitus prašymus dėl duomenų subjekto teisių per mūsų privatumo portalą(atsidaro naujame lange). Šiomis teisėmis taip pat galite pasinaudoti susisiekę adresu dsar@openai.com.

Atminkite, kad pagal privatumo apsaugos teisės aktus kai kurios teisės gali būti ne absoliučios. Galime atmesti užklausą, jei turime teisėtą priežastį tai padaryti. Tačiau stengiamės teikti pirmenybę asmeninės informacijos apsaugai ir laikytis visų taikomų privatumo apsaugos teisės aktų. Norėdami gauti daugiau informacijos apie „OpenAI“ praktiką, susijusią su asmenine informacija, kurią renkame iš jūsų arba apie jus, kai naudojatės mūsų svetaine, programomis ir paslaugomis, žr. mūsų Privatumo politiką.

Norėdami gauti daugiau informacijos apie „OpenAI“ praktiką, susijusią su asmenine informacija, kurią renkame iš jūsų arba apie jus, kai naudojatės mūsų svetaine, programomis ir paslaugomis, žr. mūsų Privatumo politiką.