Přeskoč na hlavní obsah
OpenAI

Aktualizováno: 30. dubna 2025

Jak se vyvíjí ChatGPT a naše základní modely

Zjistěte více o tom, jak vyvíjíme naše modely a používáme je v produktech, jako je ChatGPT

Základní modely OpenAI, včetně modelů, které služba ChatGPT využívá ke své činnosti, jsou vyvíjeny pomocí tří primárních zdrojů informací: 1) informace, které jsou veřejně dostupné na internetu, 2) informace, ke kterým přistupujeme na základě partnerství s třetími stranami, a 3) informace, které nám poskytují nebo které generují naši uživatelé nebo školitelé či výzkumní pracovníci.

V tomto článku je uveden přehled veřejně dostupných informací, které používáme k vývoji těchto modelů, a způsob, jakým tyto informace shromažďujeme a používáme v souladu se zákony o ochraně osobních údajů. Podrobnosti o tom, jak shromažďujeme a používáme informace od uživatelů našich služeb, včetně toho, jak zrušit používání konverzací ChatGPT k učení našich modelů, naleznete v našich Zásadách ochrany osobních údajů a tomto článku.

Co je ChatGPT a jak funguje?

ChatGPT je služba založená na umělé inteligenci, ke které máte přístup prostřednictvím internetu. ChatGPT můžete využívat k různým úkolům, jako je uspořádání nebo shrnutí informací, pomoc s překlady, analýza nebo generování obrázků, inspirace pro kreativitu, podněcování nápadů a pomoc s každodenními úkoly. ChatGPT byl vyvinut tak, aby mohl rozumět a odpovídat na otázky a pokyny uživatelů. Při tom prochází velké množství stávajících informací, jako je text, obrázky, zvuk nebo video, a učí se ze vztahů v těchto informacích. Model se například učí, jak se slova obvykle objevují v kontextu s jinými slovy, a pak používá naučené informace k předpovídání dalšího nejpravděpodobnějšího slova, které se může objevit v reakci na požadavek uživatele, a každého dalšího slova. Tyto modely se mohou naučit generovat i jiné formy informací, jako jsou obrázky, tím, že se naučí, jak spolu vzájemně souvisí pixely, které tvoří obrázek v trénovacích datech, a popisky, které je popisují.

Během procesu učení modelu („trénování“) se může model například pokusit dokončit větu: „místo toho, aby odbočila doleva, zabočila ___.“ Před trénováním bude model reagovat náhodnými slovy, ale protože čte a učí se z mnoha řádků textu, lépe porozumí tomuto typu věty a dokáže přesněji předpovědět další slovo. Tento proces pak opakuje na velmi velkém počtu vět.

Protože v této větě může následovat spousta možných slov (např. místo odbočení doleva odbočila „doprava“, „za roh“, „zpět“), obsahuje způsob, kterým model odpovídá, prvek náhodnosti, a naše modely v mnoha případech odpoví na stejnou otázku různými způsoby.

Modely strojového učení se skládají z velkých řetězců čísel, nazývaných „váhy“ nebo „parametry“, a kódu, který tato čísla interpretuje a provádí. Modely neobsahují ani neukládají kopie informací, ze kterých se učí. Místo toho se v průběhu trénování modelu některá čísla, která tvoří model, mírně mění, aby odrážela to, co se naučil. Ve výše uvedeném příkladu model vyhodnotil informace, které mu pomohly se zlepšit z předpovídání nesprávných náhodných slov na předpovídání přesnějších slov, zatímco v samotném modelu došlo pouze k mírné změně čísel. Model neukládal ani nekopíroval věty, obrázky ani zvuk, které hodnotil.

Jaký typ informací se používá k trénování ChatGPT?

Jak je uvedeno výše, ChatGPT a naše další služby jsou vyvíjeny na základě 1) informací, které jsou veřejně dostupné na internetu, 2) informací, ke kterým přistupujeme na základě partnerství s třetími stranami, a 3) informací, které nám poskytují nebo které generují naši uživatelé, školitelé či výzkumní pracovníci. Tento článek se zaměřuje na první skupinu: informace, které jsou veřejně dostupné na internetu.

Pro tento soubor informací používáme pouze veřejně dostupné informace, které jsou volně a otevřeně dostupné na internetu – například nevyhledáváme informace, o kterých víme, že se nachází za paywally nebo na „temném webu“. Používáme filtry a odstraňujeme informace, u kterých nechceme, aby se z nich naše modely učily nebo z nich vytvářely výstupy, jako jsou nenávistné projevy, obsah pro dospělé, stránky, které primárně shromažďují osobní údaje, a spam. Informace pak používáme k trénování našich modelů.

Používají se k trénování služby ChatGPT osobní údaje?

Velké množství dat na internetu se týká lidí, proto naše trénovací informace příležitostně obsahují osobní údaje. Při trénování našich modelů aktivně nevyhledáváme osobní údaje.

Trénovací informace používáme pouze k tomu, abychom naše modely naučili inteligenci, jako je schopnost předvídat, uvažovat a řešit problémy. Žádné osobní údaje z trénovacích informací nepoužíváme a nebudeme používat k vytváření profilů o lidech za účelem jejich kontaktování, zasílání reklam, snahy jim cokoli prodat či za účelem prodeje informací jako takových.

Naše modely se mohou učit z osobních údajů, aby pochopily, jak věci, jako jsou jména a adresy, zapadají do jazyka a vět, nebo aby se dozvěděly více o slavných a veřejných osobnostech. Díky tomu se naše modely zlepšují v poskytování relevantních odpovědí.

Při trénování našich modelů také podnikáme kroky ke snížení zpracování osobních údajů. Odstraňujeme například webové stránky, které agregují velké objemy osobních údajů, a školíme naše modely tak, aby zamítaly žádosti o soukromé nebo citlivé informace o lidech.

Jak vývoj služby ChatGPT splňuje zákony o ochraně osobních údajů?

Trénovací informace používáme v souladu se zákonem. Naše základní modely mají mnoho způsobů použití, které přinášejí významné výhody a pomáhají lidem vytvářet obsah, zlepšovat zákaznické služby, vyvíjet software, přizpůsobovat vzdělávání, podporovat vědecký výzkum a mnoho dalšího. Tyto přínosy nelze realizovat bez velkého množství informací, které slouží pro trénování modelů. Naše používání trénovacích informací navíc nemá negativní dopad na jednotlivce a primární zdroje těchto trénovacích informací jsou již veřejně dostupné. Z těchto důvodů vychází naše shromažďování a používání osobních údajů, které jsou součástí trénovacích informací, z oprávněných zájmů v souladu se zákony o ochraně osobních údajů, jako je GDPR, jak je podrobněji vysvětleno v našich Zásadách ochrany osobních údajů. Provedli jsme také posouzení vlivu na ochranu osobních údajů, abychom zajistili, že tyto informace shromažďujeme a používáme zákonným a odpovědným způsobem.

Reagujeme na žádosti obsahující vznesení námitky a uplatňování podobných práv. V důsledku učení jazyka mohou odpovědi ChatGPT někdy obsahovat osobní údaje o jednotlivcích, jejichž osobní údaje se na veřejném internetu objevují vícekrát (například veřejné osobnosti). Fyzické osoby v některých jurisdikcích mohou vznášet námitky proti zpracování osobních údajů našimi modely nebo podávat jiné žádosti o práva subjektů údajů prostřednictvím našeho Portálu pro ochranu osobních údajů(otevře se v novém okně). Tato práva můžete uplatnit také tak, že nás kontaktujete na adrese dsar@openai.com.

Upozorňujeme, že v souladu s právními předpisy o ochraně osobních údajů nemusí být některá práva absolutní. Žádost můžeme odmítnout, pokud k tomu máme zákonný důvod. Snažíme se však upřednostňovat ochranu osobních údajů a dodržovat všechny platné právní předpisy o ochraně osobních údajů. Máte-li pocit, že jsme váš problém dostatečně neřešili, máte právo podat stížnost u místního dozorového orgánu.

Další informace o postupech společnosti OpenAI v souvislosti s osobními údaji, které shromažďujeme od vás nebo o vás při vašem používání našich webových stránek, aplikací a služeb, naleznete v našich Zásadách ochrany osobních údajů.