Перейти до основного вмісту
OpenAI

25 березня 2025 р.

ПродуктВипуск

Представляємо генерацію зображень 4o

Генерація корисних і цінних зображень за допомогою мультимодальної моделі, здатної створювати точні, достовірні та фотореалістичні результати.

This post introduced 4o image generation.

Завантаження…

Ми в OpenAI давно вважали, що створення зображень має бути основною можливістю наших мовних моделей. Ось чому ми вбудували найсучасніший генератор зображень у GPT‑4o. Результат — генерація не лише гарних, а й корисних зображень.

Створення корисних зображень

Від перших наскельних малюнків до сучасної інфографіки люди завжди використовували візуальні образи для спілкування, переконання та аналізу, а не лише для краси. Сучасні генеративні моделі здатні створювати сюрреалістичні, захоплюючі дух сцени, але зазнають труднощів із повсякденними зображеннями, які люди використовують для обміну та створення інформації. Зображення — від логотипів до діаграм — можуть передавати точне значення, якщо їх доповнити символами, які надсилають до спільної мови та досвіду.

Генерація зображень GPT‑4o відрізняється точною візуалізацією тексту, точним виконанням підказок та використанням вбудованих знань 4o та контексту чату, включаючи перетворення завантажених зображень або використання їх як візуального натхнення. Ці можливості полегшують створення саме того зображення, яке ви собі уявляєте, допомагаючи вам ефективніше спілкуватися за допомогою візуальних засобів і перетворюючи генерацію зображень на практичний, точний і потужний інструмент.

Покращені можливості

Ми навчили наші моделі на спільному розподілі онлайн-зображень та тексту, навчивши їх не лише тому, як зображення співвідносяться з описом, а й тому, як вони співвідносяться один із одним. У поєднанні з агресивним постнавчанням це дозволило створити модель, яка має дивовижну швидкість аналізу візуальної інформації, і здатна формувати корисні та послідовні зображення, що враховують контекст.

Рендеринг тексту

Одне зображення варте тисячі слів, але іноді, додавши кілька слів у потрібному місці, можна наголосити на сенсі зображення. Здатність 4o поєднувати точні символи із зображеннями перетворює генерацію зображень на інструмент візуальної комунікації.

Багатоетапне генерування

Генерація зображень тепер вбудована у GPT‑4o, тож ви можете покращувати зображення через природний діалог. GPT‑4o може працювати із зображеннями та текстом у контексті чату, забезпечуючи узгодженість протягом усього процесу. Наприклад, якщо ви розробляєте персонажа для відеоігри, його зовнішній вигляд залишатиметься послідовним протягом кількох ітерацій, поки ви його вдосконалюєте та експериментуєте.

Дотримання інструкцій

Генерація зображень GPT‑4o виконується за детальними підказками та з увагою до деталей. У той час як інші системи мають труднощі з 5–8 об'єктами, GPT‑4o може обробляти до 10–20 різних об'єктів. Тісніша прив'язка об'єктів до їхніх характеристик і зв'язків дозволяє краще контролювати процес генерації.

GPT‑4o може аналізувати та вивчати завантажені користувачем зображення, безперешкодно інтегруючи їхні деталі у свій контекст для осмисленої генерації зображень.

Світові знання

Нативна генерація зображень дає 4o можливість створення зв'язку між даними в тексті і зображеннях, у результаті чого модель стає розумнішою та ефективною.

Фотореалізм і стиль

Навчання на зображеннях, що відображають велику різноманітність стилів, дозволяє моделі переконливо створювати чи перетворювати зображення.

A candid paparazzi-style photo of Karl Marx hurriedly walking through the parking lot of the Mall of America, glancing over his shoulder with a startled expression as he tries to avoid being photographed. He’s clutching multiple glossy shopping bags filled with luxury goods. His coat flutters behind him in the wind, and one of the bags is swinging as if he’s mid-stride. Blurred background with cars and a glowing mall entrance to emphasize motion. Flash glare from the camera partially overexposes the image, giving it a chaotic, tabloid feel.
A cat looking into a puddle of water on a street, but its reflection is that of a tiger, and both reflections are realistically distorted by ripples in the water
Generate a candid, Polaroid-style photograph of four diverse friends in their early 20s at a gritty dive bar. The lighting features a very harsh, direct flash, creating sharp shadows and giving the photo a very overexposed, vintage instant-camera feel. Colors should be slightly muted, evoking nostalgic, early-2000s party vibes. The aesthetic is casually emo. No border or logos or signs. There's an interesting looking wall behind them with some light graffiti. Quality of the image should be very sharp and detailed (very little grain). The energy should be silly and chaotic. They're either playfully grimacing, smiling, or pretending to look tough. One of them should have their friend in a silly, playful headlock. Their mouths are closed.
Generate a photorealistic image of farmer's market in toronto on a saturday in summer 2006, it's a beautiful late june day, people are shopping and eating sandwiches. in focus should be a young asian girl wearing denim overalls and sipping on a strawberry banana smoothie - rest can be blurred. the photo should be reminiscent of that a digital camera from 2006 would take, with a timestamp like a printed photo would have. aspect ratio should be 3:2
blurry old analog film photograph, picture of parked car on side street, quiet night. credit creator: [Roope Rainisto](https://www.instagram.com/never_ever_never_land/?igsh=MXh3N3EyOWdoMmNubg%3D%3D#)
Create image super-realistic picture of these 4 creatures playing poker on a picnic blanket, zoomed out, in dolores park. photorealistic. The tabby long haired cat is holding a hand; right next to it are 2 tall vertical black chips (with stripes) as it has been raking in the dough.  Tabby's pupils are large and cute, and ii looking down and scrutinizing its cards, focused. Derpy black cat went all in. Two dogs are peering over cat's shoulder to see their cards. All cards are face down and of the same back color except for an exposed three of diamonds. small stack of poker chips are in front of each creature, but black cat went all in. the two dogs folded. All chips are from the same set and all cards have same color. photorealistic, shot on iphone, raw format.
Best of 1 | Generate an portrait ad on a solid pastel background.

In solid white san serif text, "ChatGPT image generation" in the top left, about a third of the way down.

In solid white san serif text, "Form follows function", in the bottom right, about a third of the way up.

In the background, put a photo of a really sleek, modern sculpture. It should gradually transition from a wireframe sketch on the left to the fully photorealistic version on the right. 

At the very bottom, in medium-small text, say "This entire poster was generated by ChatGPT image generation."
A lone astronaut floats inside a vast space station, painting swirling galaxies onto a massive canvas that hangs weightlessly in the air. Their paintbrush leaves behind trails of cosmic dust, and their suit is stained with nebula-colored hues. Their helmet is off, revealing eyes filled with the reflection of distant planets. Outside the glass window, a black hole looms, twisting light into mesmerizing patterns.
Realistic photograph of a horse galloping from right to left across a vast, calm ocean surface, accurately depicting splashes, reflections, and subtle ripple patterns beneath their hooves. Exaggerate horse movements but everything else should be still, quiet to show contrast with the horse's strength. clean composition, cinematographic. A wide, panoramic composition showcasing a distant horizon. Atmospheric perspective creating depth. zoomed out so the horse appears minuscule compared to vast ocean.

horse is right at the horizon where ocean meets sky. use rule of thirds to position horse. size of horse is 1% size of entire image because camera is so far away from subject. camera view is super close to the ground/ocean like a worm's eye view. horse is galloping right where ocean meets the sky
A realistic underwater scene with dolphins swimming through the windows of an abandoned subway car, with bubbles and detailed water flow accurately simulated.
Photo of a fruit bowl consisting of real fruits mixed with miniature planets (Jupiter, Saturn, Mars, Earth), maintaining realistic reflections, lighting, and shadows consistent with original photo, clean composition, authentic textures, crisp detailed rendering

A candid paparazzi-style photo of Karl Marx hurriedly walking through the parking lot of the Mall of America, glancing over his shoulder with a startled expression as he tries to avoid being photographed. He’s clutching multiple glossy shopping bags filled with luxury goods. His coat flutters behind him in the wind, and one of the bags is swinging as if he’s mid-stride. Blurred background with cars and a glowing mall entrance to emphasize motion. Flash glare from the camera partially overexposes the image, giving it a chaotic, tabloid feel.

Обмеження

Наша модель не є досконалою. Наразі нам відомо про численні обмеження, які ми будемо усувати шляхом вдосконалення моделі після початкового запуску.

Безпека

Відповідно до нашої специфікації моделі, ми прагнемо максимально розширити творчу свободу, підтримуючи такі сценарії використання, як розробка ігор, історичні дослідження та освіта, при цьому зберігаючи сувору відданість стандартам безпеки. У той же час, як і раніше, важливо блокувати запити, які порушують ці стандарти. Нижче наведено оцінки додаткових сфер ризику, в яких ми працюємо над включенням безпечного та корисного контенту та підтримкою ширшого творчого самовираження для користувачів.

Доступ до даних походження через C2PA та внутрішній реверсивний пошук
Усі згенеровані зображення містять метадані C2PA, які ідентифікують зображення як створене за допомогою GPT‑4o, забезпечуючи прозорість. Ми також розробили внутрішній інструмент пошуку, який використовує технічні атрибути генерацій та дозволяє перевіряти, чи був контент створений нашою моделлю.

Блокування небажаного контенту
Ми продовжуємо блокувати запити на генерування зображень, які можуть порушувати нашу політику щодо контенту: наприклад, матеріали з натяком на сексуальне насильство над дітьми та дипфейки відвертого характеру. Коли в контексті знаходяться зображення реальних людей, ми застосовуємо підвищені обмеження щодо того, які зображення можна створити з особливо суворими заходами захисту щодо зображення наготи та графічного насильства. Як і у випадку з будь-яким запуском, робота над безпекою ведеться постійно і постійно потребує інвестицій. У міру того, як ми дізнаватимемося більше про реальне використання цієї моделі, ми відповідним чином коригуватимемо нашу політику.

Щоб дізнатися більше про наш підхід, див. додаток до системної карти GPT‑4o щодо генерації зображень.

Використання міркувань для забезпечення безпеки
Подібно до нашої роботи з усвідомленим узгодженням, ми навчили LLM, засновану на міркуваннях, працювати безпосередньо з написаними людиною та інтерпретованими специфікаціями з безпеки. Ми використовували цю LLM для міркувань під час розробки, щоб виявити та усунути неясності у наших політиках. Разом з нашими мультимодальними досягненнями та існуючими методами безпеки, розробленими для ChatGPT і Sora, це дозволяє нам модерувати як текст, що вводиться, так і отримані зображення відповідно до наших політик.

Доступ

Генерація зображень 4o запускається з сьогоднішнього дня для користувачів Plus, Pro, Team і Free як генератор зображень за замовчуванням у ChatGPT, а незабаром стане доступною для користувачів Enterprise та Edu. Інструмент також можна використовувати у Sora. Для тих, у кого особливе місце в серці займає DALL·E, доступ до інструменту все ще буде можливий через спеціальний DALL·E GPT.

Розробники невдовзі зможуть генерувати зображення за допомогою GPT‑4o через API, доступ до якого буде надано протягом найближчих кількох тижнів.

Створювати та редагувати зображення тепер так само просто, як спілкуватися з GPT‑4o: просто опишіть, що вам потрібно, додавши за бажання такі деталі, як співвідношення сторін, точні кольори з використанням шістнадцяткових кодів або прозоре тло. Ця модель створює більш детальні зображення, тому час рендерингу часто може становити до однієї хвилини.

credit creator: [Alex Duffy](https://every.to/@AlxAi)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: Cassandra Ansara
credit creator: [Isa](https://www.instagram.com/isabelitavirtual/?igsh=ZHdoYjFwYzV6dzFi#)
credit creator: [Isa](https://www.instagram.com/isabelitavirtual/?igsh=ZHdoYjFwYzV6dzFi#)
credit creator: Les Morgan
credit creator: Les Morgan
credit creator: [Derya Unatmaz](https://x.com/deryatr_)
credit creator: [Derya Unatmaz](https://x.com/deryatr_)
credit creator: [Derya Unatmaz](https://x.com/deryatr_)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Eugenio Marongiu](https://www.instagram.com/katsukokoiso.ai/?igsh=YTduZnNjZ2RhdTM3#)
credit creator: [Eugenio Marongiu](https://www.instagram.com/katsukokoiso.ai/?igsh=YTduZnNjZ2RhdTM3#)
credit creator: Jesse Kramme
credit creator: Jesse Kramme
credit creator: Matthew Dear
credit creator: [Minh Do](https://www.instagram.com/minhsmind/?igsh=MTFscDRqZ3JiZHVveA%3D%3D#)
credit creator: [Niceaunties](https://www.instagram.com/niceaunties/?igsh=Nm1jZmV4YTF6MTQ%3D#)
credit creator: Eskcanta
credit creator: Eskcanta
credit creator: [Roope Rainisto](https://www.instagram.com/never_ever_never_land/?igsh=MXh3N3EyOWdoMmNubg%3D%3D#)
credit creator: [Roope Rainisto](https://www.instagram.com/never_ever_never_land/?igsh=MXh3N3EyOWdoMmNubg%3D%3D#)
credit creator: [Roope Rainisto](https://www.instagram.com/never_ever_never_land/?igsh=MXh3N3EyOWdoMmNubg%3D%3D#)
credit creator: Shane Copenhagen
credit creator: Will Maberry
credit creator: Manuel Sainsily
credit creator: Manuel Sainsily
credit creator: Manuel Sainsily
credit creator: Manuel Sainsily
credit creator: Manuel Sainsily

credit creator: Alex Duffy

Запис прямої трансляції

Автор

OpenAI

Лідерство

Габріель Гох: Генерація зображень

Джекі Шеннон: Продукт ChatGPT

Менчао Чжун, Вейн Чанг: Інженерія ChatGPT

Рохан Сахай: Продукт і інженерія Sora

Брендан Квінн, Томер Кафтан: Висновки

Прафулла Дхарівал: Мультимодальна організація

Дослідження

Фундаментальні дослідження

Аллан Джабрі, Девід Медіна, Ґабріель Го, Кендзі Хата, Лу Лю, Прафулла Дхарівал

Основні дослідження

Адітья Рамеш, Алекс Нікол, Кейсі Чу, Чен Лу, Дянь Анг Яп, Хью Джун, Джеймс Беткер, Цзяньфен Ван, Лун Оуян, Лі Цзін, Весам Манасра

Учасники дослідження

Ейден Лоу, Брендон МакКінзі, Чарлі Неш, Хейвен Чанг, Ішаан Гулраджані, Джеймі Кірос, Джі Лін, Кшитідж Гупта, Ян Сонг

Поведінка моделі

Лаврентія Романюк

Мультимодальна організація

Ендрю Гібіанський, Ян Лу

Дані

Ліди по роботі з даними

Гілдас Шабо, Джеймс Парк Леннон

Дані

Арші Бхатнагар, Драгош Опріка, Рохан Кширсагар, Спенсер Папай, Сі-ч'є Ю, Весам Манасра, Ілей Цянь

Модератори

Хейзел Бірн, Дженніфер Лакенбіл, Маріано Лопес

Консультанти з питань людських даних

Лун Оуян

Масштабування

Висновки

Брендан Квінн, Томер Кафтан

Висновки

Алісса Хуанг, Джейкоб Менік, Нік Статас, Руслан Васильєв, Стенлі Шей

Прикладні сфери

Керівник по продукту ChatGPT

Джекі Шеннон

Керівники інженерії ChatGPT

Менчао Чжун, Вейн Чанг

Керівник дизайну продукту

Метт Чан

Наука про дані

Сяолінь Хао

ChatGPT

Ендрю Сіма, Енні Ченг, Бенджамін Гох, Боян Ніу, Дянь Анг Яп, Дюк Тран, Едеде Ойво, Ерік Чжан, Ітан Чанг, Джеффрі Данем, Джей Чен, Кан Ву, Карен Лі, Келлі Стірман, Менг'юань Сюй, Мішель Цінь, Ола Окелола, Педро Агілар, Роккі Сміт, Рохіт Рамчандані, Сара Калвер, Шон Фіцджеральд, Влад Фоменко, Ваннін Цзян, Весам Манасра, Сяолінь Хао, Ілей Цянь

Sora

Лідери продукту Sora

Рохан Сахай, Весам Манасра

Продукція та інженерія Sora

Боян Ню, Девід Шнурр, Гілман Толле, Джо Тейлор, Джої Флінн, Майк Старр, Раджив Наяк, Рохан Сахай, Весам Манасра

Безпека

Керівник з безпеки

Сомай Джайн

Безпека

Алекс Бойтель, Андреа Валлоне, Ботао Хао, Брендан Квінн, Камерон Реймонд, Чонг Чжан, Девід Робінсон, Ерік Воллес, Філіппо Расо, Хуейвен Чанг, Ян Ківлічан, Ірина Кофман, Керен Гу-Лемберг, Крістен Їн, Маделейн Бойд, Меган Шах, Майкл Лампе, Оуен Кемпбелл-Мур, Рохан Сахай, Родріго Ріаза Перес, Сем Тойзер, Сандіні Агарвал, Трой Петерсон

Стратегія

Адам Коен, Адам Веллс, Еллі Беннетт, Ешлі Пантуліано, Кароліна Пас, Клаудія Фішер, Деклан Грабб, Габі Сакрамоне-Лутц, Лорен Джонас, Райан Байєрмейстер, Шао Лі, Том Стазі, Тайс Уолтерс, Зіад Реслан, Зої Столл

Маркетинг і комунікації

Керівники з комунікацій та маркетингу

Міннія Фенг, Наталі Саммерс, Тая Крістіансон

Комунікації

Алекс Бейкер-Віткомб, Ешлі Тайра, Бейлі Річардсон, Габі Раїла, Марселус Кейтон, Скотт Етерсміт, Сукі Мансур

Дизайн та креатив

Ліди

Кендра Римбах, Вейт Меллер

Дизайн

Адам Брендон, Адам Коппель, Анджела Бек, Кері Гадсон, Дана Палмі, Фредді Суліт, Джеффрі Сабін Мацумото, Лейан Ло, Метт Ніколс, Томас Дегрі, Ванесса Антонія Шефке, Яра Хакбаз

Особлива подяка

Адіт'я Рамеш, Ейдан Кларк, Алекс Бойтел, Бен Ньюхаус, Бен Россен, Че Чанг, Грег Брокман, Ханна Вонг, Ішаан Сінгал, Джейсон Квон, Цзячен Фенг, Цзяхуей Ю, Джоан Джанг, Йоханнес Хайдеке, Кевін Вейл, Марк Чен, Міа Глейз, Нік Терлі, Рауль Пурі, Рейчіро Накано, Руї Шу, Сем Альтман, Шучао Бі, Вінні Монако