پرش به محتوای اصلی
OpenAI

۲۵ آذر ۱۴۰۴

محصولانتشار

تصاویر جدید ChatGPT اینجاست

This post covers an image-generation launch.

در حال بارگذاری…

امروز، نسخه جدیدی از ChatGPT Images را منتشر می‌کنیم که با مدل پرچم‌دار جدید تولید تصویر ما تقویت شده است. حالا، چه در حال ساختن چیزی از ابتداء باشید یا ویرایش یک عکس، نتیجه‌ای که در ذهن دارید را به دست می‌آورید. این برنامه ویرایش‌های دقیقی انجام می‌دهد و در عین حال جزئیاتی مانند ظاهر افراد را دست‌نخورده نگه می‌دارد و تصاویر را تا ۴ برابر سریع‌تر تولید می‌کند. همزمان، ما یک ویژگی جدید تصاویر را در ChatGPT معرفی می‌کنیم که برای لذت‌بخش کردن تولید تصویر طراحی شده است—تا الهام‌بخش باشد و کاوش خلاقانه را آسان کند

مدل و ویژگی جدید تصاویر از امروز در ChatGPT برای همه کاربران عرضه می‌شود و در API به عنوان gpt-image-1.5 ارائه می‌شود.

ویرایش‌های دقیقی که آنچه مهم است را حفظ می‌کنند

حالا، وقتی که درخواست ویرایش یک تصویر بارگذاری‌شده رو می‌کنی، مدل به نیتت به‌طور قابل‌اعتمادتری پایبند می‌مونه—تا جزئیات کوچک—و فقط اون چیزی رو که درخواست کردی تغییر می‌ده، در حالی که عناصری مثل نور پردازی، ترکیب‌بندی و ظاهر افراد رو در ورودی‌ها، خروجی‌ها و ویرایش‌های بعدی ثابت نگه می‌داره.

این قفل‌گشایی نتایجی را که با نیت تو مطابقت دارند، فراهم می‌کند—ویرایش‌های عکس مفیدتر، امتحان لباس و مدل مو باور پذیرتر، به همراه فیلترهای سبکی و تغییرات مفهومی که جوهره تصویر اصلی را حفظ می‌کنند. این بهبودها به این معناست که ChatGPT می‌تواند به عنوان یک استودیوی خلاق در جیبت عمل کند، قادر به انجام ویرایش‌های عملی و بازآفرینی‌های بیانی است.

ویرایش

این مدل در انواع مختلف ویرایش مهارت دارد—از جمله افزودن، کم کردن، ترکیب کردن، مخلوط کردن و جابجا کردن — بنابراین می‌تونی تغییراتی که می‌خوای رو بدون از دست دادن ویژگی‌های خاص تصویر اعمال کنی.

تحولات خلاقانه

خلاقیت مدل از طریق تغییراتی که عناصر را تغییر داده و اضافه می‌کند—مانند متن و چیدمان—برای زنده کردن ایده‌ها در حالی که جزئیات مهم را حفظ می‌کند، می‌درخشد. این تغییرات برای مفاهیم ساده و پیچیده‌تر کار می‌کنند و به راحتی می‌توانید با استفاده از سبک‌ها و ایده‌های از پیش تعیین‌شده در ویژگی جدید تصاویر ChatGPT(در یک پنجره جدید باز می‌شود) امتحان‌شان کنید—بدون نیاز به پیام نوشتاری.

پیروی از دستورالعمل

این مدل به‌طور قابل‌اعتمادتری از دستور العمل‌ها نسبت به نسخه اولیه ما پیروی می‌کند. این امکان ویرایش‌های دقیق‌تر و همچنین ترکیب‌های اصلی پیچیده‌تر را فراهم می‌کند، به‌طوری که روابط بین عناصر همان‌طور که در نظر گرفته شده حفظ می‌شوند.

جدید

draw a 6x6 grid

Make a 6 (columns) by 6 (rows) grid grid of:

Row 1: the Greek letter beta, a beach ball, a lemon, a robot, a fish tank, a frog

Row 2: a praying mantis, an expensive watch, a baththub, a pair of sunglasses, a colorful butterfly, an envelope

Row 3: a stamp, a picture frame, a steaming dumpling, the word "miracle", a pair of skis, the letter Z

Row 4: a toilet, a subway token, a mute icon, a bottle of perfume, a dragonfly, a skateboard helmet

Row 5: a Bluetooth icon, the number 13, a green heart, a rubik's cube, a Canada goose, a soldier's helmet

Row 6: a white dog, a life jacket, a knot, a keyboard, a tissue box, the number 14

chatgpt-images-instruction-following-new

قبلی

draw a 6x6 grid

Make a 6 (columns) by 6 (rows) grid grid of:

Row 1: the Greek letter beta, a beach ball, a lemon, a robot, a fish tank, a frog

Row 2: a praying mantis, an expensive watch, a baththub, a pair of sunglasses, a colorful butterfly, an envelope

Row 3: a stamp, a picture frame, a steaming dumpling, the word "miracle", a pair of skis, the letter Z

Row 4: a toilet, a subway token, a mute icon, a bottle of perfume, a dragonfly, a skateboard helmet

Row 5: a Bluetooth icon, the number 13, a green heart, a rubik's cube, a Canada goose, a soldier's helmet

Row 6: a white dog, a life jacket, a knot, a keyboard, a tissue box, the number 14

chatgpt-images-instruction-following-old

تبدیل متن

مدل یک گام دیگر در رندر متن به جلو می‌رود و قادر به پردازش متن‌های متراکم‌تر و کوچک‌تر است.

بهبودهای بیشتر در کیفیت

این مدل همچنین در ابعاد اضافی که به خروجی‌های بلافاصله قابل استفاده‌تر تبدیل می‌شوند، مانند رندر کردن چهره‌های کوچک متعدد و طبیعی بودن ظاهر خروجی‌ها، بهبود یافته است.

یک فضای جدید برای خلق

علاوه بر تولید تصاویر با توصیف آنچه دوست داری در یک پیام ببینی، ما یک بخش اختصاصی برای تصاویر(در یک پنجره جدید باز می‌شود) در ChatGPT معرفی کرده‌ایم—که از طریق برنامه موبایل و در chatgpt.com در نوار کناری در دسترس است—کاوش و امتحان کردن تصاویر را سریع‌تر و آسان‌تر کن. این شامل ده‌ها فیلتر و درخواست از پیش تعیین‌شده است که برای شروع الهام‌بخشی به‌طور منظم به‌روزرسانی می‌شوند تا روندهای نوظهور را منعکس کنند.

با هم، این ارتقاءها بهت اجازه می‌دهند تصاویری ایجاد کنی که بهتر با چشم‌اندازت مطابقت داشته باشند، از ویرایش‌های کوچک تا بازآفرینی‌های کامل.

تصاویر ChatGPT برای کار

این مدل با تولید سریع‌تر تصاویر، ویرایش‌های دقیق و جزئیات بصری هماهنگ در تکرارها، جریان‌های کاری کسب و کار را ساده‌سازی می‌کند. تیم‌ها می‌توانند ایده‌ها را بررسی کنند، تغییرات هدفمند ایجاد کنند و مفاهیم پیچیده یا خشک را تجسم کنند و از موارد استفاده در بازاریابی، طراحی، تجارت الکترونیک و ارتباطات داخلی پشتیبانی کنند.

بهبودها و محدودیت‌ها

ما بسیاری از مثال‌ها را از راه‌اندازی اولیه تولید تصویرمان دوباره اجراء کردیم تا عملکرد را ارزیابی کنیم. این مدل در موارد مختلف بهبودهای آشکاری نشان می‌دهد، هرچند نتایج هنوز کامل نیستند. در حالی که این نسخه نشان‌دهنده پیشرفت معناداری است، هنوز فضای زیادی برای بهبود در نسخه‌های آینده وجود دارد.

GPT Image 1.5 در API

gpt-image-1.5 در API تمام بهبودهای مشابه در ChatGPT Images را ارائه می‌کند: این مدل در حفظ و ویرایش تصاویر نسبت به GPT Image 1 قوی‌تر است.

تو شاهد حفظ مداوم‌تری از لوگوهای برند و تصاویر کلیدی در ویرایش‌ها خواهی بود—که آن را برای کارهای بازاریابی و برند مانند ایجاد گرافیک و لوگو، و برای تیم‌های تجارت الکترونیک که کاتالوگ‌های کامل تصاویر محصول (انواع، صحنه‌ها و زوایا) را از یک تصویر منبع واحد تولید می‌کنند، مناسب می‌سازد.

ورودی‌ها و خروجی‌های تصویری اکنون در GPT Image 1.5 نسبت به GPT Image 1، ۲۰٪ ارزان‌تر شده‌اند، بنابراین می‌تونی با همون بودجه، تصاویر بیشتری تولید و تکرار کنی.

می‌تونی مدل جدید رو در
OpenAI Playground(در یک پنجره جدید باز می‌شود) امتحان کنی یا برای الهام گرفتن راهنمای پرامپت‌نویسی(در یک پنجره جدید باز می‌شود) رو بخونی.

شرکت‌ها و استارت‌آپ‌ها در صنایع مختلف از جمله ابزارهای خلاقانه، تجارت الکترونیک، نرم‌افزارهای بازاریابی و موارد دیگر، هم‌اکنون از GPT Image 1.5 بهره می‌برند. ما خوشحال می‌شویم که تعدادی از این مثال‌ها را در زیر با شما به اشتراک بگذاریم.

در دسترس بودن

قابلیت جدید تصاویر ChatGPT اکنون برای همه کاربران ChatGPT و کاربران API در سطح جهانی در حال عرضه است. این ویژگی در تمام مدل‌ها کار می‌کند، پس نیازی نیست چیزی رو انتخاب کنی تا ازش استفاده کنی.

ما باور داریم که هنوز در ابتدای مسیری هستیم که تولید تصویر می‌تواند ممکن سازد. به‌روزرسانی امروز یک گام معنادار به جلو است و در آینده، از ویرایش‌های دقیق‌تر تا خروجی‌های غنی‌تر و جزئی‌تر در زبان‌های مختلف، موارد بیشتری در راه خواهد بود.

Author

OpenAI

Contributors

Project Leadership

Gabriel Goh — Research Lead

Adele Li — Product Lead

Bill Peebles — Sora Lead 

Aditya Ramesh — World Simulation Lead

Mark Chen — Chief Research Officer

Prafulla Dhariwal — Multimodal Lead

Core Team 

Alex Fang, Alex Yu, Ben Wang, Bing Liang, Boyuan Chen, Charlie Nash, David Medina, Dibya Bhattacharjee, Jianfeng Wang, Kenji Hata, Kiwhan Song, Mengchao Zhong, Mike Starr, Yuguang Yang

Research Contributors

Bram Wallace, Dmytro Okhonko, Haitang Hu, Kshitij Gupta, Li Jing, Lu Liu, Peter Zhokhov, Qiming Yuan, Senthil Purushwalkam, Yizhen Zhang

Core Inference

Adam Tart, Alyssa Huang, Andrew Braunstein, Jane Park, Karen Li, Tomer Kaftan

Research Collaborators

Aditya Ramesh, Alex Nichol, Andrew Kondrich, Andrew Liu, Benedikt Winter, Bill Peebles, Connor Holmes, Cyril Zhang, Daniel Geng, Eric Mintun, James Betker, Jamie Kiros, Manuka Stratta, Martin Li, Raoul de Liedekerke, Ricky Wang, Ruslan Vasilev, Vladimir Chalyshev, Welton Wang, Wyatt Thompson, Yaming Lin

Inference Collaborators

Jiayu Bai, Kevin King, Stanley Hsieh, Weiyi Zheng

Data & Evaluation

Alexandra Barr, Aparna Dutta, Arshi Bhatnagar, Chao Yu, Charlotte Cole, Dragos Oprica, Emma Tang, Gowrishankar Sunder, Henry Baer, Ian Sohl, James Park Lennon, Jason Xu, Peilin Yang, Somay Jain, Szi-chieh Yu, Wesam Manassra, Xiaolei Zhu, Yilei Qian

Applied

Affonso Reis, Alan Gou, Alexandra Vodopianova, Amandeep Grewal, Andi Liu, Andrew Sima, Angus Fletcher, Antonia Woodford, Arun Eswara, Benny Wong, Bharat Rangan, Boyang Niu, Bridget Collins, Bryan Brandow, Callie Riggins Zetino, Chris Wendel, Ethan Chang, Gilman Tolle, Greg Hochmuth, Ibrahim Okuyucu, Jesse Chand, Jesse Hendrickson, Jiayu Bai, Jimmy Lin, Johan Cervantes, Kan Wu, Liam Esparraguera, Maja Wichrowska, Matthew Ferrari, Murat Yesildal, Nikunj Handa, Nithanth Kudige, Ola Okelola, Osman Khwaja, Peter Argany, Peter Bakkum, Peter Vidani, Richard Zadorozny, Rohan Sahai, Savelii Bondini, Sean Chang, Vickie Duong, Victoria Huang, Xiaolin Hao, Xueqing Li

Safety, Safety Systems, Integrity, Policy & Trust

Abby Fanlo Susk, Adam Wells, Aleah Houze, Annie Cheng, Artyi Xu, Carolina Paz, David Abelman, Femi Alamu, Jay Wang, Jeremiah Currier, Jesika Haria, Mariya Guryeva, Max Burkhardt, Paige Walker, Pedro Aguilar, Rutsu Koshimizu, Sam Toizer, Savannah Heon, Tom Rubin, Tonia Osadebe, Willow Primack, Zoe Stoll

Product Operations, Program Management and Governance

Antonio Di Francesco, Filippo Raso, Grace Wu, Josh Metherd, Ruth Costigan

Legal

Ally Bennett, Tony Song, Tyce Walters

Communications, Marketing, Community, Design & Creative

Akash Iyer, Alex Baker-Whitcomb, Angie Luo, Anne Oburgh, Antonia Richmond, Annie Tsang, Ashley Tyra, Bailey Richardson, Brandon McGraw, Cary Hudson, Dana Palmie, Evan Corrigan, Gaby Raila, Indgila Samad Ali, James Anderson, Jeremy Schwartz, Jordan Liss, Juan Garza, Julie Steele, Kara Zichittella, Karn Piluntanadilok, Kendal Peirce, Kim Baschet, Leah Anise, Livvy Pierce, Maria Clara M. Fleury Osorio, Minnia Feng, Nick Ciffone, Nick Forland, Niko Felix, Paige Ford, Rachel Puckett, Rishabh Aggarwal, Rusty Rupprecht, Souki Mansoor, Tasia Potasinski, Taya Christianson, Vasundhara Mudgil, Whitney Ferris, Yara Khakbaz, Zach Brock, Zoë Silverman

Special Thanks

Amy Yang, Arvin Wu, Avital Oliver, Brandon McKinzie, Chak Li, Chris Lu, David Duxin, Dian Ang Yap, Gabriel Petersson, Guillaume Leclerc, Hazel Byrne, Henry Aspegren, Jennifer Luckenbill, Ji Lin, Joseph Mo, Julius Hochmuth, Liunian (Harold) Li, Long Ouyang, Mariano López, Michael Zhang, Ravi Teja Mullapudi, Suvansh Sanjeev, Varun Shetty, Wenda Zhou

Exec

Fidji Simo, Hannah Wong, Jakub Pachocki, Jason Kwon, Johannes Heidecke, Kate Rouch, Lauren Itow, Mark Chen, Mia Glaese, Nick Ryder, Nick Turley, Prafulla Dhariwal, Sam Altman, Sulman Choudhry