Memperkenalkan kajian mendalam
Ejen yang menggunakan penaakulan untuk mensintesis sejumlah besar maklumat dalam talian dan menyelesaikan tugas penyelidikan berbilang langkah untuk anda. Tersedia untuk pengguna Pro hari ini, pengguna Plus dan Team seterusnya.
Kemas kini 10 Februari 2026: Anda kini boleh menyambungkan penyelidikan mendalam kepada mana-mana MCP atau aplikasi dan mengehadkan carian web kepada laman yang dipercayai, supaya anda boleh memberi tumpuan kepada sumber yang disahkan dan standard industri. Anda juga kini boleh menjejak kemajuan dalam masa nyata dan menghentikan untuk memperhalusi dengan prom susulan atau sumber baharu. Kami telah mengemas kini pengalaman visual supaya lebih mudah untuk memulakan, menjejak, dan menyemak penyelidikan anda dari awal hingga akhir.
Kemas kini 17 Julai 2025: Penyelidikan mendalam kini boleh menjadi lebih mendalam dan lebih luas dengan akses kepada pelayar visual sebagai sebahagian daripada ejen ChatGPT. Untuk mengakses keupayaan yang dikemas kini ini, hanya pilih “mod ejen” daripada menu lungsur dalam komposer dan masukkan pertanyaan anda secara langsung. Fungsi penyelidikan mendalam asal kekal tersedia melalui pilihan “penyelidikan mendalam” dalam menu alat.
Kemas kini 24 April 2025: Kami meningkatkan dengan ketara kekerapan anda boleh menggunakan penyelidikan mendalam—Pengguna Plus, Team, Enterprise, dan Edu kini mendapat 25 pertanyaan sebulan, pengguna Pro mendapat 250, dan pengguna Percuma mendapat 5. Ini dimungkinkan melalui versi penyelidikan mendalam baharu yang ringan yang dikuasakan oleh versi o4-mini, direka bentuk untuk lebih menjimatkan kos sambil mengekalkan kualiti yang tinggi. Sebaik sahaja anda mencapai had anda untuk versi penuh, pertanyaan anda akan bertukar secara automatik kepada versi ringan.
Kemas kini 25 Februari 2025: Semua pengguna Plus kini boleh menggunakan kajian mendalam.
Kemas kini 5 Februari 2025: Kajian mendalam kini tersedia untuk pengguna Pro di United Kingdom, Switzerland, dan Kawasan Ekonomi Eropah.
Hari ini kami melancarkan penyelidikan mendalam dalam ChatGPT, satu keupayaan ejen baharu yang menjalankan penyelidikan pelbagai langkah di Internet untuk tugas-tugas yang kompleks. Ia menyelesaikan dalam beberapa minit apa yang akan mengambil masa berjam-jam bagi manusia.
Penyelidikan mendalam adalah ejen OpenAI seterusnya yang boleh melakukan kerja untuk anda secara bebas—anda memberikannya prom, dan ChatGPT akan mencari, menganalisis, dan mensintesis ratusan sumber dalam talian untuk mencipta laporan komprehensif pada tahap penganalisis penyelidikan. Dikuasakan oleh versi model OpenAI o3 yang akan datang dan dioptimumkan untuk penyemakan imbas web dan analisis data, ia menggunakan penaakulan untuk mencari, mentafsir, dan menganalisis sejumlah besar teks, imej, dan PDF di Internet, menyesuaikan diri mengikut keperluan sebagai tindak balas kepada maklumat yang ditemuinya.
Keupayaan untuk mensintesis pengetahuan adalah prasyarat untuk mencipta pengetahuan baharu. Atas penaakulan ini, penyelidikan mendalam menandakan langkah penting ke arah matlamat kami yang lebih luas untuk membangunkan AGI, yang telah lama kami bayangkan sebagai mampu menghasilkan penyelidikan saintifik baharu.
Penyelidikan mendalam direka untuk orang yang melakukan kerja pengetahuan intensif dalam bidang seperti kewangan, sains, dasar, dan kejuruteraan serta memerlukan penyelidikan yang menyeluruh, tepat, dan boleh dipercayai. Ia boleh menjadi sama berguna untuk pembeli bijak yang mencari cadangan hiper-peribadi pada pembelian yang biasanya memerlukan penyelidikan teliti, seperti kereta, peralatan, dan perabot. Setiap output didokumentasikan sepenuhnya, dengan petikan yang jelas dan ringkasan pemikirannya, menjadikannya mudah untuk dirujuk dan disahkan maklumatnya. Ia sangat berkesan dalam mencari maklumat khusus dan tidak intuitif yang memerlukan melayari banyak laman web. Penyelidikan mendalam membebaskan masa berharga dengan membolehkan anda menyerahkan dan mempercepat penyelidikan web yang kompleks dan memakan masa dengan hanya satu pertanyaan.
Penyelidikan mendalam secara bebas menemui, membuat penaakulan, dan menyatukan cerapan dari seluruh web. Untuk mencapai ini, ia dilatih pada tugas dunia sebenar yang memerlukan penggunaan alat pelayar dan Python, menggunakan kaedah pembelajaran pengukuhan yang sama di sebalik OpenAI o1, model penaakulan pertama kami. Walaupun o1 menunjukkan keupayaan yang mengagumkan dalam pengekodan, matematik, dan domain teknikal lain, banyak cabaran dunia sebenar memerlukan konteks yang luas dan pengumpulan maklumat daripada pelbagai sumber dalam talian. Penyelidikan mendalam membina keupayaan penaakulan ini untuk merapatkan jurang tersebut, membolehkannya menangani jenis masalah yang dihadapi oleh orang ramai dalam pekerjaan dan kehidupan harian.
Dalam ChatGPT, pilih 'penyelidikan mendalam' dalam komposer mesej dan masukkan pertanyaan anda. Beritahu ChatGPT apa yang anda perlukan — sama ada analisis kompetitif pada platform penstriman atau laporan peribadi mengenai basikal komuter terbaik. Anda boleh melampirkan fail atau hamparan untuk menambah konteks pada soalan anda. Sebaik sahaja ia mula berjalan, bar sisi akan muncul dengan ringkasan langkah-langkah yang diambil dan sumber-sumber yang digunakan.
Penyelidikan mendalam mungkin mengambil masa antara 5 hingga 30 minit untuk menyelesaikan tugasnya, mengambil masa yang diperlukan untuk menyelam jauh ke dalam web. Sementara itu, anda boleh berundur atau mengerjakan tugas lain—anda akan mendapat pemberitahuan setelah penyelidikan selesai. Output akhir tiba sebagai laporan dalam sembang – dalam beberapa minggu seterusnya, kami juga akan menambah imej terbenam, pengvisualan data, dan output analitik lain dalam laporan ini untuk kejelasan dan konteks tambahan.
Berbanding dengan penyelidikan mendalam, GPT‑4o adalah ideal untuk perbualan multimodal masa nyata. Untuk pertanyaan berbilang aspek, domain di mana kedalaman dan perincian adalah kritikal, keupayaan penyelidikan mendalam untuk menjalankan penerokaan yang meluas dan memetik setiap tuntutan adalah perbezaan antara ringkasan cepat dan jawapan yang didokumenkan dengan baik dan mengesahkan yang boleh digunakan sebagai produk kerja.
GPT-4o
Kajian mendalam
Penyelidikan mendalam memberikan respons kepada prom dengan cara yang sangat terperinci, menyediakan data khusus negara secara bersebelahan untuk kedua-dua 10 negara maju teratas dan 10 negara membangun teratas untuk rujukan dan perbandingan yang mudah. Ia menggunakan maklumat tersebut untuk menawarkan cadangan kemasukan pasaran yang terperinci, berinformasi, dan boleh digunakan.
Penyelidikan mendalam telah dilatih menggunakan pembelajaran pengukuhan hujung ke hujung pada tugas penyemakan imbas dan penaakulan sukar merentas pelbagai domain. Melalui latihan itu, ia belajar untuk rancangkan dan melaksanakan lintasan berbilang langkah untuk mencari data yang diperlukannya, menjejaki balik dan bertindak balas terhadap maklumat masa nyata jika perlu. Model ini juga boleh melayari fail yang dimuat naik oleh pengguna, memplot dan mengulangi graf menggunakan alat Python, membenamkan kedua-dua graf yang dijana dan imej daripada laman web dalam responsnya, serta memetik ayat atau petikan tertentu daripada sumbernya. Hasil daripada latihan ini, ia mencapai tahap tertinggi baharu dalam beberapa penilaian awam yang tertumpu kepada masalah dunia sebenar.
Pada Peperiksaan Terakhir Manusia(dibuka dalam tetingkap baru), penilaian yang baharu dikeluarkan yang menguji AI merentas pelbagai subjek dengan soalan peringkat pakar, model yang menggerakkan penyelidikan mendalam mencapai markah tertinggi baharu dengan ketepatan 26.6%. Ujian ini mengandungi lebih 3,000 soalan aneka pilihan dan jawapan pendek merentasi lebih 100 subjek, daripada linguistik hingga sains roket, klasik hingga ekologi. Berbanding dengan OpenAI o1, pencapaian terbesar muncul dalam kimia, kemanusiaan dan sains sosial, serta matematik. Model yang menggerakkan kajian mendalam mempamerkan pendekatan seperti manusia dengan berkesan mencari maklumat khusus apabila diperlukan.
| Model | Ketepatan (%) |
|---|---|
| GPT-4o | 3.3 |
| Grok-2 | 3.8 |
| Claude 3.5 Sonnet | 4.3 |
| Gemini Thinking | 6.2 |
| OpenAI o1 | 9.1 |
| DeepSeek-R1* | 9.4 |
| OpenAI o3-mini (medium)* | 10.5 |
| OpenAI o3-mini (tinggi)* | 13.0 |
| OpenAI deep research** | 26.6 |
Pada GAIA(dibuka dalam tetingkap baru)1, penanda aras awam yang menilai AI pada soalan dunia sebenar, model yang menggerakkan penyelidikan mendalam mencapai tahap terkini (SOTA), mendahului papan pendahulu(dibuka dalam tetingkap baru) luaran. Merangkumi soalan merentasi tiga tahap kesukaran, kejayaan dalam menyelesaikan tugas-tugas ini memerlukan kebolehan seperti penaakulan, kefasihan berbilang modal, penyemakan imbas web, dan kecekapan penggunaan alat.
| GAIA | ||||
|---|---|---|---|---|
| Tahap 1 | Tahap 2 | Tahap 3 | Purata | |
| SOTA sebelumnya(dibuka dalam tetingkap baru) | 67.92 | 67.44 | 42.31 | 63.64 |
| Deep Research (pass@1) | 74.29 | 69.06 | 47.6 | 67.36 |
| Deep Research (cons@64) | 78.66 | 73.21 | 58.03 | 72.57 |
Contoh tugas GAIA
Dalam penilaian dalaman tugas peringkat pakar merentas pelbagai bidang, penyelidikan mendalam dinilai oleh pakar domain telah mengautomasikan beberapa jam penyiasatan manual yang sukar.
Kadar Lulus vs Panggilan Alat Maks
Contoh tugas tahap pakar
Kadar Lulus pada Tugas Peringkat Pakar berdasarkan Anggaran Nilai Ekonomi
Kadar Lulus pada Tugas Peringkat Pakar mengikut Jam Anggaran
Kajian mendalam membuka keupayaan baharu yang signifikan, tetapi masih di peringkat awal dan mempunyai batasan. Kadang-kadang ia boleh berhalusinasi fakta dalam jawapan atau membuat kesimpulan yang salah, walaupun pada kadar yang jauh lebih rendah daripada model ChatGPT sedia ada, menurut penilaian dalaman. Ia mungkin menghadapi kesukaran untuk membezakan maklumat berwibawa daripada khabar angin, dan pada masa ini menunjukkan kelemahan dalam penentukuran keyakinan, sering gagal menyampaikan ketidakpastian dengan tepat. Semasa pelancaran, mungkin terdapat ralat pemformatan kecil dalam laporan dan petikan, dan tugas mungkin mengambil masa yang lebih lama untuk dimulakan. Kami menjangkakan semua isu ini akan bertambah baik dengan cepat dengan lebih banyak penggunaan dan masa.
Kajian mendalam dalam ChatGPT kini sangat intensif dari segi pengiraan. Semakin lama masa yang diambil untuk menyelidik pertanyaan, semakin banyak pengiraan inferens diperlukan. Kami memulakan dengan versi yang dioptimumkan untuk pengguna Pro hari ini, dengan sehingga 100 pertanyaan sebulan. Pengguna Plus dan Team akan mendapat akses seterusnya, diikuti oleh Enterprise. Kami masih berusaha untuk memberikan akses kepada pengguna di United Kingdom, Switzerland, dan Kawasan Ekonomi Eropah.
Semua pengguna berbayar akan segera mendapat had kadar yang jauh lebih tinggi apabila kami melancarkan versi penyelidikan mendalam yang lebih pantas dan kos efektif, dikuasakan oleh model yang lebih kecil tetapi masih memberikan hasil berkualiti tinggi.
Dalam minggu dan bulan yang akan datang, kami akan bekerja pada infrastruktur teknikal, memantau dengan teliti keluaran semasa, dan menjalankan ujian yang lebih ketat. Ini selaras dengan prinsip pelaksanaan berulang kami. Jika semua pemeriksaan keselamatan masih terus memenuhi standard pelepasan kami, kami menjangkakan untuk melancarkan penyelidikan mendalam kepada pengguna Plus dalam masa sebulan.
Penyelidikan mendalam tersedia hari ini di web ChatGPT, dan akan dilancarkan ke apl mudah alih dan desktop dalam bulan ini. Pada masa ini, kajian mendalam boleh mengakses web terbuka dan sebarang fail yang dimuat naik. Pada masa hadapan, anda akan dapat sambungkan kepada sumber data yang lebih khusus—memperluaskan akses kepada sumber berasaskan langganan atau dalaman—untuk menjadikan output lebih kukuh dan diperibadikan.
Melihat lebih jauh ke hadapan, kami membayangkan pengalaman agnetik yang bersatu dalam ChatGPT untuk penyelidikan dan pelaksanaan dunia sebenar secara tak segerak. Gabungan penyelidikan mendalam, yang boleh melakukan penyiasatan dalam talian tak segerak, dan Operator, yang boleh mengambil tindakan dunia sebenar, akan dayakan ChatGPT melaksanakan tugas yang semakin canggih untuk anda.
Tambahan 3 Februari 2025: Kami telah menjalankan ujian keselamatan yang ketat, penilaian kesediaan, dan tinjauan tadbir urus pada versi awal o3 yang menyokong penyelidikan mendalam, mengenal pasti ia sebagai risiko Sederhana(dibuka dalam tetingkap baru). Kami juga telah menjalankan ujian keselamatan tambahan untuk lebih memahami risiko tambahan yang berkaitan dengan keupayaan penyelidikan mendalam untuk melayari web, dan kami telah menambah mitigasi baharu. Kami akan terus menguji dan memantau dengan teliti keluaran terhad semasa. Kami akan berkongsi pandangan keselamatan dan perlindungan kami untuk penyelidikan mendalam dalam kad sistem apabila kami meluaskan akses kepada pengguna Plus.
Nota kaki
- 1
Kami mendapati bahawa jawapan sebenar untuk set data ini telah dibocorkan secara meluas dalam talian dan telah menyekat beberapa laman web atau URL yang berkaitan untuk memastikan penilaian model yang adil.
Penulis
Ketua-ketua Penyelidikan
Isa Fulford, Zhiqing Sun
Penyumbang asas
Alex Tachard Passos, Alexandra Barr, Allison Tam, Charlotte Cole, Hyung Won Chung, Jason Wei, Jon Blackman, Scott Mayer McKinney, Valerie Qi
Penyumbang Teras
Penyelidikan
Elaine Ya Le, Eric Mitchell, Eric Wallace, Hyung Won Chung, Ignasi Clavera, Leo Liu, Lorenz Kuhn, Louis Feuvrier, Max Schwarzer, Saachi Jain, Scottie Yan, Shunyu Yao, Vitchyr Pong
Pasang atur
Carpus Chang, Harry Zhao, Joseph Trasatti, Joshua Dickens, Matt Kaufer, Mike Trpcic, Minnia Feng, Neel Ajjarapu, Peter Vidani, Sean Fitzgerald
Penyumbang
Penyelidikan
Ahmed El-Kishky, AJ Ostrow, Alexander Wei, Andrei Gheorghe, Andrew Kondrich, Andrey Mishchenko, Anuj Nair, Behrooz Ghorbani, Brydon Eastman, Chak Li, Foivos Tsimpourlas, Francis Song, Giambattista Parascandolo, Gildas Chabot, Hessam Bagherinezhad, Haitang Hu, Hongyu Ren, Henry Aspegren, Hunter Lightman, Ilya Kostrikov, Ilge Akkaya, James Lennon, Jean Harb, Jonathan Ward, Kai Chen, Katy Shi, Kevin Liu, Kevin Yu, Manuka Stratta, Marvin Zhang, Mengyuan Yan, Mostafa Rohaninejad, Noam Brown, Phoebe Thacker, Raz Goan, Reah Miyara, Spencer Papay, Taylor Gordon, Wenda Zhou, Wenlei Xie, Yash Patil, Yann Dubois, Youlong Cheng, Yushi Wang, Wyatt Thompson
+ semua penyumbang kepada o3.
Sistem Keselamatan
Adam Kalai, Alex Beutel, Andrea Vallone, Andy Applebaum, David Robinson, Elizabeth Proehl, Evan Mays, Grace Zhao, Irina Kofman, Jason Phang, Joaquin Quinonero Candela, Joel Parish, Kevin Liu, Kristen Ying, Lama Ahmad, Leon Maksin, Leyton Ho, Meghan Shah, Michele Wang, Miles Wang, Phillip Guo, Olivia Watkins, Owen Campbell-Moore, Patrick Chao, Sam Toizer, Samuel Miserendino, Sandhini Agarwal, Tejal Patwardhan, Tina Sriskandarajah, Troy Peterson, Yaodong Yu, Yunyun Wang
Pasang atur
Adam Koppel, Adam Wells, Adele Li, Andy Applebaum, Andrey Malevich, Andrew Duberstein, Andrew Howell, Anton Tananaev, Ashley Tyra, Brandon Walkin, Bryan Ashley, Cary Bassin, Cary Hudson, Cory Decareaux, Cristina Scheau, Derek Chen, Dibya Bhattacharjee, Drea Lopez, Eric Antonow, Eric Burke, Filippo Raso, Fotis Chantzis, Freddie Sulit, Harris Cohen, Heather Whitney, Jay Dixit, Jeffrey Han, Jen Robinson, Jessica Shieh, Joel Parish, Kan Wu, Kevin Gladstone, Kshitij Wadhwa, Leo Vandriel, Leyton Ho, Liang Chen, Madeline Christian, Mamie Rheingold, Matt Jones, Michelle Fradin, Mike McClay, Mingxuan Wang, Nacho Soto, Niko Felix, Patrick Delaney, Paul McMillan, Philip Pronin, Rodrigo Riaza Perez, Samuel Miserendino, Scott Ethersmith, Steven Baldwin, Thomas Dimson, Tomo Hiratsuka, Yaming Lin, Yara Khakbaz, Yining Chen
Kepimpinan
Akshay Nathan, Greg Brockman, Hannah Wong, Jakub Pachocki, Jerry Tworek, Johannes Heidecke, Josh Tobin, Liam Fedus, Mark Chen, Mia Glaese, Nick Turley, Sam Altman, Wojciech Zaremba