Menambah baik kecerdasan kesihatan dalam ChatGPT
GPT‑5.5 Instant membawa kecerdasan kesihatan termaju kepada lebih ramai orang, dibentuk oleh kemajuan model kami dan penilaian yang diterajui doktor.
Kesihatan ialah salah satu cara paling bermakna orang menggunakan ChatGPT. Setiap minggu, lebih 230 juta orang beralih kepada ChatGPT untuk mendapatkan bantuan dengan soalan kesihatan dan kesejahteraan: memahami maklumat kesihatan, memahami keputusan makmal, bersedia untuk janji temu, mengurus insurans, membina tabiat yang lebih sihat, dan menentukan soalan seterusnya yang patut ditanya.
Dengan GPT‑5.5 Instant, kami melihat satu kemajuan besar dalam cara model mengendalikan soalan kesihatan, dengan penambahbaikan dalam mengenal pasti bila rawatan segera mungkin diperlukan, meminta konteks yang relevan, menjelaskan ketidakpastian, dan menjadikan maklumat yang kompleks lebih mudah difahami. Dalam penilaian kesihatan kami yang paling mencabar, GPT‑5.5 Instant kini berprestasi pada tahap yang setanding dengan model Thinking termaju kami. Oleh sebab ia tersedia kepada pengguna percuma dalam ChatGPT, lebih ramai orang boleh mendapat manfaat daripada penambahbaikan ini. Ini boleh bermakna maklumat kesihatan yang lebih mudah difahami, soalan yang lebih baik untuk ditanya, dan langkah seterusnya yang jelas.
Kemajuan itu mencerminkan peningkatan keupayaan model serta usaha yang diterajui doktor di sebalik penilaian kesihatan kami. Dalam seluruh usaha kami, rangkaian doktor global membantu mentakrifkan rupa respons yang “baik” dalam situasi kesihatan dunia sebenar dengan menyemak contoh respons model, menghuraikan tingkah laku ideal, dan mengenal pasti mod kegagalan. Bekerja dengan doktor memberi kami cara untuk mengukur kemajuan dalam kesihatan dan menambah baik cara ChatGPT memberi respons dari semasa ke semasa.
Dalam kesihatan, kemajuan bermaksud memberikan respons yang tepat, mudah difahami dan berasaskan pertimbangan yang baik: mengenal pasti bila lebih banyak konteks diperlukan, menjelaskan ketidakpastian tanpa melebih-lebihkan keyakinan, dan membantu orang memahami bila perlu mendapatkan rawatan.
Untuk mengukur kemajuan itu, kami menggunakan penilaian khusus kesihatan, termasuk HealthBench dan HealthBench Professional. Penilaian ini menggunakan perbualan kesihatan yang realistik dan rubrik yang ditulis oleh doktor untuk menilai aspek seperti ketepatan, keselamatan, komunikasi, kesedaran konteks, kelengkapan, dan eskalasi yang sesuai.
GPT‑5.5 Instant mencapai prestasi kesihatan yang serupa dengan model termaju terkini kami pada agregat penilaian kesihatan, termasuk HealthBench Professional, dengan peningkatan besar berbanding GPT‑5.3 Instant. 5.5 Instant (dikeluarkan Mei 2026) dan 5.3 Instant (dikeluarkan Mac 2026) tersedia untuk semua pengguna percuma dalam ChatGPT (tertakluk pada had), dan kami menggunakan harga API untuk mengira kos bagi 5.4 Thinking dan 5.5 Thinking.
Sebagai perbandingan lain, kami juga meminta doktor menulis respons untuk perbualan kesihatan yang mewakili situasi sebenar, dengan masa tanpa had dan akses kepada internet (tetapi bukan AI). Panel doktor yang berasingan kemudian membandingkan respons doktor ini dengan model Instant dari semasa ke semasa, menyemak aspek yang penting dalam interaksi sebenar, termasuk ketepatan, komunikasi, kelengkapan, pematuhan arahan dan kegunaan dalam keputusan kesihatan, merentas 3500 respons yang disemak.
Respons GPT‑5.5 Instant dinilai lebih tinggi berbanding respons yang ditulis oleh doktor dan respons model lama merentas dimensi dalam penilaian ini.
Doktor menilai respons GPT‑5.5 Instant sebagai mempunyai lebih sedikit mod kegagalan berbanding respons daripada model lama dan doktor. Contohnya, GPT 5.5 Instant mempunyai lebih sedikit keadaan berbanding model lama dan doktor dalam isu seperti tidak menyesuaikan respons dengan konteks penjagaan kesihatan setempat, terlepas tanda amaran atau rujukan kepada rawatan, atau gagal mendapatkan konteks tambahan daripada pengguna apabila diperlukan.
Memandangkan skala penggunaan model kami dalam kesihatan, satu lagi cara untuk memahami penambahbaikan model terkini ialah mengukur trafik produksi. Kami menggunakan pemantau yang memelihara privasi pada trafik produksi untuk menjejaki kemungkinan isu kefaktaan dalam respons kesihatan. Berdasarkan perbandingan trafik produksi terkini dalam kesihatan—berbilion-bilion mesej seminggu—kadar respons dengan sekurang-kurangnya satu isu kefaktaan yang ditandakan telah menurun sebanyak 71% dalam dua bulan lalu.
Membandingkan respons daripada model pada detik masa yang berbeza merentas soalan kesihatan dunia sebenar menunjukkan bagaimana ChatGPT telah bertambah baik dalam perkara yang penting untuk kesihatan: mengenal pasti bila sesuatu situasi mungkin memerlukan perhatian segera, mengendalikan ketidakpastian dengan pertimbangan yang lebih baik, dan memberi orang panduan yang lebih jelas serta lebih berguna tentang perkara yang perlu dilakukan seterusnya.
GPT-5.2 Instant
Klik nama model untuk melihat respons model tambahan.
Kemajuan ini dibentuk oleh doktor yang membantu kami mentakrif, mengukur dan menambah baik respons kesihatan dalam ChatGPT.
OpenAI bekerjasama dengan rangkaian global yang terdiri daripada lebih 260 doktor merentas 60 negara, 49 bahasa dan 26 kepakaran perubatan. Maklum balas mereka membentuk cara ChatGPT memberi respons kepada soalan kesihatan merentas pelbagai senario, daripada soalan kesejahteraan harian hingga situasi klinikal yang lebih kompleks.
Doktor menyemak contoh respons model dan menilai sama ada respons itu tepat, jelas, lengkap, cukup berhati-hati dan berguna. Mereka membantu mengenal pasti tempat respons mungkin terlepas konteks penting, kedengaran terlalu yakin, perlu lebih jelas tentang langkah seterusnya, atau perlu lebih langsung menggalakkan seseorang mendapatkan rawatan perubatan.
Setakat ini, doktor telah menyemak lebih 700,000 contoh respons model yang mencerminkan cara klinisian dan pesakit mungkin menggunakan ChatGPT dalam dunia sebenar. Setiap beberapa minit, seorang doktor menyemak respons baharu. Maklum balas mereka menjadi rubrik dan kriteria penilaian yang membantu penyelidik mengukur sama ada respons itu tepat, selamat, jelas, lengkap, cukup berhati-hati dan berguna dalam situasi kesihatan dunia sebenar. Ini memberi kami cara yang lebih jelas untuk melihat di mana model semakin baik dan di mana ia masih perlu diperbaiki.
Kerja ini juga menyokong usaha OpenAI yang lebih luas dalam kesihatan, merangkumi alat yang membantu orang lebih memahami dan menavigasi maklumat kesihatan serta alat yang dibina untuk klinisian, seperti ChatGPT for Clinicians dan OpenAI for Healthcare, yang menyokong profesional perubatan dengan tugas seperti dokumentasi, penyelidikan dan konsultasi penjagaan.
Meningkatkan kesihatan manusia akan menjadi salah satu impak AGI yang paling peribadi dan nyata. Apabila model kami terus bertambah baik, matlamat kami adalah menjadikan ChatGPT lebih tepat, lebih berhati-hati dan lebih berguna pada saat-saat itu — serta terus membawa kemajuan tersebut kepada lebih ramai orang.


