Hari ini, kami melancarkan GPT‑5.4 mini dan nano, model kecil kami yang paling berkemampuan setakat ini. Model-model ini membawa banyak kekuatan GPT‑5.4 kepada model yang lebih pantas dan cekap yang direka untuk beban kerja berjumlah besar.
GPT‑5.4 mini meningkatkan dengan ketara berbanding GPT‑5 mini dalam pengekodan, penaakulan, pemahaman multimodal, dan penggunaan alat, sambil berjalan lebih daripada 2x lebih pantas. Ia juga menghampiri prestasi model GPT‑5.4 yang lebih besar pada beberapa penilaian, termasuk SWE-Bench Pro dan OSWorld-Verified.
GPT‑5.4 nano ialah versi GPT‑5.4 yang terkecil dan termurah untuk tugasan di mana kelajuan dan kos adalah paling penting. Ia juga merupakan penaiktarafan yang ketara berbanding GPT‑5 nano. Kami mengesyorkannya untuk pengelasan, pengekstrakan data, pemeringkatan, dan sub ejen pengekodan yang menguruskan tugas sokongan yang lebih mudah.
Model-model ini dibina untuk jenis beban kerja di mana kependaman secara langsung membentuk pengalaman produk: pembantu pengekodan yang perlu terasa responsif, subejen yang cepat melengkapkan tugas sokongan, sistem penggunaan komputer yang menangkap dan mentafsir tangkapan skrin, dan aplikasi multimodal yang boleh membuat penaakulan ke atas imej dalam masa nyata. Dalam tetapan ini, model terbaik selalunya bukan yang terbesar—ia ialah yang boleh memberikan respons dengan pantas, menggunakan alat dengan boleh dipercayai, dan masih berprestasi baik pada tugas profesional yang kompleks.
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| SWE-Bench Pro (Public) | 57.7% | 54.4% | 52.4% | 45.7% |
| Terminal-Bench 2.0 | 75.1% | 60.0% | 46.3% | 38.2% |
| Toolathlon | 54.6% | 42.9% | 35.5% | 26.9% |
| GPQA Diamond | 93.0% | 88.0% | 82.8% | 81.6% |
| OSWorld-Verified | 75.0% | 72.1% | 39.0% | 42.0% |
1 Nilai reasoning_effort tertinggi yang tersedia untuk GPT‑5 mini ialah “high”.
Inilah pendapat pelanggan kami selepas menguji GPT‑5.4 mini dan nano dalam aliran kerja mereka:
“GPT-5.4 mini memberikan prestasi hujung-ke-hujung yang kukuh untuk sebuah model dalam kelas ini. Dalam penilaian kami, ia menyamai atau melebihi model yang bersaing pada beberapa tugasan output dan ingat semula petikan pada kos yang jauh lebih rendah. Ia juga mencapai kadar lulus hujung-ke-hujung yang lebih tinggi dan atribusi sumber yang lebih kukuh berbanding model GPT-5.4 yang lebih besar."
GPT‑5.4 mini dan nano amat berkesan dalam aliran kerja pengekodan yang mendapat manfaat daripada iterasi pantas. Model ini mengendalikan suntingan yang disasarkan, navigasi pangkalan kod, penjanaan front-end, dan kitaran nyahpepijat dengan kependaman rendah, menjadikannya sangat sesuai untuk tugas pengekodan yang perlu disiapkan dengan lebih cepat pada kos yang lebih rendah.
Dalam penanda aras, GPT‑5.4 mini secara konsisten mengatasi GPT‑5‑mini pada kependaman yang serupa dan menghampiri tahap GPT‑5.4 kadar lulus sambil berjalan jauh lebih pantas, memberikan salah satu pertukaran prestasi-berbanding-latensi yang paling kuat untuk aliran kerja pengekodan.
Kami menganggarkan kependaman dengan melihat tingkah laku pengeluaran model kami dan mensimulasikannya secara luar talian. Anggaran kependaman mengambil kira tempoh panggilan alat (masa pelaksanaan kod), token yang disampel dan token input. Kependaman dunia sebenar mungkin berbeza dengan ketara dan bergantung pada banyak faktor yang tidak ditangkap dalam simulasi kami. Begitu juga, kos dianggarkan berdasarkan harga API bagi model-model ini pada masa penulisan. Kos mungkin berubah pada masa hadapan. Usaha penaakulan telah diubah daripada rendah kepada xhigh.
GPT‑5.4 mini juga sangat sesuai untuk sistem yang menggabungkan model dengan saiz yang berbeza. Dalam Codex, sebagai contoh, sebuah model yang lebih besar seperti GPT‑5.4 boleh mengendalikan perancangan, penyelarasan dan pertimbangan akhir, sambil mendelegasikan kepada subejen mini GPT‑5.4 yang mengendalikan subtugas yang lebih sempit secara selari—seperti mencari dalam pangkalan kod, menyemak fail besar atau memproses dokumen sokongan. Ketahui bagaimana subejen berfungsi dalam Codex dalam dokumen(dibuka dalam tetingkap baru).
Corak ini menjadi lebih berguna apabila model yang lebih kecil menjadi lebih pantas dan lebih berkebolehan. Daripada menggunakan satu model untuk semua, pembangun boleh menyusun sistem di mana model yang lebih besar memutuskan apa yang perlu dilakukan dan model yang lebih kecil melaksanakan dengan pantas pada skala. GPT‑5.4 mini ialah model mini paling berkeupayaan kami setakat ini untuk gaya aliran kerja tersebut.
GPT‑5.4 mini juga kuat dalam tugasan multimodal, terutamanya yang berkaitan dengan penggunaan komputer. Model boleh mentafsir dengan pantas tangkapan skrin antara muka pengguna yang padat untuk melengkapkan tugasan penggunaan komputer dengan pantas. Di OSWorld-Verified, GPT‑5.4 mini menghampiri GPT‑5.4 sambil jauh mengatasi GPT‑5 mini.
GPT‑5.4 mini boleh didapati hari ini dalam API, Codex, dan ChatGPT.
Dalam API, GPT‑5.4 mini menyokong input teks dan imej, penggunaan alat, pemanggilan fungsi, carian web, carian fail, penggunaan komputer, dan kemahiran. Ia mempunyai tetingkap konteks 400k dan berharga $0.75 per 1 juta token input dan $4.50 per 1 juta token output.
Dalam Codex, GPT‑5.4 mini tersedia merentas apl Codex, CLI, sambungan IDE dan web. Ia hanya menggunakan 30% daripada GPT‑5.4 kuota, membolehkan pembangun mengendalikan tugas pengekodan yang lebih mudah dengan cepat dalam Codex pada kira-kira satu pertiga daripada kos. Codex juga boleh mendelegasikan kepada subejen mini GPT‑5.4 supaya kerja yang kurang intensif dari segi penaakulan dijalankan pada model yang lebih murah.
Dalam ChatGPT, GPT‑5.4 mini tersedia untuk pengguna Free dan Go melalui ciri “Thinking” dalam + menu. Untuk semua pengguna lain, GPT‑5.4 mini tersedia sebagai sandaran had kadar untuk GPT‑5.4 Thinking.
GPT‑5.4 nano hanya tersedia dalam API dan berharga $0.20 bagi setiap 1J token input dan $1.25 bagi setiap 1J token output.
Untuk maklumat lanjut tentang langkah perlindungan model, sila lihat tambahan kad sistem di Deployment Safety Hub(dibuka dalam tetingkap baru) kami.
Coding
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| SWE-bench Pro (Public) | 57.7% | 54.4% | 52.4% | 45.7% |
| Terminal-Bench 2.0 | 75.1% | 60.0% | 46.3% | 38.2% |
Tool-calling
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| MCP Atlas | 67.2% | 57.7% | 56.1% | 47.6% |
| Toolathlon | 54.6% | 42.9% | 35.5% | 26.9% |
| τ2-bench (telecom) | 98.9% | 93.4% | 92.5% | 74.1% |
Intelligence
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| GPQA Diamond | 93.0% | 88.0% | 82.8% | 81.6% |
| HLE w/ tool | 52.1% | 41.5% | 37.7% | 31.6% |
| HLE w/o tools | 39.8% | 28.2% | 24.3% | 18.3% |
MM / Vision / CUA
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| OSWorld-Verified | 75.0% | 72.1% | 39.0% | 42.0% |
| MMMUPro w/ Python | 81.5% | 78.0% | 69.5% | 74.1% |
| MMMUPro | 81.2% | 76.6% | 66.1% | 67.5% |
| OmniDocBench 1.5 (no tools)² — lower is better | 0.109 | 0.1263 | 0.2419 | 0.1791 |
Long context
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| OpenAI MRCR v2 8-needle 64K–128K | 86.0% | 47.7% | 44.2% | 35.1% |
| OpenAI MRCR v2 8-needle 128K–256K | 79.3% | 33.6% | 33.1% | 19.4% |
| Graphwalks BFS 0K–128K | 93.1% | 76.3% | 73.4% | 73.4% |
| Graphwalks parents 0–128K (accuracy) | 89.8% | 71.5% | 50.8% | 64.3% |
1 Nilai reasoning_effort tertinggi yang tersedia untuk GPT‑5 mini ialah “high”.
2 Jarak Suntingan Keseluruhan. OmniDocBench dijalankan dengan reasoning_effort ditetapkan kepada 'none' untuk mencerminkan prestasi kos rendah dan kependaman rendah.


