Lumaktaw sa pangunahing content
OpenAI

Hunyo 26, 2026

ProduktoPaglabas

Preview ng GPT‑5.6 Sol: isang susunod-na-henerasyong modelo

Naglo-load…

Nagsisimula kami ng limitadong preview ng seryeng GPT‑5.6: Sol, ang aming pangunahing modelo; Terra, isang balanseng modelo para sa pang-araw-araw na trabaho; at Luna, isang mabilis at abot-kayang modelo. Ang Terra ay may performance na maikukumpara sa GPT‑5.5 habang 2x na mas mura, at naghahatid ang Luna ng malakas na capability sa pinakamababang gastos namin.

Inilulunsad ang GPT‑5.6 Sol kasama ang pinakamatatag naming safety stack hanggang ngayon. Pinalakas namin ang mga proteksiyon para sa mas mataas na risk na aktibidad, sensitibong cyber request, at paulit-ulit na misuse, at gumugol ng ilang linggo sa paghahanap ng mga kahinaan, pressure-testing sa aming system, at pagpapatibay nito laban sa real-world attacks.

Naniniwala kami sa malawak na access, at plano naming gawing generally available ang GPT‑5.6 Sol, Terra, at Luna sa mga darating na linggo. Bilang bahagi ng patuloy naming pakikipag-ugnayan sa pamahalaan ng U.S., ipinakita namin nang maaga ang aming mga plano at ang capabilities ng mga modelo bago ang launch ngayon. Sa kanilang kahilingan, nagsisimula kami sa limitadong preview para sa maliit na grupo ng mga pinagkakatiwalaang partner na ang paglahok ay naibahagi sa pamahalaan, bago ang mas malawak na release. Sa panahon ng preview na ito, patuloy kaming susubok at makikipag-coordinate nang malapit sa mga partner habang nagtatrabaho kami tungo sa mas malawak na availability. Hindi kami naniniwalang dapat maging pangmatagalang default ang ganitong uri ng proseso ng government access. Inilalayo nito ang pinakamahusay na tools mula sa mga user, developer, enterprise, cyber defender, at global partner na nangangailangan ng mga ito. Ginagawa namin ang panandaliang hakbang na ito dahil naniniwala kaming ito ang pinakamalakas na landas patungo sa mas malawak na availability sa mga darating na linggo, habang nakikipagtulungan kami sa Administration para bumuo ng cyber Executive Order framework at isang nauulit na proseso para sa mga release ng modelo sa hinaharap.

Mga capability

Ang GPT‑5.6 Sol ang pinakamalakas naming modelo hanggang ngayon. Para magbigay ng preview ng performance ng modelo, ibinabahagi namin ang isang hanay ng evaluations na nagpapakita ng pinahusay na agentic capabilities sa coding, biology, at cybersecurity, na may karagdagang safety at preparedness evaluations na available sa aming card ng system(magbubukas sa bagong window). Magbabahagi kami ng mas pinalawak na suite ng evaluation results kapag ginawa naming malawak na available ang modelo.

Sa GPT‑5.6, ipinapakilala namin ang bagong `max` na antas ng pangangatwiran upang bigyan ang Sol ng pinakamaraming oras para mangatwiran nang malalim. Bukod dito, ipinapakilala namin ang bagong `ultra` mode na lumalampas sa capabilities ng isang agent sa pamamagitan ng paggamit ng mga subagent para pabilisin ang kumplikadong trabaho.

Para sa coding workflows, nagtatakda ang GPT‑5.6 Sol ng bagong state of the art sa Terminal‑Bench 2.1, na sumusubok sa command-line workflows na nangangailangan ng pagpaplano, pag-uulit, at koordinasyon ng tool.

Nagpapakita rin ang GPT‑5.6 Sol ng malawak na pagbuti sa biology workflows. Sa GeneBench v1, na sumusuri sa long-horizon genomics at quantitative-biology analyses, nakakamit nito ang mas malalakas na resulta kaysa GPT‑5.5 habang gumagamit ng mas kaunting token.

Ang GPT‑5.6 Sol ang pinaka-capable naming modelo hanggang ngayon para sa cybersecurity. Inuusog nito ang performance-efficiency frontier para sa long-horizon security tasks kabilang ang vulnerability research at exploitation. Sa ExploitBench², nakikipagsabayan ang GPT‑5.6 Sol sa Mythos Preview gamit lamang ang ~1/3 ng mga output token. Sa ExploitGym(magbubukas sa bagong window)3, isang benchmark na ginawa ng mga researcher ng UC Berkeley sa pakikipagtulungan sa OpenAI at iba pang frontier labs, ang mga modelo ng GPT‑5.6 Sol, Terra, at Luna ay pawang nagpapakita ng malalakas na pagbuti sa cyber capabilities habang dinaragdagan namin ang pangangatwiran.

Mas malalakas na cyber capability na may mas malalakas na safeguard

Binuo namin ang GPT‑5.6 Sol, Terra at Luna gamit ang pinakamatatag naming mga safeguard hanggang ngayon, na may mga configuration na itinugma sa capabilities ng bawat modelo. Habang nagiging mas capable ang modelo, nagdidisenyo kami ng mga safeguard na mas kayang tumagal laban sa real-world adversarial pressure habang pinapanatili ang access sa lehitimong trabaho gaya ng code review, vulnerability research, patch development, debugging, security education, at defensive testing. Layunin naming gawing mas mahirap, hindi tiyak, at detectable ang ipinagbabawal na offensive activity nang hindi kinakailangang nililimitahan ang mga kapaki-pakinabang na paggamit na iyon. Batay sa aming pagtatasa sa modelo at mga safeguard, inaasahan namin ang malaking benepisyo para sa lehitimong defensive work, habang makabuluhang nililimitahan ang ipinagbabawal na offensive use.

Mas mahusay ang GPT‑5.6 Sol sa pagtulong sa mga tao na makahanap at mag-ayos ng vulnerabilities kaysa sa maaasahang pagsasagawa ng end-to-end attacks. Habang patuloy na sumusulong ang capabilities na ito, prayoridad naming tiyaking makarating at makinabang dito ang mga defender, na magagamit ang mga tool na ito para maghanap ng kahinaan, bumuo ng patches, at mas malawak na palakasin ang systems.

Hindi lumalampas ang GPT‑5.6 Sol sa Cyber Critical threshold sa ilalim ng aming Preparedness Framework. Sa evaluations na kinasasangkutan ng Chromium at Firefox, natukoy nito ang mga bug at exploitation primitive—ang mga building block ng isang exploit—ngunit hindi ito autonomously nakagawa ng functional full-chain exploit sa ilalim ng mga kondisyong sinubok. Gayunpaman, hindi kayang saklawin ng benchmark thresholds ang bawat paraan ng paggamit sa isang modelo o pagsasama nito sa iba pang tool. Ang kawalang-katiyakang iyon, kasama ang mas malawak na step change sa capabilities ng modelo, ang dahilan kung bakit ipinapares namin ang mas mataas na capabilities ng modelo sa mas malalakas na safeguard at phased release. Nagbabahagi kami ng higit pang detalye tungkol sa aming mga safeguard sa GPT‑5.6 Preview card ng system(magbubukas sa bagong window).

Isang layered na safeguard stack

Walang iisang safeguard ang sapat laban sa determinadong o adaptive na misuse. Sa buong preview ng GPT‑5.6, gumagamit kami ng layered safeguards, na nag-iiba ang eksaktong configurations sa iba’t ibang modelo, at pini-pressure-test ang mga ito para sa real-world attacks. Kabilang dito ang mga proteksiyong itinrain sa modelo, real-time checks habang nagge-generate, account-level signals, differentiated access, monitoring, enforcement, at patuloy na testing.

Sinasanay ang GPT‑5.6 na tumanggi sa ipinagbabawal na cyber assistance, kabilang kapag sinusubukan ng mga user na itago ang kanilang layunin o i-jailbreak ang modelo. Itinatakda ng mga model-level safeguard na ito ang unang hangganan sa kung ano ang dapat at hindi dapat tulungan ng modelo.

Nagbibigay ang real-time cyber at biology misuse classifiers ng isa pang layer sa pamamagitan ng pagsusuri sa output habang ito ay ginagawa. Para sa mas mataas na risk na mga kaso, kung makakita sila ng posibleng paglabag, maaaring i-pause ang generation habang sinusuri ng mas malaking nangangatwirang modelo ang pag-uusap at ang konteksto nito. Kung natasa ang output bilang hindi pinapayagan, pinipigil ito bago ito makarating sa user.

Maaari ring mag-trigger ang na-flag na aktibidad ng account-level review sa mga kaugnay na pag-uusap at risk signals, alinsunod sa aming terms at policies tungkol sa content retention at review. Ang pagtingin nang lampas sa isang pag-uusap ay tumutulong sa aming mga system na matukoy ang pagkakaiba ng persistent malicious behavior at lehitimong dual-use security work, kung saan maaaring lumitaw ang magkaparehong technical concepts sa magkaibang-magkaibang konteksto.

Kapag pinagsama, ginagawa ng mga layer na ito na mas matatag ang kabuuang approach kaysa alinmang isang safeguard lamang. Binabawasan ng behavior ng modelo ang posibilidad ng mapaminsalang tugon, maaaring mamagitan ang real-time systems habang nagge-generate, maaaring tukuyin ng account-level review ang mas malalawak na pattern, at pinapanatili ng differentiated access ang mahalagang defensive work nang hindi ginagawang broadly available by default ang pinakasensitibong capabilities.

Lalo na sa panahon ng preview, maaaring makaranas ang mga user ng mga safeguard na nagba-block o tumatanggi sa ilang request. Maaaring mas tumagal ang ibang request dahil naka-pause ang generation para sa karagdagang review. Paminsan-minsan, maaaring mamagitan ang mga safeguard sa lehitimong trabaho, lalo na sa mga dual-use na larangan kung saan maaaring magmukhang magkatulad sa simula ang defensive at offensive activity.

Bahagi iyon ng idinisenyo para subukin ng preview. Nais naming maunawaan hindi lamang kung nalilimitahan ng mga safeguard ang misuse, kundi kung kaya pa ring tapusin ng lehitimong users ang karaniwang trabaho nang maaasahan at mahusay. Makakatulong ang feedback sa panahon ng preview para mabawasan ang hindi kinakailangang blocks at delays, mapahusay kung paano binibigyang-kahulugan ng mga safeguard ang konteksto, at makalikha ng mas maayos na karanasan bago ang mas malawak na release.

Nakikipagtulungan din kami sa enterprise customers sa mas pangmatagalang approaches—kabilang ang privacy-preserving detection, customer-operated safety controls, at access na naka-calibrate sa risk ng isang customer, user, o workload—upang isulong ang safety habang sinusuportahan ang enterprise privacy requirements.

Pagpapahusay ng tibay gamit ang automated red-teaming

Kailangan ding manatiling epektibo ang mga safeguard kapag binabago ng mga attacker ang kanilang mga taktika. Hindi sapat ang tibay ng proteksiyong gumagana lamang sa isang nakapirming hanay ng mga kilalang pag-atake para sa isang frontier na modelo.

Kaya mas maraming intelligence at compute kaysa dati ang inilalapat namin sa safety, gamit ang sarili naming mga modelo para mas mabilis na makahanap ng kahinaan at mapahusay ang mga safeguard. Naglaan kami ng mahigit 700,000 A100-equivalent GPU hours sa automated red teaming na naglalayong makahanap ng mga universal jailbreak: mga pag-atakeng maaaring gumana sa maraming prompt o konteksto, hindi lang sa isang makitid na setting. Sa pagtutok sa mas mahihirap at mas pangkalahatang pag-atakeng ito, nasubok namin ang mga safeguard nang lampas sa nakapirming hanay ng mga kilalang failure. Nagbibigay-daan din ito sa amin na tuklasin ang mas maraming pattern ng pag-atake kaysa kayang saklawin ng human testing lamang, mas maagang matukoy ang mga pattern ng failure, at paikliin ang proseso mula sa paghahanap ng kahinaan hanggang sa pagtugon dito.

Bukod sa automated red-teaming, nakipagtulungan kami sa mga third-party tester para magsagawa ng malawakang human expert red teaming, na magpapatuloy sa panahon ng preview. Kinukumpleto ng human red-teaming ang automated na gawain sa pamamagitan ng pagsubok sa mga safeguard laban sa malikhaing mga eksperto na sumusubok abusuhin ang modelo sa mga paraang maaaring hindi mahulaan ng aming mga system.

Walang evaluation ang makakatawan sa bawat configuration ng produkto, multi-step na pag-atake, o real-world workflow. Kaya nagpapanatili kami ng mabilisang proseso para i-reproduce, tasahin, unahin, at ayusin ang mga bagong natuklasang jailbreak, pagkatapos ay idagdag ang mga ito sa aming patuloy na evaluations upang masubok namin ang katulad na mga failure sa hinaharap.

Availability at presyo

Sa panahon ng preview, ang mga modelo ng GPT‑5.6 ay unang magiging available sa pamamagitan ng API at Codex sa piling grupo ng mga pinagkakatiwalaang partner at organisasyon. Plano naming gawing mas malawak na available ang mga ito sa mga taong gumagamit ng ChatGPT, Codex, at API sa lalong madaling panahon.

Sa bagong naming system na ito na ipinakilala sa GPT‑5.6, tinutukoy ng numero ang henerasyon ng modelo, habang tinutukoy ng Sol, Terra, at Luna ang matitibay na tier ng capability na maaaring umusad sa sarili nilang bilis. Bilang isang pamilya, nagbibigay ito sa mga tao at developer ng mas malinaw na pagpipilian sa intelligence, bilis, at gastos.

Ang GPT‑5.6 ay pinipresyuhan kada 1M token sa tatlong laki ng modelo: Sol ay $5 input / $30 output; Terra ay $2.50 input / $15 output; at Luna ay $1 input / $6 output. Ipinapakilala rin ng GPT‑5.6 ang mas predictable na prompt caching, kabilang ang suporta para sa explicit cache breakpoints at 30-minutong minimum cache life. Para sa GPT‑5.6 at mga susunod na modelo, sinisingil ang cache writes sa 1.25x ng uncached input rate ng modelo, habang patuloy na tumatanggap ang cache reads ng 90% cached-input discount.

Ilulunsad din namin ang GPT‑5.6 Sol sa Cerebras sa bilis na hanggang 750 token kada segundo sa Hulyo, na nagdadala ng frontier intelligence sa mga customer sa walang kapantay na bilis. Sa simula, magiging limitado ang access sa piling customer habang pinapalawak namin ang kapasidad.

Nasasabik kaming patuloy na matuto mula sa panahon ng preview na ito, at dalhin ang GPT‑5.6 Sol, Terra at Luna sa mas maraming tao sa lalong madaling panahon.


1. Tinatantiya namin ang latency at gastos sa API sa pamamagitan ng pagtingin sa production behavior ng aming mga modelo, at pag-simulate offline. Isinasaalang-alang ng mga tantiyang ito ang mga detalye ng tool call, sampled tokens, at input tokens. Maaaring malaki ang ibahin ng real-world results, at nakadepende ang mga ito sa maraming salik na hindi nakuha sa aming simulation. Sine-simulate namin ang latency sa mabilis na API speeds, at ang gastos sa regular na API pricing.

2. Sinusuri ang lahat ng modelo gamit ang ExploitBench API harness na may 5 seed at reasoning continuity.

3. Pinatakbo namin ang ExploitGym sa aming alpha API, na naglalabas ng mga tugon nang mas mabilis kaysa sa aming public API, at pagkatapos ay ni-rescale upang tumugma sa aming public API. Kapag ni-rescale ang mga latency sa bilis na inaasahan para sa aming public API, nagdudulot ito na lumampas ang ilang tinantiyang latency sa 2h at 6h hour time limits, kahit tama itong nasunod sa evaluation run. Para makakuha ng mas mabilis na bilis para sa time-sensitive na trabaho, nag-aalok kami ng priority processing⁠ sa API at fast mode⁠ sa Codex.

4. Ang mga modelong walang iniulat na output token, latency, o gastos ay ipinapakita bilang mga horizontal dotted line.

May-akda

OpenAI