Po nisim një paraafishim të kufizuar të serisë GPT‑5.6: Sol, modeli ynë kryesor; Terra, një model i balancuar për punën e përditshme; dhe Luna, një model i shpejtë dhe i përballueshëm. Terra ka performancë konkurruese me GPT‑5.5 ndërkohë që është 2 herë më e lirë, ndërsa Luna sjell aftësi të forta me koston tonë më të ulët.
GPT‑5.6 Sol prezantohet me paketën tonë më të qëndrueshme të sigurisë deri më sot. Forcuam mbrojtjet për aktivitetet me rrezik më të lartë, kërkesat kibernetike të ndjeshme dhe keqpërdorimin e përsëritur, dhe kaluam disa javë duke gjetur dobësi, duke ushtruar presion mbi sistemin tonë dhe duke e fortifikuar ndaj sulmeve në botën reale.
Ne besojmë tek aksesi i gjerë dhe planifikojmë t’i bëjmë GPT‑5.6 Sol, Terra dhe Luna përgjithësisht të disponueshme në javët në vijim. Si pjesë e angazhimit tonë të vazhdueshëm me qeverinë e SHBA-së, ne prezantuam paraprakisht planet tona dhe aftësitë e modeleve përpara prezantimit të sotëm. Me kërkesën e tyre, po e nisim me një paraafishim të kufizuar për një grup të vogël partnerësh të besuar, pjesëmarrja e të cilëve i është komunikuar qeverisë përpara se ta publikojmë më gjerësisht. Gjatë këtij paraafishimi, do të vazhdojmë testimin dhe koordinimin e ngushtë me partnerët ndërsa punojmë drejt disponueshmërisë më të gjerë. Nuk besojmë se ky lloj procesi aksesi nga qeveria duhet të bëhet standardi afatgjatë. Ai ua mban larg mjetet më të mira përdoruesve, zhvilluesve, ndërmarrjeve, mbrojtësve kibernetikë dhe partnerëve globalë që kanë nevojë për to. Po e ndërmarrim këtë hap afatshkurtër sepse besojmë se është rruga më e fortë drejt disponueshmërisë më të gjerë në javët në vijim, ndërsa punojmë me Administratën për të zhvilluar kuadrin e Urdhrit Ekzekutiv për kibernetikën dhe një proces të përsëritshëm për publikimet e ardhshme të modeleve.
GPT‑5.6 Sol është modeli ynë më i fortë deri tani. Për të dhënë një paraafishim të performancës së modelit, ndajmë një grup vlerësimesh që theksojnë aftësi agjentike të përmirësuara në kodim, biologji dhe siguri kibernetike, me vlerësime shtesë të sigurisë dhe gatishmërisë të disponueshme në kartë tonë të sistemit(hapet në një dritare të re). Do të ndajmë një paketë të zgjeruar rezultatesh vlerësimi kur ta bëjmë modelin gjerësisht të disponueshëm.
Me GPT‑5.6, po prezantojmë një përpjekje të re arsyetimi "max" për t’i dhënë Sol më shumë kohë për të arsyetuar thellë. Përveç kësaj, po prezantojmë një modalitet të ri "ultra" që shkon përtej aftësive të një agjenti të vetëm duke shfrytëzuar nënagjentë për ta përshpejtuar punën komplekse.
Për rrjedhat e punës së kodimit, GPT‑5.6 Sol vendos një standard të ri më të lartë në Terminal‑Bench 2.1, i cili teston rrjedha pune në linjë komande që kërkojnë planifikim, iterim dhe koordinim mjetesh.
GPT‑5.6 Sol tregon gjithashtu përmirësime të gjera në rrjedhat e punës në biologji. Në GeneBench v1, i cili vlerëson analiza afatgjata të gjenomikës dhe biologjisë sasiore, ai arrin rezultate më të forta se GPT‑5.5 duke përdorur më pak tokenë.
GPT‑5.6 Sol është modeli ynë më i aftë deri tani për sigurinë kibernetike. Ai zhvendos kufirin e performancës dhe efikasitetit për detyra afatgjata sigurie, përfshirë kërkimin e cenueshmërive dhe shfrytëzimin. Në ExploitBench², GPT‑5.6 Sol është konkurrues me Mythos Preview duke përdorur vetëm rreth 1/3 e tokenëve të daljes. Në ExploitGym(hapet në një dritare të re)3, një pikë referimi i krijuar nga studiues të UC Berkeley në bashkëpunim me OpenAI dhe laboratorë të tjerë avangardë, modelet GPT‑5.6 Sol, Terra dhe Luna demonstrojnë të gjitha përmirësime të forta në aftësitë kibernetike ndërsa rrisim arsyetimin.
Ne zhvilluam GPT‑5.6 Sol, Terra dhe Luna me masat tona më të qëndrueshme mbrojtëse deri më sot, me konfigurime të përshtatura me aftësitë e secilit model. Ndërsa modeli bëhet më i aftë, ne projektojmë masa mbrojtëse që t’i rezistojnë gjithnjë e më shumë presionit kundërshtar në botën reale, duke ruajtur aksesin për punë legjitime si rishikimi i kodit, kërkimi i cenueshmërive, zhvillimi i arnimeve , korrigjimi i defekteve në kod, edukimi për sigurinë dhe testimi i mbrojtjes. Qëllimi ynë është ta bëjmë aktivitetin e ndaluar sulmues më të vështirë, më të pasigurt dhe më të dallueshëm, pa kufizuar pa qenë nevoja këto përdorime të dobishme. Bazuar në vlerësimin tonë të modelit dhe të masave mbrojtëse, presim përfitim të konsiderueshëm për punën legjitime mbrojtëse, ndërkohë që kufizojmë ndjeshëm përdorimin e ndaluar sulmues.
GPT‑5.6 Sol është më i mirë për t’i ndihmuar njerëzit të gjejnë dhe rregullojnë cenueshmërinë sesa për të kryer me besueshmëri sulme nga fillimi në fund. Ndërsa këto aftësi vazhdojnë të përparojnë, përparësia jonë është të sigurohemi që ato të arrijnë te mbrojtësit dhe t’u sjellin përfitim atyre, të cilët mund t’i përdorin këto mjete për të gjetur dobësi, për të zhvilluar arnime dhe për të forcuar sistemet më gjerësisht.
GPT‑5.6 Sol nuk e kalon pragun Kritik Kibernetik sipas Preparedness Framework. Në vlerësimet që përfshinin Chromium dhe Firefox, ai identifikoi gabime dhe elemente bazë shfrytëzimi—blloqet ndërtuese të një shfrytëzimi—por nuk prodhoi në mënyrë autonome një shfrytëzim funksional me zinxhir të plotë në kushtet e testuara. Megjithatë, pragjet e pikës së referimit nuk mund të kapin çdo mënyrë se si një model mund të përdoret ose të kombinohet me mjete të tjera. Kjo pasiguri, bashkë me ndryshimin më të gjerë të hapit në aftësitë e modelit, është arsyeja pse po i shoqërojmë aftësitë e rritura të modelit me masa mbrojtëse më të forta dhe me një publikim me faza. Ndajmë më shumë detaje rreth masave tona mbrojtëse në kartë sistemi të GPT‑5.6 Preview(hapet në një dritare të re).
Asnjë masë e vetme mbrojtëse nuk mjafton kundër keqpërdorimit të vendosur ose përshtatës. Gjatë paraafishimit të GPT‑5.6, përdorim masa mbrojtëse me shtresa, me konfigurime të sakta që ndryshojnë sipas modeleve, dhe i testojmë nën presion ndaj sulmeve në botën reale. Këto përfshijnë mbrojtje të trajnuara brenda modelit, kontrolle në kohë reale gjatë gjenerimit, sinjale në nivel llogarie, akses të diferencuar, monitorim, zbatim rregullash dhe testim të vazhdueshëm.
GPT‑5.6 është trajnuar të refuzojë asistencën kibernetike të ndaluar, përfshirë rastet kur përdoruesit përpiqen të fshehin qëllimin e tyre ose të heqin kufizimet mbrojtëse ndaj modelit. Këto masa mbrojtëse në nivel modeli vendosin kufirin e parë rreth asaj për të cilën modeli duhet dhe nuk duhet të ndihmojë.
Klasifikuesit në kohë reale për keqpërdorim kibernetik dhe biologjik ofrojnë një shtresë tjetër duke vlerësuar daljen teksa gjenerohet. Për rastet me rrezik më të lartë, nëse zbulojnë një shkelje të mundshme, gjenerimi mund të ndërpritet përkohësisht ndërsa një model arsyetimi më i madh shqyrton bisedën dhe kontekstin e saj. Nëse dalja vlerësohet si e palejuar, ajo mbahet pa arritur te përdoruesi.
Aktiviteti i sinjalizuar mund të nxisë gjithashtu shqyrtim në nivel llogarie në bisedat përkatëse dhe sinjalet e rrezikut, në përputhje me kushtet dhe politikat tona për ruajtjen dhe shqyrtimin e përmbajtjes. Vështrimi përtej një bisede të vetme i ndihmon sistemet tona të dallojnë sjellje keqdashëse të vazhdueshme nga puna legjitime e sigurisë me përdorim të dyfishtë, ku koncepte teknike të ngjashme mund të shfaqen në kontekste shumë të ndryshme.
Së bashku, këto shtresa e bëjnë qasjen e përgjithshme më të qëndrueshme se çdo masë mbrojtëse më vete. Sjellja e modelit ul gjasat e përgjigjeve të dëmshme, sistemet në kohë reale mund të ndërhyjnë gjatë gjenerimit, shqyrtimi në nivel llogarie mund të identifikojë modele më të gjera, dhe qasja e diferencuar ruan punën e rëndësishme mbrojtëse pa i bërë aftësitë më të ndjeshme të jenë gjerësisht të disponueshme si parazgjedhje.
Veçanërisht gjatë paraafishimit, përdoruesit mund të ndeshin masa mbrojtëse që bllokojnë ose refuzojnë disa kërkesa. Kërkesa të tjera mund të zgjasin më shumë sepse gjenerimi ndërpritet përkohësisht për shqyrtim shtesë. Masat mbrojtëse mund të ndërhyjnë herë pas here në punë legjitime, veçanërisht në fusha me përdorim të dyfishtë ku aktiviteti mbrojtës dhe ai sulmues fillimisht mund të duken të ngjashëm.
Kjo është pjesë e asaj që paraafishimi është krijuar për të testuar. Duam të kuptojmë jo vetëm nëse masat mbrojtëse kufizojnë keqpërdorimin, por edhe nëse përdoruesit legjitimë mund ta kryejnë ende punën normale në mënyrë të besueshme dhe efikase. Reagimet gjatë paraafishimit do të na ndihmojnë të zvogëlojmë bllokimet dhe vonesat e panevojshme, të përmirësojmë mënyrën si masat mbrojtëse interpretojnë kontekstin dhe të krijojmë një përvojë më të rrjedhshme përpara publikimit më të gjerë.
Po punojmë gjithashtu me klientët e ndërmarrjeve për qasje afatgjata—përfshirë zbulimin që ruan privatësinë, kontrollet e sigurisë të operuara nga klienti dhe qasjen e kalibruar sipas rrezikut të një klienti, përdoruesi ose ngarkese pune—për të çuar përpara sigurinë duke mbështetur kërkesat e privatësisë së ndërmarrjeve.
Masat mbrojtëse duhet të mbeten efektive edhe kur sulmuesit përshtatin taktikat e tyre. Një mbrojtje që funksionon vetëm ndaj një grupi të pandryshueshëm sulmesh të njohura nuk është mjaftueshëm e qëndrueshme për një model avangardë.
Prandaj po përdorim më shumë inteligjencë dhe kapacitet llogaritës se kurrë më parë për sigurinë, duke përdorur modelet tona për të gjetur dobësi dhe për të përmirësuar më shpejt masat mbrojtëse. I kushtuam mbi 700 000 orë GPU ekuivalente me A100 simulim sulmesh të automatizuara për gjetjen e heqjes universale të kufizimeve mbrojtëse: sulme që mund të funksionojnë në shumë kërkesa ose kontekste, jo vetëm në një mjedis të ngushtë. Fokusimi në këto sulme më të vështira dhe më të përgjithshme na lejoi t’i testonim masat mbrojtëse përtej një grupi të pandryshueshëm dështimesh të njohura. Kjo na lejon gjithashtu të shqyrtojmë shumë më tepër modele sulmi sesa mund të mbulonte vetëm testimi njerëzor, të identifikojmë më herët modelet e dështimit dhe të shkurtojmë rrugën nga gjetja e një dobësie deri tek adresimi i saj.
Përveç simulimit të automatizuar të sulmeve, punuam me testues të palëve të treta për të kryer simulim sulmesh të gjerë nga ekspertë njerëzorë, i cili do të vazhdojë gjatë periudhës së paraafishimit. Simulimi i sulmeve me njerëz e plotëson punën e automatizuar duke testuar masat mbrojtëse ndaj ekspertëve krijues që përpiqen ta keqpërdorin modelin në mënyra që sistemet tona mund të mos i parashikojnë.
Asnjë vlerësim nuk mund të përfaqësojë çdo konfigurim produkti, sulm me shumë hapa ose rrjedhë pune në botën reale. Prandaj mbajmë një proces reagimi të shpejtë për të riprodhuar, vlerësuar, dhënl përparësi dhe korrigjuar heqjen e kufizimeve mbrojtëse të sapozbuluara, pastaj i shtojmë ato në vlerësimet tona të vazhdueshme që të mund të testojmë ndaj dështimeve të ngjashme në të ardhmen.
Gjatë paraafishimit, modelet GPT‑5.6 fillimisht do të jenë të disponueshme përmes API-së dhe Codex për një grup të përzgjedhur partnerësh dhe organizatash të besuara. Planifikojmë t’i bëjmë së shpejti më gjerësisht të disponueshme për njerëzit që përdorin ChatGPT, Codex dhe API.
Në këtë sistem të ri emërtimi të prezantuar me GPT‑5.6, numri tregon gjeneratën e modelit, ndërsa Sol, Terra dhe Luna tregojnë nivele të qëndrueshme aftësish që mund të përparojnë me ritmin e tyre. Së bashku, familja u jep njerëzve dhe zhvilluesve zgjedhje më të qarta mes inteligjencës, shpejtësisë dhe kostos.
GPT‑5.6 tarifohet për 1 milion tokenë në tri madhësi modeli: Sol kushton 5 dollarë për hyrje / 30 dollarë për dalje; Terra 2,50 dollarë për hyrje / 15 dollarë për dalje; dhe Luna 1 dollarë për hyrje / 6 dollarë për dalje. GPT‑5.6 prezanton gjithashtu memorien specifike më të parashikueshëm të kërkesave, duke përfshirë mbështetje për pika të qarta ndërprerjeje të memories specifike dhe një jetë minimale memorie specifike prej 30 minutash. Për GPT‑5.6 dhe modelet e mëvonshme, shkrimet në memorien specifike faturohen me 1,25x tarifën e hyrjes së kufirit të mungesës së memories specifike të modelit, ndërsa leximet nga memoriet specifike vazhdojnë të marrin zbritjen 90% për hyrjen e memories specifike.
Po prezantojmë gjithashtu GPT‑5.6 Sol në Cerebras deri në 750 tokenë në sekondë në korrik, duke u sjellë klientëve inteligjencë avangardë me shpejtësi të paprecedentë. Aksesi fillimisht do të kufizohet për klientë të përzgjedhur ndërsa zgjerojmë kapacitetin.
Jemi të entuziazmuar të vazhdojmë të mësojmë nga kjo periudhë paraafishimi dhe t’ua sjellim së shpejti GPT‑5.6 Sol, Terra dhe Luna më shumë njerëzve.
1. Ne vlerësojmë vonesën dhe koston e API-së duke parë sjelljen në prodhim të modeleve tona dhe duke simuluar jashtë linje. Këto vlerësime marrin parasysh detajet e thirrjeve të mjeteve, tokenët e kampionuar dhe tokenët e hyrjes. Rezultatet në botën reale mund të ndryshojnë ndjeshëm dhe varen nga shumë faktorë që nuk përfshihen në simulimin tonë. Ne simulojmë vonesën me shpejtësi të larta API-je dhe koston me çmimet e zakonshme të API-së.
2. Të gjitha modelet vlerësohen duke përdorur strukturën e API-së së ExploitBench me 5 farëza dhe vazhdimësi arsyetimi.
3. E ekzekutuam ExploitGym në API-në tonë alpha, e cila prodhon përgjigje më shpejt se API-ja jonë publike, dhe më pas e rishkallëzuam për t’u përputhur me API-në tonë publike. Kur rishkallëzojmë vonesat sipas shpejtësive të pritshme për API-në tonë publike, kjo bën që disa vonesa të vlerësuara të tejkalojnë kufijtë kohorë prej 2 orësh dhe 6 orësh, megjithëse në ekzekutimin e vlerësimit janë respektuar saktë. Për shpejtësi më të larta në punë të ndjeshme ndaj kohës, ofrojmë përpunim me përparësi në API dhe modalitet të shpejtë në Codex.
4. Modelet pa tokenë daljeje, vonesë ose kosto të raportuar paraqiten si vija horizontale me pika.

