Leiðarvísir þróunaraðila um GPT‑5.6
Tæknilegur lærdómur sprotafyrirtækja í framleiðslu
GPT‑5.6‑líkanafjölskyldan gerir háþróaða frammistöðu fulltrúa mun hagkvæmari og færir jafnframt mörk hins mögulega fram á við.
Í þessum leiðarvísi sýnum við hvernig sprotafyrirtæki nota snjallara líkanaval og nýjar API-stýringar fyrir samfelld rök, samhæfingu margra fulltrúa og forritanleg verkfæraköll til að smíða hraðari og öflugri fulltrúa fyrir brot af kostnaðinum.
Frá GPT‑5 hefur hver ný kynslóð líkana miðað að því að leysa langvinnari verkefni með færri tókum. GPT‑5.6 heldur þeirri þróun áfram: öflugri fulltrúar, lægri kostnaður og lágmarksbreytingar á undirliggjandi kerfi.
Aukin nákvæmni við minni rök bætist við umtalsverða hagkvæmni í heildarkostnaði. Á Agents’ Last Exam stóð GPT‑5.6 Sol með „lítil“ rök sig til dæmis betur en GPT‑5.5 með „mikil“ rök þegar kerfinu var haldið óbreyttu. Við höfum séð sambærilegan árangur í framleiðsluprófunum, þar sem sprotafyrirtæki segja frá verulegum kostnaðarlækkunum í fjölbreyttum verkferlum með því að draga úr rökum miðað við fyrri sjálfgefnar stillingar.
Hingað til hefur besti kosturinn fyrir verkefni sem taka langan tíma verið að uppfæra í flaggskipslíkan með mestu tiltæku rökum. Það hefur að stórum hluta stafað af því að þessi líkön ráða mun betur en kostnaðarhámörkuð líkön við lengra samhengi og verkfæraköll. Þetta hefur breyst með 5.6-fjölskyldunni: með meiri reiknivinnu við prófun geta Luna og Terra oft skilað svipuðum árangri og GPT‑5.4 og 5.5 en á mun lægra verði.
Lítum á verkefni í BrowseComp, leitarviðmiði sem prófar getu líkans til að finna lítt þekktar staðreyndir. Fyrir þremur mánuðum fékk GPT‑5.5 (Mjög hátt) 84,36% á þessu viðmiði og heildarkostnaðurinn var $33,27. Við útgáfu skilar GPT‑5.6 Luna (Mjög hátt) nánast sömu frammistöðu, 84,04%, fyrir $1,33. Síðan höfum við lækkað verðið enn frekar. Lestu meira um nýjustu verðlækkanirnar okkar.
Minni líkön 5.6-fjölskyldunnar henta vel fyrir vinnuálag í miklu magni, samskipti þar sem svartími skiptir máli og endurtekin skref í verkferlum fulltrúa. Ef þú rekur til dæmis lögfræðitæknisprota sem les handskrifuð minnisblöð fyrir greiningu fulltrúa geturðu nú notað Terra eða Luna við útdráttinn, í stað háþróaðs líkans fyrir allt ferlið, og sparað verulega.
Auk þess að bæta sjálfgefna frammistöðu GPT‑5.6 gáfum við út nýjar grunneiningar fyrir Responses API sem skapa svigrúm til enn meiri ávinnings. Við þjálfuðum GPT‑5.6 frá upphafi til enda með þremur samverkandi breytingum á högun sem gera fulltrúum kleift að starfa skilvirkar:
- Endurnýtið vinnu sem þegar hefur verið unnin: með því að gera kleift að varðveita rök(opnast í nýjum glugga) milli umferða líkansins og nota innbyggða þjöppun(opnast í nýjum glugga) til að þjappa löngum samtölum getur líkanið viðhaldið samhengi í vinnu sinni yfir lengri verkefni án þess að ruglast eða þurfa að endurskapa fyrra samhengi.
- Skiptið vinnu samhliða þegar það á við: með innbyggðri samhæfingu margra fulltrúa(opnast í nýjum glugga) má samstilla marga fulltrúa í samhliða verkstraumum og ljúka flóknum verkefnum hraðar.
- Færið fyrirsjáanlega vinnu yfir í kóða: notið forritanleg verkfæraköll(opnast í nýjum glugga) til að sía, safna saman og samhæfa úttak verkfæra utan samhengisglugga líkansins. Þá nýtast tókar líkansins í mat og kostnaður, biðtími og hnignun samhengis minnka.
Saman geta þessir þættir skipt sköpum. Á ARC-AGI-3 fékk GPT‑5.6 Sol til dæmis 13,3% með staðlaða kerfinu. Þegar varðveitt rök og þjöppun voru virkjuð rauk einkunnin hins vegar upp í 38,3% — með um sexfalt færri úttakstókum. Engar breytingar á líkaninu, en árangurinn nær þrefaldaðist. Hér má lesa meira um rannsókn okkar á kerfi ARC-AGI-3.
Verkferlar fulltrúa fela oft í sér tvenns konar vinnu:
- Verkefni sem krefjast mats
- Vinna sem felst aðallega í að flytja, sía og sameina gögn
Þegar fulltrúi sækir 100 skýrslur, síar þær eftir dagsetningu og finnur viðeigandi viðskipti ætti líkanið ekki að þurfa að beita rökum á hverja milliniðurstöðu í samhengisglugganum. Með forritanlegum verkfæraköllum getur GPT‑5.6 skrifað JavaScript til að samhæfa verkfæri, keyra óháð köll samhliða og vinna úr úttaki þeirra utan samhengisgluggans. Þá getur líkanið einbeitt sér að því sem krefst greindar: að beita mati.
Í flóknum verkefnum sem hægt er að vinna samhliða flýtir dreifing aðgerða og raka milli margra verkstrauma fulltrúa fyrir verklok og eykur jafnframt greind. Í slíkri uppsetningu ber aðalfulltrúinn ábyrgð á að samhæfa undirfulltrúana og úthluta þeim verkefnum. Undirfulltrúarnir vinna að markmiðum sínum samhliða og skila loks niðurstöðunum til aðalfulltrúans, sem tekur þær saman. Teymi geta byrjað að nýta innbyggða virkni margra fulltrúa með því að virkja marga fulltrúa(opnast í nýjum glugga) í Responses API. Svona virkar Ultra-getustillingin í ChatGPT einnig.
“Qualia lætur teymi fulltrúa glíma við opin rannsóknarverkefni og GPT‑5.6 Sol virkaði einfaldlega strax. Það var greinilega betra en GPT‑5.5, lauk verkinu hraðar en nánast öll önnur líkön sem við prófuðum og varð fljótt það OpenAI-líkan sem við leitum helst til.”
“GPT‑5.6 er besti verkstjórinn sem við höfum séð frá OpenAI. Við lögðum sex forskriftir fyrir það í einu — létum það skrifa, smíða og ræða þær allar — og það hélt utan um allt án þess að gæðin hröpuðu.”
Þótt GPT‑5.6 meti vel hæfilegan fjölda undirfulltrúa og hvenær eigi að ræsa þá er auðvelt að stýra hegðun margra fulltrúa. Með leiðbeiningum um hvenær líkanið eigi að kalla til undirfulltrúa má auka líkurnar á að fulltrúar séu aðeins ræstir þegar aukin tókanotkun skilar betri árangri.
Í allri líkanafjölskyldunni hefur lágmarks-TTL kvaðningarskyndiminnis verið lengt í 30 mínútur og nú má staðsetja skyndiminnisrofpunkta með fyrirsjáanlegum hætti innan samhengisglugga líkans. Þannig hafa sprotafyrirtæki getað aukið hlutfall skyndiminnishitta verulega.
Auk þess að stilla skyndiminnisrofpunkta eykur áframhaldandi notkun á viðeigandi prompt_cache_key(opnast í nýjum glugga) líkurnar á að beiðnir fari í sömu ályktunarvél og afgreiddi áður sama forskeyti og dregur þannig úr biðtíma.
Það sem stendur upp úr í þessum dæmum er hversu mikið hagkvæmni þess að smíða fulltrúa hefur breyst.
Notkunartilvik sem áður kröfðust háþróaðs líkans í hverju skrefi geta nú skilað sambærilegum eða betri árangri fyrir brot af kostnaðinum með minni líkönum, fínstillingu raka og skilvirkum ákvörðunum um högun.
Við hlökkum til að sjá hvað þið smíðið!
- 2026
- API Platform
Um höfunda
Þessi leiðarvísir var unninn af Samarth Madduru(opnast í nýjum glugga), Prashant Mital(opnast í nýjum glugga), Dave Leo(opnast í nýjum glugga) og Julien Reiman(opnast í nýjum glugga). Hann byggir á reynslu þeirra af nánu samstarfi við sprotafyrirtæki sem þróuðu með GPT‑5.6, frá fyrstu prófunum til framleiðslu.


