Fara beint í aðalefni
OpenAI

13. ágúst 2026

Hagnýtt AI

Leiðarvísir þróunaraðila um GPT‑5.6

Tæknilegur lærdómur sprotafyrirtækja í framleiðslu

Hleður inn...

GPT‑5.6 setur ný viðmið um afköst miðað við verð

GPT‑5.6‑líkanafjölskyldan gerir háþróaða frammistöðu fulltrúa mun hagkvæmari og færir jafnframt mörk hins mögulega fram á við.

Í þessum leiðarvísi sýnum við hvernig sprotafyrirtæki nota snjallara líkanaval og nýjar API-stýringar fyrir samfelld rök, samhæfingu margra fulltrúa og forritanleg verkfæraköll til að smíða hraðari og öflugri fulltrúa fyrir brot af kostnaðinum.

Betri upplifun strax frá upphafi

Frá GPT‑5 hefur hver ný kynslóð líkana miðað að því að leysa langvinnari verkefni með færri tókum. GPT‑5.6 heldur þeirri þróun áfram: öflugri fulltrúar, lægri kostnaður og lágmarksbreytingar á undirliggjandi kerfi.

Aukin nákvæmni við minni rök bætist við umtalsverða hagkvæmni í heildarkostnaði. Á Agents’ Last Exam stóð GPT‑5.6 Sol með „lítil“ rök sig til dæmis betur en GPT‑5.5 með „mikil“ rök þegar kerfinu var haldið óbreyttu. Við höfum séð sambærilegan árangur í framleiðsluprófunum, þar sem sprotafyrirtæki segja frá verulegum kostnaðarlækkunum í fjölbreyttum verkferlum með því að draga úr rökum miðað við fyrri sjálfgefnar stillingar.

Við settum GPT‑5.6 beint inn í kerfið okkar og lítil rök skiluðu besta árangrinum. Það vissi hvenær gögnin voru einfaldlega ekki til staðar, elti ekki villuspor og fann rétta svarið með færri tókum.
— Izzy Miller, rannsóknarstjóri gervigreindar, Hex(opnast í nýjum glugga)

Líkanaval

Hingað til hefur besti kosturinn fyrir verkefni sem taka langan tíma verið að uppfæra í flaggskipslíkan með mestu tiltæku rökum. Það hefur að stórum hluta stafað af því að þessi líkön ráða mun betur en kostnaðarhámörkuð líkön við lengra samhengi og verkfæraköll. Þetta hefur breyst með 5.6-fjölskyldunni: með meiri reiknivinnu við prófun geta Luna og Terra oft skilað svipuðum árangri og GPT‑5.4 og 5.5 en á mun lægra verði.

1 af 3
Luna heldur 98% af útdráttarnákvæmni GPT‑5.5 fyrir átjánda hluta kostnaðarins. Þannig fá fulltrúarnir okkar hágæða skilning á skjölum á verði sem gerir notkunina raunhæfa í mun fleiri verkferlum.
— Serhii Shchoholiev, verkfræðistjóri fulltrúa, Hypha(opnast í nýjum glugga)

Lítum á verkefni í BrowseComp, leitarviðmiði sem prófar getu líkans til að finna lítt þekktar staðreyndir. Fyrir þremur mánuðum fékk GPT‑5.5 (Mjög hátt) 84,36% á þessu viðmiði og heildarkostnaðurinn var $33,27. Við útgáfu skilar GPT‑5.6 Luna (Mjög hátt) nánast sömu frammistöðu, 84,04%, fyrir $1,33. Síðan höfum við lækkað verðið enn frekar. Lestu meira um nýjustu verðlækkanirnar okkar.

Minni líkön 5.6-fjölskyldunnar henta vel fyrir vinnuálag í miklu magni, samskipti þar sem svartími skiptir máli og endurtekin skref í verkferlum fulltrúa. Ef þú rekur til dæmis lögfræðitæknisprota sem les handskrifuð minnisblöð fyrir greiningu fulltrúa geturðu nú notað Terra eða Luna við útdráttinn, í stað háþróaðs líkans fyrir allt ferlið, og sparað verulega.

Responses API þróað áfram til að hanna skilvirkari fulltrúa

Auk þess að bæta sjálfgefna frammistöðu GPT‑5.6 gáfum við út nýjar grunneiningar fyrir Responses API sem skapa svigrúm til enn meiri ávinnings. Við þjálfuðum GPT‑5.6 frá upphafi til enda með þremur samverkandi breytingum á högun sem gera fulltrúum kleift að starfa skilvirkar:

  1. Endurnýtið vinnu sem þegar hefur verið unnin: með því að gera kleift að varðveita rök(opnast í nýjum glugga) milli umferða líkansins og nota innbyggða þjöppun(opnast í nýjum glugga) til að þjappa löngum samtölum getur líkanið viðhaldið samhengi í vinnu sinni yfir lengri verkefni án þess að ruglast eða þurfa að endurskapa fyrra samhengi.
  2. Skiptið vinnu samhliða þegar það á við: með innbyggðri samhæfingu margra fulltrúa(opnast í nýjum glugga) má samstilla marga fulltrúa í samhliða verkstraumum og ljúka flóknum verkefnum hraðar.
  3. Færið fyrirsjáanlega vinnu yfir í kóða: notið forritanleg verkfæraköll(opnast í nýjum glugga) til að sía, safna saman og samhæfa úttak verkfæra utan samhengisglugga líkansins. Þá nýtast tókar líkansins í mat og kostnaður, biðtími og hnignun samhengis minnka.

Saman geta þessir þættir skipt sköpum. Á ARC-AGI-3 fékk GPT‑5.6 Sol til dæmis 13,3% með staðlaða kerfinu. Þegar varðveitt rök og þjöppun voru virkjuð rauk einkunnin hins vegar upp í 38,3% — með um sexfalt færri úttakstókum. Engar breytingar á líkaninu, en árangurinn nær þrefaldaðist. Hér má lesa meira um rannsókn okkar á kerfi ARC-AGI-3.

Forritanleg verkfæraköll

Verkferlar fulltrúa fela oft í sér tvenns konar vinnu:

  1. Verkefni sem krefjast mats
  2. Vinna sem felst aðallega í að flytja, sía og sameina gögn

Þegar fulltrúi sækir 100 skýrslur, síar þær eftir dagsetningu og finnur viðeigandi viðskipti ætti líkanið ekki að þurfa að beita rökum á hverja milliniðurstöðu í samhengisglugganum. Með forritanlegum verkfæraköllum getur GPT‑5.6 skrifað JavaScript til að samhæfa verkfæri, keyra óháð köll samhliða og vinna úr úttaki þeirra utan samhengisgluggans. Þá getur líkanið einbeitt sér að því sem krefst greindar: að beita mati.

Í fjármálarannsóknum felst vandinn í að sækja gögn úr skýrslum með áreiðanlegum hætti, samhæfa verkfæri og vinna úr tölunum. Í mati okkar náði GPT‑5.6 með forritanlegum verkfæraköllum sömu gæðum samkvæmt matsrammanum en notaði 21% færri inntakstóka. Þar liggur munurinn á fulltrúa sem getur rætt fjármálarannsóknir og fulltrúa sem getur raunverulega framkvæmt þær.
— Alex Wang, hagnýt gervigreind, Rogo(opnast í nýjum glugga)

Margir fulltrúar

Í flóknum verkefnum sem hægt er að vinna samhliða flýtir dreifing aðgerða og raka milli margra verkstrauma fulltrúa fyrir verklok og eykur jafnframt greind. Í slíkri uppsetningu ber aðalfulltrúinn ábyrgð á að samhæfa undirfulltrúana og úthluta þeim verkefnum. Undirfulltrúarnir vinna að markmiðum sínum samhliða og skila loks niðurstöðunum til aðalfulltrúans, sem tekur þær saman. Teymi geta byrjað að nýta innbyggða virkni margra fulltrúa með því að virkja marga fulltrúa(opnast í nýjum glugga) í Responses API. Svona virkar Ultra-getustillingin í ChatGPT einnig.

1 af 2
Qualia lætur teymi fulltrúa glíma við opin rannsóknarverkefni og GPT‑5.6 Sol virkaði einfaldlega strax. Það var greinilega betra en GPT‑5.5, lauk verkinu hraðar en nánast öll önnur líkön sem við prófuðum og varð fljótt það OpenAI-líkan sem við leitum helst til.
— E Chi, stofnandi, Quadrillion(opnast í nýjum glugga)

Þótt GPT‑5.6 meti vel hæfilegan fjölda undirfulltrúa og hvenær eigi að ræsa þá er auðvelt að stýra hegðun margra fulltrúa. Með leiðbeiningum um hvenær líkanið eigi að kalla til undirfulltrúa má auka líkurnar á að fulltrúar séu aðeins ræstir þegar aukin tókanotkun skilar betri árangri.

Kvaðningarskyndiminni

Í allri líkanafjölskyldunni hefur lágmarks-TTL kvaðningarskyndiminnis verið lengt í 30 mínútur og nú má staðsetja skyndiminnisrofpunkta með fyrirsjáanlegum hætti innan samhengisglugga líkans. Þannig hafa sprotafyrirtæki getað aukið hlutfall skyndiminnishitta verulega.

Við bættum skyndiminnisrofpunktum og sértækum lyklum fyrir hvert vinnusvæði við sameiginlega 29.000 tóka kvaðningu og minnkuðum óskeyndiminnað inntak um 28%. 30 mínútna skyndiminnisglugginn opnaði líka mikla möguleika: fulltrúarnir okkar gátu endurnýtt sama samhengi milli keyrslna í stað þess að byrja frá grunni.
— Lorenzo Gentile, gervigreindarverkfræðingur, Ploy(opnast í nýjum glugga)

Auk þess að stilla skyndiminnisrofpunkta eykur áframhaldandi notkun á viðeigandi prompt_cache_key(opnast í nýjum glugga) líkurnar á að beiðnir fari í sömu ályktunarvél og afgreiddi áður sama forskeyti og dregur þannig úr biðtíma.

Niðurstaða

Það sem stendur upp úr í þessum dæmum er hversu mikið hagkvæmni þess að smíða fulltrúa hefur breyst.

Notkunartilvik sem áður kröfðust háþróaðs líkans í hverju skrefi geta nú skilað sambærilegum eða betri árangri fyrir brot af kostnaðinum með minni líkönum, fínstillingu raka og skilvirkum ákvörðunum um högun.

Við hlökkum til að sjá hvað þið smíðið!

  • 2026
  • API Platform

Um höfunda

Þessi leiðarvísir var unninn af Samarth Madduru(opnast í nýjum glugga), Prashant Mital(opnast í nýjum glugga), Dave Leo(opnast í nýjum glugga) og Julien Reiman(opnast í nýjum glugga). Hann byggir á reynslu þeirra af nánu samstarfi við sprotafyrirtæki sem þróuðu með GPT‑5.6, frá fyrstu prófunum til framleiðslu.