GPT‑5.6:n opas kehittäjille
Teknisiä oppeja tuotantokäytössä olevilta startupeilta
GPT‑5.6‑malliperhe tekee edistyneen tason agenttien suorituskyvystä huomattavasti edullisempaa ja vie samalla mahdollisuuksien rajoja eteenpäin.
Tässä oppaassa kerromme, miten startupit rakentavat nopeampia ja kyvykkäämpiä agentteja murto-osalla aiemmista kustannuksista hyödyntämällä älykkäämpää mallinvalintaa sekä uusia API-ohjaimia, jotka tukevat päättelyn jatkuvuutta, moniagenttiorkestrointia ja ohjelmallisia työkalukutsuja.
GPT‑5:stä lähtien jokaisella mallisukupolvella on pyritty ratkaisemaan pidemmän aikavälin tehtäviä aiempaa pienemmällä tokenmäärällä. GPT‑5.6 jatkaa samaa kehitystä: agenttien suorituskyky paranee ja kustannukset laskevat, vaikka taustalla olevaan arviointikehykseen tehdään vain vähäisiä muutoksia.
Yleistä kustannustehokkuutta parantaa entisestään suurempi tarkkuus vähäisemmällä päättelypanoksella. Esimerkiksi Agents’ Last Exam -testissä GPT‑5.6 Sol päihitti ”matalalla” päättelytasolla GPT‑5.5:n ”korkealla” päättelytasolla, kun arviointikehys pidettiin samana. Olemme nähneet vastaavia onnistumisia tuotantotestauksessa: startupit ovat raportoineet merkittäviä kustannussäästöjä monissa työnkuluissa, kun päättelypanosta on vähennetty aiemmista oletusasetuksista.
Pitkän aikavälin käyttötapauksissa paras vaihtoehto on perinteisesti ollut päivittää lippulaivamalliin ja käyttää suurinta saatavilla olevaa päättelypanosta. Tämä on johtunut pitkälti siitä, että nämä mallit ovat käsitelleet pitkiä konteksteja ja työkalukutsuja huomattavasti kyvykkäämmin kuin kustannusoptimoidut mallit. Tilanne on muuttunut 5.6-perheen myötä: suuremmalla suorituksenaikaisella laskentateholla Luna ja Terra yltävät usein GPT‑5.4:n ja 5.5:n tasolle huomattavasti edullisemmin.
Tarkastellaan esimerkiksi BrowseComp-tehtäviä. Tämä hakupohjainen vertailutesti mittaa mallin kykyä etsiä vaikeasti löydettäviä faktoja. Kolme kuukautta sitten GPT‑5.5 (Erittäin korkea) sai tässä vertailutestissä tuloksen 84,36 %, ja kokonaiskustannus oli 33,27 dollaria. Julkaisuhetkellä GPT‑5.6 Luna (Erittäin korkea) tarjoaa käytännössä saman suorituskyvyn: tulos on 84,04 % vain 1,33 dollarin kustannuksella. Olemme sittemmin laskeneet hintoja entisestään. Lue lisää uusimmista hinnanalennuksistamme.
5.6-perheen pienemmät mallit sopivat erinomaisesti suuren volyymin työkuormiin, viiveherkkiin vuorovaikutustilanteisiin ja agenttipohjaisten työnkulkujen toistuviin vaiheisiin. Jos esimerkiksi pyörität lakiteknologia-alan startupia, joka jäsentää käsinkirjoitettuja muistioita ennen agenttipohjaista analyysia, voit käyttää Terran tai Lunan kaltaista mallia tietojen poimintaan sen sijaan, että käyttäisit edistynyttä mallia koko prosessiin. Näin saavutat merkittäviä kustannussäästöjä.
Sen lisäksi, että paransimme GPT‑5.6:n suorituskykyä heti käyttövalmiina, toimme Responses APIin uusia perustoimintoja lisähyötyjen saavuttamiseksi. Koulutimme GPT‑5.6:n alusta loppuun kolmella toisiaan täydentävällä arkkitehtuuriratkaisulla, joiden ansiosta agentit toimivat tehokkaammin:
- Hyödynnä jo tehty työ uudelleen: kun päättely säilytetään(avautuu uudessa ikkunassa) mallin vuorojen välillä ja pitkät keskustelut pakataan sisäänrakennetulla kontekstin tiivistämisellä(avautuu uudessa ikkunassa), malli pystyy säilyttämään työnsä johdonmukaisuuden pitkissä tehtävissä hämmentymättä tai rakentamatta aiempaa kontekstia uudelleen.
- Jaa työ rinnakkaisiin osiin silloin, kun se on tarkoituksenmukaista: sisäänrakennettu moniagenttiorkestrointi(avautuu uudessa ikkunassa) mahdollistaa useiden agenttien koordinoinnin rinnakkaisissa työvirroissa, jolloin monimutkaiset tehtävät valmistuvat nopeammin.
- Siirrä deterministinen työ koodiin: ohjelmallisilla työkalukutsuilla(avautuu uudessa ikkunassa) voidaan suodattaa ja yhdistellä työkalujen tuloksia sekä orkestroida niitä mallin konteksti-ikkunan ulkopuolella. Näin mallin tokenit säästyvät harkintaa vaativiin tehtäviin ja kustannukset, viive sekä kontekstin rapautuminen vähenevät.
Yhdessä käytettyinä niiden vaikutus voi olla dramaattinen. Esimerkiksi ARC-AGI-3:ssa GPT‑5.6 Sol sai vakioarviointikehyksellä tuloksen 13,3 %. Kun säilytetty päättely ja kontekstin tiivistäminen otettiin käyttöön, tulos nousi kuitenkin 38,3 prosenttiin – ja tulostokeneita kului noin kuusi kertaa vähemmän. Mallia ei muutettu, mutta suorituskyky lähes kolminkertaistui. Voit lukea lisää ARC-AGI-3-arviointikehystä koskevasta tutkimuksestamme.
Agenttipohjaisiin työnkulkuihin sisältyy usein kahdenlaista työtä:
- Harkintaa vaativat tehtävät
- Työ, jossa lähinnä siirretään, suodatetaan ja yhdistellään tietoja
Kun agentti hakee 100 viranomaisasiakirjaa, suodattaa ne päivämäärän perusteella ja tunnistaa olennaiset tapahtumat, mallin ei pitäisi joutua päättelemään jokaisen välituloksen pohjalta konteksti-ikkunassaan. Ohjelmallisten työkalukutsujen avulla GPT‑5.6 voi kirjoittaa JavaScriptiä työkalujen orkestrointiin, suorittaa toisistaan riippumattomia kutsuja rinnakkain ja käsitellä niiden tuloksia konteksti-ikkunan ulkopuolella. Näin malli voi keskittyä älykkyyttä vaativaan työhön eli harkintaan.
Monimutkaisissa rinnakkaistettavissa tehtävissä toimintojen ja päättelyn jakaminen useisiin agenttien työvirtoihin nopeuttaa tehtävien valmistumista ja parantaa älykkyyttä. Näissä kokoonpanoissa pääagentti vastaa aliagenttien orkestroinnista ja tehtävien delegoinnista niille. Aliagentit tavoittelevat päämääriään rinnakkain ja palauttavat lopuksi tuloksensa pääagentille lopullista yhteenvetoa varten. Tiimit voivat alkaa hyödyntää sisäänrakennettua moniagenttitoimintoa ottamalla moniagenttitoiminnon käyttöön(avautuu uudessa ikkunassa) Responses APIssa. Myös ChatGPT:n Ultra-kyvykkyysasetus toimii näin.
“Qualia käyttää agenttitiimejä avoimissa tutkimusongelmissa, ja GPT‑5.6 Sol osui heti kohdalleen. Se oli selvästi GPT‑5.5:tä parempi, suoriutui tehtävistä nopeammin kuin lähes kaikki muut testaamamme mallit ja nousi nopeasti ensisijaiseksi OpenAI-malliksemme.”
“GPT‑5.6 on paras OpenAI-orkestroija, jonka olemme nähneet. Annoimme sille kuusi määrittelyä kerralla – kaikki piti kirjoittaa, toteuttaa ja käydä läpi – ja se pysyi kaikesta kärryillä laadun kärsimättä.”
Vaikka GPT‑5.6 osaa arvioida hyvin sopivan aliagenttien määrän ja sen, milloin niitä kannattaa käynnistää, moniagenttitoimintaa voi ohjata tarkasti. Kun mallille kerrotaan, milloin aliagentteja on käytettävä, agentteja käynnistetään todennäköisemmin vain tilanteissa, joissa tokenien lisäkulutus parantaa suorituskykyä.
Koko malliperheessä kehotteen välimuistin TTL on pidennetty vähintään 30 minuuttiin, ja välimuistin katkaisukohdat voidaan nyt määrittää deterministisesti mallin konteksti-ikkunassa. Tämän ansiosta startupit ovat pystyneet parantamaan välimuistin osumatarkkuutta merkittävästi.
Välimuistin katkaisukohtien määrittämisen lisäksi sopivan prompt_cache_key(avautuu uudessa ikkunassa)-arvon jatkuva käyttö lisää todennäköisyyttä, että pyynnöt ohjautuvat samalle päättelymoottorille, joka käsitteli saman etuliitteen aiemmin. Tämä lyhentää viivettä.
Näissä esimerkeissä korostuu se, kuinka paljon agenttien rakentamisen taloudelliset lähtökohdat ovat muuttuneet.
Käyttötapauksissa, joissa aiemmin tarvittiin edistynyt malli joka vaiheessa, voidaan nyt saavuttaa vastaavia tai parempia tuloksia murto-osalla kustannuksista käyttämällä pienempiä malleja, säätämällä päättelypanosta ja tekemällä tehokkaita arkkitehtuurivalintoja.
Odotamme innolla, mitä kaikkea rakennat!
- 2026
- API-alusta
Tietoa kirjoittajista
Tämän oppaan laativat Samarth Madduru(avautuu uudessa ikkunassa), Prashant Mital(avautuu uudessa ikkunassa), Dave Leo(avautuu uudessa ikkunassa) ja Julien Reiman(avautuu uudessa ikkunassa). Opas perustuu heidän kokemuksiinsa tiiviistä yhteistyöstä GPT‑5.6:ta hyödyntävien startupien kanssa aina varhaisesta testauksesta tuotantoon asti.


