GPT‑5.6 అత్యాధునిక ఇంటెలిజెన్స్ను అత్యాధునిక సామర్థ్యంతో ఎలా కలిపింది
ప్రజలు మా మోడళ్లను ఉపయోగించే అన్ని రకాల పనుల్లో సామర్థ్యం, ఖర్చును సమతుల్యం చేసేలా GPT‑5.6 మోడల్ కుటుంబాన్ని రూపొందించాం. మ్యాక్స్ రీజనింగ్తో కూడిన మా ఫ్లాగ్షిప్ మోడల్ GPT‑5.6 Sol, సగం కంటే తక్కువ ఖర్చుతో Artificial Analysis Coding Agent Indexలో Claude Fable 5 కంటే మెరుగైన పనితీరు చూపుతుంది. ఇంటెలిజెన్స్ బెంచ్మార్క్లలో Terra సగం ధరకు GPT‑5.5తో సమానంగా పనిచేస్తుంది. Luna మా అత్యంత వేగవంతమైన, చవకైన మోడల్. దీని ధర Sol ఖర్చు కంటే 80% తక్కువ. ఈ సామర్థ్యాలను అందించేందుకు, మా పరిశోధన, సాంకేతిక బృందాలు మా సాంకేతిక వ్యవస్థలోని ప్రతి ప్రధాన పొరలో గణనీయమైన ఆప్టిమైజేషన్లు చేశాయి. ఈ మెరుగుదలలు మా మోడళ్లు, ఇన్ఫరెన్స్—అవుట్పుట్ రూపొందించేందుకు మోడళ్లను నడిపే విధానం—అలాగే Codex, ChatGPT Work రెండూ ఉపయోగించే మా ఏజెంట్ ఆధారిత హార్నెస్ వరకు విస్తరించాయి.
గత నాలుగేళ్లలో మా మోడళ్లను 100 కోట్ల క్రియాశీల వినియోగదారులకు, 20 లక్షలకు పైగా వ్యాపారాలకు విస్తరించిన క్రమంలో, ఇంటెలిజెన్స్ ప్రయోజనాలను అందరికీ అందించడంలో సామర్థ్యం ప్రధానంగా నిలిచింది. ఆర్టిఫిషియల్ జనరల్ ఇంటెలిజెన్స్ మానవాళి అందరికీ ప్రయోజనం చేకూర్చేలా చూడటమే మా లక్ష్యం. ఈ సంవత్సరాల్లో, ఖర్చు-ఇంటెలిజెన్స్ వక్రరేఖలో ప్రతి స్థాయిలో అత్యుత్తమ పనితీరు గల మోడళ్లను అందించేందుకు మా సాంకేతిక వ్యవస్థ అంతటా మరింత మెరుగైన ఆప్టిమైజేషన్లను నిరంతరం సాధించడానికి కృషి చేశాం. ఒక్కో టోకెన్తో ఎక్కువ పని సాధించేలా శిక్షణ పొందిన GPT‑5.6 ద్వారా ఇప్పటివరకు మా అత్యుత్తమ టోకెన్కు ఇంటెలిజెన్స్ సామర్థ్యాన్ని సాధించాం. శిక్షణలో పని విజయవంతం కావడం, సామర్థ్యం రెండింటినీ ఆప్టిమైజ్ చేసి, మోడల్ ఒక పనిని మరింత నేరుగా పూర్తి చేసేలా తీర్చిదిద్దుతాం.
ఈ పోస్ట్ మా మోడళ్లకు మించి, సాంకేతిక వ్యవస్థలోని మరో రెండు ప్రధాన భాగాల పురోగతితో సామర్థ్యాన్ని ఎలా రూపొందించామో వివరిస్తుంది. 1) అదే హార్డ్వేర్ నుంచి ఎక్కువ అవుట్పుట్ పొందేందుకు లోడ్ బ్యాలెన్సింగ్, ఊహాత్మక డీకోడింగ్, క్యాషింగ్, కెర్నల్ ఆప్టిమైజేషన్ వంటి ప్రక్రియలను మెరుగుపరిచే ఇన్ఫరెన్స్. 2) కాంటెక్స్ట్ అనవసర పెరుగుదల, సాధన వినియోగం, పునరావృత పనిని మెరుగ్గా నిర్వహించే మా ఏజెంట్ ఆధారిత హార్నెస్. ఈ ప్రయోజనాల్లో అనేకం స్వయంప్రతిపత్తితో సాధించడంలో GPT‑5.6 Sol పోషించిన పాత్రను కూడా వివరిస్తాం. ఒక్కో మెరుగుదల విడిగా పరిమితంగా అనిపించినా, ఈ ప్రయోజనాలు కలసి ఇంటెలిజెన్స్, సామర్థ్యం రెండింటిలోనూ అత్యాధునిక స్థాయిని అందించడానికి తోడ్పడతాయి.
కంప్యూటింగ్ సామర్థ్యం కంటే మోడల్ డిమాండ్ వేగంగా పెరుగుతున్న, వనరుల పరిమితులు గల ప్రపంచంలో ప్రతి వ్యవస్థ రూపకల్పనకు సామర్థ్యమే కీలకం. ప్రతిస్పందనలను రూపొందించేందుకు శిక్షణ పొందిన మోడళ్లను అమలు చేసే మా ఇన్ఫరెన్స్ సాంకేతిక వ్యవస్థలో ఇది మరీ ముఖ్యమైనది. వినియోగదారులు ఆశించే ఇంటెలిజెన్స్, జాప్యం, లభ్యత, విశ్వసనీయతను కొనసాగిస్తూనే అదే హార్డ్వేర్తో మరిన్ని టోకెన్లను అందించడం మా ప్రధాన లక్ష్యం.
దీన్ని సాధించాలంటే మొత్తం వ్యవస్థను ఆప్టిమైజ్ చేయాలి. ఒక మోడల్ విడిగా చాలా సమర్థంగా ఉన్నా, అభ్యర్థనల పంపిణీ సరిగా లేకపోతే, హార్డ్వేర్ ఖాళీగా ఉంటే లేదా డేటా తరలింపు గణనను నెమ్మదింపజేస్తే దాన్ని అందించడం ఖరీదైనదే కావచ్చు. ప్రతి పొరలోని మెరుగుదలలు కలసి మరింత ప్రయోజనాన్ని ఇస్తాయి. రూటింగ్లో అభ్యర్థనలు ఎక్కడికి పంపాలి, షెడ్యూలింగ్లో ఎప్పుడు పంపాలి, కెర్నల్లలో GPUలపై నడిచే సాఫ్ట్వేర్, క్యాషింగ్లో పనిని దాచి మళ్లీ ఉపయోగించడం, మోడల్ అమలులో GPU కోడ్ క్రమం వంటి ఆప్టిమైజేషన్ల నుంచి ఈ ప్రయోజనాలు వస్తాయి. ఈ ఆప్టిమైజేషన్లన్నింటిలో Codexలోని GPT‑5.6 Sol కీలక పాత్ర పోషించింది.
మొదటి ముఖ్యమైన ఉదాహరణ లోడ్ బ్యాలెన్సింగ్. ప్రపంచవ్యాప్తంగా ప్రాంతం, అందుబాటులోని సామర్థ్యం, యాక్సిలరేటర్ రకం—అంటే మోడల్ను నడిపే GPU లేదా ప్రత్యేక చిప్ రకం—వంటి అంశాల ఆధారంగా అభ్యర్థనలను రూట్ చేస్తాం. ఒక క్లస్టర్లో లోడ్, కాంటెక్స్ట్ పొడవు, క్యాష్ లభ్యత, ఇతర అభ్యర్థన లక్షణాల ఆధారంగా మోడల్ ఇన్స్టాన్స్ల మధ్య పనిని పంపిణీ చేస్తాం. ఆపై ప్రతి ఇన్స్టాన్స్లో యాక్సిలరేటర్లు, మోడల్ ఉపనెట్వర్క్లు, కంప్యూటింగ్ కోర్ల మధ్య పనిని సమర్థంగా విభజించాలి. Codexలోని GPT‑5.6 Sol ఉత్పత్తి ట్రాఫిక్ను విశ్లేషించడానికి, గతంలో గుర్తించని అసమతుల్యత మూలాలను కనుగొనడానికి, కొత్త రూటింగ్ వ్యూహాలను పరీక్షించడానికి, ఈ అనుభవాధారిత నియమాలను నిరంతరం సర్దుబాటు చేయడానికి మాకు సహాయపడుతుంది. ఈ లోడ్ బ్యాలెన్సింగ్ మెరుగుదలలతోనే మా మోడళ్లను అందించే ఖర్చు గణనీయంగా తగ్గింది.
ఇన్పుట్లను తదుపరి టోకెన్ అంచనాలుగా మార్చే గణన అయిన మోడల్ ఫార్వర్డ్ పాస్ను ఆప్టిమైజ్ చేయడానికి కూడా GPT‑5.6 Solను ఉపయోగించాం. ఒక్కో ఆపరేషన్ వేగంగా ఉన్నప్పటికీ, అధిక మెమరీ తరలింపు, సమకాలీకరణ, అసమర్థ డేటా అమరికలు GPUలను ఖాళీగా ఉంచగలవు. దీన్ని నివారించేందుకు ముందే గణించగల, తప్పించగల లేదా సమాంతరంగా చేయగల పనిని GPT‑5.6 Sol గుర్తించింది. Codexతో కలిసి GPT‑5.6 Sol మా ఉత్పత్తి కెర్నల్లను స్వయంప్రతిపత్తితో తిరిగి రాసి ఆప్టిమైజ్ చేసింది. మోడల్ను రూపొందించే గణిత ఆపరేషన్లను అమలు చేసే ప్రధాన కోడ్ ఇవే. OpenAI నిర్వహించే రెండు ఓపెన్ సోర్స్ GPU ప్రోగ్రామింగ్ భాషలైన Triton(కొత్త విండోలో తెరుచుకుంటుంది), Gluon(కొత్త విండోలో తెరుచుకుంటుంది)లలో కెర్నల్లను సమర్థంగా రాయడానికి, మెరుగుపరచడానికి GPT‑5.6కు శిక్షణ ఇచ్చినందువల్ల ఇది కొంతవరకు సాధ్యమైంది. GPT‑5.6 Sol సాధించిన విస్తృత కెర్నల్ పురోగతులతో కలిపి ఈ ప్రయత్నాలు మొత్తం సేవా ఖర్చులను 20% తగ్గించాయి. GPT‑5.6 Sol రాసిన కెర్నల్ల ఖచ్చితత్వాన్ని ధ్రువీకరించడంలో సహాయపడేందుకు, ఓపెన్ సోర్స్ సాధనం FpSan(కొత్త విండోలో తెరుచుకుంటుంది) (ఫ్లోటింగ్-పాయింట్ శానిటైజర్) వంటి ధ్రువీకరణ సాధనాల్లో కూడా భారీగా పెట్టుబడి పెట్టాం.
ఊహాత్మక డీకోడింగ్ వేగం, సామర్థ్యాన్ని మెరుగుపరిచే మరో మార్గం. ఈ పద్ధతిలో ప్రధాన మోడల్తో పాటు చిన్న ముసాయిదా లేదా అంచనా మోడల్ను నడిపి, ప్రధాన మోడల్ సమాంతరంగా ధ్రువీకరించేందుకు అనేక టోకెన్లను ప్రతిపాదిస్తారు. ఆ ప్రతిపాదనలు ఆమోదించబడితే, ఒకే ప్రధాన మోడల్ పాస్ నుంచి వ్యవస్థ అనేక అవుట్పుట్ టోకెన్లను రూపొందించగలదు. దీంతో ఖరీదైన వరుస గణన తగ్గుతుంది. GPT‑5.6 Sol తన నిర్మాణంపై వందలాది ప్రయోగాలను రూపొందించి అమలు చేస్తూ, పరిమాణం, నిర్మాణం, లక్షణాల్లో మార్పులను పరీక్షించి తన ముసాయిదా మోడల్ను మెరుగుపరచుకుంది. అదనంగా, GPT‑5.6 Sol అంచనా మోడల్ శిక్షణ ప్రక్రియను ప్రారంభించి పర్యవేక్షించింది. హార్డ్వేర్ వైఫల్యాలు, శిక్షణ అస్థిరత సహా సమస్యలు తలెత్తినప్పుడు స్వయంప్రతిపత్తితో జోక్యం చేసుకుంది. ఫలితంగా వచ్చిన మెరుగుదలలు టోకెన్ ఉత్పత్తి సామర్థ్యాన్ని 15% కంటే ఎక్కువ పెంచాయి.
క్యాష్ చేయని ఇన్పుట్ టోకెన్లను ప్రాసెస్ చేస్తున్నప్పుడు, మోడల్ అధిక కంప్యూటింగ్ అవసరమయ్యే ఒకే పాస్లో కీ-వాల్యూ (KV) క్యాష్ను రూపొందిస్తుంది. అవుట్పుట్ను రూపొందించేటప్పుడు ఆ క్యాష్ నుంచి పదేపదే చదివి దాన్ని విస్తరిస్తుంది. బ్యాచింగ్, షార్డింగ్, KV నిర్వహణ వంటి సరైన సేవా కాన్ఫిగరేషన్ పనిభారంపై ఎక్కువగా ఆధారపడి ఉంటుంది. ఇందులో ప్రాంప్ట్, అవుట్పుట్ పొడవు, బ్యాచ్ పరిమాణం, క్యాష్ హిట్ రేటు, క్వెరీ లక్షణాలు మొదలైనవి ఉంటాయి. అయితే గతంలో కాన్ఫిగరేషన్ పరిధి క్రమబద్ధంగా సర్దుబాటు చేయలేనంత పెద్దగా ఉండేది. అందువల్ల ఇంజినీర్లు విస్తృత అనుభవాధారిత నియమాలపై ఆధారపడాల్సి వచ్చేది. Codexలోని GPT‑5.6 Solతో ఉత్పత్తి పనిభారాలను విశ్లేషించి, సాధ్యమైన కాన్ఫిగరేషన్లను రూపొందించి మూల్యాంకనం చేయగలిగాం. ప్రతి సందర్భానికి ఇంజిన్, మోడల్ కాన్ఫిగరేషన్ను అత్యంత సూక్ష్మంగా ఆప్టిమైజ్ చేయగలిగాం. దీంతో పనిభారానికి ప్రత్యేకమైన కొత్త స్థాయి ఆప్టిమైజేషన్ ఆచరణ సాధ్యమై, అదే హార్డ్వేర్ నుంచి మరింత ఉపయోగకరమైన ఇన్ఫరెన్స్ లభిస్తుంది.
ఇన్ఫరెన్స్ ఆప్టిమైజేషన్ నిరంతర ప్రతిస్పందన చక్రం. ఉత్పత్తి వాతావరణంలోని పనితీరును కొలిచి, అతిపెద్ద లోపాలను గుర్తించి, మార్పులను అమలు చేస్తాం. అవి ఒక విడి బెంచ్మార్క్ను మాత్రమే కాకుండా మొత్తం వ్యవస్థను మెరుగుపరుస్తున్నాయని ధ్రువీకరిస్తాం. GPT‑5.6 Sol, Codex ఆ చక్రంలోని ప్రతి భాగాన్ని వేగవంతం చేస్తాయి. దీంతో మా బృందం మరిన్ని ఆలోచనలను పరిశీలించగలదు, మారుతున్న పనిభారాలకు వేగంగా స్పందించగలదు, వినియోగదారుల కోసం తక్కువ జాప్యం, ఎక్కువ సామర్థ్యం, తక్కువ ఖర్చులు గల ఇన్ఫరెన్స్ సాంకేతిక వ్యవస్థను రూపొందించగలదు.
ChatGPT Work, Codex వరుస మోడల్ అభ్యర్థనలు, సాధన కాల్ల ద్వారా సంక్లిష్ట పనులను పూర్తి చేస్తాయి. వినియోగదారు అభ్యర్థన నుంచి తుది ప్రతిస్పందన వరకు ఒకే వంతులో Codex సోర్స్ కోడ్ను పరిశీలించవచ్చు, డిప్లాయ్మెంట్ చరిత్రలో వెతకవచ్చు, ఘటన నివేదికలను చదవవచ్చు, ఫైల్ను సవరించవచ్చు, పరీక్షలను అమలు చేయవచ్చు. ప్రతి దశకు ఒక అభ్యర్థన అవసరం కావచ్చు.
కాంటెక్స్ట్ను సిద్ధం చేయడం, డేటాను పంపడం, ఇన్ఫరెన్స్ను అమలు చేయడం, సాధనాలను కాల్ చేయడం, ప్రాసెస్లను ప్రారంభించడం—వీటన్నింటికీ సమయం, కంప్యూటింగ్ వనరులు అవసరం. ఒక పనికి 30 మోడల్ అభ్యర్థనలు అవసరమైతే, ప్రతి అభ్యర్థనకు అదనంగా పట్టే ఒక్క సెకను కూడా కలిపితే గణనీయమవుతుంది. మొత్తం పనితీరును మెరుగుపరచాలంటే మోడల్ను వేగవంతం చేయడం మాత్రమే కాకుండా, వ్యవస్థ అంతటా పునరావృత పనిని తగ్గించాలి.
ఒక వినియోగదారు వంతులో మోడల్, సాధనం మధ్య అనేక పునరావృత దశలు ఉండవచ్చు. పునరావృతమయ్యే పరిధిలోని ఏ ఖర్చయినా చాలాసార్లు చెల్లించాల్సి రావచ్చు.
ఈ గుణక ప్రభావాలను దృష్టిలో ఉంచుకొని మా ఏజెంట్ ఆధారిత హార్నెస్ను రూపొందించాం. ఇది మా మోడళ్లు, సాధనాలు, వినియోగదారు పరిసరాలను అనుసంధానించే Rust సమన్వయ పొర. తర్వాత, కాంటెక్స్ట్ అనవసరంగా పెరగకుండా చూడటం, సాధనాలను లోడ్ చేయడం, పనిని మళ్లీ ఉపయోగించడం ద్వారా ప్రతి అభ్యర్థనను ఎలా మరింత సమర్థంగా చేస్తామో వివరిస్తాం.
ఏజెంట్లకు మరిన్ని సాధనాలు, నైపుణ్యాలు, ప్లగిన్లు, సంభాషణ చరిత్ర అందుబాటులోకి వస్తున్నకొద్దీ కాంటెక్స్ట్ విండోలు సులభంగా విస్తరించగలవు. ఇది ఖర్చును పెంచి, మోడల్ దృష్టిని మళ్లించి, అనవసరమైన రీజనింగ్ను ప్రేరేపిస్తుంది. అవసరమైనప్పుడు మాత్రమే అనుసంధానాలు, అనుకూల MCP సాధనాలు, నైపుణ్యాలు, ప్లగిన్లు కనిపించేలా చేసే వాయిదా వేసిన అన్వేషణ ద్వారా హార్నెస్ ఈ అదనపు భారాన్ని తగ్గించగలదు. ఒక్కో సాధనం, MCP అనుసంధానం అనూహ్యంగా కాంటెక్స్ట్ విండోను వినియోగించకుండా కూడా హార్నెస్ నిరోధిస్తుంది. మోడల్ వేరే పరిమితిని కోరితే తప్ప, సాధన అవుట్పుట్కు డిఫాల్ట్గా 10,000 టోకెన్ల పరిమితి ఉంటుంది.
ముందు పేర్కొన్నట్లుగా, ఒక ఏజెంట్ లూప్ ఒకే వంతులో అవే సూచనలు, సంభాషణ చరిత్ర, సాధన నిర్వచనాలు, మునుపటి ఫలితాలను GPUలకు పలుమార్లు పంపగలదు. పునరావృతమయ్యే ఈ ఇన్పుట్ల ప్రాసెసింగ్ ఖరీదైనది. అందుకే ప్రాంప్ట్ క్యాషింగ్ గతంలో ప్రాసెస్ చేసిన ప్రాంప్ట్ ప్రిఫిక్స్కు సంబంధించిన గణనను మళ్లీ ఉపయోగిస్తుంది. ఆ ప్రిఫిక్స్ను పరిరక్షించేందుకు, మోడల్కు కనిపించే చరిత్ర మొత్తాన్ని హార్నెస్ చివర మాత్రమే జోడించగలిగేదిగా పరిగణిస్తుంది. కొత్త సందేశాలు, సాధన ఫలితాలు, పరిసరాల నవీకరణలను మునుపటి కాంటెక్స్ట్లో చొప్పించకుండా చివరలో జోడిస్తుంది. సాధనాలను కూడా స్థిరమైన క్రమంలో అందిస్తారు. ఆమోద విధానాల వంటి రన్టైమ్ సెట్టింగ్లను సాధన నిర్వచనాల్లో చేర్చకుండా అమలు సమయంలో వర్తింపజేస్తారు. ఈ రూపకల్పన నిర్ణయం Codex, ChatGPT Workలో ప్రాంప్ట్ క్యాష్ హిట్ రేట్లు మొత్తంగా ఎక్కువగా ఉండటానికి దోహదపడుతుంది.
దశలవారీ రవాణా నెట్వర్క్ ద్వారా వెళ్లే దాన్ని మారుస్తుంది. ప్రాంప్ట్ క్యాషింగ్, మోడల్ మళ్లీ లెక్కించకుండా ఉండగల దాన్ని మారుస్తుంది. వెడల్పులు భావనాత్మకమైనవి. అదనపు కుదింపు పొరను చూపలేదు.
GPT‑5.6తో మేము సాధించిన సామర్థ్య ప్రయోజనాలు పరిశోధన, ఇన్ఫరెన్స్, మా ఏజెంట్ ఆధారిత హార్నెస్ సహా మొత్తం సాంకేతిక వ్యవస్థలో ఏళ్లుగా పేరుకుపోయిన మెరుగుదలల ఫలితం. ఈ మెరుగుదలల్లో అనేకం సాధించడంలో GPT‑5.6 పోషించిన పాత్ర, ఆప్టిమైజేషన్ల వేగం మరింత పెరుగుతుందనే ఆశాభావాన్ని మాకు కలిగిస్తోంది. మా సాంకేతిక వ్యవస్థలో మౌలిక మెరుగుదలలతో పాటు, కెర్నల్ ఆప్టిమైజేషన్ వంటి రంగాల్లో ఇంకా మెరుగైన ఆప్టిమైజేషన్లను కొనసాగిస్తాం. అంతర్గతంగా కొనసాగుతున్న ఈ మెరుగుదలలను మరింత విస్తృతంగా లభించే, ఖర్చుకు తగిన ఇంటెలిజెన్స్ రూపంలో మా వినియోగదారులకు, కస్టమర్లకు అందించాలని ఎదురుచూస్తున్నాం.
ఈ పోస్ట్కు సహకరించిన సాంకేతిక సిబ్బంది Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson, Steve Coffeyలకు ప్రత్యేక కృతజ్ఞతలు.


