Ghidul modelelor din familia GPT‑6
Sfaturi practice pentru a obține cele mai bune rezultate cu modelele GPT‑6, gestionând timpul și costurile
GPT‑6 este cea mai avansată suită de modele a noastră de până acum și îți oferă modele pentru diferite tipuri de activități.
Fie că transformi o idee într-un prototip funcțional, dezvolți și testezi o funcționalitate sau orchestrezi fluxuri de lucru cu mai mulți pași în depozite de cod, baze de date și API-uri externe, acest ghid explică cum să alegi un model GPT‑6, să-i dai instrucțiuni eficiente, să gestionezi activități de durată și să te pregătești pentru producție.

Rulează eficient în producție. Folosește memorarea în cache(se deschide într-o fereastră nouă) și compactarea(se deschide într-o fereastră nouă) pentru a gestiona contextul și costurile. Măsoară succesul sarcinilor și latența și planifică monitorizarea și controalele asupra datelor.
Alege modelul potrivit pentru activitatea ta. Echilibrează capacitatea, costul și latența alegând modelul, efortul de raţionament(se deschide într-o fereastră nouă) și viteza potrivite sarcinii.
Ajustează solicitările și abilitățile. Asigură-te că solicitările, abilitățile și instrucțiunile din depozit sunt consecvente privind ce trebuie să livreze modelul, ce poate face independent și când se consideră sarcina încheiată.
Menține activitățile de durată pe direcția corectă. Folosește ghidarea(se deschide într-o fereastră nouă), instrumentele asincrone(se deschide într-o fereastră nouă) și delegarea(se deschide într-o fereastră nouă) pentru a gestiona actualizările și activitățile independente. Stabilește clar când trebuie modelul să-ți ceară părerea.
Înainte de implementare, pune în aplicare câteva verificări și bune practici.
Ține cont de eficiență. (se deschide într-o fereastră nouă)Elimină contextul inutil pentru sarcină(se deschide într-o fereastră nouă), păstrând dovezile necesare. Dacă aplicația permite, rulează simultan sarcinile independente(se deschide într-o fereastră nouă), astfel încât un pas lent să nu blocheze activități fără legătură cu el.
Reutilizează contextul comun prin memorarea în cache a prompturilor(se deschide într-o fereastră nouă) pentru activitățile recurente. Tokenurile de intrare memorate în cache costă cu până la 95% mai puțin(se deschide într-o fereastră nouă) decât cele nememorate în cache, în funcție de model. Plasează instrucțiunile stabile și materialele de referință înaintea detaliilor variabile ale sarcinii și păstrează consecvența definițiilor instrumentelor. Tabloul de bord pentru memorarea în cache(se deschide într-o fereastră nouă) și ghidul de diagnosticare(se deschide într-o fereastră nouă) te ajută să vezi unde nu mai funcționează această reutilizare. Include scrierile în cache și eventualele tarife pentru contexte lungi când estimezi costul unui flux de lucru complet.
Pentru conversațiile mai lungi, compactarea(se deschide într-o fereastră nouă) reduce dimensiunea contextului, păstrând starea necesară continuării.
Decide cum vei monitoriza comportamentul(se deschide într-o fereastră nouă) și examinează controalele asupra datelor(se deschide într-o fereastră nouă) pentru aplicația ta.
Testează înainte de implementare: rulează sarcini reprezentative și măsoară succesul, latența și costul per sarcină reușită. Consultă lista noastră de verificare pentru implementarea API(se deschide într-o fereastră nouă).
Privește alegerea modelului și a nivelului de raţionament ca pe un compromis între inteligență și preț.
Model:
GPT‑6 Astra(se deschide într-o fereastră nouă) pentru cele mai dificile sarcini de raţionament, care necesită inteligență maximă.
GPT‑6.1 Sol(se deschide într-o fereastră nouă) pentru sarcini complexe de programare, cercetare și utilizare a computerului.
GPT‑6 Luna(se deschide într-o fereastră nouă) pentru sarcini punctuale la scară largă și activități cotidiene repetitive cu un scop clar, precum extragerea câmpurilor din facturi, clasificarea cererilor sau crearea de rezumate structurate.
Când evaluezi modelul potrivit pentru sarcină, compară prețurile(se deschide într-o fereastră nouă) fiecărui model.
Nivel de raţionament: În API, alege cât efort dedică modelul sarcinii.
Scăzută: sarcini de rutină, precum extragerea informațiilor sau mici modificări.
Medie: activități care cer discernământ, precum planificarea unei funcționalități sau compararea opțiunilor.
Ridicată: depanare dificilă, analiză aprofundată sau verificare atentă.
Foarte ridicată / Max: testează aceste opțiuni acolo unde sunt acceptate, când Ridicată nu este suficientă, și păstrează-le doar dacă îmbunătățirea justifică timpul și costul suplimentare.
În API, poți schimba efortul de raţionament în timpul conversației(se deschide într-o fereastră nouă) fără a invalida memoria cache.
În Codex, începe cu nivelul de raţionament implicit al modelului, apoi redu-l pentru sarcini mai simple sau mărește-l pentru analize aprofundate.
Viteză:
În API, folosește modul rapid(se deschide într-o fereastră nouă) când timpul de răspuns contează, de exemplu în aplicații de chat sau instrumente de programare. Oferă timpi de răspuns mai scurți și mai constanți, la un cost per token mai mare decât procesarea Standard.
În Codex și API, folosește Ultrarapid(se deschide într-o fereastră nouă) când răspunsurile mai rapide merită costul suplimentar, de exemplu pentru iterații rapide de programare. Accelerează generarea tokenurilor independent de efortul de raţionament. Disponibil pentru GPT‑6 Astra(se deschide într-o fereastră nouă).

Începe cu o sarcină clară: rezultatul dorit, cui îi este destinat, contextul și constrângerile relevante și criteriile de finalizare. Apoi examinează aceste patru aspecte, rezumate din Regândirea abilităților și solicitărilor pentru GPT‑6 Astra(se deschide într-o fereastră nouă), pentru a aprofunda modul de actualizare a instrucțiunilor:
Creează abilități mai bune: Folosește descrieri scurte care precizează când trebuie activată fiecare abilitate, încarcă detalii suplimentare doar la nevoie și înlocuiește rețetele rigide cu îndrumări adaptate modelelor folosite de echipa ta.
Actualizează fișierul AGENTS.md: Explică când sunt relevante anumite documente și teste și autorizează explicit fluxurile de rutină sigure, precum rularea testelor locale cu date temporare și fără acces la producție.
Stabilește limitele de decizie: Precizează ce acțiuni pot continua independent și care necesită aprobare, înlocuind regulile generale de tipul „întreabă întotdeauna” cu limite clare.
Precizează până unde trebuie continuată munca: Definește ce înseamnă „finalizat” — implementarea modificării, rularea ei, verificarea rezultatului și remedierea erorilor — și identifică deciziile care necesită verificarea ta.
Pentru îndrumări suplimentare, consultă bunele practici pentru raţionament(se deschide într-o fereastră nouă).
Fie că lucrezi în Codex sau dezvolți cu API-ul, precizează ce decizii poate lua modelul, când trebuie să-ți ceară părerea și cum arată un răspuns util.
Oferă-i modelului suficiente îndrumări pentru a continua lucrul fără a lua decizii importante pe baza presupunerilor. (se deschide într-o fereastră nouă)Spune-i ce poate decide și când trebuie să-ți ceară părerea(se deschide într-o fereastră nouă). De exemplu, poate alege cum să organizeze un rezumat, dar trebuie să te consulte înainte de a schimba amploarea proiectului. (se deschide într-o fereastră nouă)Descrie cum arată un răspuns util(se deschide într-o fereastră nouă): de exemplu, limbaj simplu, detalii tehnice adaptate publicului și un scurt raport final despre ce s-a schimbat, ce s-a verificat și ce mai necesită atenție.
Cu familia de modele GPT‑6, poți aborda acum sarcini care durează ore sau zile. Folosește următoarele funcționalități pentru a gestiona mai bine agenții care execută sarcini de durată.
În API, folosește ghidarea, instrumentele asincrone și lucrul în paralel pentru a asigura progresul sarcinilor de durată.
Actualizează instrucțiunile în timpul rulării: Ghidarea în timpul unui tur de conversație(se deschide într-o fereastră nouă) îți permite să trimiți o corecție prin API-ul WebSocket Responses(se deschide într-o fereastră nouă) în timp ce modelul lucrează. Actualizările sunt puse în coadă; nu anulează instrumentele în curs de rulare și nu revocă acțiunile finalizate.
Continuă lucrul în timp ce rulează un instrument: Apelarea asincronă a instrumentelor(se deschide într-o fereastră nouă) permite modelului să continue activități independente în timp ce aplicația ta execută o sarcină mai lentă, precum testele. Aplicația ta returnează rezultatul când este gata. Așteaptă acel rezultat înainte de a începe activitățile care depind de el.
Deleagă subsarcini independente: GPT‑6.1 Sol acceptă fluxuri de lucru cu mai mulți agenți în API-ul Responses(se deschide într-o fereastră nouă). Poate atribui activități independente subagenților (precum investigarea diferitelor părți ale unei baze de cod) și le poate reuni concluziile într-un răspuns final. Funcționalitatea cu mai mulți agenți este momentan în versiune beta.
Sarcinile de durată pot aduce în prim-plan decizii pe care nu le-ai fi anticipat neapărat în solicitarea inițială. Folosește clarificarea și ghidarea pentru a menține lucrul pe direcția corectă.
Răspunde la întrebări pe măsură ce lucrul avansează: Cu GPT‑6 Astra, Codex poate cere clarificări în timp ce lucrează(se deschide într-o fereastră nouă). Clarifică întrebările care influențează pasul următor și precizează ce activități independente pot continua până iei o decizie. Dacă vei lipsi, spune-i lui Codex ce sarcini pot continua și când trebuie să se oprească pentru a aștepta răspunsul tău.
Redirecționează lucrul când cerințele se schimbă: Ghidează sarcina activă(se deschide într-o fereastră nouă) cu informații noi, explicând ce trebuie schimbat și ce trebuie să rămână la fel. Astfel, eviți să mai pierzi timp cu o abordare care nu îți mai satisface nevoile.

Utilizarea computerului(se deschide într-o fereastră nouă) permite modelelor GPT‑6 Astra, GPT‑6.1 Sol și GPT‑6 Luna să interacționeze direct cu site-uri și aplicații desktop, chiar și cu aplicații fără API. De exemplu, îi poți cere modelului să investigheze o eroare, să corecteze codul și să deschidă produsul tău într-un browser pentru a verifica dacă remedierea funcționează.
Alege cea mai simplă metodă fiabilă pentru fiecare pas:
Folosește un API sau un instrument conectat dacă poate îndeplini sarcina direct.
Apelează la utilizarea computerului când modelul trebuie să citească un ecran, să facă clic pe butoane sau să completeze un formular pentru tine.
Dacă integrezi utilizarea computerului în propria aplicație, oferă-i modelului un instrument care poate rula cod pentru a controla un browser sau un mediu desktop. Playwright funcționează cu browsere(se deschide într-o fereastră nouă); PyAutoGUI funcționează cu aplicații desktop.



