GPT‑6 Sol, Luna എന്നിവയെ അവതരിപ്പിക്കുന്നു
നിങ്ങളുടെ ദൈനംദിന ജോലികളിലേക്ക് അത്യാധുനിക ഇൻ്റലിജൻസ് എത്തിക്കാൻ കൂടുതൽ മാർഗങ്ങൾ.
ഈ മാസത്തിന്റെ തുടക്കത്തിൽ, ലോകത്തിലെ ഏറ്റവും ബുദ്ധിശക്തിയുള്ളതും മികച്ച രീതിയിൽ പൊരുത്തപ്പെടുത്തിയതുമായ മോഡലായ GPT‑6 Astra ഞങ്ങൾ അവതരിപ്പിച്ചു. വളരെ സങ്കീർണ്ണവും പ്രധാനപ്പെട്ടതുമായ പ്രോജക്റ്റുകൾക്ക് ഇപ്പോഴും Astra-യുടെ പൂർണ്ണ ശേഷി ആവശ്യമാണെങ്കിലും, വിവിധ തലങ്ങളിലും വേഗതകളിലും ബജറ്റുകളിലുമാണ് ഓരോ ജോലിയും നടക്കുന്നത്.
അതുകൊണ്ടാണ് GPT‑6 Sol, GPT‑6 Luna എന്നിവയിലൂടെ GPT‑6 ലോകം ഞങ്ങൾ വികസിപ്പിക്കുന്നത്. GPT‑6 Astra ഇൻ്റലിജൻസിൻ്റെ ഒരു പുതിയ തലമുറ അവതരിപ്പിച്ചു. ചെലവ് കാര്യക്ഷമതയിൽ അത്യാധുനിക നിലവാരം മുന്നോട്ടുകൊണ്ടുപോയി, ആ ഇൻ്റലിജൻസിൻ്റെ നേട്ടങ്ങൾ കൂടുതൽ വ്യാപകമാക്കാൻ ഈ മോഡലുകൾ സഹായിക്കുന്നു. GPT‑6 Astra-യ്ക്ക് സമാനമായ രീതികളിലാണ് GPT‑6 Sol, Luna എന്നിവയെ ഞങ്ങൾ പരിശീലിപ്പിച്ചത്. പ്രൊഫഷണൽ ജോലി, വസ്തുതാപരമായ കൃത്യത, കോഡിംഗ്, കമ്പ്യൂട്ടർ ഉപയോഗം, പൊരുത്തപ്പെടുത്തൽ എന്നിവയിൽ Astra-യുടെ അത്യാധുനിക പ്രകടനത്തിന് പിന്നിലുള്ള മുന്നേറ്റങ്ങൾ ഇതിലൂടെ കൂടുതൽ വേഗമേറിയതും താങ്ങാനാവുന്നതുമായ മോഡലുകളിലേക്ക് എത്തുന്നു.
ഓരോ നിരയിലും അസാധാരണമായ ശേഷികളും അവയെ കാര്യക്ഷമമായി വലിയ തോതിൽ ലഭ്യമാക്കുന്ന അടിസ്ഥാനസൗകര്യവും സംയോജിപ്പിച്ച്, ചെലവും ഇൻ്റലിജൻസും തമ്മിലുള്ള അനുപാതത്തിൽ GPT‑6 മോഡലുകൾ മുന്നിലാണ്. കാഷിംഗിലെയും അനുമാന നിർവഹണത്തിലെയും മെച്ചപ്പെടുത്തലുകൾ കുറഞ്ഞ ചെലവിൽ ഈ മോഡലുകൾ ലഭ്യമാക്കാൻ സഹായിക്കുന്നു. GPT‑5.6-ൻ്റെ പ്രചാരണവിലയുമായി താരതമ്യം ചെയ്യുമ്പോൾ Sol, Luna എന്നിവയുടെ API വില 50% കുറച്ചുകൊണ്ട് ആ ലാഭം ഞങ്ങൾ ഉപയോക്താക്കൾക്കും ഉപഭോക്താക്കൾക്കും നേരിട്ട് കൈമാറുന്നു. ഈ മെച്ചപ്പെടുത്തലുകൾ ഒരുമിച്ച്, കൂടുതൽ ദൈനംദിന ടാസ്ക്കിനും വലിയ തോതിലുള്ള പ്രയോഗങ്ങൾക്കും നൂതന AI പ്രായോഗികമാക്കുന്നു.
മോഡൽ | ഇൻപുട്ട് | ഔട്ട്പുട്ട് | വിലക്കുറവ് |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% വിലക്കുറവ് |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% വിലക്കുറവ് |
വിലകൾ 10 ലക്ഷം ടോക്കണുകൾക്കുള്ളതാണ്.
എല്ലാ മേഖലകളിലും GPT‑6 Astra തന്നെയാണ് ഞങ്ങളുടെ മികച്ച മോഡൽ. മികച്ച ഫലങ്ങളും വിട്ടുവീഴ്ചയില്ലാത്ത അനുഭവവും വേണ്ടപ്പോൾ ഇത് തിരഞ്ഞെടുക്കുക.
സങ്കീർണമായ ജോലികൾ പൂർത്തിയാക്കാൻ ഏറ്റവും ഉപകാരപ്രദമായ ശേഷികളിലുടനീളം, നിങ്ങൾ ഇതിനകം അറിയുകയും ഉപയോഗിക്കുകയും ചെയ്യുന്ന മോഡലുകളിലേക്ക് മെച്ചപ്പെട്ട ഇൻ്റലിജൻസും ചെലവ് കാര്യക്ഷമതയും GPT‑6 Sol, Luna എന്നിവ കൊണ്ടുവരുന്നു.
ഉയർന്ന ഉപയോഗപരിധികളും കുറഞ്ഞ ചെലവും മൂലം ആവർത്തിച്ച് മെച്ചപ്പെടുത്താൻ കൂടുതൽ അവസരം നൽകിക്കൊണ്ട് GPT‑6 Sol-ന് പ്രയാസമേറിയ ടാസ്ക്കുകൾ ഏറ്റെടുക്കാം. സമാന വിലയുള്ള എതിരാളി മോഡലുകളേക്കാൾ കൂടുതൽ ഇൻ്റലിജൻസും മികച്ച ഫലങ്ങളും ഇത് നൽകുന്നു.
വിവിധ ആപ്പുകളിലുടനീളമുള്ള ബിസിനസ്സ് വർക്ക്ഫ്ലോകൾ വിലയിരുത്തുന്ന AutomationBench-ൽ, വലിയ പരിശ്രമത്തിൽ പ്രവർത്തിക്കുന്ന GPT‑6 Sol, Opus 5-ന്റെ ഒരു ടാസ്ക്കിനുള്ള ചെലവിന്റെ വെറും 9% മാത്രം ചെലവിൽ പരമാവധി പരിശ്രമത്തിൽ പ്രവർത്തിക്കുന്ന Claude Opus 5-നേക്കാൾ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്നു. ഉയർന്ന പരിശമത്തിൽ പ്രവർത്തിക്കുമ്പോൾ, GPT‑6 Luna അതിന്റെ മുൻഗാമിയേക്കാൾ 5.4 ശതമാനം പോയിന്റ് മെച്ചപ്പെടുകയും, ഓരോ ടാസ്ക്കിനുമുള്ള ചെലവിൽ 58% കുറവ് വരുത്തുകയും ചെയ്യുന്നു.
AutomationBench 1.0.6(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-ൽ, വിൽപ്പന, വിപണനം, പ്രവർത്തനങ്ങൾ, പിന്തുണ, ധനകാര്യം, മാനവവിഭവശേഷി എന്നിവയിലായി 47 ഉപകരണങ്ങൾ ഉപയോഗിക്കുന്ന സമ്പൂർണ പ്രവർത്തനക്രമങ്ങളിൽ AI ഏജൻ്റുകളെ പരിശോധിക്കുന്നു. ഏകദേശം 40% ടാസ്ക്കുകളിൽ ഉപയോഗിച്ച Opus 5 പകരംസംവിധാനങ്ങളുടെ ചെലവ് ഒഴിവാക്കിയതിനാൽ, Claude Fable 5.1-ൻ്റെ ഡാറ്റാ പോയിൻ്റ് യഥാർഥ ചെലവിനെക്കാൾ കുറവാണ്.
വളരെ കുറഞ്ഞ ചെലവിൽ GPT‑6 Sol, Claude Fable 5.1-നെയും മറികടക്കുന്നു. കുറഞ്ഞ ശ്രമനിലയിലുള്ള GPT‑6 Astra-യെപ്പോലും അത് പിന്നിലാക്കുന്നു.
മോഡൽ, ശ്രമനില | സ്കോർ | ഓരോ ടാസ്ക്കിനുമുള്ള ചെലവ് |
|---|---|---|
GPT‑6 Sol (അത്യുയർന്നത്) | 33.2% | $0.27 |
GPT‑6 Astra (താഴ്ന്നത്) | 30.3% | GPT‑6 Sol-ൻ്റെ 3.9 മടങ്ങ് |
Claude Opus 5 (പരമാവധി) | 26.9% | GPT‑6 Sol-ൻ്റെ 11.1 മടങ്ങ് |
Opus 5 പകരം സംവിധാനമുള്ള Claude Fable 5.1 (പരമാവധി) | 31.4% | GPT‑6 Sol-ൻ്റെ >8.9 മടങ്ങ് (പകരംസംവിധാനത്തിൻ്റെ ചെലവ് റിപ്പോർട്ട് ചെയ്തിട്ടില്ല) |
സങ്കീർണ്ണമായ പ്രൊഫഷണൽ വർക്ക്ഫ്ലോകളിൽ ഏജന്റുകളെ വിലയിരുത്തുന്ന Agents’ Last Exam-ൽ, പരമാവധി പരിശ്രമത്തിൽ പ്രവർത്തിക്കുന്ന GPT‑6 Sol 56.4% സ്കോർ നേടുന്നു; ഇത് ഓരോ ടാസ്ക്കിനുമുള്ള ചെലവിൽ 60% കുറവോടെ Claude Opus 5 ഈ മൂല്യനിർണ്ണയത്തിൽ നേടിയ ഏറ്റവും ഉയർന്ന സ്കോറിനേക്കാൾ മുൻപിലാണ്.
Agents’ Last Exam V1(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-ൽ, കമ്പ്യൂട്ടറിൽ നിർവഹിക്കുന്ന പ്രൊഫഷണൽ ടാസ്ക്കുകളുടെ മിക്ക പ്രധാന മേഖലകളും ഉൾക്കൊള്ളുന്ന 55 ഉപവ്യവസായങ്ങളിലെ ദീർഘകാലവും സാമ്പത്തിക മൂല്യമുള്ളതുമായ ജോലികളിൽ AI ഏജൻ്റുകളെ വിലയിരുത്തുന്നു.
ഒരു ഉത്തരത്തിൻ്റെ പ്രയോജനം അതിലെ വസ്തുതകളുടെ കൃത്യതയെ ആശ്രയിച്ചിരിക്കുന്നു. വസ്തുതാപരമായ വിശ്വാസ്യതയിൽ ഞങ്ങൾ തുടർന്നും പുരോഗതി കൈവരിക്കുന്നു. ഞങ്ങളുടെ മോഡലുകളുടെ പിശകുകൾ ഉപയോക്താക്കൾ ചൂണ്ടിക്കാട്ടിയ, തിരിച്ചറിയൽ വിവരങ്ങൾ നീക്കിയ യഥാർഥ സംഭാഷണങ്ങളെ അടിസ്ഥാനമാക്കിയുള്ള ആഭ്യന്തര വസ്തുതാപരമായ വിലയിരുത്തലിൽ, GPT‑6 Sol അതിൻ്റെ മുൻഗാമിയുടെ പകുതിയോളം പിശകുകൾ മാത്രമാണ് വരുത്തുന്നത്. വളരെ കുറഞ്ഞ ചെലവിൽ ഇത് Astra-യുടെ വിശ്വാസ്യതയോട് അടുക്കുന്നു. GPT‑6 Luna-യും ഗണ്യമായി മെച്ചപ്പെടുന്നു. ഉയർന്ന ശ്രമനിലകളിൽ, ചെലവിൻ്റെ ഏകദേശം നൂറിലൊന്നിൽ അത് GPT‑5.6 Sol-ന് തുല്യമായ പ്രകടനം നൽകുന്നു.
മുൻ മോഡലിൻ്റെ വസ്തുതാപരമായ പിശക് ഉപയോക്താക്കൾ ചൂണ്ടിക്കാട്ടിയ, തിരിച്ചറിയൽ വിവരങ്ങൾ നീക്കിയ ChatGPT സംഭാഷണങ്ങളിലാണ് ഇവിടെ കൃത്യത വിലയിരുത്തുന്നത്. പിശകുകൾ ഉളവാക്കുന്ന ഈ സംഭാഷണങ്ങൾ, വസ്തുതാപരമായ പിശകുകൾ വളരെ അപൂർവമായ സാധാരണ ഉപയോഗത്തെ പ്രതിനിധീകരിക്കുന്നില്ല. ഉത്തരങ്ങളുടെ ദൈർഘ്യം കണക്കിലെടുത്ത് സ്കോറുകൾ ക്രമീകരിച്ചിട്ടില്ല. എന്നാൽ വിശദതയുടെ വിവിധ നിലകളിൽ നടത്തിയ പരിശോധനയിൽ ഉത്തരത്തിൻ്റെ ദൈർഘ്യവുമായി കാര്യമായ ബന്ധമൊന്നും കണ്ടെത്തിയില്ല.
മുമ്പെക്കാളും കൂടുതൽ സങ്കീർണവും വിപുലവും ദൈർഘ്യമേറിയതുമായ ടാസ്ക്കുകൾ കോഡിംഗ് ഏജൻ്റുകൾ ഈ വർഷം ഏറ്റെടുത്തുതുടങ്ങി. OpenAI-യിലെ ഞങ്ങളുടെ ആഭ്യന്തര ഉപയോഗം അതിവേഗം വർധിച്ചു. API വിലയിൽ കണക്കാക്കുമ്പോൾ, മധ്യനിലയിലുള്ള ഗവേഷകൻ്റെ പ്രതിദിന ടോക്കൺ ഉപയോഗം $600-ഉം 90-ാം ശതമാനകത്തിലുള്ള ഗവേഷകരുടേത് $7,000-ഉം കവിഞ്ഞു (ഗവേഷണത്തിൻ്റെ വേഗവർധന: OpenAI-യുടെ അകത്തുനിന്നുള്ള കാഴ്ച). കോഡിംഗ് ഏജൻ്റുകൾ കൂടുതൽ ദൈർഘ്യമേറിയതും പ്രയാസമേറിയതുമായ ടാസ്ക്കുകൾ ഏറ്റെടുക്കുമ്പോൾ, തുടർച്ചയായ ഉപയോഗത്തിൻ്റെ ചെലവ് കൂടുതൽ പ്രധാനമാകുന്നു. ശക്തമായ കോഡിംഗ് പ്രകടനവും കുറഞ്ഞ API വിലയും GPT‑6 Sol, Luna എന്നിവ സംയോജിപ്പിക്കുന്നു. ഇത് ഡെവലപ്പർമാർക്ക് ആവർത്തിച്ച് മെച്ചപ്പെടുത്താൻ കൂടുതൽ അവസരവും Codex-നെ ഏൽപ്പിക്കുന്ന ജോലികളിൽ കൂടുതൽ ലക്ഷ്യബോധത്തോടെ മുന്നേറാൻ ടീമുകൾക്ക് ആത്മവിശ്വാസവും നൽകുന്നു.
യഥാർഥ കോഡ് ശേഖരങ്ങളിൽ ലയിപ്പിക്കാൻ തയ്യാറായ മാറ്റങ്ങൾ കോഡിംഗ് ഏജൻ്റുകൾ സൃഷ്ടിക്കുന്നുണ്ടോ എന്ന് വിലയിരുത്തുന്ന FrontierCode-ൽ, GPT‑6 Sol, GPT‑5.6 Sol-നെക്കാൾ ഗണ്യമായി മെച്ചപ്പെടുകയും വളരെ കുറഞ്ഞ ചെലവിൽ വലിയ പരിശ്രമത്തിൽ പ്രവർത്തിക്കുന്ന Claude Fable 5.1-ന് തുല്യമാകുകയും ചെയ്യുന്നു.
FrontierCode 1.1 Main(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-ൽ, AI ഏജൻ്റുകൾ എഴുതുന്ന കോഡ് കൃത്യതയുടെ അടിസ്ഥാനത്തിൽ മാത്രമല്ല, ലയിപ്പിക്കാനുള്ള യോഗ്യതയുടെ അടിസ്ഥാനത്തിലും വിലയിരുത്തപ്പെടുന്നു. ഉദാഹരണത്തിന്, പരിശോധനകളുടെ ഗുണമേന്മ, പരിധിയിലെ അച്ചടക്കം, കോഡ് ശൈലി, കോഡ് ശേഖരത്തിൻ്റെ മാനദണ്ഡങ്ങൾ പാലിക്കൽ എന്നിവ പരിശോധിക്കുന്നു.
യഥാർത്ഥ കോഡ്ബേസുകളിലെ സങ്കീർണ്ണമായ സോഫ്റ്റ്വെയർ എഞ്ചിനീയറിംഗ് ജോലികളിലെ പ്രകടനം പരിശോധിക്കുന്ന DeepSWE v1.1 -ൽ, പരമാവധി പരിശ്രമത്തിൽ പ്രവർത്തിക്കുന്ന GPT‑6 Sol 68.8% സ്കോർ നേടുന്നു; ഇത് ഈ മൂല്യനിർണ്ണയത്തിൽ Claude Fable 5 നേടിയ ഏറ്റവും ഉയർന്ന സ്കോറായ—വലിയ പരിശ്രമത്തിൽ പ്രവർത്തിക്കുന്ന 69.9%-ൽ നിന്ന് വെറും 1.1 ശതമാനം പോയിന്റ് മാത്രം വ്യത്യാസത്തിലാണ്—കൂടാതെ ഓരോ ടാസ്ക്കിനുമുള്ള ചെലവിൽ ഏകദേശം 80% കുറവുമുണ്ട്.
പരമാവധി പരിശ്രമത്തിൽ GPT‑6 Luna 66.6% സ്കോർ നേടുന്നു. ഇത് മാധ്യമം ശ്രമനിലയിലുള്ള Claude Opus 5, Fable 5 എന്നിവയ്ക്ക് സമാനമാണ്. ഈ താരതമ്യങ്ങളിൽ, ഓരോ ടാസ്ക്കിനും Luna-യുടെ ചെലവ് Opus 5-നെക്കാൾ 93%-ഉം Fable 5-നെക്കാൾ 96%-ഉം കുറവാണ്.
DeepSWE 1.1(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-ൽ, AI ഏജൻ്റുകൾ പുതുമയുള്ളതും ദീർഘകാലം നീളുന്നതുമായ സോഫ്റ്റ്വെയർ എൻജിനീയറിംഗ് ടാസ്ക്കുകൾ പരിഹരിക്കുന്നു.
കമ്പ്യൂട്ടർ ഉപയോഗത്തിൽ ലോകത്തിലെ മികച്ച മോഡലായി GPT‑6 Astra തുടരുമ്പോഴും, മുൻഗാമികളേക്കാൾ ചെലവ് കാര്യക്ഷമമായ പ്രകടനം GPT‑6 Sol, Luna എന്നിവ നൽകുന്നു. OSWorld 2.0 ഓഫ്ലൈൻ വിലയിരുത്തലിൽ, വലിയ പരിശ്രമത്തിൽ പ്രവർത്തിക്കുന്ന GPT‑6 Sol, മാധ്യമം ശ്രമനിലയിലുള്ള Claude Opus 5-ന് സമാനമായ സ്കോർ നേടുന്നു. 60.5%-നെതിരെ 60.3%. ഓരോ ടാസ്ക്കിനും ഏകദേശം 80% കുറഞ്ഞ ചെലവിലാണ് ഇത്. ചെലവിൻ്റെ പത്തിലൊന്നിൽ, GPT‑6 Luna-യ്ക്ക് (പരമാവധി) GPT‑5.6 Sol-നെ (മാധ്യമം) മറികടക്കാനാകും.
OSWorld 2.0(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-ൽ, ദൈനംദിനവും പ്രൊഫഷണലുമായ ടാസ്ക്കുകൾ ഉൾപ്പെടുന്ന ദീർഘകാല കമ്പ്യൂട്ടർ ഉപയോഗ പ്രവർത്തനക്രമങ്ങൾ AI ഏജൻ്റുകൾ പൂർത്തിയാക്കാൻ ശ്രമിക്കുന്നു. v2026.08.08 പതിപ്പിലെ ഓഫ്ലൈൻ ഗണത്തിൽ ലഭിച്ച ഭാഗിക പ്രതിഫലമാണ് ഞങ്ങൾ റിപ്പോർട്ട് ചെയ്യുന്നത്.
GPT‑6 Astra-യുടെ മെച്ചപ്പെട്ട ആശയവിനിമയ ശൈലി Sol, Luna എന്നിവയിലേക്കും ഞങ്ങൾ കൊണ്ടുവന്നു. സാങ്കേതികവും കോഡിംഗുമായി ബന്ധപ്പെട്ടതുമായ സംഭാഷണങ്ങളിൽ ഇത് പ്രത്യേകിച്ചും പ്രകടമാകുമെന്ന് ഞങ്ങൾ കരുതുന്നു. ആശയസമ്പുഷ്ടത നഷ്ടപ്പെടാതെ കൂടുതൽ വ്യക്തതയും കുറഞ്ഞ സാങ്കേതിക പദപ്രയോഗവും അസ്വാഭാവികമായ പ്രയോഗങ്ങളും പ്രയോജനം കുറഞ്ഞ വിശദാംശങ്ങളും കുറച്ച, മൊത്തത്തിൽ അൽപ്പം ഹ്രസ്വമായ ഉത്തരങ്ങളും പ്രതീക്ഷിക്കാം.
ശൈലി വ്യക്തിനിഷ്ഠമാണെങ്കിലും, ഇവിടെ GPT‑6 Sol-ൻ്റെ മറുപടിയാണ് ഞങ്ങൾ ഇഷ്ടപ്പെടുന്നത്. അത് പെട്ടെന്ന് നിഗമനത്തിലെത്തുന്നില്ല, ചോദിച്ചയാൾക്ക് വ്യക്തമായിരിക്കാവുന്ന വിശദാംശങ്ങൾ ആവർത്തിക്കാൻ കുറച്ച് സമയം മാത്രം ചെലവഴിക്കുന്നു, അവ്യക്തമായ ഭാഷ കുറച്ച് ഉപയോഗിക്കുന്നു, പരിശോധിച്ചതും പരിശോധിക്കാത്തതും കൂടുതൽ തുറന്നുപറയുന്നു, ചിത്രനിർമാണ ഉപകരണത്തിനുള്ള പ്രോംപ്റ്റ് പോലുള്ള നിർവഹണ വിശദാംശങ്ങൾ അനാവശ്യമായി പങ്കിടുന്നുമില്ല.
കുറഞ്ഞ ടോക്കൺ വിലയ്ക്കൊപ്പം, GPT‑6 ഉപയോഗിച്ച് നിർമ്മിക്കുന്ന ഡെവലപ്പർമാരുടെ ആപ്പുകൾ പുനരുപയോഗിക്കുന്ന സന്ദർഭവിവരത്തിലും കൂടുതൽ ലാഭിക്കാൻ ഞങ്ങൾ സഹായിക്കുന്നു. GPT‑6‑ൻ്റെ പ്രോംപ്റ്റ് കാഷിംഗ് ഞങ്ങൾ മെച്ചപ്പെടുത്തി. ഇതിലൂടെ സ്ഥിരസ്ഥിതിയായി കൂടുതൽ കാഷെ പൊരുത്തങ്ങൾ ലഭിക്കുകയും ഏജൻ്റുകൾക്ക് കൂടുതൽ സന്ദർഭവിവരം പുനരുപയോഗിക്കാനും വേഗത്തിൽ പ്രതികരിക്കാനും കാഷെ ചെയ്ത ഇൻപുട്ട് ടോക്കണുകൾ വായിക്കുന്നതിൽ 90% വിലക്കുറവ് നേടാനും കഴിയുന്നു.
കാഷിംഗ് പ്രകടനം അളക്കാനും മെച്ചപ്പെടുത്താനും ഡെവലപ്പർമാർക്ക് കൂടുതൽ മാർഗങ്ങളുമുണ്ട്:
നിരീക്ഷിക്കുകയും പ്രശ്നം കണ്ടെത്തുകയും ചെയ്യുക. എത്രത്തോളം ഇൻപുട്ട് കാഷ് ചെയ്തിട്ടുണ്ടെന്നും കാലക്രമേണ അത് എങ്ങനെ മാറുന്നുവെന്നും പ്രോംപ്റ്റ് കാഷിംഗ് ഡാഷ്ബോർഡ്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) കാണിക്കുന്നു. കാഷിംഗ് ചെയ്യാനുള്ള നഷ്ടപ്പെട്ട അവസരങ്ങളും പരിഹരിക്കേണ്ട കാര്യങ്ങളും വിശദീകരിക്കാൻ പ്രശ്നനിർണയ ഉപകരണം(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) സഹായിക്കുന്നു.
കാഷെ തകർക്കാതെ റീസണിംഗ് ശ്രമനിലയും ഉപകരണലഭ്യതയും ക്രമീകരിക്കുക. കഠിനമായ ടാസ്ക്കുകൾക്കായി റീസണിംഗ് ശ്രമനില(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) കൂട്ടുകയോ ലളിതമായ തുടർചോദ്യങ്ങൾക്കായി കുറയ്ക്കുകയോ ചെയ്യാം. ഏജൻ്റിൻ്റെ ആവശ്യങ്ങൾ മാറുന്നതിനനുസരിച്ച് ഉപകരണങ്ങൾ പ്രവർത്തനക്ഷമമാക്കുകയോ പ്രവർത്തനരഹിതമാക്കുകയോ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ചെയ്യാം. കാഷ് പുനരുപയോഗത്തിനായി മുൻ സന്ദർഭവിവരം ഇപ്പോൾ രണ്ട് നിയന്ത്രണങ്ങളും നിലനിർത്തുന്നു.
കാഷെ ചെയ്യേണ്ട പ്രാരംഭ ഭാഗങ്ങൾ മെച്ചപ്പെടുത്തുക. കാഷ് ചെയ്ത പ്രോംപ്റ്റിൻ്റെ പ്രാരംഭ ഭാഗങ്ങൾ എവിടെ അവസാനിക്കണമെന്ന് വ്യക്തമായ ഇടവേളകൾ ഉപയോഗിച്ച് ഡെവലപ്പർമാർക്ക് തിരഞ്ഞെടുക്കാം. ഇത് കാഷെ പുനരുപയോഗത്തിൽ ഡെവലപ്പർമാർക്ക് കൂടുതൽ നിയന്ത്രണം നൽകുകയും പ്രകടനം മെച്ചപ്പെടുത്തുകയും ചെയ്യും.
കഴിഞ്ഞ ഏതാനും മാസങ്ങളിൽ, OpenAI മോഡലുകളിലേക്കുള്ള ശതകോടിക്കണക്കിന് അഭ്യർഥനകളിൽ പുതുതായി പ്രോസസ്സ് ചെയ്യേണ്ട പ്രോംപ്റ്റ് ടോക്കണുകളുടെ വിഹിതം ഈ മെച്ചപ്പെടുത്തലുകൾ 50%-ത്തിലധികം കുറച്ചതായി GitHub റിപ്പോർട്ട് ചെയ്യുന്നു. ഇത് Copilot-നെ വേഗത്തിൽ പ്രതികരിക്കാൻ സഹായിക്കുന്നു.
ഇതുവരെയുള്ള ഞങ്ങളുടെ ഏറ്റവും മികച്ച രീതിയിൽ പൊരുത്തപ്പെടുത്തിയ മോഡലായ Astra-യിലൂടെ അവതരിപ്പിച്ച പ്രവർത്തനങ്ങളെ അടിസ്ഥാനമാക്കിയാണ് GPT‑6 Sol, Luna എന്നിവ നിർമ്മിച്ചിരിക്കുന്നത്. ഞങ്ങളുടെ പൊരുത്തപ്പെടുത്തൽ വിലയിരുത്തലുകളിൽ, കോഡിംഗ് ജോലിയെക്കുറിച്ചുള്ള തെറ്റിദ്ധരിപ്പിക്കുന്ന അവകാശവാദങ്ങളുടെ കുറഞ്ഞ നിരക്ക് ഉൾപ്പെടെ, Sol, Luna എന്നിവ അവയുടെ GPT‑5.6 പതിപ്പുകളേക്കാൾ മെച്ചപ്പെട്ട പ്രകടനം കാണിക്കുന്നു.
താഴെയുള്ള വിലയിരുത്തലുകൾ മനഃപൂർവം വെല്ലുവിളിയേറിയ സാഹചര്യങ്ങളാണ് പരിശോധിക്കുന്നത്. സാധാരണ ഉപയോഗത്തിലെ പരാജയനിരക്ക് ഇവ അളക്കുന്നില്ല. പൂർണ ഫലങ്ങൾക്ക് സിസ്റ്റം കാർഡ്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) കാണുക.
എല്ലാ Plus, Pro, Business, Enterprise, Edu ഉപയോക്താക്കൾക്കും GPT‑6 Sol, GPT‑6 Luna എന്നിവ ഇന്ന് മുതൽ ChatGPT ജോലിയിലും Codex-ലും ലഭ്യമാണ്. Free, Go ഉപയോക്താക്കൾക്ക് ഡെസ്ക്ടോപ്പ് ആപ്പിൽ GPT‑6 Luna ഉപയോഗിക്കാം. ഈ മോഡലുകൾ ചാറ്റിൽ ഇതുവരെ ലഭ്യമല്ല. OpenAI API-യിൽ ഇവ gpt-6-sol, gpt-6-luna എന്നീ പേരുകളിൽ ലഭ്യമാണ്.
എല്ലാവർക്കും സേവനം സ്ഥിരതയോടെ ലഭ്യമാക്കാൻ, ഈ മോഡലുകൾ ദിവസം മുഴുവൻ ഘട്ടംഘട്ടമായി ChatGPT‑യിൽ പുറത്തിറക്കാനാണ് പദ്ധതി. ChatGPT ജോലിയിലോ Codex-ലോ പുതിയ മോഡലുകൾ കാണുന്നില്ലെങ്കിൽ, പിന്നീട് വീണ്ടും ശ്രമിക്കുക.
GPT‑യുടെ വിലയിരുത്തലുകൾ ഞങ്ങളുടെ ഗവേഷണ പരിതസ്ഥിതിയിലോ API വഴിയോ ആണ് നടത്തിയത്. സിസ്റ്റം പ്രോംപ്റ്റുകൾ, ലഭ്യമായ ഉപകരണങ്ങൾ തുടങ്ങിയവയിലെ വ്യത്യാസങ്ങൾ കാരണം ഇവ പ്രവർത്തനത്തിലുള്ള ChatGPT‑യിൽനിന്ന് അൽപ്പം വ്യത്യസ്തമായ ഔട്ട്പുട്ട് നൽകിയേക്കാം. എതിരാളി മോഡലുകളുടെ വിലയിരുത്തലുകൾ പൊതുവായി ലഭ്യമായ റിപ്പോർട്ടുകളിൽനിന്നാണ് എടുത്തത്. Claude Fable 5.1-ൻ്റെ സ്കോറുകൾ ലഭ്യമല്ലാത്തപ്പോൾ Claude Fable 5-ൻ്റെ സ്കോറുകളാണ് റിപ്പോർട്ട് ചെയ്തത്.


