GPT‑6 Sol ಮತ್ತು Luna ಪರಿಚಯ
ನಿಮ್ಮ ದೈನಂದಿನ ಕೆಲಸಕ್ಕೆ ಅತ್ಯಾಧುನಿಕ ಇಂಟೆಲಿಜೆನ್ಸ್ ತರಲು ಇನ್ನಷ್ಟು ಮಾರ್ಗಗಳು.
ಈ ತಿಂಗಳ ಆರಂಭದಲ್ಲಿ, ವಿಶ್ವದ ಅತ್ಯಂತ ಬುದ್ಧಿವಂತ ಮತ್ತು ಹೊಂದಾಣಿಕೆಯ ಮಾಡೆಲ್ ಆದ GPT‑6 Astra ಅನ್ನು ನಾವು ಪರಿಚಯಿಸಿದ್ದೇವೆ. ಅತ್ಯಂತ ಸವಾಲಿನ ಮತ್ತು ಪ್ರಮುಖ ಯೋಜನೆಗಳಿಗೆ ಇನ್ನೂ Astra ದ ಸಂಪೂರ್ಣ ಆಳ ಅಗತ್ಯವಾದರೂ, ಕೆಲಸವು ವಿಭಿನ್ನ ಪ್ರಮಾಣ, ವೇಗ ಮತ್ತು ಬಜೆಟ್ಗಳಲ್ಲಿ ನಡೆಯುತ್ತದೆ.
ಆದ್ದರಿಂದ ನಾವು GPT‑6 ವಿಶ್ವವನ್ನು GPT‑6 Sol ಮತ್ತು GPT‑6 Luna ಗಳೊಂದಿಗೆ ವಿಸ್ತರಿಸುತ್ತಿದ್ದೇವೆ. GPT‑6 Astra ಹೊಸ ತಲೆಮಾರಿನ ಇಂಟೆಲಿಜೆನ್ಸ್ ಅನ್ನು ಪರಿಚಯಿಸಿತು. ಈ ಮಾಡೆಲ್ಗಳು ವೆಚ್ಚದಕ್ಷತೆಯನ್ನು ಅತ್ಯಾಧುನಿಕ ಮಟ್ಟಕ್ಕೆ ಕೊಂಡೊಯ್ಯುವ ಮೂಲಕ ಆ ಇಂಟೆಲಿಜೆನ್ಸ್ನ ಪ್ರಯೋಜನಗಳನ್ನು ಹೆಚ್ಚು ಜನರಿಗೆ ತಲುಪಿಸುತ್ತವೆ. ವೃತ್ತಿಪರ ಕೆಲಸ, ವಾಸ್ತವಿಕತೆ, ಕೋಡಿಂಗ್, ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ ಮತ್ತು ಹೊಂದಾಣಿಕೆಯಲ್ಲಿ Astra ದ ಅತ್ಯಾಧುನಿಕ ಕಾರ್ಯಕ್ಷಮತೆಗೆ ಕಾರಣವಾದ ಪ್ರಗತಿಗಳನ್ನು ವೇಗವಾದ, ಹೆಚ್ಚು ಕೈಗೆಟಕುವ ಮಾಡೆಲ್ಗಳಿಗೆ ತರಲು, GPT‑6 Astra ಗೆ ಬಳಸಿದಂತಹ ವಿಧಾನಗಳಿಂದಲೇ GPT‑6 Sol ಮತ್ತು Luna ಗೆ ತರಬೇತಿ ನೀಡಿದ್ದೇವೆ.
GPT‑6 ಮಾಡೆಲ್ಗಳು ವೆಚ್ಚ–ಇಂಟೆಲಿಜೆನ್ಸ್ ವಕ್ರದಾದ್ಯಂತ ಮುಂಚೂಣಿಯಲ್ಲಿದ್ದು, ಪ್ರತಿ ಹಂತದಲ್ಲೂ ಅಸಾಧಾರಣ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ದಕ್ಷವಾಗಿ ಒದಗಿಸುವ ಮೂಲಸೌಕರ್ಯದೊಂದಿಗೆ ಸಂಯೋಜಿಸುತ್ತವೆ. ಕ್ಯಾಶಿಂಗ್ ಮತ್ತು ಇನ್ಫರೆನ್ಸ್ನ ಸುಧಾರಣೆಗಳಿಂದ ಈ ಮಾಡೆಲ್ಗಳನ್ನು ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲಿ ಒದಗಿಸಲು ಸಾಧ್ಯವಾಗಿದೆ. GPT‑5.6 ರ ಪ್ರಚಾರ ದರಗಳಿಗೆ ಹೋಲಿಸಿದರೆ Sol ಮತ್ತು Lunaದ API ಬೆಲೆಗಳನ್ನು 50% ಇಳಿಸುವ ಮೂಲಕ ಆ ಉಳಿತಾಯವನ್ನು ಬಳಕೆದಾರರು ಮತ್ತು ಗ್ರಾಹಕರಿಗೆ ನೇರವಾಗಿ ವರ್ಗಾಯಿಸುತ್ತಿದ್ದೇವೆ. ಒಟ್ಟಾಗಿ, ಈ ಸುಧಾರಣೆಗಳು ಹೆಚ್ಚಿನ ದೈನಂದಿನ ಕಾರ್ಯಗಳು ಮತ್ತು ದೊಡ್ಡ ಪ್ರಮಾಣದ ಅಪ್ಲಿಕೇಶನ್ಗಳಿಗೆ ಸುಧಾರಿತ AI ಬಳಕೆಯನ್ನು ಕಾರ್ಯಸಾಧ್ಯವಾಗಿಸುತ್ತವೆ.
ಮಾಡೆಲ್ | ಇನ್ಪುಟ್ | ಔಟ್ಪುಟ್ | ಬೆಲೆ ಇಳಿಕೆ |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% ಅಗ್ಗ |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% ಅಗ್ಗ |
ಬೆಲೆಗಳು ಪ್ರತಿ 10 ಲಕ್ಷ ಟೋಕನ್ಗಳಿಗೆ ಅನ್ವಯಿಸುತ್ತವೆ.
GPT‑6 Astra ಎಲ್ಲ ಅಂಶಗಳಲ್ಲೂ ನಮ್ಮ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್ ಆಗಿಯೇ ಮುಂದುವರಿದಿದೆ. ಅತ್ಯುತ್ತಮ ಫಲಿತಾಂಶಗಳು ಮತ್ತು ಯಾವುದೇ ರಾಜಿಯಿಲ್ಲದ ಅನುಭವ ಬೇಕಾದಾಗ ಇದನ್ನು ಆರಿಸಿ.
ಸಂಕೀರ್ಣ ಕೆಲಸವನ್ನು ಪೂರ್ಣಗೊಳಿಸಲು ಹೆಚ್ಚು ಉಪಯುಕ್ತವಾದ ಸಾಮರ್ಥ್ಯಗಳಾದ್ಯಂತ, ನಿಮಗೆ ಈಗಾಗಲೇ ಪರಿಚಿತವಾಗಿರುವ ಮಾಡೆಲ್ಗಳಿಗೆ GPT‑6 Sol ಮತ್ತು Luna ಇಂಟೆಲಿಜೆನ್ಸ್ ಸುಧಾರಣೆಗಳು ಹಾಗೂ ವೆಚ್ಚದಕ್ಷತೆಯನ್ನು ತರುತ್ತವೆ.
GPT‑6 Sol ಕಠಿಣ ಕೆಲಸಗಳನ್ನು ನಿಭಾಯಿಸುವುದರ ಜೊತೆಗೆ, ಹೆಚ್ಚಿನ ಬಳಕೆ ಮಿತಿಗಳು ಮತ್ತು ಕಡಿಮೆ ವೆಚ್ಚದ ಮೂಲಕ ಪುನರಾವರ್ತನೆಗೆ ಹೆಚ್ಚು ಅವಕಾಶ ನೀಡುತ್ತದೆ. ಇದೇ ಬೆಲೆಯ ಸ್ಪರ್ಧಿ ಮಾಡೆಲ್ಗಳಿಗಿಂತ ಹೆಚ್ಚು ಇಂಟೆಲಿಜೆನ್ಸ್ ಮತ್ತು ಉತ್ತಮ ಫಲಿತಾಂಶಗಳನ್ನೂ ಒದಗಿಸುತ್ತದೆ.
ಅಪ್ಲಿಕೇಶನ್ಗಳಾದ್ಯಂತ ವ್ಯವಹಾರ ಕಾರ್ಯಪ್ರವಾಹಗಳನ್ನು ಪರೀಕ್ಷಿಸುವ AutomationBenchನಲ್ಲಿ, ಅತ್ಯಂತ ಅಧಿಕ ಶ್ರಮದ GPT‑6 Sol, ಗರಿಷ್ಠ ಶ್ರಮದ Claude Opus 5 ಅನ್ನು ಮೀರಿಸುತ್ತದೆ. ಪ್ರತಿ ಕಾರ್ಯಕ್ಕೆ ಇದರ ವೆಚ್ಚ Opus 5ರ ವೆಚ್ಚದ ಕೇವಲ 9%. ಹೈ ಶ್ರಮದಲ್ಲಿ, GPT‑6 Luna ತನ್ನ ಹಿಂದಿನ ಆವೃತ್ತಿಗಿಂತ 5.4 ಶೇಕಡಾವಾರು ಅಂಕಗಳಷ್ಟು ಸುಧಾರಿಸಿದ್ದು, ಪ್ರತಿ ಕಾರ್ಯದ ವೆಚ್ಚ 58% ಕಡಿಮೆಯಾಗಿದೆ.
AutomationBench 1.0.6(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ,ಮಾರಾಟ, ಮಾರುಕಟ್ಟೆ, ಕಾರ್ಯಾಚರಣೆ, ಬೆಂಬಲ, ಹಣಕಾಸು ಮತ್ತು ಮಾನವ ಸಂಪನ್ಮೂಲ ವಿಭಾಗಗಳ 47 ಪರಿಕರಗಳನ್ನು ಬಳಸುವ ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗಿನ ಕಾರ್ಯಪ್ರವಾಹಗಳಲ್ಲಿ AI ಏಜೆಂಟ್ಗಳನ್ನು ಪರೀಕ್ಷಿಸಲಾಗುತ್ತದೆ. Claude Fable 5.1 ರ ದತ್ತಾಂಶ ಬಿಂದುವು ಅದರ ನೈಜ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆಯಾಗಿ ತೋರಿಸುತ್ತದೆ, ಏಕೆಂದರೆ ಸುಮಾರು 40% ಕಾರ್ಯಗಳಲ್ಲಿ ಬಳಸಿದ Opus 5 ಪರ್ಯಾಯಗಳ ವೆಚ್ಚವನ್ನು ಅದು ಒಳಗೊಂಡಿಲ್ಲ.
GPT‑6 Sol, ಬಹಳ ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲಿ Claude Fable 5.1 ಅನ್ನೂ ಮೀರುತ್ತದೆ ಮತ್ತು ಕಡಿಮೆ ಶ್ರಮದ GPT‑6 Astra ಗಿಂತಲೂ ಉತ್ತಮವಾಗಿದೆ.
ಮಾಡೆಲ್ (ಮತ್ತು ಶ್ರಮ) | ಅಂಕ | ಪ್ರತಿ ಕಾರ್ಯದ ವೆಚ್ಚ |
|---|---|---|
GPT‑6 Sol (ಅತ್ಯಂತ ಅಧಿಕ) | 33.2% | $0.27 |
GPT‑6 Astra (ಕಡಿಮೆ) | 30.3% | GPT‑6 Sol ಗಿಂತ 3.9 ಪಟ್ಟು |
Claude Opus 5 (ಗರಿಷ್ಠ) | 26.9% | GPT‑6 Sol ಗಿಂತ 11.1 ಪಟ್ಟು |
Opus 5 ಪರ್ಯಾಯದೊಂದಿಗೆ Claude Fable 5.1 (ಗರಿಷ್ಠ) | 31.4% | GPT‑6 Sol ಗಿಂತ >8.9 ಪಟ್ಟು (ಪರ್ಯಾಯದ ವೆಚ್ಚ ವರದಿಯಾಗಿಲ್ಲ) |
ಸಂಕೀರ್ಣ ವೃತ್ತಿಪರ ಕಾರ್ಯಪ್ರವಾಹಗಳಲ್ಲಿ ಏಜೆಂಟ್ಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ Agents’ Last Examನಲ್ಲಿ, ಗರಿಷ್ಠ ಶ್ರಮದ GPT‑6 Sol 56.4% ಅಂಕ ಗಳಿಸಿದೆ. ಇದು ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ Claude Opus 5 ಗಳಿಸಿದ ಅತ್ಯಧಿಕ ಅಂಕಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿದ್ದು, ಪ್ರತಿ ಕಾರ್ಯದ ವೆಚ್ಚ 60% ಕಡಿಮೆ.
Agents’ Last Exam V1(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)ನಲ್ಲಿ,ಕಂಪ್ಯೂಟರ್ನಲ್ಲಿ ನಿರ್ವಹಿಸುವ ಬಹುತೇಕ ಪ್ರಮುಖ ವೃತ್ತಿಪರ ಕ್ಷೇತ್ರಗಳನ್ನು ಒಳಗೊಂಡ 55 ಉಪ-ಉದ್ಯಮಗಳ ದೀರ್ಘಾವಧಿಯ, ಆರ್ಥಿಕ ಮೌಲ್ಯವಿರುವ ಕಾರ್ಯಗಳಲ್ಲಿ AI ಏಜೆಂಟ್ಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಾಗುತ್ತದೆ.
ಉತ್ತರದ ಉಪಯುಕ್ತತೆಯು ವಾಸ್ತವಾಂಶಗಳ ನಿಖರತೆಯನ್ನು ಅವಲಂಬಿಸಿದೆ. ವಾಸ್ತವಿಕ ವಿಶ್ವಾಸಾರ್ಹತೆಯನ್ನು ಹೆಚ್ಚಿಸುವಲ್ಲಿ ನಾವು ಪ್ರಗತಿ ಮುಂದುವರಿಸಿದ್ದೇವೆ. ನಮ್ಮ ಮಾಡೆಲ್ಗಳ ತಪ್ಪುಗಳನ್ನು ಬಳಕೆದಾರರು ಗುರುತಿಸಿದ, ಗುರುತು ತೆಗೆದ ನೈಜ ಸಂಭಾಷಣೆಗಳನ್ನು ಆಧರಿಸಿದ ಆಂತರಿಕ ವಾಸ್ತವಿಕತೆ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, GPT‑6 Sol ತನ್ನ ಹಿಂದಿನ ಆವೃತ್ತಿಗಿಂತ ಅರ್ಧದಷ್ಟು ತಪ್ಪುಗಳನ್ನು ಮಾಡುತ್ತದೆ. ಬಹಳ ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲೇ ಅದರ ವಿಶ್ವಾಸಾರ್ಹತೆ Astra ಮಟ್ಟವನ್ನು ಸಮೀಪಿಸುತ್ತದೆ. GPT‑6 Luna ಕೂಡ ಗಣನೀಯವಾಗಿ ಸುಧಾರಿಸಿದೆ. ಹೆಚ್ಚಿನ ಶ್ರಮದ ಹಂತಗಳಲ್ಲಿ, ಸುಮಾರು ನೂರನೇ ಒಂದು ಭಾಗದ ವೆಚ್ಚದಲ್ಲಿ GPT‑5.6 Solಗೆ ಸಮನಾಗಿದೆ.
ಹಿಂದಿನ ಮಾಡೆಲ್ನ ವಾಸ್ತವಿಕ ದೋಷವನ್ನು ಬಳಕೆದಾರರು ಗುರುತಿಸಿದ್ದ, ಗುರುತು ತೆಗೆದ ChatGPT ಸಂಭಾಷಣೆಗಳಲ್ಲಿ ಇಲ್ಲಿ ವಾಸ್ತವಿಕತೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತೇವೆ. ದೋಷ ಉಂಟುಮಾಡುವ ಈ ಸಂಭಾಷಣೆಗಳು ಸಾಮಾನ್ಯ ಬಳಕೆಯನ್ನು ಪ್ರತಿನಿಧಿಸುವುದಿಲ್ಲ; ಸಾಮಾನ್ಯ ಬಳಕೆಯಲ್ಲಿ ವಾಸ್ತವಿಕ ದೋಷಗಳು ಅಪರೂಪ. ಅಂಕಗಳನ್ನು ಉದ್ದಕ್ಕೆ ಅನುಗುಣವಾಗಿ ನಿಯಂತ್ರಿಸಿಲ್ಲ. ಆದರೆ ಉತ್ತರದ ಉದ್ದವು ಫಲಿತಾಂಶದ ಮೇಲೆ ಬಹುತೇಕ ಯಾವುದೇ ಪರಿಣಾಮ ಬೀರುವುದಿಲ್ಲವೆಂದು ನಮ್ಮ ವಿಸ್ತೃತತೆಯ ಪರೀಕ್ಷೆಗಳು ತೋರಿಸಿವೆ.
ಈ ವರ್ಷ, ಕೋಡಿಂಗ್ ಏಜೆಂಟ್ಗಳು ಹಿಂದೆಂದಿಗಿಂತಲೂ ಹೆಚ್ಚು ಸಂಕೀರ್ಣ, ವ್ಯಾಪಕ ಮತ್ತು ದೀರ್ಘಾವಧಿಯ ಕಾರ್ಯಗಳನ್ನು ನಿಭಾಯಿಸಲು ಆರಂಭಿಸಿವೆ. OpenAIನಲ್ಲಿ ನಮ್ಮ ಆಂತರಿಕ ಬಳಕೆ ಘಾತೀಯವಾಗಿ ಬೆಳೆದಿದೆ. API ಬೆಲೆಗಳಲ್ಲಿ ಲೆಕ್ಕಹಾಕಿದಾಗ, ದೈನಂದಿನ ಟೋಕನ್ ಬಳಕೆ ಮಧ್ಯಮ ಸಂಶೋಧಕರಿಗೆ $600 ಮತ್ತು 90ನೇ ಶೇಕಡಾವಾರು ಮಟ್ಟದ ಸಂಶೋಧಕರಿಗೆ $7,000 ಮೀರಿದೆ (ಸಂಶೋಧನೆಯ ವೇಗವರ್ಧನೆ: OpenAI ಒಳಗಿನ ನೋಟ). ಕೋಡಿಂಗ್ ಏಜೆಂಟ್ಗಳು ದೀರ್ಘ ಮತ್ತು ಹೆಚ್ಚು ಸವಾಲಿನ ಕಾರ್ಯಗಳನ್ನು ನಿಭಾಯಿಸುತ್ತಿರುವಂತೆ, ನಿರಂತರ ಬಳಕೆಯ ವೆಚ್ಚವು ಹೆಚ್ಚು ಮುಖ್ಯವಾಗುತ್ತದೆ. GPT‑6 Sol ಮತ್ತು Luna ಪ್ರಬಲ ಕೋಡಿಂಗ್ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಕಡಿಮೆ API ಬೆಲೆಗಳೊಂದಿಗೆ ಸಂಯೋಜಿಸುತ್ತವೆ. ಇದರಿಂದ ಡೆವಲಪರ್ಗಳಿಗೆ ಪುನರಾವರ್ತನೆಗೆ ಹೆಚ್ಚು ಅವಕಾಶ ಮತ್ತು Codex ಗೆ ಹೆಚ್ಚು ಮಹತ್ವಾಕಾಂಕ್ಷೆಯ ಕೆಲಸಗಳನ್ನು ವಹಿಸುವ ವಿಶ್ವಾಸ ತಂಡಗಳಿಗೆ ದೊರೆಯುತ್ತದೆ.
ಕೋಡಿಂಗ್ ಏಜೆಂಟ್ಗಳು ನೈಜ ಕೋಡ್ಬೇಸ್ಗಳಿಗೆ ವಿಲೀನಗೊಳಿಸಲು ಸಿದ್ಧವಾದ ಬದಲಾವಣೆಗಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತವೆಯೇ ಎಂದು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ FrontierCodeನಲ್ಲಿ, GPT‑6 Sol, GPT‑5.6 Sol ಗಿಂತ ಗಣನೀಯವಾಗಿ ಸುಧಾರಿಸಿದೆ ಮತ್ತು ಬಹಳ ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲಿ ಅತ್ಯಂತ ಅಧಿಕ ಶ್ರಮದ Claude Fable 5.1 ಗೆ ಸಮನಾಗಿದೆ.
FrontierCode 1.1 Main(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)ನಲ್ಲಿ, AI ಏಜೆಂಟ್ಗಳು ಬರೆಯುವ ಕೋಡ್ ಅನ್ನು ನಿಖರತೆ ಮಾತ್ರವಲ್ಲದೆ, ಪರೀಕ್ಷೆಯ ಗುಣಮಟ್ಟ, ವ್ಯಾಪ್ತಿಯ ಶಿಸ್ತು, ಕೋಡ್ ಶೈಲಿ ಮತ್ತು ಕೋಡ್ಬೇಸ್ ಮಾನದಂಡಗಳ ಪಾಲನೆಯಂತಹ “ವಿಲೀನಯೋಗ್ಯತೆ” ಆಧಾರದಲ್ಲೂ ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಾಗುತ್ತದೆ.
ನೈಜ ಕೋಡ್ಬೇಸ್ಗಳ ಸಂಕೀರ್ಣ ಸಾಫ್ಟ್ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್ ಕಾರ್ಯಗಳಲ್ಲಿ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಪರೀಕ್ಷಿಸುವ DeepSWE v1.1ನಲ್ಲಿ, ಗರಿಷ್ಠ ಶ್ರಮದ GPT‑6 Sol 68.8% ಅಂಕ ಗಳಿಸಿದೆ. ಇದು ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ ಅತ್ಯಂತ ಅಧಿಕ ಶ್ರಮದ Claude Fable 5 ಗಳಿಸಿದ ಅತ್ಯಧಿಕ 69.9% ಅಂಕಕ್ಕಿಂತ ಕೇವಲ 1.1 ಶೇಕಡಾವಾರು ಅಂಕ ಕಡಿಮೆಯಾಗಿದ್ದು, ಪ್ರತಿ ಕಾರ್ಯದ ವೆಚ್ಚ ಸುಮಾರು 80% ಕಡಿಮೆ.
ಗರಿಷ್ಠ ಶ್ರಮದ GPT‑6 Luna 66.6% ಅಂಕ ಗಳಿಸಿದೆ. ಇದು ಮೀಡಿಯಂ ಶ್ರಮದ Claude Opus 5 ಮತ್ತು Fable 5ಗೆ ಸಮಾನವಾಗಿದೆ. ಈ ಹೋಲಿಕೆಗಳಲ್ಲಿ, ಪ್ರತಿ ಕಾರ್ಯಕ್ಕೆ Luna ದ ವೆಚ್ಚ Opus 5 ಗಿಂತ 93% ಮತ್ತು Fable 5 ಗಿಂತ 96% ಕಡಿಮೆ.
DeepSWE 1.1(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ,AI ಏಜೆಂಟ್ಗಳು ಹೊಸದಾಗಿ ರಚಿಸಿದ, ದೀರ್ಘಾವಧಿಯ ಸಾಫ್ಟ್ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್ ಕಾರ್ಯಗಳನ್ನು ಪರಿಹರಿಸುತ್ತವೆ.
ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಗೆ GPT‑6 Astra ವಿಶ್ವದ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್ ಆಗಿಯೇ ಉಳಿದಿದ್ದರೂ, GPT‑6 Sol ಮತ್ತು Luna ತಮ್ಮ ಹಿಂದಿನ ಆವೃತ್ತಿಗಳಿಗಿಂತ ಹೆಚ್ಚು ವೆಚ್ಚದಕ್ಷ ಕಾರ್ಯಕ್ಷಮತೆ ನೀಡುತ್ತವೆ. OSWorld 2.0 ಆಫ್ಲೈನ್ನಲ್ಲಿ, ಅತ್ಯಂತ ಅಧಿಕ ಶ್ರಮದ GPT‑6 Sol, ಮೀಡಿಯಂ ಶ್ರಮದ Claude Opus 5ಗೆ ಸಮಾನ ಅಂಕ ಗಳಿಸಿದೆ—60.5% ಮತ್ತು 60.3%—ಆದರೆ ಪ್ರತಿ ಕಾರ್ಯದ ವೆಚ್ಚ ಸುಮಾರು 80% ಕಡಿಮೆ. ಗರಿಷ್ಠ ಶ್ರಮದ GPT‑6 Luna, ಹತ್ತನೇ ಒಂದು ಭಾಗದ ವೆಚ್ಚದಲ್ಲಿ ಮೀಡಿಯಂ ಶ್ರಮದ GPT‑5.6 Sol ಅನ್ನು ಮೀರಿಸುತ್ತದೆ.
OSWorld 2.0(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)ನಲ್ಲಿ,AI ಏಜೆಂಟ್ಗಳು ದೈನಂದಿನ ಮತ್ತು ವೃತ್ತಿಪರ ಕಾರ್ಯಗಳನ್ನು ಒಳಗೊಂಡ ದೀರ್ಘಾವಧಿಯ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ಕಾರ್ಯಪ್ರವಾಹಗಳನ್ನು ಪ್ರಯತ್ನಿಸುತ್ತವೆ. v2026.08.08 ಬಿಡುಗಡೆಯ ಆಫ್ಲೈನ್ ಸಮೂಹದ ಭಾಗಶಃ ಪ್ರತಿಫಲವನ್ನು ನಾವು ವರದಿ ಮಾಡುತ್ತೇವೆ.
GPT‑6 Astra ದ ಸುಧಾರಿತ ಸಂವಹನ ಶೈಲಿಯನ್ನು Sol ಮತ್ತು Luna ಗೂ ತಂದಿದ್ದೇವೆ. ವಿಶೇಷವಾಗಿ ತಾಂತ್ರಿಕ ಮತ್ತು ಕೋಡಿಂಗ್ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ ಇದು ಹೆಚ್ಚು ಗಮನಕ್ಕೆ ಬರುತ್ತದೆ ಎಂದು ನಾವು ಭಾವಿಸುತ್ತೇವೆ. ವಿಷಯದ ಸಾರ ಕಳೆದುಕೊಳ್ಳದೆ ಹೆಚ್ಚು ಸ್ಪಷ್ಟತೆ, ಕಡಿಮೆ ಪರಿಭಾಷೆ, ಕಡಿಮೆ ವಿಚಿತ್ರ ಪದಪ್ರಯೋಗ, ಕಡಿಮೆ ಮೌಲ್ಯದ ವಿವರಗಳು ಮತ್ತು ಒಟ್ಟಾರೆ ಸ್ವಲ್ಪ ಚಿಕ್ಕ ಉತ್ತರಗಳನ್ನು ನಿರೀಕ್ಷಿಸಬಹುದು.
ಶೈಲಿ ವ್ಯಕ್ತಿನಿಷ್ಠವಾದರೂ, ಇಲ್ಲಿ GPT‑6 Sol ನ ಉತ್ತರ ನಮಗೆ ಹೆಚ್ಚು ಇಷ್ಟ. ಅದು ಅಷ್ಟು ಬೇಗ ತೀರ್ಮಾನಕ್ಕೆ ಬರುವುದಿಲ್ಲ, ಪ್ರಶ್ನಿಸಿದವರಿಗೆ ಸ್ಪಷ್ಟವಾಗಿರಬಹುದಾದ ವಿವರಗಳನ್ನು ಪುನರಾವರ್ತಿಸಲು ಕಡಿಮೆ ಸಮಯ ವ್ಯಯಿಸುತ್ತದೆ (ಉದಾ., ಜಾಲತಾಣದಲ್ಲಿ ನಾಲ್ಕು ಪುಟಗಳಿವೆ), ಅಸ್ಪಷ್ಟ ಭಾಷೆಯನ್ನು ಕಡಿಮೆ ಬಳಸುತ್ತದೆ (ಉದಾ., “ಬೆಂಟೊ ಅನುಭವ”, “ಆ ವ್ಯವಸ್ಥೆಯ ಸುತ್ತ ಮರುರೂಪಿಸುವುದು”), ತಾನು ಪರಿಶೀಲಿಸಿದ ಮತ್ತು ಪರಿಶೀಲಿಸದ ಅಂಶಗಳನ್ನು ಹೆಚ್ಚು ಮುಕ್ತವಾಗಿ ತಿಳಿಸುತ್ತದೆ ಹಾಗೂ ತನ್ನ ಚಿತ್ರ ಪರಿಕರದ ಪ್ರಾಂಪ್ಟ್ನಂತಹ ಅನುಷ್ಠಾನ ವಿವರಗಳನ್ನು ಅನಗತ್ಯವಾಗಿ ಹಂಚಿಕೊಳ್ಳುವುದಿಲ್ಲ.
ಕಡಿಮೆ ಟೋಕನ್ ಬೆಲೆಗಳ ಜೊತೆಗೆ, GPT‑6 ಆಧರಿಸಿ ನಿರ್ಮಿಸುವ ಡೆವಲಪರ್ಗಳು ತಮ್ಮ ಅಪ್ಲಿಕೇಶನ್ಗಳು ಮರುಬಳಸುವ ಸಂದರ್ಭದ ಮೇಲೂ ಹೆಚ್ಚು ಉಳಿತಾಯ ಮಾಡಲು ಸಹಾಯ ಮಾಡುತ್ತಿದ್ದೇವೆ. ಪೂರ್ವನಿಯೋಜಿತವಾಗಿಯೇ ಹೆಚ್ಚಿನ ಕ್ಯಾಶ್ ಹಿಟ್ ಪ್ರಮಾಣ ನೀಡಲು GPT‑6 ಗಾಗಿ ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ಅನ್ನು ಸುಧಾರಿಸಿದ್ದೇವೆ. ಇದರಿಂದ ಏಜೆಂಟ್ಗಳು ಹೆಚ್ಚಿನ ಸಂದರ್ಭವನ್ನು ಮರುಬಳಸಬಹುದು, ವೇಗವಾಗಿ ಪ್ರತಿಕ್ರಿಯಿಸಬಹುದು ಮತ್ತು ಕ್ಯಾಶ್ ಮಾಡಿದ ಇನ್ಪುಟ್-ಟೋಕನ್ ಓದುವಿಕೆಗಳ ಮೇಲೆ 90% ರಿಯಾಯಿತಿ ಪಡೆಯಬಹುದು.
ಡೆವಲಪರ್ಗಳಿಗೆ ತಮ್ಮ ಕ್ಯಾಶಿಂಗ್ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಅಳೆಯಲು ಮತ್ತು ಅತ್ಯುತ್ತಮಗೊಳಿಸಲು ಇನ್ನಷ್ಟು ಮಾರ್ಗಗಳಿವೆ:
ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಿ ಮತ್ತು ದೋಷನಿರ್ಣಯ ಮಾಡಿ. ಎಷ್ಟು ಇನ್ಪುಟ್ ಕ್ಯಾಶ್ ಆಗಿದೆ ಮತ್ತು ಅದು ಕಾಲಕ್ರಮೇಣ ಹೇಗೆ ಬದಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ಡ್ಯಾಶ್ಬೋರ್ಡ್(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ತೋರಿಸುತ್ತದೆ. ಕ್ಯಾಶಿಂಗ್ ಅವಕಾಶಗಳು ಏಕೆ ತಪ್ಪಿಹೋದವು ಮತ್ತು ಏನು ಸರಿಪಡಿಸಬೇಕು ಎಂಬುದನ್ನು ವಿವರಿಸಲು ದೋಷನಿರ್ಣಯ ಪರಿಕರ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ಕ್ಯಾಶ್ಗೆ ಅಡ್ಡಿಯಾಗದಂತೆ ರೀಜನಿಂಗ್ ಶ್ರಮ ಮತ್ತು ಪರಿಕರಗಳ ಲಭ್ಯತೆಯನ್ನು ಹೊಂದಿಸಿ. ಕಠಿಣ ಕಾರ್ಯಗಳಿಗೆ ರೀಜನಿಂಗ್ ಶ್ರಮವನ್ನು(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಹೆಚ್ಚಿಸಿ ಅಥವಾ ಸರಳ ಅನುಸರಣೆ ಪ್ರಶ್ನೆಗಳಿಗೆ ಕಡಿಮೆ ಮಾಡಿ. ನಿಮ್ಮ ಏಜೆಂಟ್ನ ಅಗತ್ಯಗಳು ಬದಲಾದಂತೆ ಪರಿಕರಗಳನ್ನು ಸಕ್ರಿಯ ಅಥವಾ ನಿಷ್ಕ್ರಿಯಗೊಳಿಸಿ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ). ಈ ಎರಡೂ ನಿಯಂತ್ರಣಗಳು ಈಗ ಕ್ಯಾಶ್ ಮರುಬಳಕೆಗಾಗಿ ಹಿಂದಿನ ಸಂದರ್ಭವನ್ನು ಉಳಿಸುತ್ತವೆ.
ಯಾವ ಪೂರ್ವಪ್ರತ್ಯಯಗಳು ಕ್ಯಾಶ್ ಆಗಬೇಕು ಎಂಬುದನ್ನು ಅತ್ಯುತ್ತಮಗೊಳಿಸಿ. ಸ್ಪಷ್ಟ ವಿರಾಮಬಿಂದುಗಳು ಕ್ಯಾಶ್ ಮಾಡಿದ ಪ್ರಾಂಪ್ಟ್ ಪೂರ್ವಪ್ರತ್ಯಯಗಳು ಎಲ್ಲಿ ಕೊನೆಗೊಳ್ಳಬೇಕು ಎಂಬುದನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ಡೆವಲಪರ್ಗಳಿಗೆ ಅವಕಾಶ ನೀಡುತ್ತವೆ. ಇದು ಕ್ಯಾಶ್ ಮರುಬಳಕೆಯ ಮೇಲೆ ಡೆವಲಪರ್ಗಳಿಗೆ ಹೆಚ್ಚಿನ ನಿಯಂತ್ರಣ ನೀಡಿ, ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸುಧಾರಿಸಬಹುದು.
ಕಳೆದ ಕೆಲವು ತಿಂಗಳಲ್ಲಿ, OpenAI ಮಾಡೆಲ್ಗಳಿಗೆ ಬಂದ ಶತಕೋಟ್ಯಂತರ ವಿನಂತಿಗಳಾದ್ಯಂತ ಹೊಸದಾಗಿ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಬೇಕಾದ ಪ್ರಾಂಪ್ಟ್ ಟೋಕನ್ಗಳ ಪಾಲನ್ನು ಈ ಸುಧಾರಣೆಗಳು 50%ಕ್ಕಿಂತ ಹೆಚ್ಚು ಕಡಿಮೆ ಮಾಡಿವೆ ಎಂದು GitHub ವರದಿ ಮಾಡಿದೆ. ಇದರಿಂದ Copilot ವೇಗವಾಗಿ ಪ್ರತಿಕ್ರಿಯಿಸಲು ಸಾಧ್ಯವಾಗಿದೆ.
GPT‑6 Sol ಮತ್ತು Luna, ಇಲ್ಲಿಯವರೆಗಿನ ನಮ್ಮ ಅತ್ಯಂತ ಹೊಂದಾಣಿಕೆಯ ಮಾಡೆಲ್ ಆದ Astraದೊಂದಿಗೆ ಪರಿಚಯಿಸಿದ ಹೊಂದಾಣಿಕೆ ಕಾರ್ಯದ ಮುಂದುವರಿದ ರೂಪಗಳಾಗಿವೆ. ನಮ್ಮ ಹೊಂದಾಣಿಕೆ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ, Sol ಮತ್ತು Luna ಎರಡೂ ತಮ್ಮ GPT‑5.6 ಸಮಾನ ಆವೃತ್ತಿಗಳಿಗಿಂತ ಸುಧಾರಣೆ ತೋರಿಸಿವೆ. ತಮ್ಮ ಕೋಡಿಂಗ್ ಕೆಲಸದ ಬಗ್ಗೆ ದಾರಿತಪ್ಪಿಸುವ ಹೇಳಿಕೆಗಳ ಕಡಿಮೆ ಪ್ರಮಾಣವೂ ಇದರಲ್ಲಿ ಸೇರಿದೆ.
ಕೆಳಗಿನ ಮೌಲ್ಯಮಾಪನಗಳು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಸವಾಲಿನ ಸಂದರ್ಭಗಳನ್ನು ಪರೀಕ್ಷಿಸುತ್ತವೆ ಮತ್ತು ಸಾಮಾನ್ಯ ಬಳಕೆಯ ವೈಫಲ್ಯ ಪ್ರಮಾಣಗಳನ್ನು ಅಳೆಯುವುದಿಲ್ಲ. ಪೂರ್ಣ ಫಲಿತಾಂಶಗಳಿಗಾಗಿ ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನೋಡಿ.
GPT‑6 Sol ಮತ್ತು GPT‑6 Luna ಇಂದಿನಿಂದ ಎಲ್ಲ Plus, Pro, Business, Enterprise ಮತ್ತು Edu ಬಳಕೆದಾರರಿಗೆ ChatGPT Work ಹಾಗೂ Codex ನಲ್ಲಿ ಲಭ್ಯವಿವೆ. Free ಮತ್ತು Go ಬಳಕೆದಾರರು ಡೆಸ್ಕ್ಟಾಪ್ ಅಪ್ಲಿಕೇಶನ್ನಲ್ಲಿ GPT‑6 Luna ಬಳಸಬಹುದು. ಈ ಮಾಡೆಲ್ಗಳು ಇನ್ನೂ ಚಾಟ್ನಲ್ಲಿ ಲಭ್ಯವಿಲ್ಲ. OpenAI API ಯಲ್ಲಿ ಅವು gpt-6-sol ಮತ್ತು gpt-6-luna ಹೆಸರಿನಲ್ಲಿ ಲಭ್ಯವಿವೆ.
ಎಲ್ಲರಿಗೂ ಸೇವೆಯನ್ನು ಸ್ಥಿರವಾಗಿಡಲು, ದಿನವಿಡೀ ಈ ಮಾಡೆಲ್ಗಳನ್ನು ChatGPT ನಲ್ಲಿ ಹಂತ ಹಂತವಾಗಿ ಬಿಡುಗಡೆ ಮಾಡಲು ಯೋಜಿಸಿದ್ದೇವೆ. ChatGPT Work ಅಥವಾ Codex ನಲ್ಲಿ ಹೊಸ ಮಾಡೆಲ್ಗಳು ಕಾಣಿಸದಿದ್ದರೆ, ದಯವಿಟ್ಟು ನಂತರ ಮತ್ತೆ ಪ್ರಯತ್ನಿಸಿ.
GPT ಯ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ನಮ್ಮ ಸಂಶೋಧನಾ ಪರಿಸರದಲ್ಲಿ ಅಥವಾ ನಮ್ಮ API ಮೂಲಕ ನಡೆಸಲಾಗಿದೆ. ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ಗಳು, ಲಭ್ಯವಿರುವ ಪರಿಕರಗಳು ಮುಂತಾದವುಗಳ ವ್ಯತ್ಯಾಸದಿಂದಾಗಿ ಇವು ಉತ್ಪಾದನಾ ChatGPT ಗಿಂತ ಸ್ವಲ್ಪ ವಿಭಿನ್ನ ಔಟ್ಪುಟ್ ನೀಡಬಹುದು. ಸ್ಪರ್ಧಿ ಮಾಡೆಲ್ಗಳ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ಸಾರ್ವಜನಿಕವಾಗಿ ಲಭ್ಯವಿರುವ ವರದಿಗಳಿಂದ ಪಡೆಯಲಾಗಿದೆ. Claude Fable 5.1 ರ ಅಂಕಗಳು ಲಭ್ಯವಿರದಾಗ Claude Fable 5 ರ ಅಂಕಗಳನ್ನು ವರದಿ ಮಾಡಲಾಗಿದೆ.


