OpenAI

GPT-6 Astra: A new generation of intelligence

ಇಂಟೆಲಿಜೆನ್ಸ್‌ನ ಹೊಸ ಪೀಳಿಗೆ

22 ಸೆಪ್ಟೆಂಬರ್, 2026 ರ ನವೀಕರಣ: ನಾವು GPT‑6 Sol ಮತ್ತು GPT‑6 Luna ಅನ್ನು ಸೇರಿಸುವ ಮೂಲಕ ನಮ್ಮ GPT‑6 ಕುಟುಂಬವನ್ನು ವಿಸ್ತರಿಸುತ್ತಿದ್ದೇವೆ. ಇನ್ನಷ್ಟು ತಿಳಿಯಿರಿ.

ನಾವು ವಿಶ್ವದ ಅತ್ಯಂತ ಬುದ್ಧಿವಂತ ಮತ್ತು ಹೊಂದಾಣಿಕೆಯಾಗಿರುವ ಮಾಡೆಲ್ GPT‑6 Astra ಅನ್ನು ಪರಿಚಯಿಸುತ್ತಿದ್ದೇವೆ.

GPT‑6 Astra ಪ್ರೀ-ಟ್ರೈನಿಂಗ್, ರೀಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಮತ್ತು ಅಲೈನ್‌ಮೆಂಟ್ ಕ್ಷೇತ್ರಗಳಲ್ಲಿನ ವರ್ಷಗಳ ಸಂಶೋಧನೆ ಮತ್ತು ದೊಡ್ಡ ಹೂಡಿಕೆಗಳನ್ನು ಒಟ್ಟುಗೂಡಿಸುತ್ತದೆ. ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ, ಬ್ರೌಸಿಂಗ್, ಸಾಫ್ಟ್‌ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್, ಸೈಬರ್‌ಭದ್ರತೆ, ವಿಜ್ಞಾನ ಮತ್ತು ವೃತ್ತಿಪರ ಕೆಲಸದಲ್ಲಿ Astra ಅತ್ಯಾಧುನಿಕವಾಗಿದೆ. ಗಣಿತಶಾಸ್ತ್ರದಲ್ಲಿ ಈಗಾಗಲೇ ದೀರ್ಘಕಾಲದಿಂದ ಬಗೆಹರಿಯದೆ ಉಳಿದಿರುವ ಮುಕ್ತ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸಲು⁠ ಸಹಾಯ ಮಾಡಿರುವ Astra, 98% ಅಂಕದೊಂದಿಗೆ FrontierMath Tier 4 ಅನ್ನು ಸ್ಯಾಚುರೇಟ್ ಮಾಡಿದೆ. Astra ಸಹ 99.9% ಅಂಕದೊಂದಿಗೆ ARC-AGI-3 ಅನ್ನು ಸ್ಯಾಚುರೇಟ್ ಮಾಡುತ್ತದೆ ಮತ್ತು 100% ಅಂಕದೊಂದಿಗೆ ExploitBench ಅನ್ನು ಸ್ಯಾಚುರೇಟ್ ಮಾಡುತ್ತದೆ. ಇದು ಕಂಪ್ಯೂಟರ್ ಮತ್ತು ಬ್ರೌಸರ್ ಬಳಕೆಯಲ್ಲಿ ಹೊಸ ಅತ್ಯಾಧುನಿಕತೆಯನ್ನೂ ಸ್ಥಾಪಿಸುತ್ತದೆ ಹಾಗೂ ಸಾಟಿಯಿಲ್ಲದ ವೇಗ, ನಿಖರತೆ ಮತ್ತು ವಿವೇಚನೆಯೊಂದಿಗೆ ಅತ್ಯಂತ ಬೇಡಿಕೆಯ ವೃತ್ತಿಪರ ಕೆಲಸವನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ. 

GPT‑6 Astra ಇಂದು ಸೀಮಿತ ಸಂಖ್ಯೆಯ ಸಂಸ್ಥೆಗಳಿಗೆ ಹಂತ ಹಂತವಾಗಿ ಲಭ್ಯವಾಗುತ್ತಿದೆ ಮತ್ತು ಮುಂದಿನ ದಿನಗಳಲ್ಲಿ ಎಲ್ಲಾ ChatGPT Plus, Pro, Business ಮತ್ತು Enterprise ಬಳಕೆದಾರರಿಗೆ, ಹಾಗೆಯೇ OpenAI API, Microsoft Azure ಮತ್ತು AWS Bedrock ಮೂಲಕ ಲಭ್ಯವಾಗಲಿದೆ.

“ARC-AGI-3 ನಲ್ಲಿ, Astra ನಮ್ಮ ಮಾನವ ಕ್ರಿಯಾ-ದಕ್ಷತೆಯ ಮೂಲಮಟ್ಟವನ್ನು 96% ಹಂತಗಳಲ್ಲಿ ಮೀರಿಸಿತು, ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಈ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ನಲ್ಲಿ ಮಾನವ ಸಮಾನತೆಯನ್ನು ತಲುಪಿತು. ಇದು ನಾವು ಇದುವರೆಗೆ ಪರೀಕ್ಷಿಸಿದ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್ ಮಾತ್ರವಲ್ಲ, ಅತ್ಯಾಧುನಿಕ-ಮಾಡೆಲ್ ಕಾರ್ಯಕ್ಷಮತೆಯಲ್ಲಿ ಮಹತ್ವದ ಬದಲಾವಣೆಯನ್ನೂ ಪ್ರತಿನಿಧಿಸುತ್ತದೆ—ಹೊಸ ಪರಿಸರಗಳನ್ನು ನ್ಯಾವಿಗೇಟ್ ಮಾಡಿ ಪರಿಹರಿಸುವ ಅದರ ಸಾಮರ್ಥ್ಯದಲ್ಲಿ ಮಾತ್ರವಲ್ಲದೆ, ಅದನ್ನು ಮಾಡಲು ಅದು ಎಷ್ಟು ದಕ್ಷವಾಗಿ ಕಲಿಯುತ್ತದೆ ಎಂಬುದರಲ್ಲಿಯೂ.
ಗ್ರೇಗ್ ಕಾಮ್ರಾಡ್ಟ್, ARC ಪ್ರೈಸ್ ಫೌಂಡೇಶನ್

Astra ನಮ್ಮ ಅತ್ಯಂತ ಹೊಂದಾಣಿಕೆಯಾಗಿರುವ ಮಾಡೆಲ್ ಆಗಿದ್ದು, ಬಳಕೆದಾರರ ಉದ್ದೇಶ ಮತ್ತು ಮಾಡೆಲ್ ನಡವಳಿಕೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಲ್ಲಿ ಗಮನಾರ್ಹ ಸುಧಾರಣೆಗಳನ್ನು ಹೊಂದಿದೆ—Astraದ ತೀರ್ಮಾನದ ಮೇಲೆ ಹೆಚ್ಚಿನ ವಿಶ್ವಾಸದೊಂದಿಗೆ ನೀವು ಕಾರ್ಯಗಳನ್ನು ನಿಯೋಜಿಸಬಹುದು. ಇದನ್ನು ನಾವು ಪರೀಕ್ಷಿಸುವ ಒಂದು ವಿಧಾನವಾಗಿ, ಕಷ್ಟಕರ ಅಥವಾ ಅಸಾಧ್ಯವಾದ ಕಾರ್ಯವನ್ನು ಎದುರಿಸುತ್ತಿರುವ ಮಾಡೆಲ್ ತನ್ನ ಉದ್ದೇಶಿತ ವ್ಯಾಪ್ತಿಯನ್ನು ಮೀರಿ ಹೋಗುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ, Hugging Face ಘಟನೆಯಿಂದ ಮಾಹಿತಿ ಪಡೆದ ಹೊಸ ಮೌಲ್ಯಮಾಪನವನ್ನು ನಾವು ನಿರ್ಮಿಸಿದ್ದೇವೆ. ಉತ್ಪಾದನಾ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳಿಲ್ಲದೆ ಅನುಮೋದಿತ ಗುರಿಯನ್ನು 48% ಸಂದರ್ಭಗಳಲ್ಲಿ ಮೀರಿದ GPT‑5.6 Sol ಗೆ ಹೋಲಿಸಿದರೆ, GPT‑6 Astra 0% ಸಂದರ್ಭಗಳಲ್ಲಿ ಹೀಗೆ ಮಾಡಿತು.

ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಗಾಗಿ ವಿಶ್ವದ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್

GPT‑6 Astra ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ವೇಗ, ನಿಖರತೆ ಮತ್ತು ಸುರಕ್ಷತೆಯಲ್ಲಿ ಹೊಸ ಅತ್ಯಾಧುನಿಕ ಗಡಿಯನ್ನು ಗುರುತಿಸುತ್ತದೆ. ಇದು ಆನ್‌ಲೈನ್ ಫಾರ್ಮ್‌ಗಳನ್ನು ಭರ್ತಿ ಮಾಡುವುದು, CRM ನಲ್ಲಿ ಗ್ರಾಹಕರ ದಾಖಲೆಗಳನ್ನು ನವೀಕರಿಸುವುದು ಮತ್ತು ನಿಮ್ಮ ಕ್ಯಾಲೆಂಡರ್ ಅನ್ನು ವ್ಯವಸ್ಥಿತಗೊಳಿಸುವುದು ಮುಂತಾದ ಬೇಸರದ ಕಾರ್ಯಗಳನ್ನು ನಿಭಾಯಿಸಬಹುದು. ಇದು ಆನ್‌ಲೈನ್ ಸಂಶೋಧನೆ ನಡೆಸಿ, ನಿಮ್ಮ ಇಮೇಲ್‌ನಲ್ಲಿ ಅಥವಾ ನಿಮ್ಮ ಡಾಕ್ಯುಮೆಂಟ್ ಎಡಿಟರ್‌ನಲ್ಲಿ ಸಾರಾಂಶಗಳ ಕರಡುಗಳನ್ನು ರಚಿಸಬಹುದು. ಅದು ವೈಜ್ಞಾನಿಕ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸಬಹುದು, ಪ್ಲಾಟ್‌ಗಳನ್ನು ರಚಿಸಬಹುದು, ವೆಬ್‌ಸೈಟ್ ಅನ್ನು ಸೃಷ್ಟಿಸಬಹುದು, ಮತ್ತು ಆ ಸೈಟ್‌ನಲ್ಲಿರುವ ಎಲ್ಲಾ ವೈಶಿಷ್ಟ್ಯಗಳು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿವೆ ಎಂಬುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಫ್ರಂಟ್‌ಎಂಡ್ QA ಪರಿಶೀಲನೆಗಳನ್ನು ನಡೆಸಬಹುದು. ಇದು ನಿಮಗೆ ಸಾಫ್ಟ್‌ವೇರ್ ಅನ್ನು ಸ್ವಾಯತ್ತವಾಗಿ ಸ್ಥಾಪಿಸಲು ಮತ್ತು ಪರೀಕ್ಷಿಸಲು, ಹಾಗೂ ಪರದೆಯಲ್ಲಿ ಕಾಣುವ ಸಮಸ್ಯೆಗಳನ್ನು ನಿವಾರಿಸಲು ಸಹಾಯ ಮಾಡಬಹುದು. ಈ ಸುಧಾರಣೆಗಳು ನಮ್ಮ ಅತ್ಯಾಧುನಿಕ ಮೌಲ್ಯಮಾಪನ ಫಲಿತಾಂಶಗಳಲ್ಲಿಯೂ ಪ್ರತಿಬಿಂಬಿತವಾಗಿವೆ.

ಈ ಸುಧಾರಣೆಗಳು ಕೂಡ ನೈಜ ಜ್ಞಾನ-ಕೆಲಸದ ಕಾರ್ಯಗಳಲ್ಲಿ ದಕ್ಷತೆಯಲ್ಲಿ ಗಮನಾರ್ಹ ಹೆಚ್ಚಳಕ್ಕೆ ಕಾರಣವಾಗುತ್ತವೆ. OSWorld 2.0 ನಲ್ಲಿನ ಲೇಟೆನ್ಸಿ (ವಿಳಂಬ) ಅನುಕರಣೆ‌ಗಳಲ್ಲಿ, GPT‑5.6 Sol ಗೆ ಹೋಲಿಸಿದರೆ Astra ಪ್ರತಿ ಕಾರ್ಯಕ್ಕೆ ಸುಮಾರು 47% ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಉತ್ತಮ ಕಂಪ್ಯೂಟರ್-ಬಳಕೆಯ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಾಧಿಸುತ್ತದೆ; ಇದು ಪ್ರತಿ ಕಾರ್ಯಕ್ಕೆ ಸುಮಾರು 40 ನಿಮಿಷಗಳಲ್ಲಿ 72.6% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದರೆ, GPT‑5.6 Sol ಸುಮಾರು 75 ನಿಮಿಷಗಳಲ್ಲಿ 65.7% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದೆ.3

GPT‑6 Astraದ ಕಂಪ್ಯೂಟರ್-ಬಳಕೆಯ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಆಟದ ಅಭಿವೃದ್ಧಿ, ವಿದ್ಯುತ್ ಎಂಜಿನಿಯರಿಂಗ್ ಮತ್ತು ದೈನಂದಿನ ಜ್ಞಾನ ಕಾರ್ಯ ಸೇರಿದಂತೆ ವಿವಿಧ ಕ್ಷೇತ್ರಗಳ ಔಟ್‌ಪುಟ್‌ಗಳಲ್ಲಿ ಕಾಣಬಹುದು:

Astra ಜೊತೆಗೆ, ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ವೇಗವನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಸುಧಾರಿಸಲು ನಾವು Codex ಪೂರಕ ವ್ಯವಸ್ಥೆಯನ್ನೂ ನವೀಕರಿಸುತ್ತಿದ್ದೇವೆ. Astraದ ದಕ್ಷತೆಯೊಂದಿಗೆ ಸೇರಿ, Mind2Web ಮಾನದಂಡದಲ್ಲಿ ಪ್ರಸ್ತುತ GPT‑5.6 Sol ಅನುಭವಕ್ಕೆ ಹೋಲಿಸಿದರೆ ಇದು 1.9x ವೇಗವಾಗಿ ಕಾರ್ಯ ಪೂರ್ಣಗೊಳಿಸುವಿಕೆಗೆ ಕಾರಣವಾಗುತ್ತದೆ. ಮಾಡೆಲ್‌ನ ವೇಗದಲ್ಲಿನ ಸುಧಾರಣೆಗಳು, ನೀವು ಮಾಡುವುದಕ್ಕಿಂತಲೂ ವೇಗವಾಗಿ, ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುವ ಅನೇಕ ದೈನಂದಿನ ಕಾರ್ಯಗಳನ್ನು ನಿಮಗಾಗಿ ಕೈಗೆತ್ತಿಕೊಳ್ಳಲು ಅದಕ್ಕೆ ಸಾಧ್ಯವಾಗಿಸುತ್ತವೆ.4

“ನಾವು ಬಿಡುಗಡೆ ದಿನದಂದು GPT‑6 Astra ಅನ್ನು Devin‌ನ ಪೂರಕ ವ್ಯವಸ್ಥೆಗೆ ಸಂಯೋಜಿಸುತ್ತಿದ್ದೇವೆ. ಅಲ್ಲಿ ಅದು ನಮ್ಮ ಆಂತರಿಕ ಪರೀಕ್ಷಾ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ನಲ್ಲಿ ಅತ್ಯಾಧುನಿಕ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡುತ್ತದೆ. ಅದರ ಅತ್ಯುತ್ತಮ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ, ಬರವಣಿಗೆ ಮತ್ತು ಕೋಡ್‌ಬೇಸ್‌ ಅರಿವು ಬಳಕೆ ಆರಂಭಿಸಿದ ತಕ್ಷಣವೇ ಪರೀಕ್ಷೆಯನ್ನು ಸುಧಾರಿಸಿತು: ವೀಡಿಯೊಗಳನ್ನು ಅನುಸರಿಸುವುದು ಗಮನಾರ್ಹವಾಗಿ ಸುಲಭವಾಗಿದೆ ಮತ್ತು ವರದಿಗಳು ಇನ್ನಷ್ಟು ಸ್ಪಷ್ಟ ಹಾಗೂ ಸಂಕ್ಷಿಪ್ತವಾಗಿವೆ”
ಸಿಲಾಸ್ ಬರ್ಟಿ, SVP ಸಂಶೋಧನೆ, Cognition

ವೃತ್ತಿಪರ ಕೆಲಸದಲ್ಲಿ ಮಹತ್ವದ ಬದಲಾವಣೆ

GPT‑6 Astra ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯಲ್ಲಿನ ಪ್ರಗತಿಗಳನ್ನು ವೃತ್ತಿಪರ ಪರಿಸರಗಳಿಗಾಗಿ ಉದ್ದೇಶಿತ ತರಬೇತಿಯೊಂದಿಗೆ ಸಂಯೋಜಿಸಿ, ಸಂಕೀರ್ಣ ಕೆಲಸದ ಕಾರ್ಯಗಳನ್ನು ನಿಭಾಯಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಇದು ಸಂಕೀರ್ಣ ಸಮಸ್ಯೆಗಳಿಗೆ ಅಗತ್ಯವಾದ ಇಂಟೆಲಿಜೆನ್ಸ್ ಅನ್ನು ಬಹು-ಹಂತದ ವರ್ಕ್‌ಫ್ಲೋಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಹಾಗೂ ಪರಿಷ್ಕೃತ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳು, ಸ್ಪ್ರೆಡ್‌ಶೀಟ್‌ಗಳು ಮತ್ತು ಪ್ರಸ್ತುತಿಗಳನ್ನು ರಚಿಸುವ ಸಾಮರ್ಥ್ಯದೊಂದಿಗೆ ಸಂಯೋಜಿಸುತ್ತದೆ.

GPT‑6 Astra ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಟೆಂಪ್ಲೇಟ್‌ಗಳನ್ನು ಅನುಸರಿಸಲು ಮತ್ತು ಉತ್ತಮವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ, ರಚನಾತ್ಮಕ ನಿರೂಪಣೆಯೊಂದಿಗೆ ಪ್ರಮುಖ ಅಂಶಗಳನ್ನು ಸಂಕ್ಷಿಪ್ತವಾಗಿ ತಿಳಿಸುವ ಸ್ಲೈಡ್‌ಗಳನ್ನು ತಯಾರಿಸಲು ನಮ್ಮ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್ ಆಗಿದೆ. ಇದು ನಿಮ್ಮ ಟೆಂಪ್ಲೇಟ್‌ಗಳನ್ನು ಅನುಸರಿಸುವ ಮತ್ತು ನಿಮ್ಮ ಬರವಣಿಗೆ ಹಾಗೂ ದೃಶ್ಯ ಶೈಲಿಗೆ ಹೊಂದಿಕೆಯಾಗುವ ಸ್ಪಷ್ಟ, ಉತ್ತಮವಾಗಿ ರಚಿಸಲಾದ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳು, ಪ್ರಸ್ತುತಿಗಳು, ಸ್ಪ್ರೆಡ್‌ಶೀಟ್‌ಗಳು ಮತ್ತು ವಿಶ್ಲೇಷಣೆಗಳನ್ನು ರಚಿಸುತ್ತದೆ. Astra ಅನ್ನು ಕೈಯಲ್ಲಿರುವ ಕೆಲಸಕ್ಕೆ ಅನಗತ್ಯವಾದ ಮಾಹಿತಿಯನ್ನು ಪುನರಾವರ್ತಿಸುವ ಬದಲು, ಔಟ್‌ಪುಟ್‌ಗಳಲ್ಲಿ ಪ್ರಸ್ತುತ ಕೆಲಸಕ್ಕೆ ಸಂಬಂಧಿಸಿದ ಸಂದರ್ಭವನ್ನು ಮಾತ್ರ ನಿರ್ದಿಷ್ಟವಾಗಿ ಸೇರಿಸುವಂತೆ ತರಬೇತಿ ನೀಡಲಾಗಿದೆ. ಇವೆಲ್ಲದರರ್ಥ, ನಿಮ್ಮ ವ್ಯವಹಾರಿಕ ಸನ್ನಿವೇಶ ಮತ್ತು ಮಾನದಂಡಗಳಿಗೆ ಹೊಂದುವ, ತಕ್ಷಣವೇ ಹೆಚ್ಚು ಬಳಸಬಹುದಾದ ಆರ್ಟಿಫ್ಯಾಕ್ಟ್‌ಗಳನ್ನು ಇದು ಔಟ್‌ಪುಟ್ ಆಗಿ ನೀಡಬಹುದು.

GPT‑6 Astra ತಾನು ನಿರ್ಮಿಸುವ ವೆಬ್‌ಸೈಟ್‌ಗಳು, ಗೇಮ್‌ಗಳು, ಅಪ್ಲಿಕೇಶನ್‌ಗಳು ಮತ್ತು ರೆಂಡರಿಂಗ್‌ಗಳಿಗೆ ಇನ್ನಷ್ಟು ಉತ್ತಮ ದೃಶ್ಯ ವಿವೇಚನೆಯನ್ನು ತರುತ್ತದೆ. ChatGPT ಯಲ್ಲಿನ ಸೈಟ್‌ಗಳೊಂದಿಗೆ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ), Astra ಪ್ರಾಂಪ್ಟ್‌ನಿಂದಲೇ ವೆಬ್‌ಸೈಟ್‌ಗಳು, ವೆಬ್ ಆ್ಯಪ್‌ಗಳು ಮತ್ತು ಗೇಮ್‌ಗಳನ್ನು ರಚಿಸಬಹುದು, ಹೋಸ್ಟ್ ಮಾಡಬಹುದು ಮತ್ತು ಹಂಚಿಕೊಳ್ಳಬಹುದು.

“Astra ನಮಗೆ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ದಕ್ಷತೆ ಎರಡರಲ್ಲಿಯೂ ಮಹತ್ವದ ಮುನ್ನಡೆಯನ್ನು ನೀಡುತ್ತದೆ. ನಾವು ಪರೀಕ್ಷಿಸಿದ ಇತರ ಮಾಡೆಲ್‌ಗಳಿಗಿಂತ ಗರಿಷ್ಠ 20% ಕಡಿಮೆ ಟೋಕನ್‌ಗಳನ್ನು ಬಳಸುತ್ತಾ ಇದು ನಮ್ಮ ಅತ್ಯಂತ ಸಂಕೀರ್ಣ ಸೃಜನಾತ್ಮಕ ಕಾರ್ಯಪ್ರವಾಹಗಳನ್ನು ಯಶಸ್ವಿಯಾಗಿ ಕಾರ್ಯಗತಗೊಳಿಸುತ್ತದೆ. ಅತ್ಯಂತ ಮುಖ್ಯವಾಗಿ, ನಮ್ಮ ಗ್ರಾಹಕರಿಗೆ, ಇದರರ್ಥ ಹೈ ಗುಣಮಟ್ಟದ ಔಟ್‌ಪುಟ್.”
ಅಲೆಕ್ಸ್ ಮಶ್ರಬೋವ್, CEO ಮತ್ತು ಸಹ-ಸ್ಥಾಪಕ, Higgsfield AI

ಸೂಚನೆಗಳು ವ್ಯಾಖ್ಯಾನಕ್ಕೆ ಅವಕಾಶ ನೀಡಿದಾಗ, ಸರಿಯಾದ ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವಲ್ಲಿ GPT‑6 Astra ಹಿಂದಿನ ಮಾಡೆಲ್‌ಗಳಿಗಿಂತ ಉತ್ತಮವಾಗಿದೆ. ಇದು ಸಾಮಾನ್ಯ ಕೊರತೆಗಳನ್ನು ಭರ್ತಿ ಮಾಡಲು ಸಂದರ್ಭವನ್ನು ಬಳಸುತ್ತದೆ ಮತ್ತು ಉತ್ತರವು ಫಲಿತಾಂಶವನ್ನು ಬದಲಾಯಿಸಬಹುದಾದಾಗ ಕೇಂದ್ರೀಕೃತ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುತ್ತದೆ. Codex ನಲ್ಲಿ, ನಿಮ್ಮ ಉತ್ತರವನ್ನು ಅವಲಂಬಿಸದ ಕೆಲಸವನ್ನು ಮುಂದುವರಿಸುತ್ತಲೇ ಇದು ಅಸಿಂಕ್ರೋನಸ್ ಆಗಿ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳಬಹುದು. ನೀವು ಪ್ರತಿಕ್ರಿಯಿಸದಿದ್ದರೆ, ಸೂಕ್ತವಾದಲ್ಲಿ ಅದು ಸಮಂಜಸವಾದ ಊಹೆಗಳೊಂದಿಗೆ ಮುಂದುವರಿಯುತ್ತದೆ, ಆದರೆ ಮಹತ್ವದ ನಿರ್ಧಾರಗಳ ಕುರಿತು ನಿಮ್ಮ ಅಭಿಪ್ರಾಯಕ್ಕಾಗಿ ಕಾಯುತ್ತದೆ.

ಕೆಳಗಿನ ಉದಾಹರಣೆಗಳು, ಮಾಹಿತಿ ಕೊರತೆಯು ಉತ್ತರವನ್ನು ಗಣನೀಯವಾಗಿ ಬದಲಾಯಿಸಬಹುದಾದ ದೈನಂದಿನ ಕಾರ್ಯಗಳಲ್ಲಿ Astra ಹೇಗೆ ಸಹಕರಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತವೆ.

ಕಾರ್ಯವು ವಿಕಸಿಸುತ್ತಿದ್ದಂತೆ ಅದರ ದಿಕ್ಕಿನ ಕುರಿತು ಸ್ಪಷ್ಟತೆ ಕಾಯ್ದುಕೊಳ್ಳುವುದರಲ್ಲಿಯೂ Astra ಉತ್ತಮವಾಗಿದೆ. ಹಿಂದಿನ ಮಾಡೆಲ್‌ಗಳು ಕೆಲವೊಮ್ಮೆ ಸ್ಟಿಯರಿಂಗ್ ಸಂದೇಶಗಳನ್ನು ಹೊಸ ಗುರಿಯಾಗಿ ಪರಿಗಣಿಸಿ, ಮೂಲ ವಿನಂತಿ ಅಥವಾ ಹಿಂದಿನ ನಿರ್ಬಂಧಗಳ ಮೇಲಿನ ಗಮನವನ್ನು ಕಳೆದುಕೊಳ್ಳುತ್ತಿದ್ದವು. Astra ಹೊಸ ಅವಶ್ಯಕತೆಗಳನ್ನು ಒಳಗೊಳ್ಳುತ್ತದೆ, ಕೇಳಿದಾಗ ದಿಕ್ಕು ಬದಲಾಯಿಸುತ್ತದೆ ಮತ್ತು ವ್ಯಾಪಕ ಕಾರ್ಯವನ್ನು ಕೈಬಿಡದೆ ಪೂರಕ ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸುತ್ತದೆ.

“Astra ಸಂಕೀರ್ಣ ಕಾನೂನು ಕಾರ್ಯಗಳಲ್ಲಿ GPT‑5.6 Sol ಗಿಂತ ಗುಣಮಟ್ಟದಲ್ಲಿ ಗಮನಾರ್ಹ ಸುಧಾರಣೆಯಾಗಿದೆ. ನಮ್ಮ ಪ್ರಾರಂಭಿಕ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ, Astra ಕಾನೂನು ಕೆಲಸವನ್ನು ಒಬ್ಬ ಸೂಕ್ಷ್ಮಗ್ರಾಹಿ ವಕೀಲನು ಮಾಡುವ ರೀತಿಯಲ್ಲೇ ಸಮೀಪಿಸುವ ಮೂಲಕ ಗಮನ ಸೆಳೆಯಿತು: ಅದು ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಸ್ಥಾಪಿತ ದಾಖಲೆಗಳಿಂದ ಭೇದಿಸುತ್ತದೆ, ಆಧಾರರಹಿತ ಊಹೆಗಳನ್ನು ಹೊರತರುತ್ತದೆ, ಮತ್ತು ಲೋಪಗಳನ್ನು ಸ್ಪಷ್ಟ ಕರಡು-ರಚನಾ ನಿಲುವುಗಳಾಗಿ ಪರಿವರ್ತಿಸುತ್ತದೆ.
Niko Grupen, ಅನ್ವಯಿತ ಸಂಶೋಧನೆಯ ಮುಖ್ಯಸ್ಥ, Harvey

ಕೋಡಿಂಗ್

GPT‑6 Astra ಇದುವರೆಗಿನ ಸಾಫ್ಟ್‌ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್‌ಗೆ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್ ಆಗಿದೆ.

2ರಲ್ಲಿ 1
“GPT‑6 Astra ನಮ್ಮ ಆಂತರಿಕ ಕೋಡಿಂಗ್ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳಲ್ಲಿ ಅತ್ಯಾಧುನಿಕ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡುತ್ತದೆ ಮತ್ತು GPT‑5.6 Sol ಗೆ ಹೋಲಿಸಿದರೆ ಟ್ರೇಡಿಂಗ್ ಒಳನೋಟದ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ ಸ್ಪಷ್ಟವಾದ ಮುನ್ನಡೆಯನ್ನು ತೋರಿಸುತ್ತದೆ. ಏಜೆಂಟಿಕ್ ಕೋಡಿಂಗ್‌ಗೆ ಬಳಸಿದಾಗ, GPT‑6 Astra ಡೆವಲಪರ್‌ಗಳು ಸುಲಭವಾಗಿ ಅನುಸರಿಸಬಹುದಾದ ರೀತಿಯಲ್ಲಿ ಸಂವಹನ ನಡೆಸುತ್ತದೆ ಮತ್ತು ಪ್ರೊಡಕ್ಷನ್ ಗುಣಮಟ್ಟ ತಲುಪಲು ಕಡಿಮೆ ಪುನರಾವರ್ತನೆ ಅಗತ್ಯವಿರುವ ಕೋಡ್ ಅನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.”
ಜಾನ್ ಕ್ರೆಪೆಝಿ, AI ಸಹಾಯಕಗಳು, ಜೇನ್ ಸ್ಟ್ರೀಟ್

Astra ಜೊತೆಗೆ, ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ತುಂಬಿದಾಗ ಸಂದರ್ಭವನ್ನು ಸಂರಕ್ಷಿಸಲು ಮತ್ತು ಹಿಂಪಡೆಯಲು Codex ಗೆ ಹೊಸ ವಿಧಾನವನ್ನು ನಾವು ಪರಿಚಯಿಸುತ್ತಿದ್ದೇವೆ. ಐತಿಹಾಸಿಕವಾಗಿ, ಸಂಕೀರ್ಣ ಸಮಸ್ಯೆಗಳನ್ನು ಡೀಬಗ್ ಮಾಡುವಾಗ ಅಥವಾ ದೊಡ್ಡ ಮರುರಚನೆಗಳನ್ನು ಕೈಗೆತ್ತಿಕೊಳ್ಳುವಾಗಿನಂತಹ ದೀರ್ಘ ಸೆಷನ್‌ಗಳಲ್ಲಿ ಕೆಲಸವನ್ನು ಸಾರಾಂಶಗೊಳಿಸಲು ಮಾಡೆಲ್‌ಗಳು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯನ್ನು ಬಳಸಿವೆ. ಪ್ರತಿಯೊಂದು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯು ಪರಿಹಾರ ಏಕೆ ವಿಫಲವಾಯಿತು ಅಥವಾ ಒಂದು ಘಟಕ ಹೇಗೆ ವರ್ತಿಸುತ್ತದೆ ಎಂಬ ವಿವರಗಳನ್ನು ಬಿಟ್ಟುಬಿಡಬಹುದು. Codex ನಲ್ಲಿ, Astra ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋಗಳಾದ್ಯಂತ ಟಿಪ್ಪಣಿಗಳನ್ನು ಉಳಿಸಿಕೊಳ್ಳಬಹುದು, ಅವುಗಳನ್ನು ಒಂದೇ ಸಾರಾಂಶಕ್ಕೆ ಪದೇಪದೇ ಸಂಕುಚಿತಗೊಳಿಸದೆ ಸಂಗ್ರಹವಾದ ವಿವರಗಳನ್ನು ಸಂರಕ್ಷಿಸುತ್ತದೆ. ಹಿಂದಿನ ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋಗಳು ಹುಡುಕಬಹುದಾಗಿಯೇ ಉಳಿಯುತ್ತವೆ, ಆದ್ದರಿಂದ ಆ ಮಾಹಿತಿಯನ್ನು ತನ್ನ ಟಿಪ್ಪಣಿಗಳಲ್ಲಿ ಸೆರೆಹಿಡಿಯದಿದ್ದರೂ Astra ಹಿಂದಿನ ಸಂದೇಶಗಳು ಮತ್ತು ಟೂಲ್ ಔಟ್‌ಪುಟ್‌ಗಳಿಂದ ಅಗತ್ಯತೆಗಳು ಅಥವಾ ಪರೀಕ್ಷಾ ಫಲಿತಾಂಶಗಳನ್ನು ಕಂಡುಹಿಡಿಯಬಹುದು. ನಿಮ್ಮ Codex config.toml ನಲ್ಲಿ ಈ ಪ್ರಯೋಗಾತ್ಮಕ ವೈಶಿಷ್ಟ್ಯವನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಬಹುದು,⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಮತ್ತು ಮುಂಬರುವ ವಾರಗಳಲ್ಲಿ ಇದು Astra ಗಾಗಿ ಡೀಫಾಲ್ಟ್ ಆಗಲಿದೆ.

ವೈಜ್ಞಾನಿಕ ಆವಿಷ್ಕಾರವನ್ನು ಮುನ್ನಡೆಸುವುದು

“ಕಥೆ ಹೀಗಿದೆ: ಒಂದು ಯುಗದ ಅಂತ್ಯ, ಮತ್ತೊಂದು ಯುಗದ ಆರಂಭ.”
ಗ್ರೇಗ್ ಬರ್ನ್‌ಹ್ಯಾಮ್, EpochAI

GPT‑6 Astra ವೈಜ್ಞಾನಿಕ ಶೋಧನೆ, ಗಣಿತ ಮತ್ತು ಆರೋಗ್ಯಕ್ಕಾಗಿ ಪ್ರಮುಖ ಮುನ್ನಡೆಯಾಗಿದೆ. ಇಂದು, ಅವಿಭಾಜ್ಯ ಸಂಖ್ಯೆಗಳ ನಡುವಿನ ಅಂತರಗಳ ಕುರಿತು ಇನ್ನೂ ಎರಡು ಫಲಿತಾಂಶಗಳನ್ನು ನಾವು ಹಂಚಿಕೊಳ್ಳುತ್ತಿದ್ದೇವೆ.9, 10

Astra ಗಣಿತ ಮತ್ತು ವಿಜ್ಞಾನ ಮೌಲ್ಯಮಾಪನಗಳ ಸರಣಿಯಾದ್ಯಂತ ಹೊಸ ದಾಖಲೆಗಳನ್ನೂ ಸ್ಥಾಪಿಸಿದೆ.

ವೈಜ್ಞಾನಿಕ ಆವಿಷ್ಕಾರದ ಹಿಂದಿನ ವ್ಯಾವಹಾರಿಕ ಕೆಲಸದಲ್ಲಿ Astra ಸಹಾಯ ಮಾಡಬಹುದು. ವೈಜ್ಞಾನಿಕ ರೀಜನಿಂಗ್ ಅನ್ನು ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯೊಂದಿಗೆ ಸಂಯೋಜಿಸುವ ಮೂಲಕ, ಇದು ದತ್ತಾಂಶವನ್ನು ಪರಿಶೀಲಿಸಲು ಮತ್ತು ಫಲಿತಾಂಶಗಳನ್ನು ಅನ್ವೇಷಿಸಲು ವಿಶೇಷ ಸಾಫ್ಟ್‌ವೇರ್‌ನಲ್ಲಿ ನೇರವಾಗಿ ಕೆಲಸ ಮಾಡಬಹುದು, ಇದರಿಂದ ಸಂಶೋಧಕರು ಸಾಕ್ಷ್ಯವನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ಮತ್ತು ಮುಂದೆ ಏನನ್ನು ತನಿಖೆ ಮಾಡಬೇಕೆಂದು ನಿರ್ಧರಿಸಲು ಸಹಾಯವಾಗುತ್ತದೆ.

ಸೈಬರ್‌ಸುರಕ್ಷತೆ

ನಮ್ಮ ಸುರಕ್ಷತಾ ಅಪ್‌ಡೇಟ್‌ನಲ್ಲಿ⁠ ನಾವು ಚರ್ಚಿಸಿದಂತೆ, Astra ಸೈಬರ್ ಸಾಮರ್ಥ್ಯಗಳಲ್ಲಿ ಮಹತ್ವದ ಮುನ್ನಡೆಯಾಗಿದ್ದು, ಸೈಬರ್‌ಸುರಕ್ಷತೆಯಲ್ಲಿ ಕ್ರಿಟಿಕಲ್ ಮಿತಿಯನ್ನು ನಮ್ಮ ಪ್ರಿಪೇರ್ಡ್‌ನೆಸ್ ಫ್ರೇಮ್‌ವರ್ಕ್ ಅಡಿಯಲ್ಲಿ ತಲುಪುತ್ತದೆ. ಝೀರೋ-ಡೆ ಎಕ್ಸ್‌ಪ್ಲಾಯಿಟ್‌ಗಳನ್ನು ಗುರುತಿಸುವ ಮತ್ತು ಅಭಿವೃದ್ಧಿಪಡಿಸುವ ಅದರ ಸಾಮರ್ಥ್ಯವು ರಕ್ಷಕರು ದೌರ್ಬಲ್ಯಗಳನ್ನು ಕಂಡುಹಿಡಿದು ಪ್ಯಾಚ್ ಮಾಡಲು ಸಹಾಯ ಮಾಡಬಹುದು, ಆದರೆ ಇದು ಇನ್ನಷ್ಟು ಬಲವಾದ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳ ಅಗತ್ಯವನ್ನೂ ಸೃಷ್ಟಿಸುತ್ತದೆ. ಈ ಸಾಮರ್ಥ್ಯಗಳು ಯಾವ ಮಟ್ಟಿಗೆ ವಿಸ್ತರಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ನಾವು Astra ಅನ್ನು ಆಂತರಿಕ ಮತ್ತು ಮೂರನೇ ವ್ಯಕ್ತಿಯ ತಜ್ಞರ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ.

ತಿಳಿದಿರುವ ಸಾಫ್ಟ್‌ವೇರ್ ದುರ್ಬಲತೆಗಳನ್ನು ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಎಕ್ಸ್‌ಪ್ಲಾಯಿಟ್‌ಗಳಾಗಿ ಪರಿವರ್ತಿಸಬಹುದೇ ಎಂಬುದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ExploitBench ಮತ್ತು ExploitGym ನಲ್ಲಿ, ಉತ್ಪಾದನಾ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳಿಲ್ಲದೆ ನಾವು ಮೊದಲು ಮಾಡೆಲ್ ಅನ್ನು ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ. ExploitBench ನಲ್ಲಿ, ನಮ್ಮ ಹಿಂದಿನ ಅತ್ಯಾಧುನಿಕ ಸೈಬರ್-ಸಾಮರ್ಥ್ಯವಿರುವ ಮಾಡೆಲ್ GPT‑5.6 Sol ಗೆ 78.5% ಸಿಕ್ಕಿದ್ದು, Astra ಪರಿಪೂರ್ಣ 100% ಸ್ಕೋರ್ ಸಾಧಿಸಿತು. ExploitGym ನಲ್ಲಿ, Astra ಗಮನಾರ್ಹವಾಗಿ ಕಡಿಮೆ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳನ್ನು ಬಳಸುತ್ತಾ 42.4% ಯಶಸ್ಸಿನ ದರವನ್ನು ತಲುಪಿತು, GPT‑5.6 Sol ಗೆ ಇದು 30.3% ಆಗಿತ್ತು.13

ಐತಿಹಾಸಿಕ ಸಾಫ್ಟ್‌ವೇರ್ ದುರ್ಬಲತೆಗಳ ಸಂಪರ್ಕವು ಬೆಂಚ್‌ಮಾರ್ಕ್ ಫಲಿತಾಂಶಗಳ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರಿರಬಹುದು ಎಂಬ ಕಳವಳಗಳನ್ನು ಗಮನದಲ್ಲಿಟ್ಟುಕೊಂಡು, ನಾವು Astra ಅನ್ನು ಎರಡು ಹೊಸ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳ ಮೇಲೆಯೂ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದೆವು. ಮೊದಲನೆಯದಾಗಿ, ಹಿಂದಿನ ಮೂರು ತಿಂಗಳ ದೌರ್ಬಲ್ಯಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಎಕ್ಸ್‌ಪ್ಲಾಯ್ಟ್ ಅಭಿವೃದ್ಧಿಯನ್ನು ಪರೀಕ್ಷಿಸಲು ನಾವು ಆಂತರಿಕ “ExploitBench (ಜೂನ್–ಆಗಸ್ಟ್ 2026)” ಮೌಲ್ಯಮಾಪನವನ್ನು ನಿರ್ಮಿಸಿದ್ದೇವೆ.14 ಈ ಡೇಟಾಸೆಟ್‌ನಲ್ಲಿ, GPT‑5.6 Sol ಗೆ ಹೋಲಿಸಿದರೆ Astra ಗಮನಾರ್ಹವಾಗಿ ಹೆಚ್ಚಿನ 'ಆರ್ಬಿಟ್ರರಿ ಕೋಡ್-ಎಕ್ಸಿಕ್ಯೂಷನ್' ದರಗಳನ್ನು ಸಾಧಿಸಿತು; ಜೊತೆಗೆ, ಇದು ಅತ್ಯಂತ ಕಡಿಮೆ ಸಂಖ್ಯೆಯ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳನ್ನು ಬಳಸಿತು. ಮೌಲ್ಯಮಾಪನದ ಸಮಯದಲ್ಲಿ, Astra ಹಿಂದೆ ತಿಳಿಯದ ಎರಡು ಝೀರೋ-ಡೇ ದೌರ್ಬಲ್ಯಗಳನ್ನು ಕೂಡ ಕಂಡುಹಿಡಿದು ಬಳಸಿತು. ನಾವು ಎರಡೂ ದುರ್ಬಲತೆಗಳನ್ನು ಅವುಗಳ ನಿರ್ವಹಕರಿಗೆ ಬಹಿರಂಗಪಡಿಸುತ್ತಿದ್ದೇವೆ.

ಕೋರ್ ಲಾಜಿಕ್ ಅನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ಕಚ್ಚಾ ಮೂಲ ಕೋಡ್‌ಗೆ ಪ್ರವೇಶವಿಲ್ಲದೆ ಮಾಡೆಲ್‌ಗಳು ಸಾಫ್ಟ್‌ವೇರ್ ಬೈನರಿಗಳನ್ನು ರಿವರ್ಸ್ ಎಂಜಿನಿಯರ್ ಮಾಡಬಹುದೇ ಎಂಬುದನ್ನು ಅಳೆಯುವ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಆದ SRE-Bench15 ನಲ್ಲಿ ನಾವು Astra ಅನ್ನು ಸಹ ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ. Astra ಒಂದೇ ಪ್ರಯತ್ನದಲ್ಲಿ 88.0% ಕಾರ್ಯಗಳನ್ನು ಮತ್ತು ನಾಲ್ಕು ಪ್ರಯತ್ನಗಳೊಳಗೆ 99.2% ಕಾರ್ಯಗಳನ್ನು ಪರಿಹರಿಸಿತು; ಇದಕ್ಕೆ ಹೋಲಿಸಿದರೆ GPT‑5.6 Sol ಕ್ರಮವಾಗಿ 55.9% ಮತ್ತು 68.7% ಕಾರ್ಯಗಳನ್ನು ಪರಿಹರಿಸಿತು.

ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳನ್ನು ಮೀರಿ, ತಜ್ಞರ ನೇತೃತ್ವದ ಮೌಲ್ಯಮಾಪನಗಳು Astra ಅನ್ನು ಉತ್ಪಾದನಾ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳಿಲ್ಲದೆ ಚಲಾಯಿಸಿದಾಗ, ಅದು ಹಿಂದೆ ತಿಳಿಯದ ದುರ್ಬಲತೆಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಬಲಪಡಿಸಲಾದ ಬ್ರೌಸರ್‌ಗಳಲ್ಲಿ ಅನಿಯಂತ್ರಿತ ಕೋಡ್ ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಯನ್ನು ಸಾಧಿಸಬಹುದು ಮತ್ತು ಬಲಪಡಿಸಲಾದ ಆಪರೇಟಿಂಗ್ ಸಿಸ್ಟಮ್‌ಗಳಿಗಾಗಿ ಅಧಿಕಾರ-ಏರಿಕೆ ಎಕ್ಸ್‌ಪ್ಲಾಯಿಟ್‌ಗಳನ್ನು ರಚಿಸಬಹುದು ಎಂದು ಕಂಡುಹಿಡಿದವು.

ನಾವು The Defender’s Window ನಲ್ಲಿ ಚರ್ಚಿಸಿದಂತೆ, ಅತ್ಯಾಧುನಿಕ ಸೈಬರ್ ಸಾಮರ್ಥ್ಯಗಳು ರಕ್ಷಕರಿಗೆ ದುರ್ಬಲತೆಗಳನ್ನು ವೇಗವಾಗಿ ಕಂಡುಹಿಡಿಯಲು ಸಹಾಯ ಮಾಡಬಹುದು, ಆದರೆ ಅವು ಆ ದುರ್ಬಲತೆಗಳನ್ನು ದುರುಪಯೋಗಪಡಿಸಿಕೊಳ್ಳುವುದನ್ನು ಸಹ ಸುಲಭಗೊಳಿಸುತ್ತವೆ, ಇದರಿಂದ ರಕ್ಷಕರು ಹೊಂದಿಕೊಳ್ಳುವ ತುರ್ತು ಅಗತ್ಯ ಹೆಚ್ಚುತ್ತದೆ. ಇಂದು ಬಿಡುಗಡೆಗೊಳ್ಳುತ್ತಿರುವ Astra ಆವೃತ್ತಿಯೊಂದಿಗೆ, ರಕ್ಷಣಾ ತಜ್ಞರು ಇದನ್ನು ಸುರಕ್ಷಿತ ಕೋಡ್ ಪರಿಶೀಲನೆ ಮತ್ತು ಪ್ಯಾಚಿಂಗ್‌ನಂತಹ ಕಾರ್ಯಗಳನ್ನು ಪೂರ್ಣಗೊಳಿಸಲು ಬಳಸಬಹುದು.

ಆದರೆ, ದುರ್ಬಲತೆಗಳಿಗಾಗಿ ಪ್ರೂಫ್-ಆಫ್-ಕಾನ್ಸೆಪ್ಟ್ ಎಕ್ಸ್‌ಪ್ಲಾಯ್ಟ್‌ಗಳನ್ನು ರಚಿಸುವಂತಹ ಇನ್ನಷ್ಟು ಸುಧಾರಿತ ಸೈಬರ್‌ಸುರಕ್ಷತಾ ಕಾರ್ಯಗಳನ್ನು ಪಾಲಿಸಲು Astra ನಿರಾಕರಿಸುತ್ತದೆ. OpenAI Daybreak⁠ ಮೂಲಕ, ಮುಂದಿನ ವಾರಗಳಲ್ಲಿ ಪ್ರವೇಶವನ್ನು ವಿಸ್ತರಿಸಲು ಮತ್ತು ಕಡಿಮೆ ನಿರ್ಬಂಧಿತ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳನ್ನು ಜಾರಿಗೊಳಿಸಲು ನಾವು ಯೋಜಿಸುತ್ತಿದ್ದೇವೆ. ಇದು ದುರ್ಬಲತೆ ಮತ್ತು ಪ್ರೂಫ್-ಆಫ್-ಕಾನ್ಸೆಪ್ಟ್ ಮೌಲ್ಯೀಕರಣ, ಮಾಲ್ವೇರ್ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ಪತ್ತೆ ಎಂಜಿನಿಯರಿಂಗ್ ಒಳಗೊಂಡಂತೆ ಹೆಚ್ಚಿನ ರಕ್ಷಣಾತ್ಮಕ ಕಾರ್ಯಪ್ರವಾಹಗಳನ್ನು ಸಾಧ್ಯಗೊಳಿಸುತ್ತದೆ.

GPT‑5.6 Sol ಗಾಗಿ ನಮ್ಮ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳ ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ಆಧರಿಸಿ, ಸಂಭವನೀಯ ಸೈಬರ್ ದುರುಪಯೋಗದ ವಿರುದ್ಧದ ನಮ್ಮ ರಕ್ಷಣೆಗಳನ್ನು ಸಹ ನಾವು ಬಲಪಡಿಸಿದ್ದೇವೆ. ಸಂಭವನೀಯ ಜೈಲ್‌ಬ್ರೇಕ್‌ಗಳನ್ನು ಉತ್ತಮವಾಗಿ ತಡೆದುಕೊಳ್ಳಲು ಹೆಚ್ಚು ಬಲಿಷ್ಠವಾದ ಮಾಡೆಲ್ ದೃಢತೆ ಮತ್ತು ನಮ್ಮ ಮೇಲ್ವಿಚಾರಣಾ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಹೆಚ್ಚಿನ ಸಂದರ್ಭವನ್ನು ಇವು ಒಳಗೊಂಡಿವೆ. ನಮ್ಮ ಆಂತರಿಕ ರೆಡ್ ಟೀಮಿಂಗ್ ದಾಳಿಕಾರರೊಂದಿಗೆ ಸ್ವಯಂಚಾಲಿತ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ಒಳಗೊಂಡಂತೆ, ಕಠಿಣ ಆಂತರಿಕ ಮತ್ತು ಬಾಹ್ಯ ಪರೀಕ್ಷೆಗಳನ್ನು ನಾವು ಮುಂದುವರಿಸಿದ್ದೇವೆ. ನಮ್ಮ ಸೈಬರ್ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳು ಮತ್ತು ಪರೀಕ್ಷೆಯ ಕುರಿತು ಹೆಚ್ಚಿನ ವಿವರಗಳು Astra ಸುರಕ್ಷತಾ ಅವಲೋಕನದಲ್ಲಿ⁠ ಮತ್ತು ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್‌ನಲ್ಲಿ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಲಭ್ಯವಿವೆ..

GPT‑6 Astra ಅನ್ನು ಜವಾಬ್ದಾರಿಯುತವಾಗಿ ಹೊಂದಾಣಿಕೆಗೊಳಿಸುವುದು ಮತ್ತು ನಿಯೋಜಿಸುವುದು

Astra ನಮ್ಮ ಅತ್ಯಂತ ಹೊಂದಾಣಿಕೆಯಾಗಿರುವ ಮಾಡೆಲ್ ಆಗಿದೆ. Astra ಕಾಳಜಿ ವಹಿಸುವಲ್ಲಿ, ಕಾರ್ಯದ ಮಿತಿಗಳನ್ನು ಗೌರವಿಸುವಲ್ಲಿ ಮತ್ತು ಪಾರದರ್ಶಕವಾಗಿ ಸಂವಹನ ಮಾಡುವಲ್ಲಿ ಅತ್ಯುತ್ತಮವಾಗಿದೆ. ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗೆ ಮಾನವ ಉದ್ದೇಶದೊಂದಿಗೆ ಹೊಂದಾಣಿಕೆಯಾಗಿರುವ ಮಾಡೆಲ್‌ಗಳಿಗೆ ತರಬೇತಿ ನೀಡುವುದರ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದ ನಮ್ಮ ದೀರ್ಘಕಾಲದ ಸಂಶೋಧನಾ ಕಾರ್ಯಕ್ರಮದ ಇತ್ತೀಚಿನ ಫಲವೇ ಈ ಕೆಲಸವಾಗಿದೆ.

ಸಂವೇದನಾಶೀಲ ಪರಿಸರಗಳಲ್ಲಿ, Astra ತನ್ನ ಅಪಾಯದ ಮಟ್ಟಕ್ಕೆ ಅನುಗುಣವಾದ ಎಚ್ಚರಿಕೆಯಿಂದ ಮುಂದುವರಿಯುತ್ತದೆ. ಅಸಮರ್ಪಕ ವರ್ತನೆಗೆ ಪ್ರೇರೇಪಿಸುವಂತೆ ಪ್ರತಿಕೂಲವಾಗಿ ಆಯ್ಕೆಮಾಡಲಾದ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ಕಾರ್ಯಗಳ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, Astra ಉದ್ದೇಶಿಸದ ಪರಿಣಾಮಗಳನ್ನು ತಪ್ಪಿಸುವಲ್ಲಿ ಹೆಚ್ಚು ಯಶಸ್ವಿಯಾಗಿತ್ತು. ಡೀಫಾಲ್ಟ್ ಆಗಿ ಒದಗಿಸಲಾದ ಹೆಚ್ಚುವರಿ ಭದ್ರತಾ ಕ್ರಮಗಳೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸಿದಾಗ ಇನ್ನೂ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆ ದೊರೆಯಿತು.

Astra ಪರೀಕ್ಷಿಸಲಾದ ಇತರ ಯಾವುದೇ ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್‌ಗಳಿಗಿಂತ ಕಡಿಮೆ ಅಸಮಂಜಸ ಫಲಿತಾಂಶಗಳನ್ನು ಉಂಟುಮಾಡುತ್ತದೆ. ನ್ಯಾಯಸಮ್ಮತ ಹೋಲಿಕೆಗಾಗಿ, ನಾವು ಸಾಮಾನ್ಯ ಕಂಪ್ಯೂಟರ್-ಯೂಸಿಂಗ್ ಏಜೆಂಟ್ ಪೂರಕ ವ್ಯವಸ್ಥೆಯನ್ನು ಬಳಸಿದ್ದೇವೆ ( OpenAI Responses API⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಮತ್ತು Anthropic Messages API⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಎರಡರಲ್ಲಿಯೂ ಲಭ್ಯವಿರುವ ನೆಟೀವ್ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ ಸಾಧನಗಳ ಆಧಾರದ ಮೇಲೆ) ಮತ್ತು Codex ಹಾಗೂ ChatGPT Work ಬಳಕೆದಾರರಿಗೆ ಸಾಮಾನ್ಯವಾಗಿ ನಿಯೋಜಿಸಲ್ಪಡುವ ಹೆಚ್ಚುವರಿ ರಕ್ಷಣೆಗಳಿಲ್ಲದೆ (ಸ್ವಯಂ-ಪರಿಶೀಲನೆ, ದೃಢೀಕರಣ ನೀತಿ).

Astra ಬಳಕೆದಾರರು ನಿಗದಿಪಡಿಸಿದ ಮತ್ತು ಅದರ ಪರಿಸರದಿಂದ ಪರೋಕ್ಷವಾಗಿ ಸೂಚಿಸಲ್ಪಡುವ ಮಿತಿಗಳೊಳಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಸಾಧ್ಯತೆಯೂ ಹೆಚ್ಚು. ಆಂತರಿಕ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, Codex Auto-Review ನಿರಾಕರಣೆಯನ್ನು ತಪ್ಪಿಸಲು Astra ಎಂದಿಗೂ ಪ್ರಯತ್ನಿಸಲಿಲ್ಲ. Auto-review ಅನ್ನು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ತಪ್ಪಿಸಿಕೊಳ್ಳಬಹುದಾದಂತೆ ಕಾನ್ಫಿಗರ್ ಮಾಡಲಾಗಿದ್ದರೂ ಮತ್ತು ಇಲ್ಲದಿದ್ದರೆ ಕಾರ್ಯವನ್ನು ಪೂರ್ಣಗೊಳಿಸುವುದು ಅಸಾಧ್ಯವಾಗಿದ್ದರೂ ಸಹ ಇದು ಸತ್ಯವಾಗಿಯೇ ಉಳಿಯಿತು. ಪರಿಸರದ ನಿರ್ಬಂಧಗಳ ಈ ಗೌರವವು, ಈ ಪೋಸ್ಟ್‌ನ ಪರಿಚಯದಲ್ಲಿ ನಾವು ಹಂಚಿಕೊಂಡ ಅಸಾಧ್ಯ ಸೈಬರ್ ಕಾರ್ಯದ ಮೌಲ್ಯಮಾಪನದ ಫಲಿತಾಂಶಗಳು ಮತ್ತು ನಮ್ಮ ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ದಾಖಲಿಸಲಾದ ಇತರ ಶೋಧಗಳಿಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ.

ಪಾರದರ್ಶಕ ಬಳಕೆದಾರ ಸಂವಹನದಲ್ಲಿ Astra ಹೆಚ್ಚುವರಿಯಾಗಿ ಹೊಸ ಮಾನದಂಡಗಳನ್ನು ಸ್ಥಾಪಿಸುತ್ತದೆ. ಒಂದು ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, Astra, GPT‑5.6 Sol ತನ್ನ ಸಾಮರ್ಥ್ಯಗಳು ಮತ್ತು ಸೌಲಭ್ಯಗಳ ಬಗ್ಗೆ ತಪ್ಪಾದ ನಿರೂಪಣೆಗಳನ್ನು ಮಾಡಲು

ನಮ್ಮ ಸಾಮರ್ಥ್ಯ-ಭ್ರಮೆ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, Astra GPT‑5.6 Sol ಗಿಂತ ಗಣನೀಯ ಸುಧಾರಣೆಯನ್ನು ತೋರಿಸುತ್ತದೆ ಮತ್ತು ತನ್ನ ಸಾಮರ್ಥ್ಯಗಳ ಬಗ್ಗೆ ಕಡಿಮೆ ತಪ್ಪುದಾರಿಗೆಳೆಯುವ ಹೇಳಿಕೆಗಳನ್ನು ನೀಡುತ್ತದೆ.

ಮೇಲ್ವಿಚಾರಣೆಯಿಂದ ತಪ್ಪಿಸಿಕೊಳ್ಳುವಂತೆ ಸ್ಪಷ್ಟವಾಗಿ ಸೂಚಿಸಿದ ಪರೀಕ್ಷೆಗಳ ಆಧಾರದ ಮೇಲೆ, GPT‑5.6 Sol ಗೆ ಹೋಲಿಸಿದರೆ Astra ದ ಲಿಖಿತ ರೀಜನಿಂಗ್ ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು ಹೆಚ್ಚು ಕಷ್ಟಕರವೆಂದು ನಮ್ಮ ಮೌಲ್ಯಮಾಪನಗಳು ಕಂಡುಕೊಂಡಿವೆ. ಸರಳ ಕಾರ್ಯಗಳಲ್ಲಿ ಲಿಖಿತ ರೀಜನಿಂಗ್ ಮೇಲೆ Astraಗೆ ಹೆಚ್ಚಿನ ನಿಯಂತ್ರಣ ಇರುವುದು ಮತ್ತು ಕಡಿಮೆ ಲಿಖಿತ ಹಂತಗಳೊಂದಿಗೆ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸುವ ಸಾಮರ್ಥ್ಯ ಇರುವುದು ಇದಕ್ಕೆ ಕಾರಣವೆಂದು ನಾವು ಭಾವಿಸುತ್ತೇವೆ. ಸಂಕೀರ್ಣ ಕಾರ್ಯಗಳಿಗೆ ಅಗತ್ಯವಿರುವ ರೀಜನಿಂಗ್ ಅನ್ನು ಮರೆಮಾಡಲು Astra ಇನ್ನೂ ಕಷ್ಟಪಡುತ್ತಿರುವಂತೆ ಕಾಣುತ್ತದೆ, ಆದರೆ ಈ ಕುಸಿತವನ್ನು ನಾವು ಗಂಭೀರವಾಗಿ ಪರಿಗಣಿಸುತ್ತೇವೆ. ಮೇಲ್ವಿಚಾರಣಾ ಸಾಮರ್ಥ್ಯವನ್ನು ಸುಧಾರಿಸುವುದು ಇನ್ನೂ ಸಂಶೋಧನೆಯ ಆದ್ಯತೆಯಾಗಿದೆ ಮತ್ತು ಜೊತೆಯಲ್ಲಿರುವ ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಮ್ಮ ಕಂಡುಹಿಡಿಕೆಗಳು ಮತ್ತು ನಡೆಯುತ್ತಿರುವ ಕೆಲಸದ ವಿವರಗಳನ್ನು ಒದಗಿಸುತ್ತದೆ.

ಹೊಂದಾಣಿಕೆ ತರಬೇತಿ ನಿಯೋಜನೆಗೆ ನಮ್ಮ ವಿಧಾನಕ್ಕೆ ಮೂಲಭೂತವಾಗಿದೆ. ಹೆಚ್ಚುವರಿ ರಕ್ಷಣೆಯ ಪದರವಾಗಿ, ಅಸುರಕ್ಷಿತ ನಡವಳಿಕೆಯನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಮತ್ತು ನಿಯಂತ್ರಿಸಲು ಸಹಾಯವಾಗುವಂತೆ ನಾವು Codex ಸ್ವಯಂ-ಪರಿಶೀಲನೆ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಯಂತಹ ಸಿಸ್ಟಮ್ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತೇವೆ ಮತ್ತು ಏಜೆಂಟ್‌ಗಳ ರೀಜನಿಂಗ್ ಹಾಗೂ ಕ್ರಿಯೆಗಳನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುತ್ತೇವೆ. ನಮ್ಮ ಸುರಕ್ಷತಾ ನವೀಕರಣ⁠ದಲ್ಲಿ ವಿವರಿಸಿದಂತೆ, ಹೊಂದಾಣಿಕೆಯ ಕೊರತೆಯ ಬಗ್ಗೆ ಗೋಚರತೆ ಹೊಂದಲು ಮತ್ತು ಅದರ ಅತ್ಯಂತ ಗಂಭೀರ ಸಂದರ್ಭಗಳನ್ನು ನಿಯಂತ್ರಿಸಲು Astra ವರ್ಗದ ಮಾಡೆಲ್‌ಗಳಿಗಾಗಿ ಉತ್ಪಾದನೆಯಲ್ಲಿ ಹೊಂದಾಣಿಕೆಯ ಕೊರತೆಯ ಮೇಲ್ವಿಚಾರಣೆಯನ್ನೂ ನಿಯೋಜಿಸುತ್ತಿದ್ದೇವೆ. ಈ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳು ನಮ್ಮ ಆಂತರಿಕ ನಿಯೋಜನೆಗಳ ಮೇಲ್ವಿಚಾರಣೆಯನ್ನು ಹೋಲುತ್ತವೆ ಮತ್ತು ಮಾಡೆಲ್‌ನ ರೀಜನಿಂಗ್ ಹಾಗೂ ಕ್ರಿಯೆಗಳಲ್ಲಿ ಅನಧಿಕೃತ ನಡವಳಿಕೆಯನ್ನು ಪರಿಶೀಲಿಸಿ, ಸಂಭಾವ್ಯ ಅನಧಿಕೃತ ಚಟುವಟಿಕೆಯನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ನಿಲ್ಲಿಸುವ ವರ್ಗೀಕಾರಕಗಳ ವ್ಯವಸ್ಥೆಯನ್ನು ಒಳಗೊಂಡಿವೆ.

Astra ದ ಸೈಬರ್‌ಭದ್ರತಾ ಸಾಮರ್ಥ್ಯಗಳಲ್ಲಿ ಗಣನೀಯ ಹೆಚ್ಚಳವಾಗಿರುವುದರಿಂದ, ಈ ನಿಯೋಜನೆಯನ್ನು ಸುರಕ್ಷಿತವೂ ಭದ್ರವೂ ಆಗಿಸಲು ನಾವು ವಿಶೇಷ ಎಚ್ಚರಿಕೆ ವಹಿಸುತ್ತಿದ್ದೇವೆ. ಹೆಚ್ಚುವರಿ ಸುರಕ್ಷತಾ ಪರಿಶೀಲನೆಗಳು ಕೆಲವೊಮ್ಮೆ ರಕ್ಷಣಾತ್ಮಕ ಸೈಬರ್ ಭದ್ರತೆಯನ್ನು ಒಳಗೊಂಡಂತೆ ನ್ಯಾಯಸಮ್ಮತ ಕೆಲಸವನ್ನು ನಿಧಾನಗೊಳಿಸಬಹುದು, ತಾತ್ಕಾಲಿಕವಾಗಿ ವಿರಾಮಗೊಳಿಸಬಹುದು ಅಥವಾ ನಿಲ್ಲಿಸಬಹುದು. ChatGPT ಅಥವಾ Codex ನಲ್ಲಿ ಕಾರ್ಯವನ್ನು ವಿರಾಮಗೊಳಿಸಿದರೆ, ಮುಂದುವರಿಯುವ ಮೊದಲು ಕ್ರಮವನ್ನು ಪರಿಶೀಲಿಸಲು ನಿಮ್ಮನ್ನು ಕೇಳಬಹುದು. API ನಲ್ಲಿ, ಕಾರ್ಯವು ನಿಲ್ಲುತ್ತದೆ. ಈ ಪರಿಶೀಲನೆಗಳು ಕೆಲವೊಮ್ಮೆ ಮಾನ್ಯವಾದ ಕೆಲಸಕ್ಕೆ ಅಡಚಣೆ ಉಂಟುಮಾಡಬಹುದು ಮತ್ತು ಅನಗತ್ಯ ಅಡಚಣೆಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಲು ನಾವು ಈ ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರಂತರವಾಗಿ ಸುಧಾರಿಸುತ್ತಿದ್ದೇವೆ. ಹೊಂದಾಣಿಕೆಯ ಕೊರತೆಯ ಮೇಲ್ವಿಚಾರಣೆಯು ಹೊಂದಾಣಿಕೆಗೆ ಪರ್ಯಾಯವಾಗಲು ಸಾಧ್ಯವಿಲ್ಲ: ಮಾಡೆಲ್‌ಗಳು ತಮ್ಮ ಅಧಿಕೃತ ವ್ಯಾಪ್ತಿಯೊಳಗೆ ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಉಳಿಯುವಂತೆ ನಿರ್ಮಿಸುವುದು ನಮ್ಮ ಗುರಿಯಾಗಿದೆ, ಇದರಿಂದ ಈ ರಕ್ಷಣೆಗಳು ಮಧ್ಯಪ್ರವೇಶಿಸಬೇಕಾಗುವುದಿಲ್ಲ.

ಲಭ್ಯತೆ

GPT‑6 Astra ಇಂದು ಸೀಮಿತ ಸಂಖ್ಯೆಯ ಸಂಸ್ಥೆಗಳಿಗೆ ಹಂತ ಹಂತವಾಗಿ ಲಭ್ಯವಾಗುತ್ತಿದೆ ಮತ್ತು ಮುಂಬರುವ ದಿನಗಳಲ್ಲಿ ಎಲ್ಲಾ ChatGPT Plus, Pro, Business ಮತ್ತು Enterprise ಬಳಕೆದಾರರಿಗೆ, ಹಾಗೆಯೇ OpenAI API, Microsoft Azure ಮತ್ತು AWS Bedrock ಮೂಲಕ ಲಭ್ಯವಾಗಲಿದೆ. Astra ಬಳಕೆಯು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಚಂದಾದಾರಿಕೆ ಭತ್ಯೆಗಳಲ್ಲಿ ಸೇರಿದೆ—ಬಳಕೆದಾರರು ಮತ್ತು ವ್ಯವಹಾರಗಳು ಹೆಚ್ಚುವರಿ ಬಳಕೆಗಾಗಿ ಕ್ರೆಡಿಟ್‌ಗಳನ್ನು ಖರೀದಿಸಬಹುದು. Pro, Business ಮತ್ತು Enterprise ಯೋಜನೆಗಳ ಬಳಕೆದಾರರು GPT‑6 Astra Pro ಗೆ ಪ್ರವೇಶವನ್ನೂ ಪಡೆಯುತ್ತಾರೆ. Enterprise ನಿರ್ವಾಹಕರು ತಮ್ಮ ವರ್ಕ್‌ಸ್ಪೇಸ್‌ಗೆ Astra ಅನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಬಹುದು; ಬಿಡುಗಡೆಯ ಸಮಯದಲ್ಲಿ ಪ್ರವೇಶವು ಪೂರ್ವನಿಯೋಜಿತವಾಗಿ ಆಫ್ ಆಗಿರುತ್ತದೆ.

Astra ಅರ್ಹ API ಗ್ರಾಹಕರಿಗೆ ಜೀರೋ ಡೇಟಾ ರಿಟೆನ್ಷನ್ ಅನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ ಮತ್ತು ನಾವು ಕಳೆದ ತಿಂಗಳು ಹಂಚಿಕೊಂಡಂತೆ, ಗ್ರಾಹಕರ ಗೌಪ್ಯತೆಯನ್ನು ಕಾಪಾಡಿಕೊಂಡು ಸುರಕ್ಷತಾ ಮೇಲ್ವಿಚಾರಣೆಯನ್ನು ಬಲಪಡಿಸಲು ಖಾಸಗಿ ಸುರಕ್ಷತಾ ಸಂಸ್ಕರಣೆಯನ್ನು ಪರೀಕ್ಷಿಸುತ್ತಿದ್ದೇವೆ.

ಡೆವಲಪರ್‌ಗಳಿಗಾಗಿ, GPT‑6 Astra OpenAI API ನಲ್ಲಿ gpt-6-astra ಆಗಿ ಹಾಗೂ Microsoft Azure ಮತ್ತು Amazon Bedrock ಮೂಲಕ ಲಭ್ಯವಾಗಲಿದೆ.

OpenAI API ಸ್ಟ್ಯಾಂಡರ್ಡ್ ದರವು ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳಿಗೆ $10 ಮತ್ತು ಪ್ರತಿ ಮಿಲಿಯನ್ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳಿಗೆ $50 ಆಗಿದೆ. ಕ್ಯಾಶ್ ಓದುವಿಕೆಗಳು ಮತ್ತು ಬರೆಯುವಿಕೆಗಳಿಗೆ ಪ್ರತ್ಯೇಕ ದರಗಳು ಅನ್ವಯಿಸುತ್ತವೆ. API ಯಲ್ಲಿ GPT‑6 Astra ಗಾಗಿ ಫಾಸ್ಟ್ ಮೋಡ್ ಲಭ್ಯವಿದ್ದು, ಸ್ಟ್ಯಾಂಡರ್ಡ್ ದರದ 2x ಬೆಲೆಯಲ್ಲಿ ಸ್ಟ್ಯಾಂಡರ್ಡ್ ಪ್ರೊಸೆಸಿಂಗ್‌ಗಿಂತ 2x ವರೆಗಿನ ವೇಗವನ್ನು ಒದಗಿಸುತ್ತದೆ.

ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ

ಕಂಪ್ಯೂಟರ್ ಬಳಕೆGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1ಕ್ಲಾಡ್ ಫೇಬಲ್ 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (ಆಗಸ್ಟ್ ಬಿಡುಗಡೆ, ಭಾಗಶಃ ಸ್ಕೋರ್)---66.1%70.6%-
OSWorld 2.0 (ಆಗಸ್ಟ್ ಬಿಡುಗಡೆ, ಆಫ್‌ಲೈನ್ ಉಪಸಮೂಹ, ಭಾಗಶಃ ಸ್ಕೋರ್)------
ScreenSpot Pro92.6%76.8%----
BrowseComp92.1%90.4%-87.4%90.8%-

ಪ್ರೊಫೆಷನಲ್

ಪ್ರೊಫೆಷನಲ್

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

ಕ್ಲಾಡ್ ಫೇಬಲ್ 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

ಓಪನ್‌ಸ್ಕೋರ್ ಸ್ಟ್ರಿಂಗ್ ಚತುಷ್ಕಗಳು (1 - OMR-NED)

0.84

0.19

-

-

-

-

ಆಂತರಿಕ ವಿನ್ಯಾಸ ಕಾರ್ಯಗಳು

50.0%

47.4%

-

35.8%

-

-

ಆಂತರಿಕ ಡೇಟಾ ಸೈನ್ಸ್ ಕಾರ್ಯಗಳು

40.9%

30.5%

-

34.7%

-

-

ಆರ್ಟಿಫಿಷಿಯಲ್ ಅನಾಲಿಸಿಸ್ ಇಂಟೆಲಿಜೆನ್ಸ್ ಸೂಚ್ಯಂಕ v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

ಕೋಡಿಂಗ್

ಕೋಡಿಂಗ್GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (ಅಂಕ)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (ಅಂಕ)53.3% 847.5%50.9%53.5%53.4%43.6%
ಆಂತರಿಕ ಡೇಟಾಬೇಸ್ ಮೈಗ್ರೇಶನ್ ಕಾರ್ಯಗಳು63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

ಅಕಾಡೆಮಿಕ್

ಅಕಾಡೆಮಿಕ್

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

ಕ್ಲಾಡ್ ಫೇಬಲ್ 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA ಡೈಮಂಡ್

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

ಮಾನವೀಯತೆಯ ಕೊನೆಯ ಪರೀಕ್ಷೆ (ಉಪಕರಣಗಳೊಂದಿಗೆ)

57.2%

-

65.0%

63.8%

63.6%

-

ವಿಜ್ಞಾನ ಮತ್ತು ಆರೋಗ್ಯ

ವಿಜ್ಞಾನ ಮತ್ತು ChatGPT HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (ಆಂತರಿಕ)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (ಉದ್ದಕ್ಕೆ ಸರಿಹೊಂದಿಸಿದ)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

ಸೈಬರ್‌ಸುರಕ್ಷತೆ

ಸೈಬರ್ ಭದ್ರತೆGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (ಜೂನ್-ಆಗಸ್ಟ್ 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

ಹೊಂದಿಸುವಿಕೆ

ಹೊಂದಿಸುವಿಕೆ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

ಕ್ಲಾಡ್ ಫೇಬಲ್ 5

Claude Opus 5

Gemini 3.8 Flash

ಆಂತರಿಕ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ ಸುರಕ್ಷತಾ ಬೆಂಚ್‌ಮಾರ್ಕ್ (ಕಡಿಮೆ ಇದ್ದಷ್ಟು ಉತ್ತಮ)

2.4%

22.0%

9.5%

18.3%

11.5%

-

ಆಂತರಿಕ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ಸುರಕ್ಷತಾ ಬೆಂಚ್‌ಮಾರ್ಕ್, AutoReview ಜೊತೆಗೆ (ಕಡಿಮೆ ಇದ್ದಷ್ಟೂ ಉತ್ತಮ)

1.8%

4.3%

-

-

-

-

ಆಂತರಿಕ ತಪ್ಪಿಸಿಕೊಳ್ಳುವಿಕೆಯ ಮಾನದಂಡ (ಕಡಿಮೆ ಇದ್ದಷ್ಟು ಉತ್ತಮ)

0.00%

0.29%

-

-

-

-

ExploitGym ಹನಿಪಾಟ್ (ಕಡಿಮೆ ಇದ್ದಷ್ಟು ಉತ್ತಮ)

0.0%

48.2%

-

-

-

-

ಅಸಾಧ್ಯ ExploitGym

100.0%

-

-

-

-

-

ಆಂತರಿಕ ಹಾಲ್ಯೂಸಿನೇಷನ್ ಬೆಂಚ್‌ಮಾರ್ಕ್ (ಕಡಿಮೆ ಇದ್ದಷ್ಟು ಉತ್ತಮ)

4.2%

12.2%

-

-

-

-

ದೀರ್ಘ ಸಂದರ್ಭ.

ದೀರ್ಘ ಸಂದರ್ಭ.

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

ಕ್ಲಾಡ್ ಫೇಬಲ್ 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

ಅಮೂರ್ತ ತಾರ್ಕಿಕತೆ

ಅಮೂರ್ತ ರೀಜನಿಂಗ್GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

ಯಾವುದೇ ಪ್ರಯತ್ನದಲ್ಲೂ ಮೌಲ್ಯಮಾಪನ ಅಂಕಗಳು ಗರಿಷ್ಠವಾಗಿರುತ್ತವೆ. GPT ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ನಮ್ಮ ಸಂಶೋಧನಾ ಪರಿಸರದಲ್ಲಿ ಅಥವಾ ನಮ್ಮ API ಮೂಲಕ ರನ್ ಮಾಡಲಾಯಿತು, ಇದು ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್‌ಗಳು, ಲಭ್ಯವಿರುವ ಟೂಲ್‌ಗಳು ಇತ್ಯಾದಿಗಳಲ್ಲಿನ ವ್ಯತ್ಯಾಸಗಳಿಂದಾಗಿ ಉತ್ಪಾದನಾ ChatGPT ಗಿಂತ ಸ್ವಲ್ಪ ವಿಭಿನ್ನ ಔಟ್‌ಪುಟ್ ಅನ್ನು ಒದಗಿಸಬಹುದು.

ಅಡಿಟಿಪ್ಪಣಿಗಳು

  1. 1

    ARC-AGI-3ನಲ್ಲಿ, GPT-6 Astra ಅನ್ನು ನಮ್ಮ responses API ಪೂರಕ ವ್ಯವಸ್ಥೆಯೊಂದಿಗೆ⁠ ರನ್ ಮಾಡಲಾಯಿತು, ಇದು ನೈಜ-ಜಗತ್ತಿನ ಕಾರ್ಯಕ್ಷಮತೆಗೆ ಉತ್ತಮವಾಗಿ ಹೊಂದಿಕೆಯಾಗುವಂತೆ ಎರಡು ಸೆಟ್ಟಿಂಗ್‌ಗಳನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ. ಈ ಬದಲಾವಣೆಗಳು ನಿರ್ದಿಷ್ಟವಾಗಿ ARC-AGI-3 ಅನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿಲ್ಲ.

  2. 2

    GPT-5.6 Sol ನಮ್ಮ API, ChatGPT Codex ಮತ್ತು ChatGPT Work ನಲ್ಲಿ ಲಭ್ಯವಿರುವ ಆವೃತ್ತಿಯನ್ನು ಸೂಚಿಸುತ್ತದೆ. ChatGPT ಚಾಟ್ ನಲ್ಲಿರುವ ಆವೃತ್ತಿಯು ಸ್ವಲ್ಪ ವಿಭಿನ್ನವಾಗಿದೆ.⁠

  3. 3

    OSWorld V2-Offline ಎಂಬುದು ಇಂಟರ್ನೆಟ್ ಪ್ರವೇಶವಿಲ್ಲದೆ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಮೂಲ OSWorld V2 ನ ಉಪಸಮೂಹವಾಗಿದೆ. OSWorld-V2 Offline ನಲ್ಲಿ Claude ಮಾಡೆಲ್‌ನ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಲೇಖಕರು ಅಧಿಕೃತ ಲೀಡರ್‌ಬೋರ್ಡ್‌ನಲ್ಲಿ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಮರುಉತ್ಪಾದಿಸಿದರು. OSWorld 2.0 ನಲ್ಲಿ, Claude ಗಾಗಿ ಸ್ಕೋರ್‌ಗಳು ಅಧಿಕೃತ ಸೆಟ್ಟಿಂಗ್‌ಗಳನ್ನು ಬಳಸುತ್ತವೆ; Fable 5.1 ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್‌ನ ಮಾರ್ಪಡಿಸಿದ ಕಾರ್ಯಗಳು ಮತ್ತು ಮಾರ್ಪಡಿಸಿದ ಶ್ರೇಣೀಕರಣವನ್ನು ಬಳಸುವುದಿಲ್ಲ.

  4. 4

    ಮಾಡೆಲ್ ಸಮಯಗಳು ಅನುಗುಣವಾದ ಪ್ರದರ್ಶನ ರನ್‌ಗಳಿಗಾಗಿ ವರದಿ ಮಾಡಲಾದ ಕಳೆದ ಸಮಯಗಳಾಗಿವೆ. ಪ್ರದರ್ಶಿಸಲಾದ ಕ್ಲಿಪ್‌ಗಳು ಸಂಪಾದಿತ ಆಯ್ದ ಭಾಗಗಳಾಗಿವೆ.

  5. 5

    BenchCAD ನಲ್ಲಿ, Claude ನ ಅಂಕಗಳು ಮೌಲ್ಯಮಾಪನಕ್ಕೆ ಮಾಡಲಾದ ಮೂರು ಮಾರ್ಪಾಡುಗಳನ್ನು ಪ್ರತಿಬಿಂಬಿಸುತ್ತವೆ; ಅವುಗಳನ್ನು Fable 5.1 ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ವಿವರಿಸಲಾಗಿದೆ.

  6. 6

    ಗುವಾಂಗ್ ಯಾಂಗ್, ವಿಕ್ಟೋರಿಯಾ ಎಬರ್ಟ್, ನಾಜಿಫ್ ಟಾಮರ್, ಬ್ರಯನ್ ಸಿಯುವಾನ್ ಝೆಂಗ್, ಲೂಯಿಜಾ ಪೊಜ್ಜೊಬೊನ್ ಮತ್ತು ನೋಆ ಎ. ಸ್ಮಿತ್. “LEGATO: ಟೈಪ್‌ಸೆಟ್ OMR ಗಾಗಿ ದೊಡ್ಡ-ಪ್ರಮಾಣದ ಎಂಡ್-ಟು-ಎಂಡ್ ಸಾಮಾನ್ಯೀಕರಿಸಬಹುದಾದ ವಿಧಾನ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).” arXiv:2506.19065, 2025.

  7. 7

    ಮಾರ್ಕ್ ಆರ್. ಎಚ್. ಗೋಥಮ್, ಮೌರೀನ್ ರೆಡ್‌ಬಾಂಡ್, ಬ್ರೂನೋ ಬೋವರ್ ಮತ್ತು ಪೀಟರ್ ಜೋನಸ್. “ಓಪನ್‌ಸ್ಕೋರ್ ಸ್ಟ್ರಿಂಗ್ ಚತುಷ್ಕಗಳ ಕಾರ್ಪಸ್⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).” ಸಂಗೀತಶಾಸ್ತ್ರಕ್ಕಾಗಿ ಡಿಜಿಟಲ್ ಗ್ರಂಥಾಲಯಗಳ 10ನೇ ಅಂತಾರಾಷ್ಟ್ರೀಯ ಸಮ್ಮೇಳನದ ಪ್ರಬಂಧ ಸಂಕಲನ, ಪುಟಗಳು 49–57. ACM, 2023.

  8. 8

    FrontierCode ನಲ್ಲಿ, GPT-6 Astra ಅನ್ನು Codex ನಲ್ಲಿನ ಅದರ ಡೆವಲಪರ್ ಸಂದೇಶದ ಒಂದು ವಿಭಾಗಕ್ಕೆ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಹೋಲುವ ಡೆವಲಪರ್ ಸಂದೇಶದೊಂದಿಗೆ ರನ್ ಮಾಡಲಾಯಿತು: "ಅತಿಯಾದ ಟೆಸ್ಟ್ ಫೈಲ್‌ಗಳನ್ನು ರಚಿಸುವುದನ್ನು ತಪ್ಪಿಸಿ. ರಿಪೊಸಿಟರಿ ಸಂಪ್ರದಾಯಗಳಿಗೆ ಅಗತ್ಯವಿದ್ದಾಗ ಅಥವಾ ಯಾವುದೇ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಫೈಲ್ ಸೂಕ್ತ ಸ್ಥಳವಾಗಿಲ್ಲದಿದ್ದಾಗ ಮಾತ್ರ ಹೊಸ ಟೆಸ್ಟ್ ಫೈಲ್ ರಚಿಸಿ. ಸಂಬಂಧವಿಲ್ಲದ ಕ್ಲೀನ್‌ಅಪ್ ಮತ್ತು ಅನಗತ್ಯ ಸಂಕೀರ್ಣತೆಯನ್ನು ತಪ್ಪಿಸಿ. ಸೂಕ್ತವಾದ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಯುಟಿಲಿಟಿಗಳನ್ನು ಮರುಬಳಸಿ. ಸಂಬಂಧಿತ ರಿಪೊಸಿಟರಿ ಸೂಚನೆಗಳನ್ನು ಓದಿ ಮತ್ತು ಹತ್ತಿರದ ಕೋಡ್, ಪರೀಕ್ಷೆಗಳು, ದಸ್ತಾವೇಜುಗಳು ಮತ್ತು CI ಅನ್ನು ಪರಿಶೀಲಿಸಿ. ಸ್ಥಾಪಿತ ಸಂಪ್ರದಾಯಗಳನ್ನು ಅನುಸರಿಸಿ. ಗುರಿ ಸ್ವಚ್ಛವಾದ, ಮರ್ಜ್ ಮಾಡಬಹುದಾದ ಕೋಡ್ ಆಗಿದೆ." ಇವಾಲ್‌ಗೆ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಆಪ್ಟಿಮೈಜ್ ಮಾಡಲಾಗಿಲ್ಲ.

  9. 9

    ಮೊದಲನೆಯದು, ಸಂಖ್ಯಾ ರೇಖೆಯಲ್ಲಿ ನೀವು ಎಷ್ಟು ದೂರ ಮುಂದಕ್ಕೆ ಹೋದರೂ ಅವಿಭಾಜ್ಯ ಸಂಖ್ಯೆಗಳು ಒಂದಕ್ಕೊಂದು ಎಷ್ಟು ಸಮೀಪದಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳಬಹುದು ಎಂಬುದಕ್ಕೆ ಸಂಬಂಧಿಸಿದೆ. ಒಂದು ದಶಕಕ್ಕೂ ಹೆಚ್ಚಿನ ಕಾಲ, ತಿಳಿದಿದ್ದ ಅತ್ಯುತ್ತಮ ಫಲಿತಾಂಶವು ಅನಂತ ಸಂಖ್ಯೆಯ ಅವಿಭಾಜ್ಯ ಸಂಖ್ಯೆಗಳ ಜೋಡಿಗಳ ನಡುವಿನ ಅಂತರವು ಗರಿಷ್ಠ 246 ಆಗಿದೆ ಎಂದು ಸಾಬೀತುಪಡಿಸಿತ್ತು. ಜೂಲಿಯಾ ಸ್ಟಾಡ್ಲ್‌ಮನ್⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಇತ್ತೀಚೆಗೆ ಆ ಮಿತಿಯನ್ನು 240ಕ್ಕೆ ಸುಧಾರಿಸಿದರು. ಅಸ್ಟ್ರಾ 186 ಎಂಬ ಇನ್ನಷ್ಟು ಬಲವಾದ ಮಿತಿಯನ್ನು ಸ್ಥಾಪಿಸಲು ಸಹಾಯ ಮಾಡಿತು, ಇದರಿಂದ ಈ ಕಡಿಮೆ ಅಂತರದೊಳಗೆ ಅನಂತ ಸಂಖ್ಯೆಯ ಜೋಡಿಗಳು ಸಂಭವಿಸುತ್ತವೆ ಎಂಬುದು ತೋರಿತು. ಸಣ್ಣ ಅವಿಭಾಜ್ಯ ಅಂತರಗಳು: ಪುರಾವೆ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಮತ್ತು ಬೆಂಬಲಕಾರಿ ಸಂಶೋಧನೆ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).

  10. 10

    ಎರಡನೆಯದು ಅವಿಭಾಜ್ಯ ಸಂಖ್ಯೆಗಳ ನಡುವಿನ ಅಸಾಮಾನ್ಯವಾಗಿ ದೊಡ್ಡ ಅಂತರಗಳಿಗೆ ಸಂಬಂಧಿಸಿದೆ. Astra, 80 ವರ್ಷಗಳಿಗಿಂತ ಹೆಚ್ಚು ಕಾಲ ಬದಲಾಗದೆ ಉಳಿದಿದ್ದ ಈ ಅಂತರಗಳ ಮೇಲಿನ ಮಿತಿಯಲ್ಲಿನ ಒಂದು ಪದವನ್ನು ಸುಧಾರಿಸಿತು. ಎರಡೂ ಫಲಿತಾಂಶಗಳಿಗಾಗಿ ನಾವು ಪುರಾವೆಗಳು, ಸಂಕ್ಷಿಪ್ತ ಚೈನ್-ಆಫ್-ಥಾಟ್ ಮತ್ತು ಪರಿಶೀಲನಾ ಸಾಮಗ್ರಿಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳುತ್ತಿದ್ದೇವೆ. ದೊಡ್ಡ ಅವಿಭಾಜ್ಯ ಅಂತರಗಳು: ಪುರಾವೆ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಮತ್ತು ಬೆಂಬಲಿಸುವ ಸಂಶೋಧನೆ⁠(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).

  11. 11

    GPT-5.4 ಶ್ರೇಣೀಕರಣ ಹಾಗೂ ಉದ್ದಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಹೊಂದಿಸಲಾದ ಮತ್ತು ಕತ್ತರಿಸದ (unclipped) ಅಂಕಗಳನ್ನು ಬಳಸಿಕೊಂಡು, ಉದ್ದೇಶಿತ HealthBench Professional ಕಾರ್ಯವಿಧಾನದನ್ವಯ ನಾವು ಎಲ್ಲಾ Claude ಮಾಡೆಲ್ ಗಳನ್ನು ಸ್ವತಂತ್ರವಾಗಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದೆವು. Fable 5.1 ಗಾಗಿ, ಪೂರೈಕೆದಾರರ ನಿರಾಕರಣೆಗಳ ಸಂದರ್ಭದಲ್ಲಿ ನಾವು Opus 5 ಅನ್ನು ಫಾಲ್‌ಬ್ಯಾಕ್ ಆಗಿ ಬಳಸಿದ್ದೇವೆ.

  12. 12

    ಈ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿನ ಬಹುಪಾಲು ಪ್ರಶ್ನೆಗಳನ್ನು Claude Fable 5 ಮತ್ತು 5.1 ನಿರಾಕರಿಸುವುದರಿಂದ, ಅವುಗಳನ್ನು LifeSciBench Gold v1, GeneBench Pro v13 ಮತ್ತು MedChemBench ನಲ್ಲಿ ಸೇರಿಸಲಾಗಿಲ್ಲ.

  13. 13

    ExploitGym ನಲ್ಲಿ, Astra ಮತ್ತು Sol ನ ಪೂರ್ಣ ಸೈಬರ್ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಉತ್ತಮವಾಗಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು, ನಾವು ಅವುಗಳನ್ನು ಆರು-ಗಂಟೆಯ ಸಮಯ ಮಿತಿಯಿಲ್ಲದೆ ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ. ಅವು ಸಾಕಷ್ಟು ವೇಗವಾಗಿರುವುದರಿಂದ ಇದರಿಂದ ಅಲ್ಪ ಪರಿಣಾಮ ಮಾತ್ರ ಉಂಟಾಗುತ್ತದೆ.

  14. 14

    ExploitBench (ಜೂನ್–ಆಗಸ್ಟ್ 2026) 13 ಸ್ಥಿರ Chrome ಬಿಡುಗಡೆಗಳಲ್ಲಿ 20 ಉನ್ನತ-ತೀವ್ರತೆಯ V8 ದೋಷಗಳನ್ನು ಒಳಗೊಂಡಿದೆ. ಪ್ರತಿ ನಿರ್ದಿಷ್ಟ ದುರ್ಬಲತೆಯನ್ನು ದುರುಪಯೋಗಪಡಿಸಿಕೊಳ್ಳುವ ಮೂಲಕ ಏಜೆಂಟ್‌ಗಳು Linux ಗಾಗಿ V8 ಮತ್ತು ಅಧಿಕೃತ Chrome ಬಿಡುಗಡೆಗಳಲ್ಲಿ ಅನಿಯಂತ್ರಿತ ಕೋಡ್-ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಯನ್ನು ಸಾಧಿಸಬಹುದೇ ಎಂಬುದನ್ನು ಬೆಂಚ್ಮಾರ್ಕ್ ಪರೀಕ್ಷಿಸುತ್ತದೆ. ಒಳಗೊಂಡಿರುವ ಕೆಲವು ದುರ್ಬಲತೆಗಳು ಮೌಲ್ಯಮಾಪನದ ನಿರ್ಬಂಧಗಳ ಅಡಿಯಲ್ಲಿ ಅನಿಯಂತ್ರಿತ ಕೋಡ್ ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಗೆ ಅವಕಾಶ ನೀಡದೇ ಇರಬಹುದು, ಆದ್ದರಿಂದ 100% ಯಶಸ್ಸಿನ ದರವನ್ನು ಸಾಧಿಸುವುದು ಸಾಧ್ಯವಾಗದೇ ಇರಬಹುದು. ಗಮನಿಸಿ: GPT-5.6 Sol ನ 5.5% ಅಂಕವು ಬೆಂಚ್ಮಾರ್ಕ್‌ನ 300-ತಿರುವುಗಳ ಮಿತಿಯ ಪರಿಣಾಮವಾಗಿದೆ; ಇದು max ಬಳಸುವ ನಿಜವಾದ ಗ್ರಾಹಕರಿಗೆ ಅನ್ವಯಿಸುವ ಮಿತಿಯಲ್ಲ. ಕಡಿಮೆ ಮಿತಿಗಳನ್ನು ತಲುಪಿದಾಗ, ಇದೇ ರೀತಿಯ ಸೆಟ್ಟಿಂಗ್‌ಗಳಲ್ಲಿ ಮಾಡೆಲ್ 11.5% ಅಂಕವನ್ನು ಸಾಧಿಸಿತು.

  15. 15
  16. 16

    ನಾವು ತೃತೀಯ-ಪಕ್ಷದ ಮಾಡೆಲ್‌ಗಳಲ್ಲಿ ಪರೀಕ್ಷಿಸುವಾಗ, ಸರಳವಾದ ಸಂಶೋಧನಾ ಸೆಟಪ್ ಅನ್ನು ಬಳಸುತ್ತೇವೆ. Codex ಹೆಚ್ಚು ಸಂಕೀರ್ಣವಾದ ಉತ್ಪಾದನಾ ಸಂರಚನೆಯನ್ನು ಹೊಂದಿದೆ, ಇದರಿಂದ ಕಚ್ಚಾ-ಮಾಡೆಲ್ ದೋಷ ದರಗಳು ವಿಭಿನ್ನವಾಗಬಹುದು. ಪೂರೈಕೆದಾರ-ಪಕ್ಷದ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳು ಮತ್ತು ಕಂಪ್ಯೂಟರ್-ಉಪಕರಣದ ಅನುಷ್ಠಾನಗಳು ಇನ್ನೂ ಭಿನ್ನವಾಗಿವೆ. ಇದು ಆಂತರಿಕ ಸಂಶೋಧನಾ ಸಂರಚನೆಯಾಗಿರುವುದರಿಂದ, ಬಳಕೆದಾರರು Codex ನಲ್ಲಿ ದೃಢೀಕರಣವಿಲ್ಲದ ಸನ್ನಿವೇಶವನ್ನು ಅನುಭವಿಸುವುದಿಲ್ಲ.

  17. 17

    ScreenSpot-Pro ಮತ್ತು ExploitGym ಗಾಗಿ, ನಾವು ವರದಿ ಮಾಡುವ Fable ಸ್ಕೋರ್‌ಗಳು ಕಡಿಮೆ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳನ್ನು ಹೊಂದಿರುವ Fable ಆಗಿರುವ Mythos ನಿಂದ ಬರುತ್ತವೆ.