ಇಂಟೆಲಿಜೆನ್ಸ್ನ ಹೊಸ ಪೀಳಿಗೆ
ನಾವು ವಿಶ್ವದ ಅತ್ಯಂತ ಬುದ್ಧಿವಂತ ಮತ್ತು ಹೊಂದಾಣಿಕೆಯಾಗಿರುವ ಮಾಡೆಲ್ GPT‑6 Astra ಅನ್ನು ಪರಿಚಯಿಸುತ್ತಿದ್ದೇವೆ.
GPT‑6 Astra ಪ್ರೀ-ಟ್ರೈನಿಂಗ್, ರೀಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಮತ್ತು ಅಲೈನ್ಮೆಂಟ್ ಕ್ಷೇತ್ರಗಳಲ್ಲಿನ ವರ್ಷಗಳ ಸಂಶೋಧನೆ ಮತ್ತು ದೊಡ್ಡ ಹೂಡಿಕೆಗಳನ್ನು ಒಟ್ಟುಗೂಡಿಸುತ್ತದೆ. ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ, ಬ್ರೌಸಿಂಗ್, ಸಾಫ್ಟ್ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್, ಸೈಬರ್ಭದ್ರತೆ, ವಿಜ್ಞಾನ ಮತ್ತು ವೃತ್ತಿಪರ ಕೆಲಸದಲ್ಲಿ Astra ಅತ್ಯಾಧುನಿಕವಾಗಿದೆ. ಗಣಿತಶಾಸ್ತ್ರದಲ್ಲಿ ಈಗಾಗಲೇ ದೀರ್ಘಕಾಲದಿಂದ ಬಗೆಹರಿಯದೆ ಉಳಿದಿರುವ ಮುಕ್ತ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸಲು ಸಹಾಯ ಮಾಡಿರುವ Astra, 98% ಅಂಕದೊಂದಿಗೆ FrontierMath Tier 4 ಅನ್ನು ಸ್ಯಾಚುರೇಟ್ ಮಾಡಿದೆ. Astra ಸಹ 99.9% ಅಂಕದೊಂದಿಗೆ ARC-AGI-3 ಅನ್ನು ಸ್ಯಾಚುರೇಟ್ ಮಾಡುತ್ತದೆ ಮತ್ತು 100% ಅಂಕದೊಂದಿಗೆ ExploitBench ಅನ್ನು ಸ್ಯಾಚುರೇಟ್ ಮಾಡುತ್ತದೆ. ಇದು ಕಂಪ್ಯೂಟರ್ ಮತ್ತು ಬ್ರೌಸರ್ ಬಳಕೆಯಲ್ಲಿ ಹೊಸ ಅತ್ಯಾಧುನಿಕತೆಯನ್ನೂ ಸ್ಥಾಪಿಸುತ್ತದೆ ಹಾಗೂ ಸಾಟಿಯಿಲ್ಲದ ವೇಗ, ನಿಖರತೆ ಮತ್ತು ವಿವೇಚನೆಯೊಂದಿಗೆ ಅತ್ಯಂತ ಬೇಡಿಕೆಯ ವೃತ್ತಿಪರ ಕೆಲಸವನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ.
GPT‑6 Astra ಇಂದು ಸೀಮಿತ ಸಂಖ್ಯೆಯ ಸಂಸ್ಥೆಗಳಿಗೆ ಹಂತ ಹಂತವಾಗಿ ಲಭ್ಯವಾಗುತ್ತಿದೆ ಮತ್ತು ಮುಂದಿನ ದಿನಗಳಲ್ಲಿ ಎಲ್ಲಾ ChatGPT Plus, Pro, Business ಮತ್ತು Enterprise ಬಳಕೆದಾರರಿಗೆ, ಹಾಗೆಯೇ OpenAI API, Microsoft Azure ಮತ್ತು AWS Bedrock ಮೂಲಕ ಲಭ್ಯವಾಗಲಿದೆ.
Astra ನಮ್ಮ ಅತ್ಯಂತ ಹೊಂದಾಣಿಕೆಯಾಗಿರುವ ಮಾಡೆಲ್ ಆಗಿದ್ದು, ಬಳಕೆದಾರರ ಉದ್ದೇಶ ಮತ್ತು ಮಾಡೆಲ್ ನಡವಳಿಕೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಲ್ಲಿ ಗಮನಾರ್ಹ ಸುಧಾರಣೆಗಳನ್ನು ಹೊಂದಿದೆ—Astraದ ತೀರ್ಮಾನದ ಮೇಲೆ ಹೆಚ್ಚಿನ ವಿಶ್ವಾಸದೊಂದಿಗೆ ನೀವು ಕಾರ್ಯಗಳನ್ನು ನಿಯೋಜಿಸಬಹುದು. ಇದನ್ನು ನಾವು ಪರೀಕ್ಷಿಸುವ ಒಂದು ವಿಧಾನವಾಗಿ, ಕಷ್ಟಕರ ಅಥವಾ ಅಸಾಧ್ಯವಾದ ಕಾರ್ಯವನ್ನು ಎದುರಿಸುತ್ತಿರುವ ಮಾಡೆಲ್ ತನ್ನ ಉದ್ದೇಶಿತ ವ್ಯಾಪ್ತಿಯನ್ನು ಮೀರಿ ಹೋಗುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ, Hugging Face ಘಟನೆಯಿಂದ ಮಾಹಿತಿ ಪಡೆದ ಹೊಸ ಮೌಲ್ಯಮಾಪನವನ್ನು ನಾವು ನಿರ್ಮಿಸಿದ್ದೇವೆ. ಉತ್ಪಾದನಾ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳಿಲ್ಲದೆ ಅನುಮೋದಿತ ಗುರಿಯನ್ನು 48% ಸಂದರ್ಭಗಳಲ್ಲಿ ಮೀರಿದ GPT‑5.6 Sol ಗೆ ಹೋಲಿಸಿದರೆ, GPT‑6 Astra 0% ಸಂದರ್ಭಗಳಲ್ಲಿ ಹೀಗೆ ಮಾಡಿತು.
ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಗಾಗಿ ವಿಶ್ವದ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್
GPT‑6 Astra ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ವೇಗ, ನಿಖರತೆ ಮತ್ತು ಸುರಕ್ಷತೆಯಲ್ಲಿ ಹೊಸ ಅತ್ಯಾಧುನಿಕ ಗಡಿಯನ್ನು ಗುರುತಿಸುತ್ತದೆ. ಇದು ಆನ್ಲೈನ್ ಫಾರ್ಮ್ಗಳನ್ನು ಭರ್ತಿ ಮಾಡುವುದು, CRM ನಲ್ಲಿ ಗ್ರಾಹಕರ ದಾಖಲೆಗಳನ್ನು ನವೀಕರಿಸುವುದು ಮತ್ತು ನಿಮ್ಮ ಕ್ಯಾಲೆಂಡರ್ ಅನ್ನು ವ್ಯವಸ್ಥಿತಗೊಳಿಸುವುದು ಮುಂತಾದ ಬೇಸರದ ಕಾರ್ಯಗಳನ್ನು ನಿಭಾಯಿಸಬಹುದು. ಇದು ಆನ್ಲೈನ್ ಸಂಶೋಧನೆ ನಡೆಸಿ, ನಿಮ್ಮ ಇಮೇಲ್ನಲ್ಲಿ ಅಥವಾ ನಿಮ್ಮ ಡಾಕ್ಯುಮೆಂಟ್ ಎಡಿಟರ್ನಲ್ಲಿ ಸಾರಾಂಶಗಳ ಕರಡುಗಳನ್ನು ರಚಿಸಬಹುದು. ಅದು ವೈಜ್ಞಾನಿಕ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸಬಹುದು, ಪ್ಲಾಟ್ಗಳನ್ನು ರಚಿಸಬಹುದು, ವೆಬ್ಸೈಟ್ ಅನ್ನು ಸೃಷ್ಟಿಸಬಹುದು, ಮತ್ತು ಆ ಸೈಟ್ನಲ್ಲಿರುವ ಎಲ್ಲಾ ವೈಶಿಷ್ಟ್ಯಗಳು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿವೆ ಎಂಬುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಫ್ರಂಟ್ಎಂಡ್ QA ಪರಿಶೀಲನೆಗಳನ್ನು ನಡೆಸಬಹುದು. ಇದು ನಿಮಗೆ ಸಾಫ್ಟ್ವೇರ್ ಅನ್ನು ಸ್ವಾಯತ್ತವಾಗಿ ಸ್ಥಾಪಿಸಲು ಮತ್ತು ಪರೀಕ್ಷಿಸಲು, ಹಾಗೂ ಪರದೆಯಲ್ಲಿ ಕಾಣುವ ಸಮಸ್ಯೆಗಳನ್ನು ನಿವಾರಿಸಲು ಸಹಾಯ ಮಾಡಬಹುದು. ಈ ಸುಧಾರಣೆಗಳು ನಮ್ಮ ಅತ್ಯಾಧುನಿಕ ಮೌಲ್ಯಮಾಪನ ಫಲಿತಾಂಶಗಳಲ್ಲಿಯೂ ಪ್ರತಿಬಿಂಬಿತವಾಗಿವೆ.
ಈ ಸುಧಾರಣೆಗಳು ಕೂಡ ನೈಜ ಜ್ಞಾನ-ಕೆಲಸದ ಕಾರ್ಯಗಳಲ್ಲಿ ದಕ್ಷತೆಯಲ್ಲಿ ಗಮನಾರ್ಹ ಹೆಚ್ಚಳಕ್ಕೆ ಕಾರಣವಾಗುತ್ತವೆ. OSWorld 2.0 ನಲ್ಲಿನ ಲೇಟೆನ್ಸಿ (ವಿಳಂಬ) ಅನುಕರಣೆಗಳಲ್ಲಿ, GPT‑5.6 Sol ಗೆ ಹೋಲಿಸಿದರೆ Astra ಪ್ರತಿ ಕಾರ್ಯಕ್ಕೆ ಸುಮಾರು 47% ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಉತ್ತಮ ಕಂಪ್ಯೂಟರ್-ಬಳಕೆಯ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಾಧಿಸುತ್ತದೆ; ಇದು ಪ್ರತಿ ಕಾರ್ಯಕ್ಕೆ ಸುಮಾರು 40 ನಿಮಿಷಗಳಲ್ಲಿ 72.6% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದರೆ, GPT‑5.6 Sol ಸುಮಾರು 75 ನಿಮಿಷಗಳಲ್ಲಿ 65.7% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದೆ.3
GPT‑6 Astraದ ಕಂಪ್ಯೂಟರ್-ಬಳಕೆಯ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಆಟದ ಅಭಿವೃದ್ಧಿ, ವಿದ್ಯುತ್ ಎಂಜಿನಿಯರಿಂಗ್ ಮತ್ತು ದೈನಂದಿನ ಜ್ಞಾನ ಕಾರ್ಯ ಸೇರಿದಂತೆ ವಿವಿಧ ಕ್ಷೇತ್ರಗಳ ಔಟ್ಪುಟ್ಗಳಲ್ಲಿ ಕಾಣಬಹುದು:
Astra ಜೊತೆಗೆ, ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ವೇಗವನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಸುಧಾರಿಸಲು ನಾವು Codex ಪೂರಕ ವ್ಯವಸ್ಥೆಯನ್ನೂ ನವೀಕರಿಸುತ್ತಿದ್ದೇವೆ. Astraದ ದಕ್ಷತೆಯೊಂದಿಗೆ ಸೇರಿ, Mind2Web ಮಾನದಂಡದಲ್ಲಿ ಪ್ರಸ್ತುತ GPT‑5.6 Sol ಅನುಭವಕ್ಕೆ ಹೋಲಿಸಿದರೆ ಇದು 1.9x ವೇಗವಾಗಿ ಕಾರ್ಯ ಪೂರ್ಣಗೊಳಿಸುವಿಕೆಗೆ ಕಾರಣವಾಗುತ್ತದೆ. ಮಾಡೆಲ್ನ ವೇಗದಲ್ಲಿನ ಸುಧಾರಣೆಗಳು, ನೀವು ಮಾಡುವುದಕ್ಕಿಂತಲೂ ವೇಗವಾಗಿ, ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುವ ಅನೇಕ ದೈನಂದಿನ ಕಾರ್ಯಗಳನ್ನು ನಿಮಗಾಗಿ ಕೈಗೆತ್ತಿಕೊಳ್ಳಲು ಅದಕ್ಕೆ ಸಾಧ್ಯವಾಗಿಸುತ್ತವೆ.
ವೃತ್ತಿಪರ ಕೆಲಸದಲ್ಲಿ ಮಹತ್ವದ ಬದಲಾವಣೆ
GPT‑6 Astra ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯಲ್ಲಿನ ಪ್ರಗತಿಗಳನ್ನು ವೃತ್ತಿಪರ ಪರಿಸರಗಳಿಗಾಗಿ ಉದ್ದೇಶಿತ ತರಬೇತಿಯೊಂದಿಗೆ ಸಂಯೋಜಿಸಿ, ಸಂಕೀರ್ಣ ಕೆಲಸದ ಕಾರ್ಯಗಳನ್ನು ನಿಭಾಯಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಇದು ಸಂಕೀರ್ಣ ಸಮಸ್ಯೆಗಳಿಗೆ ಅಗತ್ಯವಾದ ಇಂಟೆಲಿಜೆನ್ಸ್ ಅನ್ನು ಬಹು-ಹಂತದ ವರ್ಕ್ಫ್ಲೋಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಹಾಗೂ ಪರಿಷ್ಕೃತ ಡಾಕ್ಯುಮೆಂಟ್ಗಳು, ಸ್ಪ್ರೆಡ್ಶೀಟ್ಗಳು ಮತ್ತು ಪ್ರಸ್ತುತಿಗಳನ್ನು ರಚಿಸುವ ಸಾಮರ್ಥ್ಯದೊಂದಿಗೆ ಸಂಯೋಜಿಸುತ್ತದೆ.
GPT‑6 Astra ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಟೆಂಪ್ಲೇಟ್ಗಳನ್ನು ಅನುಸರಿಸಲು ಮತ್ತು ಉತ್ತಮವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ, ರಚನಾತ್ಮಕ ನಿರೂಪಣೆಯೊಂದಿಗೆ ಪ್ರಮುಖ ಅಂಶಗಳನ್ನು ಸಂಕ್ಷಿಪ್ತವಾಗಿ ತಿಳಿಸುವ ಸ್ಲೈಡ್ಗಳನ್ನು ತಯಾರಿಸಲು ನಮ್ಮ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್ ಆಗಿದೆ. ಇದು ನಿಮ್ಮ ಟೆಂಪ್ಲೇಟ್ಗಳನ್ನು ಅನುಸರಿಸುವ ಮತ್ತು ನಿಮ್ಮ ಬರವಣಿಗೆ ಹಾಗೂ ದೃಶ್ಯ ಶೈಲಿಗೆ ಹೊಂದಿಕೆಯಾಗುವ ಸ್ಪಷ್ಟ, ಉತ್ತಮವಾಗಿ ರಚಿಸಲಾದ ಡಾಕ್ಯುಮೆಂಟ್ಗಳು, ಪ್ರಸ್ತುತಿಗಳು, ಸ್ಪ್ರೆಡ್ಶೀಟ್ಗಳು ಮತ್ತು ವಿಶ್ಲೇಷಣೆಗಳನ್ನು ರಚಿಸುತ್ತದೆ. Astra ಅನ್ನು ಕೈಯಲ್ಲಿರುವ ಕೆಲಸಕ್ಕೆ ಅನಗತ್ಯವಾದ ಮಾಹಿತಿಯನ್ನು ಪುನರಾವರ್ತಿಸುವ ಬದಲು, ಔಟ್ಪುಟ್ಗಳಲ್ಲಿ ಪ್ರಸ್ತುತ ಕೆಲಸಕ್ಕೆ ಸಂಬಂಧಿಸಿದ ಸಂದರ್ಭವನ್ನು ಮಾತ್ರ ನಿರ್ದಿಷ್ಟವಾಗಿ ಸೇರಿಸುವಂತೆ ತರಬೇತಿ ನೀಡಲಾಗಿದೆ. ಇವೆಲ್ಲದರರ್ಥ, ನಿಮ್ಮ ವ್ಯವಹಾರಿಕ ಸನ್ನಿವೇಶ ಮತ್ತು ಮಾನದಂಡಗಳಿಗೆ ಹೊಂದುವ, ತಕ್ಷಣವೇ ಹೆಚ್ಚು ಬಳಸಬಹುದಾದ ಆರ್ಟಿಫ್ಯಾಕ್ಟ್ಗಳನ್ನು ಇದು ಔಟ್ಪುಟ್ ಆಗಿ ನೀಡಬಹುದು.
GPT‑6 Astra ತಾನು ನಿರ್ಮಿಸುವ ವೆಬ್ಸೈಟ್ಗಳು, ಗೇಮ್ಗಳು, ಅಪ್ಲಿಕೇಶನ್ಗಳು ಮತ್ತು ರೆಂಡರಿಂಗ್ಗಳಿಗೆ ಇನ್ನಷ್ಟು ಉತ್ತಮ ದೃಶ್ಯ ವಿವೇಚನೆಯನ್ನು ತರುತ್ತದೆ. ChatGPT ಯಲ್ಲಿನ ಸೈಟ್ಗಳೊಂದಿಗೆ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ), Astra ಪ್ರಾಂಪ್ಟ್ನಿಂದಲೇ ವೆಬ್ಸೈಟ್ಗಳು, ವೆಬ್ ಆ್ಯಪ್ಗಳು ಮತ್ತು ಗೇಮ್ಗಳನ್ನು ರಚಿಸಬಹುದು, ಹೋಸ್ಟ್ ಮಾಡಬಹುದು ಮತ್ತು ಹಂಚಿಕೊಳ್ಳಬಹುದು.
ಸೂಚನೆಗಳು ವ್ಯಾಖ್ಯಾನಕ್ಕೆ ಅವಕಾಶ ನೀಡಿದಾಗ, ಸರಿಯಾದ ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವಲ್ಲಿ GPT‑6 Astra ಹಿಂದಿನ ಮಾಡೆಲ್ಗಳಿಗಿಂತ ಉತ್ತಮವಾಗಿದೆ. ಇದು ಸಾಮಾನ್ಯ ಕೊರತೆಗಳನ್ನು ಭರ್ತಿ ಮಾಡಲು ಸಂದರ್ಭವನ್ನು ಬಳಸುತ್ತದೆ ಮತ್ತು ಉತ್ತರವು ಫಲಿತಾಂಶವನ್ನು ಬದಲಾಯಿಸಬಹುದಾದಾಗ ಕೇಂದ್ರೀಕೃತ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುತ್ತದೆ. Codex ನಲ್ಲಿ, ನಿಮ್ಮ ಉತ್ತರವನ್ನು ಅವಲಂಬಿಸದ ಕೆಲಸವನ್ನು ಮುಂದುವರಿಸುತ್ತಲೇ ಇದು ಅಸಿಂಕ್ರೋನಸ್ ಆಗಿ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳಬಹುದು. ನೀವು ಪ್ರತಿಕ್ರಿಯಿಸದಿದ್ದರೆ, ಸೂಕ್ತವಾದಲ್ಲಿ ಅದು ಸಮಂಜಸವಾದ ಊಹೆಗಳೊಂದಿಗೆ ಮುಂದುವರಿಯುತ್ತದೆ, ಆದರೆ ಮಹತ್ವದ ನಿರ್ಧಾರಗಳ ಕುರಿತು ನಿಮ್ಮ ಅಭಿಪ್ರಾಯಕ್ಕಾಗಿ ಕಾಯುತ್ತದೆ.
ಕೆಳಗಿನ ಉದಾಹರಣೆಗಳು, ಮಾಹಿತಿ ಕೊರತೆಯು ಉತ್ತರವನ್ನು ಗಣನೀಯವಾಗಿ ಬದಲಾಯಿಸಬಹುದಾದ ದೈನಂದಿನ ಕಾರ್ಯಗಳಲ್ಲಿ Astra ಹೇಗೆ ಸಹಕರಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತವೆ.
ಕಾರ್ಯವು ವಿಕಸಿಸುತ್ತಿದ್ದಂತೆ ಅದರ ದಿಕ್ಕಿನ ಕುರಿತು ಸ್ಪಷ್ಟತೆ ಕಾಯ್ದುಕೊಳ್ಳುವುದರಲ್ಲಿಯೂ Astra ಉತ್ತಮವಾಗಿದೆ. ಹಿಂದಿನ ಮಾಡೆಲ್ಗಳು ಕೆಲವೊಮ್ಮೆ ಸ್ಟಿಯರಿಂಗ್ ಸಂದೇಶಗಳನ್ನು ಹೊಸ ಗುರಿಯಾಗಿ ಪರಿಗಣಿಸಿ, ಮೂಲ ವಿನಂತಿ ಅಥವಾ ಹಿಂದಿನ ನಿರ್ಬಂಧಗಳ ಮೇಲಿನ ಗಮನವನ್ನು ಕಳೆದುಕೊಳ್ಳುತ್ತಿದ್ದವು. Astra ಹೊಸ ಅವಶ್ಯಕತೆಗಳನ್ನು ಒಳಗೊಳ್ಳುತ್ತದೆ, ಕೇಳಿದಾಗ ದಿಕ್ಕು ಬದಲಾಯಿಸುತ್ತದೆ ಮತ್ತು ವ್ಯಾಪಕ ಕಾರ್ಯವನ್ನು ಕೈಬಿಡದೆ ಪೂರಕ ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸುತ್ತದೆ.
ಕೋಡಿಂಗ್
GPT‑6 Astra ಇದುವರೆಗಿನ ಸಾಫ್ಟ್ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್ಗೆ ಅತ್ಯುತ್ತಮ ಮಾಡೆಲ್ ಆಗಿದೆ.
“GPT‑6 Astra ನಮ್ಮ ಆಂತರಿಕ ಕೋಡಿಂಗ್ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಲ್ಲಿ ಅತ್ಯಾಧುನಿಕ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡುತ್ತದೆ ಮತ್ತು GPT‑5.6 Sol ಗೆ ಹೋಲಿಸಿದರೆ ಟ್ರೇಡಿಂಗ್ ಒಳನೋಟದ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ ಸ್ಪಷ್ಟವಾದ ಮುನ್ನಡೆಯನ್ನು ತೋರಿಸುತ್ತದೆ. ಏಜೆಂಟಿಕ್ ಕೋಡಿಂಗ್ಗೆ ಬಳಸಿದಾಗ, GPT‑6 Astra ಡೆವಲಪರ್ಗಳು ಸುಲಭವಾಗಿ ಅನುಸರಿಸಬಹುದಾದ ರೀತಿಯಲ್ಲಿ ಸಂವಹನ ನಡೆಸುತ್ತದೆ ಮತ್ತು ಪ್ರೊಡಕ್ಷನ್ ಗುಣಮಟ್ಟ ತಲುಪಲು ಕಡಿಮೆ ಪುನರಾವರ್ತನೆ ಅಗತ್ಯವಿರುವ ಕೋಡ್ ಅನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.”
“ನಾವು ನಮ್ಮ ಮೊದಲ ತಲೆಮಾರಿನ eval ಗಳಲ್ಲಿ ಒಂದರಲ್ಲಿ Astra ಅನ್ನು ಕಡಿಮೆ, ಮೀಡಿಯಂ ಮತ್ತು ಉನ್ನತ ಪ್ರಯತ್ನ ಮಟ್ಟಗಳಲ್ಲಿ ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ ಮತ್ತು ಅದು GPT 5.6 Sol ಗಿಂತ ಗಮನಾರ್ಹವಾಗಿ ಮುಂದಿತ್ತು. ಹೆಚ್ಚಿನ ಪ್ರಯತ್ನವು ಹೊಸ ಬಿಲ್ಡ್ನಲ್ಲಿ ಹೆಚ್ಚಿನ ಪುನರಾವರ್ತನೆಗಳನ್ನು, ಬ್ರೌಸರ್ ಪರೀಕ್ಷೆಯ ಮೂಲಕ ಹೆಚ್ಚಿನ ಪರಿಶೀಲನೆಯನ್ನು ಮತ್ತು apply-patch ಗಿಂತ ಕೋಡ್ ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಯ ಕಡೆಗೆ ಒಲವನ್ನು ಒದಗಿಸುತ್ತದೆ. ಮಾಡೆಲ್ ತನ್ನ ಪ್ರಯತ್ನವನ್ನು ಹೇಗೆ ಬಳಸುತ್ತದೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದರ ಮೂಲಕವೇ ನಾವು ಲಕ್ಷಾಂತರ ಬಿಲ್ಡರ್ಗಳಿಗೆ ಕಲ್ಪನೆಯಿಂದ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಆ್ಯಪ್ವರೆಗಿನ ವೇಗವಾದ, ಹೆಚ್ಚು ವಿಶ್ವಾಸಾರ್ಹ ಮಾರ್ಗವನ್ನು ಒದಗಿಸುತ್ತೇವೆ.”
Astra ಜೊತೆಗೆ, ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ತುಂಬಿದಾಗ ಸಂದರ್ಭವನ್ನು ಸಂರಕ್ಷಿಸಲು ಮತ್ತು ಹಿಂಪಡೆಯಲು Codex ಗೆ ಹೊಸ ವಿಧಾನವನ್ನು ನಾವು ಪರಿಚಯಿಸುತ್ತಿದ್ದೇವೆ. ಐತಿಹಾಸಿಕವಾಗಿ, ಸಂಕೀರ್ಣ ಸಮಸ್ಯೆಗಳನ್ನು ಡೀಬಗ್ ಮಾಡುವಾಗ ಅಥವಾ ದೊಡ್ಡ ಮರುರಚನೆಗಳನ್ನು ಕೈಗೆತ್ತಿಕೊಳ್ಳುವಾಗಿನಂತಹ ದೀರ್ಘ ಸೆಷನ್ಗಳಲ್ಲಿ ಕೆಲಸವನ್ನು ಸಾರಾಂಶಗೊಳಿಸಲು ಮಾಡೆಲ್ಗಳು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯನ್ನು ಬಳಸಿವೆ. ಪ್ರತಿಯೊಂದು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯು ಪರಿಹಾರ ಏಕೆ ವಿಫಲವಾಯಿತು ಅಥವಾ ಒಂದು ಘಟಕ ಹೇಗೆ ವರ್ತಿಸುತ್ತದೆ ಎಂಬ ವಿವರಗಳನ್ನು ಬಿಟ್ಟುಬಿಡಬಹುದು. Codex ನಲ್ಲಿ, Astra ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋಗಳಾದ್ಯಂತ ಟಿಪ್ಪಣಿಗಳನ್ನು ಉಳಿಸಿಕೊಳ್ಳಬಹುದು, ಅವುಗಳನ್ನು ಒಂದೇ ಸಾರಾಂಶಕ್ಕೆ ಪದೇಪದೇ ಸಂಕುಚಿತಗೊಳಿಸದೆ ಸಂಗ್ರಹವಾದ ವಿವರಗಳನ್ನು ಸಂರಕ್ಷಿಸುತ್ತದೆ. ಹಿಂದಿನ ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋಗಳು ಹುಡುಕಬಹುದಾಗಿಯೇ ಉಳಿಯುತ್ತವೆ, ಆದ್ದರಿಂದ ಆ ಮಾಹಿತಿಯನ್ನು ತನ್ನ ಟಿಪ್ಪಣಿಗಳಲ್ಲಿ ಸೆರೆಹಿಡಿಯದಿದ್ದರೂ Astra ಹಿಂದಿನ ಸಂದೇಶಗಳು ಮತ್ತು ಟೂಲ್ ಔಟ್ಪುಟ್ಗಳಿಂದ ಅಗತ್ಯತೆಗಳು ಅಥವಾ ಪರೀಕ್ಷಾ ಫಲಿತಾಂಶಗಳನ್ನು ಕಂಡುಹಿಡಿಯಬಹುದು. ನಿಮ್ಮ Codex config.toml ನಲ್ಲಿ ಈ ಪ್ರಯೋಗಾತ್ಮಕ ವೈಶಿಷ್ಟ್ಯವನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಬಹುದು,(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಮತ್ತು ಮುಂಬರುವ ವಾರಗಳಲ್ಲಿ ಇದು Astra ಗಾಗಿ ಡೀಫಾಲ್ಟ್ ಆಗಲಿದೆ.
ವೈಜ್ಞಾನಿಕ ಆವಿಷ್ಕಾರವನ್ನು ಮುನ್ನಡೆಸುವುದು
GPT‑6 Astra ವೈಜ್ಞಾನಿಕ ಶೋಧನೆ, ಗಣಿತ ಮತ್ತು ಆರೋಗ್ಯಕ್ಕಾಗಿ ಪ್ರಮುಖ ಮುನ್ನಡೆಯಾಗಿದೆ. ಇಂದು, ಅವಿಭಾಜ್ಯ ಸಂಖ್ಯೆಗಳ ನಡುವಿನ ಅಂತರಗಳ ಕುರಿತು ಇನ್ನೂ ಎರಡು ಫಲಿತಾಂಶಗಳನ್ನು ನಾವು ಹಂಚಿಕೊಳ್ಳುತ್ತಿದ್ದೇವೆ [WITH LINK]. Astra ವಿಜ್ಞಾನ ಮೌಲ್ಯಮಾಪನಗಳ ಸರಣಿಯಲ್ಲಿ ಹೊಸ ದಾಖಲೆಗಳನ್ನೂ ಸ್ಥಾಪಿಸಿದೆ:
ವೈಜ್ಞಾನಿಕ ಆವಿಷ್ಕಾರದ ಹಿಂದಿನ ವ್ಯಾವಹಾರಿಕ ಕೆಲಸದಲ್ಲಿ Astra ಸಹಾಯ ಮಾಡಬಹುದು. ವೈಜ್ಞಾನಿಕ ರೀಜನಿಂಗ್ ಅನ್ನು ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯೊಂದಿಗೆ ಸಂಯೋಜಿಸುವ ಮೂಲಕ, ಇದು ದತ್ತಾಂಶವನ್ನು ಪರಿಶೀಲಿಸಲು ಮತ್ತು ಫಲಿತಾಂಶಗಳನ್ನು ಅನ್ವೇಷಿಸಲು ವಿಶೇಷ ಸಾಫ್ಟ್ವೇರ್ನಲ್ಲಿ ನೇರವಾಗಿ ಕೆಲಸ ಮಾಡಬಹುದು, ಇದರಿಂದ ಸಂಶೋಧಕರು ಸಾಕ್ಷ್ಯವನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ಮತ್ತು ಮುಂದೆ ಏನನ್ನು ತನಿಖೆ ಮಾಡಬೇಕೆಂದು ನಿರ್ಧರಿಸಲು ಸಹಾಯವಾಗುತ್ತದೆ.
ಸೈಬರ್ಸುರಕ್ಷತೆ
Astra ಸೈಬರ್ ಭದ್ರತಾ ಸಾಮರ್ಥ್ಯಗಳಲ್ಲಿ ಮಹತ್ವದ ಮುನ್ನಡೆಯಾಗಿದೆ. ಝೀರೋ-ಡೆ ಎಕ್ಸ್ಪ್ಲಾಯಿಟ್ಗಳನ್ನು ಗುರುತಿಸುವ ಮತ್ತು ಅಭಿವೃದ್ಧಿಪಡಿಸುವ ಅದರ ಸಾಮರ್ಥ್ಯವು ರಕ್ಷಕರು ದೌರ್ಬಲ್ಯಗಳನ್ನು ಪ್ಯಾಚ್ ಮಾಡಲು ಸಹಾಯ ಮಾಡಬಹುದು, ಆದರೆ ಇದು ಇನ್ನಷ್ಟು ಬಲವಾದ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳ ಅಗತ್ಯವನ್ನೂ ಸೃಷ್ಟಿಸುತ್ತದೆ. ಈ ಸಾಮರ್ಥ್ಯಗಳು ಯಾವ ಮಟ್ಟಿಗೆ ವಿಸ್ತರಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ನಾವು ಆಂತರಿಕ ಮತ್ತು ಮೂರನೇ ವ್ಯಕ್ತಿಯ ತಜ್ಞರ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ಬಳಸಿದ್ದೇವೆ.
ದುರ್ಬಲತೆಯಿರುವ ಕೋಡ್ಬೇಸ್ಗಳಲ್ಲಿ ಮಾಡೆಲ್ಗಳು ಅನಿಯಂತ್ರಿತ ಕೋಡ್ ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಯನ್ನು ಸಾಧಿಸಬಹುದೇ ಎಂಬುದನ್ನು ಅಳೆಯುವ ExploitBench ಮತ್ತು ExploitGym ನಲ್ಲಿ ನಾವು ಮೊದಲು Astra ಅನ್ನು ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ.
ಐತಿಹಾಸಿಕ ಸಾಫ್ಟ್ವೇರ್ ದುರ್ಬಲತೆಗಳ ಸಂಪರ್ಕವು ಬೆಂಚ್ಮಾರ್ಕ್ ಫಲಿತಾಂಶಗಳ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರಿರಬಹುದು ಎಂಬ ಸಂಭಾವ್ಯ ಕಳವಳಗಳನ್ನು ಗಮನದಲ್ಲಿಟ್ಟುಕೊಂಡು, ನಾವು Astra ಅನ್ನು ಎರಡು ಹೊಸ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳ ಮೇಲೆಯೂ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದೆವು. ಮೊದಲನೆಯದಾಗಿ, ಹಿಂದಿನ ಮೂರು ತಿಂಗಳ ದೌರ್ಬಲ್ಯಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಎಕ್ಸ್ಪ್ಲಾಯ್ಟ್ ಅಭಿವೃದ್ಧಿಯನ್ನು ಪರೀಕ್ಷಿಸಲು ನಾವು ಆಂತರಿಕ “ExploitBench (ಜೂನ್–ಆಗಸ್ಟ್ 2026)” ಮೌಲ್ಯಮಾಪನವನ್ನು ನಿರ್ಮಿಸಿದ್ದೇವೆ. 2 ಈ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ, ಬಹಳ ಕಡಿಮೆ ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಬಳಸಿದರೂ Astra, GPT‑5.6 Sol ಗಿಂತ ಗಮನಾರ್ಹವಾಗಿ ಹೈ ಅನಿಯಂತ್ರಿತ ಕೋಡ್-ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆ ದರಗಳನ್ನು ಸಾಧಿಸಿತು. ಮೌಲ್ಯಮಾಪನದ ಸಮಯದಲ್ಲಿ, Astra ಹಿಂದೆ ತಿಳಿದಿರದ ಎರಡು Chrome V8 ಹೀಪ್-ಸ್ಯಾಂಡ್ಬಾಕ್ಸ್ನಿಂದ ಹೊರಬರುವ ತಂತ್ರಗಳನ್ನು ಕಂಡುಹಿಡಿದು ಬಳಸಿತು. ನಾವು ಎರಡೂ ದುರ್ಬಲತೆಗಳನ್ನು ಅವುಗಳ ನಿರ್ವಹಕರಿಗೆ ಬಹಿರಂಗಪಡಿಸುತ್ತಿದ್ದೇವೆ.
ಕೋರ್ ಲಾಜಿಕ್ ಅನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಮಾಡೆಲ್ಗಳು ಬೈನರಿ ಸಾಫ್ಟ್ವೇರ್ ಅನ್ನು ರಿವರ್ಸ್ ಎಂಜಿನಿಯರ್ ಮಾಡಬಹುದೇ ಎಂಬುದನ್ನು ಅಳೆಯುವ ಬೆಂಚ್ಮಾರ್ಕ್ ಆದ SRE-Bench ನಲ್ಲಿ ನಾವು Astra ಅನ್ನು ಸಹ ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ. ಬೆಂಚ್ಮಾರ್ಕ್ನ ಲೇಖಕರು ಸಾಫ್ಟ್ವೇರ್ ಅನ್ನು ಆರಂಭದಿಂದಲೇ ನಿರ್ಮಿಸಿದರು ಮತ್ತು ಅದರ ಮೂಲ ಕೋಡ್ ಅನ್ನು ಖಾಸಗಿಯಾಗಿ ಉಳಿಸಿಕೊಂಡರು. Astra ಒಂದೇ ಪ್ರಯತ್ನದಲ್ಲಿ 88.0% ಕಾರ್ಯಗಳನ್ನು ಮತ್ತು ನಾಲ್ಕು ಪ್ರಯತ್ನಗಳೊಳಗೆ 99.2% ಕಾರ್ಯಗಳನ್ನು ಪರಿಹರಿಸಿತು; ಇದಕ್ಕೆ ಹೋಲಿಸಿದರೆ GPT‑5.6 Sol ಕ್ರಮವಾಗಿ 55.9% ಮತ್ತು 68.7% ಕಾರ್ಯಗಳನ್ನು ಪರಿಹರಿಸಿತು.
ಬೆಂಚ್ಮಾರ್ಕ್ಗಳನ್ನು ಮೀರಿ, ತಜ್ಞರ ನೇತೃತ್ವದ ಮೌಲ್ಯಮಾಪನಗಳು Astra ಹಿಂದೆ ತಿಳಿಯದ ದುರ್ಬಲತೆಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಬಲಪಡಿಸಲಾದ ಬ್ರೌಸರ್ಗಳಲ್ಲಿ ಅನಿಯಂತ್ರಿತ ಕೋಡ್ ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಯನ್ನು ಸಾಧಿಸಬಹುದು ಮತ್ತು ಬಲಪಡಿಸಲಾದ ಆಪರೇಟಿಂಗ್ ಸಿಸ್ಟಮ್ಗಳಿಗಾಗಿ ಅಧಿಕಾರ-ಏರಿಕೆ ಎಕ್ಸ್ಪ್ಲಾಯಿಟ್ಗಳನ್ನು ರಚಿಸಬಹುದು ಎಂದು ಕಂಡುಹಿಡಿದವು. ಒಟ್ಟಾರೆಯಾಗಿ, ಈ ಫಲಿತಾಂಶಗಳು ನಮ್ಮ ಪ್ರಿಪೇರ್ಡ್ನೆಸ್ ಫ್ರೇಮ್ವರ್ಕ್ ಅಡಿಯಲ್ಲಿ Astra ಸೈಬರ್ಸುರಕ್ಷತೆಯಲ್ಲಿ ಕ್ರಿಟಿಕಲ್ ಮಿತಿಯನ್ನು ತಲುಪಿದೆ ಎಂಬ ನಮ್ಮ ನಿರ್ಧಾರಕ್ಕೆ ಆಧಾರವಾದವು.
ನಾವು The Defender’s Window ನಲ್ಲಿ ಚರ್ಚಿಸಿದಂತೆ, ಅತ್ಯಾಧುನಿಕ ಸೈಬರ್ ಸಾಮರ್ಥ್ಯಗಳು ರಕ್ಷಕರಿಗೆ ದುರ್ಬಲತೆಗಳನ್ನು ವೇಗವಾಗಿ ಕಂಡುಹಿಡಿಯಲು ಸಹಾಯ ಮಾಡಬಹುದು, ಆದರೆ ಅವು ಆ ದುರ್ಬಲತೆಗಳನ್ನು ದುರುಪಯೋಗಪಡಿಸಿಕೊಳ್ಳುವುದನ್ನು ಸಹ ಸುಲಭಗೊಳಿಸುತ್ತವೆ, ಇದರಿಂದ ರಕ್ಷಕರು ಹೊಂದಿಕೊಳ್ಳುವ ತುರ್ತು ಅಗತ್ಯ ಹೆಚ್ಚುತ್ತದೆ.
ಇಂದು ಬಿಡುಗಡೆಗೊಳ್ಳುತ್ತಿರುವ Astra ಆವೃತ್ತಿಯಲ್ಲಿ, ಸುರಕ್ಷಿತ ಕೋಡ್ ಪರಿಶೀಲನೆ, ಪ್ಯಾಚಿಂಗ್ ಮತ್ತು ಬೆದರಿಕೆ ಮಾದರೀಕರಣ ಮುಂತಾದ ಪ್ರಮುಖ ರಕ್ಷಣಾತ್ಮಕ ಕಾರ್ಯಗಳನ್ನು ನಾವು ಬೆಂಬಲಿಸುತ್ತೇವೆ. ಆದರೆ, ಪೂರ್ವನಿಯೋಜಿತವಾಗಿ, ಎಕ್ಸ್ಪ್ಲಾಯ್ಟ್ ಪತ್ತೆಹಚ್ಚುವಿಕೆಯಂತಹ ಸುಧಾರಿತ ಸೈಬರ್ಸುರಕ್ಷತಾ ಕಾರ್ಯಗಳನ್ನು ಅನುಸರಿಸಲು Astra ನಿರಾಕರಿಸುತ್ತದೆ. OpenAI Daybreak ಮೂಲಕ, ನಾವು OpenAI Daybreak ಕಾರ್ಯಕ್ರಮದಲ್ಲಿನ ವಿಶ್ವಾಸಾರ್ಹ ಸೈಬರ್ಸುರಕ್ಷತಾ ರಕ್ಷಕರ ಆಲ್ಫಾ ಗುಂಪಿಗೆ ಕಡಿಮೆ ನಿರ್ಬಂಧಿತ ಪ್ರವೇಶವನ್ನು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ. ಇದು ದುರ್ಬಲತೆ ಟ್ರಿಯಾಜ್ ಮತ್ತು ವ್ಯಾಲಿಡೇಷನ್, ಮಾಲ್ವೇರ್ ವಿಶ್ಲೇಷಣೆ, ಡಿಟೆಕ್ಷನ್ ಎಂಜಿನಿಯರಿಂಗ್ ಮತ್ತು ಪ್ಯಾಚ್ ವ್ಯಾಲಿಡೇಷನ್ ಒಳಗೊಂಡ ರಕ್ಷಣಾತ್ಮಕ ಕಾರ್ಯಪ್ರವಾಹಗಳಿಗೆ ಪ್ರವೇಶವನ್ನು ವಿಸ್ತರಿಸುತ್ತದೆ. Daybreak Blue ಮೂಲಕ ಪ್ರವೇಶವನ್ನು ಇನ್ನಷ್ಟು ವಿಸ್ತರಿಸಲು ನಾವು ಯೋಜಿಸುತ್ತಿದ್ದೇವೆ.
GPT‑5.6 Sol ಗಾಗಿ ನಮ್ಮ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳ ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ಆಧರಿಸಿ, ಸಂಭವನೀಯ ಸೈಬರ್ ದುರುಪಯೋಗದ ವಿರುದ್ಧದ ನಮ್ಮ ರಕ್ಷಣೆಗಳನ್ನು ಸಹ ನಾವು ಬಲಪಡಿಸಿದ್ದೇವೆ. ಸಂಭವನೀಯ ಜೈಲ್ಬ್ರೇಕ್ಗಳನ್ನು ಉತ್ತಮವಾಗಿ ತಡೆದುಕೊಳ್ಳಲು ಹೆಚ್ಚು ಬಲಿಷ್ಠವಾದ ಮಾಡೆಲ್ ದೃಢತೆ ತರಬೇತಿ ಮತ್ತು ನಮ್ಮ ಮೇಲ್ವಿಚಾರಣಾ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಹೆಚ್ಚಿನ ಸಂದರ್ಭವನ್ನು ಇವು ಒಳಗೊಂಡಿವೆ. ನಮ್ಮ ಆಂತರಿಕ ರೆಡ್ ಟೀಮಿಂಗ್ ದಾಳಿಕಾರರೊಂದಿಗೆ ಸ್ವಯಂಚಾಲಿತ ಪರೀಕ್ಷೆಗಳನ್ನು ಒಳಗೊಂಡಂತೆ, ಕಠಿಣ ಆಂತರಿಕ ಮತ್ತು ಬಾಹ್ಯ ಪರೀಕ್ಷೆಗಳನ್ನು ನಾವು ಮುಂದುವರಿಸಿದ್ದೇವೆ. ನಮ್ಮ ಸೈಬರ್ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳು ಮತ್ತು ಪರೀಕ್ಷೆಯ ಕುರಿತು ಹೆಚ್ಚಿನ ವಿವರಗಳು Astra ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್ನಲ್ಲಿ ಮತ್ತು ನಮ್ಮ ಬ್ಲಾಗ್ನಲ್ಲಿ ಲಭ್ಯವಿವೆ.
GPT‑6 Astra ಅನ್ನು ಜವಾಬ್ದಾರಿಯುತವಾಗಿ ಹೊಂದಾಣಿಕೆಗೊಳಿಸುವುದು ಮತ್ತು ನಿಯೋಜಿಸುವುದು
Astra ನಮ್ಮ ಅತ್ಯಂತ ಹೊಂದಾಣಿಕೆಯಾಗಿರುವ ಮಾಡೆಲ್ ಆಗಿದೆ. Astra ಕಾಳಜಿ ವಹಿಸುವಲ್ಲಿ, ಕಾರ್ಯದ ಮಿತಿಗಳನ್ನು ಗೌರವಿಸುವಲ್ಲಿ ಮತ್ತು ಪಾರದರ್ಶಕವಾಗಿ ಸಂವಹನ ಮಾಡುವಲ್ಲಿ ಅತ್ಯುತ್ತಮವಾಗಿದೆ. ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗೆ ಮಾನವ ಉದ್ದೇಶದೊಂದಿಗೆ ಹೊಂದಾಣಿಕೆಯಾಗಿರುವ ಮಾಡೆಲ್ಗಳಿಗೆ ತರಬೇತಿ ನೀಡುವುದರ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದ ನಮ್ಮ ದೀರ್ಘಕಾಲದ ಸಂಶೋಧನಾ ಕಾರ್ಯಕ್ರಮದ ಇತ್ತೀಚಿನ ಫಲವೇ ಈ ಕೆಲಸವಾಗಿದೆ.
ಸಂವೇದನಾಶೀಲ ಪರಿಸರಗಳಲ್ಲಿ, Astra ತನ್ನ ಅಪಾಯದ ಮಟ್ಟಕ್ಕೆ ಅನುಗುಣವಾದ ಎಚ್ಚರಿಕೆಯಿಂದ ಮುಂದುವರಿಯುತ್ತದೆ. ಅಸಮರ್ಪಕ ವರ್ತನೆಗೆ ಪ್ರೇರೇಪಿಸುವಂತೆ ಪ್ರತಿಕೂಲವಾಗಿ ಆಯ್ಕೆಮಾಡಲಾದ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ಕಾರ್ಯಗಳ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, Astra ಉದ್ದೇಶಿಸದ ಪರಿಣಾಮಗಳನ್ನು ತಪ್ಪಿಸುವಲ್ಲಿ ಹೆಚ್ಚು ಯಶಸ್ವಿಯಾಗಿತ್ತು. ಡೀಫಾಲ್ಟ್ ಆಗಿ ಒದಗಿಸಲಾದ ಹೆಚ್ಚುವರಿ ಭದ್ರತಾ ಕ್ರಮಗಳೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸಿದಾಗ ಇನ್ನೂ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆ ದೊರೆಯಿತು.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) and Anthropic Messages API(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
Astra ಬಳಕೆದಾರರು ನಿಗದಿಪಡಿಸಿದ ಮತ್ತು ಅದರ ಪರಿಸರದಿಂದ ಪರೋಕ್ಷವಾಗಿ ಸೂಚಿಸಲ್ಪಡುವ ಮಿತಿಗಳೊಳಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಸಾಧ್ಯತೆಯೂ ಹೆಚ್ಚು. ಆಂತರಿಕ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, Codex Auto-Review ನಿರಾಕರಣೆಯನ್ನು ತಪ್ಪಿಸಲು Astra ಎಂದಿಗೂ ಪ್ರಯತ್ನಿಸಲಿಲ್ಲ. Auto-review ಅನ್ನು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ತಪ್ಪಿಸಿಕೊಳ್ಳಬಹುದಾದಂತೆ ಕಾನ್ಫಿಗರ್ ಮಾಡಲಾಗಿದ್ದರೂ ಮತ್ತು ಇಲ್ಲದಿದ್ದರೆ ಕಾರ್ಯವನ್ನು ಪೂರ್ಣಗೊಳಿಸುವುದು ಅಸಾಧ್ಯವಾಗಿದ್ದರೂ ಸಹ ಇದು ಸತ್ಯವಾಗಿಯೇ ಉಳಿಯಿತು. ಪರಿಸರದ ನಿರ್ಬಂಧಗಳ ಈ ಗೌರವವು, ಈ ಪೋಸ್ಟ್ನ ಪರಿಚಯದಲ್ಲಿ ನಾವು ಹಂಚಿಕೊಂಡ ಅಸಾಧ್ಯ ಸೈಬರ್ ಕಾರ್ಯದ ಮೌಲ್ಯಮಾಪನದ ಫಲಿತಾಂಶಗಳು ಮತ್ತು ನಮ್ಮ ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ದಾಖಲಿಸಲಾದ ಇತರ ಶೋಧಗಳಿಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ.
Astra ಸಹ ವಂಚನಾತ್ಮಕ ನಡವಳಿಕೆಯಲ್ಲಿ ಗಣನೀಯ ಕಡಿತಗಳನ್ನು ತೋರಿಸುತ್ತದೆ. ಕೆಲಸವನ್ನು ನಿಯೋಜಿಸುವ ಜನರಿಗೆ ಮಾಡೆಲ್ನ ಸಾಮರ್ಥ್ಯಗಳ ಸ್ಪಷ್ಟ ತಿಳುವಳಿಕೆ ಮತ್ತು ಅದರ ಪ್ರಗತಿಯ ಪ್ರಾಮಾಣಿಕ ವರದಿ ಅಗತ್ಯವಿದೆ. ಇದು ಪ್ರಾಮಾಣಿಕತೆಯ ಒಂದು ಅಂಶವನ್ನು ಅಳೆಯುತ್ತದೆ; ಉದ್ದೇಶಪೂರ್ವಕ ವಂಚನೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುವುದು ನಮ್ಮ ಹೊಂದಾಣಿಕೆ ಕಾರ್ಯದ ವ್ಯಾಪಕ ಗಮನಕೇಂದ್ರವಾಗಿಯೇ ಉಳಿದಿದೆ.
ನಮ್ಮ ಸಾಮರ್ಥ್ಯ-ಭ್ರಮೆ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, Astra GPT‑5.6 Sol ಗಿಂತ ಗಣನೀಯ ಸುಧಾರಣೆಯನ್ನು ತೋರಿಸುತ್ತದೆ ಮತ್ತು ತನ್ನ ಸಾಮರ್ಥ್ಯಗಳ ಬಗ್ಗೆ ಕಡಿಮೆ ತಪ್ಪುದಾರಿಗೆಳೆಯುವ ಹೇಳಿಕೆಗಳನ್ನು ನೀಡುತ್ತದೆ.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
ಲಭ್ಯತೆ
GPT‑6 Astra ಇಂದು ಎಂಟರ್ಪ್ರೈಸಸ್ಗಳು ಮತ್ತು ನಮ್ಮ ವಿಶ್ವಾಸಾರ್ಹ ಪ್ರವೇಶ ಕಾರ್ಯಕ್ರಮದಲ್ಲಿರುವ ಗ್ರಾಹಕರಿಗೆ ಹಂತ ಹಂತವಾಗಿ ಲಭ್ಯವಾಗುತ್ತಿದೆ. ChatGPT Plus, Pro, Business ಮತ್ತು Enterprise ಗೆ ಚಂದಾದಾರರಾಗಿರುವವರಿಗೆ ಮುಂದಿನ ಕೆಲವು ದಿನಗಳಲ್ಲಿ ವ್ಯಾಪಕವಾಗಿ ಲಭ್ಯವಾಗಲಿದೆ. Astra ಬಳಕೆಯು $100 ಮತ್ತು $200 Pro ಪ್ಲಾನ್ಗಳು ಹಾಗೂ $100 Business ಪ್ಲಾನ್ನಲ್ಲಿರುವ ಪ್ರಸ್ತುತ ಬಳಕೆಯ ಮಿತಿಯೊಳಗೆ ಸೇರಿದೆ ಮತ್ತು ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ದರ ಮಿತಿಗಳು ಅಥವಾ ನಿರ್ಬಂಧಗಳಿಲ್ಲ. $20 Plus ಚಂದಾದಾರಿಕೆ ಹೊಂದಿರುವವರು ಮತ್ತು ಪ್ರಮಾಣಿತ Business ಪ್ಲಾನ್ನ ಗ್ರಾಹಕರು ಕಡಿಮೆ ಮಿತಿಗಳೊಂದಿಗೆ GPT‑6 Astra ಅನ್ನು ಪ್ರವೇಶಿಸಬಹುದು ಹಾಗೂ ಹೆಚ್ಚುವರಿ ಪ್ರವೇಶಕ್ಕಾಗಿ ಕ್ರೆಡಿಟ್ಗಳನ್ನು ಖರೀದಿಸುವ ಆಯ್ಕೆಯೂ ಇದೆ. Enterprise ನಿರ್ವಾಹಕರು ತಮ್ಮ ವರ್ಕ್ಸ್ಪೇಸ್ಗೆ Astra ಅನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಬಹುದು; ಬಿಡುಗಡೆಯ ಸಮಯದಲ್ಲಿ ಪ್ರವೇಶವು ಪೂರ್ವನಿಯೋಜಿತವಾಗಿ ಆಫ್ ಆಗಿರುತ್ತದೆ.
Pro Lite, Pro, Business ಮತ್ತು Enterprise ಬಳಕೆದಾರರು ಚಾಟ್ನಲ್ಲಿ GPT‑6 Astra ಅನ್ನೂ ಬಳಸಬಹುದು. Astra ಅರ್ಹ API ಗ್ರಾಹಕರಿಗೆ ಜೀರೋ ಡೇಟಾ ರಿಟೆನ್ಷನ್ ಅನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ ಮತ್ತು ನಾವು ಕಳೆದ ತಿಂಗಳು ಹಂಚಿಕೊಂಡಂತೆ, ಗ್ರಾಹಕರ ಗೌಪ್ಯತೆಯನ್ನು ಕಾಪಾಡಿಕೊಂಡು ಸುರಕ್ಷತಾ ಮೇಲ್ವಿಚಾರಣೆಯನ್ನು ಬಲಪಡಿಸಲು ಖಾಸಗಿ ಸುರಕ್ಷತಾ ಸಂಸ್ಕರಣೆಯನ್ನು ಪರೀಕ್ಷಿಸುತ್ತಿದ್ದೇವೆ.
ಡೆವಲಪರ್ಗಳಿಗಾಗಿ, GPT‑6 Astra OpenAI API ನಲ್ಲಿ gpt-6-astra ಆಗಿ ಲಭ್ಯವಿದೆ ಮತ್ತು AWS Bedrock ನಲ್ಲಿಯೂ ಲಭ್ಯವಿದೆ. OpenAI API ಸ್ಟ್ಯಾಂಡರ್ಡ್ ದರವು ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳಿಗೆ $10 ಮತ್ತು ಪ್ರತಿ ಮಿಲಿಯನ್ ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳಿಗೆ $50 ಆಗಿದೆ. ಕ್ಯಾಶ್ ಓದುವಿಕೆಗಳು ಮತ್ತು ಬರೆಯುವಿಕೆಗಳಿಗೆ ಪ್ರತ್ಯೇಕ ದರಗಳು ಅನ್ವಯಿಸುತ್ತವೆ. API ಯಲ್ಲಿ GPT‑6 Astra ಗಾಗಿ ಫಾಸ್ಟ್ ಮೋಡ್ ಲಭ್ಯವಿದ್ದು, ಸ್ಟ್ಯಾಂಡರ್ಡ್ ದರದ 2x ಬೆಲೆಯಲ್ಲಿ ಸ್ಟ್ಯಾಂಡರ್ಡ್ ಪ್ರೊಸೆಸಿಂಗ್ನ 2.5x ವರೆಗಿನ ವೇಗವನ್ನು ಒದಗಿಸುತ್ತದೆ.
ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ
| ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | ಕ್ಲಾಡ್ ಫೇಬಲ್ 5 | Claude Opus 5 | Gemini 3.7 Flash |
| OSWorld 2.0 (ಆಗಸ್ಟ್ ಬಿಡುಗಡೆ, ಭಾಗಶಃ ಸ್ಕೋರ್) | - | - | - | 66.1% | 70.6% | - |
| OSWorld 2.0 (ಆಗಸ್ಟ್ ಬಿಡುಗಡೆ, ಆಫ್ಲೈನ್ ಉಪಸಮೂಹ, ಭಾಗಶಃ ಸ್ಕೋರ್) | - | - | - | - | - | - |
| ScreenSpot Pro | 92.6% | 76.8% | - | - | - | - |
| BrowseComp | 92.1% | 90.4% | - | 87.4% | 90.8% | - |
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
ವಿಜ್ಞಾನ ಮತ್ತು ಆರೋಗ್ಯ
| ವಿಜ್ಞಾನ ಮತ್ತು ಆರೋಗ್ಯ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | ಕ್ಲಾಡ್ ಫೇಬಲ್ 5 | Claude Opus 5 | Gemini 3.7 Flash |
| GeneBench Pro | 37.1% | 32.3% | - | - | - | - |
| MedChemBench (Internal) | 49.7% | 47.4% | - | - | - | - |
| LifeSci Bench | 60.8% | 59.9% | - | - | - | - |
| HealthBench ಪ್ರೊಫೆಷನಲ್ (ಉದ್ದಕ್ಕೆ ಹೊಂದಿಸಲಾದ) | 63.4% | 60.5% | 62.1% | 60.9% | 59.8% | 48.7% |
ಸೈಬರ್ಸುರಕ್ಷತೆ
| ಸೈಬರ್ಸುರಕ್ಷತೆ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | ಕ್ಲಾಡ್ ಫೇಬಲ್ 5 | Claude Opus 5 | Gemini 3.7 Flash |
| CVE-Bench | - | 94.1% | - | - | - | - |
| ಕ್ಯಾಪ್ಚರ್-ದಿ-ಫ್ಲ್ಯಾಗ್ಸ್ ಸವಾಲುಗಳು | - | 96.7% | - | - | - | - |
| SEC-Bench Pro | 85.4% | 79.1% | - | - | - | - |
| ಸೈಬರ್ ಜಿಮ್ | - | 84.5% | - | - | - | - |
| ExploitBench | 100.0% | 78.5% | - | - | 70.0% | - |
| ExploitGym (2 ಗಂಟೆ) | - | 33.7%? | - | - | 171 | - |
| ExploitGym (6 ಗಂಟೆ) | - | 33.7%? | - | - | 191 | - |
ಹೊಂದಿಸುವಿಕೆ
ಹೊಂದಿಸುವಿಕೆ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | ಕ್ಲಾಡ್ ಫೇಬಲ್ 5 | Claude Opus 5 | Gemini 3.8 Flash |
ಆಂತರಿಕ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆ ಸುರಕ್ಷತಾ ಬೆಂಚ್ಮಾರ್ಕ್ (ಕಡಿಮೆ ಇದ್ದಷ್ಟು ಉತ್ತಮ) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
ಆಂತರಿಕ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ಸುರಕ್ಷತಾ ಬೆಂಚ್ಮಾರ್ಕ್, AutoReview ಜೊತೆಗೆ (ಕಡಿಮೆ ಇದ್ದಷ್ಟೂ ಉತ್ತಮ) | 1.8% | 4.3% | - | - | - | - |
ಆಂತರಿಕ ತಪ್ಪಿಸಿಕೊಳ್ಳುವಿಕೆಯ ಮಾನದಂಡ (ಕಡಿಮೆ ಇದ್ದಷ್ಟು ಉತ್ತಮ) | 0.00% | 0.29% | - | - | - | - |
ExploitGym ಹನಿಪಾಟ್ (ಕಡಿಮೆ ಇದ್ದಷ್ಟು ಉತ್ತಮ) | 0.0% | 48.2% | - | - | - | - |
ಅಸಾಧ್ಯ ExploitGym | 100.0% | - | - | - | - | - |
ಆಂತರಿಕ ಹಾಲ್ಯೂಸಿನೇಷನ್ ಬೆಂಚ್ಮಾರ್ಕ್ (ಕಡಿಮೆ ಇದ್ದಷ್ಟು ಉತ್ತಮ) | 4.2% | 12.2% | - | - | - | - |
ದೀರ್ಘ ಸಂದರ್ಭ.
ದೀರ್ಘ ಸಂದರ್ಭ. | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | ಕ್ಲಾಡ್ ಫೇಬಲ್ 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
ಅಮೂರ್ತ ತಾರ್ಕಿಕತೆ
| ಅಮೂರ್ತ ತಾರ್ಕಿಕತೆ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | ಕ್ಲಾಡ್ ಫೇಬಲ್ 5 | Claude Opus 5 | Gemini 3.7 Flash |
| ARC-AGI-3 | 99.9% | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | 84.6% |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | 95.5% |
ಯಾವುದೇ ಪ್ರಯತ್ನದಲ್ಲೂ ಮೌಲ್ಯಮಾಪನ ಅಂಕಗಳು ಗರಿಷ್ಠವಾಗಿರುತ್ತವೆ. GPT ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ನಮ್ಮ ಸಂಶೋಧನಾ ಪರಿಸರದಲ್ಲಿ ಅಥವಾ ನಮ್ಮ API ಮೂಲಕ ರನ್ ಮಾಡಲಾಯಿತು, ಇದು ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ಗಳು, ಲಭ್ಯವಿರುವ ಟೂಲ್ಗಳು ಇತ್ಯಾದಿಗಳಲ್ಲಿನ ವ್ಯತ್ಯಾಸಗಳಿಂದಾಗಿ ಉತ್ಪಾದನಾ ChatGPT ಗಿಂತ ಸ್ವಲ್ಪ ವಿಭಿನ್ನ ಔಟ್ಪುಟ್ ಅನ್ನು ಒದಗಿಸಬಹುದು.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) and supporting research(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) and supporting research(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
