ನಾವು GPT‑5.6 ಸರಣಿಯ ಸೀಮಿತ ಪೂರ್ವವೀಕ್ಷಣೆಯನ್ನು ಆರಂಭಿಸುತ್ತಿದ್ದೇವೆ: ನಮ್ಮ ಫ್ಲಾಗ್ಶಿಪ್ ಮಾಡೆಲ್ Sol; ದಿನನಿತ್ಯದ ಕೆಲಸಕ್ಕೆ ಸಮತೋಲನ ಹೊಂದಿದ ಮಾಡೆಲ್ Terra; ಮತ್ತು ವೇಗವಾದ, ಕಡಿಮೆ ವೆಚ್ಚದ ಮಾಡೆಲ್ Luna. Terra, GPT‑5.5 ಗೆ ಸ್ಪರ್ಧಾತ್ಮಕ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡುತ್ತಲೇ 2x ಕಡಿಮೆ ವೆಚ್ಚದ್ದಾಗಿದೆ; Luna ನಮ್ಮ ಅತಿ ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲಿ ಬಲವಾದ ಸಾಮರ್ಥ್ಯವನ್ನು ನೀಡುತ್ತದೆ.
GPT‑5.6 Sol ಇದುವರೆಗಿನ ನಮ್ಮ ಅತ್ಯಂತ ದೃಢ ಸುರಕ್ಷತಾ ಸ್ಟ್ಯಾಕ್ನೊಂದಿಗೆ ಬಿಡುಗಡೆಯಾಗುತ್ತದೆ. ಹೆಚ್ಚಿನ-ಅಪಾಯದ ಚಟುವಟಿಕೆ, ಸಂವೇದನಾಶೀಲ ಸೈಬರ್ ವಿನಂತಿಗಳು ಮತ್ತು ಪುನರಾವರ್ತಿತ ದುರುಪಯೋಗದ ವಿರುದ್ಧ ರಕ್ಷಣೆಯನ್ನು ನಾವು ಬಲಪಡಿಸಿದ್ದೇವೆ; ದುರ್ಬಲತೆಗಳನ್ನು ಹುಡುಕಲು, ನಮ್ಮ ವ್ಯವಸ್ಥೆಯನ್ನು ಒತ್ತಡ-ಪರೀಕ್ಷಿಸಲು, ಮತ್ತು ನೈಜ ದಾಳಿಗಳ ವಿರುದ್ಧ ಅದನ್ನು ಗಟ್ಟಿಗೊಳಿಸಲು ಹಲವು ವಾರಗಳನ್ನು ಕಳೆದಿದ್ದೇವೆ.
ವ್ಯಾಪಕ ಪ್ರವೇಶವನ್ನು ನಾವು ನಂಬುತ್ತೇವೆ; ಮುಂದಿನ ಕೆಲವು ವಾರಗಳಲ್ಲಿ GPT‑5.6 Sol, Terra ಮತ್ತು Luna ಅನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಲಭ್ಯವಾಗಿಸುವ ಯೋಜನೆ ನಮ್ಮದು. ಅಮೆರಿಕ ಸರ್ಕಾರದೊಂದಿಗೆ ನಮ್ಮ ನಿರಂತರ ಸಂವಹನದ ಭಾಗವಾಗಿ, ಇಂದಿನ ಬಿಡುಗಡೆಗೆ ಮುನ್ನ ನಮ್ಮ ಯೋಜನೆಗಳು ಮತ್ತು ಮಾಡೆಲ್ಗಳ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ನಾವು ಪೂರ್ವವಾಗಿ ಹಂಚಿಕೊಂಡೆವು. ಅವರ ವಿನಂತಿಯ ಮೇರೆಗೆ, ಹೆಚ್ಚು ವ್ಯಾಪಕವಾಗಿ ಬಿಡುಗಡೆ ಮಾಡುವ ಮೊದಲು, ಸರ್ಕಾರದೊಂದಿಗೆ ಹಂಚಿಕೊಳ್ಳಲಾದ ಭಾಗವಹಿಸುವಿಕೆಯಿರುವ ವಿಶ್ವಾಸಾರ್ಹ ಪಾಲುದಾರರ ಸಣ್ಣ ಗುಂಪಿಗೆ ಸೀಮಿತ ಪೂರ್ವವೀಕ್ಷಣೆಯಿಂದ ನಾವು ಆರಂಭಿಸುತ್ತಿದ್ದೇವೆ. ಈ ಪೂರ್ವವೀಕ್ಷಣೆಯ ವೇಳೆ, ಹೆಚ್ಚು ವ್ಯಾಪಕ ಲಭ್ಯತೆಯತ್ತ ಕೆಲಸ ಮಾಡುವಾಗ ನಾವು ಪರೀಕ್ಷೆಯನ್ನು ಮುಂದುವರಿಸಿ ಪಾಲುದಾರರೊಂದಿಗೆ ನಿಕಟವಾಗಿ ಸಂಯೋಜಿಸುತ್ತೇವೆ. ಈ ರೀತಿಯ ಸರ್ಕಾರ ಪ್ರವೇಶ ಪ್ರಕ್ರಿಯೆ ದೀರ್ಘಕಾಲದ ಡಿಫಾಲ್ಟ್ ಆಗಬೇಕು ಎಂದು ನಾವು ನಂಬುವುದಿಲ್ಲ. ಇದು ಅವುಗಳನ್ನು ಅಗತ್ಯವಿರುವ ಬಳಕೆದಾರರು, ಡೆವಲಪರ್ಗಳು, ಉದ್ಯಮಗಳು, ಸೈಬರ್ ರಕ್ಷಕರು ಮತ್ತು ಜಾಗತಿಕ ಪಾಲುದಾರರಿಂದ ಅತ್ಯುತ್ತಮ ಟೂಲ್ಗಳನ್ನು ದೂರ ಇಡುತ್ತದೆ. ಮುಂದಿನ ವಾರಗಳಲ್ಲಿ ಹೆಚ್ಚು ವ್ಯಾಪಕ ಲಭ್ಯತೆಯತ್ತ ಹೋಗಲು ಇದು ಅತ್ಯಂತ ಬಲವಾದ ಮಾರ್ಗ ಎಂದು ನಾವು ನಂಬುವುದರಿಂದ, ಮತ್ತು Administration ಜೊತೆ ಸೈಬರ್ Executive Order ಫ್ರೇಮ್ವರ್ಕ್ ಹಾಗೂ ಭವಿಷ್ಯದ ಮಾಡೆಲ್ ಬಿಡುಗಡೆಗಳಿಗೆ ಪುನರಾವರ್ತಿಸಬಹುದಾದ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸುತ್ತಿರುವುದರಿಂದ, ನಾವು ಈ ಅಲ್ಪಕಾಲಿಕ ಹೆಜ್ಜೆ ಇಡುತ್ತಿದ್ದೇವೆ.
GPT‑5.6 Sol ಇದುವರೆಗಿನ ನಮ್ಮ ಅತ್ಯಂತ ಬಲವಾದ ಮಾಡೆಲ್. ಮಾಡೆಲ್ ಕಾರ್ಯಕ್ಷಮತೆಯ ಪೂರ್ವವೀಕ್ಷಣೆಗೆ, ಕೋಡಿಂಗ್, ಜೀವಶಾಸ್ತ್ರ ಮತ್ತು ಸೈಬರ್ಸುರಕ್ಷತೆಯಲ್ಲಿ ಸುಧಾರಿತ ಏಜೆಂಟಿಕ್ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ತೋರಿಸುವ ಮೌಲ್ಯಮಾಪನಗಳೊಂದನ್ನು ನಾವು ಹಂಚಿಕೊಳ್ಳುತ್ತಿದ್ದೇವೆ; ಹೆಚ್ಚುವರಿ ಸುರಕ್ಷತಾ ಮತ್ತು ಸಿದ್ಧತಾ ಮೌಲ್ಯಮಾಪನಗಳು ನಮ್ಮ ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ಲಭ್ಯ. ಮಾಡೆಲ್ ಅನ್ನು ವ್ಯಾಪಕವಾಗಿ ಲಭ್ಯಗೊಳಿಸಿದಾಗ ವಿಸ್ತೃತ ಮೌಲ್ಯಮಾಪನ ಫಲಿತಾಂಶಗಳನ್ನು ನಾವು ಹಂಚಿಕೊಳ್ಳುತ್ತೇವೆ.
GPT‑5.6 ಜೊತೆಗೆ, Sol ಗೆ ಆಳವಾಗಿ ರೀಜನ್ ಮಾಡಲು ಅತಿ ಹೆಚ್ಚು ಸಮಯ ನೀಡಲು ಹೊಸ `max` ರೀಜನಿಂಗ್ ಪ್ರಯತ್ನವನ್ನು ಪರಿಚಯಿಸುತ್ತಿದ್ದೇವೆ. ಅದರ ಜೊತೆಗೆ, ಸಂಕೀರ್ಣ ಕೆಲಸವನ್ನು ವೇಗಗೊಳಿಸಲು ಉಪಏಜೆಂಟ್ಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಒಂದೇ ಏಜೆಂಟ್ನ ಸಾಮರ್ಥ್ಯಗಳನ್ನೂ ಮೀರುವ ಹೊಸ `ultra` ಮೋಡ್ ಅನ್ನು ಪರಿಚಯಿಸುತ್ತಿದ್ದೇವೆ.
ಕೋಡಿಂಗ್ ವರ್ಕ್ಫ್ಲೋಗಳಿಗೆ, GPT‑5.6 Sol Terminal‑Bench 2.1 ನಲ್ಲಿ ಹೊಸ ಅತ್ಯುತ್ತಮ ಮಟ್ಟವನ್ನು ಸ್ಥಾಪಿಸುತ್ತದೆ; ಇದು ಯೋಜನೆ, ಪುನರಾವರ್ತನೆ ಮತ್ತು ಟೂಲ್ ಸಂಯೋಜನೆ ಅಗತ್ಯವಿರುವ ಕಮಾಂಡ್-ಲೈನ್ ವರ್ಕ್ಫ್ಲೋಗಳನ್ನು ಪರೀಕ್ಷಿಸುತ್ತದೆ.
GPT‑5.6 Sol ಜೀವಶಾಸ್ತ್ರ ವರ್ಕ್ಫ್ಲೋಗಳಲ್ಲಿಯೂ ವ್ಯಾಪಕ ಸುಧಾರಣೆಗಳನ್ನು ತೋರಿಸುತ್ತದೆ. ದೀರ್ಘ-ವ್ಯಾಪ್ತಿಯ ಜಿನೋಮಿಕ್ಸ್ ಮತ್ತು ಪ್ರಮಾಣಾತ್ಮಕ-ಜೀವಶಾಸ್ತ್ರ ವಿಶ್ಲೇಷಣೆಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ GeneBench v1 ನಲ್ಲಿ, ಇದು ಕಡಿಮೆ ಟೋಕನ್ಗಳನ್ನು ಬಳಸುತ್ತಲೇ GPT‑5.5 ಗಿಂತ ಬಲವಾದ ಫಲಿತಾಂಶಗಳನ್ನು ಸಾಧಿಸುತ್ತದೆ.
ಸೈಬರ್ಸುರಕ್ಷತೆಗೆ GPT‑5.6 Sol ಇದುವರೆಗಿನ ನಮ್ಮ ಅತ್ಯಂತ ಸಾಮರ್ಥ್ಯವಂತ ಮಾಡೆಲ್. ದುರ್ಬಲತೆ ಸಂಶೋಧನೆ ಮತ್ತು ಎಕ್ಸ್ಪ್ಲಾಯ್ಟೇಶನ್ ಸೇರಿದಂತೆ ದೀರ್ಘ-ವ್ಯಾಪ್ತಿಯ ಭದ್ರತಾ ಕಾರ್ಯಗಳಲ್ಲಿ ಇದು ಕಾರ್ಯಕ್ಷಮತೆ-ದಕ್ಷತೆ ಗಡಿಯನ್ನು ಮುಂದೂಡುತ್ತದೆ. ExploitBench² ನಲ್ಲಿ, GPT‑5.6 Sol ಕೇವಲ ~1/3 ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಬಳಸಿಕೊಂಡು Mythos Preview ಗೆ ಸ್ಪರ್ಧಾತ್ಮಕವಾಗಿದೆ. UC Berkeley ಸಂಶೋಧಕರು OpenAI ಮತ್ತು ಇತರ ಫ್ರಂಟಿಯರ್ ಲ್ಯಾಬ್ಗಳ ಸಹಕಾರದಲ್ಲಿ ರಚಿಸಿದ ಮಾನದಂಡವಾದ ExploitGym(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)3 ನಲ್ಲಿ, ರೀಜನಿಂಗ್ ಹೆಚ್ಚಿಸಿದಂತೆ GPT‑5.6 Sol, Terra ಮತ್ತು Luna ಮಾಡೆಲ್ಗಳು ಎಲ್ಲವೂ ಸೈಬರ್ ಸಾಮರ್ಥ್ಯಗಳಲ್ಲಿ ಬಲವಾದ ಸುಧಾರಣೆಗಳನ್ನು ತೋರಿಸುತ್ತವೆ.
ಪ್ರತಿ ಮಾಡೆಲ್ನ ಸಾಮರ್ಥ್ಯಗಳಿಗೆ ಹೊಂದುವ ಸಂರಚನೆಗಳೊಂದಿಗೆ, ಇದುವರೆಗಿನ ನಮ್ಮ ಅತ್ಯಂತ ದೃಢ ರಕ್ಷಣಾ ಕ್ರಮಗಳೊಂದಿಗೆ GPT‑5.6 Sol, Terra ಮತ್ತು Luna ಅನ್ನು ನಾವು ಅಭಿವೃದ್ಧಿಪಡಿಸಿದ್ದೇವೆ. ಮಾಡೆಲ್ ಹೆಚ್ಚು ಸಾಮರ್ಥ್ಯವಂತವಾಗುತ್ತಿದ್ದಂತೆ, ಕೋಡ್ ಪರಿಶೀಲನೆ, ದುರ್ಬಲತೆ ಸಂಶೋಧನೆ, ಪ್ಯಾಚ್ ಅಭಿವೃದ್ಧಿ, ಡಿಬಗಿಂಗ್, ಭದ್ರತಾ ಶಿಕ್ಷಣ ಮತ್ತು ರಕ್ಷಣಾತ್ಮಕ ಪರೀಕ್ಷೆಯಂತಹ ನ್ಯಾಯಸಮ್ಮತ ಕೆಲಸಗಳಿಗೆ ಪ್ರವೇಶವನ್ನು ಉಳಿಸಿಕೊಂಡೇ ನೈಜ-ಜಗತ್ತಿನ ಪ್ರತಿಕೂಲ ಒತ್ತಡವನ್ನು ತಾಳುವಂತೆ ರಕ್ಷಣಾ ಕ್ರಮಗಳನ್ನು ನಾವು ವಿನ್ಯಾಸಗೊಳಿಸುತ್ತೇವೆ. ಆ ಪ್ರಯೋಜನಕಾರಿ ಬಳಕೆಗಳನ್ನು ಅನಗತ್ಯವಾಗಿ ಮಿತಿಗೊಳಿಸದೆ, ನಿಷೇಧಿತ ಆಕ್ರಮಣಕಾರಿ ಚಟುವಟಿಕೆಯನ್ನು ಹೆಚ್ಚು ಕಠಿಣ, ಅನಿಶ್ಚಿತ ಮತ್ತು ಪತ್ತೆಹಚ್ಚಬಹುದಾದಂತೆ ಮಾಡುವುದು ನಮ್ಮ ಗುರಿ. ಮಾಡೆಲ್ ಮತ್ತು ರಕ್ಷಣಾ ಕ್ರಮಗಳ ನಮ್ಮ ಮೌಲ್ಯಮಾಪನದ ಆಧಾರದ ಮೇಲೆ, ನಿಷೇಧಿತ ಆಕ್ರಮಣಕಾರಿ ಬಳಕೆಯನ್ನು ಅರ್ಥಪೂರ್ಣವಾಗಿ ನಿಯಂತ್ರಿಸುತ್ತಲೇ, ನ್ಯಾಯಸಮ್ಮತ ರಕ್ಷಣಾತ್ಮಕ ಕೆಲಸಕ್ಕೆ ಮಹತ್ತರ ಲಾಭ ಸಿಗುತ್ತದೆ ಎಂದು ನಾವು ನಿರೀಕ್ಷಿಸುತ್ತೇವೆ.
GPT‑5.6 Sol, ಅಂತ್ಯದಿಂದ ಅಂತ್ಯವರೆಗೆ ದಾಳಿಗಳನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ನಡೆಸುವುದಕ್ಕಿಂತ, ಜನರು ದುರ್ಬಲತೆಗಳನ್ನು ಕಂಡುಹಿಡಿದು ಸರಿಪಡಿಸಲು ಸಹಾಯ ಮಾಡುವಲ್ಲಿ ಹೆಚ್ಚು ಉತ್ತಮ. ಈ ಸಾಮರ್ಥ್ಯಗಳು ಮುಂದುವರಿದು ಹೆಚ್ಚುತ್ತಿರುವಂತೆ, ದುರ್ಬಲತೆಗಳನ್ನು ಕಂಡುಹಿಡಿಯಲು, ಪ್ಯಾಚ್ಗಳನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸಲು ಮತ್ತು ವ್ಯವಸ್ಥೆಗಳನ್ನು ವ್ಯಾಪಕವಾಗಿ ಬಲಪಡಿಸಲು ಈ ಟೂಲ್ಗಳನ್ನು ಬಳಸಬಲ್ಲ ರಕ್ಷಕರಿಗೆ ಅವು ತಲುಪಿ ಪ್ರಯೋಜನವಾಗುವುದನ್ನು ಖಚಿತಪಡಿಸುವುದೇ ನಮ್ಮ ಆದ್ಯತೆ.
GPT‑5.6 Sol ನಮ್ಮ Preparedness Framework ಅಡಿಯಲ್ಲಿ Cyber Critical ಮಿತಿಯನ್ನು ದಾಟುವುದಿಲ್ಲ. Chromium ಮತ್ತು Firefox ಒಳಗೊಂಡ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ, ಇದು ಬಗ್ಗಳು ಮತ್ತು ಎಕ್ಸ್ಪ್ಲಾಯ್ಟೇಶನ್ ಪ್ರಿಮಿಟಿವ್ಗಳನ್ನು—ಎಕ್ಸ್ಪ್ಲಾಯ್ಟ್ನ ಕಟ್ಟಡ ಘಟಕಗಳನ್ನು—ಗುರುತಿಸಿತು; ಆದರೆ ಪರೀಕ್ಷಿಸಿದ ಪರಿಸ್ಥಿತಿಗಳಲ್ಲಿ ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಪೂರ್ಣ-ಚೈನ್ ಎಕ್ಸ್ಪ್ಲಾಯ್ಟ್ ಅನ್ನು ಉತ್ಪಾದಿಸಲಿಲ್ಲ. ಆದರೂ, benchmark ಮಿತಿಗಳು ಮಾಡೆಲ್ ಅನ್ನು ಬಳಸುವ ಅಥವಾ ಇತರ ಟೂಲ್ಗಳೊಂದಿಗೆ ಸೇರಿಸುವ ಪ್ರತಿಯೊಂದು ರೀತಿಯನ್ನೂ ಹಿಡಿಯಲು ಸಾಧ್ಯವಿಲ್ಲ. ಆ ಅನಿಶ್ಚಿತತೆ, ಜೊತೆಗೆ ಮಾಡೆಲ್ನ ವಿಶಾಲ ಸಾಮರ್ಥ್ಯಗಳ ಹಂತ ಬದಲಾವಣೆ, ಇವೆಲ್ಲದರಿಂದಲೇ ಮಾಡೆಲ್ನ ಹೆಚ್ಚಿದ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಬಲವಾದ ರಕ್ಷಣಾ ಕ್ರಮಗಳು ಮತ್ತು ಹಂತಗತ ಬಿಡುಗಡೆಯೊಂದಿಗೆ ಜೋಡಿಸುತ್ತಿದ್ದೇವೆ. ನಮ್ಮ ರಕ್ಷಣಾ ಕ್ರಮಗಳ ಕುರಿತು ಹೆಚ್ಚಿನ ವಿವರಗಳನ್ನು GPT‑5.6 Preview ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ಹಂಚಿಕೊಳ್ಳುತ್ತೇವೆ.
ದೃಢನಿಶ್ಚಯದ ಅಥವಾ ಹೊಂದಿಕೊಳ್ಳುವ ದುರುಪಯೋಗದ ವಿರುದ್ಧ ಒಂದೇ ರಕ್ಷಣಾ ಕ್ರಮ ಸಾಕಾಗುವುದಿಲ್ಲ. GPT‑5.6 ಪೂರ್ವವೀಕ್ಷಣೆಯಾದ್ಯಂತ, ನಾವು ಪದರಗಟ್ಟಿದ ರಕ್ಷಣಾ ಕ್ರಮಗಳನ್ನು ಬಳಸುತ್ತೇವೆ; ನಿಖರ ಸಂರಚನೆಗಳು ಮಾಡೆಲ್ಗಳಾದ್ಯಂತ ಬದಲಾಗುತ್ತವೆ, ಮತ್ತು ನೈಜ-ಜಗತ್ತಿನ ದಾಳಿಗಳಿಗೆ ಅವನ್ನು ಒತ್ತಡ-ಪರೀಕ್ಷಿಸುತ್ತೇವೆ. ಇವುಗಳಲ್ಲಿ ಮಾಡೆಲ್ಗೆ ತರಬೇತಿಗೊಳಿಸಿದ ರಕ್ಷಣೆಗಳು, ಜನರೇಷನ್ ಸಮಯದ ರಿಯಲ್-ಟೈಮ್ ಪರಿಶೀಲನೆಗಳು, ಖಾತೆ-ಮಟ್ಟದ ಸಂಕೇತಗಳು, ವಿಭಿನ್ನ ಪ್ರವೇಶ, ಮೇಲ್ವಿಚಾರಣೆ, ಜಾರಿ, ಮತ್ತು ನಿರಂತರ ಪರೀಕ್ಷೆ ಸೇರಿವೆ.
ಬಳಕೆದಾರರು ತಮ್ಮ ಉದ್ದೇಶವನ್ನು ಮರೆಮಾಡಲು ಅಥವಾ ಮಾಡೆಲ್ ಅನ್ನು ಜೈಲ್ಬ್ರೇಕ್ ಮಾಡಲು ಪ್ರಯತ್ನಿಸಿದರೂ ಸಹ, ನಿಷೇಧಿತ ಸೈಬರ್ ಸಹಾಯವನ್ನು ನಿರಾಕರಿಸಲು GPT‑5.6 ತರಬೇತಿಗೊಂಡಿದೆ. ಈ ಮಾಡೆಲ್-ಮಟ್ಟದ ರಕ್ಷಣಾ ಕ್ರಮಗಳು, ಮಾಡೆಲ್ ಯಾವುದರಲ್ಲಿ ಸಹಾಯ ಮಾಡಬೇಕು ಮತ್ತು ಮಾಡಬಾರದು ಎಂಬುದರ ಸುತ್ತ ಮೊದಲ ಗಡಿಯನ್ನು ಸ್ಥಾಪಿಸುತ್ತವೆ.
ರಿಯಲ್-ಟೈಮ್ ಸೈಬರ್ ಮತ್ತು ಜೀವಶಾಸ್ತ್ರ ದುರುಪಯೋಗ ವರ್ಗೀಕರಕಗಳು, ಔಟ್ಪುಟ್ ರಚನೆಯಾಗುವಾಗಲೇ ಅದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ಮೂಲಕ ಮತ್ತೊಂದು ಪದರ ಒದಗಿಸುತ್ತವೆ. ಹೆಚ್ಚಿನ ಅಪಾಯದ ಸಂದರ್ಭಗಳಲ್ಲಿ, ಅವು ಸಾಧ್ಯವಿರುವ ಉಲ್ಲಂಘನೆಯನ್ನು ಪತ್ತೆಹಚ್ಚಿದರೆ, ದೊಡ್ಡ ರೀಜನಿಂಗ್ ಮಾಡೆಲ್ ಸಂಭಾಷಣೆ ಮತ್ತು ಅದರ ಸಂದರ್ಭವನ್ನು ಪರಿಶೀಲಿಸುವವರೆಗೆ ಜನರೇಷನ್ ಅನ್ನು ವಿರಾಮಗೊಳಿಸಬಹುದು. ಔಟ್ಪುಟ್ ಅನುಮತಿಸದದ್ದು ಎಂದು ಮೌಲ್ಯಮಾಪನವಾದರೆ, ಅದು ಬಳಕೆದಾರರನ್ನು ತಲುಪುವ ಮೊದಲು ತಡೆಹಿಡಿಯಲಾಗುತ್ತದೆ.
ಫ್ಲ್ಯಾಗ್ ಮಾಡಿದ ಚಟುವಟಿಕೆ ಸಂಬಂಧಿತ ಸಂಭಾಷಣೆಗಳು ಮತ್ತು ಅಪಾಯ ಸಂಕೇತಗಳಾದ್ಯಂತ ಖಾತೆ-ಮಟ್ಟದ ಪರಿಶೀಲನೆಯನ್ನು ಕೂಡ ಪ್ರೇರೇಪಿಸಬಹುದು; ಇದು ವಿಷಯ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಪರಿಶೀಲನೆ ಕುರಿತ ನಮ್ಮ ನಿಯಮಗಳು ಮತ್ತು ನೀತಿಗಳಿಗೆ ಅನುಗುಣವಾಗಿರುತ್ತದೆ. ಒಂದೇ ಸಂಭಾಷಣೆಯನ್ನು ಮೀರಿ ನೋಡುವುದು, ಒಂದೇ ರೀತಿಯ ತಾಂತ್ರಿಕ ಕಲ್ಪನೆಗಳು ಸಂಪೂರ್ಣ ಭಿನ್ನ ಸಂದರ್ಭಗಳಲ್ಲಿ ಕಾಣಿಸಬಹುದಾದಲ್ಲಿ, ನಿರಂತರ ದುರುದ್ದೇಶಪೂರ್ಣ ವರ್ತನೆಯನ್ನು ನ್ಯಾಯಸಮ್ಮತ ದ್ವಿ-ಬಳಕೆ ಭದ್ರತಾ ಕೆಲಸದಿಂದ ಬೇರ್ಪಡಿಸಲು ನಮ್ಮ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ಒಟ್ಟಿಗೆ, ಈ ಪದರಗಳು ಯಾವುದೇ ಒಂದು ರಕ್ಷಣಾ ಕ್ರಮಕ್ಕಿಂತ ಒಟ್ಟಾರೆ ವಿಧಾನವನ್ನು ಹೆಚ್ಚು ದೃಢವಾಗಿಸುತ್ತವೆ. ಮಾಡೆಲ್ ವರ್ತನೆ ಹಾನಿಕರ ಪ್ರತಿಕ್ರಿಯೆಗಳ ಸಾಧ್ಯತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ರಿಯಲ್-ಟೈಮ್ ವ್ಯವಸ್ಥೆಗಳು ಜನರೇಷನ್ ವೇಳೆ ಮಧ್ಯಪ್ರವೇಶಿಸಬಹುದು, ಖಾತೆ-ಮಟ್ಟದ ಪರಿಶೀಲನೆ ವಿಶಾಲ ಮಾದರಿಗಳನ್ನು ಗುರುತಿಸಬಹುದು, ಮತ್ತು ವಿಭಿನ್ನ ಪ್ರವೇಶವು ಅತಿ ಸಂವೇದನಶೀಲ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಡಿಫಾಲ್ಟ್ ಆಗಿ ವ್ಯಾಪಕವಾಗಿ ಲಭ್ಯಗೊಳಿಸದೆ ಪ್ರಮುಖ ರಕ್ಷಣಾತ್ಮಕ ಕೆಲಸವನ್ನು ಉಳಿಸುತ್ತದೆ.
ವಿಶೇಷವಾಗಿ ಪೂರ್ವವೀಕ್ಷಣೆಯ ಸಮಯದಲ್ಲಿ, ಬಳಕೆದಾರರು ಕೆಲವು ವಿನಂತಿಗಳನ್ನು ತಡೆಹಿಡಿಯುವ ಅಥವಾ ನಿರಾಕರಿಸುವ ರಕ್ಷಣಾ ಕ್ರಮಗಳನ್ನು ಎದುರಿಸಬಹುದು. ಹೆಚ್ಚುವರಿ ಪರಿಶೀಲನೆಗಾಗಿ ಜನರೇಷನ್ ವಿರಾಮಗೊಳ್ಳುವುದರಿಂದ ಇತರ ವಿನಂತಿಗಳಿಗೆ ಹೆಚ್ಚು ಸಮಯ ಬೇಕಾಗಬಹುದು. ರಕ್ಷಣಾತ್ಮಕ ಮತ್ತು ಆಕ್ರಮಣಕಾರಿ ಚಟುವಟಿಕೆಗಳು ಆರಂಭದಲ್ಲಿ ಒಂದೇ ರೀತಿ ಕಾಣಬಹುದಾದ ದ್ವಿ-ಬಳಕೆ ಕ್ಷೇತ್ರಗಳಲ್ಲಿ ವಿಶೇಷವಾಗಿ, ರಕ್ಷಣಾ ಕ್ರಮಗಳು ಕೆಲವೊಮ್ಮೆ ನ್ಯಾಯಸಮ್ಮತ ಕೆಲಸದಲ್ಲೂ ಮಧ್ಯಪ್ರವೇಶಿಸಬಹುದು.
ಪೂರ್ವವೀಕ್ಷಣೆಯನ್ನು ಪರೀಕ್ಷಿಸಲು ರೂಪಿಸಿರುವ ವಿಷಯಗಳಲ್ಲಿ ಇದೂ ಒಂದು. ರಕ್ಷಣಾ ಕ್ರಮಗಳು ದುರುಪಯೋಗವನ್ನು ನಿಯಂತ್ರಿಸುತ್ತವೆಯೇ ಎಂಬುದಷ್ಟೇ ಅಲ್ಲ, ನ್ಯಾಯಸಮ್ಮತ ಬಳಕೆದಾರರು ಸಾಮಾನ್ಯ ಕೆಲಸವನ್ನು ಇನ್ನೂ ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಮತ್ತು ದಕ್ಷವಾಗಿ ಪೂರ್ಣಗೊಳಿಸಬಹುದೇ ಎಂಬುದನ್ನೂ ತಿಳಿದುಕೊಳ್ಳಲು ನಾವು ಬಯಸುತ್ತೇವೆ. ಪೂರ್ವವೀಕ್ಷಣೆಯ ಪ್ರತಿಕ್ರಿಯೆಗಳು ಅನಗತ್ಯ ತಡೆಗಳು ಮತ್ತು ವಿಳಂಬಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಲು, ರಕ್ಷಣಾ ಕ್ರಮಗಳು ಸಂದರ್ಭವನ್ನು ಅರ್ಥೈಸುವ ರೀತಿಯನ್ನು ಸುಧಾರಿಸಲು, ಮತ್ತು ವ್ಯಾಪಕ ಬಿಡುಗಡೆಗೆ ಮೊದಲು ಇನ್ನಷ್ಟು ಸುಗಮ ಅನುಭವವನ್ನು ರೂಪಿಸಲು ನಮಗೆ ಸಹಾಯ ಮಾಡುತ್ತವೆ.
ಉದ್ಯಮ ಗೌಪ್ಯತಾ ಅವಶ್ಯಕತೆಗಳನ್ನು ಬೆಂಬಲಿಸುತ್ತಲೇ ಸುರಕ್ಷತೆಯನ್ನು ಮುಂದೂಡಲು, ಗೌಪ್ಯತೆಯನ್ನು ಕಾಪಾಡುವ ಪತ್ತೆ, ಗ್ರಾಹಕರು ನಿರ್ವಹಿಸುವ ಸುರಕ್ಷತಾ ನಿಯಂತ್ರಣಗಳು, ಮತ್ತು ಗ್ರಾಹಕ, ಬಳಕೆದಾರ ಅಥವಾ ಕೆಲಸದಭಾರದ ಅಪಾಯಕ್ಕೆ ಹೊಂದಿಸಿದ ಪ್ರವೇಶ ಸೇರಿದಂತೆ ದೀರ್ಘಕಾಲದ ವಿಧಾನಗಳ ಮೇಲೂ ನಾವು ಉದ್ಯಮ ಗ್ರಾಹಕರೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುತ್ತಿದ್ದೇವೆ.
ದಾಳಿಕೋರರು ತಮ್ಮ ತಂತ್ರಗಳನ್ನು ಬದಲಾಯಿಸಿದಾಗಲೂ ರಕ್ಷಣಾ ಕ್ರಮಗಳು ಪರಿಣಾಮಕಾರಿಯಾಗಿಯೇ ಉಳಿಯಬೇಕು. ತಿಳಿದಿರುವ ಸ್ಥಿರ ದಾಳಿಗಳ ಗುಂಪಿನ ಮೇಲಷ್ಟೇ ಕೆಲಸ ಮಾಡುವ ರಕ್ಷಣೆ ಫ್ರಂಟಿಯರ್ ಮಾಡೆಲ್ಗೆ ಸಾಕಷ್ಟು ದೃಢವಾಗಿರುವುದಿಲ್ಲ.
ಅದರ ಕಾರಣದಿಂದಲೇ, ದುರ್ಬಲತೆಗಳನ್ನು ಕಂಡುಹಿಡಿದು ರಕ್ಷಣಾ ಕ್ರಮಗಳನ್ನು ವೇಗವಾಗಿ ಸುಧಾರಿಸಲು ನಮ್ಮದೇ ಮಾಡೆಲ್ಗಳನ್ನು ಬಳಸಿಕೊಂಡು, ಸುರಕ್ಷತೆಗೆ ಹಿಂದೆಂದಿಗಿಂತ ಹೆಚ್ಚು ಬುದ್ಧಿಮತ್ತೆ ಮತ್ತು ಕಂಪ್ಯೂಟ್ ಅನ್ನು ಬಳಸುತ್ತಿದ್ದೇವೆ. ಅನೇಕ ಪ್ರಾಂಪ್ಟ್ಗಳು ಅಥವಾ ಸಂದರ್ಭಗಳಲ್ಲಿ ಕೆಲಸ ಮಾಡಬಹುದಾದ, ಕೇವಲ ಒಂದು ಸೀಮಿತ ಪರಿಸ್ಥಿತಿಗೆ ಸೀಮಿತವಾಗಿರದ ಯುನಿವರ್ಸಲ್ ಜೈಲ್ಬ್ರೇಕ್ಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವ ಗುರಿಯ ಸ್ವಯಂಚಾಲಿತ ರೆಡ್ ಟೀಮಿಂಗ್ಗೆ ನಾವು 700,000 ಕ್ಕೂ ಹೆಚ್ಚು A100-ಸಮಾನ GPU ಗಂಟೆಗಳನ್ನು ಮೀಸಲಿಟ್ಟಿದ್ದೇವೆ. ಇಂತಹ ಕಠಿಣ ಮತ್ತು ಹೆಚ್ಚು ಸಾಮಾನ್ಯ ದಾಳಿಗಳ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸುವುದರಿಂದ, ತಿಳಿದಿರುವ ವೈಫಲ್ಯಗಳ ಸ್ಥಿರ ಗುಂಪನ್ನು ಮೀರಿ ರಕ್ಷಣಾ ಕ್ರಮಗಳನ್ನು ಪರೀಕ್ಷಿಸಲು ನಮಗೆ ಸಾಧ್ಯವಾಯಿತು. ಮಾನವ ಪರೀಕ್ಷೆ ಮಾತ್ರ ಆವರಿಸಬಹುದಾದಕ್ಕಿಂತ ಬಹಳ ಹೆಚ್ಚು ದಾಳಿ ಮಾದರಿಗಳನ್ನು ಪರಿಶೀಲಿಸಲು, ವೈಫಲ್ಯ ಮಾದರಿಗಳನ್ನು ಮುಂಚಿತವಾಗಿ ಗುರುತಿಸಲು, ಮತ್ತು ದುರ್ಬಲತೆಯನ್ನು ಕಂಡುಹಿಡಿದ ಕ್ಷಣದಿಂದ ಅದನ್ನು ಪರಿಹರಿಸುವವರೆಗಿನ ಸಮಯವನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಇದು ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ಸ್ವಯಂಚಾಲಿತ ರೆಡ್-ಟೀಮಿಂಗ್ಗೆ ಜೊತೆಗೆ, ನಾವು ತೃತೀಯ ಪಕ್ಷದ ಪರೀಕ್ಷಕರೊಂದಿಗೆ ವ್ಯಾಪಕ ಮಾನವ ತಜ್ಞರ ರೆಡ್ ಟೀಮಿಂಗ್ ನಡೆಸಿದ್ದೇವೆ; ಇದು ಪೂರ್ವವೀಕ್ಷಣೆಯ ಅವಧಿಯಲ್ಲೂ ಮುಂದುವರಿಯಲಿದೆ. ನಮ್ಮ ವ್ಯವಸ್ಥೆಗಳು ಊಹಿಸದ ರೀತಿಯಲ್ಲಿ ಮಾಡೆಲ್ ಅನ್ನು ದುರುಪಯೋಗಪಡಿಸಲು ಯತ್ನಿಸುವ ಸೃಜನಶೀಲ ತಜ್ಞರ ವಿರುದ್ಧ ರಕ್ಷಣಾ ಕ್ರಮಗಳನ್ನು ಪರೀಕ್ಷಿಸುವ ಮೂಲಕ ಮಾನವ ರೆಡ್-ಟೀಮಿಂಗ್ ಸ್ವಯಂಚಾಲಿತ ಕೆಲಸಕ್ಕೆ ಪೂರಕವಾಗುತ್ತದೆ.
ಯಾವುದೇ ಮೌಲ್ಯಮಾಪನವು ಪ್ರತಿಯೊಂದು ಉತ್ಪನ್ನ ಸಂರಚನೆ, ಬಹು-ಹಂತದ ದಾಳಿ, ಅಥವಾ ನೈಜ-ಜಗತ್ತಿನ ವರ್ಕ್ಫ್ಲೋವನ್ನು ಪ್ರತಿನಿಧಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಆದ್ದರಿಂದ ಹೊಸದಾಗಿ ಪತ್ತೆಯಾಗುವ ಜೈಲ್ಬ್ರೇಕ್ಗಳನ್ನು ಪುನರುತ್ಪಾದಿಸಲು, ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು, ಆದ್ಯತೆಗೊಳಿಸಲು ಮತ್ತು ಸರಿಪಡಿಸಲು ನಾವು ತ್ವರಿತ-ಪ್ರತಿಕ್ರಿಯೆ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಕಾಯ್ದುಕೊಂಡಿದ್ದೇವೆ; ನಂತರ ಭವಿಷ್ಯದಲ್ಲಿ ಸಮಾನ ವೈಫಲ್ಯಗಳ ವಿರುದ್ಧ ಪರೀಕ್ಷಿಸಲು ಅವನ್ನು ನಮ್ಮ ನಿರಂತರ ಮೌಲ್ಯಮಾಪನಗಳಿಗೆ ಸೇರಿಸುತ್ತೇವೆ.
ಪೂರ್ವವೀಕ್ಷಣೆಯ ಸಮಯದಲ್ಲಿ, GPT‑5.6 ಮಾಡೆಲ್ಗಳು ಆರಂಭದಲ್ಲಿ API ಮತ್ತು Codex ಮೂಲಕ ಆಯ್ದ ವಿಶ್ವಾಸಾರ್ಹ ಪಾಲುದಾರರು ಮತ್ತು ಸಂಸ್ಥೆಗಳಿಗೆ ಲಭ್ಯವಾಗುತ್ತವೆ. ChatGPT, Codex ಮತ್ತು API ಬಳಸುವ ಜನರಿಗೆ ಅವನ್ನು ಶೀಘ್ರದಲ್ಲೇ ಹೆಚ್ಚು ವ್ಯಾಪಕವಾಗಿ ಲಭ್ಯವಾಗಿಸುವ ಯೋಜನೆ ನಮ್ಮದು.
GPT‑5.6 ಜೊತೆಗೆ ಪರಿಚಯಿಸಿದ ಈ ಹೊಸ ಹೆಸರಿಸುವ ವ್ಯವಸ್ಥೆಯಲ್ಲಿ, ಸಂಖ್ಯೆ ಮಾಡೆಲ್ನ ಪೀಳಿಗೆಯನ್ನು ಸೂಚಿಸುತ್ತದೆ; Sol, Terra ಮತ್ತು Luna ಸ್ವತಂತ್ರ ಗತಿಯಲ್ಲೇ ಮುಂದುವರಿಯಬಹುದಾದ ಸ್ಥಿರ ಸಾಮರ್ಥ್ಯ ಹಂತಗಳನ್ನು ಸೂಚಿಸುತ್ತವೆ. ಒಟ್ಟಾಗಿ, ಈ ಕುಟುಂಬವು ಜನರಿಗೆ ಮತ್ತು ಡೆವಲಪರ್ಗಳಿಗೆ ಬುದ್ಧಿಮತ್ತೆ, ವೇಗ ಮತ್ತು ವೆಚ್ಚದ across ಸ್ಪಷ್ಟ ಆಯ್ಕೆಗಳನ್ನು ನೀಡುತ್ತದೆ.
GPT‑5.6 ಗೆ ಮೂರು ಮಾಡೆಲ್ ಗಾತ್ರಗಳಲ್ಲಿ ಪ್ರತಿ 1M ಟೋಕನ್ಗಳಿಗೆ ಬೆಲೆ ನಿಗದಿಯಾಗಿದೆ: Sol ಇನ್ಪುಟ್ $5 / ಔಟ್ಪುಟ್ $30; Terra ಇನ್ಪುಟ್ $2.50 / ಔಟ್ಪುಟ್ $15; ಮತ್ತು Luna ಇನ್ಪುಟ್ $1 / ಔಟ್ಪುಟ್ $6. GPT‑5.6 ಇನ್ನಷ್ಟು ಊಹಿಸಬಹುದಾದ ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ಅನ್ನು ಕೂಡ ಪರಿಚಯಿಸುತ್ತದೆ; ಇದರಲ್ಲಿ ಸ್ಪಷ್ಟ ಕ್ಯಾಶ್ ಬ್ರೇಕ್ಪಾಯಿಂಟ್ಗಳು ಮತ್ತು ಕನಿಷ್ಠ 30-ನಿಮಿಷದ ಕ್ಯಾಶ್ ಆಯುಷ್ಯಕ್ಕೆ ಬೆಂಬಲವಿದೆ. GPT‑5.6 ಮತ್ತು ನಂತರದ ಮಾಡೆಲ್ಗಳಿಗೆ, ಕ್ಯಾಶ್ ಬರಹಗಳಿಗೆ ಮಾಡೆಲ್ನ ಕ್ಯಾಶ್ ಮಾಡದ ಇನ್ಪುಟ್ ದರದ 1.25x ಬಿಲ್ ಮಾಡಲಾಗುತ್ತದೆ; ಕ್ಯಾಶ್ ಓದುಗಳು 90% ಕ್ಯಾಶ್ ಮಾಡಿದ-ಇನ್ಪುಟ್ ರಿಯಾಯಿತಿಯನ್ನು ಮುಂದುವರಿಸುತ್ತವೆ.
ಜುಲೈನಲ್ಲಿ Cerebras ಮೇಲೆ ಪ್ರತಿ ಸೆಕೆಂಡ್ಗೆ 750 ಟೋಕನ್ಗಳವರೆಗೆ GPT‑5.6 Sol ಅನ್ನು ಸಹ ಆರಂಭಿಸುತ್ತಿದ್ದೇವೆ; ಇದರಿಂದ ಫ್ರಂಟಿಯರ್ ಬುದ್ಧಿಮತ್ತೆ ಗ್ರಾಹಕರಿಗೆ ಅಭೂತಪೂರ್ವ ವೇಗದಲ್ಲಿ ದೊರೆಯುತ್ತದೆ. ಸಾಮರ್ಥ್ಯವನ್ನು ವಿಸ್ತರಿಸುತ್ತಿರುವಾಗ, ಪ್ರವೇಶವನ್ನು ಆರಂಭದಲ್ಲಿ ಆಯ್ದ ಗ್ರಾಹಕರಿಗೆ ಮಾತ್ರ ಮಿತಿಗೊಳಿಸಲಾಗುತ್ತದೆ.
ಈ ಪೂರ್ವವೀಕ್ಷಣೆಯ ಅವಧಿಯಿಂದ ಕಲಿಯುವುದನ್ನು ಮುಂದುವರಿಸಲು, ಹಾಗೂ GPT‑5.6 Sol, Terra ಮತ್ತು Luna ಅನ್ನು ಶೀಘ್ರದಲ್ಲೇ ಇನ್ನಷ್ಟು ಜನರಿಗೆ ತಲುಪಿಸಲು ನಾವು ಉತ್ಸುಕರಾಗಿದ್ದೇವೆ.
1. ನಮ್ಮ ಮಾಡೆಲ್ಗಳ ಉತ್ಪಾದನಾ ವರ್ತನೆಯನ್ನು ನೋಡಿ ಮತ್ತು ಆಫ್ಲೈನ್ನಲ್ಲಿ ಸಿಮ್ಯುಲೇಟ್ ಮಾಡುವ ಮೂಲಕ ಲೇಟೆನ್ಸಿ ಮತ್ತು API ವೆಚ್ಚವನ್ನು ನಾವು ಅಂದಾಜಿಸುತ್ತೇವೆ. ಈ ಅಂದಾಜುಗಳು ಟೂಲ್ ಕರೆ ವಿವರಗಳು, ಸ್ಯಾಂಪಲ್ ಮಾಡಿದ ಟೋಕನ್ಗಳು ಮತ್ತು ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಒಳಗೊಂಡಿವೆ. ನೈಜ-ಜಗತ್ತಿನ ಫಲಿತಾಂಶಗಳು ಬಹಳ ಬದಲಾಗಬಹುದು ಮತ್ತು ನಮ್ಮ ಸಿಮ್ಯುಲೇಷನ್ನಲ್ಲಿ ಹಿಡಿಯಲಾಗದ ಅನೇಕ ಅಂಶಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತವೆ. ನಾವು ವೇಗವಾದ API ವೇಗಗಳಲ್ಲಿ ಲೇಟೆನ್ಸಿಯನ್ನು, ಮತ್ತು ಸಾಮಾನ್ಯ API ಬೆಲೆಯಲ್ಲಿ ವೆಚ್ಚವನ್ನು ಸಿಮ್ಯುಲೇಟ್ ಮಾಡುತ್ತೇವೆ.
2. ಎಲ್ಲಾ ಮಾಡೆಲ್ಗಳನ್ನು 5 seeds ಮತ್ತು ರೀಜನಿಂಗ್ ನಿರಂತರತೆಯೊಂದಿಗೆ ExploitBench API harness ಬಳಸಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಾಗಿದೆ.
3. ನಾವು ExploitGym ಅನ್ನು ನಮ್ಮ alpha API ಮೇಲೆ ಚಲಾಯಿಸಿದ್ದೇವೆ; ಅದು ನಮ್ಮ public API ಗಿಂತ ವೇಗವಾಗಿ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಔಟ್ಪುಟ್ ಮಾಡುತ್ತದೆ, ನಂತರ ನಮ್ಮ public API ಗೆ ಹೊಂದುವಂತೆ ಮರು-ಸ್ಕೇಲ್ ಮಾಡಿದ್ದೇವೆ. ನಮ್ಮ public API ಗಾಗಿ ನಿರೀಕ್ಷಿತ ವೇಗಗಳಿಗೆ ಲೇಟೆನ್ಸಿಗಳನ್ನು ಮರು-ಸ್ಕೇಲ್ ಮಾಡುವಾಗ, ಮೌಲ್ಯಮಾಪನ ರನ್ನಲ್ಲಿ ಸರಿಯಾಗಿ ಪಾಲಿಸಿದ್ದರೂ ಕೆಲವು ಅಂದಾಜು ಲೇಟೆನ್ಸಿಗಳು 2h ಮತ್ತು 6h ಗಂಟೆಗಳ ಸಮಯ ಮಿತಿಗಳನ್ನು ಮೀರಿದಂತೆ ಕಾಣುತ್ತವೆ. ಸಮಯ-ಸೂಕ್ಷ್ಮ ಕೆಲಸಕ್ಕೆ ವೇಗ ಹೆಚ್ಚಿಸಲು, API ನಲ್ಲಿ priority processing ಮತ್ತು Codex ನಲ್ಲಿ fast mode ನೀಡುತ್ತೇವೆ.
4. ವರದಿ ಮಾಡಿದ ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳು, ಲೇಟೆನ್ಸಿ ಅಥವಾ ವೆಚ್ಚವಿಲ್ಲದ ಮಾಡೆಲ್ಗಳನ್ನು ಅಡ್ಡ ಚುಕ್ಕೆ ರೇಖೆಗಳಾಗಿ ಪ್ಲಾಟ್ ಮಾಡಲಾಗಿದೆ.

