ಸಾರಾಂಶ
ಸಮಸ್ಯೆ
ದುರ್ಬಲತೆಗಳನ್ನು ಕಂಡುಹಿಡಿಯಲು ಮತ್ತು ನಮ್ಮ ಮಾಡೆಲ್ಗಳ ದೃಢತೆಯನ್ನು ಸುಧಾರಿಸಲು ರೆಡ್ ಟೀಮಿಂಗ್ ಅಗತ್ಯವಾಗಿದೆ. ಆದರೆ, ಪ್ರಸ್ತುತ ವಿಧಾನಗಳನ್ನು ವಿಸ್ತರಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತಿಲ್ಲ; ಇದರಿಂದ ಅಡಚಣೆ ಉಂಟಾಗುತ್ತದೆ.
ಸಾಮಾನ್ಯವಾಗಿ ಬಳಸುವ ದೃಢತೆ ಮೌಲ್ಯಮಾಪನಗಳು ಈಗಾಗಲೇ ನಮ್ಮ ಇತ್ತೀಚಿನ ಮಾಡೆಲ್ಗಳಿಂದ ಸಂಪೂರ್ಣವಾಗಿ ಪರಿಹರಿಸಲ್ಪಟ್ಟಿವೆ.
ಮಾಡೆಲ್ ಸಾಮರ್ಥ್ಯಗಳ ಜೊತೆಗೆ ಸುರಕ್ಷತೆ ಮತ್ತು ಅಲೈನ್ಮೆಂಟ್ ಕೂಡ ವಿಸ್ತರಿಸಲು ನೆರವಾಗುವ ವಿಧಾನಗಳನ್ನು ನಾವು ಅಭಿವೃದ್ಧಿಪಡಿಸಬೇಕು.
ನಾವು ಮಾಡಿದ್ದು
ವ್ಯಾಪಕ ನಿಯೋಜನೆಗೂ ಮುನ್ನ ದುರ್ಬಲತೆಗಳನ್ನು ಸರಿಪಡಿಸಲು ಅವುಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವ ನಮ್ಮ ಸಾಮರ್ಥ್ಯವನ್ನು ವಿಸ್ತರಿಸುವ ಸ್ವಯಂಚಾಲಿತ ರೆಡ್ ಟೀಮಿಂಗ್ ಮಾಡೆಲ್ ಆದ GPT‑Red ಅನ್ನು ನಾವು ತರಬೇತಿಗೊಳಿಸಿದ್ದೇವೆ.
GPT‑Red ಬಲವಾದ ರೆಡ್ ಟೀಮಿಂಗ್ ತಜ್ಞ, ಮತ್ತು ನಮ್ಮ ಹಿಂದಿನ ಮಾಡೆಲ್ಗಳು ಅದರ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ದಾಳಿಗಳಿಗೆ ಬಹಳ ದುರ್ಬಲವಾಗಿವೆ.
GPT‑5.6 ಅನ್ನು ವೈರಿ ತರಬೇತಿಗೊಳಿಸಲು ನಾವು GPT‑Red ಅನ್ನು ಬಳಸುತ್ತೇವೆ; ಇದರಿಂದ ಅದು ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ಗಳಿಗೆ ಬಹಳ ಹೆಚ್ಚು ದೃಢವಾಗುತ್ತದೆ.
ಮಾನವ ಮತ್ತು ಮೂರನೇ-ಪಕ್ಷದ ರೆಡ್ ಟೀಮಿಂಗ್, ಪದರಿತ ಸುರಕ್ಷಾ ಕ್ರಮಗಳು ಮತ್ತು ರಿಯಲ್-ಟೈಮ್ ಮೇಲ್ವಿಚಾರಣೆಯ ಜೊತೆಗೆ ಈ ವಿಧಾನವನ್ನು ನಾವು ಮುಂದುವರಿಸಿ ವಿಸ್ತರಿಸುತ್ತೇವೆ.
AI ವ್ಯವಸ್ಥೆಗಳು ಬ್ರೌಸರ್ಗಳು, ಸಂಪರ್ಕಿತ ಆ್ಯಪ್ಗಳು, ಸ್ಥಳೀಯ ಫೈಲ್ಗಳು ಮತ್ತು ಇತರ ಟೂಲ್ಗಳ ಮೂಲಕ ಸಾಮಾನ್ಯವಾಗಿ ಮೂರನೇ-ಪಕ್ಷದ ಡೇಟಾವನ್ನು ಎದುರಿಸುತ್ತವೆ. ನೈಜ ಜಗತ್ತಿನ ಕಾರ್ಯಗಳನ್ನು ನಿರ್ವಹಿಸಲು ಈ ಸೌಲಭ್ಯಗಳು ಅಗತ್ಯ, ಆದರೆ ಅವು ದುರುದ್ದೇಶಪೂರಿತ ಪಾತ್ರಧಾರಿಗಳಿಗೆ ಮಾಡೆಲ್ ವರ್ತನೆಯನ್ನು ಪ್ರಭಾವಿಸಲು ಹೆಚ್ಚು ಅವಕಾಶಗಳನ್ನೂ ಸೃಷ್ಟಿಸುತ್ತವೆ. ಉದಾಹರಣೆಗೆ, ಸಂವೇದನಾಶೀಲ ಡೇಟಾವನ್ನು ಬಾಹ್ಯ ಸರ್ವರ್ಗೆ ಅಪ್ಲೋಡ್ ಮಾಡುವಂತೆ ಮಾಡೆಲ್ ಅನ್ನು ಮೋಸಗೊಳಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಿದ ಜಾಗರೂಕವಾಗಿ ರಚಿಸಲಾದ ಸೂಚನೆಯನ್ನು ಮೂರನೇ ಪಕ್ಷವು ಇಮೇಲ್, ವೆಬ್ಪುಟ, ಟೂಲ್ ಪ್ರತಿಕ್ರಿಯೆ ಅಥವಾ ಕೋಡ್ ರಿಪೊಸಿಟರಿಯಲ್ಲಿ ಸೇರಿಸಬಹುದು.
ಮಾನವ ರೆಡ್ ಟೀಮಿಂಗ್ ನಮ್ಮ ಸುರಕ್ಷತಾ ಕೆಲಸದ ಮಹತ್ವದ ಭಾಗವಾಗಿದ್ದು, ನಿಯೋಜನೆಗೂ ಮುನ್ನ ಈ ದುರ್ಬಲತೆಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಮತ್ತು ಸರಿಯಾದ ಸುರಕ್ಷಾ ಕ್ರಮಗಳನ್ನು ಜಾರಿಗೆ ತರಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಆದರೆ ಮಾನವ ರೆಡ್ ಟೀಮಿಂಗ್ ಮಾತ್ರವನ್ನು ವಿಸ್ತರಿಸುವುದು ಕಷ್ಟ. ಈ ಅಭ್ಯಾಸಗಳನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ ನಡೆಸುವುದು ಸಮಯವಹಿಸುತ್ತದೆ; ಇದರಿಂದ ಹೊಸ ವೈಫಲ್ಯ ವಿಧಾನಗಳನ್ನು ನಾವು ಎಷ್ಟು ಬೇಗ ಗುರುತಿಸಿ ಬಲವಾದ ಸುರಕ್ಷಾ ಕ್ರಮಗಳಲ್ಲಿ ಸೇರಿಸಬಹುದು ಎಂಬುದು ಸೀಮಿತವಾಗುತ್ತದೆ. ಇನ್ನೂ ಮುಂದೆ, ಈ ಅಭ್ಯಾಸಗಳು ಯಶಸ್ವಿ ದಾಳಿಗಳ ಮೌಲ್ಯಯುತ ಉದಾಹರಣೆಗಳನ್ನು ನೀಡಿದರೂ, ತರಬೇತಿಯ ಮೂಲಕ ಮಾಡೆಲ್ ದೃಢತೆಯನ್ನು ಸುಧಾರಿಸಲು ಬೇಕಾದ ವೈರಿ ಡೇಟಾದ ಪ್ರಮಾಣ ಮತ್ತು ವೈವಿಧ್ಯವನ್ನು ಅವು ಸೃಷ್ಟಿಸಲಾರವು.
ಹೆಚ್ಚುತ್ತಾ ಹೋಗುತ್ತಿರುವ ಸಾಮರ್ಥ್ಯವುಳ್ಳ ಮಾಡೆಲ್ಗಳ ಜೊತೆಗೇ ಸಾಗಲು ರೆಡ್ ಟೀಮಿಂಗ್ ಕೂಡ ವಿಸ್ತರಿಸಬೇಕಾಗಿದೆ. ಈ ಉದ್ದೇಶಕ್ಕಾಗಿ, ನಿಯೋಜನೆಗೂ ಮುನ್ನ ದುರ್ಬಲತೆಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವ ಮತ್ತು ಮಾಡೆಲ್ ತರಬೇತಿಯ ವೇಳೆ ದೃಢತೆಯನ್ನು ಸುಧಾರಿಸಲು ದಾಳಿಗಳನ್ನು ಸೃಷ್ಟಿಸುವ ಸ್ವಯಂಚಾಲಿತ, ಆಂತರಿಕ ಬಳಕೆಗೆ ಮಾತ್ರವಾದ ರೆಡ್ ಟೀಮಿಂಗ್ ಮಾಡೆಲ್ಗಳನ್ನು ನಾವು ತರಬೇತಿಗೊಳಿಸುತ್ತಿದ್ದೇವೆ. ಸ್ವಯಂಚಾಲಿತ ರೆಡ್ ಟೀಮಿಂಗ್ ಸುರಕ್ಷತೆಗೆ ಮಹತ್ವದ ಸ್ವ-ಸುಧಾರಣೆಯ ರೂಪವನ್ನು ತೆರೆದಿಡುತ್ತದೆ ಎಂದು ನಾವು ನಂಬುತ್ತೇವೆ: ಭವಿಷ್ಯದ ಮಾಡೆಲ್ಗಳನ್ನು ಹೆಚ್ಚು ಸುರಕ್ಷಿತಗೊಳಿಸಲು ಇಂದಿನ ಮಾಡೆಲ್ಗಳನ್ನು ನೇರವಾಗಿ ಬಳಸುವುದು.
GPT‑Red ಈ ಪ್ರಯತ್ನಗಳ ಪರಾಕಾಷ್ಠೆ ಮತ್ತು ನಮ್ಮ ಇಂದಿನ ಅತ್ಯುತ್ತಮ ಸ್ವಯಂಚಾಲಿತ ಸುರಕ್ಷತಾ ರೆಡ್ ಟೀಮಿಂಗ್ ಮಾಡೆಲ್ ಆಗಿದೆ. ಮಾನವ ರೆಡ್ ಟೀಮಿಂಗ್ ತಜ್ಞರು ದಾಳಿಗಳನ್ನು ರಚಿಸುವ ರೀತಿಯಂತೆಯೇ, ಈ ಮಾಡೆಲ್ ಒಂದು ಪ್ರಾಂಪ್ಟ್ ಕಳುಹಿಸಿ, GPT ಮಾಡೆಲ್ಗಳು ಅದಕ್ಕೆ ಹೇಗೆ ಪ್ರತಿಕ್ರಿಯಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ವೀಕ್ಷಿಸಿ, ಪುನರಾವರ್ತಿಸುವ ಮೂಲಕ ಗುರಿಯತ್ತ ಕೆಲಸ ಮಾಡುತ್ತದೆ. OpenAI ಯಲ್ಲಿನ ನಮ್ಮ ಕೆಲವು ಅತಿದೊಡ್ಡ ಪೋಸ್ಟ್-ಟ್ರೇನಿಂಗ್ ರನ್ಗಳ ಕಂಪ್ಯೂಟ್ ಮಟ್ಟದಲ್ಲಿ ನಾವು GPT‑Red ಅನ್ನು ತರಬೇತಿಗೊಳಿಸಿದೆವು. ಇದು ಸುರಕ್ಷತೆಯನ್ನು ಸುಧಾರಿಸುವುದಕ್ಕಷ್ಟೇ ಮೀಸಲಾದ ಅಪೂರ್ವ ಪ್ರಮಾಣದ ಕಂಪ್ಯೂಟ್ ಆಗಿದೆ.
ನಮ್ಮ ಉತ್ಪಾದನಾ ಮಾಡೆಲ್ಗಳ ತರಬೇತಿ ಪ್ರಕ್ರಿಯೆಯಲ್ಲಿ GPT‑Red ಅನ್ನು ನಾವು ನೇರವಾಗಿ ಸೇರಿಸುತ್ತೇವೆ. ಇದರ ಫಲವಾಗಿ, GPT‑5.6 Sol ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ಗಳಿಗೆ ಇದುವರೆಗೆ ನಮ್ಮ ಅತ್ಯಂತ ದೃಢವಾದ ಮಾಡೆಲ್ ಆಗಿದೆ; ಕೇವಲ ನಾಲ್ಕು ತಿಂಗಳು ಹಿಂದಿನ ನಮ್ಮ ಅತ್ಯುತ್ತಮ ಉತ್ಪಾದನಾ ಮಾಡೆಲ್ಗೆ ಹೋಲಿಸಿದರೆ, ನಮ್ಮ ಅತ್ಯಂತ ಕಠಿಣ ನೇರ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ ಇದು 6 ಪಟ್ಟು ಕಡಿಮೆ ವೈಫಲ್ಯಗಳನ್ನು ಸಾಧಿಸಿದೆ. ನಾವು ಇನ್ನಷ್ಟು ಬಲವಾದ ರೆಡ್ ಟೀಮಿಂಗ್ ತಜ್ಞರನ್ನು ತರಬೇತಿಗೊಳಿಸುತ್ತಿರುವುದರಿಂದ, ನಮ್ಮ ವಿಧಾನದ ವಿಸ್ತರಣಾಶೀಲತೆ ಭವಿಷ್ಯದಲ್ಲಿ ಇನ್ನೂ ಬಲವಾದ ಫಲಿತಾಂಶಗಳ ಬಗ್ಗೆ ನಮ್ಮನ್ನು ಉತ್ಸಾಹಗೊಳಿಸುತ್ತದೆ.
GPT‑Red ಅನ್ನು ಸೆಲ್ಫ್-ಪ್ಲೇ ರೀಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಬಳಸಿ ತರಬೇತಿಗೊಳಿಸಲಾಗಿದೆ; ಇದರಲ್ಲಿ ಮಾಡೆಲ್ ಮತ್ತು ವೈವಿಧ್ಯಮಯ ರಕ್ಷಕ LLMಗಳ ಸಂಕಲನವನ್ನು ವ್ಯಾಪಕ ರೆಡ್ ಟೀಮಿಂಗ್ ಸಂದರ್ಭಗಳಲ್ಲಿ ಒಂದೇ ಸಮಯದಲ್ಲಿ ತರಬೇತಿಗೊಳಿಸಲಾಗುತ್ತದೆ. ಯಶಸ್ವಿ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ನಂತಹ ಮಾನ್ಯ ವೈಫಲ್ಯವನ್ನು ಹೊರತೆಗೆದರೆ GPT‑Red ಗೆ ಬಹುಮಾನ ಸಿಗುತ್ತದೆ; ರಕ್ಷಕ ಮಾಡೆಲ್ಗಳು ದಾಳಿಯನ್ನು ತಡೆದು ತಮ್ಮ ಮೂಲ ಕಾರ್ಯಗಳನ್ನು ಪೂರ್ಣಗೊಳಿಸಿದರೆ ಅವುಗಳಿಗೆ ಬಹುಮಾನ ಸಿಗುತ್ತದೆ. ರಕ್ಷಕರು ಹೆಚ್ಚು ದೃಢರಾಗುತ್ತಾ ಹೋದಂತೆ, GPT‑Red ಇನ್ನಷ್ಟು ಬಲವಾದ ಮತ್ತು ವೈವಿಧ್ಯಮಯ ದಾಳಿಗಳನ್ನು ಕಂಡುಹಿಡಿಯಬೇಕಾಗುತ್ತದೆ.
ಸೆಲ್ಫ್-ಪ್ಲೇ ತರಬೇತಿಗೆ ಬೆಂಬಲವಾಗಿ, ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ಗಳನ್ನು ಸೇರಿಸಬಹುದಾದ ವಾಸ್ತವಿಕ ಸಂದರ್ಭಗಳ ವಿಸ್ತೃತ ಸಮೂಹವನ್ನು ನಾವು ನಿರ್ಮಿಸುತ್ತೇವೆ. ಪ್ರತಿ ಪರಿಸರದಲ್ಲೂ GPT‑Red ಏನು ನಿಯಂತ್ರಿಸಬಹುದು ಮತ್ತು ಯಾವುದು ಯಶಸ್ವಿ ದಾಳಿ ಎಂದು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ನಿರ್ದಿಷ್ಟಪಡಿಸುವ ಬೆದರಿಕೆ ಮಾಡೆಲ್ ಇರುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, GPT‑Red ಸ್ಥಳೀಯ ಫೈಲ್ನ ಒಂದು ಭಾಗ, ವೆಬ್ಪುಟ ಬ್ಯಾನರ್, ಇಮೇಲ್ ಪಠ್ಯ ಅಥವಾ ಟೂಲ್ನ ಔಟ್ಪುಟ್ ಅನ್ನು ನಿಯಂತ್ರಿಸಬಹುದು.
ತರಬೇತಿಯ ಅಂತ್ಯಕ್ಕೆ, GPT‑Red ಅತ್ಯಂತ ಬಲವಾದ ದಾಳಿಕೋರವಾಗುತ್ತದೆ: GPT‑5.5 ವರೆಗೆ ಮತ್ತು ಅದನ್ನೂ ಒಳಗೊಂಡಂತೆ, ತನ್ನ ಎದುರು ನಿಲ್ಲಿಸಲಾದ ಬಹುತೇಕ ಎಲ್ಲ ಆಂತರಿಕ ಮತ್ತು ಉತ್ಪಾದನಾ ಮಾಡೆಲ್ಗಳನ್ನು ಇದು ಮುರಿಯಬಲ್ಲದು. GPT‑Red ತರಬೇತಿ ಪೂರ್ಣಗೊಳಿಸಿದ ನಂತರ, GPT‑5.6 ತರಬೇತಿಗಾಗಿ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ಗಳನ್ನು ಸೃಷ್ಟಿಸಲು ನಾವು ಅದನ್ನು ಬಳಸಿದೆವು; ಇದರ ಫಲವಾಗಿ ಆ ಮಾಡೆಲ್ GPT‑Red ದಾಳಿಗಳ ವಿರುದ್ಧ ಅತ್ಯಂತ ಪ್ರತಿರೋಧಕವಾಯಿತು.
ನಾವು ನಿಯೋಜಿಸುವ ಮಾಡೆಲ್ಗಳಿಂದ GPT‑Red ಅನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಇಡುತ್ತೇವೆ. ಇದರಿಂದ GPT‑Red ಗೆ ನಾವು ವಿಶೇಷವಾಗಿ ತರಬೇತಿಗೊಳಿಸುವ ದುರುದ್ದೇಶಪೂರಿತ ಸಾಮರ್ಥ್ಯಗಳು ವೈರಿ ಪಾತ್ರಧಾರಿಗಳ ಕೈಗೆ ಸಿಗದಂತೆ ಆಗುತ್ತದೆ, ಜೊತೆಗೆ ನಮ್ಮ ಉತ್ಪಾದನಾ ಮಾಡೆಲ್ಗಳಲ್ಲಿ ದೃಢತೆ ಬೆಳೆಸುತ್ತದೆ.
ತಾನು ತರಬೇತಿ ಪಡೆದ ರಕ್ಷಕ ಮಾಡೆಲ್ಗಳ ಸಮೂಹ ಮತ್ತು ರೆಡ್ ಟೀಮಿಂಗ್ ಸಂದರ್ಭಗಳ ವಿರುದ್ಧ GPT‑Red ಅತ್ಯಂತ ಪರಿಣಾಮಕಾರಿಯಾಗಿದೆ. OpenAI ನಲ್ಲಿ ಸುರಕ್ಷತೆಗೆ ವ್ಯಾಪಕವಾಗಿ ನೆರವಾಗುವ ಸಾಮಾನ್ಯ-ಉದ್ದೇಶದ ರೆಡ್ ಟೀಮಿಂಗ್ ಏಜೆಂಟ್ ಆಗಿ ಈ ಮಾಡೆಲ್ ಉಪಯುಕ್ತವಿದೆಯೇ ಎಂಬುದನ್ನೂ ನಾವು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತೇವೆ. ಅದಕ್ಕಾಗಿ, ಹೊಸ ಸುರಕ್ಷತಾ ಪರಿಸರಗಳು ಮತ್ತು ಗುರಿ ಮಾಡೆಲ್ಗಳಲ್ಲಿ GPT‑Red ನ ಪರಿಣಾಮಕಾರಿತ್ವವನ್ನು ನಾವು ಪರೀಕ್ಷಿಸುತ್ತೇವೆ.
ಹೊಸ ರೆಡ್ ಟೀಮಿಂಗ್ ಸಂದರ್ಭಗಳಿಗೆ ಸಾಮಾನ್ಯೀಕರಿಸುವ GPT‑Red ನ ಸಾಮರ್ಥ್ಯವನ್ನು ಮೊದಲು ನಾವು Dziemian et al. (2025) ಅವರ ಪರೋಕ್ಷ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಅರೀನಾದ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಪ್ರತಿರೂಪಿತ ಆವೃತ್ತಿಯನ್ನು ಬಳಸಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತೇವೆ. ಈ ಸವಾಲಿನಲ್ಲಿ, ಪೂರ್ವನಿರ್ದಿಷ್ಟ ಪರಿಸರಗಳ ಸಮೂಹದಲ್ಲಿ GPT‑5.1 ವಿರುದ್ಧ ಮಾನವ ರೆಡ್ ಟೀಮಿಂಗ್ ತಜ್ಞರು ಮತ್ತು GPT‑Red ಸ್ವತಂತ್ರವಾಗಿ ದಾಳಿಗಳನ್ನು ಪ್ರಸ್ತಾಪಿಸಿದರು. ಈ ರೆಡ್ ಟೀಮಿಂಗ್ ಸಂದರ್ಭಗಳು ಮತ್ತು ಗುರಿಗಳು GPT‑Red ತರಬೇತಿಗೆ ಬಳಸಿದವುಗಳಿಂದ ಭಿನ್ನವಾಗಿವೆ. GPT‑Red ಗಣನೀಯವಾಗಿ ಹೆಚ್ಚಿನ ದಾಳಿ ಯಶಸ್ಸಿನ ದರಗಳನ್ನು ಸಾಧಿಸುತ್ತದೆ; ಮಾನವರಿಗೆ 13% ಗೆ ಹೋಲಿಸಿದರೆ 84% ಸಂದರ್ಭಗಳಲ್ಲಿ ಯಶಸ್ಸು ಕಂಡುಕೊಳ್ಳುತ್ತದೆ.
ಸ್ವಯಂಚಾಲಿತ ರೆಡ್ ಟೀಮಿಂಗ್ ತಜ್ಞನಾಗಿ GPT‑Red ಅತ್ಯುತ್ತಮವಾಗಿದೆ. ಆಂತರಿಕ ಮಿರರ್ ಬಳಸಿ Dziemian et al. (2025) ಅವರ ಪರೋಕ್ಷ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಅರೀನಾದಲ್ಲಿ, ಮಾನವ ರೆಡ್ ಟೀಮಿಂಗ್ ತಜ್ಞರಿಗಿಂತ ಬಹಳ ಹೆಚ್ಚಿನ ಸಂದರ್ಭಗಳಲ್ಲಿ GPT‑5.1 ವಿರುದ್ಧ ಯಶಸ್ವಿ ದಾಳಿಗಳನ್ನು GPT‑Red ಸೃಷ್ಟಿಸಬಲ್ಲದು.
ರೆಡ್-ಟೀಮರ್ನ ಅಂತಿಮ ಪರೀಕ್ಷೆಯೆಂದರೆ, ವ್ಯವಸ್ಥೆಯ ಆಧಾರವಾಗಿರುವ ಮಾದರಿ ಮತ್ತು ಸರಂಜಾಮು ವಿನ್ಯಾಸದ ಅಪೂರ್ಣ ಜ್ಞಾನದೊಂದಿಗೆ ನೈಜ-ಪ್ರಪಂಚದ ಏಜೆಂಟ್ ವ್ಯವಸ್ಥೆಗಳ ವಿರುದ್ಧ ಉದ್ದೇಶಿತ ದುರುದ್ದೇಶಪೂರಿತ ಗುರಿಗಳನ್ನು ಸಾಧಿಸುವ ಸಾಮರ್ಥ್ಯ. ಈ ಸನ್ನಿವೇಶದಲ್ಲಿ ನಮ್ಮ ಮೊದಲ ಪ್ರಯೋಗವು ಆಂಡನ್ ಲ್ಯಾಬ್ಸ್ ನಿರ್ಮಿಸಿದ ಓಪನ್ಎಐ ಕಚೇರಿಯಲ್ಲಿ ( ಪ್ರಾಜೆಕ್ಟ್ ವೆಂಡ್ನಂತೆಯೇ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)) ಎಐ-ಚಾಲಿತ ವೆಂಡಿಂಗ್ ಯಂತ್ರದೊಂದಿಗೆ ಜಿಪಿಟಿ-ರೆಡ್ ಅನ್ನು ಸ್ಪರ್ಧಿಸಿತು. ನಾವು GPT‑Red ಗೆ ವ್ಯವಸ್ಥೆಯ ವಿವರಣೆಯನ್ನು ನೀಡಿದ್ದೇವೆ ಮತ್ತು ದಾಳಿಗಳನ್ನು ಕಳುಹಿಸುವ ಮತ್ತು ನೈಜ ಪ್ರಪಂಚದ ನಿಯೋಜನೆಯನ್ನು ನಿಕಟವಾಗಿ ಪ್ರತಿಬಿಂಬಿಸುವ ಸಿಮ್ಯುಲೇಟೆಡ್ ಏಜೆಂಟ್ನಿಂದ ಟೂಲ್ ಕರೆಗಳನ್ನು ಗಮನಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ನೀಡಿದ್ದೇವೆ. ದಾಳಿಗಳ ಬಗ್ಗೆ ಪದೇ ಪದೇ ಮಾತನಾಡಿದ ನಂತರ, GPT‑Red ಉತ್ಪಾದನಾ ಏಜೆಂಟ್ ವಿರುದ್ಧ ತನ್ನ ದಾಳಿಯನ್ನು ನಿಯೋಜಿಸಿತು, ಅದರ ಮೂರು ದುರುದ್ದೇಶಪೂರಿತ ಉದ್ದೇಶಗಳನ್ನು ಸಾಧಿಸಿತು:
- ಸ್ಟಾಕ್ನಲ್ಲಿರುವ ದುಬಾರಿ ವಸ್ತುವಿನ ಬೆಲೆಯನ್ನು ಕನಿಷ್ಠ ಅನುಮತಿಸಲಾದ ಬೆಲೆ $0.50 ಗೆ ಬದಲಾಯಿಸಿ;
- $100+ ಬೆಲೆಯ ಹೊಸ ಐಟಂ ಅನ್ನು ಆರ್ಡರ್ ಮಾಡಿ ಮತ್ತು ಅದನ್ನು $0.50 ಗೆ ನೀಡಿ; ಮತ್ತು
- ಇನ್ನೊಬ್ಬ ಗ್ರಾಹಕರ ಆರ್ಡರ್ ಅನ್ನು ರದ್ದುಗೊಳಿಸಿ.
ಈ ದುರ್ಬಲತೆಗಳನ್ನು ನಾವು ಬಹಿರಂಗಪಡಿಸಿದ್ದೇವೆ ಮತ್ತು ಹೊಸ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳನ್ನು ಸಕ್ರಿಯವಾಗಿ ಪರೀಕ್ಷಿಸಲಾಗುತ್ತಿದೆ.
ವೆಂಡಿಂಗ್ ಮೆಷಿನ್ ಅನ್ನು ನಿರ್ವಹಿಸುವ Vendy ಎಂಬ ಲೈವ್ ಸ್ವಾಯತ್ತ ಏಜೆಂಟ್ ಅನ್ನು GPT‑Red ಮುರಿಯಲು ಸಾಧ್ಯವಾಯಿತು. ಮೊದಲು ಸಿಮ್ಯುಲೇಶನ್ನಲ್ಲಿ ಪರೀಕ್ಷಿಸಿ, ನಂತರ ದಾಳಿಗಳನ್ನು ಲೈವ್ ಏಜೆಂಟ್ಗೆ ವರ್ಗಾಯಿಸುವ ಮೂಲಕ, ದುಬಾರಿ ವಸ್ತುಗಳನ್ನು ಅಗ್ಗವಾಗಿಸಲು ಮತ್ತು ಇತರ ಗ್ರಾಹಕರ ಆರ್ಡರ್ಗಳನ್ನು ರದ್ದುಮಾಡಲು ಉತ್ಪಾದನಾ ಏಜೆಂಟ್ ಅನ್ನು GPT‑Red ಕಾರಣವಾಗಿಸಿತು.
10 ಹೋಲ್ಡ್-ಔಟ್ ಡೇಟಾ-ಎಕ್ಸ್ಫಿಲ್ಟ್ರೇಶನ್ ಸನ್ನಿವೇಶಗಳ ಸೂಟ್ನಲ್ಲಿ ಕೋಡೆಕ್ಸ್ CLI ಏಜೆಂಟ್ (GPT‑5.4 ಮಿನಿ ಆಧರಿಸಿ) ಮೇಲೆ ದಾಳಿ ಮಾಡಲು ನಾವು GPT‑Red ಅನ್ನು ಸಹ ಬಳಸುತ್ತೇವೆ. ರೆಡ್-ಟೀಮಿಂಗ್ನಲ್ಲಿ ನಮ್ಮ ತರಬೇತಿ ಕಾರ್ಯವಿಧಾನದ ಪರಿಣಾಮವನ್ನು ಅಧ್ಯಯನ ಮಾಡಲು ನಾವು ಮಾದರಿಯನ್ನು GPT‑5.5 ಬೇಸ್ಲೈನ್ಗೆ ಹೋಲಿಸುತ್ತೇವೆ. GPT‑Red ಎರಡೂ ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿದೆ, ಏಕೆಂದರೆ ಇದು ಏಜೆಂಟ್ ಹೆಚ್ಚಿನ ಸನ್ನಿವೇಶಗಳಲ್ಲಿ ಸೂಕ್ಷ್ಮ ಡೇಟಾವನ್ನು ಯಶಸ್ವಿಯಾಗಿ ಹೊರಹಾಕುವಂತೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಹೆಚ್ಚು ಟೋಕನ್ ದಕ್ಷತೆಯನ್ನು ಹೊಂದಿದೆ.
ಲೈವ್ codex ಏಜೆಂಟ್ಗಳನ್ನು ಮುರಿಯುವಲ್ಲಿ GPT‑Red ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿ ಮತ್ತು ದಕ್ಷವಾಗಿದೆ. 10 ಡೇಟಾ ಎಕ್ಸ್ಫಿಲ್ಟ್ರೇಶನ್ ಕಾರ್ಯಗಳ ಕಸ್ಟಮ್ ಸಮೂಹದಲ್ಲಿ GPT‑5.4 Mini ಬೆಂಬಲಿತ codex ಏಜೆಂಟ್ ವಿರುದ್ಧ ನಾವು ಪರೀಕ್ಷಿಸುತ್ತೇವೆ.
ನಮ್ಮ ಮಾದರಿಗಳ ದೃಢತೆಯನ್ನು ಸುಧಾರಿಸುವುದು ಜಿಪಿಟಿ-ರೆಡ್ನ ಅಂತಿಮ ಗುರಿಯಾಗಿದೆ. ಕಳೆದ ಆರು ತಿಂಗಳುಗಳಲ್ಲಿ, ನಾವು ಹೆಚ್ಚುತ್ತಿರುವ ಕಂಪ್ಯೂಟ್ನೊಂದಿಗೆ ಹಂತಹಂತವಾಗಿ ಬಲವಾದ ರೆಡ್-ಟೀಮಿಂಗ್ ಮಾದರಿಗಳಿಗೆ (GPT‑Red ಗೆ ಪೂರ್ವಗಾಮಿಗಳು) ತರಬೇತಿ ನೀಡಿದ್ದೇವೆ ಮತ್ತು GPT‑5.3 ರಿಂದ ಪ್ರತಿ ಸತತ ಉತ್ಪಾದನಾ ಮಾದರಿಯ ತರಬೇತಿಯಲ್ಲಿ ಈ ಮಾದರಿಗಳನ್ನು ಬಳಸಿದ್ದೇವೆ. ಕಾಲಾನಂತರದಲ್ಲಿ, ಪ್ರತಿ ನಂತರದ GPT ಬಿಡುಗಡೆಯು ಹೆಚ್ಚು ಬಲಿಷ್ಠವಾಗಿದೆ.
ಒಂದು ಉದಾಹರಣೆಯಾಗಿ, GPT‑Red ನ ಆರಂಭಿಕ ಆವೃತ್ತಿಯು "ನಕಲಿ ಚೈನ್-ಆಫ್-ಥಾಟ್" ದಾಳಿಗಳು ಎಂದು ಕರೆಯಲ್ಪಡುವ ನೇರ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ದಾಳಿಗಳ ಒಂದು ಹೊಸ ವರ್ಗವನ್ನು ಕಂಡುಹಿಡಿದಿದೆ. ಈ ದಾಳಿಗಳು GPT‑5.1 ನಲ್ಲಿ 95% ಕ್ಕಿಂತ ಹೆಚ್ಚಿನ ಯಶಸ್ಸಿನ ಪ್ರಮಾಣವನ್ನು ಸಾಧಿಸಿದವು ಆದರೆ ಈಗ GPT‑5.6 Sol ಗೆ 10% ಕ್ಕಿಂತ ಕಡಿಮೆ ಇವೆ. ಅದೇ ರೀತಿ, ಡೆವಲಪರ್ ಪರಿಕರಗಳು ಮತ್ತು ಬ್ರೌಸಿಂಗ್ನಲ್ಲಿ ದಾಳಿಗಳನ್ನು ಗುರಿಯಾಗಿಸುವ ನಮ್ಮ ಹಲವಾರು ಪರೋಕ್ಷ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಮಾನದಂಡಗಳನ್ನು ನಮ್ಮ ಇತ್ತೀಚಿನ ಮಾದರಿ (>97% ನಿಖರತೆ) ಮೂಲಕ ಸ್ಯಾಚುರೇಟೆಡ್ ಮಾಡಲಾಗಿದೆ.
ಜಿಪಿಟಿ-ರೆಡ್ನ ದೃಢತೆಯೂ ಗಣನೀಯವಾಗಿ ಸುಧಾರಿಸಿದೆ. ವ್ಯಾಪಕವಾದ ದೃಢತೆಯ ಪರಿಸರದಲ್ಲಿ, GPT‑Red ನ ದಾಳಿಯ ಯಶಸ್ಸಿನ ಪ್ರಮಾಣವು ಕಾಲಾನಂತರದಲ್ಲಿ ಏಕತಾನತೆಯಿಂದ ಕುಸಿದಿದೆ. ನಮ್ಮ ಇತ್ತೀಚಿನ ಮಾದರಿ ಬಿಡುಗಡೆಯೊಂದಿಗೆ, GPT‑5.6 Sol, GPT‑Red ನ ನೇರ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ಗಳಲ್ಲಿ ಕೇವಲ 0.05% ರಷ್ಟು ಮಾತ್ರ ವಿಫಲಗೊಳ್ಳುತ್ತದೆ.
ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ಗಳಿಗಾಗಿ ಸೆಲ್ಫ್-ಪ್ಲೇ ತರಬೇತಿಯನ್ನು ನಾವು ವಿಸ್ತರಿಸುತ್ತಿರುವಾಗ, ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಮಾಡೆಲ್ಗಳನ್ನು ಮುರಿಯಬಲ್ಲ ಹೊಸ ಬೆದರಿಕೆಗಳನ್ನು ಕಂಡುಕೊಂಡಿದ್ದೇವೆ. ಆದರೂ, ನಮ್ಮ ವಿಸ್ತರಣೆ ಈ ದಾಳಿಗಳ ವಿರುದ್ಧದ ದೃಢತೆಯನ್ನು ಕೂಡ ಗಣನೀಯವಾಗಿ ಸುಧಾರಿಸಿದೆ. ಹೆಲ್ಡ್-ಔಟ್ ಪರಿಸರಗಳಲ್ಲಿ GPT‑Red ಮಾಡಿದ ಎಲ್ಲ ಪ್ರಯತ್ನಗಳ ಸರಾಸರಿ ಯಶಸ್ಸಾಗಿ ದಾಳಿ ಯಶಸ್ಸಿನ ದರವನ್ನು ಲೆಕ್ಕಿಸಲಾಗುತ್ತದೆ.
ಹೆಚ್ಚಿನ ವಿನಂತಿಗಳನ್ನು ನಿರಾಕರಿಸುವ ಮೂಲಕ ಅಥವಾ ಕಡಿಮೆ ಸಾಮರ್ಥ್ಯ ಹೊಂದುವ ಮೂಲಕ ಒಂದು ಮಾದರಿಯು ಸುರಕ್ಷಿತವೆಂದು ಕಾಣಿಸಬಹುದು. ಕಡಿಮೆ ಮಾಡುವ ಮಾದರಿಯು ಸ್ವಾಭಾವಿಕವಾಗಿ ದಾಳಿ ಮಾಡಲು ಕಷ್ಟ, ಆದರೆ ಅದು ಉಪಯುಕ್ತವಾದ ದೃಢತೆ ಅಲ್ಲ.
ನಾವು ವಿನ್ಯಾಸಗೊಳಿಸುವ ಗುರಿ ಮೀರಿದ ನಿರಾಕರಣೆ ಕಾರ್ಯಗಳ ಜೊತೆಗೆ ಸಾಮಾನ್ಯ ಗಡಿನಾಡು ಸಾಮರ್ಥ್ಯಗಳನ್ನು ನಾವು ಕೂಲಂಕಷವಾಗಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತೇವೆ. ಎಲ್ಲಾ ಸಾಮಾನ್ಯ ಸಾಮರ್ಥ್ಯಗಳು ಪರಿಣಾಮ ಬೀರದೆ ಉಳಿದಿವೆ ಎಂದು ನಾವು ಕಂಡುಕೊಂಡಿದ್ದೇವೆ, ಆದರೆ ದೃಢತೆಯನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಸುಧಾರಿಸುತ್ತೇವೆ. ಅನುಚಿತ ಉಪಕರಣ ಬಳಕೆ ಅಥವಾ ಪೂರ್ವನಿಯೋಜಿತವಾಗಿ ಕಾನೂನುಬದ್ಧ ವಿನಂತಿಗಳನ್ನು ನಿರಾಕರಿಸುವ ಬದಲು ದುರುದ್ದೇಶಪೂರಿತ ಸೂಚನೆಗಳಿಗೆ ಉತ್ತಮ ಪ್ರತಿರೋಧದಿಂದ ದೃಢತೆಯ ಲಾಭಗಳು ಬಂದಿವೆ ಎಂದು ಇದು ಸೂಚಿಸುತ್ತದೆ.
ನಮ್ಮ ಮುಂದಿನ ಪೀಳಿಗೆಯ ಮಾದರಿಗಳ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಸುಧಾರಿಸಲು AI ಏಜೆಂಟ್ಗಳನ್ನು ಈಗಾಗಲೇ ಬಳಸಲಾಗುತ್ತಿದೆ. ಜಿಪಿಟಿ-ರೆಡ್ನೊಂದಿಗೆ ನಾವು ಸುರಕ್ಷತೆಗಾಗಿ ಇದೇ ರೀತಿಯ ಫ್ಲೈವೀಲ್ ಅನ್ನು ಅನ್ಲಾಕ್ ಮಾಡಲು ಪ್ರಾರಂಭಿಸಿದ್ದೇವೆ ಎಂದು ನಾವು ನಂಬುತ್ತೇವೆ, ಇಂದಿನ ಮಾದರಿಗಳನ್ನು ನಾಳೆಯ ಮಾದರಿಗಳನ್ನು ಹೆಚ್ಚು ದೃಢವಾಗಿ, ಜೋಡಿಸಿ ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿಸಲು ಬಳಸಬಹುದು. ಇಂದಿನ ಮಾದರಿಗಿಂತ ಬಲಿಷ್ಠವಾಗಿರುವ GPT‑Red ನ ಭವಿಷ್ಯದ ಆವೃತ್ತಿಗಳಿಗೆ ತರಬೇತಿ ನೀಡಲು, ಅಲ್ಗಾರಿದಮಿಕ್ ಸುಧಾರಣೆಗಳನ್ನು ಮಾಡುವಾಗ ನಾವು ಕಂಪ್ಯೂಟ್ ಮತ್ತು ಡೇಟಾವನ್ನು ಅಳೆಯುವುದನ್ನು ಮುಂದುವರಿಸುತ್ತೇವೆ. ಮತ್ತು ಪ್ರತಿಯಾಗಿ, ಈ ಮಾದರಿಗಳು ಭವಿಷ್ಯದ GPT ಬಿಡುಗಡೆಗಳನ್ನು ಸುರಕ್ಷಿತವಾಗಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತವೆ.
ಈ ವಾರದ ಕೊನೆಯಲ್ಲಿ ಹೆಚ್ಚಿನ ವಿವರಗಳೊಂದಿಗೆ ಪೂರ್ವ ಮುದ್ರಣವನ್ನು ಬಿಡುಗಡೆ ಮಾಡುತ್ತೇವೆ.


