GPT‑Red: దృఢత్వానికి స్వీయ-మెరుగుదలని తెరవడం
దృఢత్వాన్ని మెరుగుపరచడానికి బలమైన ఆటోమేటెడ్ భద్రతా రెడ్ టీమర్లకు శిక్షణ ఇవ్వడం.
సారాంశం
సమస్య
లోపాలను కనుగొని మా మోడళ్ల దృఢత్వాన్ని మెరుగుపరచడానికి రెడ్ టీమింగ్ అత్యవసరం. అయితే, ప్రస్తుత విధానాలు స్కేల్ చేయలేవు కాబట్టి అవి అడ్డంకిగా మారుతున్నాయి.
సాధారణంగా ఉపయోగించే దృఢత్వ మూల్యాంకనాలను మా తాజా మోడళ్లు ఇప్పటికే సంతృప్తిపరిచాయి.
మోడల్ సామర్థ్యాల వెంట భద్రత మరియు అలైన్మెంట్ కూడా స్కేల్ అయ్యేలా చేసే పద్ధతులను మేము అభివృద్ధి చేయాలి.
మేము చేసినది
విస్తృత డిప్లాయ్మెంట్కు ముందు లోపాలను కనుగొని సరిచేయడానికి మా సామర్థ్యాన్ని స్కేల్ చేసే ఆటోమేటెడ్ రెడ్ టీమింగ్ మోడల్ GPT‑Redకు మేము శిక్షణ ఇచ్చాము.
GPT‑Red బలమైన రెడ్ టీమర్; మా మునుపటి మోడళ్లు దాని ప్రాంప్ట్ ఇంజెక్షన్ దాడుల పట్ల అత్యంత బలహీనంగా ఉంటాయి.
GPT‑5.6కు ప్రతికూల శిక్షణ ఇవ్వడానికి GPT‑Redను ఉపయోగించి, ప్రాంప్ట్ ఇంజెక్షన్ల పట్ల దాన్ని మరింత దృఢంగా మారుస్తాము.
మానవ మరియు మూడవ పక్ష రెడ్ టీమింగ్, పొరల భద్రతా చర్యలు, రియల్-టైమ్ మానిటరింగ్తో పాటు ఈ విధానాన్ని మేము స్కేల్ చేస్తూనే ఉంటాము.
AI సిస్టమ్లు బ్రౌజర్లు, కనెక్టెడ్ యాప్లు, స్థానిక ఫైళ్లు మరియు ఇతర సాధనాల ద్వారా సాధారణంగా మూడవ పక్ష డేటాను ఎదుర్కొంటాయి. వాస్తవ ప్రపంచ పనులు చేయడానికి ఈ అవకాశాలు అవసరం; కానీ అవి హానికర వ్యక్తులు మోడల్ ప్రవర్తనను ప్రభావితం చేయడానికి మరిన్ని మార్గాలను కూడా సృష్టిస్తాయి. ఉదాహరణకు, సున్నితమైన డేటాను బాహ్య సర్వర్కు అప్లోడ్ చేయించేలా మోడల్ను మోసగించడానికి రూపొందించిన జాగ్రత్తగా రూపొందించిన సూచనను మూడవ పక్షం ఇమెయిల్, వెబ్పేజీ, సాధన ప్రతిస్పందన లేదా కోడ్ రిపోజిటరీలో చొప్పించవచ్చు.
మానవ రెడ్ టీమింగ్ మా భద్రతా పనిలో కీలక భాగం; డిప్లాయ్మెంట్కు ముందు ఈ లోపాలను వెలికితీయడంలో, సరైన భద్రతా చర్యలను అమలు చేయడంలో ఇది మాకు సహాయపడుతుంది. కానీ మానవ రెడ్ టీమింగ్ ఒక్కటే స్కేల్ చేయడం కష్టం. ఈ వ్యాయామాలను రూపకల్పన చేసి అమలు చేయడం ఎక్కువ సమయం తీసుకుంటుంది; దాంతో కొత్త వైఫల్య రీతులను ఎంత త్వరగా గుర్తించి బలమైన భద్రతా చర్యల్లో చేర్చగలమో పరిమితం అవుతుంది. ఇంకా, ఈ వ్యాయామాలు విజయవంతమైన దాడుల విలువైన ఉదాహరణలను అందించినా, శిక్షణ ద్వారా మోడల్ దృఢత్వాన్ని మెరుగుపరచడానికి అవసరమైన పరిమాణం మరియు వైవిధ్యంతో కూడిన ప్రతికూల డేటాను రూపొందించలేవు.
సామర్థ్యాలు పెరుగుతున్న మోడళ్ల వేగానికి సరిపోయేందుకు రెడ్ టీమింగ్ కూడా స్కేల్ కావాలి. ఈ లక్ష్యంతో, డిప్లాయ్మెంట్కు ముందు లోపాలను వెలికితీసే మరియు మోడల్ శిక్షణ సమయంలో దృఢత్వాన్ని మెరుగుపరచడానికి దాడులను రూపొందించే, ఆటోమేటెడ్ అంతర్గత-వినియోగ రెడ్ టీమింగ్ మోడళ్లకు మేము శిక్షణ ఇస్తున్నాము. ఆటోమేటెడ్ రెడ్ టీమింగ్ భద్రత కోసం కీలకమైన స్వీయ-మెరుగుదల రూపాన్ని తెరుస్తుందని మేము నమ్ముతున్నాము: నేటి మోడళ్లను ఉపయోగించి భవిష్యత్ మోడళ్లను నేరుగా మరింత సురక్షితంగా చేయడం.
GPT‑Red ఈ ప్రయత్నాల పరాకాష్ఠ, అలాగే ప్రస్తుతం మా అత్యుత్తమ ఆటోమేటెడ్ భద్రతా రెడ్ టీమింగ్ మోడల్. మానవ రెడ్ టీమర్లు దాడులను రూపొందించే విధానంలానే, ఈ మోడల్ ప్రాంప్ట్ను పంపడం, GPT మోడళ్లు దానికి ఎలా స్పందిస్తాయో గమనించడం, ఆపై పునరావృతంగా మెరుగుపరచడం ద్వారా లక్ష్యాన్ని సాధించేందుకు పనిచేస్తుంది. OpenAIలో మా అతిపెద్ద పోస్ట్-ట్రైనింగ్ రన్లలో కొన్నింటి కంప్యూట్ స్థాయిలో GPT‑Redకు శిక్షణ ఇచ్చాము—ఇది పూర్తిగా భద్రతను మెరుగుపరచడానికి అంకితం చేసిన అపూర్వమైన కంప్యూట్ పరిమాణం.
మా ప్రొడక్షన్ మోడళ్ల శిక్షణ ప్రక్రియలో GPT‑Redను మేము నేరుగా చేర్చుతాము. ఫలితంగా, GPT‑5.6 Sol ఇప్పటివరకు ప్రాంప్ట్ ఇంజెక్షన్ల పట్ల మా అత్యంత దృఢమైన మోడల్. కేవలం నాలుగు నెలల క్రితం మా ఉత్తమ ప్రొడక్షన్ మోడల్తో పోలిస్తే, మా అత్యంత కఠినమైన ప్రత్యక్ష ప్రాంప్ట్ ఇంజెక్షన్ బెంచ్మార్క్లో ఇది 6x తక్కువ వైఫల్యాలను సాధించింది. మేము ఇంకా బలమైన రెడ్ టీమర్లకు శిక్షణ ఇవ్వడం కొనసాగిస్తున్నందున, మా విధానం స్కేల్ కావడం భవిష్యత్తులో మరింత బలమైన ఫలితాలపై మాకు ఉత్సాహాన్ని ఇస్తోంది.
సెల్ఫ్-ప్లే రీఇన్ఫోర్స్మెంట్ లెర్నింగ్తో GPT‑Redకు శిక్షణ ఇస్తారు. ఇందులో మోడల్ను మరియు విభిన్న రక్షక LLMల సమాహారాన్ని, విస్తృత రెడ్ టీమింగ్ సన్నివేశాలపై ఒకేసారి శిక్షణ ఇస్తారు. విజయవంతమైన ప్రాంప్ట్ ఇంజెక్షన్లాంటి చెల్లుబాటు అయ్యే వైఫల్యాన్ని రాబట్టినందుకు GPT‑Redకు రివార్డ్ ఇస్తారు; రక్షక మోడళ్లకు మాత్రం దాడిని ఎదుర్కొని తమ అసలు పనులను పూర్తి చేసినందుకు రివార్డ్ ఇస్తారు. రక్షకాలు మరింత దృఢంగా మారే కొద్దీ, GPT‑Red ఇంకా బలమైన, విభిన్నమైన దాడులను కనుగొనాల్సి వస్తుంది.
సెల్ఫ్-ప్లే శిక్షణకు మద్దతుగా, ప్రాంప్ట్ ఇంజెక్షన్లను చొప్పించగల వాస్తవిక సన్నివేశాల విస్తృత సమాహారాన్ని మేము నిర్మిస్తాము. ప్రతి ఎన్విరాన్మెంట్లో GPT‑Red ఏమి నియంత్రించగలదు, ఏది విజయవంతమైన దాడిగా పరిగణించబడుతుంది అనే విషయాలను నిర్దేశించే ముప్పు మోడల్ ఉంటుంది. ఉదాహరణకు, GPT‑Red ఒక స్థానిక ఫైల్లోని భాగాన్ని, వెబ్పేజీ బ్యానర్ను, ఇమెయిల్ బాడీని లేదా సాధనం అవుట్పుట్ను నియంత్రించవచ్చు.
శిక్షణ ముగిసే సమయానికి GPT‑Red చాలా బలమైన దాడిదారుగా మారుతుంది: దాని ఎదుట నిలిపిన దాదాపు అన్ని మోడళ్లను, GPT‑5.5 వరకు ఉన్న అంతర్గత మరియు ప్రొడక్షన్ మోడళ్లను కూడా, అది భేదించగలదు. GPT‑Red శిక్షణ పూర్తయ్యాక, GPT‑5.6 శిక్షణ కోసం ప్రాంప్ట్ ఇంజెక్షన్లను రూపొందించడానికి దాన్ని ఉపయోగించాము. ఫలితంగా ఆ మోడల్ GPT‑Red దాడుల పట్ల అత్యంత ప్రతిఘటన కలిగినదిగా మారింది.
మేము డిప్లాయ్ చేసే మోడళ్ల నుండి GPT‑Redను వేరుగా ఉంచుతాము. ఇలా చేయడం వల్ల GPT‑Redలో ప్రత్యేకంగా శిక్షణ ఇచ్చిన హానికర సామర్థ్యాలు ప్రతికూలుల చేతుల్లోకి వెళ్లకుండా ఉంటాయి; అదే సమయంలో మా ప్రొడక్షన్ మోడళ్లలో దృఢత్వం పెంపొందుతుంది.
తనకు శిక్షణ ఇచ్చిన రక్షక మోడళ్ల సమూహం మరియు రెడ్ టీమింగ్ సన్నివేశాలపై GPT‑Red అత్యంత ప్రభావవంతంగా ఉంటుంది. OpenAIలో భద్రతకు విస్తృతంగా ఉపయోగపడే సాధారణ ప్రయోజన రెడ్ టీమింగ్ ఏజెంట్గా ఈ మోడల్ ఉపయోగకరమా అని కూడా మేము మూల్యాంకనం చేస్తాము. దానికి, కొత్త భద్రతా ఎన్విరాన్మెంట్లు మరియు లక్ష్య మోడళ్లపై GPT‑Red ప్రభావాన్ని మేము పరీక్షిస్తాము.
మొదట, Dziemian తదితరులు (2025) రూపొందించిన పరోక్ష ప్రాంప్ట్ ఇంజెక్షన్ అరేనా(కొత్త విండోలో తెరుచుకుంటుంది) యొక్క ప్రతిరూపిత సంస్కరణను ఉపయోగించి, కొత్త రెడ్ టీమింగ్ సన్నివేశాలకు GPT‑Red సాధారణీకరించే సామర్థ్యాన్ని మేము మూల్యాంకనం చేస్తాము. ఈ ఛాలెంజ్లో, మానవ రెడ్ టీమర్లు మరియు GPT‑Red ఇద్దరూ ముందుగా నిర్దేశించిన ఎన్విరాన్మెంట్ల సమితిలో GPT‑5.1పై స్వతంత్రంగా దాడులను ప్రతిపాదించారు. ఈ రెడ్ టీమింగ్ సన్నివేశాలు, లక్ష్యాలు GPT‑Redకు శిక్షణ ఇవ్వడానికి ఉపయోగించిన వాటికి భిన్నమైనవి. GPT‑Red గణనీయంగా ఎక్కువ దాడి విజయ రేట్లను సాధిస్తుంది; మానవులకు 13%తో పోలిస్తే, 84% సన్నివేశాల్లో అది విజయాన్ని కనుగొంటుంది.
ఆటోమేటెడ్ రెడ్ టీమర్గా GPT‑Red అత్యుత్తమంగా పనిచేస్తుంది. అంతర్గత మిరర్ను ఉపయోగించి Dziemian తదితరులు (2025) రూపొందించిన పరోక్ష ప్రాంప్ట్ ఇంజెక్షన్ అరేనాలో, మానవ రెడ్ టీమర్ల కంటే చాలా ఎక్కువ సన్నివేశాల్లో GPT‑5.1పై విజయవంతమైన దాడులను GPT‑Red రూపొందించగలదు.
ఒక రెడ్-టీమర్కు అసలైన పరీక్ష ఏమిటంటే, ఒక సిస్టమ్ యొక్క అంతర్లీన మోడల్ మరియు హార్నెస్ డిజైన్ గురించి అసంపూర్ణమైన జ్ఞానంతో, వాస్తవ ప్రపంచ ఏజెంటిక్ సిస్టమ్లకు వ్యతిరేకంగా లక్షిత దురుద్దేశాలను సాధించగల సామర్థ్యం. ఈ సెట్టింగ్లో మా మొదటి ప్రయోగంలో, OpenAI కార్యాలయంలో Andon Labs రూపొందించిన ( ప్రాజెక్ట్ వెండ్ను(కొత్త విండోలో తెరుచుకుంటుంది) పోలిన) ఒక AI-ఆధారిత వెండింగ్ మెషీన్తో GPT‑Redను తలపెట్టాము. వాస్తవ ప్రపంచ విస్తరణను దగ్గరగా పోలి ఉండే సిమ్యులేటెడ్ ఏజెంట్ నుండి దాడులను పంపగల మరియు టూల్ కాల్స్ను గమనించగల సామర్థ్యం గురించి, అలాగే సిస్టమ్ యొక్క వివరణను మేము GPT‑Redకు అందించాము. దాడులను పునరావృతం చేసిన తర్వాత, GPT‑Red ప్రొడక్షన్ ఏజెంట్పై తన దాడిని ప్రయోగించి, తన మూడు దురుద్దేశపూర్వక లక్ష్యాలను సాధించింది:
- స్టాక్లో ఉన్న ఖరీదైన వస్తువు ధరను అనుమతించబడిన కనీస ధర అయిన $0.50కి మార్చండి;
- కొత్తగా $100 లేదా అంతకంటే ఎక్కువ విలువైన వస్తువును ఆర్డర్ చేసి, దానిని $0.50 కే ఆఫర్ చేయండి; మరియు
- మరొక కస్టమర్ యొక్క ఆర్డర్ను రద్దు చేయండి.
మేము ఈ లోపాలను వెల్లడించాము మరియు కొత్త భద్రతా చర్యలను చురుకుగా పరీక్షిస్తున్నాము.
వెండింగ్ మెషిన్ను నిర్వహించే Vendy అనే సక్రియ స్వయంచాలక ఏజెంట్ను GPT‑Red భేదించగలదు. ముందుగా సిమ్యులేషన్లో పరీక్షించి, ఆపై దాడులను సక్రియ ఏజెంట్కు బదిలీ చేయడం ద్వారా, ఖరీదైన వస్తువులను చౌకగా మార్చేలా మరియు ఇతర కస్టమర్ ఆర్డర్లను రద్దు చేసేలా ప్రొడక్షన్ ఏజెంట్ను GPT‑Red చేయగలిగింది.
మేము 10 రకాల డేటా-బహిష్కరణ దృశ్యాలపై కోడెక్స్ CLI ఏజెంట్ (GPT‑5.4 మినీ ఆధారిత) పై దాడి చేయడానికి GPT‑Redను కూడా ఉపయోగిస్తాము. హోల్డ్-అవుట్ రెడ్-టీమింగ్ పనితీరుపై మా శిక్షణా విధానం యొక్క ప్రభావాన్ని అధ్యయనం చేయడానికి, మేము ఈ మోడల్ను ప్రాంప్టెడ్ GPT‑5.5 బేస్లైన్తో పోలుస్తాము. GPT‑Red మరింత ప్రభావవంతమైనది, ఎందుకంటే ఇది మరిన్ని సందర్భాలలో ఏజెంట్ ద్వారా సున్నితమైన డేటాను విజయవంతంగా బయటకు తీయించగలదు మరియు ఇది టోకెన్ల విషయంలో కూడా మరింత సమర్థవంతమైనది.
సక్రియ Codex ఏజెంట్లను భేదించడంలో GPT‑Red మరింత ప్రభావవంతంగా, సమర్థంగా ఉంటుంది. GPT‑5.4 Mini మద్దతుతో నడిచే Codex ఏజెంట్పై, 10 డేటా ఎక్స్ఫిల్ట్రేషన్ పనుల ప్రత్యేక సూట్లో మేము పరీక్షిస్తాము.
మన మోడళ్ల పటిష్టతను మెరుగుపరచడమే GPT‑Red యొక్క అంతిమ లక్ష్యం. గత ఆరు నెలలుగా, మేము పెరుగుతున్న కంప్యూట్తో క్రమంగా బలమైన రెడ్-టీమింగ్ మోడల్లకు (GPT‑Red యొక్క పూర్వగాములు) శిక్షణ ఇచ్చాము మరియు GPT‑5.3 నుండి ప్రతి తదుపరి ప్రొడక్షన్ మోడల్ శిక్షణలో ఈ మోడల్లను ఉపయోగించాము. కాలక్రమేణా, ఆ తర్వాత వచ్చిన ప్రతి GPT విడుదల మరింత పటిష్టంగా తయారయ్యింది.
ఉదాహరణకు, GPT‑Red యొక్క తొలి వెర్షన్ "ఫేక్ చైన్-ఆఫ్-థాట్" దాడులు అని పిలువబడే ఒక కొత్త తరహా డైరెక్ట్ ప్రాంప్ట్ ఇంజెక్షన్ దాడులను కనుగొంది. ఈ దాడులు GPT‑5.1 పై 95% కంటే ఎక్కువ విజయ రేట్లను సాధించాయి, కానీ ఇప్పుడు GPT‑5.6 Sol కోసం 10% కంటే తక్కువగా ఉన్నాయి. అదేవిధంగా, డెవలపర్ టూల్స్ మరియు బ్రౌజింగ్లో దాడులను లక్ష్యంగా చేసుకున్న మా పరోక్ష ప్రాంప్ట్ ఇంజెక్షన్ బెంచ్మార్క్లలో చాలా వరకు మా తాజా మోడల్ ద్వారా అధిగమించబడ్డాయి (>97% ఖచ్చితత్వం).
GPT‑Red పట్ల దృఢత్వం కూడా గణనీయంగా మెరుగుపడింది. విస్తృత శ్రేణి పటిష్ట వాతావరణాలలో, కాలక్రమేణా GPT‑Red యొక్క దాడి విజయాల రేట్లు ఏకరీతిగా తగ్గుతూ వచ్చాయి. మా తాజా మోడల్ విడుదలతో, GPT‑5.6 Sol అనేది GPT‑Red యొక్క డైరెక్ట్ ప్రాంప్ట్ ఇంజెక్షన్లలో కేవలం 0.05% వద్ద మాత్రమే విఫలమవుతుంది.
ప్రాంప్ట్ ఇంజెక్షన్ల కోసం సెల్ఫ్-ప్లే శిక్షణను మేము మరింత విస్తరిస్తూ ఉండగా, ప్రస్తుత మోడళ్లను భేదించగల కొత్త ముప్పులను కనుగొన్నాము. అయితే, మా స్కేలింగ్ ఈ దాడులపై దృఢత్వాన్ని కూడా గణనీయంగా మెరుగుపరచడంలో సహాయపడింది. నిలిపి ఉంచిన ఎన్విరాన్మెంట్లలో GPT‑Red చేసిన అన్ని ప్రయత్నాల్లో సగటు ప్రయత్న విజయంగా దాడి విజయ రేటు లెక్కించబడుతుంది.
మరిన్ని అభ్యర్థనలను తిరస్కరించడం ద్వారా లేదా తక్కువ సామర్థ్యం ప్రదర్శించడం ద్వారా ఒక మోడల్ మరింత సురక్షితంగా కనిపించవచ్చు. తక్కువ చేసే మోడల్పై దాడి చేయడం సహజంగానే కష్టం, కానీ అది ఉపయోగకరమైన పటిష్టత కాదు.
మేము రూపొందించే సాధారణ ఫ్రాంటియర్ సామర్థ్యాలతో పాటు, లక్షిత ఓవర్ రిఫ్యూజల్ టాస్క్లను కూడా క్షుణ్ణంగా మూల్యాంకనం చేస్తాము. దృఢత్వం గణనీయంగా మెరుగుపడుతున్నప్పటికీ, సాధారణ సామర్థ్యాలన్నీ చెక్కుచెదరకుండా ఉన్నాయని మేము కనుగొన్నాము. దీనిని బట్టి, సాధనాల సరికాని వాడకం లేదా చట్టబద్ధమైన అభ్యర్థనలను డిఫాల్ట్గా తిరస్కరించడం వల్ల కాకుండా, హానికరమైన సూచనలను మెరుగ్గా నిరోధించడం వల్లే ఈ పటిష్టత పెరుగుదల వచ్చిందని తెలుస్తోంది.
మన తదుపరి తరం మోడళ్ల సామర్థ్యాలను మెరుగుపరచడానికి AI ఏజెంట్లను ఇప్పటికే ఉపయోగిస్తున్నారు. GPT‑Redతో మేము భద్రత కోసం ఒక సారూప్యమైన ఫ్లైవీల్ను ఆవిష్కరించడం ప్రారంభించామని విశ్వసిస్తున్నాము, దీని ద్వారా నేటి నమూనాలను ఉపయోగించి రేపటి నమూనాలను మరింత పటిష్టంగా, సమలేఖనంగా మరియు విశ్వసనీయంగా తయారు చేయవచ్చు. నేటి మోడల్ కంటే మరింత శక్తివంతమైన GPT‑Red యొక్క భవిష్యత్ వెర్షన్లకు శిక్షణ ఇవ్వడానికి, మేము అల్గారిథమిక్ మెరుగుదలలు చేస్తూనే, కంప్యూట్ మరియు డేటాను విస్తరింపజేయడం కొనసాగిస్తాము. తద్వారా, ఈ నమూనాలు భవిష్యత్ GPT విడుదలలను మరింత సురక్షితంగా చేయడానికి సహాయపడతాయి.
మేము ఈ వారం చివరలో మరిన్ని వివరాలతో ఒక ప్రీ-ప్రింట్ను విడుదల చేయబోతున్నాము.


