సమన్వయంతో సాగిన మోడల్ డిస్టిలేషన్ దాడిని అడ్డుకోవడం
మా మోడళ్ల నుంచి సంరక్షిత రీజనింగ్ను వెలికితీసేందుకు సమన్వయంతో సాగిన దాడిని ఇటీవల గుర్తించి అడ్డుకున్నాం. దీనికి సంబంధించిన కార్యకలాపాలను తొలిసారిగా జూలై మొదటి వారంలో గమనించాం. ఈ కార్యకలాపం దురుద్దేశపూర్వక డిస్టిలేషన్ లక్షణాలకు అనుగుణంగా ఉంది. అంటే, ఒక మోడల్ అందించే ఫలితాలను లేదా రీజనింగ్ను అనుమతి లేకుండా క్రమపద్ధతిలో ఉపయోగించి మరో మోడల్కు శిక్షణ ఇవ్వడం, దాన్ని పునఃసృష్టించడం లేదా మెరుగుపరచడం. ఒక పనిని చేసేటప్పుడు మోడల్ అనుసరించే ప్రక్రియకు సంబంధించిన అంతర్గత నమోదు సంరక్షిత రీజనింగ్. దీన్ని వెలికితీయడం వల్ల తుది సమాధానంలో వెల్లడించని సమాచారం బయటపడవచ్చు. మోడల్ సామర్థ్యాలను పునఃసృష్టించేందుకు ఇతరులకు తోడ్పడవచ్చు.
ఈ దాడికి పాల్పడినవారు మా గుప్తీకరణను ఛేదించలేదు, సమాచార భాండాగారంలోకి చొరబడలేదు, నిల్వ చేసిన వినియోగదారుల సంభాషణలకు నేరుగా ప్రవేశం పొందలేదు. బదులుగా, అభ్యర్థించిన వ్యక్తికి కనిపించే రూపాల్లో సంరక్షిత రీజనింగ్ను తిరిగి ఉత్పత్తి చేసేలా మోడల్తో సంభాషణలను మలిచారు. మా సేవా నిబంధనలను ఉల్లంఘిస్తూ, సమన్వయంతో పెద్ద ఎత్తున ఇలా చేశారు. ఈ రకమైన దుర్వినియోగానికి దారితీసే లోపం OpenAI మోడళ్లకే పరిమితం కాదు. దురుద్దేశపూర్వక డిస్టిలేషన్కు వ్యతిరేకంగా సమష్టి రక్షణలను బలోపేతం చేసేందుకు, అత్యాధునిక మోడల్ ఫోరమ్ ద్వారా పరిశ్రమ భాగస్వాములతో దీని గురించి సమాచారం పంచుకున్నాం.
ఈ సమాచారాన్ని ప్రచురించే ముందు, దాడి పరిధిని, దాని వల్ల కలగగల ప్రభావాన్ని పరిశోధించాం. మా స్వంత నివారణ చర్యలను అమలు చేశాం. ఈ రకమైన దాడిని ఎదుర్కొనే రక్షణలు అమల్లో ఉండేలా పరిశోధకులు, పరిశ్రమ భాగస్వాములతో వివరాలు పంచుకుని వారి అభిప్రాయాలు తీసుకున్నాం. అదనపు నివారణ చర్యలు, పరిశోధన కొనసాగుతున్నాయి. ఇప్పటివరకు మేము తెలుసుకున్న విషయాలను పంచుకోవడం వల్ల విస్తృత సాంకేతిక వ్యవస్థలోని ఇతరులు కూడా తమ రక్షణలను బలోపేతం చేసుకోగలరని నమ్ముతున్నాం.
దాడికి పాల్పడినవారు కొత్త పద్ధతుల్లో సంరక్షిత రీజనింగ్ను వెలికితీసేందుకు ప్రయత్నించడం గమనించాం. ఒక సంభాషణలోని గుప్తీకరించిన రీజనింగ్ను కాపీ చేసి, దాన్ని మరో సంభాషణలో మోడల్కు ఇచ్చి, దాగి ఉన్న రీజనింగ్ను విగుప్తీకరించి రాసి ఇవ్వమని అడగడం కూడా ఇందులో ఉంది.
స్వతంత్ర భద్రతా పరిశోధకులు(కొత్త విండోలో తెరుచుకుంటుంది) కూడా బాధ్యతాయుత వెల్లడింపు ప్రక్రియ ద్వారా మోడళ్ల మధ్య వినియోగానికి, సంభాషణ కాంపాక్షన్కు సంబంధించిన లోపాలను మా దృష్టికి తెచ్చారు. వారి పరిశోధన ఫలితాలను పరిశీలించి, వారు గుర్తించిన మార్గాల్లో దాడులు నిజంగానే సాధ్యమని నిర్ధారించాం. ఈ విస్తృత దాడి వర్గాన్ని అర్థం చేసుకోవడానికి, నివారణ చర్యలను వేగవంతం చేయడానికి వారి కృషి మాకు తోడ్పడింది.
ఈ కార్యకలాపం జూలై 1న మొదలై, తొలుత స్వల్ప స్థాయిలో సాగింది. జూలై 24, 25 తేదీల్లో ఇది ఒక్కసారిగా భారీగా పెరిగింది. సంబంధిత వెలికితీత పద్ధతిని ఉపయోగిస్తూ 4,000 మందికి పైగా వినియోగదారుల నుంచి 16,000 అభ్యర్థనలు1 రావడం గమనించాం. తదుపరి పరిశోధనలో 15,000 మందికి పైగా వినియోగదారుల సమూహంలో సంబంధిత ప్రాంప్ట్ నమూనాలను ఉపయోగించిన కార్యకలాపాలను గుర్తించాం. వాటిని జూలై 28 నాటికి పూర్తిగా అడ్డుకున్నాం.
కాలక్రమేణా ఈ కార్యకలాపం రూపు మారింది. దురుద్దేశపూర్వక డిస్టిలేషన్ అనేది విస్తృత భద్రతా సవాలని, దాన్ని ఎదుర్కోవడానికి బహుళ స్థాయుల్లో, పరిస్థితులకు అనుగుణంగా మారే రక్షణలు అవసరమని ఇది మరింత స్పష్టం చేసింది.
సంబంధిత కాలంలో మేము గమనించిన దాడులకు పాల్పడినవారంతా ఒకే వ్యక్తి లేదా సంస్థ తరఫున పనిచేశారా అనేది స్పష్టంగా లేదు. అయితే, ఈ కార్యకలాపాల్లోని ఒక ప్రధాన సమూహం వెనుక కిమీని అభివృద్ధి చేసిన మూన్షాట్ ఏఐతో సంబంధం ఉన్న వ్యక్తులు ఉన్నారని మేము నిర్ధారించాం.
దురుద్దేశపూర్వక డిస్టిలేషన్ వల్ల సురక్షిత వినియోగానికి, జాతీయ భద్రతకు ముప్పులు తలెత్తుతాయి. అసలు మోడల్ వినియోగదారులకు అందించే ఫలితాలపై అమలు చేసే రక్షణలను కొనసాగించకుండానే, వెలికితీసిన రీజనింగ్తో మరో మోడల్కు శిక్షణ ఇవ్వవచ్చు. భారీ స్థాయిలో డిస్టిలేషన్ చేయడం వల్ల, భద్రతపై అదే స్థాయిలో పెట్టుబడి పెట్టాల్సిన అవసరం లేకుండానే అధునాతన సామర్థ్యాల బదిలీ వేగవంతం కావచ్చు. పౌర, సైనిక అవసరాలు రెండింటికీ ఉపయోగపడే రంగాల్లో మోడళ్ల సామర్థ్యాలు పెరిగే కొద్దీ ఈ ఆందోళనలు మరింత తీవ్రమవుతాయి.
ఈ ముప్పు OpenAIకే పరిమితం కాదు. పైన పేర్కొన్నట్లుగా, ఇలాంటి పద్ధతులు ఇతర అధునాతన కృత్రిమ మేధ వ్యవస్థలనూ ప్రభావితం చేయవచ్చు. అందువల్ల ఇది పరిశ్రమవ్యాప్తంగా సమన్వయం అవసరమైన ఉమ్మడి భద్రతా సవాలు.
ఖాతాలపై నిబంధనల అమలు, సాంకేతిక నియంత్రణలు, భాగస్వాములతో సమన్వయం ద్వారా ఇటీవలి ఈ డిస్టిలేషన్ దాడిని నిరోధించాం. మోసపూరిత ఖాతాలను నిషేధించాం లేదా పరిమితం చేశాం. ఖాతా నమోదు, మౌలిక సదుపాయాలపై నియంత్రణలను బలోపేతం చేశాం. సంబంధిత నెట్వర్క్లపై పర్యవేక్షణను విస్తరించాం.
వినియోగదారులు, కార్యస్థలాలు, సంస్థలు, మోడల్ కుటుంబాలన్నింటిలోనూ దాగి ఉన్న రీజనింగ్కు రక్షణలను బలోపేతం చేశాం. ఇతర వినియోగదారుల గుప్తీకరించిన రీజనింగ్ ఇప్పటికే చేతిలో ఉన్నవారు, దాన్ని మళ్లీ మోడల్కు సమర్పించి అందులోని సమాచారాన్ని వెలికితీసే మార్గాన్ని మూసివేశాం. రీజనింగ్ను బయటపెట్టే అవకాశం ఉన్న ప్రసార ఫలితాలను గుర్తించి నిలిపివేసేందుకు తనిఖీలను జోడించాం. సంబంధిత కార్యకలాపాలు మూడవ పక్ష సేవల ద్వారా కొనసాగినప్పుడు, ఆయా సేవా ప్రదాతలతో కలిసి సంబంధిత ఖాతాలను గుర్తించి అడ్డుకున్నాం.
చివరిగా, అత్యాధునిక మోడల్ ఫోరమ్ ద్వారా, తగిన ప్రభుత్వ సమాచార మార్పిడి మార్గాల ద్వారా సంబంధిత పరిశోధన ఫలితాలను పంచుకున్నాం. ఇతర అత్యాధునిక మోడల్ అభివృద్ధిదారులు, ప్రభుత్వ రంగ భాగస్వాములు ఇలాంటి కార్యకలాపాలను గుర్తించి తమ రక్షణలను బలోపేతం చేసుకునేందుకు ఇది తోడ్పడుతుంది. రీజనింగ్ నమోదులను బదిలీ చేయడానికి లేదా మళ్లీ ఉపయోగించడానికి వీలు కల్పించే వ్యవస్థలు ఇలాంటి ముప్పులను ఎదుర్కోవచ్చు.
అత్యాధునిక మోడళ్లు మెరుగుపడుతున్న కొద్దీ, వాటి సామర్థ్యాలను తక్కువ ఖర్చుతో అనుకరించే మార్గాల కోసం దాడులకు పాల్పడేవారు వెతుకుతున్న కొద్దీ, దురుద్దేశపూర్వక డిస్టిలేషన్ ప్రయత్నాలు మరింత సంక్లిష్టమవుతాయని భావిస్తున్నాం. ఈ కార్యకలాపాన్ని ఎదుర్కోవడానికి బహుళ స్థాయుల్లో నియంత్రణలు అవసరం. మారుతున్న పరిస్థితులకు అనుగుణంగా వాటిని నిరంతరం సవరించాలి.
ఈ పని ఇంకా పూర్తికాలేదు. మేము నేరుగా అందించే సేవలకు ఉన్న రక్షణలే భాగస్వాములు హోస్ట్ చేసే వ్యవస్థలకూ అవసరం. సాధనాల ఫలితాల ద్వారా జరిగే దాడులను ఎదుర్కొనేందుకు, సాధారణంగా కనిపించే వచనంతో పాటు ఇతర అంశాలనూ పరిశీలించే రక్షణలు కావాలి. సాధనాల రక్షణలను, వర్గీకరణ వ్యవస్థల పరిధిని, అనుచిత అభ్యర్థనలను మోడళ్లు తిరస్కరించే విధానాలను మెరుగుపరుస్తూనే ఉన్నాం. సంబంధిత నియంత్రణలను క్లౌడ్ భాగస్వాముల వ్యవస్థలన్నింటికీ విస్తరిస్తున్నాం.
మా ప్రతిస్పందన మూడు అంశాలపై దృష్టి సారిస్తూనే ఉంటుంది: సమాచార వెలికితీతను అడ్డుకునే సాంకేతిక రక్షణలను బలోపేతం చేయడం, సమన్వయంతో సాగే దాడులను మరింత సమర్థంగా గుర్తించి చర్యలు తీసుకోవడం, పరిశ్రమ–ప్రభుత్వాల మధ్య ముప్పులకు సంబంధించిన సమాచార మార్పిడిని మరింత విస్తరించడం.

