ప్రధాన కంటెంట్‌కి దాటండి
OpenAI
లోడ్ అవుతోంది…

మేము ఇప్పటివరకు విస్తృతంగా అమలు చేసిన వాటిలో అత్యంత సామర్థ్యవంతమైన మోడల్ GPT‑6 Astraను నేడు విడుదల చేస్తున్నాం. మా ప్రిపేర్‌డ్నెస్ ఫ్రేమ్‌వర్క్ ప్రకారం అత్యంత కీలక సైబర్ భద్రతా సామర్థ్య స్థాయిని చేరుకున్న మా తొలి మోడల్ ఆస్ట్రా.

ఈ విడుదల భద్రత గురించి తెలుసుకోవాల్సిన అత్యంత ముఖ్యమైన విషయాలు ఇవి:

  1. GPT‑6 Astra సైబర్ సామర్థ్యాల్లో గణనీయమైన ముందడుగు వేసి, మా అత్యంత కీలక పరిమితిని చేరుకుంది. అంటే, సరైన సాధనాలు, ప్రాప్యత ఉంటే, ప్రతి దశలోనూ వ్యక్తి మార్గనిర్దేశం చేయకుండానే GPT‑6 Astra గతంలో తెలియని భద్రతా లోపాలను గుర్తించి, పటిష్ఠంగా రక్షించిన అనేక వ్యవస్థల్లో వాటిని ఉపయోగించుకునే కొత్త పద్ధతులను రూపొందించగలదు. అందువల్ల దుర్వినియోగం లేదా లక్ష్యవ్యతిరేకత కారణంగా మోడల్ హానికర సైబర్ చర్యలు చేపట్టకుండా మా రక్షణలను గణనీయంగా బలోపేతం చేశాం. కఠినమైన వేరుచేత, తనిఖీ స్థితుల గుప్తీకరణ, ఆలోచనా శృంఖలలతో (CoT) సహా పూర్తి కార్యాచరణ క్రమాల నిరంతర పర్యవేక్షణ, అంతర్గత వినియోగానికి ముందు తప్పనిసరి లక్ష్యానుసరణ మూల్యాంకనం వంటి చర్యలతో ఆస్ట్రా, సారూప్య మోడళ్ల అంతర్గత అభివృద్ధి, అమలును కూడా సురక్షితం చేశాం.
  2. GPT‑6 Astra తన ముందస్తుల కంటే గణనీయంగా మరింత దృఢమైనది. కొత్త దృఢత్వ భద్రతా శిక్షణ పద్ధతులను చేర్చడంతో, సుదీర్ఘ కార్యాచరణ క్రమాల్లోనూ GPT‑6 Astra GPT‑5.6 Sol కంటే జైల్‌బ్రేక్‌లను గణనీయంగా మెరుగ్గా నిరోధిస్తుంది. వ్యవస్థకు అనుసంధానం లేని పరీక్షలతో పాటు, కఠినమైన అంతర్గత, బాహ్య జైల్‌బ్రేక్ పరీక్షలు మరియు పరిష్కార చర్యల కార్యక్రమం ద్వారా మేము దీన్ని నిర్ధారించాము. అధిక ప్రమాదం ఉండవచ్చని గుర్తించిన వినియోగదారుల కోసం, మోడల్ తిరస్కరణ పరిమితిని మరింత జాగ్రత్తగా సర్దుబాటు చేసి, ద్వంద్వ వినియోగ ప్రమాదాల విస్తృత శ్రేణిని కవర్ చేసే సామర్థ్యంపై అదనపు శిక్షణ ఇచ్చాము. మునుపటి పరీక్ష దశల్లో గుర్తించిన జైల్‌బ్రేక్‌లను ఆస్ట్రా నిరోధిస్తోందని నిర్ధారించడానికి పునరావృత లోప పరీక్షలను ఉపయోగించాము. మా మెరుగుదలలను ధ్రువీకరించడానికి సరికొత్త అంతర్గత దాడి సాధనాలతో కొత్త విడతల స్వయంచాలక రెడ్ టీమింగ్‌ను కూడా నిర్వహించాము.
  3. GPT‑6 Astra GPT‑5.6 Sol కంటే మెరుగ్గా లక్ష్యానుసరణ చేస్తుంది. మోడల్ లక్ష్యానుసరణలో ఆస్ట్రా గణనీయమైన ముందడుగు. ప్రీ-ట్రైనింగ్ డేటా కూర్పు నుంచి రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్‌లో మా శ్రేణీకరణ వరకు అనేక మెరుగుదలలు ఇందులో ఉన్నాయి. మేము కొత్త లక్ష్యానుసరణ మూల్యాంకన సమాహారాన్ని(కొత్త విండోలో తెరుచుకుంటుంది) నివేదించాం. భద్రతా పరిమితులను గౌరవిస్తూ, తనకు అనుమతించిన పరిధిలో ఉండటంలో GPT‑6 Astra మరింత సమర్థంగా ఉందని గుర్తించాం. 54,000కుపైగా అంతర్గత Codex పనులను(కొత్త విండోలో తెరుచుకుంటుంది) ఉపయోగించిన అనుకరణలో, అధిక తీవ్రత గల లక్ష్యవ్యతిరేక ప్రవర్తనకు సోల్‌తో పోలిస్తే ఆస్ట్రా సుమారు సగం హెచ్చరికలను మాత్రమే పొందింది.
  4. లక్ష్యవ్యతిరేకత పర్యవేక్షణను మేము విస్తృతంగా అమలు చేస్తున్నాం. మా మోడళ్లలో సంభావ్య లక్ష్యవ్యతిరేక ప్రవర్తనను నివారించడానికి మోడల్ లక్ష్యానుసరణే ప్రధాన సాధనమని మేము భావిస్తున్నాం. అయితే, పర్యవేక్షణ అత్యాధునిక మోడల్ ప్రవర్తనపై విస్తృత అవగాహనను అందించి, లక్ష్యానుసరణ, భద్రతను మరింత మెరుగుపరిచే అవకాశాలను వెల్లడిస్తుంది. అదనంగా, గుర్తించిన లక్ష్యవ్యతిరేక ప్రవర్తనపై పర్యవేక్షణ మరో రక్షణ పొరగా పనిచేస్తుంది. ఈ కారణాలతో, అధిక గణన వ్యయం ఉన్నప్పటికీ, ఆస్ట్రా బాహ్య అమలులో సాధనాలను ఉపయోగించే అన్ని నిర్ధారణ ప్రక్రియలకు లక్ష్యవ్యతిరేకత పర్యవేక్షణను అదనంగా చేర్చాం. ఈ వ్యవస్థ మా అంతర్గత ఏర్పాటును పోలి ఉంటుంది.
  5. GPT‑5.6 Sol‌తో పోలిస్తే GPT‑6 Astra పర్యవేక్షణ సాధ్యత తగ్గింది. GPT‑6 Astra పర్యవేక్షణ సాధ్యత(కొత్త విండోలో తెరుచుకుంటుంది), నియంత్రణ సాధ్యత(కొత్త విండోలో తెరుచుకుంటుంది)పై విస్తృత పరిశోధనలు నిర్వహించాం. GPT‑5.6 Sol‌తో పోలిస్తే GPT‑6 Astra తన CoTని స్వయంగా మరింత సమర్థంగా నియంత్రించగలదని, అందులో తన తప్పును వెల్లడించే సమాచారం చేర్చే అవకాశం తక్కువని గుర్తించాం. ప్రతికూల పరిస్థితుల్లో, అంటే మా పర్యవేక్షణ వ్యవస్థలను తప్పించుకునేలా మోడల్‌ను ప్రేరేపించినప్పుడు, మూల్యాంకనాల్లో వ్యూహాత్మకంగా తక్కువ సామర్థ్యం చూపుతూ (సాండ్‌బాగింగ్) అది గుర్తించబడకుండా ఉండగలదని కనుగొన్నాం. అలాగే కొన్ని విధ్వంసక పనులు(కొత్త విండోలో తెరుచుకుంటుంది) చేయమని కోరినప్పుడు, కొన్నిసార్లు మా అంతర్గత పర్యవేక్షణ వ్యవస్థలను తప్పించుకోగలదు. సాధారణంగా కనిపించే, సంబంధం లేని పాఠ్యంలో అంతర్లీన రీజనింగ్‌ను దాచడం వంటి గుప్తసంకేత CoT రీజనింగ్‌కు ఆధారాలు కనిపించలేదు. అందువల్ల తప్పించుకునే ప్రమాదం ప్రధానంగా తక్కువ స్థాయి రీజనింగ్ పనులకే పరిమితం కావచ్చు.
    • ప్రతికూల పరిస్థితుల్లో ఆస్ట్రా తరగతి మోడళ్లు మా CoT పర్యవేక్షణ వ్యవస్థలను తప్పించుకోగలవని ఈ ఫలితాలు సూచిస్తున్నాయి. ప్రస్తుతం ఈ ఫలితాలు ప్రధానంగా ప్రతికూల మూల్యాంకనాలపై, అంటే పర్యవేక్షణను తప్పించుకోవాలని మేము మోడల్‌కు సూచించిన సందర్భాలపై ఆధారపడ్డాయి. మొత్తంగా చూస్తే, భద్రతా పరిమితులను ఉల్లంఘించే అవకాశం GPT‑5.6 Sol కంటే ఆస్ట్రాకు తక్కువని మా లక్ష్యానుసరణ మూల్యాంకనాలు చూపుతున్నాయి.
    • అయితే, ఈ ధోరణిని మేము తీవ్రంగా పరిగణిస్తున్నాం. మా మోడళ్ల సామర్థ్యం పెరుగుతున్న కొద్దీ, ఈ ఫలితాలు, పర్యవేక్షణ సాధ్యతపై వాటి ప్రభావాలను పరిశోధించడం కొనసాగిస్తున్నాం. ఆలోచనా శృంఖల పర్యవేక్షణను సంరక్షించి ఉపయోగించడానికి OpenAI కృషి చేసింది. CoT పర్యవేక్షణ సాధ్యతను కాపాడటం ఈ పరిశోధన కార్యక్రమపు ప్రధాన లక్ష్యం. అయితే, మోడల్ ఆలోచనా శృంఖలను పరిశీలించడానికే పరిమితం కాకుండా ఇతర లక్ష్యానుసరణ తనిఖీ పద్ధతులను అభివృద్ధి చేయాల్సిన ప్రాముఖ్యతను కూడా ఈ ఫలితాలు స్పష్టం చేస్తున్నాయి.
  6. అంతర్జాల విహరణ, కార్యాలయ పరిసరాల్లో GPT‑6 Astra మరింత బాధ్యతాయుతంగా వ్యవహరిస్తుంది: GPT‑5.6 Sol‌తో పోలిస్తే GPT‑6 Astra ప్రాంప్ట్ చొప్పింపులను గణనీయంగా మెరుగ్గా నిరోధిస్తుంది. వాస్తవిక అంతర్జాల విహరణ, వృత్తిపరమైన కంప్యూటర్ పరిసరాల్లో మోడల్ ప్రవర్తనను కూడా పరీక్షించాం. GPT‑5.6 Sol‌తో పోలిస్తే అనధికార లావాదేవీలు, డేటా నష్టం, మితిమీరిన ప్రాప్యత లేదా నియంత్రణలను దాటవేయడం వంటి లక్ష్యవ్యతిరేక, సంభావ్య విధ్వంసక చర్యలను మోడల్ చేపట్టే అవకాశం గణనీయంగా తక్కువని గుర్తించాం. హింసాత్మక దాడి ప్రణాళికకు సహాయం చేయడం లేదా మోసం చేయడం వంటి హానికర అభ్యర్థనలను ఏజెంటిక్ సందర్భాల్లో నిర్వహించేటప్పుడు కూడా ఇది మరింత సురక్షితంగా వ్యవహరిస్తుంది.
  7. అధిక ప్రమాద సందర్భాల్లో GPT‑6 Astra గణనీయంగా మరింత సురక్షితమైనది. వాస్తవ వినియోగం, మానవుల ప్రతికూల రెడ్ టీమింగ్ నుంచి సేకరించిన క్లిష్టమైన అభ్యర్థనలకు GPT‑6 Astra, GPT‑5.6 Sol కంటే మరింత సురక్షితంగా స్పందిస్తుంది. అసురక్షిత అభ్యర్థనలను సురక్షితంగా పూర్తి చేయడం, హానిరహిత అభ్యర్థనలను అనవసరంగా తిరస్కరించకపోవడం అనే రెండు అంశాల్లోనూ ఆస్ట్రా పారెటో మెరుగుదలను సాధించింది. హాని ప్రమాదం స్పష్టమైన అభ్యర్థన వల్ల కాకుండా విస్తృత సందర్భం నుంచి ఉత్పన్నమయ్యే అత్యంత తీవ్రమైన పరిస్థితులకూ ఈ మెరుగుదలలు వర్తిస్తాయి. 18 ఏళ్లలోపు వినియోగదారులకు వయసుకు తగిన భద్రతా పరిమితులను కూడా ఆస్ట్రా మరింత స్థిరంగా వర్తింపజేస్తుంది.