Судалгааг хурдасгах: OpenAI-ийн дотоод ертөнц
AGI нь бүх хүн төрөлхтөнд ашиг тусаа өгөхийн тулд ардчилсан засаглалтай байх ёстой гэж бид үздэг. Энэ нь өндөр чадвартай AI системүүдийн чадавх, эрсдэл, хамгаалалтын арга хэмжээний талаар мэдээлэлтэй олон нийтийн мэтгэлцээнээр л боломжтой. Хаа сайгүй хүмүүс хил хязгаарын AI-ийн ирээдүйн хөгжлийн магадлалтай чиг хандлагыг ойлгох хэрэгтэй бөгөөд ингэснээр түүний хөгжлийн талаар утга учиртай байр сууриа илэрхийлэх боломжтой болно.
Тодорхой эрсдэл, тохиолдол, хамгаалалтын арга хэмжээний талаарх ил тод байдал шаардлагатай боловч хангалтгүй. Хамгийн чадавхтай системүүд хэрхэн хөгжиж, хил хязгаарын лабораториудад судалгааны ахицыг хэрхэн хөтөлж байгааг олон нийт мөн ойлгох хэрэгтэй гэж бид үзэж байна.
Бид хүний хяналт дор ажиллаж, гүний сургалт болон нийцүүлэлтийн ахицыг цааш ахиулан, давталттай сайжруулалтыг боломжтой болгох автоматжуулсан AI судлаачийг аюулгүйгээр бүтээх зорилготой. Бидний хэмжилтээр, энэ оны есдүгээр сар гэхэд автоматжуулсан судалгааны дадлагажигчтай болох, өнгөрсөн намар зарласан(шинэ цонхонд нээгдэнэ) зорилгодоо одоо хүрлээ. «Судалгааны дадлагажигч» гэж бид чадварлаг судлаачийн хэдэн өдөр зарцуулах даалгавруудыг багтаасан, хүний удирдлага дор сайн тодорхойлогдсон судалгааны даалгавруудыг гүйцэтгэж чадах системийг хэлнэ. Бид 2028 оны 3-р сар гэхэд автоматжуулсан хиймэл оюун ухааны судлаач бий болгох чиглэлээр хүчтэй ахиц дэвшил гаргаж байна.
Энэ жилийн туршид OpenAI-ийн судлаачдын өдөр тутмын ажил ихээхэн өөрчлөгдсөн. Судлаачид өдрийн турш кодчиллын агентуудыг (ихэвчлэн зэрэгцээ сешнүүдэд) ашиглаж байгаа бөгөөд нийт хэрэглээ хурдацтай өсөж, OpenAI-ийн бусад багуудын өсөлтийг давж байна. Судлаачид кодыг илүү хурдан оруулж, илүү олон туршилт хийж байна. Судлаачдын агентуудыг ашиглах арга зам мөн өөрчлөгдөж байна: агентууд улам бүр нарийн төвөгтэй даалгавруудыг гүйцэтгэж, тэдгээрийг илүү олон удаа амжилттай биелүүлж байна. AI судалгаа нь олон боломжит саад бэрхшээлтэй, нарийн төвөгтэй үйл явц тул ахицын нийт хурд эдгээр тодорхой хэмжүүрүүдтэй хөл нийлүүлэхгүй байх магадлалтай. Гэхдээ ерөнхийд нь авч үзвэл, эдгээр үр дүн нь агент хэрэгслүүд судалгааны ахицыг бодитоор хурдасгаж байна гэсэн бидний олонхын дотооддоо төрдөг өргөн ойлголттой нийцэж байна. Хүмүүс манай судалгааны тэргүүлэх чиглэлийг тогтоож, аль санаа, үр дүнг цаашид авч явахаа дүгнэж, системүүдийг өргөтгөх, түр зогсоох, эсвэл нэвтрүүлэх эсэхийг шийддэг.
Хэрэв үүнийг хариуцлагатай хэрэгжүүлбэл, автоматжуулсан AI судалгаа нь хүний сайн сайхан байдлыг шууд сайжруулж, OpenAI-ийн эрхэм зорилгыг урагшлуулах загваруудыг бий болгоно гэж бид үзэж байна. Энэ нь дэвшилтэт оюун ухааны өртгийг бууруулж, дэлхий даяарх хүмүүст үр өгөөж хүртээх боломжтой. Бид энэ ажлыг зарим талаар автоматжуулсан судалгаа нь нийцүүлэлтийн асуудлыг шийдэж, улам бүр чадваржиж буй AI-ийн эсрэг хамгаалалт бий болгоход тусалж болох учраас хэрэгжүүлж байна. Автоматжуулсан AI судлаач нь аюулгүй байдал эсвэл нийцлийн автоматжуулсан судлаач байж болно. Илүү чадамжтай, нийцсэн системүүд нь чухал дэд бүтцийн аюулгүй байдлыг хангах, аюултай AI агентуудаас хамгаалах, хамгаалалтын шинэ арга хэмжээ боловсруулахад тусалж чадна.
Эдгээр нь ашиг тустай автоматжуулсан судалгааны чадавхыг хөгжүүлэх үндэслэл мөн боловч хурдацтай RSI нь заавал бидний эрэлхийлэх ёстой үр дүн гэсэн үг биш юм. Цааш үргэлжлүүлэх эсэх, хэрхэн үргэлжлүүлэх нь хүний хяналтыг хадгалах бидний чадвар болон ашиг тус, эрсдэлийн талаарх мэдээлэлд суурилсан ардчилсан сонголтоос хамаарах ёстой.
Нийцсэн, бүрэн RSI-д аюулгүйгээр хэрхэн хүрэхээ бид одоогоор мэдэхгүй байна. Бид чадавхын зэрэгцээ нийцүүлэлт болон аюулгүй байдлын арга хэмжээг өргөжүүлэхээр ажиллаж байна. Гэвч нийцүүлэлт, аюулгүй байдлын ахиц хөл нийлүүлнэ гэж үзэж болохгүй бөгөөд илүү чадварлаг системүүдийг хянахад илүү хэцүү болж болно. Нягт нямбай нийцүүлэлт, аюулгүй байдлын ажил нь энэхүү хүчин чармайлтын гол цөм бөгөөд агент шинжтэй кодчиллын системүүдэд өнөөдөр ажиглагдаж буй аюулгүй байдлын асуудлуудыг хэмжиж, бууруулахаас эхэлдэг. Цааш үргэлжлүүлэх нь хүлээн зөвшөөрөх боломжгүй аюулгүй байдлын эрсдэл учруулна гэж үзсэн тохиолдолд, хангалттай хамгаалж чадахгүй гэж дүгнэсэн системийнхээ хөгжүүлэлт эсвэл нэвтрүүлэлтийг удаашруулах, зогсоох зэрэг зохих арга хэмжээг авна.
Сүүлийн үеийн Hugging Face-ийн хэрэг явдлын дараа бид энэхүү амлалтаа хэрэгжүүлж, судалгааны орчноо улам бэхжүүлж, халдлагын багийн туршилт хийж, хяналтын системийн хамрах хүрээг өргөжүүлэхийн зэрэгцээ нэвтрүүлэхээр төлөвлөсөн хамгийн сүүлийн үеийн загваруудын бататгах сургалтыг (RL) түр зогсоосон. Ингэснээр бүх судалгаа зогсоогүй: зарим ажлын ачаалал илүү хатуу хяналтын дор дахин эхэлсэн бол бусад нь түр зогссон хэвээр байв. Бид аюулгүй байдал, нийцүүлэлтийн стандартаа өндөрсгөж, аюулгүй байдлын ажлыг загварын амьдралын мөчлөгийн илүү гүн шатанд оруулан, сургалтын бүх явцад нийцсэн зан төлөвийн илүү баттай нотолгоо шаардах болсон.
Сүүлийн саруудад агентын системүүд RSI руу чиглэсэн бидний ахицад хэрхэн хувь нэмэр оруулсны дэлгэрэнгүй тоймыг өнөөдөр хүргэж байна. Агентын системүүд шинэ бөгөөд хурдацтай өөрчлөгдөж байгаа бөгөөд бидний хэмжилтийн хүчин чармайлт одоогоор урьдчилсан шатандаа байна. Эдгээр эхний үр дүн болон тэдгээрийн цаадах аргуудыг хуваалцсанаар бид олон нийтэд мэдээлж, олон нийтэд ил тод мэдээлэх жишгийг дэмжин, салбарыг хэмжилтийн хамтын стандарт руу чиглүүлэхэд туслахыг зорьж байна.
Эцэст нь, бид хил хязгаарын бодлогын үндсэн баримт бичиг-тээ бичсэнчлэн, бид болон бусад компани RSI чиглэлийн ахиц дэвшлээ олон нийтэд ил тод хянах шаардлагатай гэж үзэж байна. Ийм шаардлагагүй байсан ч бид RSI чиглэлийн ахиц дэвшлийнхээ талаар ил тод байхыг үргэлжлүүлэхээр төлөвлөж байна. Аюулгүй байдал болон өмчийн мэдээллийг хамгаалах хэрэгцээг тэнцвэржүүлэхийн зэрэгцээ хэмжилтийн арга техник, ойлголт маань сайжрахын хэрээр ил тод байдлын арга барилаа хөгжүүлнэ.
Энэ оны эхээр OpenAI-д агентын хэрэглээгээр эрэмбэлэгдсэн медиан судлаач кодчиллын агентуудыг зөвхөн бага хэмжээгээр ашиглаж байсан. Наймдугаар сарын дунд гэхэд дундаж судлаач агентуудыг ажилдаа өдөр бүр нэгтгэн ашиглаж, API үнээр өдөрт 600$-оос дээш өртөгтэй инференс ашиглаж байв. Манай судалгааны байгууллагын 90-р перцентил дэх хэрэглэгч одоо өдөрт 7,000 $-оос дээш өртөгтэй токен ашигладаг.
2026 оны 6-р сараас өмнө судалгааны байгууллагын хэмжээнд агентуудын нийт ажиллах хугацаа хүний нийт хөдөлмөрийн хугацаанаас доогуур хэвээр байв. Түүнээс хойш байдал өөрчлөгдсөн. Стандарт 8 цагийн ажлын өдрөөр тооцвол, наймдугаар сарын дунд үеийн байдлаар, судалгааны байгууллага нийтдээ хүний хөдөлмөрийн ажлын өдөр бүрд агентын 3.1 ажлын өдрийн хүчин чармайлт ашиглаж байна.
Үүнийг өөрөөр авч үзэх нэг арга нь өндөр зэрэгцээ ажлын урсгал (жишээлбэл, 4 ба түүнээс олон агентыг нэгэн зэрэг ажиллуулах) ашигладаг судлаачид хэр олон байдгийг ойлгох явдал юм. Доор үзүүлснээр энэ тоо өсөж байна. Эдгээр тоонд хэрэглэгчийн шууд эхлүүлсэн агентууд болон хэрэглэгчийн шууд эхлүүлсэн тэдгээр агентуудаас цааш үүссэн дэд агентуудын өдөр тутмын оргил үзүүлэлтүүд хоёулаа багтсан.
Хиймэл оюун ухааны судалгааны ихэнхийг загварын оюун ухаан эсвэл гүйцэтгэлд шинэ сайжруулалтыг манай үндсэн загваруудын аль нэгэнд нэгтгэх зорилготой, хөдөлмөр их шаарддаг үйл явц гэж үзэж болно. Энэ үйл явц олон алхмаас хамаардаг бөгөөд бүх алхам зэрэг зөв хэрэгжихэд чадавх ахидаг: Судлаачид шинэ сайжруулалтыг зохиомжлох, загварын гүйцэтгэлийг үнэлэх үнэлгээ боловсруулах, эдгээр сайжруулалтыг өргөн цар хүрээнд турших дэд бүтэц боловсруулах, сургалтын үеэр алдаа төдийгүй аюултай эсвэл нийцэлгүй зан төлөвийг илрүүлэх, амжилттай санаануудыг үндсэн сургалтын ажиллуулалтад нэгтгэх шаардлагатай. Судалгааны үйл явцын аль ч хэсгийн доголдол нь бүхэл мөчлөгийг хязгаарлаж болно.
Код бичих болон туршилт ажиллуулах нь судлаачдын ажлын хүрээнд хийдэг хоёр гол үйл ажиллагаа бөгөөд эдгээр үйл явц хурдасч байгааг бид нотлох баримтаар харж байна.
Эдгээр өгөгдлийн цэгүүдийг хэмжих нь харьцангуй хялбар боловч тайлбарлахад хэцүү байж болно. Автоматжуулалт ахихын хэрээр автоматжуулахад хамгийн бага боломжтой даалгаврууд нь судлаачдын хүчин чармайлтын илүү их хувийг эзэлж, цаашдын ахиц дэвшлийн чухал саад бэрхшээл болно. Тооцооллын хүчин чадал нь ахиц дэвшлийг хязгаарлах өөр нэг хүчин зүйл бөгөөд бусад саад бэрхшээл багасахын хэрээр цаг хугацааны явцад илүү чухал болж магадгүй.
2026 он хүртэл идэвхтэй туршилт явуулагч бүрийн туршилтын тоо өссөн бөгөөд 2025 оны 1-р сард бүртгэж эхэлснээс хойш 2026 оны 8-р сар хамгийн өндөр үзүүлэлттэй байв. Энэ нь Codex-ийн хэрэглээ нэмэгдсэнтэй хамааралтай боловч 2025 оноос хойш бидний ашиглах боломжтой тооцооллын хүчин чадал мөн мэдэгдэхүйц өссөнийг тэмдэглэж байна.
Чанарын сэтгэгдэл болон дотоод өгөгдөл хоёулаа судлаачдын код бичих агентуудад хуваарилдаг даалгаврын хослол өөрчлөгдөж байгааг харуулж байна. Илүү өндөр түвшний, урт хугацааны даалгавруудыг хуваарилах нь цаг хугацаа өнгөрөх тусам түгээмэл болж байна.
Энэ чиг хандлагыг илүү тодорхой ойлгохын тулд бид Epoch AI-ийн боловсруулсан, AI-ийн R&D амьдралын мөчлөгийн нэг хэсэг болох төрөл бүрийн ажлын саяхан нийтлэгдсэн ангиллыг(шинэ цонхонд нээгдэнэ) ашиглан судалгааны байгууллага дахь сүүлийн үеийн хэрэглээнд дүн шинжилгээ хийсэн. Бүх төрлийн ажлыг ангилах олон жил ашиглагдсан O*NET системээс санаа авсан энэхүү ангилал нь хил хязгаарын AI-ийн R&D-д тусгайлан тохируулсан бөгөөд үйл явцыг зургаан үндсэн үе шатанд хуваадаг:
Шийдээрэй: юун дээр ажиллах, юуг үргэлжлүүлэх, нөөцөө хаана хуваарилах
Дизайн: судалгааны санаа, инженерийн техникийн үзүүлэлтүүд
Бүтээх: код болон өгөгдлийн багц
Ажиллуулалт: сургалт/үнэлгээний ажиллуулалт, техник хангамж, үйлчилгээнд байршуулах
Шинжлэх: туршилтууд, загварууд, байршуулалт, гадны ажил
Мэдээлэх: олдворууд, санал хүсэлт, төлөв, шийдвэрүүд
Доор бид кодчиллын агентын токенуудыг энэхүү ангиллын дагуу ангилна.
2026 оны 1-р сараас 8-р сарын хооронд судалгааны үйл ажиллагааны бүх ангилал өссөнийг харж байна. 1-р сард судалгаа болон дэд бүтцийн код давамгай ангилал байв. Энэ ангилал өргөжсөн ч бусад ангилал, ялангуяа техникийн тусламж болон хяналтын ажиллуулалтын өсөлт мөн мэдэгдэхүйц байна. Өндөр түвшний төлөвлөлт агентын гаралтын токенуудын өчүүхэн хэсгийг эзэлсэн хэвээр байна.
Хамт ажиллагсад кодчиллын агентууд дотоод судалгааны дэд бүтцийн асуудлыг шийдвэрлэхдээ онцгой сайн бөгөөд энэ нь судалгааны ахицад учирдаг нэг чухал саад бэрхшээлийг арилгаж байна гэж мэдээлж байна. Өмнө нь судлаачдад туршилтынхаа асуудлыг шийдвэрлэхэд нь туслахаар асуулт, хариултын цаг зохион байгуулдаг байсан хэд хэдэн баг 2026 онд оролцоо буурсныг тэмдэглэсэн бөгөөд нэг баг нь бусад системийн сайжруулалтад анхаарахын тулд асуулт, хариултын цаг зохион байгуулахаа бүрэн зогсоосон байна.
Энд судлаачид бусад багаас техникийн дэмжлэг авдаг үндсэн дотоод сувгуудын нэгэнд өдөр бүр нийтлэгдсэн дээд түвшний постын тоог дүрслэн үзүүлэв. Бидний мэдэж байгаагаар, хүний ажиллуулдаг өөр техникийн дэмжлэгийн суваг руу асуултууд шилжсэнээр энэ сувгийн идэвх буурсан явдал нөхөгдөөгүй байна. Урсгал буурсан нь энэхүү илүү өргөн хүрээтэй шилжилттэй нийцэж байна.
Мөн код бичих агентууд судлаачдын хүссэн даалгавруудыг амжилттай гүйцэтгэж байгаа эсэхийг судалж болно. Агент суурьтай ангилагч ашиглан, бид бодит үр дүнг нь тогтоох боломжтой даалгавруудын хувьд 1-р сараас 7-р сарын хооронд хэд хэдэн хүндрлийн ангилалд (хүн тухайн даалгаврыг гүйцэтгэхэд шаардагдах тооцоолсон хугацаагаар төлөөлүүлсэн) амжилтын хувь ерөнхийдөө өссөнийг тогтоосон. Гэвч агентууд амжилттай ажиллахын тулд хүний ихээхэн чиглүүлэг шаардсаар байгаа, ялангуяа даалгаврын төвөгшил нэмэгдэхийн хэрээр. Сүүлийн 6 сарын хугацаанд амжилттай гүйцэтгэсэн 4-8 цагийн даалгавруудын талаас илүү нь нэг буюу түүнээс олон оролцоотой байсан.
Судлаачийн даалгавруудын амжилтын хувь цаг хугацаа өнгөрөхийн хэрээр нэмэгдсэн. Үр дүн нь тодорхойгүй байсан ангиллууд болон <50 сесстэй эсвэл <50 давтагдашгүй хэрэглэгчтэй цэгүүдийг графикт оруулаагүй.
1-р сараас 7-р сар хүртэлх даалгаврын амжилтын хувь болон хөндлөнгийн оролцооны хувь, хугацаагаар ангилсан. Үр дүн нь тодорхойгүй байсан ангиллуудыг хассан.
Аюулгүй бөгөөд ашиг тустай AGI-д зориулсан илүү чадавхтай системүүдийг хөгжүүлэх ахиц нь ийм ажилд шаардлагатай хамгаалалтын арга хэмжээнээс мөн хамаарна. Эрсдэлийн талаар илүү ихийг мэдэхийн хэрээр шаардлагатай хамгаалалтын арга хэмжээний талаарх бидний үнэлгээ өөрчлөгдөж магадгүй.
Бидний тайлбарласнаар, бид саяхан хяналт, нийцүүлэлт, аюулгүй байдлын стандартаа шинэчилсэн. Энд бид сүүлийн үеийн хязгаарлалтууд судалгааны үйл ажиллагааны нэг талд хэрхэн нөлөөлснийг харуулж байна.
*Энд харуулсан Astra-ийн 7-р сарын 20-ноос 8-р сарын 6-ны хооронд ашигласан тооцооллын нөөцийн дийлэнх нь аюулгүй ажиллагаа болон хамгаалалтын сайжруулалтын хэрэгжилтийг туршихад зориулагдсан байсан.
7-р сарын 20-нд агентууд манай судалгааны дэд бүтцийг эвдсэн болохыг илрүүлсний дараа бид сургалтад ашигладаг контейнер үйлчилгээг түр хугацаанд зогсоож, дараа нь нэмэлт томоохон хязгаарлалтуудтайгаар сэргээсэн.
Багууд бэхжүүлсэн судалгааны орчинд ажиллахаар ажлын урсгалаа дахин тохируулах үед энэ нь RL сургалтын тооцооллын нөөц огцом буурахад хүргэсэн. Дээрх графикт нэвтрүүлэхээр төлөвлөсөн хамгийн сүүлийн үеийн загваруудын бататгах сургалтын хоёр долоо хоногийн завсарлага багтсан. 7 ᠳ᠋ᠤᠭᠠᠷ ᠰᠠᠷᠠ ᠶᠢᠨ 20 ᠡᠴᠡ 8 ᠳ᠋ᠤᠭᠠᠷ ᠰᠠᠷᠠ ᠶᠢᠨ 6 ᠬᠦᠷᠲᠡᠯᠡᠬᠢ Astra ᠠᠩᠭᠢᠯᠠᠯ ᠤᠨ RL ᠲᠤᠷᠰᠢᠯᠲᠠ ᠨᠤᠭᠤᠳ ᠲᠤ ᠠᠶᠤᠯ ᠦᠭᠡᠢ ᠪᠠᠶᠢᠳᠠᠯ ᠪᠣᠯᠤᠨ ᠬᠠᠮᠠᠭᠠᠯᠠᠯᠲᠠ ᠶᠢᠨ ᠰᠠᠶᠢᠵᠢᠷᠠᠭᠤᠯᠤᠯᠲᠠ ᠨᠤᠭᠤᠳ ᠤᠨ ᠬᠡᠷᠡᠭᠵᠢᠭᠦᠯᠦᠯᠲᠡ ᠶᠢ ᠰᠢᠯᠭᠠᠬᠤ ᠵᠣᠷᠢᠯᠭᠠ ᠲᠠᠢ ᠠᠵᠢᠯᠯᠠᠭᠤᠯᠤᠯᠲᠠ ᠨᠤᠭᠤᠳ ᠤᠨ ᠳᠡᠶᠢᠯᠦᠩᠬᠢ (GPU ᠬᠤᠪᠢᠶᠠᠷᠢᠯᠠᠯᠲᠠ ᠪᠠᠷ ᠲᠣᠭᠠᠴᠠᠪᠠᠯ) ᠪᠠᠭᠲᠠᠨᠠ᠃
8-р сарын 7-нд Astra кибер чухал чадавхтай байж болзошгүй манай Preparedness Framework(шинэ цонхонд нээгдэнэ) -ийн дагуу гэх урьдчилсан нотолгоо гарснаар загварт тусгайлан хамаарах нэмэлт аюулгүй байдлын хязгаарлалт хэрэгжиж, Astra загварыг аюулгүй байдлын түвшин өндөр судалгааны орчинд ажиллуулах шаардлагатай болсон. Дараагийн долоо хоногт Astra ангиллын GPU хуваарилалт дахин 59.2% буурсан ч бусад загварын ангилалд хуваарилсан хэмжээ 17.2% өссөн. Энэ өсөлт Astra ангиллын бууралтын ойролцоогоор 85%-ийг нөхөж, шинжилсэн RL ажлын ачааллуудын нийт хуваарилалт үндсэндээ өөрчлөгдөөгүй. Энэ хандлага нь Astra-тай холбоотой ажил хязгаарлагдсан үед зарим сургалт, туршилтыг Astra бус загвар руу шилжүүлсэнтэй нийцэж байна. Мөн шинэ хязгаарлалтад хамрагдсан ажлын ачаалалд ашиглах боломжгүй болсон тооцооллын нөөцийг судлаачид өөр зориулалтаар ашиглаж байгааг харуулсан ажиглалтад тулгуурласан мэдээлэлтэй нийцнэ.
Энэ өгөгдөл нь сургалт болон аюулгүй байдлын талаарх үргэлжилж буй хэлэлцүүлэгт хэрэгтэй дохио өгдөг: Шинэ хяналтууд нэвтрүүлэхэд тооцооллын хүчин чадал үнэ цэнтэй, уян хатан хэвээр байж, судалгааны хүрээнд өөр хэрэглээнд аяндаа чиглэнэ. Урт хугацаанд AI-ийн дэвшлийн хурдны талаарх хэлэлцүүлэг нь шинэ эсвэл санал болгож буй хяналтад хамрагдах тооцооллын хүчин чадлыг хэрхэн хамгийн үр ашигтай ашиглаж болох тухай асуудлыг мөн хамрах ёстой.
Нийцсэн RSI-д чиглэсэн ахиц дэвшил гаргаж, ойлгох нь бидний эрхэм зорилгод чухал юм. Бид арга барилаа үргэлжлүүлэн боловсронгуй болгож, хөгжиж буй ойлголтынхоо талаар тайлагнан, хил хязгаарын системүүдийн талаарх мэдээлэлтэй олон нийтийн мэтгэлцээн, утга учиртай ардчилсан засаглалын төлөө ажиллана.
Агентуудын дэмжлэгтэй AI судалгаа нь одоогоор шинэ хэвээр байгаа бөгөөд үүнийг хэрхэн хэмжих талаар бид суралцсаар байна. Манай судалгааны багуудын үүсгэдэг кодын хэмжээ зэрэг зарим үзүүлэлтийг цуглуулахад харьцангуй хялбар боловч судалгааны ахиц дэвшилтэй ямар холбоотой нь тодорхойгүй тул тайлбарлахад бэрх байдаг. Судлаачдын өгсөн даалгавруудыг агентууд хэр олон удаа амжилттай гүйцэтгэдэг зэрэг судалгааны ахиц дэвшилд илүү шууд төвлөрдөг хэмжүүрүүд нь илүү ашигтай байж болох ч боловсруулах, баталгаажуулахад төвөгтэй. Үүнийг улам хүндрүүлж, судлаачдын ашигладаг хэрэгсэл, системүүд хурдацтай хөгжиж байна. Судалгааны хурдатгалын талаарх бидний ойлголтыг гүнзгийрүүлэх нь OpenAI даяар анхаарал хандуулдаг чухал чиглэл юм.
Эдгээр шинжилгээнд өөрөөр заагаагүй бол:
"Судлаач" гэдэг нь манай судалгааны байгууллагын аль ч гишүүнийг хэлдэг өргөн хүрээтэй нэр томъёо бөгөөд үүнд судалгааны дэд бүтцийг бий болгох, судалгааны төслүүдийг удирдах эсвэл аж ахуйн нэгжийг дэмждэг зарим хүмүүс багтдаг.
Код бичих агентын ашиглалтын хэмжүүрүүд нь судлаачдын тулгуурладаг хэрэгсэл, системүүд хурдацтай хөгжиж буйтай холбоотойгоор нийт ашиглалтын ихэнхийг, гэхдээ бүгдийг нь биш, хамардаг.


