پرش به محتوای اصلی
OpenAI

۱۵ شهریور ۱۴۰۵

تحقیقمقالاتایمنی

شتاب بخشی به پژوهش: نگاهی به درون OpenAI

در حال بارگذاری…

ما معتقدیم برای اینکه AGI به سود همه بشریت باشد، باید به صورت دموکراتیک حکمرانی شود. این امر تنها از طریق گفتگوی عمومیِ آگاهانه درباره توانمندی‌ها، خطرات و ساز و کارهای حفاظتی سامانه‌های هوش مصنوعی بسیار توانمند ممکن است. مردم در همه‌جا باید مسیر احتمالی آینده هوش مصنوعی پیشرو را درک کنند تا بتوانند در نحوه توسعه آن، نقشی معنادار داشته باشند.

شفافیت درخصوص ریسک‌ها، رخدادها و تمهیدات حفاظتی مشخص ضروری است، اما کافی نیست. ما معتقدیم عموم مردم همچنین باید درک کنند که توانمند ترین سیستم‌ها چگونه در حال توسعه هستند و چگونه در آزمایشگاه‌های پیشرو، پیشرفت پژوهشی را پیش می‌برند.

هدف ما ساختنِ ایمنِ یک پژوهشگر خودکار AI است که بتواند تحت نظارت انسانی کار کند تا پیشرفت بیشتری در یادگیری عمیق و همسو سازی ایجاد کند و بهبودهای تکرار شونده را ممکن سازد. بر اساس اندازه گیری‌های ما، اکنون به هدفی که پاییز گذشته اعلام شده بود⁠(در یک پنجره جدید باز می‌شود) ، یعنی داشتن یک کارآموز پژوهشی خودکار تا ماه سپتامبر امسال، رسیده‌ایم. منظور ما از «کارآموز پژوهشی» سامانه‌ای است که بتواند تحت هدایت انسان، وظایف پژوهشیِ تعریف شده را انجام دهد، از جمله وظایفی که برای یک پژوهشگر ماهر چند روز طول می‌کشند. ما در راستای ساختن یک پژوهشگر خودکار AI تا مارس ۲۰۲۸، پیشرفت چشمگیری داریم.

در طول سال جاری، کار روزانه پژوهشگران OpenAI به طور چشمگیری تغییر کرده است. پژوهشگران در طول روز از عامل‌های کد نویسی استفاده می‌کنند (اغلب در نشست‌های همزمان) و میزان استفاده کلی به سرعت در حال افزایش است و از رشد استفاده در دیگر تیم‌های OpenAI پیشی می‌گیرد. پژوهشگران با سرعت بیشتری در ارائهٔ کد مشارکت می‌کنند و آزمایش‌های بیشتری اجرا می‌کنند. روش‌های استفادهٔ پژوهشگران از عامل‌ها نیز در حال تغییر است: عامل‌ها وظایفی هرچه پیچیده‌تر را بر عهده می‌گیرند و بیشتر از گذشته در انجام آن‌ها موفق می‌شوند. پژوهش در حوزهٔ هوش مصنوعی فرآیندی پیچیده با گلوگاه‌های بالقوهٔ فراوان است، بنابراین سرعت کلی پیشرفت احتمالی همگام با این معیارهای مشخص پیش نخواهد رفت. اما در مجموع، این یافته‌ها با برداشت کلی‌تری که بسیاری از ما در داخل داریم همخوان است؛ اینکه ابزارهای عامل محور به طور معناداری پیشرفت پژوهش را شتاب می‌دهند. انسان‌ها همچنان اولویت‌های پژوهشی ما را تعیین می‌کنند، قضاوت می‌کنند که کدام ایده‌ها و نتایج را باید دنبال کنیم، و تصمیم می‌گیرند که آیا سامانه‌ها را گسترش داده، به طور موقت متوقف یا مستقر کنیم.

اگر این کار مسئولانه انجام شود، باور داریم پژوهش خودکار AI به مدل‌هایی منجر خواهد شد که به طور مستقیم رفاه انسان را ارتقاء می‌دهند و مأموریت OpenAI را پیش می‌برند. این کار می‌تواند هزینه هوشمندی پیشرفته را کاهش دهد تا مردم در سراسر جهان بتوانند از آن بهره مند شوند. ما این کار را تا حدی به این دلیل دنبال می‌کنیم که پژوهش خودکار می‌تواند به ما کمک کند مسئله همسو سازی را حل کنیم و در برابر هوش مصنوعیِ روز به روز توانمندتر، سازوکارهای دفاعی بسازیم. یک پژوهشگر خودکارِ هوش مصنوعی می‌تواند پژوهشگر خودکارِ ایمنی یا همراستا سازی نیز باشد. سامانه‌های توانمندتر و همراستا می‌توانند به ایمن سازی زیر ساخت‌های حیاتی، دفاع در برابر عامل‌های خطرناک هوش مصنوعی و توسعه تدابیر حفاظتی جدید کمک کنند.

این‌ها دلایلی برای توسعه توانمندی‌های پژوهشی خودکارِ مفید هستند، اما به این معنا نیست که RSI سریع لزوماً پیامدی است که باید دنبال کنیم. اینکه آیا و چگونه پیش برویم، باید به توانایی ما در حفظ کنترل انسانی و انتخاب‌های دموکراتیک آگاهانه درباره مزایا و خطرها بستگی داشته باشد.

ما هنوز نمی‌دانیم چگونه به طور ایمن تمام مسیر را تا رسیدن به RSI کامل و همسو طی کنیم. ما در تلاشیم اقدامات همسو سازی و ایمنی را همگام با گسترش قابلیت‌ها، مقیاس پذیر کنیم. اما نمی‌توانیم فرض کنیم که پیشرفت در همسوسازی و ایمنی همگام پیش خواهد رفت، و سامانه‌های توانمندتر می‌توانند برای پایش دشوارتر شوند. کار دقیق در زمینهٔ همراستا سازی و ایمنی در مرکز این تلاش قرار دارد و با سنجش و کاهش مشکلات ایمنی‌ای آغاز می‌شود که امروز در سامانه‌های کد نویسی عامل محور مشاهده می‌کنیم. هر زمان تشخیص دهیم که ادامه دادن، خطر ایمنی غیرقابل قبولی ایجاد می‌کند، واکنش مناسبی نشان خواهیم داد؛ از جمله با کند کردن یا متوقف کردن توسعه یا استقرار سامانه‌هایی که تشخیص می‌دهیم قادر به ایمن سازی کافی آن‌ها نیستیم.

پس از رخداد اخیر Hugging Face، این تعهد را عملی کردیم⁠ و آموزش یادگیری تقویتی (RL) را برای جدیدترین مدل‌های‌مان که برای استقرار در نظر گرفته شده‌اند متوقف کردیم؛ در این مدت، محیط‌های پژوهشی خود را بیشتر مقاوم سازی امنیتی کردیم و آن‌ها را با تیم قرمز ارزیابی کردیم و دامنه پوشش سامانه‌های پایش خود را گسترش دادیم. این امر تمام پژوهش‌ها را متوقف نکرد: برخی بارهای کاری تحت کنترل‌های سخت گیرانه‌تر از سر گرفته شدند، در حالی که برخی دیگر همچنان متوقف ماندند. استانداردهای ایمنی و همراستایی خود را ارتقاء داده‌ایم و کار ایمنی را در چرخه عمر مدل عمیق‌تر ادغام کرده‌ایم؛ به گونه‌ای که در سراسر آموزش، شواهد قوی‌تری از رفتار همراستا لازم باشد.

امروز تصویری دقیق ارائه می‌کنیم از اینکه سیستم‌های عامل مند در ماه‌های اخیر چگونه به پیشرفت ما در مسیر RSI کمک کرده‌اند. سامانه‌های عامل مند جدیدند و به سرعت در حال تغییرند، و تلاش‌های ما برای سنجش آن‌ها هنوز مقدماتی است. با به اشتراک گذاری این نتایج اولیه و روش‌های زیر بنای آن‌ها، هدف ما آگاهی بخشی به عموم، تشویق هنجار افشای عمومی، و کمک به حرکت این حوزه به سوی استانداردهای مشترک سنجش است.

در نهایت، همانطور که در طرح سیاستی پیشرو⁠ خود نوشتیم، معتقدیم که ما و دیگر شرکت‌ها باید ملزم باشیم پیشرفت خود به سوی RSI را به صورت عمومی پیگیری کنیم. حتی بدون چنین الزامی، قصد داریم همچنان دربارهٔ پیشرفت خود در زمینهٔ RSI شفاف باشیم. با بهبود روش‌های اندازه گیری و درکمان، رویکرد خود به شفافیت را تکامل خواهیم داد و در عین حال، میان شفافیت و ضرورت حفاظت از امنیت و اطلاعات اختصاصی توازن برقرار خواهیم کرد.

۱. عامل‌های کد نویسی در حال دگرگون کردن کار روزمره پژوهشگران OpenAI هستند

در آغاز امسال، پژوهشگر میانه در OpenAI از نظر میزان استفاده از عامل‌ها، فقط به طور محدود از عامل‌های کد نویسی استفاده می‌کرد. تا اواسط ماه اوت، پژوهشگر میانه روزانه عامل‌ها را در کار خود ادغام می‌کرد و بر اساس قیمت‌های API، روزانه بیش از ۶۰۰ دلار برای استنتاج هزینه می‌کرد. کاربر صدک ۹۰ در سازمان پژوهشی ما اکنون روزانه بیش از ۷٬۰۰۰ دلار توکن مصرف می‌کند.

پیش از ژوئن ۲۰۲۶، مجموع زمان اجرای عامل‌ها در سراسر سازمان پژوهشی همچنان کمتر از مجموع نیروی کار انسانی بود. این موضوع از آن زمان تغییر کرده است. بر حسب یک روز کاری استاندارد ۸ ساعته، از اواسط اوت، سازمان پژوهشی در مجموع به ازای هر روز کاریِ نیروی کار انسانی، از تلاش معادل ۳.۱ روز کاریِ عامل استفاده می‌کند.

روش دیگر برای نگاه کردن به این موضوع، درک تعداد پژوهشگرانی است که از گردش کارهای بسیار همروند استفاده می‌کنند (برای مثال، اجرای همزمان ۴ عامل یا بیشتر). همانطور که در زیر نشان داده شده است، این عدد در حال افزایش است. این ارقام شامل اوج‌های روزانهٔ هر دو نوع عامل است: عامل‌هایی که به طور مستقیم توسط کاربر راه اندازی شده و زیر عامل‌هایی که در مراحل پایین دستی از عامل‌هایی ایجاد شده اند که کاربر به طور مستقیم راه اندازی کرده است.

۲. پژوهشگران کد بیشتری می‌نویسند و آزمایش‌های بیشتری اجراء می‌کنند

بخش زیادی از پژوهش‌های هوش مصنوعی را می‌توان فرآیندی پرزحمت دانست که هدف آن ادغام یک بهبود جدید در هوشمندی یا عملکرد مدل در یکی از مدل‌های اصلی ما است. این فرآیند به مراحل بسیاری وابسته است و توانمندی‌ها زمانی پیشرفت می‌کنند که همه مراحل به درستی در کنار هم پیش بروند: پژوهشگران باید بهبودهای جدید را طراحی کنند، ارزیابی‌هایی برای سنجش عملکرد مدل بنویسند، زیر ساختی برای آزمودن این بهبودها در مقیاس بزرگ ایجاد کرده، در طول آموزش اشکالات و نیز رفتارهای نا ایمن یا نا همراستا را شناسایی کرده، و ایده‌های موفق را در یک اجرای اصلی آموزش ادغام کنند. بروز اختلال در هر بخشی از فرآیند پژوهش می‌تواند کل چرخه را محدود کند.

نوشتن کد و اجرای آزمایش‌ها دو فعالیت اصلی هستند که پژوهشگران به عنوان بخشی از کار خود انجام می‌دهند، و ما شواهدی می‌بینیم که نشان می‌دهد این فرآیندها در حال شتاب گرفتن هستند.

اندازه گیری این نقاط داده نسبتاً آسان است، اما تفسیر آن‌ها می‌تواند دشوار باشد. با پیشرفت خودکار سازی، وظایفی که کمترین قابلیت خودکار سازی را دارند سهم بزرگ‌تری از تلاش پژوهشگران را به خود اختصاص خواهند داد و به گلوگاه‌های مهم پیشرفت‌های آینده تبدیل خواهند شد. توان محاسباتی یکی دیگر از عوامل محدود کنندهٔ پیشرفت است و ممکن است با کاهش سایر گلوگاه‌ها، به مرور زمان اهمیت بیشتری پیدا کند.

در طول سال ۲۰۲۶، تعداد آزمایش‌ها به ازای هر آزمایش‌گر فعال افزایش یافته است و اوت ۲۰۲۶ از زمان آغاز ردیابی در ژانویه ۲۰۲۵، بالاترین میزان ثبت شده تاکنون بوده است. این موضوع با افزایش پذیرش Codex هم‌بستگی دارد، هرچند یادآور می‌شویم که توان محاسباتی در دسترس ما نیز از سال ۲۰۲۵ به طور چشمگیری افزایش یافته است.

۳. کاری که پژوهشگران از عامل‌ها برای آن استفاده می‌کنند در حال تغییر است

هم برداشت‌های کیفی و هم داده‌های داخلی نشان می‌دهند که ترکیب وظایفی که پژوهشگران به عامل های کد نویسی واگذار می‌کنند در حال تغییر است و واگذاری وظایف سطح بالاتر و با افق زمانی بلندتر به مرور رایج‌تر می‌شود.

برای بدست آوردن تصویر روشن‌تری از این روند، استفاده‌های اخیر در سازمان پژوهشی را با استفاده از طبقه بندی تازه منتشرشده‌ای⁠(در یک پنجره جدید باز می‌شود) از انواع مختلف کارهایی که بخشی از چرخه عمر تحقیق‌وتوسعه هوش مصنوعی بوده و Epoch AI آن را توسعه داده است، تحلیل کردیم. این طبقه بندی که از سیستم دیرینه O*NET برای طبقه بندی انواع کار الهام گرفته است، به طور خاص برای تحقیق و توسعه هوش مصنوعی پیشرو طراحی شده و فرآیند را به شش مرحله اصلی تقسیم می‌کند:

  1. تصمیم بگیرید: روی چه چیزی کار کنید، چه چیزی را ادامه دهید، منابع را کجا تخصیص دهید

  2. طراحی: ایده‌های پژوهشی و مشخصات مهندسی

  3. ساخت: کد و مجموعه داده‌ها

  4. اجراء: اجراهای آموزش/ارزیابی، سخت افزار، سرویس دهی

  5. تحلیل کنید: آزمایش‌ها، مدل‌ها، استقرار، کار خارجی

  6. اطلاع رسانی کنید: یافته‌ها، بازخورد، وضعیت، تصمیم‌ها

در ادامه، توکن‌های عامل‌های کد نویسی را بر اساس این رده بندی طبقه بندی می‌کنیم.

مشاهده می‌کنیم که همهٔ دسته‌های فعالیت‌های پژوهشی بین ژانویه و اوت ۲۰۲۶ افزایش داشته‌اند. در ژانویه، دستهٔ غالب، کدهای پژوهشی و زیر ساختی بود. این دسته گسترش یافته است، اما در دسته‌های دیگر نیز افزایش‌های قابل توجهی مشاهده می‌کنیم، به ویژه در کمک فنی و اجرای پایش‌ها. برنامه ریزی سطح بالا همچنان تنها بخش ناچیزی از توکن‌های خروجی عامل را تشکیل می‌دهد.

بر اساس گزارش‌های غیر رسمی، همکاران می‌گویند که عامل‌های کد نویسی در عیب یابی زیرساخت‌های پژوهشی داخلی عملکرد بسیار خوبی دارند؛ موضوعی که یکی از گلوگاه‌های مهم در مسیر پیشرفت پژوهش را برطرف می‌کند. چندین تیم که پیش‌تر برای کمک به پژوهشگران در عیب یابی آزمایش‌های‌شان ساعات پاسخگویی برگزار می‌کردند، گزارش کرده‌اند که میزان حضور در سال ۲۰۲۶ کاهش یافته است، و یکی از آن‌ها برای تمرکز بر انجام سایر بهبودهای سامانه، برگزاری جلسات را به طور کامل متوقف کرده است.

در اینجا، تعداد پست‌های اصلیِ روزانه را در یکی از کانال‌های داخلی اصلی، که پژوهشگران در آن از تیم‌های دیگر درخواست پشتیبانی فنی می‌کنند، نمودار می‌کنیم. تا آنجا که ما می‌دانیم، کاهش فعالیت این کانال با انتقال درخواست‌ها به کانال پشتیبانی فنی دیگری که توسط نیروی انسانی اداره می‌شود، جبران نشده است. کاهش ترافیک با این تغییر گسترده‌تر همسو است.

همچنین می‌توانیم بررسی کنیم که آیا عامل‌های کد نویسی در انجام وظایفی که پژوهشگران درخواست می‌کنند موفق هستند یا خیر. با استفاده از یک طبقه بند عامل محور، دریافتیم که از ژانویه تا ژوئیه، نرخ‌های موفقیت به طور کلی در چندین دستهٔ دشواری (که با زمان برآورد شدهٔ مورد نیاز یک انسان برای تکمیل کار به عنوان شاخص جایگزین سنجیده شده‌اند) برای کارهایی که می‌توانیم برایشان یک نتیجهٔ حقیقت مبنا بیابیم، افزایش یافته‌اند. با این حال، عامل‌ها همچنان برای موفقیت به هدایت انسانی قابل توجهی نیاز دارند، به ویژه با افزایش پیچیدگی وظایف. در ۶ ماه گذشته، بیش از نیمی از وظایف موفق ۴ تا ۸ ساعته شامل یک یا چند مداخله بودند.

نرخ‌های موفقیت در وظایف پژوهشگران به مرور زمان افزایش یافته‌اند. نمودار، طبقه بندی‌هایی را که نتیجهٔ آن‌ها نامشخص بوده و نقاطی با <۵۰ نشست یا <۵۰ کاربر یکتا را مستثنی می‌کند.

موفقیت وظیفه و نرخ مداخله از ژانویه تا ژوئیه، تفکیک شده بر اساس افق زمانی. طبقهبندی‌هایی را که نتیجهٔ آن‌ها نامشخص بوده است، مستثنی می‌کند.

۴. تنظیم سرعت توسعه مدل

پیشرفت به سوی سیستم‌های توانمندتر برای AGI ایمن و سودمند، به تدابیر حفاظتی مورد نیاز برای چنین کاری نیز وابسته خواهد بود. ممکن است ارزیابی ما از تدابیر حفاظتیِ لازم، با کسب اطلاعات بیشتر دربارهٔ خطرات تغییر کند.

همانطور که توضیح داده‌ایم،⁠ ما اخیراً استانداردهای خود را برای پایش، همسویی و امنیت بروز رسانی کرده‌ایم. در اینجا، نشان می‌دهیم که محدودیت‌های اخیر چگونه بر یکی از جنبه‌های فعالیت پژوهشی تأثیر گذاشته‌اند.

*بخش عمدهٔ توان محاسباتی Astra که اینجا بین ۲۰ ژوئیه و ۶ اوت نشان داده شده، برای آزمایش پیاده سازی بهبودهای ایمنی و امنیتی در نظر گرفته شده بود.

در ۲۰ ژوئیه، پس از کشف این موضوع که عاملان به زیرساخت پژوهشی ما نفوذ کرده‌اند، ما سرویس کانتینر مورد استفاده برای آموزش را به طور موقت خاموش کردیم و سپس آن را با محدودیت‌های اضافی قابل توجه دوباره برقرار کردیم.

این امر به کاهش شدیدی در محاسبات آموزش RL منجر شد، در حالی که تیم‌ها جریان‌های کاری خود را برای فعالیت در محیط پژوهشی سخت سازی شده باز پیکر بندی می‌کردند. نمودار بالا شامل توقف دو هفته‌ای یادگیری تقویتی روی جدید ترین مدل‌های ما که برای استقرار در نظر گرفته شده‌اند است. آزمایش‌های RL کلاس Astra بین ۲۰ ژوئیه و ۶ اوت شامل اکثریت اجراها (بر اساس تخصیص GPU) هستند که با هدف آزمودن پیاده سازی بهبودهای ایمنی و امنیتی در نظر گرفته شده‌اند.

در ۷ اوت، شواهد اولیه مبنی بر اینکه Astra ممکن است قابلیت‌های سایبری بحرانی داشته باشد⁠ بر اساس چهار چوب آمادگی⁠(در یک پنجره جدید باز می‌شود) ما، به اعمال محدودیت‌های امنیتی اضافی و مختص مدل منجر شد که اجرای مدل Astra را در محیط‌های پژوهشی با امنیت بالاتر الزامی می‌کرد. در هفته بعد، تخصیص GPU به مدل‌های رده Astra، ۵۹.۲ درصد دیگر کاهش یافت، اما تخصیص به رده‌های دیگر مدل‌ها ۱۷.۲ درصد افزایش یافت. آن افزایش حدود ۸۵ درصد از افت رده Astra را جبران کرد و باعث شد کل تخصیص در بارهای کاری RL تحلیل شده تا حد زیادی بدون تغییر باقی بماند. این الگو با جایگزینی بخشی از آموزش و آزمایش با مدل‌های غیر-Astra در زمانی که کارهای مرتبط با Astra محدود شده بود سازگار است و با گزارش‌های موردیِ پژوهشگرانی همخوانی دارد که برای توان پردازشی‌ای که دیگر نمی‌توانستند برای بارهای کاری مشمول محدودیت‌های جدید به کار گیرند، کاربردهای دیگری یافتند.

این داده نشانه‌ای مفید برای گفتگوهای جاری دربارهٔ آموزش و ایمنی فراهم می‌کند: وقتی کنترل‌های جدید معرفی می‌شوند، توان محاسباتی همچنان ارزشمند و انعطاف پذیر باقی می‌ماند و به طور طبیعی به سمت کاربردهای جایگزین درون مجموعهٔ پژوهشی هدایت خواهد شد. در بلندمدت، بحث‌ها درباره سرعت پیشرفت هوش مصنوعی باید به این پرسش نیز گسترش یابد که توان محاسباتی‌ای که مشمول کنترل‌های جدید یا پیشنهادی است، چگونه می‌تواند به بهترین نحو مورد استفاده قرار گیرد.

۵. مسیر پیش رو

پیشرفت کردن و درک پیشرفت به سوی RSI همسو، برای مأموریت ما مهم است. ما به اصلاح روش‌های خود، گزارش درک در حال تکامل‌مان و تلاش برای شکل گیری بحثی عمومی و آگاهانه و حکمرانی دموکراتیک معنا دار بر سامانه‌های پیشرو ادامه خواهیم داد.

ضمیمه: روش‌های ما برای این مطلب

پژوهش هوش مصنوعیِ مبتنی بر عامل هنوز حوزه‌ای نو است و ما هنوز در حال یادگیری چگونگی سنجش آن هستیم. برخی شاخص‌ها، مانند میزان کدی که تیم‌های پژوهشی ما تولید می‌کنند، جمع آوری‌شان نسبتاً آسان است، اما تفسیرشان دشوار است، زیرا رابطهٔ آن‌ها با پیشرفت پژوهش نامشخص است. سنجه‌هایی که به طور مستقیم تری بر پیشرفت پژوهش تمرکز دارند—مانند اینکه عامل‌ها چند وقت یکبار در انجام وظایفی که پژوهشگران به آن‌ها محول می‌کنند موفق می‌شوند—می‌توانند سودمندتر باشند، اما توسعه و اعتبار سنجی آن‌ها پیچیده است. این موضوع دشواری را بیشتر می‌کند: ابزارها و سامانه‌هایی که پژوهشگران به آن‌ها اتکاء می‌کنند، به سرعت در حال تکامل‌اند. تعمیق درک ما از شتاب گیری پژوهش، یکی از حوزه‌های تمرکز مهم در سراسر OpenAI است.

در سراسر این تحلیل‌ها، مگر اینکه خلاف آن ذکر شده باشد:

  • «پژوهشگر» اصطلاحی گسترده برای هر عضوی از سازمان تحقیقاتی ما است، از جمله افرادی که زیرساخت پژوهشی می‌سازند، پروژه‌های پژوهشی را مدیریت می‌کنند، یا به نحوی دیگر از این مجموعه پشتیبانی می‌کنند.

  • معیارهای استفاده از عامل‌های کد نویسی، با توجه به تکامل سریع ابزارها و سیستم‌هایی که پژوهشگران به آن‌ها متکی هستند، بیشترِ موارد استفاده، اما نه همهٔ آن‌ها را پوشش می‌دهند.