تخطي إلى المحتوى الرئيسي
OpenAI

6 سبتمبر 2026

السلامةالبحث

عقل غريب

بقلم: ياكوب باتشوكي، كبير العلماء في OpenAI

جاري التحميل...

في منتصف عام 2023، رأينا ضمن مشروع «RLSlow» البحثي أولى النتائج التي منحتنا الثقة بأننا سنتمكن من توسيع نطاق تدريب نماذج الاستدلال، بما يطلق قدرة النماذج المدربة مسبقًا على تكوين سلاسل الاستدلال الخاصة بها. قضيت أنا وشيمون تلك الليلة في المكتب، ولم نكن نفكر في أرقام الاختبارات المعيارية المذهلة أو المنتجات أو النتائج العلمية التي ستوفرها هذه التقنية، بل كنا نحاول استيعاب الحقيقة المقلقة بأننا سنشهد بالفعل في حياتنا آلات أذكى منا بوضوح، وأن ملامح هذه الأنظمة باتت أمامنا؛ ونتساءل كيف ننبه الناس إلى أهمية ذلك.

بعد ثلاثة أعوام، أصبحت نماذج اللغة القائمة على الاستدلال جزءًا سريع النمو من الاقتصاد، وبدأت تدفع حدود العلم إلى آفاق جديدة. وهي قادرة على تشغيل الحواسيب والواجهات الرسومية، والتعاون مع البشر ومع بعضها، وتنفيذ مشروعات بحثية. كما أنها تعيد تشكيل مشهد أمن الحاسوب، وهو ما ينطوي على أخطار جديدة واضحة.

شهدت هذه الفترة قدرًا كبيرًا من الأبحاث الجديدة، وأصبح فهمنا لهذه الأنظمة مختلفًا قليلًا مرة أخرى عما كان عليه في عام 2023. واستنادًا إلى نتائج داخلية، أتوقع بقوة إمكان استمرار وتيرة التقدم هذه وصولًا إلى التحسين الذاتي التكراري. إذا واصل تطوير الذكاء الاصطناعي مساره الحالي، فمن المرجح أن تحقق الأنظمة التي سنراها خلال الأعوام القليلة المقبلة قفزات إضافية في القدرات تماثل القفزات السابقة أو تفوقها، وأن تقود تطويرها بنفسها على نحو متزايد.

هذه مرحلة تستدعي أقصى درجات الحذر. أشعر بالقلق من أن أحدًا ليس مستعدًا لعواقب استمرار الارتفاع السريع في ذكاء الآلات. ستواصل OpenAI البحث عن حلول تقنية للمواءمة والمراقبة، وبناء أنظمة دفاعية، ووقف المزيد من التوسع من جانب واحد عند الحاجة؛ لكنني أعتقد أن تدخلات أوسع نطاقًا ضرورية.

عقل لا نفهمه تمامًا

على المستوى العام، تدفع زيادة القدرة الحاسوبية التقدم في الذكاء الآلي. في OpenAI، استوعبنا ذلك بعمق نحو عام 2017، بعدما رأينا عوائد ثابتة لتوسيع النطاق عبر عدة مشروعات بحثية1. ونتيجة لذلك، سعينا إلى الوصول إلى قدرة حاسوبية تفوق كثيرًا ما خططنا له في البداية، ووجّهنا أبحاثنا بصورة متزايدة نحو عدد محدود من الاتجاهات العالية القابلية للتوسع. اعتقدنا أن ذلك هو سبيلنا الوحيد للبقاء في طليعة أبحاث الذكاء الاصطناعي والتأثير في تبعات الذكاء الاصطناعي العام (AGI).

وقد طُورت في الطريق خوارزميات جديدة، وحققت الفرق والباحثون الأفراد إنجازات مبتكرة جديدة. أراها إلى حد كبير اكتشافات على مسار التوسع؛ فعلم التعلم العميق لا يزال ناشئًا، وغالبًا ما يرتبط التقدم الخوارزمي المهم بإمكانية الوصول إلى القدرة الحاسوبية. وعند النظر إلى أفق يمتد عدة أعوام، نجد أن الذكاء الاصطناعي يواصل اكتساب المزيد من الذكاء كلما توسع تشغيله على حواسيب أكبر.

واتساقًا مع تنبؤات راي كورزويل في أواخر القرن العشرين(يفتح في نافذة جديدة)، نجد أنفسنا الآن عند لحظة في تاريخ الحوسبة بدأ فيها الذكاء الآلي يتجاوز الذكاء البشري بطرق تُحدث تحولات جذرية.

الذكاء الاصطناعي ينمو أكثر مما يُصمَّم؛ فهو في المقام الأول نتاج تكرار خطوة تحسين مباشرة مرات كثيرة باستخدام قدر من الحوسبة يصعب تصوره. وينتج عن ذلك نظام بالغ التعقيد يتعامل مع مفاهيم مجردة ويستطيع محاكاة جوانب من السلوك البشري. يمكننا اكتشاف رؤى متنوعة حول آليات صغيرة تنشأ داخل هذا النظام، في عملية تشبه علم الأعصاب؛ وكما في علم الأعصاب، يتعذر وصف عمله الكلي بطريقة نفهمها تمامًا.

تُعد دراسة الذكاء الاصطناعي القائم على التعلم العميق علمًا تجريبيًا إلى حد كبير. نبذل جهدًا كبيرًا لبناء خوارزميات قائمة على مبادئ ووضع تنبؤات قابلة للاختبار، لكن عمليات التدريب على نطاق واسع لدينا هي في جوهرها تجارب، وتفاجئنا نتائجها أحيانًا. وفوق ذلك، تزداد صعوبة تفسير النتائج كلما أصبحت الأنظمة أشد قدرة.

ويزداد الأمر تعقيدًا لأن الخوارزميات الحالية تحسن عمومًا القدرات السهلة القياس بوتيرة أسرع من القدرات التي يصعب قياسها موضوعيًا. نقضي وقتًا طويلًا في محاولة فهم كيفية تعميم القدرات، وما ينبغي إعطاؤه الأولوية لتطوير المهارات التي ستكون الأهم خلال الأعوام القليلة المقبلة. فمثلًا، نعتقد أن بوسعنا تحسين النماذج في أبحاث الرياضيات تحديدًا بمزيد من التركيز، لكننا لا نعطي هذا الاتجاه الأولوية بسبب ما نشعر به من إلحاح بشأن التحسين الذاتي التكراري وأبحاث المواءمة الآلية، كما سأناقش لاحقًا.

لا يمكن مقارنة الذكاء الناتج عن توسيع نطاق التعلم العميق مباشرةً بالذكاء البشري. لكي يصبح الذكاء الاصطناعي شديد التأثير في العالم الحقيقي، سواء كان بالغ النفع أو بالغ الخطورة، لا يحتاج إلى مضاهاة جميع القدرات البشرية أو تجاوزها؛ بل يكفيه التفوق في عدد كافٍ منها. ومع استمرار تفوقه على البشر في المزيد من الجوانب، تزداد صعوبة فهم مدى قدرته على وجه الدقة.

تعليم الآلات أن تحب

لأن الذكاء الآلي ينشأ من عملية تختلف جذريًا عن الذكاء البشري، فلا يمكننا افتراض أنه يلتزم تلقائيًا بالمبادئ البشرية أو يعمم انطلاقًا منها بطريقة شبيهة بالبشر. المشكلة الجوهرية في أبحاث الذكاء الاصطناعي هي المواءمة، أي جعل الذكاء الاصطناعي «يحاول فعل الصواب» وفق المعايير البشرية.

ولتنظيم اتجاهات البحث العملية، أجد من المفيد التمييز بين مواءمة الأهداف ومواءمة القيم.

ومواءمة الأهداف تعني، بوجه عام: «هل يحاول الذكاء الاصطناعي تحقيق الهدف المحدد له؟». وقد يشمل ذلك أمورًا مثل الالتزام بالتسلسل الهرمي للتعليمات، أو القدرة على التواصل والتعاون مع البشر ومحاولة فهم أهدافهم. وقد أثبتت هذه المجموعة من الاتجاهات أهمية عملية بالغة.

أما مواءمة القيم فهي خاصية أكثر تجذرًا في النموذج. إنها القدرة على تبني مجموعة رفيعة المستوى من المبادئ والتعميم انطلاقًا منها، والتصرف «بعقلانية» حتى عند تلقي أهداف غامضة أو متعارضة، أو عند الوجود في مواقف غير مألوفة أو عدائية. ينبغي للذكاء الاصطناعي الموائم أن يتصرف بصدق ونزاهة ومحبة للبشرية.

وبالطبع، قد يكون الحد الفاصل بين مواءمة القيم والأهداف ضبابيًا، فالاهتمام الحقيقي بالأهداف يتطلب محاولة استنباط النية(يفتح في نافذة جديدة) والقيم الكامنة وراءها. لكنني حين أتحدث عمومًا عن أهمية أبحاث المواءمة على المدى الطويل، فإنني أقصد مواءمة القيم.

التحدي الأساسي لمواءمة الذكاء الاصطناعي هو التعميم. كلما ازدادت الآلات ذكاءً، بدأت تتعامل مع مفاهيم أرفع مستوى وتعمل في بيئات تختلف باطراد عن تلك التي واجهتها أثناء التدريب. وقد تفشل في تعميم القيم التي تعلمتها وتعززت لديها أثناء التدريب على تلك المواقف الجديدة، وقد يصعب علينا التأكد من كيفية تصرفها. ويزداد الأمر صعوبة لأن المنظومة العامة التي تُستخدم فيها أنظمة الذكاء الاصطناعي تتغير بسرعة كبيرة؛ فمثلًا، يجب أن تكون الأنظمة المدربة اليوم قادرة على التفاعل بثبات مع طيف متنوع من أنظمة الذكاء الاصطناعي الأخرى. والأهم أننا نحتاج إلى أن تظل أنظمة الذكاء الاصطناعي المستقبلية متمسكة بالقيم البشرية، سواء اعتقدت أنها خاضعة لإشراف بشري أم لا.

هناك فئتان رئيسيتان من الأساليب المستخدمة عمليًا حاليًا في التدريب على المواءمة.

تتمثل الأولى في تشجيع السلوك الموائم ضمن التعلم بالتعزيز الموجه نحو الأهداف. تُقيّم أفعال النموذج، عادةً بواسطة ذكاء اصطناعي، بحسب اتساقها مع نموذج تفضيلات أو «مواصفات» أو «دستور» معين، ثم تُمنح المكافآت وفقًا لذلك. يمكن أن يكون هذا النهج فعالًا جدًا في الحالات المعتادة، وهو جزء أساسي من طريقة صنع مساعدي الذكاء الاصطناعي الحديثين. لكنه قد يكون هشًا للأسف، ويعتمد بشدة على شمول الرقابة التدريبية وقدرة النموذج على التعميم انطلاقًا من المواقف التي واجهها أثناء التدريب. على سبيل المثال، التزم الوكلاء في حادثة OpenAI-Hugging Face بحد يمنع استخدام الهندسة الاجتماعية ضد البشر. لكنهم أخفقوا بوضوح في الامتناع عن أفعال أخرى خرجت عن النطاق وخالفت روح القيم التي تعلموها في سياقات أخرى.

يسعى النهج الثاني إلى الاستفادة من قدرة النموذج على التعميم انطلاقًا من بيانات التدريب المسبق. وقد يتضمن إعداد مجموعات بيانات تدريبية تحفّز المواءمة، أو تركيز النموذج على جزء «موائم» من توزيع التدريب المسبق، كما في نموذج اختيار الشخصية(يفتح في نافذة جديدة) مثلًا. يكمن ضعف هذا النهج في افتقاره إلى الصمود أمام المزيد من ضغط التحسين. إذا أخذت نموذجًا يفكر عمومًا بأفكار تبدو 'موائمة'، ثم أخضعته لتدريب كافٍ يعلّمه تحقيق أهداف شديدة الصعوبة، فقد يتعلم الاستدلال بدوافع منحازة، فيطوّع الأفكار التي تبدو 'موائمة' حسب الحاجة لتحقيق الهدف. وربما شهدنا مثالًا لهذا السلوك في حوادث أمن سيبراني حديثة تورط فيها نموذج لا يتبع OpenAI.

نستثمر بكثافة في مختلف النهج الواقعة ضمن الطيف الذي تحدده هذه الاتجاهات. ونرى أيضًا تقدمًا ملموسًا؛ فنموذج GPT‑6 Astra هو أول نموذج يستفيد من بعض التحسينات المهمة التي نعمل عليها منذ وقت طويل، ومواءمته أفضل بكثير من GPT‑5.6 Sol. ومع ذلك، من المهم الإقرار بأن ازدياد قدرات النماذج يتطلب تقدمًا أكبر بكثير، وفهم أن التقدم في المواءمة القابلة للتعميم قد لا يتفوق بالقدر الكافي على التقدم في الذكاء العام للنماذج.

مراقبة التعميم

ليست لدينا نظرية مُرضية للتعميم، ويبدو من المستبعد أن نتمكن من تطوير واحدة قريبًا، على الأقل من دون مساعدة ذكاء اصطناعي أقوى. لذلك، يمكن القول إن قدرتنا حاليًا على التحقق تجريبيًا من تقنيات المواءمة لدينا أهم عمليًا حتى من تقنيات المواءمة نفسها.

كان رهان OpenAI الأساسي هنا هو مراقبة سلسلة الاستدلال(يفتح في نافذة جديدة). ويستند ذلك إلى فكرة جذابة قابلة للتوسع: جانب كبير من قدرة النموذج نابع من عملية استدلال مصاغة بالكلمات (سلسلة الاستدلال). إذا وسّعنا نطاق تحسين نتائج تلك العملية من دون الإشراف على العملية نفسها، فلن يكون لدى سلسلة الاستدلال أي حافز تدريبي مباشر لإخفاء أفكار أو أهداف غير موائمة. لا يعني هذا أن النموذج سيتعلم إظهار النزعات غير الموائمة التي لا تعتمد على سلسلة الاستدلال، لكنه قد يتيح لنا مراقبة الزيادة في القدرة الناتجة تحديدًا عن الاستدلال.

أدركنا الأهمية المحتملة لمراقبة سلسلة الاستدلال بالتزامن مع تطويرنا لنماذج الاستدلال. عندما طرحنا o1‑preview، صممنا المنتج عمدًا كي يخفي سلسلة الاستدلال، لحمايتها من ضغط الإشراف على المدى الطويل2. ومنذ ذلك الحين، سعينا أثناء التطوير إلى الالتزام بقاعدة عدم الإشراف على عملية الاستدلال. أصبحت مراقبة سلسلة الاستدلال أداة بالغة الأهمية لدراسة كيفية تعميم نماذجنا انطلاقًا من توزيع بيانات تدريبها، إذ أتاحت لنا رصد أفعالها وتحليلها، وكذلك عمليتها الداخلية.

وتظل هذه الأداة حاسمة في دراستنا لفئة نماذج Astra. لكن تقييماتنا تشير، للأسف، إلى أن قدرتنا على الاعتماد على مراقبة سلسلة الاستدلال تتراجع تدريجيًا. ويرجع ذلك إلى مجموعة من العوامل.

  • تُستخدم نماذج الاستدلال الحديثة في بيئات أعقد من بيئات o1‑preview، وتتداخل عملية استدلالها على نحو متزايد مع التواصل مع البشر وأنظمة الذكاء الاصطناعي الأخرى واستخدام الأدوات. ويجب الإشراف على كثير من هذه التفاعلات، ما يطمس الحد الفاصل الذي نهدف إلى الحفاظ عليه.
  • يصبح الذكاء الاصطناعي أفضل في الاستدلال بشأن عملية استدلاله نفسها والتلاعب بها.
  • ومع تحسن أداء التدريب المسبق، نرى أيضًا أن النماذج تصبح أذكى بكثير حتى من دون استخدام أي استدلال مصاغ بالكلمات.

هذه التحديات ليست عصية بالضرورة على الحل. ويحدوني الأمل في أن نطور تدخلات تحسن قابلية مراقبة سلسلة الاستدلال في نماذجنا، مثل التوصل إلى فهم أفضل للتفاعل بين أهداف التحسين المختلفة وأشكال الحوسبة وقت الاختبار التي يستخدمها النموذج. وأعتقد أيضًا أن الجمع بين أفكار مراقبة سلسلة الاستدلال ومراقبة التنشيطات قد يحقق قيمة كبيرة، وذلك بتوسيع نطاق تدريب أدوات المراقبة التي تصل مباشرةً إلى البنية الداخلية للشبكة، مثل الاعترافات(يفتح في نافذة جديدة). ونحن نعمل بنشاط على متابعة هذه الأفكار. ومع ذلك، أتوقع أن تتزايد عرقلة تقدم الذكاء الاصطناعي العام بسبب محدودية الثقة في المراقبة.

دفاع قابل للتوسع

أقوى حجة أراها لمواصلة تدريب نماذج أشد ذكاءً بوتيرة سريعة هي ضرورة بناء أنظمة دفاعية في مواجهة الأخطار التي يشكلها ذكاء اصطناعي آخر.

من المخاطر الواضحة التي نوقشت طوال هذا العام خطر الأمن السيبراني؛ فالنماذج تكتسب قدرات تفوق البشر على اختراق أنظمة الحاسوب والخروج منها. وهذا يوسّع بشدة نطاق المخاطر المرتبطة بالذكاء الاصطناعي؛ إذ سيتمكن الوكلاء من الوصول إلى كل البنى التحتية باستثناء الأشد تحصينًا، والتأثير مباشرةً في جانب كبير من العالم، حتى من دون جسد مادي. نحن حاليًا أمام فرصة زمنية ضيقة لاستخدام أفضل النماذج المتاحة من أجل تعزيز أمن الأنظمة الحيوية بدرجة كبيرة.

وللأسف، ستزداد المخاطر المرتبطة بالذكاء الاصطناعي من الآن فصاعدًا. يشكل وكيل بالغ القدرة، دُرّب ووُجّه صراحةً لتنفيذ أعمال خبيثة، نوعًا جديدًا من الخطر؛ فمن المرجح أن يتجاوز نطاق نية الـOperator وأن يعمم سلوكه إلى أفعال قد تكون أشد خبثًا بكثير. سيتلاشى الحد الفاصل بين إساءة الاستخدام والأفعال الذاتية غير الموائمة كلما ازدادت استقلالية الذكاء الاصطناعي. قد نكون معتادين على النظر إلى الذكاء الاصطناعي بوصفه أدوات، لكن بعض الوكلاء سيسعون إلى تحقيق أهدافهم الخاصة. وسيجدون سبلًا للتعاون مع البشر عبر التفاوض معهم أو خداعهم أو ابتزازهم.

إضافة إلى ذلك، هناك مخاطر ناجمة عن تقنيات جديدة قد يتيحها الذكاء الاصطناعي، مثل مسببات الأمراض المهندسة.

سنحتاج للدفاع إلى ذكاء اصطناعي قوي وموائم، بهدف تأمين البنية التحتية والحماية الفورية من الوكلاء المارقين وابتكار تدابير وقائية جديدة كليًا. وسيكون هذا محورًا أساسيًا في جهود OpenAI لنشر الذكاء الاصطناعي.

وفي الوقت نفسه، رغم عدم اليقين المصاحب للتقدم الواسع المتوقع في الذكاء الاصطناعي وضرورة بناء أنظمة دفاعية، يجب ألا نسمح بأن يصبح ذلك ذريعة للتهور. تبدو فكرة الاندفاع في السباق مهما كان الثمن عبثية ما إن نستوعب جسامة ما هو على المحك.

Pacing RSI

Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.

Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.

I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.

The best way forward I see currently is a combination of both.

The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(يفتح في نافذة جديدة), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(يفتح في نافذة جديدة), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.

Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(يفتح في نافذة جديدة) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.

The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.

What is next?

As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:

  1. Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
  2. Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
  3. Empowering everyone individually with a personal AGI.

I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.

As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.

Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.

Author

Jakub Pachocki

الحواشي

  1. 1
  2. 2

    وكان منع التقطير سببًا ثانويًا لهذا التصميم. لكن الحفاظ على قابلية مراقبة سلسلة الاستدلال كان صراحةً أولويتنا الأكبر طوال عملية التطوير.