Ana içeriğe atla
OpenAI

Araştırmaların hızlanması: OpenAI'dan bir bakış

Yükleniyor...

AGI (genel yapay zeka) tüm insanlığa fayda sağlayacaksa demokratik biçimde yönetilmesi gerektiğine inanıyoruz. Bu ancak çok yetenekli yapay zeka sistemlerinin yetenekleri, riskleri ve koruma önlemleri hakkında bilgiye dayanan bir toplumsal tartışmayla mümkün olabilir. Dünyanın her yerinde insanlar, en üst seviye yapay zekanın gelişiminde anlamlı biçimde söz sahibi olabilmek için gelecekte nasıl bir yol izlemesinin beklendiğini anlamalı.

Belirli riskler, olaylar ve koruma önlemleri konusunda şeffaflık gerekli, ancak tek başına yeterli değil. Kamuoyunun, en üst seviye araştırma laboratuvarlarında en yetenekli sistemlerin nasıl geliştiğini ve araştırmaları nasıl ilerlettiğini de anlaması gerektiğine inanıyoruz.

İnsan gözetiminde çalışarak derin öğrenme ve uyumlanma alanlarında ilerleme sağlayabilen, böylece yinelemeli iyileştirmeleri mümkün kılan otomatik bir yapay zeka araştırmacısını güvenli biçimde geliştirmeyi amaçlıyoruz. Ölçümlerimize göre, geçen sonbaharda duyurduğumuz⁠(yeni bir pencerede açılır) bu yılın Eylül ayına kadar otomatik bir araştırma stajyeri geliştirme hedefine artık ulaştık. "Araştırma stajyeri" ile, yetkin bir araştırmacının birkaç gününü alacak işler de dahil olmak üzere, açıkça tanımlanmış araştırma görevlerini insan yönlendirmesiyle yerine getirebilen bir sistemi kastediyoruz. Mart 2028'e kadar otomatik bir yapay zeka araştırmacısı geliştirme yolunda önemli ilerleme kaydediyoruz.

Bu yıl OpenAI araştırmacılarının günlük çalışmaları önemli ölçüde değişti. Araştırmacılar gün boyunca, çoğu zaman eş zamanlı oturumlarda, kodlama ajanlarını kullanıyor. Toplam kullanım, diğer OpenAI ekiplerindeki artışı geride bırakarak hızla yükseliyor. Araştırmacılar daha hızlı kod katkısı sağlıyor ve daha fazla deney yürütüyor. Araştırmacıların ajanları kullanma biçimleri de değişiyor: Ajanlar giderek daha karmaşık görevleri üstleniyor ve bu görevlerde daha sık başarılı oluyor. Yapay zeka araştırması, pek çok olası darboğaz içeren karmaşık bir süreç. Bu nedenle genel ilerleme hızı muhtemelen bu belirli ölçütlerdeki artışa ayak uydurmayacak. Yine de genel olarak bu bulgular, kurum içinde birçoğumuzun edindiği daha geniş bir izlenimle örtüşüyor: Ajan tabanlı araçlar araştırmalardaki ilerlemeyi kayda değer ölçüde hızlandırıyor. Araştırma önceliklerimizi yine insanlar belirliyor, hangi fikir ve sonuçların peşinden gidileceğini değerlendiriyor, sistemleri ölçeklendirme, duraklatma veya kullanıma sunma kararlarını veriyor.

Sorumlu biçimde yürütüldüğünde otomatik yapay zeka araştırmalarının, insan refahını doğrudan artıran ve OpenAI'ın misyonuna katkıda bulunan modeller ortaya çıkaracağına inanıyoruz. Gelişmiş zekanın maliyetini düşürerek dünyanın her yerindeki insanların bundan yararlanmasını sağlayabilir. Bu çalışmaları yürütmemizin nedenlerinden biri, otomatik araştırmaların uyumlanma sorununu çözmemize ve giderek daha yetenekli yapay zekaya karşı savunmalar geliştirmemize yardımcı olabilmesi. Otomatik bir yapay zeka araştırmacısı, güvenlik veya uyumlanma alanında da otomatik araştırmalar yürütebilir. Daha yetenekli ve uyumlanmış sistemler, kritik altyapıyı güvence altına almaya, tehlikeli yapay zeka ajanlarına karşı savunma sağlamaya ve yeni koruma önlemleri geliştirmeye yardımcı olabilir.

Bunlar, faydalı otomatik araştırma yetenekleri geliştirmek için gerekçeler sunuyor. Ancak hızlı RSI'ın (kendi gelişimini besleyen kendini geliştirme döngüsünün) mutlaka ulaşmaya çalışmamız gereken bir sonuç olduğu anlamına gelmiyor. İlerleyip ilerlemeyeceğimiz ve nasıl ilerleyeceğimiz, insan kontrolünü koruyabilmemize ve fayda ve riskler konusunda bilgiye dayalı demokratik tercihlere bağlı olmalı.

Uyumlanmış, tam RSI'a güvenli biçimde nasıl ulaşacağımızı henüz bilmiyoruz. Yetenekler geliştikçe uyumlanma ve güvenlik önlemlerini de ölçeklendirmek için çalışıyoruz. Ancak uyumlanma ve güvenlikteki ilerlemenin aynı hızda süreceğini varsayamayız. Daha yetenekli sistemleri izlemek de zorlaşabilir. Titizlikle yürütülen uyumlanma ve güvenlik çalışmaları bu çabanın merkezinde yer alıyor. Bu çalışmalar, bugün ajan tabanlı kodlama sistemlerinde gördüğümüz güvenlik sorunlarını ölçüp azaltmakla başlıyor. İlerlemenin kabul edilemez bir güvenlik riski doğuracağını tespit ettiğimizde gereken adımları atacağız. Buna, yeterli koruma sağlayamadığımız sistemleri geliştirmeyi veya kullanıma sunmayı yavaşlatmak ya da durdurmak da dahil.

Yakın zamanda yaşanan Hugging Face olayının ardından, bu taahhüdü hayata geçirdik⁠. Araştırma ortamlarımızın güvenliğini artırıp bu ortamları redteaming testlerinden geçirirken ve izleme sistemlerimizin kapsamını genişletirken, kullanıma sunmayı planladığımız en yeni modellerde pekiştirmeli öğrenme (RL) eğitimine ara verdik. Bu, tüm araştırmaları durdurmadı: Bazı iş yükleri daha sıkı kontroller altında yeniden başlatılırken diğerlerine verilen ara sürdü. Güvenlik ve uyumlanma standartlarımızı yükselttik. Eğitimin tüm aşamalarında uyumlanmış davranışa dair daha güçlü kanıtlar arayarak güvenlik çalışmalarını model yaşam döngüsüne daha kapsamlı biçimde dahil ettik.

Bugün, ajan tabanlı sistemlerin son aylarda RSI'a yönelik ilerlememize nasıl katkıda bulunduğunu ayrıntılarıyla ortaya koyuyoruz. Ajan tabanlı sistemler yeni ve hızla değişiyor. Ölçüm çalışmalarımız da henüz başlangıç aşamasında. Bu ilk sonuçları ve kullandığımız yöntemleri paylaşarak kamuoyunu bilgilendirmeyi, kamuya açıklama yapmayı yerleşik bir uygulama haline getirmeyi ve alanda ortak ölçüm standartlarına doğru ilerlemeye yardımcı olmayı amaçlıyoruz.

Nihayetinde, en üst seviye yapay zekaya ilişkin politika taslağımızda⁠ belirttiğimiz gibi, bizim ve diğer şirketlerin RSI'a yönelik ilerlememizi kamuya açık biçimde takip etmekle yükümlü olması gerektiğine inanıyoruz. Böyle bir zorunluluk olmasa da RSI konusundaki ilerlememiz hakkında şeffaf olmaya devam etmeyi planlıyoruz. Ölçüm tekniklerimiz ve bilgimiz geliştikçe, güvenliği ve kuruma özel bilgileri koruma gereğini de gözeterek şeffaflık yaklaşımımızı geliştireceğiz.

1. Kodlama ajanları, OpenAI araştırmacılarının günlük çalışmalarını yeniden şekillendiriyor

Bu yılın başında, OpenAI'da ajan kullanımına göre sıralandığında ortada yer alan medyan araştırmacı, kodlama ajanlarını sınırlı ölçüde kullanıyordu. Ağustos ortasına gelindiğinde, medyan araştırmacı ajanları her gün çalışmalarına dahil ediyor ve API fiyatlarıyla günde 600 $ üzerinde çıkarım kullanıyordu. Araştırma birimimizde kullanım bakımından 90. yüzdelikte yer alan kullanıcı artık günde 7.000 $ üzerinde token kullanıyor.

Haziran 2026'dan önce araştırma birimindeki ajanların toplam çalışma süresi, insanların toplam çalışma süresinin altındaydı. O zamandan bu yana durum değişti. Standart 8 saatlik iş günü esas alındığında, Ağustos ortası itibarıyla araştırma birimimizde insanların çalıştığı her bir iş gününe karşılık toplam 3,1 ajan iş günü çalışma kullanılıyor.

Bunu değerlendirmenin bir başka yolu da aynı anda 4 veya daha fazla ajan çalıştırmak gibi, çok sayıda işi eş zamanlı yürütmeye olanak tanıyan iş akışlarını kaç araştırmacının kullandığına bakmak. Aşağıda görüldüğü gibi bu sayı artıyor. Bu rakamlar, hem kullanıcının doğrudan başlattığı ajanların hem de bunların sonraki aşamalarda oluşturduğu alt ajanların günlük en yüksek sayılarını kapsıyor.

2. Araştırmacılar daha fazla kod yazıyor ve daha fazla deney yürütüyor

Yapay zeka araştırmalarının büyük bölümü, modelin zekasını veya performansını artıran yeni bir iyileştirmeyi ana modellerimizden birine dahil etmeyi amaçlayan, yoğun emek gerektiren bir süreç olarak görülebilir. Bu süreç birçok adıma bağlı ve yetenekler ancak tüm adımlar birlikte doğru işlediğinde gelişiyor: Araştırmacıların yeni iyileştirmeler tasarlaması, model performansını ölçen değerlendirmeler yazması, bu iyileştirmeleri büyük ölçekte test edecek altyapıyı geliştirmesi, eğitim sırasında hataları ve güvenli olmayan ya da uyumlanma hedefleriyle bağdaşmayan davranışları tespit etmesi ve başarılı fikirleri bir ana eğitim çalıştırmasına dahil etmesi gerekiyor. Araştırma sürecinin herhangi bir aşamasındaki aksaklık tüm döngüyü sınırlayabilir.

Kod yazmak ve deney yürütmek, araştırmacıların işlerinin iki temel parçası. Bu süreçlerin hızlandığına dair kanıtlar görüyoruz.

Bu verileri ölçmek görece kolay, ancak yorumlamak zor olabilir. Otomasyon ilerledikçe, otomatikleştirilmesi en az mümkün olan görevler, araştırmacıların emeğinden daha büyük pay alacak ve gelecekteki ilerlemenin önündeki başlıca darboğazlar haline gelecek. Hesaplama kaynakları da ilerlemeyi sınırlayan bir etken ve diğer darboğazlar azaldıkça zamanla daha önemli hale gelebilir.

2026 boyunca aktif deney yürüten kişi başına deney sayısı arttı. Ağustos 2026'da, ölçümlerin başladığı Ocak 2025'ten bu yana en yüksek seviyeye ulaşıldı. Bu artış, Codex kullanımının yaygınlaşmasıyla ilişkili. Ancak elimizdeki hesaplama kaynaklarının da 2025'ten bu yana önemli ölçüde arttığını belirtelim.

3. Araştırmacıların ajanlara yaptırdığı işler değişiyor

Hem nitel izlenimler hem de kurum içi veriler, araştırmacıların kodlama ajanlarına devrettiği görevlerin dağılımının değiştiğini gösteriyor. Zamanla, daha üst düzey ve daha uzun zaman ufkuna sahip görevleri ajanlara devretmek yaygınlaşıyor.

Bu eğilimi daha net görmek için, Epoch AI tarafından geliştirilen ve yapay zeka Ar-Ge yaşam döngüsündeki farklı iş türlerini kapsayan yakın zamanda yayınlanan sınıflandırmayı⁠(yeni bir pencerede açılır) kullanarak araştırma birimindeki son dönem kullanımını analiz ettik. Her tür işi sınıflandırmak için uzun süredir kullanılan O*NET sisteminden esinlenen bu sınıflandırma, en üst seviye yapay zeka Ar-Ge çalışmalarına özel olarak uyarlandı ve süreci altı ana aşamaya ayırıyor:

  1. Karar verme: Ne üzerinde çalışılacağı, neye devam edileceği ve kaynakların nereye ayrılacağı

  2. Tasarım: Araştırma fikirleri ve mühendislik şartnameleri

  3. Geliştirme: Kod ve veri setleri

  4. Çalıştırma: Eğitim/değerlendirme çalıştırmaları, donanım ve model sunumu

  5. Analiz: Deneyler, modeller, kullanıma sunma ve kurum dışındaki çalışmalar

  6. İletişim: Bulgular, geri bildirimler, durum ve kararlar

Aşağıda, kodlama ajanlarının token'larını bu sınıflandırmaya göre gruplandırıyoruz.

Ocak-Ağustos 2026 döneminde araştırma faaliyetlerinin tüm kategorilerinde artış görüyoruz. Ocak ayında en büyük payı araştırma ve altyapı kodu oluşturuyordu. Bu kategori büyüdü, ancak özellikle teknik yardım ve çalıştırmaları izleme olmak üzere diğer kategorilerde de belirgin artışlar görüyoruz. Üst düzey planlama, ajanların çıktı token'larının çok küçük bir bölümünü oluşturmaya devam ediyor.

Meslektaşlarımız, kodlama ajanlarının kurum içi araştırma altyapısındaki sorunları gidermekte çok başarılı olduğunu aktarıyor. Bu da araştırmalardaki ilerlemenin önündeki önemli darboğazlardan birini hafifletiyor. Daha önce araştırmacıların deneylerindeki sorunları gidermelerine yardımcı olmak için danışma saatleri düzenleyen birkaç ekip, 2026'da katılımın azaldığını bildirdi. Bir ekip ise diğer sistem iyileştirmelerine odaklanmak için bu oturumları tamamen sonlandırdı.

Burada, araştırmacıların diğer ekiplerden teknik destek aldığı başlıca kurum içi kanallardan birinde her gün başlatılan ana gönderilerin sayısını gösteriyoruz. Bildiğimiz kadarıyla bu kanaldaki etkinliğin azalması, soruların insanlar tarafından yürütülen başka bir teknik destek kanalına taşınmasından kaynaklanmıyor. Trafikteki düşüş, bu genel değişimle örtüşüyor.

Kodlama ajanlarının araştırmacıların istediği görevleri başarıyla tamamlayıp tamamlamadığını da inceleyebiliriz. Ajan tabanlı bir sınıflandırıcıyla, kesin sonucunu belirleyebildiğimiz görevlerde Ocak-Temmuz döneminde çeşitli zorluk gruplarında başarı oranlarının genel olarak arttığını görüyoruz. Zorluğu, bir insanın görevi tamamlaması için gereken tahmini süreyle yaklaşık olarak ölçüyoruz. Ancak ajanlar, özellikle görevler karmaşıklaştıkça, başarılı olmak için insanlardan önemli ölçüde yönlendirme almaya devam ediyor. Son 6 ayda başarıyla tamamlanan 4-8 saatlik görevlerin yarısından fazlasında en az 1 müdahale yapıldı.

Araştırmacıların görevlerinde başarı oranları zamanla arttı. Sonucu belirsiz sınıflandırmalar ve 50 oturumdan veya 50 benzersiz kullanıcıdan az veri içeren noktalar grafiğe dahil edilmemiştir.

Ocak-Temmuz döneminde zaman ufkuna göre görev başarısı ve müdahale oranı. Sonucu belirsiz olan sınıflandırmalar dahil edilmemiştir.

4. Model geliştirme hızını düzenleme

Güvenli ve faydalı AGI (genel yapay zeka) için daha yetenekli sistemler geliştirme yolundaki ilerleme, bu çalışmaların gerektirdiği koruma önlemlerine de bağlı olacak. Riskleri daha iyi anladıkça, gerekli koruma önlemlerine ilişkin değerlendirmemiz değişebilir.

Daha önce açıkladığımız gibi,⁠ izleme, uyumlanma ve güvenlik standartlarımızı kısa süre önce güncelledik. Burada, son dönemdeki kısıtlamaların araştırma faaliyetlerinin bir boyutunu nasıl etkilediğini gösteriyoruz.

*Burada 20 Temmuz ila 6 Ağustos arasında gösterilen Astra hesaplama kaynaklarının büyük bölümü, emniyet ve güvenlik iyileştirmelerinin uygulanmasını test etmek amacıyla ayrıldı.

20 Temmuz'da ajanların araştırma altyapımızın güvenliğini ihlal ettiğini tespit ettikten sonra, eğitimde kullanılan kapsayıcı hizmetini geçici olarak kapattık. Ardından hizmeti, kapsamlı ek kısıtlamalarla yeniden devreye aldık.

Ekipler, güvenliği artırılmış araştırma ortamında çalışabilmek için iş akışlarını yeniden düzenlerken, pekiştirmeli öğrenmeyle eğitimde kullanılan hesaplama kaynakları keskin biçimde azaldı. Yukarıdaki grafik, kullanıma sunmayı planladığımız en yeni modellerde pekiştirmeli öğrenmeye verdiğimiz iki haftalık arayı da kapsıyor. 20 Temmuz ila 6 Ağustos arasındaki Astra sınıfı pekiştirmeli öğrenme deneylerinde, GPU tahsisi temel alındığında çalıştırmaların çoğu emniyet ve güvenlik iyileştirmelerinin uygulanmasını test etmeyi amaçlıyordu.

7 Ağustos'ta, Astra'nın kritik siber yeteneklere sahip olabileceğine⁠ dair Risklere Hazırlık Çerçevemiz⁠(yeni bir pencerede açılır) kapsamındaki ilk bulgular, modele özel ek güvenlik kısıtlamalarına yol açtı. Bu kısıtlamalar, Astra modelinin güvenlik düzeyi daha yüksek araştırma ortamlarında çalıştırılmasını gerektirdi. Sonraki hafta Astra sınıfına ayrılan GPU kaynakları %59,2 daha azalırken, diğer model sınıflarına ayrılan kaynaklar %17,2 arttı. Bu artış, Astra sınıfındaki düşüşün yaklaşık %85'ini telafi etti. Böylece analiz edilen pekiştirmeli öğrenme iş yüklerine ayrılan toplam kaynak büyük ölçüde aynı kaldı. Bu tablo, Astra ile yapılan çalışmalar kısıtlanırken bazı eğitim ve deneylerin Astra dışındaki modellere kaydırılmış olmasıyla tutarlı. Araştırmacıların, yeni kısıtlamaların kapsadığı iş yüklerinde artık kullanamadıkları hesaplama kaynaklarını başka işler için değerlendirdiklerine ilişkin aktarımlarıyla da örtüşüyor.

Bu veriler, eğitim ve güvenlik konusundaki tartışmalar için yararlı bir gösterge sunuyor: Yeni kontroller getirildiğinde hesaplama kaynakları değerini ve esnekliğini koruyor, dolayısıyla araştırma çalışmaları kapsamında doğal olarak alternatif kullanımlara yönlendiriliyor. Uzun vadede, yapay zekanın ilerleme hızına ilişkin tartışmalar, yeni veya önerilen kontrollere tabi hesaplama kaynaklarının en iyi nasıl kullanılabileceğini de kapsamalı.

5. Önümüzdeki yol

Uyumlanmış RSI'a doğru ilerlemek ve bu ilerlemeyi anlamak, misyonumuz açısından önemli. Yöntemlerimizi geliştirmeye, değişen anlayışımızı paylaşmaya ve en üst seviye sistemler hakkında bilgiye dayalı bir toplumsal tartışma ve anlamlı demokratik yönetim için çalışmaya devam edeceğiz.

Ek: Bu yazıda kullandığımız yöntemler

Ajan destekli yapay zeka araştırmaları henüz yeni ve bunları nasıl ölçeceğimizi öğrenmeye devam ediyoruz. Araştırma ekiplerimizin ürettiği kod miktarı gibi bazı göstergeleri toplamak görece kolay, ancak araştırmalardaki ilerlemeyle ilişkileri belirsiz olduğundan yorumlamak zor. Araştırmalardaki ilerlemeye daha doğrudan odaklanan ölçütler (örneğin, ajanların araştırmacılardan aldıkları görevlerde ne sıklıkla başarılı olduğu) daha yararlı olabilir; ancak bunları geliştirmek ve doğrulamak karmaşık bir iştir. Araştırmacıların kullandığı araç ve sistemlerin hızla değişmesi bu işi daha da zorlaştırıyor. Araştırmaların hızlanmasına ilişkin anlayışımızı derinleştirmek, OpenAI genelinde önemli bir çalışma alanı.

Bu analizlerde, aksi belirtilmedikçe:

  • "Araştırmacı", araştırma altyapısı geliştiren, araştırma projelerini yöneten veya çalışmaları başka biçimlerde destekleyen kişiler de dahil olmak üzere araştırma birimimizin tüm üyelerini kapsayan geniş bir terimdir.

  • Araştırmacıların kullandığı araç ve sistemler hızla değiştiğinden, kodlama ajanı kullanım ölçütleri, kullanımın büyük bölümünü kapsar; ancak tamamını kapsamaz.