Besojmë se AGI duhet të qeveriset në mënyrë demokratike që t’i shërbejë gjithë njerëzimit. Kjo kërkon debat publik të informuar për aftësitë, rreziqet dhe masat mbrojtëse të sistemeve shumë të afta të IA-së. Njerëzit kudo duhet të kuptojnë drejtimin e mundshëm të IA-së avangardë, që të kenë zë me peshë në zhvillimin e saj.
Transparenca për rreziqet, incidentet dhe masat mbrojtëse specifike është e nevojshme, por jo e mjaftueshme. Publiku duhet të kuptojë edhe si zhvillohen sistemet më të afta dhe si nxisin përparimin kërkimor brenda laboratorëve avangardë.
Synojmë të ndërtojmë në mënyrë të sigurt një kërkues të automatizuar të IA-së që, nën mbikëqyrje njerëzore, avancon trajnimin e thelluar dhe përafrimin, duke mundësuar përmirësime të njëpasnjëshme. Sipas matjeve tona, e kemi arritur tashmë synimin e shpallur(hapet në një dritare të re) vjeshtën e kaluar: një praktikant kërkimor të automatizuar deri në shtator të këtij viti. Me “praktikant kërkimor” nënkuptojmë një sistem që kryen detyra kërkimore të përcaktuara qartë nën drejtimin njerëzor, edhe detyra që një kërkuesi të aftë do t’i merrnin disa ditë. Po përparojmë ndjeshëm drejt krijimit të një kërkuesi të automatizuar të IA-së deri në mars 2028.
Gjatë këtij viti, puna e përditshme e kërkuesve të OpenAI ka ndryshuar ndjeshëm. Kërkuesit përdorin agjentë kodimi gjatë gjithë ditës, shpesh në seanca paralele. Përdorimi po rritet shpejt, më shumë se në ekipet e tjera të OpenAI. Kërkuesit kontribuojnë kod më shpejt dhe kryejnë më shumë eksperimente. Po ndryshon edhe mënyra e përdorimit të agjentëve: ata trajtojnë detyra më komplekse dhe ia dalin më shpesh. Kërkimi në IA është kompleks, me shumë pengesa të mundshme, ndaj ritmi i përgjithshëm i përparimit ka gjasa të mos ecë në hap me këta tregues specifikë. Në tërësi, gjetjet përputhen me përshtypjen e shumë prej nesh se mjetet agjentike po e përshpejtojnë ndjeshëm përparimin kërkimor. Njerëzit ende caktojnë përparësitë kërkimore, zgjedhin idetë e rezultatet për t’u ndjekur dhe vendosin nëse sistemet duhen zgjeruar, pezulluar apo vënë në përdorim.
Besojmë se, i kryer me përgjegjësi, kërkimi i automatizuar në IA do të sjellë modele që rrisin drejtpërdrejt mirëqenien njerëzore dhe çojnë përpara misionin e OpenAI. Ai mund të ulë koston e inteligjencës së përparuar, që prej saj të përfitojnë njerëzit në mbarë botën. E ndjekim këtë punë pjesërisht sepse kërkimi i automatizuar mund të na ndihmojë të zgjidhim përafrimin dhe të ndërtojmë mbrojtje ndaj IA-së gjithnjë më të aftë. Një kërkues i automatizuar i IA-së mund të jetë edhe kërkues i automatizuar i sigurisë ose përafrimit. Sisteme më të afta e të përafruara mund të mbrojnë infrastrukturën kritike, të kundërshtojnë agjentë të rrezikshëm të IA-së dhe të zhvillojnë masa të reja mbrojtëse.
Këto janë arsye për të zhvilluar aftësi të dobishme kërkimi të automatizuar, por jo domosdoshmërisht për të synuar RSI të shpejtë. Nëse dhe si do të vazhdojmë duhet të varet nga ruajtja e kontrollit njerëzor dhe zgjedhjet demokratike të informuara për përfitimet e rreziqet.
Ende nuk dimë si të arrijmë në mënyrë të sigurt deri te RSI e plotë dhe e përafruar. Po punojmë që masat e përafrimit dhe sigurisë të zgjerohen krahas aftësive. Por nuk mund të supozojmë se ato do të ecin në të njëjtin hap; sistemet më të afta mund të bëhen më të vështira për t’u monitoruar. Në qendër është puna e kujdesshme për përafrimin e sigurinë, duke nisur me matjen dhe zbutjen e problemeve që shohim sot në sistemet e kodimit agjentik. Kur vazhdimi paraqet rrezik të papranueshëm sigurie, do të reagojmë siç duhet, edhe duke ngadalësuar ose ndalur zhvillimin apo përdorimin e sistemeve që nuk mund t’i mbrojmë mjaftueshëm.
Pas incidentit të fundit me Hugging Face, e zbatuam këtë angazhim: pezulluam trajnimin përforcues (RL) të modeleve më të fundit për përdorim, përforcuam e testuam mjediset kërkimore me sulme simuluese dhe zgjeruam mbulimin e monitorimit. Jo i gjithë kërkimi u ndal: disa ngarkesa rifilluan me kontrolle më të forta; të tjera mbetën të pezulluara. Kemi ngritur standardet e sigurisë e përafrimit dhe i kemi integruar më thellë në ciklin e modelit, duke kërkuar prova më të forta të sjelljes së përafruar gjatë gjithë trajnimit.
Sot paraqesim hollësisht si kanë kontribuar sistemet agjentike në përparimin tonë drejt RSI muajt e fundit. Sistemet agjentike janë të reja e ndryshojnë shpejt; përpjekjet tona për matje janë ende paraprake. Me këto rezultate të hershme dhe metodat e tyre synojmë të informojmë publikun, të nxisim publikimin e të dhënave si normë dhe standardet e përbashkëta të matjes.
Siç shkruam në planin tonë të politikave për IA-në avangardë, besojmë se ne dhe kompanitë e tjera duhet të detyrohemi ta raportojmë publikisht përparimin drejt RSI. Edhe pa këtë detyrim, planifikojmë të mbetemi transparentë për përparimin tonë drejt RSI. Do ta përshtatim transparencën teksa përmirësohen matjet dhe kuptimi ynë, duke ruajtur njëkohësisht sigurinë dhe informacionin pronësor.
Në fillim të vitit, kërkuesi në medianën e përdorimit të agjentëve në OpenAI i përdorte agjentët e kodimit vetëm në masë modeste. Nga mesi i gushtit, ai i integronte çdo ditë në punë, me mbi 600 $ inferencë në ditë sipas çmimeve të API-së. Përdoruesi në percentilin e 90-të të njësisë kërkimore tani përdor token me vlerë mbi 7 000 $ në ditë.
Para qershorit 2026, koha totale e punës së agjentëve në njësinë kërkimore ishte ende nën atë të punës njerëzore. Kjo tashmë ka ndryshuar. Me një ditë standarde 8-orëshe, nga mesi i gushtit njësia kërkimore përdor gjithsej 3,1 ditë pune agjentësh për çdo ditë pune njerëzore.
Një këndvështrim tjetër është numri i kërkuesve që përdorin rrjedha pune shumë paralele, p.sh. 4 ose më shumë agjentë njëkohësisht. Siç shihet më poshtë, ky numër po rritet. Shifrat përfshijnë kulmet ditore të agjentëve të nisur drejtpërdrejt nga përdoruesi dhe të nënagjentëve të krijuar prej tyre.
Një pjesë e madhe e kërkimit në IA kërkon shumë punë për të integruar një përmirësim të inteligjencës ose performancës në një nga modelet tona bazë. Aftësitë përparojnë kur të gjithë hapat shkojnë mirë: kërkuesit projektojnë përmirësime, shkruajnë vlerësime performance, ndërtojnë infrastrukturë për testime në shkallë të gjerë, zbulojnë gabime e sjellje të pasigurta ose të papërafruara gjatë trajnimit dhe integrojnë idetë fituese në një trajnim bazë. Dështimi në cilëndo pjesë të kërkimit mund të kufizojë gjithë ciklin.
Shkrimi i kodit dhe eksperimentet janë dy veprimtari kryesore të kërkuesve; shohim prova se të dyja po përshpejtohen.
Këta tregues maten relativisht lehtë, por mund të interpretohen me vështirësi. Teksa automatizimi përparon, detyrat më pak të automatizueshme do të zënë më shumë nga puna e kërkuesve dhe do të bëhen pengesa kyçe për përparimin. Burimet llogaritëse janë një tjetër faktor kufizues, që mund të marrë më shumë peshë teksa zbuten pengesat e tjera.
Gjatë 2026, eksperimentet për eksperimentues aktiv u shtuan. Gushti 2026 shënoi kulmin që nga nisja e matjeve në janar 2025. Kjo lidhet me përdorimin më të gjerë të Codex, por edhe burimet llogaritëse janë rritur ndjeshëm që nga 2025.
Përshtypjet cilësore dhe të dhënat e brendshme tregojnë se detyrat e deleguara te agjentët e kodimit po ndryshojnë: detyrat e nivelit më të lartë e me horizont më të gjatë po bëhen më të zakonshme.
Për ta kuptuar më mirë këtë prirje, analizuam përdorimin e fundit në njësinë kërkimore me një taksonomi të publikuar së fundmi(hapet në një dritare të re) nga Epoch AI për llojet e punës në ciklin e kërkim-zhvillimit të IA-së. Frymëzuar nga sistemi i kahershëm O*NET për klasifikimin e punës, kjo taksonomi për kërkim-zhvillimin e IA-së avangardë e ndan procesin në gjashtë faza:
Vendimmarrje: mbi çfarë të punohet, çfarë të vazhdohet, ku të alokohen burimet
Projektim: ide kërkimore dhe specifikime inxhinierike
Ndërtim: kod dhe grupe të dhënash
Ekzekutim: trajnime/vlerësime, pajisje, shërbim
Analizë: eksperimente, modele, përdorim, punë e jashtme
Komunikim: gjetje, komente, ecuri, vendime
Më poshtë klasifikojmë tokenët e agjentëve të kodimit sipas kësaj taksonomie.
Të gjitha kategoritë kërkimore janë rritur nga janari në gusht 2026. Në janar mbizotëronte kodi për kërkimin dhe infrastrukturën. Kjo kategori është zgjeruar, por shohim rritje të dukshme edhe në të tjera, sidomos te ndihma teknike dhe monitorimi i ekzekutimeve. Planifikimi i nivelit të lartë mbetet pjesë minimale e tokenëve dalës të agjentëve.
Kolegët raportojnë joformalisht se agjentët e kodimit shkëlqejnë në zgjidhjen e problemeve të infrastrukturës kërkimore, duke zbutur një pengesë të rëndësishme. Disa ekipe që ofronin orare konsultimi për problemet e eksperimenteve kanë parë rënie të pjesëmarrjes në 2026. Një ekip i ka ndërprerë ato për t’u përqendruar te përmirësime të tjera të sistemit.
Këtu paraqesim postimet fillestare ditore në një nga kanalet kryesore të brendshme ku kërkuesit kërkojnë mbështetje teknike nga ekipet e tjera. Me sa dimë, kjo rënie nuk është kompensuar nga zhvendosja e kërkesave në një kanal tjetër mbështetjeje teknike me personel njerëzor. Rënia e trafikut përputhet me këtë ndryshim më të gjerë.
Mund të studiojmë edhe nëse agjentët e kodimit ia dalin në detyrat e kërkuesve. Një klasifikues agjentik tregon se nga janari në korrik suksesi përgjithësisht u rrit në disa nivele vështirësie, të përafruara me kohën e vlerësuar për një njeri, për detyrat me rezultat real të verifikueshëm. Megjithatë, agjentët ende kërkojnë udhëzim të konsiderueshëm njerëzor për të pasur sukses, sidomos kur detyrat bëhen më komplekse. Në 6 muajt e fundit, mbi gjysma e detyrave të suksesshme 4–8-orëshe përfshinin të paktën një ndërhyrje.
Shkalla e suksesit në detyrat e kërkuesve është rritur me kalimin e kohës. Grafiku përjashton klasifikimet me rezultat të pasigurt dhe pikat me <50 seanca ose <50 përdorues unikë.
Shkalla e suksesit të detyrave dhe e ndërhyrjeve nga janari në korrik, sipas horizontit kohor. Përjashtohen klasifikimet me rezultat të pasigurt.
Përparimi drejt sistemeve më të afta për një AGI të sigurt e të dobishme do të varet edhe nga masat mbrojtëse që nevojiten për këtë punë. Vlerësimi ynë për masat e nevojshme mbrojtëse mund të ndryshojë teksa mësojmë më shumë për rreziqet.
Siç kemi shpjeguar, së fundmi kemi përditësuar standardet tona për monitorimin, përafrimin dhe mbrojtjen. Këtu tregojmë si kanë ndikuar kufizimet e fundit në një aspekt të veprimtarisë kërkimore.
*Shumica e burimeve llogaritëse të Astra të paraqitura këtu për periudhën 20 korrik–6 gusht synonin testimin e zbatimit të përmirësimeve në siguri dhe mbrojtje.
Më 20 korrik, pasi zbuluam se agjentët kishin cenuar infrastrukturën tonë kërkimore, pezulluam përkohësisht shërbimin e kontejnerëve të përdorur për trajnim dhe më pas e rikthyem me kufizime të konsiderueshme shtesë.
Kjo solli një rënie të fortë të burimeve llogaritëse për trajnimin RL, ndërsa ekipet rikonfiguronin rrjedhat e punës për të vepruar në mjedisin kërkimor me mbrojtje të përforcuar. Grafiku më sipër përfshin pezullimin dyjavor të trajnimit përforcues të modeleve tona më të fundit të destinuara për përdorim. Në eksperimentet RL të klasës Astra nga 20 korriku deri më 6 gusht, shumica e ekzekutimeve (sipas GPU-ve të alokuara) synonin testimin e zbatimit të përmirësimeve në siguri dhe mbrojtje.
Më 7 gusht, provat paraprake se Astra mund të ketë aftësi kibernetike kritike sipas Preparedness Framework(hapet në një dritare të re) sollën kufizime shtesë sigurie specifike për modelin, që kërkonin ekzekutimin e Astra në mjedise kërkimore me siguri më të lartë. Javën pasuese, alokimi i GPU-ve për klasën Astra ra edhe me 59,2 për qind, ndërsa alokimi për klasat e tjera të modeleve u rrit me 17,2 për qind. Kjo rritje kompensoi rreth 85 për qind të rënies së klasës Astra, duke e lënë thuajse të pandryshuar alokimin e përgjithshëm për ngarkesat RL të analizuara. Kjo prirje përputhet me zhvendosjen e një pjese të trajnimit dhe eksperimentimit te modelet jo-Astra gjatë kufizimeve mbi Astra. Ajo përputhet edhe me raportimet joformale të kërkuesve që gjetën përdorime të tjera për burimet llogaritëse që nuk mund të shfrytëzoheshin më për ngarkesat e mbuluara nga kufizimet e reja.
Këto të dhëna japin një sinjal të dobishëm për diskutimet e vazhdueshme mbi trajnimin dhe sigurinë: kur vendosen kontrolle të reja, burimet llogaritëse mbeten të vlefshme e fleksibël dhe natyrshëm do të drejtohen drejt përdorimeve alternative brenda veprimtarisë kërkimore. Në planin afatgjatë, diskutimet për ritmin e përparimit të IA-së duhet të trajtojnë edhe mënyrën më të mirë për të përdorur burimet llogaritëse që u nënshtrohen kontrolleve të reja ose të propozuara.
Përparimi drejt RSI të përafruar dhe kuptimi i tij janë të rëndësishëm për misionin tonë. Do të vazhdojmë të përmirësojmë metodat, të raportojmë për njohuritë që fitojmë dhe të punojmë për një debat publik të informuar dhe qeverisje demokratike me ndikim real mbi sistemet avangardë.
Kërkimi në IA i mbështetur nga agjentët është ende i ri dhe ne ende po mësojmë si ta matim. Disa tregues, si sasia e kodit që gjenerojnë ekipet tona kërkimore, mblidhen relativisht lehtë, por interpretohen me vështirësi sepse lidhja e tyre me përparimin kërkimor është e pasigurt. Treguesit që përqendrohen më drejtpërdrejt te përparimi kërkimor, si shpeshtësia me të cilën agjentët ia dalin në detyrat që u japin kërkuesit, mund të jenë më të dobishëm, por janë kompleksë për t’u zhvilluar e validuar. Vështirësinë e shton edhe zhvillimi i shpejtë i mjeteve dhe sistemeve ku mbështeten kërkuesit. Thellimi i të kuptuarit të përshpejtimit të kërkimit është një përparësi e rëndësishme në mbarë OpenAI.
Në të gjitha këto analiza, përveç rasteve kur shënohet ndryshe:
“Kërkues” është një term i gjerë për çdo anëtar të njësisë sonë kërkimore, përfshirë ata që ndërtojnë infrastrukturë kërkimore, menaxhojnë projekte kërkimore ose mbështesin veprimtarinë në mënyra të tjera.
Treguesit e përdorimit të agjentëve të kodimit mbulojnë shumicën, por jo të gjithë përdorimin, për shkak të zhvillimit të shpejtë të mjeteve dhe sistemeve ku mbështeten kërkuesit.


