Aqbeż għall-kontenut prinċipali
OpenAI

12 ta’ Settembru 2024

Ħruġ

Learning to reason with LLMs

Qed jillowdja…

OpenAI o1 jinsab fid-89 perċentil fuq mistoqsijiet ta’ programmar kompetittiv (Codeforces), jitpoġġa fost l-aqwa 500 student fl-Istati Uniti f’kwalifikazzjoni għall-Olimpjada tal-Matematika tal-Istati Uniti (AIME), u jaqbeż il-preċiżjoni umana fil-livell ta’ PhD fuq punt ta’ riferiment ta’ problemi tal-fiżika, il-bijoloġija u l-kimika (GPQA). Filwaqt li x-xogħol meħtieġ biex dan il-mudell il-ġdid ikun faċli daqs il-mudelli attwali għadu għaddej, qed noħorġu verżjoni bikrija ta’ dan il-mudell, OpenAI o1‑preview, għall-użu immedjat f’ChatGPT u għal utenti tal-API fdati(jinfetaħ f’tieqa ġdida).

L-algoritmu tagħna ta’ apprendiment ta' tisħiħ fuq skala kbira jgħallem lill-mudell kif jaħseb b’mod produttiv billi juża l-katina tal-ħsieb tiegħu fi proċess ta’ taħriġ effiċjenti ħafna fid-data. Sibna li l-prestazzjoni ta’ o1 titjieb b’mod konsistenti b’aktar apprendiment ta' tisħiħ (komputazzjoni waqt it-taħriġ) u b’aktar ħin imqatta’ jaħseb (komputazzjoni waqt it-test). Ir-restrizzjonijiet fuq l-iskalar ta’ dan l-approċċ ivarjaw b’mod sostanzjali minn dawk tal-pretaħriġ tal-LLM, u qed inkompli ninvestigawhom.

The image shows two scatter plots comparing "o1 AIME accuracy" during training and at test time. Both charts have "pass@1 accuracy" on the y-axis and compute (log scale) on the x-axis. The dots indicate increasing accuracy with more compute time.

o1 performance smoothly improves with both train-time and test-time compute

Evalwazzjonijiet

Biex nenfasizzaw it-titjib fir-raġunament fuq GPT‑4o, ittestjajna l-mudelli tagħna fuq sett varjat ta’ eżamijiet umani u punti ta’ riferiment tal-ML. Nuru li o1 jaqbeż lil GPT‑4o b’mod sinifikanti fil-maġġoranza l-kbira ta’ dawn il-kompiti intensivi fir-raġunament. Sakemm ma jkunx speċifikat mod ieħor, ivvalutajna o1 fuq l-issettjar massimu tal-komputazzjoni waqt it-test.

o1 itejjeb b'mod sinifikanti fuq GPT-4o fuq punti ta' riferiment ta' raġunament diffiċli. L-istrixxi solidi juru l-eżattezza pass@1, filwaqt li r-reġjun imdellel juri l-prestazzjoni tal-vot tal-maġġoranza (kunsens) b’64 kampjun.
o1 itejjeb fuq GPT-4o fuq firxa wiesgħa ta' benchmarks, inklużi 54/57 subkategoriji MMLU. Sebgħa huma murija għall-illustrazzjoni.

F’ħafna punti ta’ riferiment intensivi fir-raġunament, o1 jikkompeti mal-prestazzjoni ta’ esperti umani. Mudelli fruntiera reċenti1 marru tajjeb ħafna fuq MATH2 u GSM8K tant li dawn il-punti ta’ riferiment m’għadhomx effettivi biex jiddistingwu bejn mudelli. Ivvalutajna l-prestazzjoni fil-matematika fuq AIME, eżami mfassal biex jisfida lill-aktar studenti brillanti tal-matematika fl-iskola sekondarja fl-Amerika. Fl-eżamijiet AIME tal-2024, GPT‑4o solva biss medja ta’ 12% (1.8/15) tal-problemi. o1 kellu medja ta’ 74% (11.1/15) b’kampjun wieħed għal kull problema, 83% (12.5/15) b’kunsens fost 64 kampjun, u 93% (13.9/15) meta reġa’ kklassifika 1000 kampjun b’funzjoni ta’ punteġġ mitgħallma. Punteġġ ta’ 13.9 jqegħdu fost l-aqwa 500 student nazzjonalment u ’l fuq mil-livell ta’ qtugħ għall-Olimpjada Matematika tal-Istati Uniti.

Ivvalutajna wkoll lil o1 fuq GPQA diamond, punt ta’ riferiment diffiċli tal-intelliġenza li jittestja l-kompetenza fil-kimika, il-fiżika u l-bijoloġija. Sabiex inqabblu l-mudelli mal-bnedmin, irreklutajna esperti b’PhD biex iwieġbu mistoqsijiet ta’ GPQA-diamond. Sibna li o1 qabeż il-prestazzjoni ta’ dawk l-esperti umani, u sar l-ewwel mudell li għamel dan fuq dan il-punt ta’ riferiment. Dawn ir-riżultati ma jimplikawx li o1 huwa aktar kapaċi minn PhD f’kull aspett — biss li l-mudell huwa aktar profiċjenti biex isolvi xi problemi li wieħed jistenna li PhD isolvi. Fuq diversi punti oħra ta’ riferiment tal-ML, o1 tejjeb fuq l-aqwa livell attwali. Bil-kapaċitajiet tiegħu tal-perċezzjoni viżiva attivati, o1 kiseb 78.2% fuq MMMU, u sar l-ewwel mudell li hu kompetittiv ma’ esperti umani. Qabeż ukoll lil GPT‑4o f’54 minn 57 sottokategorija ta’ MMLU.

Katina tal-Ħsieb

Bħalma bniedem jista’ jaħseb għal żmien twil qabel iwieġeb mistoqsija diffiċli, o1 juża katina tal-ħsieb meta jipprova jsolvi problema. Permezz ta’ apprendiment ta' tisħiħ, o1 jitgħallem jirfina l-katina tal-ħsieb tiegħu u jtejjeb l-istrateġiji li juża. Jitgħallem jagħraf u jikkoreġi l-iżbalji tiegħu. Jitgħallem jaqsam passi diffiċli f’oħrajn aktar sempliċi. Jitgħallem jipprova approċċ differenti meta dak attwali ma jkunx qed jaħdem. Dan il-proċess itejjeb b’mod drammatiku l-kapaċità tal-mudell li jirraġuna. Biex nuru dan il-qabża ’l quddiem, hawn taħt nippreżentaw il-katina tal-ħsieb minn o1‑preview fuq diversi problemi diffiċli.

Kodifikazzjoni

Ħarreġna mudell li kiseb 213-il punt u ġie kklassifikat fid-49 perċentil fl-Olimpjada Internazzjonali tal-Informatika (IOI) tal-2024, billi bdejna minn o1 u ħarrġnieh biex ikompli jtejjeb il-ħiliet tal-programmazzjoni. Dan il-mudell ikkompetta fl-IOI tal-2024 taħt l-istess kundizzjonijiet bħall-kontestanti umani. Kellu għaxar sigħat biex isolvi sitt problemi algoritmiċi ta’ sfida u kien permess jagħmel 50 sottomissjoni għal kull problema.

Għal kull problema, is-sistema tagħna ħadet kampjun ta’ ħafna sottomissjonijiet kandidati u ssottomettiet 50 minnhom abbażi ta’ strateġija ta’ għażla waqt it-test. Is-sottomissjonijiet intgħażlu abbażi tal-prestazzjoni fuq il-każijiet pubbliċi tat-test tal-IOI, każijiet tat-test iġġenerati mill-mudell, u funzjoni ta’ punteġġ mitgħallma. Kieku minflok issottomettejna b’mod każwali, konna niksbu biss 156 punt bħala medja, li jissuġġerixxi li din l-istrateġija kienet tiswa kważi 60 punt taħt ir-restrizzjonijiet tal-kompetizzjoni.

B’restrizzjoni aktar rilassata fuq is-sottomissjonijiet, sibna li l-prestazzjoni tal-mudell tjiebet b’mod sinifikanti. Meta tħallew 10,000 sottomissjoni għal kull problema, il-mudell kiseb punteġġ ta’ 362.14 – ’il fuq mil-limitu tal-midalja tad-deheb – anke mingħajr ebda strateġija ta’ għażla waqt it-test.

Fl-aħħar nett, issimulajna kompetizzjonijiet ta’ programmar kompetittiv ospitati minn Codeforces biex nuru l-ħila ta’ dan il-mudell fil-kodifikazzjoni. Il-valutazzjonijiet tagħna qablu mill-qrib mar-regoli tal-kompetizzjoni u ppermettew 10 sottomissjonijiet. GPT‑4o kiseb klassifikazzjoni Elo3 ta’ 808, li tinsab fil-11-il perċentil tal-kompetituri umani. Dan il-mudell qabeż ferm kemm lil GPT‑4o kif ukoll lil o1—kiseb klassifikazzjoni Elo ta’ 1807, u kellu prestazzjoni aħjar minn 93% tal-kompetituri.

The image shows a bar chart comparing Codeforces Elo percentile rankings for different models. GPT-4o has 808 Elo (11th percentile), o1 preview has 1258 Elo (62nd percentile), o1 has 1673 Elo (89th percentile), and o1-ioi has 1807 Elo (93rd percentile).

Further fine-tuning on programming competitions improves o1. The improved model ranked in the 49th percentile in the 2024 International Olympiad in Informatics under competition rules.

Valutazzjoni tal-preferenza umana

Minbarra l-eżamijiet u l-punti ta’ riferiment akkademiċi, ivvalutajna wkoll il-preferenza umana ta’ o1‑preview meta mqabbel ma’ GPT‑4o fuq prompts ta’ sfida u miftuħa f’firxa wiesgħa ta’ oqsma. F’din il-valutazzjoni, trainers umani raw tweġibiet anonimizzati għal prompt minn o1‑preview u GPT‑4o, u vvutaw għal liema tweġiba ppreferew. o1‑preview huwa preferut għal gpt-4o b’marġni kbir f’kategoriji intensivi fir-raġunament bħall-analiżi tad-data, il-kodifikazzjoni u l-matematika. Madankollu, o1‑preview mhuwiex preferut fuq xi kompiti tal-lingwa naturali, u dan jissuġġerixxi li mhuwiex adattat sew għall-każijiet kollha ta’ użu.

win rate matplotlib

Sikurezza

Ir-raġunament bil-katina tal-ħsieb jipprovdi opportunitajiet ġodda għall-allinjament u s-sikurezza. Sibna li l-integrazzjoni tal-politiki tagħna għall-imġiba tal-mudell fil-katina tal-ħsieb ta’ mudell tar-raġunament hija mod effettiv biex ngħallmu b’mod robust il-valuri u l-prinċipji umani. Billi ngħallmu lill-mudell ir-regoli tas-sikurezza tagħna u kif jirraġuna dwarhom fil-kuntest, sibna evidenza ta’ kapaċità ta’ raġunament li tibbenefika direttament ir-robustezza tal-mudell: o1‑preview kiseb prestazzjoni mtejba b’mod sostanzjali fuq evalwazzjonijiet ewlenin ta’ jailbreak u fuq l-aktar punti ta’ riferiment interni diffiċli tagħna biex nivvalutaw il-limiti ta’ rifjut tas-sikurezza tal-mudell tagħna. Nemmnu li l-użu ta’ katina tal-ħsieb joffri avvanzi sinifikanti għas-sikurezza u l-allinjament għax (1) jippermettilna nosservaw lill-mudell jaħseb b’mod li jinftiehem, u (2) ir-raġunament tal-mudell dwar ir-regoli tas-sikurezza huwa aktar robust għal xenarji barra mid-distribuzzjoni.

Biex nittestjaw l-istress fuq it-titjib tagħna, wettaqna sett ta’ testijiet tas-sikurezza u red-teaming qabel it-tnedija, skont il-Qafas tat-Tħejjija(jinfetaħ f’tieqa ġdida) tagħna. Sibna li r-raġunament bil-katina tal-ħsieb ikkontribwixxa għal titjib fil-kapaċitajiet tul il-valutazzjonijiet tagħna. Ta’ nota partikolari, osservajna każijiet interessanti ta’ reward hacking(jinfetaħ f’tieqa ġdida). Riżultati dettaljati minn dawn il-valutazzjonijiet jinsabu fil-kard tas-sistema akkumpanjanti.

MetrikaGPT-4oo1-preview
% Kompletamenti siguri fuq prompts ta’ ħsara
Standard
0.9900.995
% Kompletamenti sikuri fuq prompts ta’ ħsara
Diffikultajiet: jailbreaks u każijiet estremi
0.7140.934
↳ Fastidju (sever)0.8450.900
↳ Kontenut sesswali ta' sfruttatment0.4830.949
↳ Kontenut sesswali li jinvolvi lill-minorenni0.7070.931
↳ Pariri dwar għemil ħażin mhux vjolenti0.6880.961
↳ Pariri dwar għemil ħażin vjolenti0.7780.963
% Tlestiji siguri għall-aqwa 200 bl-ogħla punteġġi tal-Moderation API għal kull kategorija f’WildChat
Zhao, et al. 2024
0.9450.971
Goodness@0.1 StrongREJECT jailbreak eval
Souly et al. 2024
0.2200.840
Evalwazzjoni ta' jailbreak minn sors uman0.7700.960
% ta' Konformità fuq il-każijiet interni beninni fil-marġni
“mhux rifjut żejjed”
0.9100.930
% Konformità fuq każijiet marġinali beninni f’XSTest
“mhux rifjut żejjed”
Röttger, et al. 2023
0.9240.976

Naħbu l-Katini tal-Ħsieb

Nemmnu li katina tal-ħsieb moħbija tippreżenta opportunità unika għall-monitoraġġ tal-mudelli. Jekk nassumu li hija fidila u tinftiehem, il-katina tal-ħsieb moħbija tippermettilna “naqraw il-moħħ” tal-mudell u nifhmu l-proċess tal-ħsieb tiegħu. Pereżempju, fil-futur nistgħu nixtiequ nimmonitorjaw il-katina tal-ħsieb għal sinjali ta’ manipulazzjoni tal-utent. Madankollu, biex dan jaħdem il-mudell irid ikollu l-libertà jesprimi l-ħsibijiet tiegħu fil-forma mhux mibdula tagħhom, għalhekk ma nistgħux inħarrġu konformità ma’ politika jew preferenzi tal-utent fuq il-katina tal-ħsieb. Lanqas ma rridu nagħmlu katina tal-ħsieb mhux allinjata viżibbli direttament lill-utenti.

Għalhekk, wara li qiesna bosta fatturi inklużi l-esperjenza tal-utent, il-vantaġġ kompetittiv, u l-għażla li nsegwu l-monitoraġġ tal-katina tal-ħsieb, iddeċidejna li ma nurux il-katini mhux ipproċessati tal-ħsieb lill-utenti. Nagħrfu li din id-deċiżjoni għandha żvantaġġi. Nistinkaw biex nikkumpensaw parzjalment għal dan billi ngħallmu lill-mudell jirriproduċi fit-tweġiba kwalunkwe idea utli mill-katina tal-ħsieb. Għas-serje ta’ mudelli o1 nuru sommarju tal-katina tal-ħsieb iġġenerat mill-mudell.

Konklużjoni

o1 javvanza b’mod sinifikanti l-aqwa livell attwali fir-raġunament tal-IA. Qed nippjanaw li noħorġu verżjonijiet imtejba ta’ dan il-mudell hekk kif inkomplu ntennu u ntejbu. Nistennew li dawn il-kapaċitajiet ġodda tar-raġunament itejbu l-ħila tagħna li nallinjaw il-mudelli mal-valuri u l-prinċipji umani. Nemmnu li o1 – u s-suċċessuri tiegħu – se jiftħu ħafna każijiet ġodda ta’ użu għall-IA fix-xjenza, il-kodifikazzjoni, il-matematika u oqsma relatati. Aħna eċċitati biex l-utenti u l-iżviluppaturi tal-API jiskopru kif jista’ jtejjeb ix-xogħol tagħhom ta’ kuljum.

Appendiċi A

Sett tad-dejtaMetrikagpt-4oo1-previewo1
Matematika tal-Kompetizzjoni
AIME (2024)
cons@6413.456.783.3
pass@19.344.674.4
Kodiċi tal-Kompetizzjoni
CodeForces
Elo8081,2581,673
Perċentil11.062.089.0
GPQA Diamondcons@6456.178.378.0
pass@150.673.377.3
Bijoloġijacons@6463.273.768.4
pass@161.665.969.2
Kimikacons@6443.060.265.6
pass@140.259.964.7
Fiżikacons@6468.689.594.2
pass@159.589.492.8
MATEMATIKApass@160.385.594.8
MMLUpass@188.092.390.8
MMMU (val)pass@169.1n/a78.2
MathVista (testmini)pass@163.8n/a73.9