გადადით მთავარ შინაარსზე
OpenAI

როგორ გაასამმაგა ორმა პარამეტრმა ჩვენი ქულები ARC-AGI-3 ბენჩმარკზე

იტვირთება…

აჩქარებული ვიდეო, რომელშიც GPT‑5.6 Sol ცდილობს ARC-AGI-3 ბენჩმარკის თავსატეხების ამოხსნას ოფიციალური სარტყლით (მარცხნივ) და ჩვენი Responses API-ის სარტყლით (მარჯვნივ), რომელიც მსჯელობას ინარჩუნებს და შეკუმშვას რთავს. ამ თამაშის(იხსნება ახალ ფანჯარაში) ლიდერბორდზე ვერცერთი მოწინავე მოდელი ვერ გადის პირველზე მომდევნო დონეს. ჩვენი სარტყლით GPT‑5.6 Sol ექვსივე დონეს გადის.

როდესაც პირველად ვნახეთ GPT‑5.6 Sol-ის დაბალი ქულები ARC-AGI-3(იხსნება ახალ ფანჯარაში) ბენჩმარკზე, დავიბენით.

GPT‑5.6 Sol-მა მათემატიკაში დიდი ხნის გადაუჭრელი ღია პრობლემები, მათ შორის ციკლის ორმაგი დაფარვის ჰიპოთეზა(იხსნება ახალ ფანჯარაში), ამოხსნა და Pokémon FireRed-ის მსგავს თამაშებსაც აჯობა. თუმცა 2D თავსატეხი თამაშების ბენჩმარკ ARC-AGI-3-ზე GPT‑5.6 Sol-მა მხოლოდ 7.8% დააგროვა, GPT‑5.5 კი თამაშს თითქმის საერთოდ ვერ ახერხებდა და მწირი 0.4% მიიღო.

ნუთუ 2D თავსატეხი თამაშები ჩვენი მოდელებისთვის უჩვეულოდ რთული იყო? თუ მიზეზი სულ სხვა რამ იყო?

ბენჩმარკები AI მოდელებს განცალკევებულად იშვიათად ზომავს. ისინი ასევე ზომავს ნაკლებად თვალსაჩინო გადაწყვეტილებებს API-ის პარამეტრების, სარტყლის დიზაინისა და მითითებების შესახებ. ARC-AGI-3-ის შემთხვევაში აღმოვაჩინეთ, რომ ChatGPT‑სა და Codex-ში გამოყენებული API-ის ორი პარამეტრის—მსჯელობის შენარჩუნებისა და შეკუმშვის—ჩართვამ საჯარო დავალებების ნაკრებში ქულები გაასამმაგა, გამომავალი ტოკენების რაოდენობა კი ექვსჯერ შეამცირა.

ოფიციალური სარტყლით GPT‑5.6 Sol-მა ARC-AGI-3-ის საჯარო ნაკრებში 13.3% დააგროვა. შენარჩუნებული მსჯელობითა და შეკუმშვით შედეგი 38.3%-მდე გაიზარდა. ქულები ზომავს ადამიანის ქმედების ფარდობით ეფექტიანობას (RHAE(იხსნება ახალ ფანჯარაში))მეტრიკას, რომელიც მოდელის შედეგს ადამიანის საბაზისო მაჩვენებელს ადარებს. თამაშის ოფიციალური ჟურნალების(იხსნება ახალ ფანჯარაში) საფუძველზე, ჩვენი შეფასებით, ადამიანმა ტესტერებმა საშუალოდ 48% დააგროვეს. მოდელებს არ ეუბნებიან, როგორ შეფასდებიან, და პროცესის განმავლობაში საკუთარ ქულას ვერ ხედავენქმედების პასუხად მხოლოდ თითოეული კადრის ტექსტურ აღწერასა და მიმდინარე დონეს იღებენ.

ARC-AGI-3

ARC-AGI-3 არის ბენჩმარკი, რომელიც ზომავს, რამდენად კარგად სწავლობენ და მსჯელობენ AI აგენტები. აგენტები იკვლევენ უცნობ 2D თამაშებს და პირდაპირი ინსტრუქციების გარეშე ადგენენ მათი მუშაობის წესებს. 25 სადემონსტრაციო თამაში შეგიძლიათ ითამაშოთ მისამართზე arcprize.org/tasks(იხსნება ახალ ფანჯარაში).

ARC-AGI-3 განზრახ იყენებს ზოგად სარტყელს, ხელსაწყოებისა და სპეციალური ფუნქციების გარეშე. ARC-ის მოსაზრებით, მარტივი სარტყელი მოდელის ნაკლოვანებებს უფრო თვალსაჩინოს, მოდელების შედარებას კი უფრო სამართლიანს ხდის. კომერციული დეველოპერები კი, პირიქით, სარტყლებს თითოეული მოდელის შესაძლებლობებსა და თავისებურებებს არგებენ.

თამაშებში GPT‑5.6 Sol-მა მხოლოდ ხედვაზე დაფუძნებული სარტყლით დაამარცხა Pokémon FireRed (ტრანსლაცია: GPT_Plays_Pokemon(იხსნება ახალ ფანჯარაში)), Codex-ის კომპიუტერის მართვის ფუნქციით—Slay the Spire (ტრანსლაცია: EpochAI(იხსნება ახალ ფანჯარაში)), ხოლო Baba Is You-ს პირველი ეტაპებიც გაიარა (მასალა გააზიარეს Piotr Migdał & Piotr Grabowski(იხსნება ახალ ფანჯარაში)-მ). რით იყო ARC-AGI-3 ასე განსხვავებული?

GPT-5.6 Sol Codex-ში ასრულებს Slay the Spire 2-ის რანდომიზებულ ყოველდღიურ გამოწვევას.

ითან მოლიკი გვიჩვენებს(იხსნება ახალ ფანჯარაში), როგორ უმკლავდება GPT‑5.6 Sol Codex-ში Slay the Spire 2-ის რანდომიზებულ ყოველდღიურ გამოწვევას. ეს თამაში GPT‑5.6 Sol-ის ცოდნის ათვლის თარიღის შემდეგ გამოვიდა.

GPT‑5.5‑ის ნაკლოვანებების შესახებ ARC-ის ანალიზით(იხსნება ახალ ფანჯარაში) შთაგონებულებმა GPT‑5.6 Sol-ის რამდენიმე მცდელობა შევისწავლეთ. ARC-ის მსგავსად, ჩვენც დავინახეთ, რომ მოდელი მაინცდამაინც გონებამახვილად არ გამოიყურებოდა. თითოეულ ქმედებაზე დიდხანს ფიქრობდა და წინსვლა უჭირდა.

თუმცა სიღრმისეული შესწავლისას აღმოვაჩინეთ, რომ დაბნეულობის დიდი ნაწილი თავად მოდელს კი არა, სარტყლის პარამეტრებს უკავშირდებოდა.

პირველ რიგში შევამჩნიეთ, რომ თამაშში ყოველი ქმედების შემდეგ მთელი პირადი მსჯელობა იშლებოდა. ეს ნიშნავდა, რომ ყოველი ქმედებისას GPT‑5.6 Sol-ს თამაშის თავიდან გააზრება უწევდა, რადგან წინა ნააზრევს ვერ იმახსოვრებდა. მოდელი კვლავ ხედავდა წინა სვლებისა და მათი მოკლე თანმხლები ჩანაწერების ისტორიას, მაგრამ ვერ ხედავდა გეგმებს, მიგნებებსა თუ აზრებს, რომლებმაც ამ სვლებამდე მიიყვანა.

მეორე, დავინახეთ, რომ სარტყელი იყენებდა მოძრავ შეკვეცის ფანჯარას, რის გამოც ისტორიის ზრდასთან ერთად ძველი ქმედებები უხილავი ხდებოდა. ამრიგად, GPT‑5.6 Sol არა მხოლოდ წინა ნააზრევს ვერ იმახსოვრებდა, არამედ წინა ქმედებების მეხსიერებასაც კარგავდა.

სარტყლის ეს ორი მახასიათებელი—მსჯელობის წაშლა და მოძრავი შეკვეცა—ერთად ხსნიდა, რატომ უჭირდა GPT‑5.6 Sol-ს დროთა განმავლობაში სწავლა.

აგენტები საუკეთესო შედეგს აღწევენ, როცა საკუთარი ქმედებები ახსოვთ

ჩვენი მოდელები გაწვრთნილია ისე, რომ პასუხის ან ხელსაწყოს გამოძახების გაცემამდე პირადი მსჯელობის შეტყობინებებით იფიქრონ. პირადი ნააზრევის ეს შეტყობინებები საუბრის ისტორიის ნაწილად ინახება. თუ საუბარი მეტისმეტად გრძელდება, მას ვაჯამებთ და ვაგრძელებთ.

დიაგრამა, რომელიც გვიჩვენებს, როგორ მუშაობს ერთად მოდელის მსჯელობა, ხელსაწყოების გამოძახებები, საუბრის ისტორია და კონტექსტის შეკუმშვა ხანგრძლივი დავალების შესრულებისას.

ჩვენი მოდელები ასეა გაწვრთნილი და სწორედ ასე გამოიყენება ChatGPT‑სა და Codex-ში. ჩვენს საწარმოო გარემოსთან უკეთ შესატყვისად ARC-AGI-3-ის სარტყელი ჩვენი Responses API(იხსნება ახალ ფანჯარაში)-ით განვახორციელეთ. ჩვენი API კონტექსტის მართვას ამარტივებს: GPT‑5.6‑ისთვის წინა პასუხის ID-ის გადაცემა ხელსაწყოების გამოძახებებსა და სვლებს შორის მსჯელობას ავტომატურად ინარჩუნებს.

მსჯელობის შენარჩუნების შემდეგ ორი მნიშვნელოვანი ცვლილება შევამჩნიეთ. პირველი: GPT‑5.6 Sol თითოეული ქმედების წინ ნაკლებ დროს ხარჯავდა ფიქრში, რადგან ყოველ სვლაზე თამაშის თავიდან გააზრება აღარ სჭირდებოდა. მეორე: წინა აზრების დამახსოვრებისას GPT‑5.6 Sol დროთა განმავლობაში გაცილებით უკეთ სწავლობდა და თანმიმდევრულ სტრატეგიებს იყენებდა.

შემდეგი გაუმჯობესება მოძრავი შეკვეცის შეკუმშვით(იხსნება ახალ ფანჯარაში) ჩანაცვლებამ მოიტანა—ეს Responses API-ის კიდევ ერთი პარამეტრია.

ARC-AGI-3-ის სარტყელი კონტექსტის შეზღუდვებს მოძრავი შეკვეცით უმკლავდება. როდესაც საუბრის კონტექსტი 175 000 სიმბოლოს აჭარბებს, უძველესი შეტყობინებები იშლება.

მოძრავ შეკვეცას ორი ნაკლი აქვს. პირველი: მოდელი ადრინდელ დაკვირვებებსა და ქმედებებს კარგავს. მეორე: დავალების დიდ ნაწილს თითქმის სავსე კონტექსტური ფანჯრით ასრულებს, რამაც შეიძლება შედეგი ოდნავ გააუარესოს.

ARC-AGI-3-ზე შეკუმშვის ჩართვის შემდეგ GPT‑5.6 Sol უფრო ხანგრძლივი პროცესების განმავლობაშიც უკეთ ინარჩუნებდა თითოეული თამაშის შესახებ ნასწავლს და ნაკლები გამომავალი ტოკენით უფრო მაღალ ქულას აღწევდა.

მსჯელობის შენარჩუნებისა და შეკუმშვის ეფექტის საჩვენებლად გთავაზობთ ანიმაციას, რომელშიც ჩანს, როგორ იყენებს GPT‑5.6 Sol 175K-იან კონტექსტურ ფანჯარას ARC-AGI-3-ის თავსატეხების სერიის თითოეული სარტყლით ამოხსნისას.

ორი ცენტრალური სვეტი გვიჩვენებს, როგორ განსხვავებულად იყენებს თითოეული სარტყელი მოდელის კონტექსტურ ფანჯარას. წარსულის უკეთ დამახსოვრების წყალობით GPT‑5.6 Sol თითოეულ ქმედებაზე ნაკლებს ფიქრობს და გაცილებით სწრაფად მოქმედებს. შენიშვნა: ჩვენი განხორციელება სიმბოლოების ნაცვლად 175 000 ტოკენის ლიმიტს იყენებს, თუმცა საბოლოო შედეგი თითქმის იგივეა, რადგან ტექსტის უდიდესი ნაწილი ქმედებათა ბადეებია, რომლებსაც ჩვენი ტოკენიზატორი 1:1 თანაფარდობით გარდაქმნის ტოკენებად.

მსჯელობის შენარჩუნება და შეკუმშვა ერთად GPT‑5.6 Sol-ს (მაქსიმალური) დაახლოებით სამჯერ მაღალი ქულის მიღებისა და ექვსჯერ ნაკლები გამომავალი ტოკენის გამოყენების საშუალებას აძლევს.

დასკვნა და რეკომენდაციები

ვიმედოვნებთ, ეს ექსპერიმენტები შეგვახსენებს, რომ შეფასებები მოდელებს განცალკევებულად იშვიათად ზომავს—ისინი ასევე ზომავს ნაკლებად თვალსაჩინო გადაწყვეტილებების ერთობლიობას API-ის პარამეტრების, სარტყლის დიზაინისა და მითითებების შესახებ. ეს პირველი შემთხვევა არ არის, როცა საჯარო ბენჩმარკის დაბალმა ქულებმა გაგვაკვირვა და შემდეგ აღმოვაჩინეთ, რომ შეფასების გამშვები ზოგად სარტყელს იყენებდა, რომელიც მსჯელობის შეტყობინებებს შლიდა.

თუ API-ის დეველოპერი ხართ და მაქსიმალური შედეგის მიღება გსურთ, გირჩევთ გამოიყენოთ იგივე პარამეტრები, რომლებსაც საკუთარ პროდუქტებში ვიყენებთ:

  • გამოიყენეთ ჩვენი Responses API და არა მოძველებული ჩატის დასრულების API
  • შეინარჩუნეთ მსჯელობა
  • გამოიყენეთ შეკუმშვა

თუ მოდელებს ადარებთ, გირჩევთ დაეყრდნოთ შეფასებებს, რომლებიც ზემოთ ჩამოთვლილ პარამეტრებს იყენებს—ისინი საუკეთესოდ შეესაბამება ChatGPT‑სა და Codex-ში რეალურ გამოყენებას.

მადლობას ვუხდით ARC-ს AGI-ის შეფასებაზე მრავალწლიანი შემოქმედებითი მუშაობისა და იმ ანალიზისთვის, რომელმაც საკითხის უფრო ღრმად შესწავლა შთაგვაგონა.

თუ გსურთ საკუთარი შესაძლებლობები მოწინავე მოდელებისას შეადაროთ, თავად სცადეთ საჯარო თამაშები მისამართზე arcprize.org/tasks(იხსნება ახალ ფანჯარაში).

ავტორი

Ilan Bigio და Ted Sanders