Lepsze buforowanie poleceń w GPT‑6
Więcej trafień w pamięci podręcznej i nowe narzędzia, dzięki którym trwali agenci działają szybciej i taniej.
GPT‑6 umożliwia trwałym agentom wielogodzinną pracę nad złożonymi zadaniami — od refaktoryzacji baz kodu po tworzenie dobrze udokumentowanych opracowań i prezentacji. Aplikacje obsługujące tych agentów wykonują serię powiązanych ze sobą żądań API, często przekazując dalej te same instrukcje, definicje narzędzi i kontekst z wcześniejszych tur. OpenAI buforuje ten wspólny kontekst, aby ponownie wykorzystywać obliczenia między żądaniami, skracać czas odpowiedzi i oferować programistom rabaty do 90% na zbuforowane tokeny wejściowe.
Wraz z rodziną GPT‑6 udostępniliśmy ulepszony system buforowania poleceń, który domyślnie zapewnia wyższy współczynnik trafień w pamięci podręcznej. Teraz oferujemy rabaty za buforowanie kwalifikujących się wspólnych prefiksów ponownie użytych w ciągu 30 minut. Wprowadzamy też nowe narzędzia, które pomagają programistom monitorować wydajność pamięci podręcznej, diagnozować chybienia i wybierać, jaka część polecenia ma być buforowana.
Nowy Panel buforowania poleceń(otwiera nowe okno) pokazuje, jaka część danych wejściowych aplikacji jest pobierana z pamięci podręcznej. Śledź współczynnik trafień w czasie i używaj wykresu struktury danych wejściowych do porównywania zbuforowanych i niezbuforowanych tokenów. Te widoki pomagają zauważyć spadki współczynnika trafień i ocenić wpływ zmian w aplikacji na wydajność buforowania.

Gdy zauważysz nieoczekiwane chybienie, użyj narzędzia diagnostycznego buforowania poleceń(otwiera nowe okno), aby ustalić, co się stało. Porównaj żądanie z niedawną odpowiedzią, aby wykryć zmiany modelu, narzędzi, ustawień lub danych wejściowych, które uniemożliwiły ponowne użycie. Szacowana liczba tokenów objętych zmianą pomaga ocenić skalę jej wpływu i ustalić, jak zoptymalizować integrację, aby zmaksymalizować współczynnik trafień w pamięci podręcznej.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Wybierz, co buforować. Jawne punkty podziału pamięci podręcznej pozwalają wybrać prefiksy polecenia przeznaczone do ponownego użycia. Zaktualizowany przewodnik po buforowaniu poleceń(otwiera nowe okno) wyjaśnia, jak z nich korzystać, jak długo zbuforowane prefiksy kwalifikują się do ponownego użycia oraz jak wpływają na nie zmiany narzędzi i danych wejściowych.
Dostosuj nakład na rozumowanie bez naruszania pamięci podręcznej. W modelach GPT‑6 można teraz zmieniać nakład na rozumowanie(otwiera nowe okno) między odpowiedziami bez naruszania pamięci podręcznej. Zwiększ nakład przy trudniejszym zadaniu lub zmniejsz go przy rutynowym pytaniu uzupełniającym, dodając configuration_update bez zmiany nakładu na rozumowanie na poziomie żądania. Pozwala to dostosować zakres rozumowania potrzebny do wykonania zadania, a jednocześnie zachować kontekst do ponownego użycia.
Zachowaj pamięć podręczną mimo zmian narzędzi i instrukcji. Gdy zmieniają się potrzeby agenta w zakresie korzystania z narzędzi, zachowaj stabilne definicje, schematy i kolejność narzędzi, aby wcześniejszy kontekst nadal nadawał się do ponownego użycia. Zamiast usuwać definicje, użyj allowed_tools, aby można było wywoływać tylko odpowiednie narzędzia, lub ustaw tool_choice na none, gdy żadne narzędzia nie są potrzebne. Dodawaj nowe instrukcje pod koniec kontekstu za pomocą nowych komunikatów deweloperskich, aby zastępowały starsze instrukcje. Zapoznaj się z naszymi wskazówkami dotyczącymi zarządzania zmianami narzędzi(otwiera nowe okno).
Wstępnie rozgrzej pamięć podręczną, aby zmniejszyć opóźnienia. Wstępne rozgrzewanie(otwiera nowe okno) przygotowuje z wyprzedzeniem znany kontekst, dzięki czemu po nadejściu żądania model może szybciej zacząć odpowiadać. Na przykład podczas uruchamiania aplikacja może wstępnie rozgrzać wspólne instrukcje, definicje narzędzi lub materiały referencyjne, zanim użytkownik zada pierwsze pytanie. Dzięki temu przetwarzanie odbywa się poza czasem oczekiwania użytkownika.
Te opcjonalne mechanizmy wykorzystują domyślną wydajność silnika i pomagają dostosować buforowanie do obciążenia.
Monitoruj współczynnik trafień w Panelu buforowania poleceń(otwiera nowe okno).
Badaj nieoczekiwane chybienia za pomocą narzędzia diagnostycznego(otwiera nowe okno).
Skorzystaj z przewodnika po buforowaniu poleceń(otwiera nowe okno), aby ulepszyć konfigurację, lub użyj Codex(otwiera nowe okno) do przejrzenia kodu, wdrożenia usprawnień i pomiaru wyników.


