Lưu trữ nội dung câu lệnh tốt hơn cho GPT‑6
Tỷ lệ truy xuất bộ nhớ đệm cao hơn cùng các công cụ mới giúp tác nhân duy trì liên tục chạy nhanh hơn với chi phí thấp hơn.
GPT‑6 cho phép các tác nhân duy trì liên tục làm việc hàng giờ với những tác vụ phức tạp, từ tái cấu trúc cơ sở mã đến tạo tài liệu và bài thuyết trình được nghiên cứu kỹ lưỡng. Các ứng dụng vận hành những tác nhân này thực hiện một chuỗi yêu cầu API nối tiếp nhau, thường tiếp tục sử dụng cùng chỉ dẫn, định nghĩa công cụ và ngữ cảnh từ các lượt trước. OpenAI lưu ngữ cảnh chung đó vào bộ nhớ đệm để tái sử dụng kết quả tính toán giữa các yêu cầu, giúp rút ngắn thời gian phản hồi và mang đến cho nhà phát triển mức giảm giá lên tới 90% đối với token đầu vào đã lưu.
Cùng dòng GPT‑6, chúng tôi ra mắt hệ thống lưu trữ nội dung câu lệnh cải tiến, mặc định mang lại tỷ lệ truy xuất bộ nhớ đệm thành công cao hơn. Giờ đây, chúng tôi áp dụng mức giá ưu đãi của bộ nhớ đệm cho các tiền tố chung đủ điều kiện được tái sử dụng trong vòng 30 phút. Chúng tôi cũng giới thiệu các công cụ mới giúp nhà phát triển theo dõi hiệu suất bộ nhớ đệm, chẩn đoán những lần truy xuất không thành công và chọn phần câu lệnh cần lưu.
Bảng điều khiển lưu trữ nội dung câu lệnh(mở trong cửa sổ mới) mới cho biết có bao nhiêu phần đầu vào của ứng dụng được cung cấp từ bộ nhớ đệm. Theo dõi tỷ lệ truy xuất thành công theo thời gian và dùng biểu đồ thành phần đầu vào để so sánh token đã lưu với token chưa lưu vào bộ nhớ đệm. Các chế độ xem này giúp bạn phát hiện mức sụt giảm của tỷ lệ truy xuất thành công và đánh giá ảnh hưởng của những thay đổi trong ứng dụng đến hiệu suất bộ nhớ đệm.

Khi gặp một lần truy xuất bộ nhớ đệm không thành công ngoài dự kiến, hãy dùng công cụ chẩn đoán lưu trữ nội dung câu lệnh(mở trong cửa sổ mới) để tìm hiểu nguyên nhân. So sánh một yêu cầu với phản hồi gần đây để xác định những thay đổi về mô hình, công cụ, chế độ cài đặt hoặc đầu vào đã ngăn việc tái sử dụng. Số token ước tính bị ảnh hưởng giúp bạn đánh giá quy mô tác động và quyết định cách tối ưu hóa tích hợp để tăng tối đa tỷ lệ truy xuất bộ nhớ đệm thành công.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Chọn nội dung cần lưu vào bộ nhớ đệm. Các điểm ngắt bộ nhớ đệm tường minh cho phép bạn chọn tiền tố câu lệnh cần tái sử dụng. Hướng dẫn lưu trữ nội dung câu lệnh(mở trong cửa sổ mới) mới cập nhật giải thích cách sử dụng các điểm ngắt, thời gian các tiền tố đã lưu còn đủ điều kiện và ảnh hưởng của những thay đổi đối với công cụ cũng như đầu vào đến khả năng tái sử dụng.
Điều chỉnh mức độ suy luận mà không làm mất hiệu lực bộ nhớ đệm. Trên các mô hình GPT‑6, giờ đây bạn có thể thay đổi mức độ suy luận(mở trong cửa sổ mới) giữa các phản hồi mà không làm mất hiệu lực bộ nhớ đệm. Tăng mức độ suy luận cho tác vụ khó hơn hoặc giảm xuống cho lượt theo dõi thông thường bằng cách nối thêm configuration_update, trong khi vẫn giữ nguyên mức độ suy luận ở cấp yêu cầu. Nhờ đó, bạn có thể điều chỉnh mức độ suy luận cần thiết cho tác vụ mà vẫn bảo toàn ngữ cảnh có thể tái sử dụng.
Duy trì bộ nhớ đệm khi công cụ và chỉ dẫn thay đổi. Khi nhu cầu sử dụng công cụ của tác nhân thay đổi, hãy giữ ổn định định nghĩa, lược đồ và thứ tự công cụ để ngữ cảnh trước đó vẫn có thể tái sử dụng. Thay vì xóa định nghĩa, hãy dùng allowed_tools để chỉ cho phép gọi các công cụ liên quan hoặc đặt tool_choice thành none khi không cần công cụ. Dùng thông báo mới của nhà phát triển để nối thêm chỉ dẫn mới vào gần cuối ngữ cảnh, qua đó ghi đè các chỉ dẫn cũ. Xem hướng dẫn quản lý thay đổi công cụ(mở trong cửa sổ mới) của chúng tôi.
Làm nóng bộ nhớ đệm trước để giảm độ trễ. Việc làm nóng trước(mở trong cửa sổ mới) chuẩn bị sẵn ngữ cảnh đã biết để mô hình có thể bắt đầu phản hồi sớm hơn khi nhận được yêu cầu. Ví dụ, khi khởi động và trước khi người dùng đặt câu hỏi đầu tiên, ứng dụng có thể làm nóng trước các chỉ dẫn chung, định nghĩa công cụ hoặc tài liệu tham khảo. Nhờ vậy, quá trình xử lý không còn diễn ra trong thời gian chờ của người dùng.
Các chế độ điều khiển tùy chọn này bổ sung cho hiệu suất mặc định của hệ thống, giúp bạn điều chỉnh việc lưu vào bộ nhớ đệm cho phù hợp với khối lượng công việc.
Theo dõi tỷ lệ truy xuất bộ nhớ đệm thành công trong Bảng điều khiển lưu trữ nội dung câu lệnh(mở trong cửa sổ mới).
Điều tra những lần truy xuất không thành công ngoài dự kiến bằng công cụ chẩn đoán(mở trong cửa sổ mới).
Làm theo hướng dẫn lưu trữ nội dung câu lệnh(mở trong cửa sổ mới) để cải thiện cấu hình hoặc dùng Codex(mở trong cửa sổ mới) để rà soát mã, áp dụng các cải tiến và đo lường kết quả.


