Bỏ qua nội dung chính
OpenAI

22 tháng 9, 2026

Sản phẩm

Lưu trữ nội dung câu lệnh tốt hơn cho GPT‑6

Tỷ lệ truy xuất bộ nhớ đệm cao hơn cùng các công cụ mới giúp tác nhân duy trì liên tục chạy nhanh hơn với chi phí thấp hơn.

Đang tải…

GPT‑6 cho phép các tác nhân duy trì liên tục làm việc hàng giờ với những tác vụ phức tạp, từ tái cấu trúc cơ sở mã đến tạo tài liệu và bài thuyết trình được nghiên cứu kỹ lưỡng. Các ứng dụng vận hành những tác nhân này thực hiện một chuỗi yêu cầu API nối tiếp nhau, thường tiếp tục sử dụng cùng chỉ dẫn, định nghĩa công cụ và ngữ cảnh từ các lượt trước. OpenAI lưu ngữ cảnh chung đó vào bộ nhớ đệm để tái sử dụng kết quả tính toán giữa các yêu cầu, giúp rút ngắn thời gian phản hồi và mang đến cho nhà phát triển mức giảm giá lên tới 90% đối với token đầu vào đã lưu.

Cùng dòng GPT‑6, chúng tôi ra mắt hệ thống lưu trữ nội dung câu lệnh cải tiến, mặc định mang lại tỷ lệ truy xuất bộ nhớ đệm thành công cao hơn. Giờ đây, chúng tôi áp dụng mức giá ưu đãi của bộ nhớ đệm cho các tiền tố chung đủ điều kiện được tái sử dụng trong vòng 30 phút. Chúng tôi cũng giới thiệu các công cụ mới giúp nhà phát triển theo dõi hiệu suất bộ nhớ đệm, chẩn đoán những lần truy xuất không thành công và chọn phần câu lệnh cần lưu.

Tính năng lưu trữ nội dung câu lệnh của OpenAI đóng vai trò then chốt trong việc giúp GitHub Copilot mang lại trải nghiệm nhanh chóng, hiệu quả ở quy mô lớn. Trong vài tháng qua, trên hàng tỷ yêu cầu gửi đến các mô hình OpenAI, chúng tôi đã giảm hơn 50% tỷ lệ token câu lệnh cần xử lý mới so với mức cơ sở trước đây. Kết quả là một hệ thống suy luận hiệu quả hơn và thời gian chờ phản hồi đầu tiên ngắn hơn cho các nhà phát triển.
—Mario Rodriguez, Giám đốc Sản phẩm

Theo dõi hoạt động lưu vào bộ nhớ đệm và chẩn đoán lỗi truy xuất

Bảng điều khiển lưu trữ nội dung câu lệnh(mở trong cửa sổ mới) mới cho biết có bao nhiêu phần đầu vào của ứng dụng được cung cấp từ bộ nhớ đệm. Theo dõi tỷ lệ truy xuất thành công theo thời gian và dùng biểu đồ thành phần đầu vào để so sánh token đã lưu với token chưa lưu vào bộ nhớ đệm. Các chế độ xem này giúp bạn phát hiện mức sụt giảm của tỷ lệ truy xuất thành công và đánh giá ảnh hưởng của những thay đổi trong ứng dụng đến hiệu suất bộ nhớ đệm.

Bảng điều khiển lưu trữ nội dung câu lệnh hiển thị tỷ lệ truy xuất bộ nhớ đệm thành công, hiệu suất bộ nhớ đệm theo thời gian và thành phần token đầu vào.

Khi gặp một lần truy xuất bộ nhớ đệm không thành công ngoài dự kiến, hãy dùng công cụ chẩn đoán lưu trữ nội dung câu lệnh(mở trong cửa sổ mới) để tìm hiểu nguyên nhân. So sánh một yêu cầu với phản hồi gần đây để xác định những thay đổi về mô hình, công cụ, chế độ cài đặt hoặc đầu vào đã ngăn việc tái sử dụng. Số token ước tính bị ảnh hưởng giúp bạn đánh giá quy mô tác động và quyết định cách tối ưu hóa tích hợp để tăng tối đa tỷ lệ truy xuất bộ nhớ đệm thành công.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Tối ưu hóa bộ nhớ đệm cho ứng dụng

Chọn nội dung cần lưu vào bộ nhớ đệm. Các điểm ngắt bộ nhớ đệm tường minh cho phép bạn chọn tiền tố câu lệnh cần tái sử dụng. Hướng dẫn lưu trữ nội dung câu lệnh(mở trong cửa sổ mới) mới cập nhật giải thích cách sử dụng các điểm ngắt, thời gian các tiền tố đã lưu còn đủ điều kiện và ảnh hưởng của những thay đổi đối với công cụ cũng như đầu vào đến khả năng tái sử dụng.

Điều chỉnh mức độ suy luận mà không làm mất hiệu lực bộ nhớ đệm. Trên các mô hình GPT‑6, giờ đây bạn có thể thay đổi mức độ suy luận(mở trong cửa sổ mới) giữa các phản hồi mà không làm mất hiệu lực bộ nhớ đệm. Tăng mức độ suy luận cho tác vụ khó hơn hoặc giảm xuống cho lượt theo dõi thông thường bằng cách nối thêm configuration_update, trong khi vẫn giữ nguyên mức độ suy luận ở cấp yêu cầu. Nhờ đó, bạn có thể điều chỉnh mức độ suy luận cần thiết cho tác vụ mà vẫn bảo toàn ngữ cảnh có thể tái sử dụng.

Duy trì bộ nhớ đệm khi công cụ và chỉ dẫn thay đổi. Khi nhu cầu sử dụng công cụ của tác nhân thay đổi, hãy giữ ổn định định nghĩa, lược đồ và thứ tự công cụ để ngữ cảnh trước đó vẫn có thể tái sử dụng. Thay vì xóa định nghĩa, hãy dùng allowed_tools để chỉ cho phép gọi các công cụ liên quan hoặc đặt tool_choice thành none khi không cần công cụ. Dùng thông báo mới của nhà phát triển để nối thêm chỉ dẫn mới vào gần cuối ngữ cảnh, qua đó ghi đè các chỉ dẫn cũ. Xem hướng dẫn quản lý thay đổi công cụ(mở trong cửa sổ mới) của chúng tôi.

Làm nóng bộ nhớ đệm trước để giảm độ trễ. Việc làm nóng trước(mở trong cửa sổ mới) chuẩn bị sẵn ngữ cảnh đã biết để mô hình có thể bắt đầu phản hồi sớm hơn khi nhận được yêu cầu. Ví dụ, khi khởi động và trước khi người dùng đặt câu hỏi đầu tiên, ứng dụng có thể làm nóng trước các chỉ dẫn chung, định nghĩa công cụ hoặc tài liệu tham khảo. Nhờ vậy, quá trình xử lý không còn diễn ra trong thời gian chờ của người dùng.

Các chế độ điều khiển tùy chọn này bổ sung cho hiệu suất mặc định của hệ thống, giúp bạn điều chỉnh việc lưu vào bộ nhớ đệm cho phù hợp với khối lượng công việc.

1 trong số 3
Công cụ chẩn đoán và bảng điều khiển lưu trữ nội dung câu lệnh của OpenAI đã giúp chúng tôi tăng tỷ lệ truy xuất bộ nhớ đệm thành công thêm vài điểm phần trăm, qua đó giảm 20% chi phí. Giờ đây, chúng tôi nhận được cảnh báo khi bộ nhớ đệm bất ngờ mất hiệu lực và dùng các tác nhân Codex để chẩn đoán nguyên nhân gốc rễ. Các điểm ngắt tường minh cũng cho phép chúng tôi lưu ngữ cảnh ổn định vào bộ nhớ đệm, đồng thời đặt nội dung thường xuyên thay đổi ở cuối câu lệnh. Nhờ vậy, việc tạo nhánh các cuộc trò chuyện cho tác vụ chạy nền trở nên khả thi về mặt chi phí, trong khi vẫn tái sử dụng được gần như toàn bộ ngữ cảnh chung.
—Arian Hanifi, Giám đốc Công nghệ

Bắt đầu

Tác giả

OpenAI