Bỏ qua nội dung chính
OpenAI

25 tháng 8, 2026

Kỹ thuậtCông ty

Những kết quả đầu tiên của Jalapeño cho thấy tốc độ và hiệu quả suy luận AI hàng đầu ngành

Đang tải…
Cận cảnh chip suy luận Jalapeño được gắn trên bo mạch màu xanh ngọc.

Kể từ khi công bố Jalapeño, chip suy luận tùy chỉnh đầu tiên của OpenAI, chúng tôi đã thử nghiệm chip này và hệ thống được xây dựng xoay quanh chip đó. Kết quả cho thấy một bước tiến đáng kể về hiệu năng: Jalapeño có thể xử lý nhiều tác vụ AI hơn trên mỗi đơn vị điện năng, đồng thời trả về phản hồi nhanh hơn. Jalapeño mang lại cả thông lượng cao hơn lẫn độ trễ thấp hơn với một kiến trúc duy nhất, trong khi các hệ thống phần cứng hiện có thường phải đánh đổi giữa hai yếu tố này.

Đối với khách hàng, điều đó có thể đồng nghĩa với phản hồi nhanh hơn, tác nhân phản hồi tốt hơn và khả năng truy cập đáng tin cậy hơn khi nhu cầu tăng lên. Sứ mệnh của chúng tôi là bảo đảm trí tuệ nhân tạo tổng hợp sẽ mang lại lợi ích cho toàn nhân loại. Những tiến bộ này sẽ giúp AI ngày càng có năng lực cao hơn có chi phí phải chăng hơn và được tiếp cận rộng rãi hơn.

Các mô hình OpenAI cũng đã đẩy nhanh quá trình phát triển của Jalapeño. Các thế hệ trước đã giúp nhóm thiết kế và đưa chip vào hoạt động, trong khi các mô hình mới nhất của chúng tôi đang đẩy nhanh quá trình chúng tôi tối ưu hóa và lập trình chip. Jalapeño cho hiệu năng trên GPT‑OSS 120B, DeepSeek R1 và Kimi K2.5 1T, cho thấy kiến trúc này hoạt động hiệu quả trên các mô hình được phát triển cả trong và ngoài OpenAI. Trong cả ba trường hợp, Jalapeño đạt khối lượng công việc AI trên mỗi watt cao hơn 1,5 đến 1,9 lần ở thông lượng đỉnh và độ trễ đầu cuối thấp hơn 1,7 đến 3,6 lần so với các hệ thống đối sánh. Đối với các khối lượng công việc có tính tương tác cao, mô hình này mang lại hiệu suất cao hơn từ 2,1 đến 4,1 lần.

Jalapeño cũng là minh chứng cho một lợi thế full-stack rộng lớn hơn. OpenAI có thể đồng thời thiết kế mô hình, sản phẩm, phần mềm phục vụ, chip, bộ nhớ, mạng và hệ thống, sử dụng những gì chúng tôi học được từ các khối lượng công việc thực tế để cải thiện mọi lớp trong toàn bộ hệ thống. Jalapeño là silicon do chính chúng tôi phát triển đang hoạt động với các kết quả đã được đo lường, đồng thời là khởi đầu của một nền tảng nhiều thế hệ. Trong những tháng tới, chúng tôi sẽ tăng cường triển khai Jalapeño để mang đến các sản phẩm nhanh hơn, mạnh mẽ hơn và hiệu quả hơn cho khách hàng.

Cách chúng tôi đo lường hiệu suất của Jalapeño

Chúng tôi đánh giá hiệu năng ở trải nghiệm người dùng tương đương, đo lường lượng công việc AI hữu ích mà mỗi hệ thống có thể hoàn thành trên mỗi đơn vị năng lượng trong khi vẫn đáp ứng độ trễ mà khách hàng và các tác nhân tương tác yêu cầu. Điều này đặc biệt quan trọng đối với các tác nhân, vốn cần hoàn thành nhiều bước theo trình tự, nên sự chậm trễ có thể cộng dồn trong toàn bộ một tác vụ.

Để hiểu cách Jalapeño hoạt động trong thực tế, chúng tôi đã thử nghiệm chip này trên InferenceX, một quy chuẩn công khai của SemiAnalysis đo lường toàn bộ quy trình xử lý một yêu cầu AI. Chúng tôi đã so sánh Jalapeño với các hệ thống AI hàng đầu hiện có trên thị trường trong toàn bộ phạm vi vận hành được thử nghiệm, từ phục vụ với thông lượng cao đến sử dụng có tính tương tác cao, độ trễ thấp. Jalapeño mang lại sự kết hợp tốt hơn giữa thông lượng, hiệu suất năng lượng và độ trễ. Mặc dù hiệu năng đôi khi được báo cáo trên mỗi chip, chúng tôi cho rằng tiêu chuẩn hữu ích hơn là hiệu năng trên mỗi đơn vị điện năng.

Jalapeño nới rộng khoảng cách dẫn đầu tại TBT tốt nhất trước đó

Jalapeño mang lại nhiều token hơn trên mỗi người dùng

Jalapeño mang lại thông lượng cao hơn trên mỗi kilowatt

Trên cả ba mô hình công khai, Jalapeño mang lại sự kết hợp tốt hơn giữa hiệu năng trên mỗi watt và độ trễ trên toàn bộ phạm vi vận hành được thử nghiệm, đưa nó lên đường biên Pareto. Để so sánh các hệ thống một cách nhất quán, chúng tôi đã chuẩn hóa kết quả bằng cách sử dụng mức công suất chip được công bố của từng bộ tăng tốc. Jalapeño được đánh giá ở mức 700 watt, mặc dù công suất duy trì đo được của nó vẫn ở mức bằng hoặc dưới 550 watt đối với các khối lượng công việc được thử nghiệm.

Jalapeño đạt hiệu suất rất tốt trên GPT‑OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T. Trên Kimi, mô hình công khai lớn nhất mà chúng tôi đã thử nghiệm, hệ thống này mang lại hiệu năng đỉnh trên mỗi watt cao hơn khoảng 1,5 lần và độ trễ đầu cuối thấp hơn 3,4 lần so với hệ thống so sánh. Trong thử nghiệm nội bộ của chúng tôi, lợi thế của Jalapeño còn được nới rộng hơn nữa trên các mô hình OpenAI tiên phong, cho thấy kiến trúc này trở nên có giá trị hơn khi khối lượng công việc trở nên lớn hơn và đòi hỏi cao hơn.

Thiết kế để đạt tốc độ và hiệu quả trong một con chip duy nhất

Jalapeño được thiết kế ngay từ đầu xoay quanh câu hỏi: chúng ta sẽ xây dựng loại phần cứng nào nếu nhiệm vụ chính của nó là phục vụ các mô hình ngôn ngữ hiện đại và trong tương lai, đặc biệt là các tác tử tương tác? Những cải thiện của Jalapeño đến từ việc thiết kế chip, bộ nhớ, mạng, phần mềm và hệ thống ở quy mô rack cùng nhau xoay quanh các khối lượng công việc thực tế của mô hình ngôn ngữ. Quá trình suy luận của mô hình ngôn ngữ trải qua nhiều giai đoạn riêng biệt với các điểm nghẽn khác nhau. Prefill, khi hệ thống xử lý một câu lệnh, đòi hỏi nhiều năng lực tính toán, trong khi decode, khi hệ thống tạo phản hồi theo từng token, lại bị giới hạn nhiều hơn bởi băng thông bộ nhớ. Việc giao tiếp cũng có thể làm tăng độ trễ khi dữ liệu phải di chuyển giữa các lõi và chip, khiến một số đơn vị xử lý không hoạt động trong khi chờ đợi. Một hệ thống vượt trội ở một giai đoạn có thể đánh mất lợi thế đó trong khi chờ dữ liệu hoặc chuyển trạng thái của mô hình giữa các tài nguyên khác nhau.

Chúng tôi thiết kế Jalapeño để giảm thiểu việc di chuyển dữ liệu và độ trễ giao tiếp. Điều này có nghĩa là trạng thái mô hình, bao gồm bộ nhớ đệm KV được sử dụng khi tạo phản hồi, có thể được đặt rõ ràng và duy trì cục bộ trong khi hệ thống kích hoạt tổ hợp tính toán, bộ nhớ và mạng phù hợp cho từng giai đoạn suy luận. Mạng là một phần không thể thiếu của kiến trúc. Phạm vi rộng lớn của mạng cho phép toàn bộ khối lượng công việc duy trì trong một hệ thống được kết nối, giảm thiểu việc di chuyển dữ liệu và giúp toàn bộ yêu cầu luôn nhanh chóng, hiệu quả từ đầu đến cuối. Kết quả là một bộ tăng tốc cân bằng và có thể thay thế, có thể hỗ trợ các kiến trúc mô hình thay đổi, vượt trội ở cả giai đoạn tiền điền dữ liệu và giải mã, đồng thời thích ứng khi sự cân bằng giữa hai giai đoạn này thay đổi — một đặc điểm xác định của các khối lượng công việc tác tử.

Chúng tôi đã dùng AI để thiết kế chip và thiết kế chip để AI có thể lập trình chip đó

AI đóng vai trò trực tiếp trong quá trình phát triển Jalapeño, giúp nhóm chuyển từ thiết kế ban đầu đến tapeout trong chín tháng bằng cách khám phá các phương án triển khai, rút ngắn các vòng lặp thiết kế, đo lường và xác minh, đồng thời liên tục lặp lại và cải tiến các workload của mô hình. AI cũng giúp tối ưu hóa các mạch số học của chip, cho phép nhóm đưa thêm năng lực tính toán vào chip đúng tiến độ.

Jalapeño được thiết kế như một mục tiêu lập trình rõ ràng, có thể dự đoán được cho cả con người và AI. Các kỹ sư có thể mô tả công việc thông qua các tensor cục bộ, giao tiếp tường minh và đồng bộ hóa có thể dự đoán được. Sau đó, AI có thể tối ưu hóa cách công việc đó được ánh xạ, bố trí, lập lịch và phối hợp trên toàn hệ thống. Cấu trúc rõ ràng, có thể dự đoán được đó mang lại cho AI một cách khả thi để giải quyết bài toán lập trình song song vốn khó khăn theo truyền thống.

Việc hỗ trợ mỗi họ mô hình mới vẫn đòi hỏi các kernel mới và các tối ưu hóa dành riêng cho từng mô hình. Bằng cách sử dụng Codex cùng GPT‑Astra, nhóm đã đưa ba mô hình trọng số mở vốn không nằm trong kế hoạch sản xuất ban đầu của Jalapeño đạt hiệu năng cao trong vòng hai tháng. Điều này cho thấy cả sự linh hoạt của kiến trúc lẫn tốc độ mà AI có thể giúp chúng tôi lập trình kiến trúc đó. Đối với một số khối attention và mixture-of-experts GPT‑OSS được chọn, các bản triển khai do AI tạo ra chạy nhanh gấp 1,5 đến 1,8 lần so với các bản triển khai hiện có do chuyên gia con người viết. Những số liệu đó áp dụng cho các khối được chọn, chứ không phải toàn bộ mô hình, nhưng chúng cho thấy triển vọng về một vòng lặp phát triển mới đầy mạnh mẽ.

Hướng đi phía trước cho suy luận hiệu quả, Ultra nhanh

Cơ sở hạ tầng AI rất có giá trị vì nó cho phép thực hiện những công việc thực tiễn hữu ích. Bằng cách tạo ra nhiều công việc hữu ích hơn với cùng lượng điện năng và phần cứng, Jalapeño có thể giúp chúng tôi đáp ứng nhiều nhu cầu hơn và giảm chi phí để mang lại kết quả thành công. Đối với OpenAI, điều đó có thể cải thiện đòn bẩy hoạt động bằng cách cho phép công việc hữu ích và doanh thu tăng nhanh hơn chi phí phục vụ. Điều đó cũng có thể hỗ trợ việc ứng dụng rộng rãi hơn và tiếp tục đầu tư vào các mô hình, sản phẩm và cơ sở hạ tầng tốt hơn. Suy luận nhanh hơn có thể cho phép lặp lại nhanh hơn và tạo ra các trường hợp sử dụng mới.

Jalapeño mở rộng những gì có thể cho suy luận hiệu quả, độ trễ thấp:

  • Suy luận ở chế độ ultra-nhanh với hiệu suất trước đây chỉ có ở chế độ nhanh
  • Suy luận ở Chế độ nhanh với mức hiệu quả trước đây chỉ có ở chế độ theo lô
  • Hiệu quả cao hơn cho suy luận ở chế độ theo lô

Chúng tôi dự kiến bắt đầu triển khai Jalapeño trong hạ tầng điện toán của OpenAI trước cuối năm nay. Đây là thế hệ đầu tiên trong lộ trình nhiều thế hệ: Gen 2 đang được phát triển sâu, và Gen 3 đang dần thành hình. Mỗi thế hệ sẽ kế thừa những gì chúng tôi học được và tiếp tục nâng cao cả hiệu quả lẫn tốc độ.

Đáp ứng nhu cầu ngày càng tăng về AI sẽ đòi hỏi nhiều năng lực điện toán hơn từ mọi nguồn sẵn có. Chúng tôi sẽ tiếp tục triển khai rộng rãi các bộ tăng tốc từ NVIDIA và các đối tác khác cho cả khối lượng công việc đào tạo và suy luận. Sứ mệnh của chúng tôi là bảo đảm trí tuệ nhân tạo tổng hợp sẽ mang lại lợi ích cho toàn nhân loại.

Khi chuẩn bị triển khai, chúng tôi đang tiếp tục đánh giá đủ điều kiện sản xuất, hoàn thiện phần mềm, chuẩn bị vận hành Jalapeño ở quy mô lớn và xác thực hiệu năng trên nhiều mô hình hơn. Kết quả đến nay cho thấy những gì có thể đạt được khi chúng tôi cùng thiết kế toàn bộ hệ thống: cung cấp AI tác nhân có khả năng phản hồi tốt hơn và năng lực cao hơn cho nhiều người hơn một cách hiệu quả hơn.

Phụ lục

Jalapeño là tiên phong Pareto tại GPT‑OSS 120B

TIÊN PHONG VỀ THÔNG LƯỢNG TRÊN MỖI kW

InferenceX · GPT‑OSS‑120B · danh nghĩa 8k/1k · STP · TDP gói: Jalapeño 700 W; GB200 1,200 W

Jalapeño dẫn đầu trên các điểm vận hành GPT‑OSS

THÔNG LƯỢNG ĐỈNH VÀ PHÙ HỢP

InferenceX · GPT‑OSS‑120B · danh nghĩa 8k/1k · STP · TDP gói: Jalapeño 700 W; GB200 1,200 W

TPS / kW đỉnh cao hỗn hợp

≈1,9×

85.448 so với 44.960 hỗn hợp / kW

Độ trễ đầu-cuối thấp hơn

≈1,7×

1,03 s so với 1,80 s

Giảm mức TBT tối thiểu

≈2,7×

0,69 so với 1,87 ms (1.459 so với 535 tok/s/người dùng)

Thông lượng cao hơn tại lần TBT trước

≈53,7×

22.935 so với 427 hỗn hợp / kW (ở mức 535,28 tok/s/user)

Jalapeño nằm trên biên tiên phong Pareto tại DeepSeek R1 670B

CÔNG SUẤT TRÊN MỖI kW

InferenceX · DeepSeek R1 MXFP4 · danh nghĩa 8k/1k · STP · TDP gói: Jalapeño 700 W; GB300 1,400 W

Jalapeño dẫn đầu tại các điểm vận hành của DeepSeek R1

THÔNG LƯỢNG ĐỈNH VÀ PHÙ HỢP

InferenceX · DeepSeek R1 MXFP4 · danh nghĩa 8k/1k · STP · TDP gói: Jalapeño 700 W; GB300 1,400 W

TPS / kW đỉnh cao hỗn hợp

≈1,7×

19.641 so với 11.781 hỗn hợp / kW

Độ trễ đầu-cuối thấp hơn

≈3,6×

1,65 giây so với 5,99 giây

Giảm mức TBT tối thiểu

≈4.1×

1,43 so với 5,90 ms (700 so với 169 tok/giây/người dùng)

Thông lượng cao hơn tại lần TBT trước

≈104,3×

12.258 so với 118 hỗn hợp / kW (với tốc độ 169,41 tok/giây/người dùng)

Jalapeño là tiên phong Pareto tại Kimi K2.5 1T

CÔNG SUẤT TRÊN MỖI kW

InferenceX · Kimi K2.5 MXFP4 · danh nghĩa 8k/1k · STP · TDP gói: Jalapeño 700 W; GB300 1.400 W

Jalapeño dẫn đầu ở mọi điểm vận hành của Kimi K2.5

THÔNG LƯỢNG ĐỈNH VÀ PHÙ HỢP

InferenceX · Kimi K2.5 MXFP4 · danh nghĩa 8k/1k · STP · TDP gói: Jalapeño 700 W; GB300 1.400 W

TPS / kW đỉnh cao hỗn hợp

≈1.5×

18.195 so với 11.862 hỗn hợp / kW

Độ trễ đầu-cuối thấp hơn

≈3.4×

1,56 giây so với 5,31 giây

Giảm mức TBT tối thiểu

≈3,8×

1,44 so với 5,48 ms (694 so với 182 tok/giây/người dùng)

Thông lượng cao hơn tại TBT trước đây

≈56.1×

6.744 so với 120 hỗn hợp / kW (với tốc độ 182,46 tok/giây/người dùng)

Tác giả

OpenAI