ಮುಖ್ಯ ವಿಷಯಕ್ಕೆ ನೇರವಾಗಿ ಹೋಗಿ
OpenAI

Jalapeñoನ ಮೊದಲ ಫಲಿತಾಂಶಗಳು AI ಇನ್ಫರೆನ್ಸ್‌ನಲ್ಲಿ ಉದ್ಯಮ-ಪ್ರಮುಖ ವೇಗ ಮತ್ತು ದಕ್ಷತೆಯನ್ನು ತೋರಿಸುತ್ತವೆ

ಲೋಡ್ ಆಗುತ್ತಿದೆ…
ಟೀಲ್ ಬಣ್ಣದ ಸರ್ಕ್ಯೂಟ್ ಬೋರ್ಡ್ ಮೇಲೆ ಅಳವಡಿಸಲಾದ Jalapeño ಇನ್ಫರೆನ್ಸ್ ಚಿಪ್‌ನ ಕ್ಲೋಸ್-ಅಪ್.

Jalapeño, OpenAIಯ ಮೊದಲ ಕಸ್ಟಮ್ ಇನ್‌ಫರೆನ್ಸ್ ಚಿಪ್, ಅನ್ನು ಘೋಷಿಸಿದಾಗಿನಿಂದ, ನಾವು ಚಿಪ್ ಮತ್ತು ಅದರ ಸುತ್ತ ನಿರ್ಮಿಸಲಾದ ವ್ಯವಸ್ಥೆಯನ್ನು ಪರೀಕ್ಷಿಸುತ್ತಿದ್ದೇವೆ. ಫಲಿತಾಂಶಗಳು ಕಾರ್ಯಕ್ಷಮತೆಯಲ್ಲಿ ಮಹತ್ವದ ಪ್ರಗತಿಯನ್ನು ತೋರಿಸುತ್ತವೆ: Jalapeño ವಿದ್ಯುತ್ ಶಕ್ತಿಯ ಪ್ರತಿ ಘಟಕಕ್ಕೆ ಹೆಚ್ಚಿನ AI ಕಾರ್ಯಭಾರವನ್ನು ನಿರ್ವಹಿಸಬಲ್ಲದು, ಜೊತೆಗೆ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಇನ್ನಷ್ಟು ವೇಗವಾಗಿ ಮರಳಿ ನೀಡುತ್ತದೆ. ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಹಾರ್ಡ್‌ವೇರ್ ವ್ಯವಸ್ಥೆಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಇವೆರಡರ ನಡುವೆ ರಾಜಿ ಮಾಡಿಕೊಳ್ಳಬೇಕಾಗುವ ಸಂದರ್ಭದಲ್ಲಿ, Jalapeño ಒಂದೇ ಆರ್ಕಿಟೆಕ್ಚರ್‌ನೊಂದಿಗೆ ಹೆಚ್ಚಿನ ಥ್ರೂಪುಟ್ ಮತ್ತು ಕಡಿಮೆ ಲೇಟೆನ್ಸಿ ಎರಡನ್ನೂ ಒದಗಿಸುತ್ತದೆ.

ಗ್ರಾಹಕರಿಗೆ, ಬೇಡಿಕೆ ಹೆಚ್ಚಾದಂತೆ ವೇಗವಾದ ಪ್ರತಿಕ್ರಿಯೆಗಳು, ಹೆಚ್ಚು ಸ್ಪಂದನಶೀಲ ಏಜೆಂಟ್‌ಗಳು ಮತ್ತು ಹೆಚ್ಚು ವಿಶ್ವಾಸಾರ್ಹ ಪ್ರವೇಶ ದೊರೆಯುತ್ತದೆ. ಕೃತಕ ಸಾಮಾನ್ಯ ಬುದ್ಧಿಮತ್ತೆಯು ಎಲ್ಲಾ ಮಾನವೀಯತೆಗೆ ಪ್ರಯೋಜನವನ್ನು ನೀಡುವುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳುವುದು ನಮ್ಮ ಧ್ಯೇಯವಾಗಿದೆ. ಈ ಮುನ್ನಡೆಗಳು, ಹೆಚ್ಚೆಚ್ಚು ಸಾಮರ್ಥ್ಯ ಹೊಂದಿರುವ AI ಅನ್ನು ಹೆಚ್ಚು ಕೈಗೆಟುಕುವಂತೆ ಮತ್ತು ಇನ್ನಷ್ಟು ವ್ಯಾಪಕವಾಗಿ ಲಭ್ಯವಾಗುವಂತೆ ಮಾಡಲು ಸಹಾಯ ಮಾಡುತ್ತವೆ.

OpenAI ಮಾಡೆಲ್‌ಗಳು Jalapeño ದ ಅಭಿವೃದ್ಧಿಯನ್ನೂ ವೇಗಗೊಳಿಸಿದವು. ಹಿಂದಿನ ತಲೆಮಾರುಗಳು ಚಿಪ್ ವಿನ್ಯಾಸಗೊಳಿಸಿ ಕಾರ್ಯಾಚರಣೆಗೆ ತರಲು ತಂಡಕ್ಕೆ ನೆರವಾದರೆ, ನಮ್ಮ ಇತ್ತೀಚಿನ ಮಾಡೆಲ್‌ಗಳು ಅದನ್ನು ನಾವು ಹೇಗೆ ಸುಧಾರಿಸಿ ಪ್ರೋಗ್ರಾಮ್ ಮಾಡುತ್ತೇವೆ ಎಂಬುದನ್ನು ವೇಗಗೊಳಿಸುತ್ತಿವೆ. Jalapeñoದ ಕಾರ್ಯಕ್ಷಮತೆಯು GPT‑OSS 120B, DeepSeek R1 ಮತ್ತು Kimi K2.5 1Tಗಳಾದ್ಯಂತ ವಿಸ್ತರಿಸುತ್ತದೆ, ಇದು OpenAIಯ ಒಳಗೆ ಮತ್ತು ಹೊರಗೆ ಅಭಿವೃದ್ಧಿಪಡಿಸಲಾದ ಮಾಡೆಲ್‌ಗಳಾದ್ಯಂತ ಈ ಆರ್ಕಿಟೆಕ್ಚರ್ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ. ಈ ಮೂರರಲ್ಲೂ, ಗರಿಷ್ಠ ಥ್ರೂಪುಟ್‌ನಲ್ಲಿ Jalapeño ಪ್ರತಿ ವಾಟ್‌ಗೆ 1.5 ರಿಂದ 1.9 ಪಟ್ಟು ಹೆಚ್ಚು AI ಕೆಲಸವನ್ನು ಒದಗಿಸಿತು ಮತ್ತು ಹೋಲಿಕೆಯ ವ್ಯವಸ್ಥೆಗಳಿಗಿಂತ 1.7 ರಿಂದ 3.6 ಪಟ್ಟು ಕಡಿಮೆ ಎಂಡ್-ಟು-ಎಂಡ್ ಲೇಟೆನ್ಸಿಯನ್ನು ನೀಡಿತು. ಹೈ ಸಂವಾದಾತ್ಮಕ ವರ್ಕ್‌ಲೋಡ್‌ಗಳಿಗಾಗಿ, ಇದು 2.1 ರಿಂದ 4.1 ಪಟ್ಟು ಹೆಚ್ಚು ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡಿತು.

Jalapeño ವಿಶಾಲವಾದ ಫುಲ್-ಸ್ಟ್ಯಾಕ್ ಪ್ರಯೋಜನದ ಮತ್ತೊಂದು ಸಾಕ್ಷಿಯಾಗಿದೆ. OpenAI ಮಾಡೆಲ್‌ಗಳು, ಉತ್ಪನ್ನಗಳು, ಸರ್ವಿಂಗ್ ಸಾಫ್ಟ್‌ವೇರ್, ಚಿಪ್‌ಗಳು, ಮೆಮೊರಿ, ನೆಟ್‌ವರ್ಕಿಂಗ್ ಮತ್ತು ವ್ಯವಸ್ಥೆಗಳನ್ನು ಒಟ್ಟಿಗೆ ವಿನ್ಯಾಸಗೊಳಿಸಬಹುದು. ನೈಜ ವರ್ಕ್‌ಲೋಡ್‌ಗಳಿಂದ ಕಲಿಯುವುದನ್ನು ಬಳಸಿಕೊಂಡು ಸ್ಟ್ಯಾಕ್‌ನ ಪ್ರತಿಯೊಂದು ಪದರವನ್ನು ಸುಧಾರಿಸಬಹುದು. Jalapeño ಅಳೆಯಲಾದ ಫಲಿತಾಂಶಗಳೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿರುವ ಪ್ರಥಮ-ಪಕ್ಷದ ಸಿಲಿಕಾನ್ ಆಗಿದ್ದು, ಇದು ಬಹು-ಪೀಳಿಗೆಯ ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ನ ಪ್ರಾರಂಭವಾಗಿದೆ. ಮುಂದಿನ ತಿಂಗಳುಗಳಲ್ಲಿ, ನಮ್ಮ ಗ್ರಾಹಕರಿಗೆ ವೇಗವಾದ, ಹೆಚ್ಚು ಸಾಮರ್ಥ್ಯವುಳ್ಳ ಮತ್ತು ಪರಿಣಾಮಕಾರಿ ಉತ್ಪನ್ನಗಳನ್ನು ಒದಗಿಸಲು ನಾವು Jalapeño ಅನ್ನು ವಿಸ್ತರಿಸುತ್ತೇವೆ.

Jalapeñoನ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನಾವು ಹೇಗೆ ಅಳೆಯುತ್ತೇವೆ

ನಾವು ಹೊಂದಾಣಿಕೆಯ ಬಳಕೆದಾರ ಅನುಭವದ ಮಟ್ಟದಲ್ಲಿ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತೇವೆ. ಗ್ರಾಹಕರು ಮತ್ತು ಸಂವಾದಾತ್ಮಕ ಏಜೆಂಟ್‌ಗಳು ಅಗತ್ಯವಿರುವ ವಿಳಂಬತೆಯನ್ನು ಪೂರೈಸುವಾಗ, ಪ್ರತಿ ವ್ಯವಸ್ಥೆಯು ಶಕ್ತಿಯ ಪ್ರತಿ ಘಟಕಕ್ಕೆ ಎಷ್ಟು ಉಪಯುಕ್ತ AI ಕೆಲಸವನ್ನು ಪೂರ್ಣಗೊಳಿಸಬಲ್ಲದು ಎಂಬುದನ್ನು ಅಳೆಯುತ್ತೇವೆ. ಇದು ವಿಶೇಷವಾಗಿ ಏಜೆಂಟ್‌ಗಳಿಗೆ ಮಹತ್ವದ್ದಾಗಿದೆ. ಏಕೆಂದರೆ ಅವು ಅನುಕ್ರಮವಾಗಿ ಅನೇಕ ಹಂತಗಳನ್ನು ಪೂರ್ಣಗೊಳಿಸಬೇಕಾಗುತ್ತದೆ, ಆದ್ದರಿಂದ ವಿಳಂಬಗಳು ಪೂರ್ಣ ಕಾರ್ಯದಾದ್ಯಂತ ಕೂಡಿಕೊಂಡು ಹೆಚ್ಚಾಗಬಹುದು.

Jalapeño ಪ್ರಾಯೋಗಿಕವಾಗಿ ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, AI ವಿನಂತಿಯನ್ನು ಪೂರೈಸುವ ಸಂಪೂರ್ಣ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಅಳೆಯುವ SemiAnalysis ನ ಸಾರ್ವಜನಿಕ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಆದ InferenceX ನಲ್ಲಿ ನಾವು ಅದನ್ನು ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ. ಹೈ-ಥ್ರೂಪುಟ್ ಸರ್ವಿಂಗ್‌ನಿಂದ ಹಿಡಿದು ಅತ್ಯಂತ ಪರಸ್ಪರ ಕ್ರಿಯಾತ್ಮಕ, ಕಡಿಮೆ-ಲೇಟೆನ್ಸಿ ಬಳಕೆಯವರೆಗೆ ಪರೀಕ್ಷಿಸಲಾದ ಕಾರ್ಯಾಚರಣಾ ವ್ಯಾಪ್ತಿಯಾದ್ಯಂತ, Jalapeñoವನ್ನು ವಾಣಿಜ್ಯಿಕವಾಗಿ ಲಭ್ಯವಿರುವ ಮುಂಚೂಣಿ AI ವ್ಯವಸ್ಥೆಗಳೊಂದಿಗೆ ನಾವು ಹೋಲಿಸಿದ್ದೇವೆ. Jalapeño ಥ್ರೂಪುಟ್, ವಿದ್ಯುತ್ ದಕ್ಷತೆ ಮತ್ತು ಲೇಟೆನ್ಸಿಯ ಉತ್ತಮ ಸಂಯೋಜನೆಯನ್ನು ಒದಗಿಸಿತು. ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಕೆಲವೊಮ್ಮೆ ಪ್ರತಿ ಚಿಪ್‌ಗೆ ಎಂದು ವರದಿ ಮಾಡಲಾಗುತ್ತದಾದರೂ, ಹೆಚ್ಚು ಉಪಯುಕ್ತವಾದ ಮಾನದಂಡವೆಂದರೆ ಶಕ್ತಿಯ ಪ್ರತಿ ಘಟಕಕ್ಕೆ ದೊರೆಯುವ ಕಾರ್ಯಕ್ಷಮತೆ ಎಂದು ನಾವು ನಂಬುತ್ತೇವೆ.

Jalapeño ಹಿಂದಿನ ಅತ್ಯುತ್ತಮ TBT ಗಿಂತ ಮುನ್ನಡೆಯನ್ನು ವಿಸ್ತರಿಸುತ್ತದೆ

Jalapeño ಪ್ರತಿ ಬಳಕೆದಾರರಿಗೆ ಹೆಚ್ಚು ಟೋಕನ್‌ಗಳನ್ನು ಒದಗಿಸುತ್ತದೆ

Jalapeño ಪ್ರತಿ ಕಿಲೋವ್ಯಾಟ್‌ಗೆ ಹೆಚ್ಚು ಥ್ರೂಪುಟ್ ನೀಡುತ್ತದೆ

ಎಲ್ಲಾ ಮೂರು ಸಾರ್ವಜನಿಕ ಮಾಡೆಲ್‌ಗಳಾದ್ಯಂತ, Jalapeño ಪರೀಕ್ಷಿಸಲಾದ ಕಾರ್ಯಾಚರಣಾ ವ್ಯಾಪ್ತಿಯಲ್ಲಿ ಪ್ರತಿ ವಾಟ್‌ಗೆ ಕಾರ್ಯಕ್ಷಮತೆ ಮತ್ತು ಲೇಟೆನ್ಸಿಯ ಉತ್ತಮ ಸಂಯೋಜನೆಯನ್ನು ನೀಡಿತು, ಇದರಿಂದ ಅದು ಪಾರೆಟೊ ಅತ್ಯಾಧುನಿಕ ಮೇಲೆ ಸ್ಥಾನ ಪಡೆದಿತು. ಸಿಸ್ಟಮ್‌ಗಳನ್ನು ಸ್ಥಿರವಾಗಿ ಹೋಲಿಸಲು, ಪ್ರತಿ ವೇಗವರ್ಧಕದ ಪ್ರಕಟಿತ ಚಿಪ್ ವಿದ್ಯುತ್-ಶಕ್ತಿ ರೇಟಿಂಗ್ ಅನ್ನು ಬಳಸಿ ನಾವು ಫಲಿತಾಂಶಗಳನ್ನು ಸಾಮಾನ್ಯೀಕರಿಸಿದ್ದೇವೆ. Jalapeño ಅನ್ನು 700 ವಾಟ್‌ಗೆ ರೇಟ್ ಮಾಡಲಾಗಿದೆ, ಆದರೆ ಪರೀಕ್ಷಿಸಿದ ಕಾರ್ಯಭಾರಗಳಲ್ಲಿ ಅದರ ಅಳೆಯಲಾದ ನಿರಂತರ ಪವರ್ 550 ವಾಟ್ ಅಥವಾ ಅದಕ್ಕಿಂತ ಕಡಿಮೆಯಲ್ಲೇ ಉಳಿಯಿತು.

Jalapeño GPT‑OSS 120B, DeepSeek R1 670B ಮತ್ತು Kimi K2.5 1Tಗಳಲ್ಲಿ ಬಲವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತೋರಿತು. ನಾವು ಪರೀಕ್ಷಿಸಿದ ಅತಿದೊಡ್ಡ ಸಾರ್ವಜನಿಕ ಮಾಡೆಲ್ ಆದ Kimiನಲ್ಲಿ, ಇದು ಹೋಲಿಕೆ ವ್ಯವಸ್ಥೆಗಿಂತ ಪ್ರತಿ ವಾಟ್‌ಗೆ ಸರಿಸುಮಾರು ಒಂದು ಪಟ್ಟು ಐದು ಹಂತಗಳಷ್ಟು ಹೈ ಗರಿಷ್ಠ ಕಾರ್ಯಕ್ಷಮತೆ ಮತ್ತು ಮೂರು ಪಟ್ಟು ನಾಲ್ಕು ಹಂತಗಳಷ್ಟು ಕಡಿಮೆ ಎಂಡ್-ಟು-ಎಂಡ್ ಲೇಟೆನ್ಸಿಯನ್ನು ಒದಗಿಸಿತು. ನಮ್ಮ ಆಂತರಿಕ ಪರೀಕ್ಷೆಯಲ್ಲಿ, ಅತ್ಯಾಧುನಿಕ OpenAI ಮಾಡೆಲ್‌ಗಳಲ್ಲಿ Jalapeñoದ ಪ್ರಯೋಜನವು ಇನ್ನಷ್ಟು ಹೆಚ್ಚಾಯಿತು; ಇದು ಕಾರ್ಯಭಾರಗಳು ದೊಡ್ಡದಾಗುತ್ತಾ ಹೆಚ್ಚು ಬೇಡಿಕೆಯುಳ್ಳವಾಗುತ್ತಾ ಹೋದಂತೆ ಆರ್ಕಿಟೆಕ್ಚರ್ ಹೆಚ್ಚು ಮೌಲ್ಯಯುತವಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸುತ್ತದೆ.

ಒಂದೇ ಚಿಪ್‌ನಲ್ಲಿ ವೇಗ ಮತ್ತು ದಕ್ಷತೆಗಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸುವುದು

Jalapeño ವನ್ನು ಆರಂಭದಿಂದಲೇ ಈ ಪ್ರಶ್ನೆಯೊಂದಿಗೆ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಯಿತು: ಆಧುನಿಕ ಮತ್ತು ಭವಿಷ್ಯದ ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳಿಗೆ, ವಿಶೇಷವಾಗಿ ಪರಸ್ಪರ ಕ್ರಿಯಾತ್ಮಕ ಏಜೆಂಟ್‌ಗಳಿಗೆ, ಸೇವೆ ಒದಗಿಸುವುದೇ ಅದರ ಮುಖ್ಯ ಕೆಲಸವಾಗಿದ್ದರೆ ನಾವು ಯಾವ ಹಾರ್ಡ್‌ವೇರ್ ಅನ್ನು ನಿರ್ಮಿಸುತ್ತಿದ್ದೆವು? ನೈಜ ಭಾಷಾ-ಮಾಡೆಲ್ ವರ್ಕ್‌ಲೋಡ್‌ಗಳನ್ನು ಕೇಂದ್ರವಾಗಿಟ್ಟುಕೊಂಡು ಚಿಪ್, ಮೆಮೊರಿ, ನೆಟ್‌ವರ್ಕ್, ಸಾಫ್ಟ್‌ವೇರ್ ಮತ್ತು ರಾಕ್-ಮಟ್ಟದ ವ್ಯವಸ್ಥೆಯನ್ನು ಒಟ್ಟಿಗೆ ವಿನ್ಯಾಸಗೊಳಿಸುವುದರಿಂದ Jalapeñoದ ಕಾರ್ಯಕ್ಷಮತೆಯ ಹೆಚ್ಚಳಗಳು ದೊರೆಯುತ್ತವೆ. ಭಾಷಾ-ಮಾಡೆಲ್ ಇನ್‌ಫರೆನ್ಸ್ ವಿಭಿನ್ನ ಅಡಚಣೆಗಳನ್ನು ಹೊಂದಿರುವ ಹಲವಾರು ಪ್ರತ್ಯೇಕ ಹಂತಗಳ ಮೂಲಕ ಸಾಗುತ್ತದೆ. ವ್ಯವಸ್ಥೆಯು ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವ ಪ್ರಿಫಿಲ್ ಹಂತವು ಗಣನಾ-ತೀವ್ರವಾಗಿರುತ್ತದೆ; ವ್ಯವಸ್ಥೆಯು ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಟೋಕನ್‌ಗಟ್ಟಲೆ ರಚಿಸುವ ಡಿಕೋಡ್ ಹಂತವು ಮೆಮೊರಿ ಬ್ಯಾಂಡ್‌ವಿಡ್ತ್‌ನಿಂದ ಹೆಚ್ಚು ನಿರ್ಬಂಧಿತವಾಗಿರುತ್ತದೆ. ಡೇಟಾ ಕೋರ್‌ಗಳು ಮತ್ತು ಚಿಪ್‌ಗಳ ನಡುವೆ ಚಲಿಸಬೇಕಾದಾಗ, ಸಂವಹನವು ವಿಳಂಬವನ್ನೂ ಹೆಚ್ಚಿಸಬಹುದು, ಇದರಿಂದ ಕೆಲವು ಸಂಸ್ಕರಣಾ ಘಟಕಗಳು ಕಾಯುತ್ತಿರುವಾಗ ನಿಷ್ಕ್ರಿಯವಾಗಿರಬಹುದು. ಒಂದು ಹಂತದಲ್ಲಿ ಅತ್ಯುತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ವ್ಯವಸ್ಥೆಯು ಡೇಟಾಕ್ಕಾಗಿ ಕಾಯುವಾಗ ಅಥವಾ ವಿಭಿನ್ನ ಸಂಪನ್ಮೂಲಗಳ ನಡುವೆ ಮಾಡೆಲ್ ಸ್ಥಿತಿಯನ್ನು ಸ್ಥಳಾಂತರಿಸುವಾಗ ಆ ಪ್ರಯೋಜನವನ್ನು ಕಳೆದುಕೊಳ್ಳಬಹುದು.

ಡೇಟಾ ಚಲನೆ ಮತ್ತು ಸಂವಹನ ವಿಳಂಬಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಲು ನಾವು Jalapeño ಅನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿದ್ದೇವೆ. ಇದರರ್ಥ, ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ರಚಿಸುವಾಗ ಬಳಸುವ KV ಕ್ಯಾಶ್ ಸೇರಿದಂತೆ ಮಾಡೆಲ್ ಸ್ಥಿತಿಯನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ಇರಿಸಬಹುದು ಮತ್ತು ಸ್ಥಳೀಯವಾಗಿಯೇ ಉಳಿಸಬಹುದು; ಅದೇ ವೇಳೆ ವ್ಯವಸ್ಥೆಯು ಪ್ರತಿ ಇನ್‌ಫರೆನ್ಸ್ ಹಂತಕ್ಕಾಗಿ ಕಂಪ್ಯೂಟ್, ಮೆಮೊರಿ ಮತ್ತು ನೆಟ್‌ವರ್ಕಿಂಗ್‌ನ ಸರಿಯಾದ ಸಂಯೋಜನೆಯನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ. ನೆಟ್‌ವರ್ಕ್, ಆರ್ಕಿಟೆಕ್ಚರ್‌ನ ಅವಿಭಾಜ್ಯ ಅಂಗವಾಗಿದೆ. ಇದರ ವಿಶಾಲ ಡೊಮೇನ್ ಸಂಪೂರ್ಣ ಕಾರ್ಯಭಾರವನ್ನು ಒಂದೇ ಸಂಪರ್ಕಿತ ವ್ಯವಸ್ಥೆಯೊಳಗೆ ಉಳಿಯುವಂತೆ ಮಾಡುತ್ತದೆ, ಡೇಟಾ ಚಲನವಲನವನ್ನು ಕನಿಷ್ಠಗೊಳಿಸುತ್ತದೆ ಮತ್ತು ಸಂಪೂರ್ಣ ವಿನಂತಿಯು ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗೆ ವೇಗವಾಗಿ ಹಾಗೂ ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಉಳಿಯಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಫಲಿತಾಂಶವು ಸಮತೋಲಿತ ಮತ್ತು ಪರಸ್ಪರ ಬದಲಾಯಿಸಬಹುದಾದ ಆಕ್ಸಿಲರೇಟರ್ ಆಗಿದೆ, ಇದು ಬದಲಾಗುತ್ತಿರುವ ಮಾಡೆಲ್ ಆರ್ಕಿಟೆಕ್ಚರ್‌ಗಳನ್ನು ಬೆಂಬಲಿಸಬಹುದು, ಪ್ರಿಫಿಲ್ ಮತ್ತು ಡಿಕೋಡ್ ಎರಡರಲ್ಲೂ ಅತ್ಯುತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬಹುದು ಮತ್ತು ಅವುಗಳ ನಡುವಿನ ಸಮತೋಲನ ಬದಲಾದಂತೆ ಹೊಂದಿಕೊಳ್ಳಬಹುದು; ಇದು ಏಜೆಂಟಿಕ್ ವರ್ಕ್‌ಲೋಡ್‌ಗಳ ನಿರ್ಣಾಯಕ ಲಕ್ಷಣವಾಗಿದೆ.

ಚಿಪ್ ವಿನ್ಯಾಸಗೊಳಿಸಲು ನಾವು AI ಅನ್ನು ಬಳಸಿದ್ದೇವೆ, ಮತ್ತು AI ಅದನ್ನು ಪ್ರೋಗ್ರಾಮ್ ಮಾಡಬಹುದಾಗುವಂತೆ ಚಿಪ್ ವಿನ್ಯಾಸಗೊಳಿಸಿದ್ದೇವೆ

Jalapeño ಅಭಿವೃದ್ಧಿಯಲ್ಲಿ AI ನೇರ ಪಾತ್ರ ವಹಿಸಿತು. ಅನುಷ್ಠಾನಗಳನ್ನು ಅನ್ವೇಷಿಸುವ ಮೂಲಕ, ವಿನ್ಯಾಸ, ಮಾಪನ ಮತ್ತು ಪರಿಶೀಲನೆ ಚಕ್ರಗಳನ್ನು ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸುವ ಮೂಲಕ ಮತ್ತು ಮಾಡೆಲ್ ವರ್ಕ್‌ಲೋಡ್‌ಗಳ ಮೇಲೆ ನಿರಂತರವಾಗಿ ಪುನರಾವರ್ತನೆ ಮಾಡುವ ಮೂಲಕ, ಆರಂಭಿಕ ವಿನ್ಯಾಸದಿಂದ ಟೇಪ್‌ಔಟ್‌ವರೆಗೆ ಒಂಬತ್ತು ತಿಂಗಳಲ್ಲಿ ತಂಡವು ಸಾಗಿತು. AI ಕೂಡ ಚಿಪ್‌ನ ಅಂಕಗಣಿತ ಸರ್ಕ್ಯೂಟ್‌ಗಳನ್ನು ಆಪ್ಟಿಮೈಸ್ ಮಾಡಲು ಸಹಾಯ ಮಾಡಿತು, ಇದರಿಂದ ತಂಡವು ನಿಗದಿತ ವೇಳಾಪಟ್ಟಿಯಂತೆ ಚಿಪ್‌ನಲ್ಲಿ ಹೆಚ್ಚಿನ ಗಣನಾ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಅಳವಡಿಸಲು ಸಾಧ್ಯವಾಯಿತು.

Jalapeño ಅನ್ನು ಮಾನವರು ಮತ್ತು AI ಎರಡಕ್ಕೂ ಸ್ಪಷ್ಟ, ಪೂರ್ವಾನುಮಾನಿಸಬಹುದಾದ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಗುರಿಯಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ. ಇಂಜಿನಿಯರ್‌ಗಳು ಸ್ಥಳೀಯ ಟೆನ್ಸರ್‌ಗಳು, ಸ್ಪಷ್ಟ ಸಂವಹನ ಮತ್ತು ಊಹಿಸಬಹುದಾದ ಸಮಕಾಲೀಕರಣದ ಮೂಲಕ ಕೆಲಸವನ್ನು ವಿವರಿಸಬಹುದು. AI ನಂತರ ಆ ಕೆಲಸವನ್ನು ಸಿಸ್ಟಮ್‌ನಾದ್ಯಂತ ಹೇಗೆ ನಕ್ಷೆ ಮಾಡಲಾಗುತ್ತದೆ, ಇರಿಸಲಾಗುತ್ತದೆ, ವೇಳಾಪಟ್ಟಿ ಮಾಡಲಾಗುತ್ತದೆ ಮತ್ತು ಸಂಯೋಜಿಸಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಸುಧಾರಿಸಬಹುದು. ಆ ಸ್ಪಷ್ಟ, ಊಹಿಸಬಹುದಾದ ರಚನೆಯು, ಪರಂಪರಾಗತವಾಗಿ ಕಷ್ಟಕರವಾದ ಸಮಾನಾಂತರ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಸಮಸ್ಯೆಯನ್ನು ಎದುರಿಸಲು AIಗೆ ನಿರ್ವಹಿಸಬಹುದಾದ ಮಾರ್ಗವನ್ನು ನೀಡುತ್ತದೆ.

ಪ್ರತಿ ಹೊಸ ಮಾಡೆಲ್ ಕುಟುಂಬವನ್ನು ಬೆಂಬಲಿಸಲು ಇನ್ನೂ ಹೊಸ ಕರ್ನಲ್‌ಗಳು ಮತ್ತು ಮಾಡೆಲ್-ನಿರ್ದಿಷ್ಟ ಆಪ್ಟಿಮೈಸೇಶನ್‌ಗಳು ಅಗತ್ಯವಿರುತ್ತವೆ. GPT‑Astra ಜೊತೆಗೆ Codex ಬಳಸಿಕೊಂಡು, ತಂಡವು Jalapeño ದ ಮೂಲ ಉತ್ಪಾದನಾ ಯೋಜನೆಯ ಭಾಗವಾಗಿರದ ಮೂರು ಓಪನ್ ವೇಟ್ ಮಾಡೆಲ್‌ಗಳನ್ನು ಎರಡು ತಿಂಗಳೊಳಗೆ ಉನ್ನತ ಕಾರ್ಯಕ್ಷಮತೆಗೆ ತಂದಿತು. ಇದು ಆರ್ಕಿಟೆಕ್ಚರ್‌ನ ಲವಚಿಕತೆಯನ್ನೂ, AI ಅದನ್ನು ಪ್ರೋಗ್ರಾಮ್ ಮಾಡಲು ನಮಗೆ ಎಷ್ಟು ವೇಗವಾಗಿ ಸಹಾಯ ಮಾಡಬಹುದು ಎಂಬುದನ್ನೂ ತೋರಿಸಿತು. ಆಯ್ದ GPT‑OSS ಅಟೆನ್ಶನ್ ಮತ್ತು ಮಿಶ್ರಣ-ತಜ್ಞರ ಬ್ಲಾಕ್‌ಗಳಿಗಾಗಿ, AI-ರಚಿತ ಅನುಷ್ಠಾನಗಳು ಈಗಿರುವ ಮಾನವ ತಜ್ಞರು ಬರೆದ ಅನುಷ್ಠಾನಗಳಿಗಿಂತ 1.5 ರಿಂದ 1.8 ಪಟ್ಟು ವೇಗವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿದವು. ಆ ಅಂಕಿಅಂಶಗಳು ಪೂರ್ಣ ಮಾಡೆಲ್‌ಗೆ ಅಲ್ಲ, ಆಯ್ಕೆಮಾಡಿದ ಬ್ಲಾಕ್‌ಗಳಿಗೆ ಅನ್ವಯಿಸುತ್ತವೆ, ಆದರೆ ಅವು ಶಕ್ತಿಯುತ ಹೊಸ ಅಭಿವೃದ್ಧಿ ಚಕ್ರದತ್ತ ಸೂಚಿಸುತ್ತವೆ.

ದಕ್ಷ, ಅತಿ-ವೇಗದ ಇನ್‌ಫರೆನ್ಸ್‌ಗೆ ಮುಂದಿನ ದಾರಿ

AI ಮೂಲಸೌಕರ್ಯವು ಮೌಲ್ಯಯುತವಾಗಿದೆ, ಏಕೆಂದರೆ ಅದು ಉಪಯುಕ್ತ ನೈಜ ಜಗತ್ತಿನ ಕೆಲಸವನ್ನು ಸಾಧ್ಯವಾಗಿಸುತ್ತದೆ. ಅದೇ ವಿದ್ಯುತ್ ಮತ್ತು ಹಾರ್ಡ್‌ವೇರ್‌ನಿಂದ ಹೆಚ್ಚು ಉಪಯುಕ್ತ ಕೆಲಸವನ್ನು ಉತ್ಪಾದಿಸುವ ಮೂಲಕ, Jalapeño ನಮಗೆ ಹೆಚ್ಚಿನ ಬೇಡಿಕೆಯನ್ನು ಪೂರೈಸಲು ಮತ್ತು ಯಶಸ್ವಿ ಫಲಿತಾಂಶವನ್ನು ಒದಗಿಸುವ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಸಹಾಯ ಮಾಡಬಹುದು. OpenAI ಗೆ, ಉಪಯುಕ್ತ ಕೆಲಸ ಮತ್ತು ಆದಾಯವು ಸೇವೆ ಒದಗಿಸುವ ವೆಚ್ಚಕ್ಕಿಂತ ವೇಗವಾಗಿ ಬೆಳೆಯಲು ಅವಕಾಶ ನೀಡುವ ಮೂಲಕ ಇದು ಕಾರ್ಯಾಚರಣೆಯ ಹತೋಟಿಯನ್ನು ಸುಧಾರಿಸಬಹುದು. ಇದು ಉತ್ತಮ ಮಾಡೆಲ್‌ಗಳು, ಉತ್ಪನ್ನಗಳು ಮತ್ತು ಮೂಲಸೌಕರ್ಯದಲ್ಲಿ ವ್ಯಾಪಕ ಅಳವಡಿಕೆ ಮತ್ತು ನಿರಂತರ ಹೂಡಿಕೆಯನ್ನು ಸಹ ಬೆಂಬಲಿಸಬಹುದು. ವೇಗವಾದ ನಿರ್ಣಯ ಪ್ರಕ್ರಿಯೆ ವೇಗವಾದ ಪುನರಾವರ್ತನೆ ಮತ್ತು ಹೊಸ ಬಳಕೆ ಸಂದರ್ಭಗಳನ್ನು ಸಾಧ್ಯವಾಗಿಸುತ್ತದೆ.

ದಕ್ಷ, ಕಡಿಮೆ ವಿಳಂಬದ ಇನ್ಫರೆನ್ಸ್‌ಗಾಗಿ ಸಾಧ್ಯವಿರುವುದರ ವ್ಯಾಪ್ತಿಯನ್ನು Jalapeño ವಿಸ್ತರಿಸುತ್ತದೆ:

  • ಫಾಸ್ಟ್ ಮೋಡ್‌ನಲ್ಲಿ ಮಾತ್ರ ಲಭ್ಯವಿದ್ದ ದಕ್ಷತೆಗಳನ್ನು ಮೀರಿಸುವ Ultra ವೇಗದ ಮೋಡ್ ಇನ್‌ಫರೆನ್ಸ್
  • ಬ್ಯಾಚ್ಡ್ ಮೋಡ್‌ನಲ್ಲಿ ಮಾತ್ರ ಲಭ್ಯವಿದ್ದ ದಕ್ಷತೆಯ ಮಟ್ಟದಲ್ಲಿ ಫಾಸ್ಟ್ ಮೋಡ್ ನಿರ್ಣಯ ಪ್ರಕ್ರಿಯೆ
  • ಬ್ಯಾಚ್ಡ್-ಮೋಡ್ ಇನ್‌ಫರೆನ್ಸ್‌ಗೆ ಉನ್ನತ ದಕ್ಷತೆ

ನಾವು ಈ ವರ್ಷದ ಅಂತ್ಯದೊಳಗೆ OpenAI ಕಂಪ್ಯೂಟ್ ಮೂಲಸೌಕರ್ಯದೊಳಗೆ Jalapeño ಅನ್ನು ನಿಯೋಜಿಸಲು ಪ್ರಾರಂಭಿಸಲು ಯೋಜಿಸಿದ್ದೇವೆ. ಇದು ಬಹುಪೀಳಿಗೆಯ ರೋಡ್‌ಮ್ಯಾಪ್‌ನ ಮೊದಲ ಪೀಳಿಗೆಯಾಗಿದೆ: Gen 2 ಅಭಿವೃದ್ಧಿಯ ಮುಂದುವರಿದ ಹಂತದಲ್ಲಿದೆ, ಮತ್ತು Gen 3 ರೂಪುಗೊಳ್ಳುತ್ತಿದೆ. ಪ್ರತಿ ತಲೆಮಾರೂ ನಾವು ಕಲಿತದ್ದನ್ನು ಆಧರಿಸಿ, ದಕ್ಷತೆ ಮತ್ತು ವೇಗವನ್ನು ಮತ್ತಷ್ಟು ಸುಧಾರಿಸುತ್ತದೆ.

AI ಗೆ ಹೆಚ್ಚುತ್ತಿರುವ ಬೇಡಿಕೆಯನ್ನು ಪೂರೈಸಲು ಲಭ್ಯವಿರುವ ಪ್ರತಿಯೊಂದು ಮೂಲದಿಂದಲೂ ಹೆಚ್ಚಿನ ಗಣನಾ ಸಾಮರ್ಥ್ಯ ಅಗತ್ಯವಿರುತ್ತದೆ. ತರಬೇತಿ ಮತ್ತು ಇನ್ಫರೆನ್ಸ್ ಕಾರ್ಯಭಾರಗಳಿಗಾಗಿ NVIDIA ಮತ್ತು ಇತರ ಪಾಲುದಾರರಿಂದ ಆಕ್ಸೆಲರೇಟರ್‌ಗಳನ್ನು ನಾವು ವ್ಯಾಪಕವಾಗಿ ನಿಯೋಜಿಸುವುದನ್ನು ಮುಂದುವರಿಸುತ್ತೇವೆ. ಕೃತಕ ಸಾಮಾನ್ಯ ಬುದ್ಧಿಮತ್ತೆಯು ಎಲ್ಲಾ ಮಾನವೀಯತೆಗೆ ಪ್ರಯೋಜನವನ್ನು ನೀಡುವುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳುವುದು ನಮ್ಮ ಧ್ಯೇಯವಾಗಿದೆ.

ನಾವು ಬಳಕೆಗೆ ಬಿಡುಗಡೆ ಮಾಡಲು ಸಿದ್ಧತೆ ನಡೆಸುತ್ತಿರುವಾಗ, ಉತ್ಪಾದನಾ ಅರ್ಹತೆಯನ್ನು ಮುಂದುವರಿಸುತ್ತಿದ್ದೇವೆ, ಸಾಫ್ಟ್‌ವೇರ್ ಅನ್ನು ಪರಿಪಕ್ವಗೊಳಿಸುತ್ತಿದ್ದೇವೆ, Jalapeño ಅನ್ನು ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಲು ಸಿದ್ಧಪಡಿಸುತ್ತಿದ್ದೇವೆ ಮತ್ತು ಹೆಚ್ಚಿನ ಮಾದರಿಗಳಾದ್ಯಂತ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಮೌಲ್ಯೀಕರಿಸುತ್ತಿದ್ದೇವೆ. ಇದುವರೆಗಿನ ಫಲಿತಾಂಶಗಳು, ನಾವು ಸಂಪೂರ್ಣ ವ್ಯವಸ್ಥೆಯನ್ನು ಒಟ್ಟಿಗೆ ವಿನ್ಯಾಸಗೊಳಿಸಿದಾಗ ಏನು ಸಾಧ್ಯ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತವೆ: ಹೆಚ್ಚಿನ ಜನರಿಗೆ ಹೆಚ್ಚು ಸ್ಪಂದನಶೀಲ, ಸಾಮರ್ಥ್ಯಯುತ ಮತ್ತು ಏಜೆಂಟಿಕ್ AI ಅನ್ನು ಹೆಚ್ಚು ದಕ್ಷವಾಗಿ ತಲುಪಿಸುವುದು.

ಅನುಬಂಧ

Jalapeño GPT‑OSS 120B ನಲ್ಲಿ ಪಾರೆಟೊ ಅತ್ಯಾಧುನಿಕ ಆಗಿದೆ

ಥ್ರೂಪುಟ್-ಪ್ರತಿ-kW ಅತ್ಯಾಧುನಿಕ

InferenceX · GPT‑OSS‑120B · ನಾಮಮಾತ್ರ 8k/1k · STP · ಪ್ಯಾಕೇಜ್ TDP: Jalapeño 700 W; GB200 1,200 W

Jalapeño ಎಲ್ಲಾ GPT‑OSS ಕಾರ್ಯನಿರ್ವಹಣಾ ಹಂತಗಳಲ್ಲಿ ಮುನ್ನಡೆ ಸಾಧಿಸಿದೆ

ಗರಿಷ್ಠ ಮತ್ತು ಹೊಂದಾಣಿಕೆಯ ಥ್ರೂಪುಟ್

InferenceX · GPT‑OSS‑120B · ನಾಮಮಾತ್ರ 8k/1k · STP · ಪ್ಯಾಕೇಜ್ TDP: Jalapeño 700 W; GB200 1,200 W

ಗರಿಷ್ಠ ಮಿಶ್ರ TPS / kW

≈1.9×

85,448 ವಿರುದ್ಧ 44,960 ಮಿಶ್ರ / kW

ಕಡಿಮೆ ಎಂಡ್-ಟು-ಎಂಡ್ ಲೇಟೆನ್ಸಿ

≈1.7×

1.03 s ವಿರುದ್ಧ 1.80 s

ಕನಿಷ್ಠ TBT ಕಡಿಮೆಮಾಡಿ

≈2.7×

0.69 vs. 1.87 ms (1,459 vs. 535 tok/ಸೆಕೆಂಡ್/ಬಳಕೆದಾರರು)

ಹಿಂದಿನ TBT ನಲ್ಲಿ ಹೆಚ್ಚು ಥ್ರೂಪುಟ್

≈53.7×

22,935 ವಿರುದ್ಧ 427 ಮಿಶ್ರಿತ / kW (535,28 tok/ಸೆಕೆಂಡ್/ಬಳಕೆದಾರರು ದರದಲ್ಲಿ)

Jalapeño DeepSeek R1 670B ನಲ್ಲಿ ಪಾರೆಟೋ ಅತ್ಯಾಧುನಿಕ ಆಗಿದೆ

ಥ್ರೂಪುಟ್-per-kW ಅತ್ಯಾಧುನಿಕ

InferenceX · DeepSeek R1 MXFP4 · ನಾಮಮಾತ್ರ 8k/1k · STP · ಪ್ಯಾಕೇಜ್ TDP: Jalapeño 700 W; GB300 1,400 W

DeepSeek R1 ಕಾರ್ಯಾಚರಣಾ ಬಿಂದುಗಳಾದ್ಯಂತ Jalapeño ಮುನ್ನಡೆ ಸಾಧಿಸುತ್ತದೆ

ಗರಿಷ್ಠ ಮತ್ತು ಹೊಂದಾಣಿಕೆಯ ಥ್ರೂಪುಟ್

InferenceX · DeepSeek R1 MXFP4 · ನಾಮಮಾತ್ರ 8k/1k · STP · ಪ್ಯಾಕೇಜ್ TDP: Jalapeño 700 W; GB300 1,400 W

ಹೈ ಪೀಕ್ ಮಿಶ್ರ TPS / kW

≈1.7×

19,641 ವಿರುದ್ಧ 11,781 ಮಿಶ್ರ / kW

ಕಡಿಮೆ ಎಂಡ್-ಟು-ಎಂಡ್ ಲೇಟೆನ್ಸಿ

≈3.6×

1.65 s vs. 5.99 s

ಕನಿಷ್ಠ TBT ಕಡಿಮೆ ಮಾಡಿರಿ

≈4.1×

1.43 vs. 5.90 ms (700 vs. 169 tok/ಸೆಕೆಂಡ್/ಬಳಕೆದಾರರು)

ಹಿಂದಿನ TBT ನಲ್ಲಿ ಹೆಚ್ಚು ಥ್ರೂಪುಟ್

≈104.3×

12,258 ವಿರುದ್ಧ 118 ಮಿಶ್ರ / kW (169.41 tok/ಸೆಕೆಂಡ್/ಬಳಕೆದಾರರು ನಲ್ಲಿ)

Kimi K2.5 1T ನಲ್ಲಿ Jalapeño ಪಾರೆಟೋ ಅತ್ಯಾಧುನಿಕ ಆಗಿದೆ

kWಗೆ ಥ್ರೂಪುಟ್ ಅತ್ಯಾಧುನಿಕ

InferenceX · Kimi K2.5 MXFP4 · ನಾಮಮಾತ್ರ 8k/1k · STP · ಪ್ಯಾಕೇಜ್ TDP: Jalapeño 700 W; GB300 1,400 W

Kimi K2.5 ಕಾರ್ಯಾಚರಣಾ ಬಿಂದುಗಳಾದ್ಯಂತ Jalapeño ಮುನ್ನಡೆ ಸಾಧಿಸುತ್ತದೆ

ಗರಿಷ್ಠ ಮತ್ತು ಹೊಂದಾಣಿಕೆಯ ಥ್ರೂಪುಟ್

InferenceX · Kimi K2.5 MXFP4 · ನಾಮಮಾತ್ರ 8k/1k · STP · ಪ್ಯಾಕೇಜ್ TDP: Jalapeño 700 W; GB300 1,400 W

ಹೈ peak mixed TPS / kW

≈1.5×

18,195 ವಿರುದ್ಧ 11,862 ಮಿಶ್ರ / kW

ಕಡಿಮೆ ಎಂಡ್-ಟು-ಎಂಡ್ ಲೇಟೆನ್ಸಿ

≈3.4×

1.56 s vs. 5.31 s

ಕನಿಷ್ಠ TBT ಅನ್ನು ಕಡಿಮೆ ಮಾಡಿರಿ

≈3.8×

1.44 ವಿರುದ್ಧ 5.48 ms (694 ವಿರುದ್ಧ 182 tok/ಸೆಕೆಂಡ್/ಬಳಕೆದಾರರು)

ಹಿಂದಿನ TBT ನಲ್ಲಿ ಹೆಚ್ಚು ಥ್ರೂಪುಟ್

≈56.1×

6,744 ವಿರುದ್ಧ 120 ಮಿಶ್ರಿತ / kW (182.46 tok/ಸೆಕೆಂಡ್/ಬಳಕೆದಾರರು ದರದಲ್ಲಿ)

ಲೇಖಕ

OpenAI