ਮੁੱਖ ਸਮੱਗਰੀ 'ਤੇ ਜਾਓ
OpenAI

Jalapeño ਦੇ ਸ਼ੁਰੂਆਤੀ ਨਤੀਜੇ AI ਇਨਫਰੈਂਸ ਵਿੱਚ ਉਦਯੋਗ-ਅਗਵਾਈ ਸਪੀਡ ਅਤੇ ਕੁਸ਼ਲਤਾ ਦਰਸਾਉਂਦੇ ਹਨ

ਲੋਡ ਹੋ ਰਿਹਾ ਹੈ…
ਟੀਲ ਰੰਗ ਦੇ ਸਰਕਿਟ ਬੋਰਡ 'ਤੇ ਮਾਊਂਟ ਕੀਤੀ ਹੋਈ Jalapeño ਇਨਫਰੈਂਸ ਚਿਪ ਦਾ ਕਲੋਜ਼-ਅੱਪ.

Jalapeño, OpenAI ਦੀ ਪਹਿਲੀ ਕਸਟਮ ਇਨਫਰੈਂਸ ਚਿਪ, ਦਾ ਐਲਾਨ ਕਰਨ ਤੋਂ ਬਾਅਦ ਅਸੀਂ ਚਿਪ ਅਤੇ ਇਸ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਬਣੇ ਸਿਸਟਮ ਦੀ ਜਾਂਚ ਕਰ ਰਹੇ ਹਾਂ. ਨਤੀਜੇ ਕਾਰਗੁਜ਼ਾਰੀ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਦਿਖਾਉਂਦੇ ਹਨ: Jalapeño ਪਾਵਰ ਦੀ ਪ੍ਰਤੀ ਇਕਾਈ ਵੱਧ AI ਕੰਮ ਸੰਭਾਲ ਸਕਦਾ ਹੈ, ਨਾਲ ਹੀ ਜਵਾਬ ਹੋਰ ਤੇਜ਼ੀ ਨਾਲ ਵਾਪਸ ਕਰਦਾ ਹੈ. Jalapeño ਇੱਕੋ ਆਰਕੀਟੈਕਚਰ ਨਾਲ ਵੱਧ ਥਰੂਪੁੱਟ ਅਤੇ ਘੱਟ ਲੇਟੈਂਸੀ ਦੋਵੇਂ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਜਦਕਿ ਮੌਜੂਦਾ ਹਾਰਡਵੇਅਰ ਸਿਸਟਮਾਂ ਨੂੰ ਅਕਸਰ ਇਹਨਾਂ ਦੋਵਾਂ ਵਿਚਕਾਰ ਸਮਝੌਤਾ ਕਰਨਾ ਪੈਂਦਾ ਹੈ.

ਗਾਹਕਾਂ ਲਈ, ਇਸਦਾ ਮਤਲਬ ਤੇਜ਼ ਜਵਾਬ, ਜ਼ਿਆਦਾ ਤੇਜ਼ੀ ਨਾਲ ਪ੍ਰਤੀਕਿਰਿਆ ਕਰਨ ਵਾਲੇ ਏਜੰਟ, ਅਤੇ ਮੰਗ ਵਧਣ ਨਾਲ ਹੋਰ ਭਰੋਸੇਯੋਗ ਪਹੁੰਚ ਹੋ ਸਕਦੀ ਹੈ. ਸਾਡਾ ਮਿਸ਼ਨ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣਾ ਹੈ ਕਿ ਆਰਟੀਫ਼ਿਸ਼ੀਅਲ ਜਨਰਲ ਇੰਟੈਲੀਜੈਂਸ ਸਮੁੱਚੀ ਮਨੁੱਖਤਾ ਦੇ ਫਾਇਦੇ ਲਈ ਹੋਵੇ. ਇਹ ਲਾਭ ਲਗਾਤਾਰ ਵਧਦੀ ਸਮਰੱਥਾ ਵਾਲੀ AI ਨੂੰ ਹੋਰ ਕਿਫ਼ਾਇਤੀ ਅਤੇ ਵਧੇਰੇ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਬਣਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰਨਗੇ.

OpenAI ਮਾਡਲਾਂ ਨੇ Jalapeño ਦੇ ਵਿਕਾਸ ਨੂੰ ਵੀ ਤੇਜ਼ ਕੀਤਾ. ਪਹਿਲੀਆਂ ਪੀੜ੍ਹੀਆਂ ਨੇ ਟੀਮ ਨੂੰ ਚਿਪ ਡਿਜ਼ਾਈਨ ਕਰਨ ਅਤੇ ਚਾਲੂ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕੀਤੀ, ਜਦਕਿ ਸਾਡੇ ਨਵੀਨਤਮ ਮਾਡਲ ਇਸ ਨੂੰ ਔਪਟੀਮਾਈਜ਼ ਅਤੇ ਪ੍ਰੋਗਰਾਮ ਕਰਨ ਦੀ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਤੇਜ਼ ਕਰ ਰਹੇ ਹਨ. Jalapeño ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ GPT‑OSS 120B, DeepSeek R1 ਅਤੇ Kimi K2.5 1T ਤੱਕ ਫੈਲੀ ਹੋਈ ਹੈ, ਜੋ ਦਿਖਾਉਂਦੀ ਹੈ ਕਿ ਇਹ ਆਰਕੀਟੈਕਚਰ OpenAI ਦੇ ਅੰਦਰ ਅਤੇ ਬਾਹਰ ਵਿਕਸਿਤ ਕੀਤੇ ਮਾਡਲਾਂ ਵਿੱਚ ਕੰਮ ਕਰਦਾ ਹੈ. ਤਿੰਨਾਂ ਵਿੱਚ, Jalapeño ਨੇ ਤੁਲਨਾ ਵਾਲੇ ਸਿਸਟਮਾਂ ਨਾਲੋਂ ਸਿਖਰਲੇ ਥਰੂਪੁੱਟ 'ਤੇ ਪ੍ਰਤੀ ਵਾਟ 1.5 ਤੋਂ 1.9 ਗੁਣਾ ਵੱਧ AI ਕੰਮ ਅਤੇ 1.7 ਤੋਂ 3.6 ਗੁਣਾ ਘੱਟ ਐਂਡ-ਟੂ-ਐਂਡ ਲੇਟੈਂਸੀ ਦਿੱਤੀ. ਬਹੁਤ ਜ਼ਿਆਦਾ ਇੰਟਰਐਕਟਿਵ ਵਰਕਲੋਡਾਂ ਲਈ, ਇਸ ਨੇ 2.1 ਤੋਂ 4.1 ਗੁਣਾ ਉੱਚਤਮ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੱਤੀ.

Jalapeño ਵਿਆਪਕ ਫੁੱਲ-ਸਟੈਕ ਫਾਇਦੇ ਦਾ ਵੀ ਸਬੂਤ ਹੈ. OpenAI ਮਾਡਲਾਂ, ਉਤਪਾਦਾਂ, ਸਰਵਿੰਗ ਸੌਫਟਵੇਅਰ, ਚਿਪਾਂ, ਮੈਮੋਰੀ, ਨੈੱਟਵਰਕਿੰਗ ਅਤੇ ਸਿਸਟਮਾਂ ਨੂੰ ਇਕੱਠੇ ਡਿਜ਼ਾਈਨ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਅਸਲ ਵਰਕਲੋਡਾਂ ਤੋਂ ਜੋ ਅਸੀਂ ਸਿੱਖਦੇ ਹਾਂ, ਉਸ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਸਟੈਕ ਦੀ ਹਰ ਪਰਤ ਨੂੰ ਬਿਹਤਰ ਬਣਾ ਸਕਦਾ ਹੈ. Jalapeño ਮਾਪੇ ਗਏ ਨਤੀਜਿਆਂ ਵਾਲਾ ਕਾਰਗਰ ਫਰਸਟ-ਪਾਰਟੀ ਸਿਲਿਕਾਨ ਹੈ, ਅਤੇ ਇਹ ਇੱਕ ਬਹੁ-ਪੀੜ੍ਹੀ ਪਲੇਟਫਾਰਮ ਦੀ ਸ਼ੁਰੂਆਤ ਹੈ. ਆਉਣ ਵਾਲੇ ਮਹੀਨਿਆਂ ਵਿੱਚ, ਅਸੀਂ ਆਪਣੇ ਗਾਹਕਾਂ ਲਈ ਹੋਰ ਤੇਜ਼, ਹੋਰ ਸਮਰੱਥ ਅਤੇ ਹੋਰ ਕੁਸ਼ਲ ਉਤਪਾਦ ਪ੍ਰਦਾਨ ਕਰਨ ਵਾਸਤੇ Jalapeño ਦਾ ਪੈਮਾਨਾ ਵਧਾਵਾਂਗੇ.

ਅਸੀਂ Jalapeño ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਨੂੰ ਕਿਵੇਂ ਮਾਪਿਆ

ਅਸੀਂ ਸਮਾਨ ਯੂਜ਼ਰ ਅਨੁਭਵ ’ਤੇ ਕਾਰਗੁਜ਼ਾਰੀ ਦਾ ਮੁਲਾਂਕਣ ਕਰਦੇ ਹਾਂ, ਇਹ ਮਾਪਦੇ ਹੋਏ ਕਿ ਹਰ ਸਿਸਟਮ ਪਾਵਰ ਦੀ ਪ੍ਰਤੀ ਇਕਾਈ ਕਿੰਨਾ ਉਪਯੋਗੀ AI ਕੰਮ ਪੂਰਾ ਕਰ ਸਕਦਾ ਹੈ, ਜਦਕਿ ਗਾਹਕਾਂ ਅਤੇ ਇੰਟਰੈਕਟਿਵ ਏਜੰਟਾਂ ਲਈ ਲੋੜੀਂਦੀ ਲੇਟੈਂਸੀ ਨੂੰ ਵੀ ਪੂਰਾ ਕਰਦਾ ਹੈ. ਇਹ ਖ਼ਾਸ ਤੌਰ ’ਤੇ ਏਜੰਟਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਕ੍ਰਮਵਾਰ ਕਈ ਕਦਮ ਪੂਰੇ ਕਰਨੇ ਪੈਂਦੇ ਹਨ, ਇਸ ਲਈ ਦੇਰੀਆਂ ਪੂਰੇ ਕੰਮ ਦੌਰਾਨ ਸੰਚਿਤ ਹੋ ਕੇ ਵਧਦੀਆਂ ਜਾਂਦੀਆਂ ਹਨ.

ਇਹ ਸਮਝਣ ਲਈ ਕਿ Jalapeño ਅਸਲ ਵਰਤੋਂ ਵਿੱਚ ਕਿਵੇਂ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ, ਅਸੀਂ ਇਸਨੂੰ SemiAnalysis ਦੇ ਇੱਕ ਜਨਤਕ ਬੈਂਚਮਾਰਕ InferenceX ’ਤੇ ਟੈਸਟ ਕੀਤਾ, ਜੋ AI ਬੇਨਤੀ ਨੂੰ ਸਰਵ ਕਰਨ ਦੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਮਾਪਦਾ ਹੈ. ਅਸੀਂ ਟੈਸਟ ਕੀਤੀ ਗਈ ਓਪਰੇਟਿੰਗ ਰੇਂਜ ਵਿੱਚ Jalapeño ਦੀ ਤੁਲਨਾ ਪ੍ਰਮੁੱਖ ਵਪਾਰਕ ਤੌਰ ’ਤੇ ਉਪਲਬਧ AI ਸਿਸਟਮਾਂ ਨਾਲ ਕੀਤੀ, ਹਾਈ-ਥਰੂਪੁੱਟ ਸਰਵਿੰਗ ਤੋਂ ਲੈ ਕੇ ਬਹੁਤ ਇੰਟਰਐਕਟਿਵ, ਘੱਟ-ਲੇਟੈਂਸੀ ਵਰਤੋਂ ਤੱਕ. Jalapeño ਨੇ ਥਰੂਪੁੱਟ, ਪਾਵਰ ਕੁਸ਼ਲਤਾ ਅਤੇ ਲੇਟੈਂਸੀ ਦਾ ਬਿਹਤਰ ਸੁਮੇਲ ਪ੍ਰਦਾਨ ਕੀਤਾ. ਹਾਲਾਂਕਿ ਕਈ ਵਾਰ ਕਾਰਗੁਜ਼ਾਰੀ ਪ੍ਰਤੀ ਚਿਪ ਦੇ ਹਿਸਾਬ ਨਾਲ ਰਿਪੋਰਟ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਸਾਡਾ ਮੰਨਣਾ ਹੈ ਕਿ ਹੋਰ ਉਪਯੋਗੀ ਮਿਆਰ ਪਾਵਰ ਦੀ ਪ੍ਰਤੀ ਇਕਾਈ ਕਾਰਗੁਜ਼ਾਰੀ ਹੈ.

Jalapeño ਨੇ ਪਿਛਲੇ ਸਭ ਤੋਂ ਵਧੀਆ TBT ਵਿੱਚ ਆਪਣਾ ਫ਼ਰਕ ਵਧਾਇਆ

Jalapeño ਪ੍ਰਤੀ ਵਰਤੋਂਕਾਰ ਵੱਧ ਟੋਕਨ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ

Jalapeño ਪ੍ਰਤੀ ਕਿਲੋਵਾਟ ਵੱਧ ਥਰੂਪੁੱਟ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ

ਤਿੰਨਾਂ ਜਨਤਕ ਮਾਡਲਾਂ ਵਿੱਚ, Jalapeño ਨੇ ਟੈਸਟ ਕੀਤੀ ਓਪਰੇਟਿੰਗ ਰੇਂਜ ਵਿੱਚ ਪ੍ਰਤੀ ਵਾਟ ਕਾਰਗੁਜ਼ਾਰੀ ਅਤੇ ਲੇਟੈਂਸੀ ਦਾ ਬਿਹਤਰ ਸੁਮੇਲ ਦਿੱਤਾ, ਜਿਸ ਨਾਲ ਇਹ Pareto ਅਤਿ-ਆਧੁਨਿਕ ਸੀਮਾ ਤੇ ਪਹੁੰਚ ਗਿਆ. ਸਿਸਟਮਾਂ ਦੀ ਇਕਸਾਰ ਢੰਗ ਨਾਲ ਤੁਲਨਾ ਕਰਨ ਲਈ, ਅਸੀਂ ਹਰ ਐਕਸਲੇਰੇਟਰ ਦੀ ਪ੍ਰਕਾਸ਼ਿਤ ਚਿਪ ਪਾਵਰ ਰੇਟਿੰਗ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਨਤੀਜਿਆਂ ਨੂੰ ਨੌਰਮਲਾਈਜ਼ ਕੀਤਾ. Jalapeño ਨੂੰ 700 ਵਾਟ ਲਈ ਰੇਟ ਕੀਤਾ ਗਿਆ ਹੈ, ਹਾਲਾਂਕਿ ਟੈਸਟ ਕੀਤੇ ਗਏ ਵਰਕਲੋਡਾਂ 'ਤੇ ਇਸ ਦੀ ਮਾਪੀ ਗਈ ਲਗਾਤਾਰ ਪਾਵਰ 550 ਵਾਟ ਜਾਂ ਇਸ ਤੋਂ ਘੱਟ ਰਹੀ.

Jalapeño ਨੇ GPT‑OSS 120B, DeepSeek R1 670B ਅਤੇ Kimi K2.5 1T ਵਿੱਚ ਮਜ਼ਬੂਤ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ. Kimi ਉੱਤੇ, ਜੋ ਸਾਡੇ ਵੱਲੋਂ ਟੈਸਟ ਕੀਤਾ ਗਿਆ ਸਭ ਤੋਂ ਵੱਡਾ ਜਨਤਕ ਮਾਡਲ ਹੈ, ਇਸ ਨੇ ਤੁਲਨਾ ਵਾਲੇ ਸਿਸਟਮ ਨਾਲੋਂ ਪ੍ਰਤੀ ਵਾਟ ਲਗਭਗ 1.5 ਗੁਣਾ ਹਾਈ ਸਿਖਰ ਕਾਰਗੁਜ਼ਾਰੀ ਅਤੇ 3.4 ਗੁਣਾ ਘੱਟ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਦੀ ਲੇਟੈਂਸੀ ਦਿੱਤੀ. ਸਾਡੀ ਅੰਦਰੂਨੀ ਟੈਸਟਿੰਗ ਵਿੱਚ, ਅਤਿ-ਆਧੁਨਿਕ OpenAI ਮਾਡਲਾਂ ਉੱਤੇ Jalapeño ਦਾ ਫਾਇਦਾ ਹੋਰ ਵੀ ਵਧ ਗਿਆ, ਜੋ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਵਰਕਲੋਡ ਵੱਡੇ ਅਤੇ ਵਧੇਰੇ ਮੰਗ ਵਾਲੇ ਹੋਣ ਨਾਲ ਆਰਕੀਟੈਕਚਰ ਹੋਰ ਕੀਮਤੀ ਬਣਦਾ ਹੈ.

ਇੱਕੋ ਚਿਪ ਦੇ ਅੰਦਰ ਸਪੀਡ ਅਤੇ ਕੁਸ਼ਲਤਾ ਲਈ ਆਰਕੀਟੈਕਚਰ ਤਿਆਰ ਕਰਨਾ

Jalapeño ਨੂੰ ਸ਼ੁਰੂ ਤੋਂ ਹੀ ਇਹ ਸਵਾਲ ਪੁੱਛ ਕੇ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਗਿਆ ਸੀ: ਜੇਕਰ ਇਸ ਦਾ ਮੁੱਖ ਕੰਮ ਆਧੁਨਿਕ ਅਤੇ ਭਵਿੱਖ ਦੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ, ਖ਼ਾਸ ਕਰਕੇ ਇੰਟਰਐਕਟਿਵ ਏਜੰਟਾਂ, ਨੂੰ ਚਲਾਉਣਾ ਹੋਵੇ, ਤਾਂ ਅਸੀਂ ਕਿਹੋ ਜਿਹਾ ਹਾਰਡਵੇਅਰ ਬਣਾਵਾਂਗੇ? Jalapeño ਦੇ ਫ਼ਾਇਦੇ ਅਸਲ ਭਾਸ਼ਾ-ਮਾਡਲ ਵਰਕਲੋਡਾਂ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਚਿਪ, ਮੈਮੋਰੀ, ਨੈੱਟਵਰਕ, ਸੌਫਟਵੇਅਰ ਅਤੇ ਰੈਕ-ਪੱਧਰੀ ਸਿਸਟਮ ਨੂੰ ਇਕੱਠੇ ਡਿਜ਼ਾਈਨ ਕਰਨ ਤੋਂ ਮਿਲਦੇ ਹਨ. ਭਾਸ਼ਾ-ਮਾਡਲ ਇਨਫਰੈਂਸ ਵੱਖ-ਵੱਖ ਰੁਕਾਵਟਾਂ ਵਾਲੇ ਕਈ ਵੱਖਰੇ ਪੜਾਵਾਂ ਵਿੱਚੋਂ ਲੰਘਦਾ ਹੈ. ਪ੍ਰੀਫ਼ਿਲ, ਜਦੋਂ ਸਿਸਟਮ ਇੱਕ ਪ੍ਰੌਂਪਟ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਦਾ ਹੈ, ਕੰਪਿਊਟ-ਇੰਟੈਂਸਿਵ ਹੁੰਦਾ ਹੈ, ਜਦਕਿ ਡੀਕੋਡ, ਜਦੋਂ ਸਿਸਟਮ ਜਵਾਬ ਨੂੰ ਟੋਕਨ ਦਰ ਟੋਕਨ ਤਿਆਰ ਕਰਦਾ ਹੈ, ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਦੁਆਰਾ ਵੱਧ ਸੀਮਿਤ ਹੁੰਦਾ ਹੈ. ਜਦੋਂ ਡਾਟਾ ਨੂੰ ਕੋਰਾਂ ਅਤੇ ਚਿਪਾਂ ਦੇ ਵਿਚਕਾਰ ਜਾਣਾ ਪੈਂਦਾ ਹੈ, ਤਾਂ ਕਮਿਊਨੀਕੇਸ਼ਨ ਵਿੱਚ ਵੀ ਲੇਟੈਂਸੀ ਵਧ ਸਕਦੀ ਹੈ, ਜਿਸ ਕਾਰਨ ਕੁਝ ਪ੍ਰੋਸੈਸਿੰਗ ਇਕਾਈਆਂ ਉਡੀਕ ਕਰਦਿਆਂ ਨਿਸ਼ਕ੍ਰਿਆ ਰਹਿ ਜਾਂਦੀਆਂ ਹਨ. ਕਿਸੇ ਇੱਕ ਪੜਾਅ ਵਿੱਚ ਸ਼ਾਨਦਾਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਨ ਵਾਲਾ ਸਿਸਟਮ ਡਾਟੇ ਉਡੀਕ ਕਰਦਿਆਂ ਜਾਂ ਵੱਖ-ਵੱਖ ਸੰਸਾਧਨਾਂ ਵਿਚਕਾਰ ਮਾਡਲ ਸਥਿਤੀ ਭੇਜਦੇ ਸਮੇਂ ਉਹ ਫਾਇਦਾ ਗੁਆ ਸਕਦਾ ਹੈ.

ਅਸੀਂ Jalapeño ਨੂੰ ਡਾਟਾ ਦੀ ਆਵਾਜਾਈ ਅਤੇ ਕਮਿਊਨੀਕੇਸ਼ਨ ਵਿੱਚ ਹੋਣ ਵਾਲੀਆਂ ਦੇਰੀਆਂ ਨੂੰ ਘੱਟ ਤੋਂ ਘੱਟ ਕਰਨ ਲਈ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਹੈ. ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਜਵਾਬ ਬਣਾਉਣ ਦੌਰਾਨ ਵਰਤੇ ਜਾਣ ਵਾਲੇ KV ਕੈਸ਼ ਸਮੇਤ ਮਾਡਲ ਸਥਿਤੀ ਨੂੰ ਸਪਸ਼ਟ ਤੌਰ ਤੇ ਨਿਰਧਾਰਤ ਥਾਂ ਤੇ ਰੱਖਿਆ ਅਤੇ ਸਥਾਨਕ ਰੱਖਿਆ ਜਾ ਸਕਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਸਿਸਟਮ ਹਰੇਕ ਇਨਫਰੈਂਸ ਪੜਾਅ ਲਈ ਕੰਪਿਊਟ, ਮੈਮੋਰੀ ਅਤੇ ਨੈੱਟਵਰਕਿੰਗ ਦੇ ਸਹੀ ਸੁਮੇਲ ਨੂੰ ਸਰਗਰਮ ਕਰਦਾ ਹੈ. ਨੈੱਟਵਰਕ ਆਰਕੀਟੈਕਚਰ ਦਾ ਅਟੁੱਟ ਹਿੱਸਾ ਹੈ. ਇਸ ਦਾ ਵਿਸ਼ਾਲ ਡੋਮੇਨ ਪੂਰੇ ਵਰਕਲੋਡ ਨੂੰ ਇੱਕ ਹੀ ਜੁੜੇ ਹੋਏ ਸਿਸਟਮ ਦੇ ਅੰਦਰ ਰਹਿਣ ਦੀ ਸਮਰੱਥਾ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਡਾਟਾ ਦੀ ਆਵਾਜਾਈ ਘੱਟ ਤੋਂ ਘੱਟ ਹੁੰਦੀ ਹੈ ਅਤੇ ਪੂਰੀ ਰਿਕਵੈਸਟ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਤੇਜ਼ ਅਤੇ ਕੁਸ਼ਲ ਰਹਿਣ ਵਿੱਚ ਮਦਦ ਮਿਲਦੀ ਹੈ. ਨਤੀਜਾ ਇੱਕ ਸੰਤੁਲਿਤ ਅਤੇ ਫੰਗਿਬਲ ਐਕਸਲੇਰੇਟਰ ਹੈ ਜੋ ਬਦਲਦੇ ਮਾਡਲ ਆਰਕੀਟੈਕਚਰਾਂ ਦਾ ਸਮਰਥਨ ਕਰ ਸਕਦਾ ਹੈ, ਪ੍ਰੀਫ਼ਿਲ ਅਤੇ ਡੀਕੋਡ ਦੋਵਾਂ ਵਿੱਚ ਸ਼ਾਨਦਾਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰ ਸਕਦਾ ਹੈ, ਅਤੇ ਜਿਵੇਂ-ਜਿਵੇਂ ਇਹਨਾਂ ਵਿਚਕਾਰ ਸੰਤੁਲਨ ਬਦਲਦਾ ਹੈ, ਉਸ ਅਨੁਸਾਰ ਢਲ ਸਕਦਾ ਹੈ—ਜੋ ਏਜੰਟ-ਆਧਾਰਿਤ ਵਰਕਲੋਡਾਂ ਦੀ ਇੱਕ ਪਰਿਭਾਸ਼ਿਤ ਫ਼ੀਚਰ ਹੈ.

ਅਸੀਂ ਚਿਪ ਨੂੰ ਡਿਜ਼ਾਈਨ ਕਰਨ ਲਈ AI ਦੀ ਵਰਤੋਂ ਕੀਤੀ, ਅਤੇ ਚਿਪ ਨੂੰ ਇਸ ਤਰ੍ਹਾਂ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਕਿ AI ਇਸਨੂੰ ਪ੍ਰੋਗਰਾਮ ਕਰ ਸਕੇ

AI ਨੇ Jalapeño ਦੇ ਵਿਕਾਸ ਵਿੱਚ ਸਿੱਧੀ ਭੂਮਿਕਾ ਨਿਭਾਈ, ਜਿਸ ਨਾਲ ਟੀਮ ਇੰਪਲੀਮੈਂਟੇਸ਼ਨਾਂ ਦੀ ਪੜਚੋਲ ਕਰਕੇ, ਡਿਜ਼ਾਈਨ, ਮਾਪ ਅਤੇ ਤਸਦੀਕ ਚੱਕਰਾਂ ਨੂੰ ਘੱਟ ਕਰਕੇ, ਅਤੇ ਮਾਡਲ ਵਰਕਲੋਡਾਂ ਉੱਤੇ ਲਗਾਤਾਰ ਦੁਹਰਾਵ ਕਰਕੇ ਨੌਂ ਮਹੀਨਿਆਂ ਵਿੱਚ ਸ਼ੁਰੂਆਤੀ ਡਿਜ਼ਾਈਨ ਤੋਂ ਟੇਪਆਊਟ ਤੱਕ ਪਹੁੰਚ ਸਕੀ. AI ਨੇ ਚਿਪ ਦੇ ਅੰਕਗਣਿਤ ਸਰਕਿਟਾਂ ਨੂੰ ਔਪਟੀਮਾਈਜ਼ ਕਰਨ ਵਿੱਚ ਵੀ ਮਦਦ ਕੀਤੀ, ਜਿਸ ਨਾਲ ਟੀਮ ਨਿਰਧਾਰਤ ਸਮੇਂ ਅਨੁਸਾਰ ਚਿਪ ਵਿੱਚ ਹੋਰ ਵੱਧ ਗਣਨਾਤਮਕ ਪ੍ਰਦਰਸ਼ਨ ਸਮਾਉਣ ਵਿੱਚ ਸਮਰੱਥ ਹੋਈ.

Jalapeño ਨੂੰ ਮਨੁੱਖਾਂ ਅਤੇ AI ਦੋਵਾਂ ਲਈ ਇੱਕ ਸਪਸ਼ਟ, ਅਨੁਮਾਨਯੋਗ ਪ੍ਰੋਗਰਾਮਿੰਗ ਟਾਰਗੇਟ ਵਜੋਂ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਗਿਆ ਸੀ. ਇੰਜੀਨੀਅਰ ਸਥਾਨਕ ਟੈਂਸਰਾਂ, ਸਪਸ਼ਟ ਕਮਿਊਨੀਕੇਸ਼ਨ, ਅਤੇ ਅਨੁਮਾਨਯੋਗ ਸਿੰਕ੍ਰੋਨਾਈਜੇਸ਼ਨ ਰਾਹੀਂ ਕੰਮ ਦਾ ਵਰਣਨ ਕਰ ਸਕਦੇ ਹਨ. ਫਿਰ AI ਇਹ ਔਪਟੀਮਾਈਜ਼ ਕਰ ਸਕਦਾ ਹੈ ਕਿ ਉਸ ਕੰਮ ਨੂੰ ਪੂਰੇ ਸਿਸਟਮ ਵਿੱਚ ਕਿਵੇਂ ਮੈਪ ਕੀਤਾ, ਰੱਖਿਆ, ਸ਼ੈਡਿਊਲ ਕੀਤਾ ਅਤੇ ਕੋ-ਆਰਡੀਨੇਟ ਕੀਤਾ ਜਾਵੇ. ਉਹ ਸਪੱਸ਼ਟ, ਅਨੁਮਾਨਯੋਗ ਬਣਤਰ AI ਨੂੰ ਪੈਰਲਲ ਪ੍ਰੋਗ੍ਰਾਮਿੰਗ ਦੀ ਰਵਾਇਤੀ ਤੌਰ 'ਤੇ ਮੁਸ਼ਕਲ ਸਮੱਸਿਆ ਨਾਲ ਨਜਿੱਠਣ ਲਈ ਇੱਕ ਸੰਭਾਲਣਯੋਗ ਢੰਗ ਦਿੰਦੀ ਹੈ.

ਹਰੇਕ ਨਵੇਂ ਮਾਡਲ ਪਰਿਵਾਰ ਨੂੰ ਸਮਰਥਨ ਦੇਣ ਲਈ ਅਜੇ ਵੀ ਨਵੇਂ ਕਰਨਲਾਂ ਅਤੇ ਮਾਡਲ-ਵਿਸ਼ੇਸ਼ ਔਪਟੀਮਾਈਜ਼ੇਸ਼ਨਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ. Codex ਨੂੰ GPT‑Astra ਨਾਲ ਵਰਤ ਕੇ, ਟੀਮ ਨੇ ਤਿੰਨ ਓਪਨ ਵਜ਼ਨ ਮਾਡਲਜ਼, ਜੋ Jalapeño ਦੀ ਮੂਲ ਪ੍ਰੋਡਕਸ਼ਨ ਯੋਜਨਾ ਦਾ ਹਿੱਸਾ ਨਹੀਂ ਸਨ, ਨੂੰ ਦੋ ਮਹੀਨਿਆਂ ਦੇ ਅੰਦਰ ਹਾਈ ਕਾਰਗੁਜ਼ਾਰੀ ਤੱਕ ਪਹੁੰਚਾਇਆ. ਇਸ ਨੇ ਆਰਕੀਟੈਕਚਰ ਦੀ ਲਚਕਤਾ ਅਤੇ ਉਸ ਸਪੀਡ ਦੋਵਾਂ ਨੂੰ ਦਰਸਾਇਆ ਜਿਸ ਨਾਲ AI ਇਸ ਨੂੰ ਪ੍ਰੋਗਰਾਮ ਕਰਨ ਵਿੱਚ ਸਾਡੀ ਮਦਦ ਕਰ ਸਕਦੀ ਹੈ. ਚੁਣੇ ਹੋਏ GPT‑OSS ਅਟੈਂਸ਼ਨ ਅਤੇ ਮਿਕਸਚਰ-ਆਫ਼-ਐਕਸਪਰਟਸ ਬਲੌਕਾਂ ਲਈ, AI ਵੱਲੋਂ ਤਿਆਰ ਕੀਤੀਆਂ ਇੰਪਲੀਮੈਂਟੇਸ਼ਨਾਂ ਨੇ ਮੌਜੂਦਾ ਮਨੁੱਖੀ ਮਾਹਿਰਾਂ ਵੱਲੋਂ ਲਿਖੀਆਂ ਇੰਪਲੀਮੈਂਟੇਸ਼ਨਾਂ ਦੇ ਮੁਕਾਬਲੇ 1.5 ਤੋਂ 1.8 ਗੁਣਾ ਤੇਜ਼ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ. ਇਹ ਅੰਕੜੇ ਚੁਣੇ ਹੋਏ ਬਲੌਕਾਂ ’ਤੇ ਲਾਗੂ ਹੁੰਦੇ ਹਨ, ਪੂਰੇ ਮਾਡਲ ’ਤੇ ਨਹੀਂ, ਪਰ ਇਹ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਨਵੇਂ ਵਿਕਾਸ ਚੱਕਰ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਦੇ ਹਨ.

ਕੁਸ਼ਲ, Ultra-ਤੇਜ਼ ਇਨਫ਼ਰੈਂਸ ਲਈ ਅੱਗੇ ਦਾ ਰਾਹ

AI ਬੁਨਿਆਦੀ ਢਾਂਚਾ ਕੀਮਤੀ ਹੈ ਕਿਉਂਕਿ ਇਹ ਅਸਲ ਦੁਨੀਆ ਵਿੱਚਉਪਯੋਗੀ ਕੰਮ ਨੂੰ ਸੰਭਵ ਬਣਾਉਂਦਾ ਹੈ. ਉਸੇ ਪਾਵਰ ਅਤੇ ਹਾਰਡਵੇਅਰ ਤੋਂ ਵੱਧ ਉਪਯੋਗੀ ਕੰਮ ਤਿਆਰ ਕਰਕੇ, Jalapeño ਸਾਨੂੰ ਵੱਧ ਮੰਗ ਨੂੰ ਪੂਰਾ ਕਰਨ ਅਤੇ ਸਫਲ ਨਤੀਜਾ ਪ੍ਰਦਾਨ ਕਰਨ ਦੀ ਲਾਗਤ ਘਟਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ. OpenAI ਲਈ, ਇਹ ਉਪਯੋਗੀ ਕੰਮ ਅਤੇ ਆਮਦਨ ਨੂੰ ਸੇਵਾ ਦੇਣ ਦੀ ਲਾਗਤ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਵਧਣ ਦੇ ਕੇ ਸੰਚਾਲਕੀ ਲੀਵਰੇਜ ਨੂੰ ਸੁਧਾਰ ਸਕਦਾ ਹੈ. ਇਹ ਬਿਹਤਰ ਮਾਡਲਾਂ, ਉਤਪਾਦਾਂ ਅਤੇ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਵਿੱਚ ਵਿਆਪਕ ਅਪਣਾਉਣ ਅਤੇ ਲਗਾਤਾਰ ਨਿਵੇਸ਼ ਦਾ ਵੀ ਸਮਰਥਨ ਕਰ ਸਕਦਾ ਹੈ. ਤੇਜ਼ ਇਨਫ਼ਰੈਂਸ ਤੇਜ਼ ਇਟਰੇਸ਼ਨ ਅਤੇ ਨਵੇਂ ਵਰਤੋਂ ਦੇ ਮਾਮਲਿਆਂ ਨੂੰ ਸਮਰੱਥ ਬਣਾ ਸਕਦਾ .

Jalapeño ਕੁਸ਼ਲ, ਘੱਟ-ਲੇਟੈਂਸੀ ਵਾਲੇ ਇਨਫਰੈਂਸ ਲਈ ਸੰਭਾਵਨਾਵਾਂ ਦਾ ਵਿਸਤਾਰ ਕਰਦਾ ਹੈ:

  • Ultra-ਫਾਸਟ ਮੋਡ ਇਨਫਰੈਂਸ, ਉਹਨਾਂ ਕਾਰਗੁਜ਼ਾਰੀ ਕੁਸ਼ਲਤਾਵਾਂ ਨਾਲ ਜੋ ਪਹਿਲਾਂ ਸਿਰਫ਼ ਫਾਸਟ ਮੋਡ ਵਿੱਚ ਉਪਲਬਧ ਸਨ
  • ਫਾਸਟ ਮੋਡ ਇਨਫਰੈਂਸ ਉਹਨਾਂ ਕੁਸ਼ਲਤਾ ਪੱਧਰਾਂ 'ਤੇ ਜੋ ਪਹਿਲਾਂ ਸਿਰਫ਼ ਬੈਚਡ ਮੋਡ ਵਿੱਚ ਹੀ ਉਪਲਬਧ ਸਨ
  • ਬੈਚ-ਮੋਡ ਇਨਫਰੈਂਸ ਲਈ ਹਾਈ ਕਾਰਗੁਜ਼ਾਰੀ

ਅਸੀਂ ਸਾਲ ਦੇ ਅੰਤ ਤੱਕ OpenAI ਦੇ ਕੰਪਿਊਟ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਵਿੱਚ Jalapeño ਨੂੰ ਡਿਪਲੌਇਮੈਂਟ ਕਰਨਾ ਸ਼ੁਰੂ ਕਰਨ ਦੀ ਯੋਜਨਾ ਬਣਾਈ ਹੈ. ਇਹ ਬਹੁ-ਪੀੜ੍ਹੀ ਵਾਲੇ ਰੋਡਮੈਪ ਦੀ ਪਹਿਲੀ ਪੀੜ੍ਹੀ ਹੈ: Gen 2 ਦਾ ਵਿਕਾਸ ਕਾਫ਼ੀ ਅੱਗੇ ਵੱਧ ਚੁੱਕਾ ਹੈ, ਅਤੇ Gen 3 ਰੂਪ ਲੈ ਰਿਹਾ ਹੈ. ਹਰ ਪੀੜ੍ਹੀ ਜੋ ਅਸੀਂ ਸਿੱਖਦੇ ਹਾਂ, ਉਸ ’ਤੇ ਅੱਗੇ ਨਿਰਮਾਣ ਕਰੇਗੀ ਅਤੇ ਕੁਸ਼ਲਤਾ ਤੇ ਗਤੀ ਦੋਵਾਂ ਨੂੰ ਹੋਰ ਵਧਾਏਗੀ.

AI ਦੀ ਵਧਦੀ ਮੰਗ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਹਰ ਉਪਲਬਧ ਸਰੋਤ ਤੋਂ ਹੋਰ ਕੰਪਿਊਟ ਸਮਰੱਥਾ ਦੀ ਲੋੜ ਹੋਵੇਗੀ. ਅਸੀਂ ਟ੍ਰੇਨਿੰਗ ਅਤੇ ਇਨਫਰੈਂਸ ਦੋਵਾਂ ਵਰਕਲੋਡਾਂ ਲਈ NVIDIA ਅਤੇ ਹੋਰ ਭਾਈਵਾਲਾਂ ਦੇ ਐਕਸਲੇਰੇਟਰਾਂ ਨੂੰ ਵਿਆਪਕ ਤੌਰ ’ਤੇ ਡਿਪਲੌਏ ਕਰਨਾ ਜਾਰੀ ਰੱਖਾਂਗੇ. ਸਾਡਾ ਮਿਸ਼ਨ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣਾ ਹੈ ਕਿ ਆਰਟੀਫ਼ਿਸ਼ੀਅਲ ਜਨਰਲ ਇੰਟੈਲੀਜੈਂਸ ਸਮੁੱਚੀ ਮਨੁੱਖਤਾ ਦੇ ਫਾਇਦੇ ਲਈ ਹੋਵੇ.

ਜਿਵੇਂ ਅਸੀਂ ਡਿਪਲੌਇਮੈਂਟ ਲਈ ਤਿਆਰੀ ਕਰ ਰਹੇ ਹਾਂ, ਅਸੀਂ ਪ੍ਰੋਡਕਸ਼ਨ ਕੁਆਲੀਫਿਕੇਸ਼ਨ ਜਾਰੀ ਰੱਖ ਰਹੇ ਹਾਂ, ਸੌਫਟਵੇਅਰ ਨੂੰ ਹੋਰ ਵਿਕਸਿਤ ਕਰ ਰਹੇ ਹਾਂ, Jalapeño ਨੂੰ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਚਲਾਉਣ ਦੀ ਤਿਆਰੀ ਕਰ ਰਹੇ ਹਾਂ ਅਤੇ ਹੋਰ ਮਾਡਲਾਂ ਵਿੱਚ ਕਾਰਗੁਜ਼ਾਰੀ ਦੀ ਪੁਸ਼ਟੀ ਕਰ ਰਹੇ ਹਾਂ. ਹੁਣ ਤੱਕ ਦੇ ਨਤੀਜੇ ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ ਜਦੋਂ ਅਸੀਂ ਪੂਰੇ ਸਿਸਟਮ ਨੂੰ ਇਕੱਠੇ ਡਿਜ਼ਾਈਨ ਕਰਦੇ ਹਾਂ ਤਾਂ ਕੀ ਸੰਭਵ ਹੈ: ਵਧੇਰੇ ਜਵਾਬਦੇਹ, ਸਮਰੱਥ ਅਤੇ ਏਜੰਟਿਕ AI ਨੂੰ ਵਧੇਰੇ ਕੁਸ਼ਲਤਾ ਨਾਲ ਹੋਰ ਲੋਕਾਂ ਤੱਕ ਪਹੁੰਚਾਇਆ ਜਾ ਰਿਹਾ ਹੈ.

ਅੰਤਕਾ

Jalapeño GPT‑OSS 120B ਵਿੱਚ Pareto ਅਤਿ-ਆਧੁਨਿਕ ਹੈ

ਪ੍ਰਤੀ kW ਥਰੂਪੁੱਟ ਫ੍ਰੰਟੀਅਰ

InferenceX · GPT‑OSS‑120B · ਨੋਮੀਨਲ 8k/1k · STP · ਪੈਕੇਜ਼ TDP: Jalapeño 700 W; GB200 1,200 W

Jalapeño GPT‑OSS ਦੇ ਸਾਰੇ ਓਪਰੇਟਿੰਗ ਪੁਆਇੰਟਾਂ 'ਤੇ ਸਭ ਤੋਂ ਅੱਗੇ ਹੈ

ਪੀਕ ਅਤੇ ਸਮਾਨ ਥਰੂਪੁੱਟ

InferenceX · GPT‑OSS‑120B · ਨੋਮੀਨਲ 8k/1k · STP · ਪੈਕੇਜ਼ TDP: Jalapeño 700 W; GB200 1,200 W

ਉੱਚਤਮ ਪੀਕ ਮਿਕਸਡ TPS / kW

≈1.9×

85,448 ਬਨਾਮ 44,960 ਮਿਕਸਡ / kW

ਐਂਡ-ਟੂ-ਐਂਡ ਘੱਟ ਲੇਟੈਂਸੀ

≈1.7×

1.03 s ਬਨਾਮ 1.80 s

ਘੱਟੋ-ਘੱਟ TBT

≈2.7×

0.69 ਬਨਾਮ 1.87 ms (1,459 ਬਨਾਮ 535 tok/s/ਵਰਤੋਂਕਾਰ)

ਪਿਛਲੇ TBT 'ਤੇ ਵੱਧ ਥਰੂਪੁੱਟ

≈53.7×

22,935 ਬਨਾਮ 427 ਮਿਕਸਡ / kW (535.28 tok/s/ਵਰਤੋਂਕਾਰ ‘ਤੇ)

Jalapeño DeepSeek R1 670B 'ਤੇ Pareto ਅਤਿ-ਆਧੁਨਿਕ ਹੈ

ਪ੍ਰਤੀ kW ਥਰੂਪੁੱਟ ਫ੍ਰੰਟੀਅਰ

InferenceX · DeepSeek R1 MXFP4 · ਨੋਮੀਨਲ 8k/1k · STP · ਪੈਕੇਜ਼ TDP: Jalapeño 700 W; GB300 1,400 W

Jalapeño DeepSeek R1 ਦੇ ਓਪਰੇਟਿੰਗ ਪੁਆਇੰਟਾਂ 'ਤੇ ਸਭ ਤੋਂ ਅੱਗੇ ਹੈ

ਪੀਕ ਅਤੇ ਸਮਾਨ ਥਰੂਪੁੱਟ

InferenceX · DeepSeek R1 MXFP4 · ਨੋਮੀਨਲ 8k/1k · STP · ਪੈਕੇਜ਼ TDP: Jalapeño 700 W; GB300 1,400 W

ਉੱਚਤਮ ਪੀਕ ਮਿਕਸਡ TPS / kW

≈1.7×

19,641 ਬਨਾਮ 11,781 ਮਿਕਸਡ / kW

ਐਂਡ-ਟੂ-ਐਂਡ ਘੱਟ ਲੇਟੈਂਸੀ

≈3.6×

1.65 s ਬਨਾਮ 5.99 s

ਘੱਟੋ-ਘੱਟ TBT

≈4.1×

1.43 ਬਨਾਮ 5.90 ms (700 ਬਨਾਮ 169 tok/s/ਵਰਤੋਂਕਾਰ)

ਪਿਛਲੇ TBT 'ਤੇ ਵੱਧ ਥਰੂਪੁੱਟ

≈104.3×

12,258 ਬਨਾਮ 118 ਮਿਕਸਡ / kW (169.41 tok/s/ਵਰਤੋਂਕਾਰ ‘ਤੇ)

Jalapeño, Kimi K2.5 1T 'ਤੇ Pareto ਅਤਿ-ਆਧੁਨਿਕ ਹੈ

ਪ੍ਰਤੀ kW ਥਰੂਪੁੱਟ ਫ੍ਰੰਟੀਅਰ

InferenceX · Kimi K2.5 MXFP4 · ਨੋਮੀਨਲ 8k/1k · STP · ਪੈਕੇਜ਼ TDP: Jalapeño 700 W; GB300 1,400 W

Jalapeño Kimi K2.5 ਓਪਰੇਟਿੰਗ ਪੁਆਇੰਟਾਂ 'ਤੇ ਸਭ ਤੋਂ ਅੱਗੇ ਹੈ

ਪੀਕ ਅਤੇ ਸਮਾਨ ਥਰੂਪੁੱਟ

InferenceX · Kimi K2.5 MXFP4 · ਨੋਮੀਨਲ 8k/1k · STP · ਪੈਕੇਜ਼ TDP: Jalapeño 700 W; GB300 1,400 W

ਉੱਚਤਮ ਪੀਕ ਮਿਕਸਡ TPS / kW

≈1.5×

18,195 ਬਨਾਮ 11,862 ਮਿਕਸਡ / kW

ਐਂਡ-ਟੂ-ਐਂਡ ਘੱਟ ਲੇਟੈਂਸੀ

≈3.4×

1.56 s ਬਨਾਮ 5.31 s

ਘੱਟੋ-ਘੱਟ TBT

≈3.8×

1.44 ਬਨਾਮ 5.48 ms (694 ਬਨਾਮ 182 tok/s/ਵਰਤੋਂਕਾਰ)

ਪਿਛਲੇ TBT 'ਤੇ ਵੱਧ ਥਰੂਪੁੱਟ

≈56.1×

6,744 ਬਨਾਮ 120 ਮਿਕਸਡ / kW (182.46 tok/s/ਵਰਤੋਂਕਾਰ ‘ਤੇ)

ਲੇਖਕ

OpenAI