GPT‑5.6 ਵਿੱਚ ਅਤਿ-ਆਧੁਨਿਕ ਬੁੱਧੀਮੱਤਾ ਤੇ ਕੁਸ਼ਲਤਾ ਦਾ ਸੁਮੇਲ
ਅਸੀਂ GPT‑5.6 ਮਾਡਲ ਪਰਿਵਾਰ ਨੂੰ ਉਹਨਾਂ ਸਾਰੇ ਕੰਮਾਂ ਵਿੱਚ ਸਮਰੱਥਾ ਅਤੇ ਲਾਗਤ ਦਾ ਸੰਤੁਲਨ ਬਣਾਉਣ ਲਈ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਹੈ, ਜਿਨ੍ਹਾਂ ਵਾਸਤੇ ਲੋਕ ਸਾਡੇ ਮਾਡਲ ਵਰਤਦੇ ਹਨ. ਸਾਡਾ ਫਲੈਗਸ਼ਿਪ ਮਾਡਲ GPT‑5.6 Sol, Max ਰੀਜ਼ਨਿੰਗ ਨਾਲ, ਅੱਧੀ ਤੋਂ ਵੀ ਘੱਟ ਲਾਗਤ ਉੱਤੇ Artificial Analysis Coding Agent Index ਵਿੱਚ Claude Fable 5 ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ. Terra ਅੱਧੀ ਕੀਮਤ ਉੱਤੇ ਬੁੱਧੀਮੱਤਾ ਮਾਪਦੰਡਾਂ ਵਿੱਚ GPT‑5.5 ਜਿੰਨਾ ਵਧੀਆ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ, ਅਤੇ Luna ਸਾਡਾ ਸਭ ਤੋਂ ਤੇਜ਼ ਤੇ ਕਿਫ਼ਾਇਤੀ ਮਾਡਲ ਹੈ, ਜਿਸਦੀ ਕੀਮਤ Sol ਦੀ ਲਾਗਤ ਨਾਲੋਂ 80% ਘੱਟ ਹੈ. ਇਹ ਕੁਸ਼ਲਤਾਵਾਂ ਮੁਹੱਈਆ ਕਰਨ ਲਈ ਸਾਡੀਆਂ ਖੋਜ ਅਤੇ ਤਕਨੀਕੀ ਟੀਮਾਂ ਨੇ ਸਾਡੇ ਤਕਨੀਕੀ ਢਾਂਚੇ ਦੀ ਹਰ ਮੁੱਖ ਪਰਤ ਉੱਤੇ ਵੱਡੇ ਅਨੁਕੂਲਨ ਕੀਤੇ ਹਨ. ਇਹ ਸੁਧਾਰ ਸਾਡੇ ਮਾਡਲਾਂ, ਇਨਫ਼ਰੈਂਸ, ਅਰਥਾਤ ਆਉਟਪੁੱਟ ਬਣਾਉਣ ਲਈ ਮਾਡਲ ਚਲਾਉਣ ਦਾ ਤਰੀਕਾ, ਅਤੇ Codex ਤੇ ChatGPT ਵਰਕ ਦੋਵਾਂ ਵੱਲੋਂ ਵਰਤੇ ਜਾਂਦੇ ਸਾਡੇ ਏਜੰਟ-ਅਧਾਰਿਤ ਜਾਂਚ-ਢਾਂਚੇ ਤੱਕ ਫੈਲੇ ਹੋਏ ਹਨ.
ਪਿਛਲੇ ਚਾਰ ਸਾਲਾਂ ਵਿੱਚ ਆਪਣੇ ਮਾਡਲਾਂ ਨੂੰ 1 ਅਰਬ ਸਰਗਰਮ ਵਰਤੋਂਕਾਰਾਂ ਅਤੇ 20 ਲੱਖ ਤੋਂ ਵੱਧ ਕਾਰੋਬਾਰਾਂ ਤੱਕ ਵਧਾਉਂਦਿਆਂ, ਬੁੱਧੀਮੱਤਾ ਦੇ ਲਾਭ ਹਰ ਕਿਸੇ ਤੱਕ ਪਹੁੰਚਾਉਣ ਲਈ ਕੁਸ਼ਲਤਾ ਕੇਂਦਰੀ ਰਹੀ ਹੈ. ਸਾਡਾ ਮਿਸ਼ਨ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣਾ ਹੈ ਕਿ ਆਰਟੀਫ਼ਿਸ਼ੀਅਲ ਜਨਰਲ ਇੰਟੈਲੀਜੈਂਸ ਸਾਰੀ ਮਨੁੱਖਤਾ ਲਈ ਲਾਭਦਾਇਕ ਹੋਵੇ. ਇਨ੍ਹਾਂ ਸਾਲਾਂ ਦੌਰਾਨ ਅਸੀਂ ਲਾਗਤ-ਬੁੱਧੀਮੱਤਾ ਪੈਮਾਨੇ ਦੇ ਹਰ ਪੱਧਰ ਉੱਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਕਾਰਗੁਜ਼ਾਰੀ ਵਾਲੇ ਮਾਡਲ ਪੇਸ਼ ਕਰਨ ਲਈ ਆਪਣੇ ਪੂਰੇ ਤਕਨੀਕੀ ਢਾਂਚੇ ਵਿੱਚ ਲਗਾਤਾਰ ਵੱਡੇ ਅਨੁਕੂਲਨ ਸੰਭਵ ਬਣਾਉਣ ਉੱਤੇ ਕੰਮ ਕੀਤਾ ਹੈ. ਅਸੀਂ GPT‑5.6 ਰਾਹੀਂ ਹੁਣ ਤੱਕ ਦੀ ਆਪਣੀ ਸਭ ਤੋਂ ਵਧੀਆ ਪ੍ਰਤੀ-ਟੋਕਨ ਬੁੱਧੀਮੱਤਾ ਕੁਸ਼ਲਤਾ ਹਾਸਲ ਕੀਤੀ ਹੈ. ਇਸਨੂੰ ਹਰੇਕ ਟੋਕਨ ਨਾਲ ਹੋਰ ਕੰਮ ਕਰਨ ਲਈ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਹੈ. ਸਿਖਲਾਈ ਦੌਰਾਨ ਅਸੀਂ ਕੰਮ ਦੀ ਸਫਲਤਾ ਅਤੇ ਕੁਸ਼ਲਤਾ ਦੋਵਾਂ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਉਂਦੇ ਹਾਂ, ਤਾਂ ਜੋ ਮਾਡਲ ਕੰਮ ਪੂਰਾ ਕਰਨ ਲਈ ਹੋਰ ਸਿੱਧਾ ਰਾਹ ਅਪਣਾਏ.
ਇਹ ਪੋਸਟ ਸਾਡੇ ਮਾਡਲਾਂ ਤੋਂ ਅੱਗੇ ਜਾ ਕੇ ਦੱਸਦੀ ਹੈ ਕਿ ਅਸੀਂ ਤਕਨੀਕੀ ਢਾਂਚੇ ਦੇ ਦੋ ਹੋਰ ਮੁੱਖ ਹਿੱਸਿਆਂ ਵਿੱਚ ਤਰੱਕੀ ਰਾਹੀਂ ਕੁਸ਼ਲਤਾ ਲਈ ਕਿਵੇਂ ਡਿਜ਼ਾਈਨ ਕੀਤਾ. ਇਨ੍ਹਾਂ ਵਿੱਚ 1) ਇਨਫ਼ਰੈਂਸ, ਜਿਸ ਵਿੱਚ ਉਸੇ ਹਾਰਡਵੇਅਰ ਤੋਂ ਹੋਰ ਆਉਟਪੁੱਟ ਲੈਣ ਲਈ ਲੋਡ ਸੰਤੁਲਨ, ਅੰਦਾਜ਼ਨ ਡੀਕੋਡਿੰਗ, ਕੈਸ਼ਿੰਗ ਅਤੇ ਕਰਨਲ ਅਨੁਕੂਲਨ ਵਰਗੀਆਂ ਪ੍ਰਕਿਰਿਆਵਾਂ ਨੂੰ ਸੁਧਾਰਨਾ, ਅਤੇ 2) ਸਾਡਾ ਏਜੰਟ-ਅਧਾਰਿਤ ਜਾਂਚ-ਢਾਂਚਾ, ਜਿਸ ਵਿੱਚ ਸੰਦਰਭ ਦੇ ਬੇਲੋੜੇ ਫੈਲਾਅ, ਟੂਲ ਵਰਤੋਂ ਅਤੇ ਦੁਹਰਾਏ ਕੰਮ ਦਾ ਬਿਹਤਰ ਪ੍ਰਬੰਧਨ ਸ਼ਾਮਲ ਹੈ. ਅਸੀਂ ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਕਈ ਲਾਭ ਖ਼ੁਦਮੁਖ਼ਤਿਆਰ ਢੰਗ ਨਾਲ ਹਾਸਲ ਕਰਨ ਵਿੱਚ GPT‑5.6 Sol ਦੀ ਭੂਮਿਕਾ ਵੀ ਸਾਂਝੀ ਕਰਾਂਗੇ. ਭਾਵੇਂ ਕੋਈ ਇਕੱਲਾ ਸੁਧਾਰ ਸੀਮਿਤ ਲੱਗ ਸਕਦਾ ਹੈ, ਪਰ ਇਹ ਸਫਲਤਾਵਾਂ ਇਕੱਠੀਆਂ ਹੋ ਕੇ ਸਾਨੂੰ ਬੁੱਧੀਮੱਤਾ ਅਤੇ ਕੁਸ਼ਲਤਾ ਦੋਵਾਂ ਦੇ ਅਤਿ-ਆਧੁਨਿਕ ਪੱਧਰ ਉੱਤੇ ਨਤੀਜੇ ਦੇਣ ਯੋਗ ਬਣਾਉਂਦੀਆਂ ਹਨ.
ਕੰਪਿਊਟਿੰਗ ਸਮਰੱਥਾ ਦੀ ਘਾਟ ਵਾਲੇ ਸੰਸਾਰ ਵਿੱਚ, ਜਿੱਥੇ ਮਾਡਲਾਂ ਦੀ ਮੰਗ ਸਮਰੱਥਾ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਵਧ ਰਹੀ ਹੈ, ਹਰ ਸਿਸਟਮ ਦੇ ਡਿਜ਼ਾਈਨ ਵਿੱਚ ਕੁਸ਼ਲਤਾ ਕੇਂਦਰੀ ਮਹੱਤਤਾ ਰੱਖਦੀ ਹੈ. ਇਹ ਗੱਲ ਖ਼ਾਸ ਕਰਕੇ ਸਾਡੇ ਇਨਫ਼ਰੈਂਸ ਤਕਨੀਕੀ ਢਾਂਚੇ ਉੱਤੇ ਲਾਗੂ ਹੁੰਦੀ ਹੈ, ਜੋ ਜਵਾਬ ਬਣਾਉਣ ਲਈ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਮਾਡਲ ਚਲਾਉਂਦਾ ਹੈ. ਸਾਡਾ ਮੁੱਖ ਉਦੇਸ਼ ਵਰਤੋਂਕਾਰਾਂ ਦੀ ਉਮੀਦ ਮੁਤਾਬਕ ਬੁੱਧੀਮੱਤਾ, ਦੇਰੀ, ਉਪਲਬਧਤਾ ਅਤੇ ਭਰੋਸੇਯੋਗਤਾ ਕਾਇਮ ਰੱਖਦਿਆਂ ਉਸੇ ਹਾਰਡਵੇਅਰ ਨਾਲ ਹੋਰ ਟੋਕਨ ਮੁਹੱਈਆ ਕਰਨਾ ਹੈ.
ਇਸ ਨੂੰ ਹਾਸਲ ਕਰਨ ਲਈ ਪੂਰੇ ਸਿਸਟਮ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਉਣਾ ਜ਼ਰੂਰੀ ਹੈ. ਇੱਕ ਮਾਡਲ ਆਪਣੇ ਆਪ ਵਿੱਚ ਬਹੁਤ ਕੁਸ਼ਲ ਹੋ ਸਕਦਾ ਹੈ, ਪਰ ਬੇਨਤੀਆਂ ਦੀ ਮਾੜੀ ਵੰਡ, ਹਾਰਡਵੇਅਰ ਦੇ ਵਿਹਲੇ ਰਹਿਣ ਜਾਂ ਡਾਟਾ ਆਵਾਜਾਈ ਕਾਰਨ ਗਣਨਾ ਹੌਲੀ ਹੋਣ ਉੱਤੇ ਉਸਨੂੰ ਮੁਹੱਈਆ ਕਰਨਾ ਫਿਰ ਵੀ ਮਹਿੰਗਾ ਹੋ ਸਕਦਾ ਹੈ. ਹਰ ਪਰਤ ਦੇ ਸੁਧਾਰ ਇਕੱਠੇ ਹੋ ਕੇ ਵੱਡਾ ਲਾਭ ਦਿੰਦੇ ਹਨ. ਇਹ ਲਾਭ ਰੂਟਿੰਗ, ਅਰਥਾਤ ਬੇਨਤੀਆਂ ਕਿੱਥੇ ਭੇਜੀਆਂ ਜਾਂਦੀਆਂ ਹਨ, ਸਮਾਂ-ਨਿਰਧਾਰਨ, ਅਰਥਾਤ ਕਦੋਂ ਭੇਜੀਆਂ ਜਾਂਦੀਆਂ ਹਨ, ਕਰਨਲ, ਅਰਥਾਤ GPU ਉੱਤੇ ਚੱਲਣ ਵਾਲਾ ਸਾਫ਼ਟਵੇਅਰ, ਕੈਸ਼ਿੰਗ, ਅਰਥਾਤ ਸੰਭਾਲਿਆ ਤੇ ਮੁੜ ਵਰਤਿਆ ਕੰਮ, ਅਤੇ ਮਾਡਲ ਲਾਗੂਕਰਨ, ਅਰਥਾਤ GPU ਕੋਡ ਦੇ ਕ੍ਰਮ, ਦੇ ਅਨੁਕੂਲਨਾਂ ਤੋਂ ਮਿਲਦੇ ਹਨ. Codex ਵਿੱਚ GPT‑5.6 Sol ਨੇ ਇਨ੍ਹਾਂ ਸਾਰੇ ਅਨੁਕੂਲਨਾਂ ਵਿੱਚ ਅਹਿਮ ਭੂਮਿਕਾ ਨਿਭਾਈ.
ਪਹਿਲੀ ਮਹੱਤਵਪੂਰਨ ਉਦਾਹਰਨ ਲੋਡ ਸੰਤੁਲਨ ਹੈ. ਵਿਸ਼ਵ ਪੱਧਰ ਉੱਤੇ ਅਸੀਂ ਭੂਗੋਲਿਕ ਸਥਿਤੀ, ਉਪਲਬਧ ਸਮਰੱਥਾ ਅਤੇ ਐਕਸਲੇਰੇਟਰ ਦੀ ਕਿਸਮ, ਅਰਥਾਤ ਮਾਡਲ ਚਲਾਉਣ ਵਾਲੇ GPU ਜਾਂ ਵਿਸ਼ੇਸ਼ ਚਿੱਪ ਦੀ ਕਿਸਮ, ਵਰਗੇ ਕਾਰਕਾਂ ਮੁਤਾਬਕ ਬੇਨਤੀਆਂ ਭੇਜਦੇ ਹਾਂ. ਇੱਕ ਕਲੱਸਟਰ ਅੰਦਰ ਅਸੀਂ ਲੋਡ, ਸੰਦਰਭ ਦੀ ਲੰਬਾਈ, ਕੈਸ਼ ਦੀ ਉਪਲਬਧਤਾ ਅਤੇ ਬੇਨਤੀ ਦੀਆਂ ਹੋਰ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਦੇ ਆਧਾਰ ਉੱਤੇ ਕੰਮ ਨੂੰ ਮਾਡਲ ਇੰਸਟੈਂਸਾਂ ਵਿੱਚ ਵੰਡਦੇ ਹਾਂ. ਫਿਰ ਹਰੇਕ ਇੰਸਟੈਂਸ ਅੰਦਰ ਕੰਮ ਨੂੰ ਐਕਸਲੇਰੇਟਰਾਂ, ਮਾਡਲ ਦੇ ਉਪ-ਨੈੱਟਵਰਕਾਂ ਅਤੇ ਕੰਪਿਊਟਿੰਗ ਕੋਰਾਂ ਵਿੱਚ ਕੁਸ਼ਲਤਾ ਨਾਲ ਵੰਡਣਾ ਲਾਜ਼ਮੀ ਹੈ. Codex ਵਿੱਚ GPT‑5.6 Sol ਉਤਪਾਦਨ ਟ੍ਰੈਫ਼ਿਕ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਨ, ਪਹਿਲਾਂ ਅਣਗੌਲੇ ਰਹੇ ਅਸੰਤੁਲਨ ਦੇ ਸਰੋਤ ਪਛਾਣਨ, ਨਵੀਆਂ ਰੂਟਿੰਗ ਰਣਨੀਤੀਆਂ ਦੀ ਜਾਂਚ ਕਰਨ ਅਤੇ ਇਨ੍ਹਾਂ ਅਨੁਭਵ-ਅਧਾਰਿਤ ਨਿਯਮਾਂ ਨੂੰ ਲਗਾਤਾਰ ਸੁਧਾਰਨ ਵਿੱਚ ਸਾਡੀ ਮਦਦ ਕਰਦਾ ਹੈ. ਇਕੱਲੇ ਇਨ੍ਹਾਂ ਲੋਡ ਸੰਤੁਲਨ ਸੁਧਾਰਾਂ ਨੇ ਹੀ ਸਾਡੇ ਮਾਡਲ ਮੁਹੱਈਆ ਕਰਨ ਦੀ ਲਾਗਤ ਬਹੁਤ ਘਟਾ ਦਿੱਤੀ.
ਅਸੀਂ ਮਾਡਲ ਦੇ ਫ਼ਾਰਵਰਡ ਪਾਸ, ਅਰਥਾਤ ਇਨਪੁੱਟਾਂ ਨੂੰ ਅਗਲੇ ਟੋਕਨ ਦੀਆਂ ਭਵਿੱਖਬਾਣੀਆਂ ਵਿੱਚ ਬਦਲਣ ਵਾਲੀ ਗਣਨਾ, ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਉਣ ਲਈ ਵੀ GPT‑5.6 Sol ਵਰਤਿਆ. ਵੱਖ-ਵੱਖ ਕਾਰਵਾਈਆਂ ਤੇਜ਼ ਹੋਣ ਦੇ ਬਾਵਜੂਦ, ਵਾਧੂ ਮੈਮੋਰੀ ਆਵਾਜਾਈ, ਸਮਕਾਲੀਕਰਨ ਅਤੇ ਅਕੁਸ਼ਲ ਡਾਟਾ ਬਣਤਰਾਂ GPU ਨੂੰ ਵਿਹਲਾ ਛੱਡ ਸਕਦੀਆਂ ਹਨ. ਇਸ ਤੋਂ ਬਚਣ ਲਈ GPT‑5.6 Sol ਨੇ ਉਹ ਕੰਮ ਲੱਭਿਆ ਜਿਸਦੀ ਪਹਿਲਾਂ ਗਣਨਾ ਕੀਤੀ ਜਾ ਸਕਦੀ ਸੀ, ਜਿਸ ਤੋਂ ਬਚਿਆ ਜਾ ਸਕਦਾ ਸੀ ਜਾਂ ਜਿਸਨੂੰ ਸਮਾਂਤਰ ਚਲਾਇਆ ਜਾ ਸਕਦਾ ਸੀ. Codex ਨਾਲ GPT‑5.6 Sol ਨੇ ਸਾਡੇ ਉਤਪਾਦਨ ਕਰਨਲਾਂ ਨੂੰ ਖ਼ੁਦਮੁਖ਼ਤਿਆਰ ਢੰਗ ਨਾਲ ਮੁੜ ਲਿਖਿਆ ਅਤੇ ਅਨੁਕੂਲ ਬਣਾਇਆ. ਇਹ ਉਹ ਮੁੱਖ ਕੋਡ ਹੈ ਜੋ ਮਾਡਲ ਬਣਾਉਣ ਵਾਲੀਆਂ ਗਣਿਤਕ ਕਾਰਵਾਈਆਂ ਚਲਾਉਂਦਾ ਹੈ. ਇਹ ਕੁਝ ਹੱਦ ਤੱਕ ਇਸ ਲਈ ਸੰਭਵ ਹੋਇਆ ਕਿਉਂਕਿ ਅਸੀਂ GPT‑5.6 ਨੂੰ OpenAI ਵੱਲੋਂ ਸੰਭਾਲੀਆਂ ਜਾਂਦੀਆਂ ਦੋ ਖੁੱਲ੍ਹੇ ਸਰੋਤ ਵਾਲੀਆਂ GPU ਪ੍ਰੋਗਰਾਮਿੰਗ ਭਾਸ਼ਾਵਾਂ Triton(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ Gluon(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਕਰਨਲ ਲਿਖਣ ਅਤੇ ਸੁਧਾਰਨ ਲਈ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਣਨ ਦੀ ਸਿਖਲਾਈ ਦਿੱਤੀ ਹੈ. GPT‑5.6 Sol ਦੇ ਵਿਆਪਕ ਕਰਨਲ ਸੁਧਾਰਾਂ ਨਾਲ ਮਿਲ ਕੇ ਇਨ੍ਹਾਂ ਯਤਨਾਂ ਨੇ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਸੇਵਾ ਮੁਹੱਈਆ ਕਰਨ ਦੀ ਲਾਗਤ 20% ਘਟਾ ਦਿੱਤੀ. ਅਸੀਂ GPT‑5.6 Sol ਵੱਲੋਂ ਲਿਖੇ ਕਰਨਲਾਂ ਦੀ ਸ਼ੁੱਧਤਾ ਪ੍ਰਮਾਣਿਤ ਕਰਨ ਵਿੱਚ ਮਦਦ ਲਈ ਖੁੱਲ੍ਹੇ ਸਰੋਤ ਵਾਲੇ ਟੂਲ FpSan(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ), ਅਰਥਾਤ ਫ਼ਲੋਟਿੰਗ-ਪੌਇੰਟ ਸੈਨਿਟਾਈਜ਼ਰ, ਵਰਗੇ ਪੁਸ਼ਟੀਕਰਨ ਟੂਲਾਂ ਵਿੱਚ ਵੀ ਭਾਰੀ ਨਿਵੇਸ਼ ਕੀਤਾ ਹੈ.
ਅੰਦਾਜ਼ਨ ਡੀਕੋਡਿੰਗ ਗਤੀ ਅਤੇ ਕੁਸ਼ਲਤਾ ਸੁਧਾਰਨ ਦਾ ਇੱਕ ਹੋਰ ਸਾਧਨ ਹੈ. ਇਸ ਤਕਨੀਕ ਵਿੱਚ ਮੁੱਖ ਮਾਡਲ ਦੇ ਨਾਲ ਇੱਕ ਛੋਟਾ ਖਰੜਾ (ਜਾਂ “ਅੰਦਾਜ਼ਾਕਾਰ”) ਮਾਡਲ ਚਲਾਇਆ ਜਾਂਦਾ ਹੈ, ਜੋ ਮੁੱਖ ਮਾਡਲ ਵੱਲੋਂ ਸਮਾਂਤਰ ਪੁਸ਼ਟੀ ਲਈ ਕਈ ਟੋਕਨ ਪ੍ਰਸਤਾਵਿਤ ਕਰਦਾ ਹੈ. ਜਦੋਂ ਉਹ ਪ੍ਰਸਤਾਵ ਮਨਜ਼ੂਰ ਹੋ ਜਾਂਦੇ ਹਨ, ਤਾਂ ਸਿਸਟਮ ਮੁੱਖ ਮਾਡਲ ਦੇ ਇੱਕੋ ਪਾਸ ਤੋਂ ਕਈ ਆਉਟਪੁੱਟ ਟੋਕਨ ਬਣਾ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮਹਿੰਗੀ ਲੜੀਵਾਰ ਗਣਨਾ ਘਟ ਜਾਂਦੀ ਹੈ. GPT‑5.6 Sol ਨੇ ਆਪਣੇ ਢਾਂਚੇ ਉੱਤੇ ਸੈਂਕੜੇ ਪ੍ਰਯੋਗ ਤਿਆਰ ਕਰਕੇ ਅਤੇ ਚਲਾ ਕੇ, ਅਤੇ ਆਕਾਰ, ਬਣਤਰ ਤੇ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਵਿੱਚ ਤਬਦੀਲੀਆਂ ਦੀ ਜਾਂਚ ਕਰਕੇ ਆਪਣੇ ਖਰੜਾ ਮਾਡਲ ਨੂੰ ਸੁਧਾਰਿਆ. ਇਸ ਤੋਂ ਇਲਾਵਾ, GPT‑5.6 Sol ਨੇ ਅੰਦਾਜ਼ਾਕਾਰ ਦੀ ਸਿਖਲਾਈ ਪ੍ਰਕਿਰਿਆ ਸ਼ੁਰੂ ਕੀਤੀ ਅਤੇ ਉਸਦੀ ਨਿਗਰਾਨੀ ਕੀਤੀ. ਹਾਰਡਵੇਅਰ ਨਾਕਾਮੀਆਂ ਅਤੇ ਸਿਖਲਾਈ ਦੀ ਅਸਥਿਰਤਾ ਸਮੇਤ ਸਮੱਸਿਆਵਾਂ ਆਉਣ ਉੱਤੇ ਇਸਨੇ ਖ਼ੁਦਮੁਖ਼ਤਿਆਰ ਢੰਗ ਨਾਲ ਦਖ਼ਲ ਦਿੱਤਾ. ਇਨ੍ਹਾਂ ਸੁਧਾਰਾਂ ਨੇ ਟੋਕਨ ਬਣਾਉਣ ਦੀ ਕੁਸ਼ਲਤਾ 15% ਤੋਂ ਵੱਧ ਵਧਾ ਦਿੱਤੀ.
ਕੈਸ਼ ਨਾ ਕੀਤੇ ਇਨਪੁੱਟ ਟੋਕਨਾਂ ਦੀ ਪ੍ਰਕਿਰਿਆ ਵੇਲੇ ਮਾਡਲ ਇੱਕ ਗਣਨਾ-ਭਰਪੂਰ ਪਾਸ ਵਿੱਚ ਕੀ-ਵੈਲਿਊ ਕੈਸ਼ ਬਣਾਉਂਦਾ ਹੈ. ਆਉਟਪੁੱਟ ਬਣਾਉਂਦੇ ਸਮੇਂ ਇਹ ਉਸ ਕੈਸ਼ ਨੂੰ ਵਾਰ-ਵਾਰ ਪੜ੍ਹਦਾ ਅਤੇ ਵਧਾਉਂਦਾ ਹੈ. ਸੇਵਾ ਮੁਹੱਈਆ ਕਰਨ ਲਈ ਸਰਵੋਤਮ ਸੰਰਚਨਾ, ਜਿਵੇਂ ਬੈਚਿੰਗ, ਸ਼ਾਰਡਿੰਗ ਅਤੇ KV ਪ੍ਰਬੰਧਨ, ਕੰਮ ਦੇ ਬੋਝ ਉੱਤੇ ਬਹੁਤ ਨਿਰਭਰ ਕਰਦੀ ਹੈ, ਜਿਸ ਵਿੱਚ ਪ੍ਰੌਂਪਟ ਅਤੇ ਆਉਟਪੁੱਟ ਦੀ ਲੰਬਾਈ, ਬੈਚ ਆਕਾਰ, ਕੈਸ਼ ਹਿੱਟ ਦਰ, ਪੁੱਛਗਿੱਛ ਦੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਆਦਿ ਸ਼ਾਮਲ ਹਨ. ਪਰ ਪਹਿਲਾਂ ਸੰਰਚਨਾਵਾਂ ਦੀ ਸੰਭਾਵੀ ਰੇਂਜ ਵਿਵਸਥਿਤ ਢੰਗ ਨਾਲ ਅਨੁਕੂਲ ਕਰਨ ਲਈ ਬਹੁਤ ਵੱਡੀ ਸੀ, ਇਸ ਲਈ ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਵਿਆਪਕ ਅਨੁਭਵ-ਅਧਾਰਿਤ ਨਿਯਮਾਂ ਉੱਤੇ ਨਿਰਭਰ ਰਹਿਣਾ ਪੈਂਦਾ ਸੀ. Codex ਵਿੱਚ GPT‑5.6 Sol ਨਾਲ ਅਸੀਂ ਉਤਪਾਦਨ ਦੇ ਕੰਮ-ਬੋਝਾਂ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ, ਸੰਭਾਵੀ ਸੰਰਚਨਾਵਾਂ ਬਣਾਉਣ ਤੇ ਮੁਲਾਂਕਣ ਕਰਨ ਅਤੇ ਹਰ ਸਥਿਤੀ ਲਈ ਇੰਜਣ ਤੇ ਮਾਡਲ ਦੀ ਸੰਰਚਨਾ ਨੂੰ ਬਹੁਤ ਬਾਰੀਕੀ ਨਾਲ ਅਨੁਕੂਲ ਬਣਾਉਣ ਦੇ ਯੋਗ ਹੋਏ. ਇਸ ਨਾਲ ਕੰਮ-ਬੋਝ ਮੁਤਾਬਕ ਅਨੁਕੂਲਨ ਦਾ ਨਵਾਂ ਪੱਧਰ ਵਿਹਾਰਕ ਬਣਦਾ ਹੈ ਅਤੇ ਉਸੇ ਹਾਰਡਵੇਅਰ ਤੋਂ ਹੋਰ ਲਾਭਦਾਇਕ ਇਨਫ਼ਰੈਂਸ ਮਿਲਦਾ ਹੈ.
ਇਨਫ਼ਰੈਂਸ ਅਨੁਕੂਲਨ ਇੱਕ ਨਿਰੰਤਰ ਪ੍ਰਤੀਕਿਰਿਆ ਚੱਕਰ ਹੈ. ਅਸੀਂ ਉਤਪਾਦਨ ਦੇ ਵਿਹਾਰ ਨੂੰ ਮਾਪਦੇ ਹਾਂ, ਸਭ ਤੋਂ ਵੱਡੀਆਂ ਕਮੀਆਂ ਪਛਾਣਦੇ ਹਾਂ, ਤਬਦੀਲੀਆਂ ਲਾਗੂ ਕਰਦੇ ਹਾਂ ਅਤੇ ਪੁਸ਼ਟੀ ਕਰਦੇ ਹਾਂ ਕਿ ਉਹ ਕਿਸੇ ਇਕੱਲੇ ਮਾਪਦੰਡ ਦੀ ਬਜਾਏ ਪੂਰੇ ਸਿਸਟਮ ਨੂੰ ਸੁਧਾਰਦੀਆਂ ਹਨ. GPT‑5.6 Sol ਅਤੇ Codex ਉਸ ਚੱਕਰ ਦੇ ਹਰ ਹਿੱਸੇ ਨੂੰ ਤੇਜ਼ ਕਰਦੇ ਹਨ. ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਸਾਡੀ ਟੀਮ ਹੋਰ ਵਿਚਾਰਾਂ ਦੀ ਪੜਚੋਲ ਕਰ ਸਕਦੀ ਹੈ, ਬਦਲਦੇ ਕੰਮ-ਬੋਝਾਂ ਲਈ ਤੇਜ਼ੀ ਨਾਲ ਪ੍ਰਤੀਕਿਰਿਆ ਦੇ ਸਕਦੀ ਹੈ ਅਤੇ ਵਰਤੋਂਕਾਰਾਂ ਵਾਸਤੇ ਘੱਟ ਦੇਰੀ, ਵੱਧ ਸਮਰੱਥਾ ਤੇ ਘੱਟ ਲਾਗਤ ਵਾਲਾ ਇਨਫ਼ਰੈਂਸ ਤਕਨੀਕੀ ਢਾਂਚਾ ਬਣਾ ਸਕਦੀ ਹੈ.
ChatGPT ਵਰਕ ਅਤੇ Codex ਮਾਡਲ ਬੇਨਤੀਆਂ ਅਤੇ ਟੂਲ ਕਾਲਾਂ ਦੀ ਲੜੀ ਰਾਹੀਂ ਗੁੰਝਲਦਾਰ ਕੰਮ ਪੂਰੇ ਕਰਦੇ ਹਨ. ਵਰਤੋਂਕਾਰ ਦੀ ਬੇਨਤੀ ਤੋਂ ਅੰਤਿਮ ਜਵਾਬ ਤੱਕ ਇੱਕੋ ਵਾਰੀ ਵਿੱਚ, Codex ਸਰੋਤ ਕੋਡ ਦੀ ਜਾਂਚ, ਡਿਪਲੌਇਮੈਂਟ ਇਤਿਹਾਸ ਦੀ ਖੋਜ, ਘਟਨਾ ਰਿਪੋਰਟਾਂ ਨੂੰ ਪੜ੍ਹਨ, ਫ਼ਾਈਲ ਵਿੱਚ ਸੋਧ ਅਤੇ ਟੈਸਟ ਚਲਾਉਣ ਵਰਗੇ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ. ਹਰੇਕ ਪੜਾਅ ਲਈ ਇੱਕ ਬੇਨਤੀ ਦੀ ਲੋੜ ਪੈ ਸਕਦੀ ਹੈ.
ਸੰਦਰਭ ਤਿਆਰ ਕਰਨ, ਡਾਟਾ ਭੇਜਣ, ਇਨਫ਼ਰੈਂਸ ਚਲਾਉਣ, ਟੂਲ ਕਾਲ ਕਰਨ ਅਤੇ ਪ੍ਰਕਿਰਿਆਵਾਂ ਸ਼ੁਰੂ ਕਰਨ ਵਿੱਚ ਸਮਾਂ ਅਤੇ ਕੰਪਿਊਟਿੰਗ ਸਮਰੱਥਾ ਲੱਗਦੀ ਹੈ. ਜੇ ਕਿਸੇ ਕੰਮ ਲਈ 30 ਮਾਡਲ ਬੇਨਤੀਆਂ ਚਾਹੀਦੀਆਂ ਹੋਣ, ਤਾਂ ਹਰ ਬੇਨਤੀ ਦਾ ਇੱਕ ਵਾਧੂ ਸਕਿੰਟ ਇਕੱਠਾ ਹੋ ਕੇ ਕਾਫ਼ੀ ਸਮਾਂ ਬਣ ਜਾਂਦਾ ਹੈ. ਸਮੁੱਚੀ ਕਾਰਗੁਜ਼ਾਰੀ ਸੁਧਾਰਨ ਦਾ ਮਤਲਬ ਪੂਰੇ ਸਿਸਟਮ ਵਿੱਚ ਦੁਹਰਾਇਆ ਕੰਮ ਘਟਾਉਣਾ ਹੈ, ਨਾ ਕਿ ਸਿਰਫ਼ ਮਾਡਲ ਨੂੰ ਤੇਜ਼ ਕਰਨਾ.
ਵਰਤੋਂਕਾਰ ਦੀ ਇੱਕ ਵਾਰੀ ਵਿੱਚ ਕਈ ਮਾਡਲ ਅਤੇ ਟੂਲ ਦੁਹਰਾਅ ਹੋ ਸਕਦੇ ਹਨ. ਦੁਹਰਾਏ ਜਾਣ ਵਾਲੇ ਹਿੱਸੇ ਅੰਦਰਲਾ ਕੋਈ ਵੀ ਖ਼ਰਚ ਕਈ ਵਾਰ ਹੋ ਸਕਦਾ ਹੈ.
ਇਨ੍ਹਾਂ ਗੁਣਕਾਂ ਨੇ ਸਾਡੇ ਏਜੰਟ-ਅਧਾਰਿਤ ਜਾਂਚ-ਢਾਂਚੇ ਦੇ ਡਿਜ਼ਾਈਨ ਨੂੰ ਸੇਧ ਦਿੱਤੀ ਹੈ. ਇਹ Rust ਦੀ ਇੱਕ ਸੰਚਾਲਨ ਪਰਤ ਹੈ ਜੋ ਸਾਡੇ ਮਾਡਲਾਂ, ਟੂਲਾਂ ਅਤੇ ਵਰਤੋਂਕਾਰ ਦੇ ਵਾਤਾਵਰਨ ਨੂੰ ਜੋੜਦੀ ਹੈ. ਅੱਗੇ ਅਸੀਂ ਦੱਸਾਂਗੇ ਕਿ ਸੰਦਰਭ ਦੇ ਬੇਲੋੜੇ ਫੈਲਾਅ ਤੋਂ ਬਚਣ, ਟੂਲ ਲੋਡ ਕਰਨ ਅਤੇ ਕੰਮ ਦੀ ਮੁੜ ਵਰਤੋਂ ਨਾਲ ਹਰ ਬੇਨਤੀ ਕਿਵੇਂ ਵਧੇਰੇ ਕੁਸ਼ਲ ਬਣਦੀ ਹੈ.
ਜਿਵੇਂ-ਜਿਵੇਂ ਏਜੰਟਾਂ ਨੂੰ ਹੋਰ ਟੂਲਾਂ, ਹੁਨਰਾਂ, ਪਲੱਗਇਨਾਂ ਅਤੇ ਗੱਲਬਾਤ ਦੇ ਇਤਿਹਾਸ ਤੱਕ ਪਹੁੰਚ ਮਿਲਦੀ ਹੈ, ਸੰਦਰਭ ਸੀਮਾਵਾਂ ਆਸਾਨੀ ਨਾਲ ਵਧ ਸਕਦੀਆਂ ਹਨ. ਇਸ ਨਾਲ ਲਾਗਤ ਵਧਦੀ ਹੈ, ਮਾਡਲ ਦਾ ਧਿਆਨ ਭਟਕਦਾ ਹੈ ਅਤੇ ਬੇਲੋੜੀ ਰੀਜ਼ਨਿੰਗ ਸ਼ੁਰੂ ਹੁੰਦੀ ਹੈ. ਜਾਂਚ-ਢਾਂਚਾ ਲੋੜ ਪੈਣ ਤੱਕ ਖੋਜ ਟਾਲ ਕੇ ਇਹ ਵਾਧੂ ਬੋਝ ਘਟਾ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਏਕੀਕਰਨ, ਵਿਉਂਤਬੱਧ MCP ਟੂਲ, ਹੁਨਰ ਅਤੇ ਪਲੱਗਇਨ ਸਿਰਫ਼ ਲੋੜ ਵੇਲੇ ਹੀ ਸਾਹਮਣੇ ਆਉਂਦੇ ਹਨ. ਜਾਂਚ-ਢਾਂਚਾ ਵੱਖ-ਵੱਖ ਟੂਲਾਂ ਅਤੇ MCP ਏਕੀਕਰਨਾਂ ਨੂੰ ਅਚਾਨਕ ਸੰਦਰਭ ਸੀਮਾ ਵਰਤਣ ਤੋਂ ਵੀ ਰੋਕਦਾ ਹੈ. ਮਾਡਲ ਵੱਲੋਂ ਵੱਖਰੀ ਸੀਮਾ ਮੰਗੇ ਜਾਣ ਤੋਂ ਇਲਾਵਾ, ਟੂਲ ਆਉਟਪੁੱਟ ਮੂਲ ਰੂਪ ਵਿੱਚ ਵੱਧ ਤੋਂ ਵੱਧ 10,000 ਟੋਕਨਾਂ ਤੱਕ ਸੀਮਿਤ ਹੁੰਦੀ ਹੈ.
ਜਿਵੇਂ ਪਹਿਲਾਂ ਦੱਸਿਆ ਗਿਆ ਹੈ, ਇੱਕ ਏਜੰਟ ਲੂਪ ਇੱਕੋ ਵਾਰੀ ਅੰਦਰ ਉਹੀ ਹਦਾਇਤਾਂ, ਗੱਲਬਾਤ ਦਾ ਇਤਿਹਾਸ, ਟੂਲ ਪਰਿਭਾਸ਼ਾਵਾਂ ਅਤੇ ਪਿਛਲੇ ਨਤੀਜੇ ਕਈ ਵਾਰ GPU ਨੂੰ ਭੇਜ ਸਕਦਾ ਹੈ. ਇਨ੍ਹਾਂ ਦੁਹਰਾਏ ਇਨਪੁੱਟਾਂ ਦੀ ਪ੍ਰਕਿਰਿਆ ਮਹਿੰਗੀ ਹੈ, ਇਸ ਲਈ ਪ੍ਰੌਂਪਟ ਕੈਸ਼ਿੰਗ ਪਹਿਲਾਂ ਪ੍ਰਕਿਰਿਆ ਕੀਤੇ ਪ੍ਰੌਂਪਟ ਅਗੇਤਰ ਨਾਲ ਸੰਬੰਧਿਤ ਗਣਨਾ ਨੂੰ ਮੁੜ ਵਰਤਦੀ ਹੈ. ਉਸ ਅਗੇਤਰ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਣ ਲਈ, ਜਾਂਚ-ਢਾਂਚਾ ਮਾਡਲ ਨੂੰ ਦਿਸਦੇ ਸਾਰੇ ਇਤਿਹਾਸ ਨੂੰ ਸਿਰਫ਼ ਅੰਤ ਵਿੱਚ ਜੋੜਨ ਯੋਗ ਮੰਨਦਾ ਹੈ: ਨਵੇਂ ਸੁਨੇਹੇ, ਟੂਲ ਨਤੀਜੇ ਅਤੇ ਵਾਤਾਵਰਨ ਅੱਪਡੇਟ ਪਹਿਲੇ ਸੰਦਰਭ ਵਿੱਚ ਪਾਉਣ ਦੀ ਬਜਾਏ ਅੰਤ ਵਿੱਚ ਜੋੜੇ ਜਾਂਦੇ ਹਨ. ਟੂਲ ਵੀ ਨਿਰਧਾਰਤ ਕ੍ਰਮ ਵਿੱਚ ਪੇਸ਼ ਕੀਤੇ ਜਾਂਦੇ ਹਨ, ਜਦਕਿ ਮਨਜ਼ੂਰੀ ਨੀਤੀਆਂ ਵਰਗੀਆਂ ਰਨਟਾਈਮ ਸੈਟਿੰਗਾਂ ਨੂੰ ਟੂਲ ਪਰਿਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਕਰਨ ਦੀ ਬਜਾਏ ਚਲਾਉਣ ਵੇਲੇ ਲਾਗੂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ. ਇਹ ਡਿਜ਼ਾਈਨ ਚੋਣ Codex ਅਤੇ ChatGPT ਵਰਕ ਦੀਆਂ ਸਮੁੱਚੀਆਂ ਉੱਚ ਪ੍ਰੌਂਪਟ-ਕੈਸ਼ ਹਿੱਟ ਦਰਾਂ ਵਿੱਚ ਯੋਗਦਾਨ ਪਾਉਂਦੀ ਹੈ.
ਵਾਧੇਵਾਰ ਟ੍ਰਾਂਸਪੋਰਟ ਬਦਲਦਾ ਹੈ ਕਿ ਨੈੱਟਵਰਕ ਰਾਹੀਂ ਕੀ ਲੰਘਦਾ ਹੈ, ਜਦਕਿ ਪ੍ਰੌਂਪਟ ਕੈਸ਼ਿੰਗ ਬਦਲਦੀ ਹੈ ਕਿ ਮਾਡਲ ਕਿਸ ਚੀਜ਼ ਦੀ ਮੁੜ ਗਣਨਾ ਤੋਂ ਬਚ ਸਕਦਾ ਹੈ. ਚੌੜਾਈਆਂ ਸੰਕਲਪਕ ਹਨ ਅਤੇ ਵਾਧੂ ਕੰਪ੍ਰੈਸ਼ਨ ਪਰਤ ਨਹੀਂ ਦਿਖਾਈ ਗਈ.
GPT‑5.6 ਨਾਲ ਹਾਸਲ ਕੀਤੇ ਸਾਡੇ ਕੁਸ਼ਲਤਾ ਲਾਭ ਖੋਜ, ਇਨਫ਼ਰੈਂਸ ਅਤੇ ਸਾਡੇ ਏਜੰਟ-ਅਧਾਰਿਤ ਜਾਂਚ-ਢਾਂਚੇ ਸਮੇਤ ਪੂਰੇ ਤਕਨੀਕੀ ਢਾਂਚੇ ਵਿੱਚ ਸਾਲਾਂ ਤੋਂ ਜੁੜਦੇ ਆ ਰਹੇ ਸੁਧਾਰਾਂ ਦਾ ਨਤੀਜਾ ਹਨ. ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਕਈ ਸੁਧਾਰ ਲਾਗੂ ਕਰਨ ਵਿੱਚ GPT‑5.6 ਦੀ ਭੂਮਿਕਾ ਸਾਨੂੰ ਆਸ਼ਾਵਾਨ ਬਣਾਉਂਦੀ ਹੈ ਕਿ ਅਨੁਕੂਲਨਾਂ ਦੀ ਰਫ਼ਤਾਰ ਹੋਰ ਤੇਜ਼ ਹੋਵੇਗੀ. ਅਸੀਂ ਆਪਣੇ ਤਕਨੀਕੀ ਢਾਂਚੇ ਵਿੱਚ ਬੁਨਿਆਦੀ ਸੁਧਾਰਾਂ ਦੇ ਨਾਲ-ਨਾਲ ਕਰਨਲ ਅਨੁਕੂਲਨ ਵਰਗੇ ਖੇਤਰਾਂ ਵਿੱਚ ਹੋਰ ਵੱਡੇ ਅਨੁਕੂਲਨ ਕਰਦੇ ਰਹਾਂਗੇ. ਅਸੀਂ ਇਹ ਜਾਰੀ ਅੰਦਰੂਨੀ ਸੁਧਾਰ ਵਧੇਰੇ ਵਿਆਪਕ ਤੌਰ ਉੱਤੇ ਉਪਲਬਧ ਅਤੇ ਲਾਗਤ-ਕੁਸ਼ਲ ਬੁੱਧੀਮੱਤਾ ਦੇ ਰੂਪ ਵਿੱਚ ਆਪਣੇ ਵਰਤੋਂਕਾਰਾਂ ਅਤੇ ਗਾਹਕਾਂ ਤੱਕ ਪਹੁੰਚਾਉਣ ਲਈ ਉਤਸੁਕ ਹਾਂ.
ਇਸ ਪੋਸਟ ਵਿੱਚ ਯੋਗਦਾਨ ਲਈ ਤਕਨੀਕੀ ਸਟਾਫ਼ ਦੇ ਮੈਂਬਰ ਮੈਥਿਊ ਫ਼ੇਰਾਰੀ, ਫ਼ਿਲਿਪ ਟਿਲੇਟ, ਅਹਿਮਦ ਇਬਰਾਹਿਮ, ਜੋ ਗਰਸ਼ੈਨਸਨ ਅਤੇ ਸਟੀਵ ਕੌਫ਼ੀ ਦਾ ਵਿਸ਼ੇਸ਼ ਧੰਨਵਾਦ.


