આસાના: GPT‑6.1 Solથી બ્રાઉઝર પરીક્ષણમાં મોડલનો ખર્ચ 1/76 થયો
ગ્રાહકોને વધુ સક્ષમ મોડલ આપવા આસાનાએ Codexમાં GPT‑6 Astra વડે પરીક્ષણોમાં પોતાના બ્રાઉઝર એજન્ટનો ખર્ચ 1/76 કર્યો અને તેને 5 ગણો ઝડપી બનાવ્યો.

76 ગણું
GPT-6.1 Solની સુધારેલી કાર્યપ્રણાલી સાથે ઓછો અંદાજિત મોડલ ખર્ચ
5 ગણું
GPT-6.1 Solની સુધારેલી કાર્યપ્રણાલી સાથે વધુ ઝડપી બ્રાઉઝર અમલ
$0.47
GPT-6.1 Solની સુધારેલી કાર્યપ્રણાલી સાથે સરેરાશ અંદાજિત મોડલ ખર્ચ
Codexમાં GPT‑6 Astra વડે પ્રયોગો કરીને આસાનાએ GPT‑6.1 Sol પર પોતાના બ્રાઉઝર એજન્ટની કાર્યપ્રણાલીમાં સુધારા કર્યા. તેનાથી ખર્ચ અગાઉનો 1/76 થયો અને અમલ 5 ગણો ઝડપી બન્યો.
આસાનાએ અધિગ્રહણ કરેલા(નવી વિન્ડોમાં ખૂલે છે) સ્ટૅકએઆઇ(નવી વિન્ડોમાં ખૂલે છે) મંચ દ્વારા તે ગ્રાહકોને વિવિધ વ્યાવસાયિક એપ્લિકેશનોમાં કામનું સ્વચાલન કરવામાં મદદ કરે છે. સ્ટૅકએઆઇ વડે ગ્રાહકો કોડ લખ્યા વિના એવી કાર્યપ્રણાલીઓ બનાવી શકે છે જે વેબસાઇટોની મુલાકાત લે, ફોર્મ ભરે અને માહિતી એકત્રિત કરે. આસાના જેવા મોટા પાયે કામ કરતી સંસ્થામાં આ કાર્યપ્રણાલીની નાની અમલ-ક્ષમતાની ઊણપો પણ એકઠી થઈને મોટી અસર કરે છે.
આસાનામાં સ્ટૅકએઆઇના મુખ્ય ટેક્નોલોજી અધિકારી ફ્રાન્ક હિદાલ્ગો, પી.એચ.ડી.,એ બ્રાઉઝર એજન્ટનો અમલ વધુ ઝડપી અને ઓછા ખર્ચાળ બનાવવાનું નક્કી કર્યું. તેમણે Codexમાં GPT‑6 Astraને એજન્ટની તપાસ કરવા, સુધારા અજમાવવા અને પરિણામોની સરખામણી કરવા સૂચના આપી. તેમના અંદાજ મુજબ જાતે કરતાં એકથી બે મહિના લાગે એવું કામ લગભગ એક અઠવાડિયામાં પૂરું થયું.
આસાનાના 144 અમલવાળા અભ્યાસમાં(નવી વિન્ડોમાં ખૂલે છે) GPT‑6.1 Sol અને અન્ય ત્રણ અત્યાધુનિક મોડલનું પરીક્ષણ થયું, જેને અહીં મોડલ A, B અને C કહ્યાં છે. આ સુધારાથી તૈયાર થયેલી GPT‑6.1 Solની કાર્યપ્રણાલીમાં દરેક અમલ દીઠ સરેરાશ અંદાજિત મોડલ ખર્ચ $0.47 અને સમય લગભગ ચાર મિનિટ હતો. આ ખર્ચ મોડલ Bની મૂળ સજીવ ગોઠવણના ખર્ચનો 1/76 હતો અને અમલ 5 ગણો ઝડપી હતો.
“માણસો અને એજન્ટોની ટીમો વ્યવહારમાં આ રીતે કામ કરે છે. એક ઇન્જિનિયરે દિશા નક્કી કરી, GPT-6 Astraએ પ્રયોગો કર્યા અને પરિણામો કમાન્ડ દ્વારા સજીવ સિસ્ટમમાં લાગુ થયાં. આ દર્શાવે છે કે આસાના માણસો અને એજન્ટોની ટીમોનો વિચાર કેવી રીતે સાકાર કરે છે.”
ઝડપથી આગળ વધવા માટે હિદાલ્ગોએ સૌપ્રથમ Codexમાં GPT‑6 Astra વડે કોડસંગ્રહની રચના સમજવાનો અને એજન્ટ મોડલને મોકલવાની દરેક વિનંતી કેવી રીતે બનાવે છે તે જાણવાનો પ્રયાસ કર્યો. GPT‑6 Astraએ શોધ્યું કે એજન્ટ તેની નિશ્ચિત સૂચનાઓ અને સાધનોની વ્યાખ્યાઓ કેશમાં સંગ્રહતો હતો, પરંતુ તે એકત્રિત કરતો હતો તે પાનાંના લખાણ અને સ્ક્રીનશોટનો વધતો ઇતિહાસ નહીં. તેથી દરેક વિનંતીમાં આ ઇતિહાસ ફરી મોકલવા માટે પૂરો ખર્ચ લાગતો હતો.
એજન્ટ લગભગ દરેક પગલે જૂના સ્ક્રીનશોટ દૂર કરતો હતો અને લખાણ ટૂંકાવતો હતો. દરેક ફેરફારથી ઇતિહાસ બદલાતો હતો, તેથી માત્ર ઇતિહાસને કેશમાં સંગ્રહવાથી ફાયદો થયો ન હોત. ઉપરાંત આ હકીકતો ગુમાવવાથી એજન્ટને અગાઉ વાંચેલાં પાનાંની ફરી મુલાકાત લેવી પડી શકે.
હિદાલ્ગોએ GPT‑6 Astraના સૂચવેલા સુધારાની સમીક્ષા કરી અને પરીક્ષણ માટે ત્રણ પસંદ કર્યા:
એજન્ટના બ્રાઉઝિંગ ઇતિહાસને પણ કેશમાં સંગ્રહવો
તે જાળવી શકે તે લખાણનું પ્રમાણ વધારવું
દરેક પગલે નહીં પણ ઝુંડમાં સ્ક્રીનશોટ દૂર કરવા
કયાં પરિબળો અસર કરે છે તે જાણવા GPT‑6 Astraએ ઝડપી પરીક્ષણો સાથે શરૂઆત કરી. કોડ નિયંત્રિત પ્રયોગો માટે બનાવેલો ન હોવાથી તેણે પછી કોડનું પુનર્ગઠન કર્યું. જેથી એક જ ફ્રન્ટએન્ડ અને બૅકએન્ડ પર અલગ-અલગ ગોઠવણ ધરાવતી ઘણી કાર્યપ્રણાલીઓ સમાંતર ચાલી શકે.
Astraએ સંપૂર્ણ અભ્યાસ કર્યો: ઇતિહાસ માટે 1,20,000 અને 4,80,000 અક્ષરની મર્યાદા અને કેશિંગ તથા સ્ક્રીનશોટની છ નીતિઓ. દરેકનું ચારમાંથી દરેક મોડલ પર ત્રણ વખત પરીક્ષણ થયું (નીચેનું કોષ્ટક જુઓ). સર્વશ્રેષ્ઠ પરિણામ આપતી નીતિમાં 20 સ્ક્રીનશોટ જમા થવા દેવાતા હતા, પછી માત્ર સૌથી છેલ્લો રાખીને બાકીના દૂર કરાતા હતા. આથી સ્ક્રીનશોટ દૂર કરવાના બે પ્રસંગો વચ્ચે અગાઉનો ઇતિહાસ વધુ લાંબા સમય સુધી બદલાતો ન હતો. ઇતિતિહાસની વધારેલી મર્યાદા સાથે આ નીતિ જોડાતાં સુધારેલી કાર્યપ્રણાલી તૈયાર થઈ. દરેક ગોઠવણે એક જ કામ કર્યું: જાહેર નમૂના-સૂચિમાંથી 32 પુસ્તકો પૈકી દરેકની છ વિગતો એકત્રિત કરવી. આ કામ આસાનાના કેટલાક ગ્રાહકો સ્ટૅકએઆઇમાં કરતા કામનું પ્રતિનિધિત્વ કરતું હતું.
મોડલ | વર્ણન | કિંમત |
|---|---|---|
મોડલ A | અન્ય અત્યાધુનિક પ્રયોગશાળાનું નાનું, ઓછા ખર્ચનું મોડલ, જે 2025ની શરદ ઋતુમાં રજૂ થયું હતું | GPT‑6.1 Solની અડધી કિંમત |
મોડલ B | મોડલ Aની જ પ્રયોગશાળાનું મોડલ, જે મૂળ સજીવ સિસ્ટમમાં વપરાતું હતું અને 2026ના ઉનાળામાં રજૂ થયું હતું | GPT‑6.1 Solજેટલી જ કિંમત |
મોડલ C | મોડલ Bનું સુધારેલું સંસ્કરણ, જે 2026ની શરદ ઋતુમાં રજૂ થયું હતું | GPT‑6.1 Solજેટલી જ કિંમત |
GPT‑6.1 Sol | OpenAIનું મોડલ |
GPT‑6 Astraએ કાર્યપ્રણાલીઓ ચલાવી અને વિનંતીઓ, વપરાશની નોંધો તથા પરિણામો તપાસ્યાં. મોડલના અલગ સત્રોમાં આ કામની સમીક્ષા થઈ. દરેક સત્રની વિનંતીઓ, ડેટાના પ્રવાહની નોંધો અને પરિણામો આસાનાના સોફ્ટવેર વિતરણ મંચ કમાન્ડ(નવી વિન્ડોમાં ખૂલે છે)માં નોંધવામાં આવ્યાં, જેથી ટીમ પછી આખા અભ્યાસની સમીક્ષા કરી શકે. કમાન્ડમાંથી આ તારણોને પહેલા કાર્ય-ટિકિટોમાં અને પછી કોડ-ફેરફાર વિનંતીઓમાં ફેરવવામાં આવ્યાં. ત્યારબાદ ફેરફારો સજીવ સિસ્ટમમાં લાગુ કરાયા.
“આ કામ જાતે કરવામાં મને એકથી બે મહિના લાગ્યા હોત. Codexમાં GPT-6 Astra સાથે લગભગ એક અઠવાડિયું લાગ્યું: હું સૂતા પહેલાં /goal નક્કી કરતો અને સવારે પરિણામોની સમીક્ષા કરતો.”
મોડલ B માટેના સુધારાથી દરેક અમલ દીઠ અંદાજિત મોડલ ખર્ચ ઓછામાં ઓછા $36.21માંથી ઘટીને $1.24 થયો, એટલે કે અગાઉનો 1/29 થયો. (કેટલાંક મૂળ અમલ પૂર્ણ થતાં પહેલાં જ પગલાંની મર્યાદાએ પહોંચી ગયાં હતાં.) GPT‑6.1 Sol પરની સુધારેલી કાર્યપ્રણાલીનો ખર્ચ વળી તેનાથી પણ 2.6 ગણો ઓછો, એટલે કે $0.47 હતો. સુધારેલી કાર્યપ્રણાલીના દરેક અમલમાં કામ પૂરું થયું અને સાચો જવાબ મળ્યો.
3 અમલની સરેરાશ. ≥: મૂળ ગોઠવણના પરિણામોમાં મર્યાદાએ અટકેલા અમલ સામેલ છે, તેથી તેની સરેરાશ નીચલી સીમા છે.
જમણી બાજુનાં બે ગુણોત્તર સુધારેલા મોડલ B સામેની સરખામણી દર્શાવે છે. મોડલ Bનો અમલ એ જ અભ્યાસના તબક્કા 1માં અને મોડલ C તથા Sol 6.1નો તબક્કા 2માં થયો હતો (ટપકાંવાળી રેખા).
જોકે માત્ર GPT‑6.1 Solના પરિણામો જોઈએ તો પણ ઇતિહાસની વધારેલી મર્યાદા સાથે નવી કેશિંગ અને સ્ક્રીનશોટ નીતિએ ખર્ચ ચોથા ભાગનો કર્યો: દરેક અમલ દીઠ $1.97માંથી $0.47. દરેક કૉલનો ખર્ચ લગભગ ત્રીજા ભાગનો થયો, કારણ કે 89% ઇનપુટ કેશમાંથી મળતું હતું અને તેનો દર કેશમાં ન હોય તેવા ઇનપુટના દરનો માત્ર 5% હતો. અમલ પણ ઝડપી બન્યો: મોડલ Bની મૂળ ગોઠવણમાં ઓછામાં ઓછી 22.5 મિનિટ લાગતી હતી, જ્યારે GPT‑6.1 Solની સુધારેલી કાર્યપ્રણાલીમાં લગભગ ચાર મિનિટ લાગી.
3 અમલની સરેરાશ, પ્રમાણિત વિચલન દર્શાવતી રેખાઓ. ≥: સરેરાશમાં મર્યાદાએ અટકેલો અથવા અધૂરા રહેલો અમલ સામેલ છે, તેથી વાસ્તવિક મૂલ્ય ઓછામાં ઓછું આટલું છે.
આલેખના સ્તંભો વાદળી રંગસંગતિમાં છે. 4,80,000ની વધારેલી મર્યાદાવાળા સ્તંભની સરખામણીમાં કેશિંગની અસરો જુઓ.
અમલનાં ચિહ્નો અને પ્રમાણિત વિચલન દર્શાવતી રેખાઓ મૂળ ચિત્ર પરથી અંદાજે ફરી બનાવેલાં છે; મૂળ અમલનાં મૂલ્યો અને પ્રમાણિત વિચલનો ઉપલબ્ધ નહોતાં.
3 અમલની સરેરાશ, પ્રમાણિત વિચલન દર્શાવતી રેખાઓ. ≥: સરેરાશમાં મર્યાદાએ અટકેલો અથવા અધૂરા રહેલો અમલ સામેલ છે, તેથી વાસ્તવિક મૂલ્ય ઓછામાં ઓછું આટલું છે.
આલેખના સ્તંભો વાદળી રંગસંગતિમાં છે. 4,80,000ની વધારેલી મર્યાદાવાળા સ્તંભની સરખામણીમાં કેશિંગની અસરો જુઓ.
અમલનાં ચિહ્નો અને પ્રમાણિત વિચલન દર્શાવતી રેખાઓ મૂળ ચિત્ર પરથી અંદાજે ફરી બનાવેલાં છે; મૂળ અમલનાં મૂલ્યો અને પ્રમાણિત વિચલનો ઉપલબ્ધ નહોતાં.
તપાસમાં એ પણ જણાયું કે એજન્ટ કોઈ જવાબ આપે કે નહીં તેના પર ઇતિહાસના વ્યવસ્થાપનની કેવી અસર પડતી હતી. GPT‑6.1 Solને બ્રાઉઝિંગ ઇતિહાસ જાળવવા વધુ જગ્યા અપાતાં જવાબ આપતા અમલની સંખ્યામાં વધારો થયો. નાની ઇતિહાસ-મર્યાદામાં 18માંથી ત્રણ અમલમાં જવાબ મળતો હતો, જ્યારે મોટી મર્યાદામાં તમામ 18 અમલમાં જવાબ મળ્યો અને દરેક જવાબ સાચો હતો. હિદાલ્ગો માટે તેનો વ્યાવસાયિક લાભ એ છે કે સંચાલનનો ખર્ચ લાંબા ગાળે પરવડે એવો રાખીને ગ્રાહકોને વધુ ઝડપી અને સક્ષમ મોડલ ઉપલબ્ધ કરી શકાય.
“આવાં કામ માટે અમે ગ્રાહકોને કયા મોડલ આપી શકીએ તેના પર પહેલાં ખર્ચની મર્યાદા હતી. એજન્ટને વધુ કાર્યક્ષમ બનાવીને અમે અમારા સંચાલનનો ખર્ચ ઘટાડવાની સાથે ગ્રાહકોને વધુ સારું અને ઝડપી મોડલ આપી શકીએ છીએ.”
આસાનાએ સ્ટૅકએઆઇમાં બ્રાઉઝર નેવિગેશનના ફેરફારો જાહેર કર્યા છે અને આવા પ્રયોગો ફરીથી કરવા સરળ બને તેવાં સાધનો વિકસાવી રહી છે. આગળ જતાં ટીમ આ પરીક્ષણને મંચના મૂલ્યાંકનોમાં સામેલ કરવાની યોજના ધરાવે છે, જેથી ગ્રાહકો અને આંતરિક ટીમો પોતાના એજન્ટની ગોઠવણ કરતી વખતે ખર્ચ, અમલનો સમય અને જવાબની ગુણવત્તાની સરખામણી કરી શકે.
“હવે સુવિધાઓ જાહેર કરવાની ઝડપ મર્યાદા નથી; માણસો આપી શકે તે ધ્યાન મર્યાદિત છે. અમે એવી દુનિયાની નજીક છીએ જ્યાં દરેક ઇન્જિનિયર એજન્ટોના કાફલાનું નેતૃત્વ કરતો ઉત્પાદન વ્યવસ્થાપક હશે.”
આસાના હવે ઉત્પાદનની સુવિધાઓ જાહેર કરતાં પહેલાં તેમનું પરીક્ષણ કરવા Codexમાં GPT‑6 Astraનો ઉપયોગ કરે છે: Astra મંચના વિવિધ ભાગોની મુલાકાત લે છે, અલગ-અલગ ઇનપુટ અજમાવે છે અને ગુણવત્તા તપાસતા માનવ સમીક્ષકો માટે ત્રુટિઓનો અહેવાલ આપે છે. હિદાલ્ગોના મતે આ નવા સોફ્ટવેર વિકાસ જીવનચક્રનો પાયો છે, જેમાં ક્લાઉડ પરના એજન્ટનાં ઘણાં સત્રો સમાંતર રીતે સુવિધાઓનું પરીક્ષણ કરે છે.
સંપૂર્ણ અભ્યાસ આસાના(નવી વિન્ડોમાં ખૂલે છે) અને સ્ટૅકએઆઇ(નવી વિન્ડોમાં ખૂલે છે)ના બ્લોગ પર ઉપલબ્ધ છે.


