GPT-6.1Sol
ஐந்தில் ஒரு பங்கு விலையில் Astra-வுக்கு நெருக்கமான நுண்ணறிவு, தொடர்ந்து அதிநவீனச் செயல்திறன்
GPT‑6 Sol-இன் மேம்பட்ட பதிப்பான GPT‑6.1 Sol-ஐ அறிமுகப்படுத்துகிறோம். இது ஏஜென்டிக் கோடிங், கணினிப் பயன்பாடு, தொழில்முறைப் பணிகள் ஆகியவற்றில் மிகச் சிறப்பான செயல்திறனை வழங்குகிறது. கடினமான பணிகளில் Sol-இன் திறனை GPT‑6 Astra-வுக்கு நெருக்கமாகக் கொண்டுவருகிறது. Astra-வின் வழக்கமான உள்ளீடு மற்றும் வெளியீட்டு டோக்கன் விலைகளில் ஐந்தில் ஒரு பங்கே செலவாவதால், அதே செலவுத்திட்டத்திற்குள் திறன்மிக்க ஏஜென்ட்களை உருவாக்கி இயக்க உருவாக்குநர்களுக்கு அதிக வாய்ப்பளிக்கிறது.
Sol விலையில் Astra-வுக்கு நெருக்கமான செயல்திறனை GPT‑6.1 Sol வழங்குகிறது. இதனால், இன்று கிடைக்கும் மாடல்களில் இந்தச் செயல்திறனுக்கு மிகக் குறைந்த செலவுடைய மாடலாக இது திகழ்கிறது. தற்காலிகச் சேமிப்பிலுள்ள உள்ளீட்டுக்கு பத்து லட்சம் டோக்கன்களுக்கு வெறும் $0.10 மட்டுமே செலவாகும். இது வழக்கமான உள்ளீட்டு விலையில் 95% தள்ளுபடி. எனவே, தொடர்ச்சியான கோரிக்கைகளில் சூழல் தகவலை மீண்டும் பயன்படுத்தும் ஏஜென்ட் பணிகளுக்குச் செலவு குறைகிறது.
ஒட்டுமொத்தமாக எங்களின் மிகத் திறன்மிக்க அதிநவீன மாடலாக GPT‑6 Astra தொடர்கிறது. பயனர்கள் அடிக்கடி செய்ய விரும்பும் முக்கியப் பணிகளுக்கும், செயலிகளைப் பெருமளவில் உருவாக்கி இயக்கும் API வாடிக்கையாளர்களுக்கும் GPT‑6.1 Sol திறன் மற்றும் செலவில் புதிய சமநிலையை வழங்குகிறது.

குறியீடு எழுதுதல், பிழைதிருத்தம் செய்தல் முதல் ஆவணங்களைப் புரிந்துகொள்ளுதல், பல படிநிலை வணிகப் பணிப்பாய்வுகளைச் செயல்படுத்துதல் வரை, சிக்கலான தொழில்முறைப் பணிகளில் GPT‑6 Sol-ஐ விட GPT‑6.1 Sol குறிப்பிடத்தக்க மேம்பாடுகளை வழங்குகிறது. இந்த மதிப்பீடுகளில் பலவற்றில், கணிசமாகக் குறைந்த செலவில் GPT‑6 Astra-வின் செயல்திறனை நெருங்குகிறது.
உண்மையான குறியீட்டுத் தொகுப்புகளில் சிக்கலான மென்பொருள் பொறியியல் பணிகளை மதிப்பிடும் DeepSWE v1.1 இல், GPT‑6 Astra-வுக்கு இணையான செயல்திறனை ஏறத்தாழ ஐந்தில் ஒரு பங்கு செலவில் GPT‑6.1 Sol வழங்குகிறது. மேலும், குறைந்த ரீஸனிங் முயற்சியிலும் செலவிலும் GPT‑6 Sol-இன் சிறந்த மதிப்பெண்ணைவிட 6.4 சதவீதப் புள்ளிகள் அதிகம் பெறுகிறது.
DeepSWE 1.1(புதிய சாளரத்தில் திறக்கும்) மதிப்பீட்டில், செயற்கை நுண்ணறிவு முகவர்கள் இதற்கெனப் புதிதாக உருவாக்கப்பட்ட, நீண்டகாலத் திட்டமிடலும் செயல்பாடும் தேவைப்படும் மென்பொருள் பொறியியல் பணிகளை நிறைவேற்றுகின்றன.
அட்டவணைகள், விளக்கப்படங்கள், வரைபடங்கள், சிறிய எழுத்து விவரங்கள் கொண்ட சிக்கலான PDF ஆவணங்களைப் பயன்படுத்தித் தொழில்முறைக் கேள்விகளுக்கு மாடல்கள் எவ்வளவு துல்லியமாகப் பதிலளிக்கின்றன என்பதை GDP.pdf அளவிடுகிறது. இதில், சோதிக்கப்பட்ட ரீஸனிங் அமைப்புகளில், மாற்று வழிகளுடன் இயங்கும் Opus 5.5-ஐ விட GPT‑6.1 Sol அதிக மதிப்பெண் பெறுகிறது; ஒரு பணிக்கான செலவோ பாதிக்கும் குறைவு. மேலும், ஒரு பணிக்கு ஏறத்தாழ ஐந்தில் ஒரு பங்கு செலவில் GPT‑6 Astra-வின் முன்னணிச் செயல்திறனை நெருங்குகிறது.
GDP.pdf(புதிய சாளரத்தில் திறக்கும்) மதிப்பீட்டில், நிதி, சுகாதாரம், சட்டம் மற்றும் மேலும் ஏழு தொழில்முறைத் துறைகளின் பணிச்செயல்முறைகளிலிருந்து பெறப்பட்ட சிக்கலான PDF ஆவணங்கள் குறித்த நிஜ உலக வினவல்களுக்கு மாதிரிகள் பதிலளிக்க வேண்டும்.
ஏஜென்ட்கள் பல படிநிலை வணிகப் பணிப்பாய்வுகளைச் சரியாக முடிக்கின்றனவா என்பதை அளவிடும் AutomationBench இல், நடுத்தர ரீஸனிங் முயற்சியில் Opus 5.5-ஐ விட GPT‑6.1 Sol 2.2 சதவீதப் புள்ளிகள் அதிகம் பெறுகிறது; செலவோ ஏறத்தாழ மூன்றில் ஒரு பங்கு மட்டுமே. அதே அமைப்பில் GPT‑6 Sol-ஐ விடவும் இந்த மதிப்பெண் 4.8 சதவீதப் புள்ளிகள் அதிகம்.
In AutomationBench 1.0.6(புதிய சாளரத்தில் திறக்கும்), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
கணினிச் செயலிகளுடன் செயலாற்ற வேண்டிய பணிகளிலும் GPT‑6.1 Sol குறிப்பிடத்தக்க முன்னேற்றத்தை அடைந்துள்ளது. கடினமான கணினிப் பயன்பாட்டுப் பணிப்பாய்வுகளில் ஏஜென்ட்களை மதிப்பிடும் OSWorld 2.0-இன் இணையமற்ற சோதனைத் தொகுப்பில், அதிகபட்ச ரீஸனிங் முயற்சியில் GPT‑6 Sol-ஐ விட GPT‑6.1 Sol ஏழு சதவீதப் புள்ளிகள் அதிகம் பெறுகிறது; செலவோ பாதிக்கும் குறைவு. அதிகபட்ச ரீஸனிங் முயற்சியில் Astra-வின் மதிப்பெண்ணுக்கு 2.1 சதவீதப் புள்ளிகளுக்குள் நெருங்குகிறது; ஒரு பணிக்கான செலவோ ஏறத்தாழ ஏழில் ஒரு பங்கு மட்டுமே.
In OSWorld 2.0(புதிய சாளரத்தில் திறக்கும்), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
தரவுப் பகுப்பாய்வு, உருவகப்படுத்தல், தேற்றங்களை நிரூபித்தல் உள்ளிட்ட அறிவியல் பணிப்பாய்வுகளை மதிப்பிடும் Terminal-Bench Science 0.1 இல், அதிகபட்ச ரீஸனிங் முயற்சியில் GPT‑6 Sol-இன் மதிப்பெண்ணைவிட இருமடங்குக்கும் அதிகமாக GPT‑6.1 Sol பெறுகிறது; ஒரு பணிக்கான செலவோ பாதிக்கும் குறைவு. அதிகபட்ச முயற்சியில், GPT‑6.1 Sol-இல் ஒரு பணிக்குச் சராசரியாக $5.47 செலவாகிறது. இது Opus 5.5 இல் $23.21, Astra இல் $23.80 ஆக உள்ளது. இரு மாடல்களையும்விட 75%-க்கும் அதிகமாகக் குறைந்த செலவில் குறிப்பிடத்தக்க அறிவியல் திறனை இது வழங்குகிறது.
சோதிக்கப்பட்ட மாடல்களில் GPT‑6 Astra தொடர்ந்து 68.1% என்ற மிக உயர்ந்த மதிப்பெண்ணைப் பெறுகிறது. மிகக் கடினமான அறிவியல் ஆராய்ச்சிப் பணிகளுக்கு அதையே பயன்படுத்த வேண்டும்.
Terminal-Bench Science 0.1(புதிய சாளரத்தில் திறக்கும்) மதிப்பீட்டில், முகவர்கள் நிரல் குறியீட்டையும் முனையக் கருவிகளையும் பயன்படுத்தி அறிவியல் ஆராய்ச்சிப் பணிச்செயல்முறைகளை நிறைவேற்றுகின்றன. தரவுகளைப் பகுப்பாய்வு செய்தல், உருவகப்படுத்தல்களை இயக்குதல், தரவுகளுக்கு ஏற்ப மாதிரிகளைப் பொருத்துதல் ஆகியவை இதில் அடங்கும்.
கடினமான அறிவுறுத்தல்களுக்கான பதில்களில் உண்மைத் துல்லியத்தையும் GPT‑6.1 Sol மேம்படுத்துகிறது. மிக அதிக ரீஸனிங் முயற்சியில், இதன் உண்மைத் தகவல் பிழை விகிதம் 4.1%. இது GPT‑6 Sol-இன் 4.5%-ஐ விடக் குறைவு; அதே அமைப்பில் Astra-வின் 4.0%-க்கு நெருக்கமானது. அதேசமயம், ஒரு பணிக்கான செலவு Astra-வை விட ஏறத்தாழ 83% குறைவு.
முந்தைய மாடலின் பிழையைப் பயனர்கள் சுட்டிக்காட்டிய உரையாடல்களிலிருந்து அடையாளத் தகவல்களை நீக்கி, அவற்றில் குறைந்தது ஓர் உண்மைத் தகவல் பிழையாவது உள்ள பதில்களின் விகிதத்தை இந்த மதிப்பீடு அளவிடுகிறது. வேண்டுமென்றே கடினமாகத் தேர்ந்தெடுக்கப்பட்ட இந்த அறிவுறுத்தல்கள் வழக்கமான பயன்பாட்டைப் பிரதிபலிப்பவை அல்ல.
முந்தைய மாடலின் உண்மைத் தகவல் பிழையைப் பயனர்கள் சுட்டிக்காட்டிய ChatGPT உரையாடல்களிலிருந்து அடையாளத் தகவல்களை நீக்கி, அவற்றில் உண்மைத் துல்லியத்தை மதிப்பிடுகிறோம். பிழைகளைத் தூண்டும் இந்த உரையாடல்கள் வழக்கமான பயன்பாட்டைப் பிரதிபலிப்பவை அல்ல; வழக்கமான பயன்பாட்டில் உண்மைத் தகவல் பிழைகள் இன்னும் அரிதாகவே ஏற்படுகின்றன.
எங்களின் நோக்க இணக்க மதிப்பீடுகளில், GPT‑6 Sol-ஐ விட GPT‑6.1 Sol குறிப்பிடத்தக்க மேம்பாடுகளைக் காட்டி, GPT‑6 Astra-வை நெருங்குகிறது.
GPT‑6.1 Sol தனது வரம்புகளை இன்னும் வெளிப்படையாகத் தெரிவிப்பதோடு, பயனர் நோக்கத்தையும் பாதுகாப்புக் கட்டுப்பாடுகளையும் இன்னும் நம்பகமாக மதித்து நடக்கிறது. சவாலான மதிப்பீடுகளில், தேடல் கருவிகளின் செயலிழப்பை வெளிப்படையாகத் தெரிவித்தல், வெளிப்படையான கட்டுப்பாடுகளை மதித்தல், ஏஜென்ட் பணிகளில் அனுமதியற்ற விளைவுகளைத் தவிர்த்தல் ஆகியவற்றில் GPT‑6 Sol-ஐ விடக் குறைந்த தோல்வி விகிதங்களைக் காட்டுகிறது. GPT‑6 Astra மற்றும் GPT‑6 Sol போலவே, தானியங்கு பாதுகாப்பு மதிப்பாய்வாளரை மீறும் முயற்சிகள் எதையும் நாங்கள் காணவில்லை.
கீழுள்ள மதிப்பீடுகள் திட்டமிட்டுச் சவாலான சூழல்களைச் சோதிக்கின்றன; வழக்கமான பயன்பாட்டில் ஏற்படும் தோல்வி விகிதங்களை அளவிடுவதில்லை.
இன்று முதல் அனைத்து Plus, Pro, Business, Enterprise மற்றும் Edu பயனர்களுக்கும் ChatGPT வேலை மற்றும் Codex இல் GPT‑6.1 Sol கிடைக்கிறது. இந்த மாடல்கள் அரட்டையில் இன்னும் கிடைக்கவில்லை. உருவாக்குநர்கள் OpenAI API வழியாகவும் gpt-6.1-sol என்ற பெயரில் இதை அணுகலாம். இதன் வழக்கமான API விலைகள்: பத்து லட்சம் உள்ளீட்டு டோக்கன்களுக்கு $2, தற்காலிகச் சேமிப்பிலுள்ள பத்து லட்சம் உள்ளீட்டு டோக்கன்களுக்கு $0.10, பத்து லட்சம் வெளியீட்டு டோக்கன்களுக்கு $10.
இதனுடன், GPT‑6 Astra-வை விட 8 மடங்கு வரை வேகமான, உலகின் அதிவேக அதிநவீன மாடலான GPT‑6 Astra Ultrafast-ஐயும், GPT‑6.1 Sol Ultrafast-ஐயும் அறிமுகப்படுத்துகிறோம். இவை API இல் கிடைக்கின்றன. மேலும், மாதம் $500 விலையுள்ள, அதிகபட்சப் பயன்பாட்டை வழங்கும் எங்கள் புதிய Pro திட்டநிலைப் பயனர்களுக்கு ChatGPT வேலை மற்றும் Codex இலும் கிடைக்கின்றன. GPT‑6.1 Sol Ultrafast மூலம், முன்பு GPT‑6 Astra-வுக்குச் செலவிட்ட ஏறத்தாழ அதே API செலவில், Astra-வுக்கு நெருக்கமான நுண்ணறிவை 8 மடங்கு வரை வேகத்தில் உருவாக்குநர்கள் பெறலாம்.
ஆசிரியர்/எழுத்தாளர்
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

