GPT-6.1Sol
ஐந்தில் ஒரு பங்கு விலையில் Astra-வை நெருங்கும் நுண்ணறிவு
GPT‑6 Sol-இன் மேம்பட்ட பதிப்பான GPT‑6.1 Sol-ஐ அறிமுகப்படுத்துகிறோம். இது ஏஜென்ட்டிக் கோடிங், கணினிப் பயன்பாடு, தொழில்முறைப் பணிகள் ஆகியவற்றில் மிகச் சிறப்பான செயல்திறனை வழங்குகிறது. கடினமான பணிகளில் Sol-இன் திறனை GPT‑6 Astra-க்கு நெருக்கமாகக் கொண்டுவருகிறது. Astra-இன் வழக்கமான உள்ளீடு மற்றும் வெளியீட்டு டோக்கன் விலைகளில் ஐந்தில் ஒரு பங்கே செலவாவதால், அதே செலவுத்திட்டத்திற்குள் திறன்மிக்க ஏஜென்ட்களை உருவாக்கி இயக்க, உருவாக்குநர்களுக்கு அதிக வாய்ப்பளிக்கிறது.
Sol விலையில் Astra-க்கு நெருக்கமான செயல்திறனை GPT‑6.1 Sol வழங்குகிறது. இதனால், இன்று கிடைக்கும் மாடல்களில் இந்தச் செயல்திறனுக்கு மிகக் குறைந்த செலவுடைய மாடலாக இது திகழ்கிறது. தற்காலிகச் சேமிப்பிலுள்ள உள்ளீட்டுக்கு பத்து லட்சம் டோக்கன்களுக்கு வெறும் $0.10 மட்டுமே செலவாகும். இது வழக்கமான உள்ளீட்டு விலையில் 95% தள்ளுபடி. எனவே, தொடர்ச்சியான கோரிக்கைகளில் சூழல் தகவலை மீண்டும் பயன்படுத்தும் ஏஜென்ட் பணிகளுக்குச் செலவு குறைகிறது.
ஒட்டுமொத்தமாக எங்களின் மிகத் திறன்மிக்க அதிநவீன மாடலாக GPT‑6 Astra தொடர்கிறது. பயனர்கள் அடிக்கடி செய்ய விரும்பும் முக்கியப் பணிகளுக்கும், செயலிகளைப் பெருமளவில் உருவாக்கி இயக்கும் API வாடிக்கையாளர்களுக்கும் திறன் மற்றும் செலவில் புதிய சமநிலையை GPT‑6.1 Sol வழங்குகிறது.

நிரல் எழுதுதல், பிழைதிருத்தம் செய்தல் முதல் ஆவணங்களைப் புரிந்துகொள்ளுதல், பல படிநிலை வணிகப் பணிப்பாய்வுகளைச் செயல்படுத்துதல் வரை, சிக்கலான தொழில்முறைப் பணிகளில் GPT‑6 Sol-ஐ விட GPT‑6.1 Sol குறிப்பிடத்தக்க மேம்பாடுகளை வழங்குகிறது. இந்த மதிப்பீடுகளில் பலவற்றில், கணிசமாகக் குறைந்த செலவில் GPT‑6 Astra-இன் செயல்திறனை நெருங்குகிறது.
உண்மையான நிரல் தொகுப்புகளில் சிக்கலான மென்பொருள் பொறியியல் பணிகளை மதிப்பிடும் DeepSWE v1.1-இல், GPT‑6 Astra-க்கு இணையான செயல்திறனை ஏறத்தாழ ஐந்தில் ஒரு பங்கு செலவில் GPT‑6.1 Sol வழங்குகிறது. மேலும், குறைந்த ரீஸனிங் முயற்சியிலும் செலவிலும் GPT‑6 Sol-இன் சிறந்த மதிப்பெண்ணைவிட 6.4 சதவீதப் புள்ளிகள் அதிகம் பெறுகிறது.
DeepSWE 1.1(புதிய சாளரத்தில் திறக்கும்) மதிப்பீட்டில், செயற்கை நுண்ணறிவு முகவர்கள் இதற்கெனப் புதிதாக உருவாக்கப்பட்ட, நீண்டகாலத் திட்டமிடலும் செயல்பாடும் தேவைப்படும் மென்பொருள் பொறியியல் பணிகளை நிறைவேற்றுகின்றன.
அட்டவணைகள், விளக்கப்படங்கள், வரைபடங்கள், சிறிய எழுத்து விவரங்கள் கொண்ட சிக்கலான PDF ஆவணங்களைப் பயன்படுத்தித் தொழில்முறைக் கேள்விகளுக்கு மாடல்கள் எவ்வளவு துல்லியமாகப் பதிலளிக்கின்றன என்பதை GDP.pdf அளவிடுகிறது. இதில், சோதிக்கப்பட்ட ரீஸனிங் அமைப்புகளில், மாற்று வழிகளுடன் இயங்கும் Opus 5.5-ஐ விட GPT‑6.1 Sol அதிக மதிப்பெண் பெறுகிறது; ஒரு பணிக்கான செலவோ பாதிக்கும் குறைவு. மேலும், ஒரு பணிக்கு ஏறத்தாழ ஐந்தில் ஒரு பங்கு செலவில் GPT‑6 Astra-இன் முன்னணிச் செயல்திறனை நெருங்குகிறது.
GDP.pdf(புதிய சாளரத்தில் திறக்கும்) மதிப்பீட்டில், நிதி, சுகாதாரம், சட்டம் மற்றும் மேலும் ஏழு தொழில்முறைத் துறைகளின் பணிச்செயல்முறைகளிலிருந்து பெறப்பட்ட சிக்கலான PDF ஆவணங்கள் குறித்த நிஜ உலக வினவல்களுக்கு மாதிரிகள் பதிலளிக்க வேண்டும்.
ஏஜென்ட்கள் பல படிநிலை வணிகப் பணிப்பாய்வுகளைச் சரியாக முடிக்கின்றனவா என்பதை அளவிடும் AutomationBench-இல், நடுத்தர ரீஸனிங் முயற்சியில் Opus 5.5-ஐ விட GPT‑6.1 Sol 2.2 சதவீதப் புள்ளிகள் அதிகம் பெறுகிறது; செலவோ ஏறத்தாழ மூன்றில் ஒரு பங்கு மட்டுமே. அதே அமைப்பில் GPT‑6 Sol-ஐ விடவும் இந்த மதிப்பெண் 4.8 சதவீதப் புள்ளிகள் அதிகம்.
AutomationBench 1.0.6(புதிய சாளரத்தில் திறக்கும்) சோதனையில், விற்பனை, சந்தைப்படுத்தல், செயல்பாடுகள், ஆதரவு, நிதி, மனிதவளம் ஆகிய துறைகளில் 47 கருவிகளைப் பயன்படுத்தும் முழுமையான பணிப்பாய்வுகளில் செயற்கை நுண்ணறிவு முகவர்கள் சோதிக்கப்படுகின்றனர். Claude Fable 5.1-க்கான தரவுப் புள்ளி அதன் உண்மையான செலவைக் குறைத்துக் காட்டுகிறது. ஏனெனில், சுமார் 40% பணிகளில் பயன்படுத்தப்பட்ட மாற்று மாடல்களின் செலவு அதில் சேர்க்கப்படவில்லை.
கணினிச் செயலிகளுடன் செயலாற்ற வேண்டிய பணிகளிலும் GPT‑6.1 Sol குறிப்பிடத்தக்க முன்னேற்றத்தை அடைந்துள்ளது. கடினமான கணினிப் பயன்பாட்டுப் பணிப்பாய்வுகளில் ஏஜென்ட்களை மதிப்பிடும் OSWorld 2.0-இன் இணையமற்ற சோதனைத் தொகுப்பில், அதிகபட்ச ரீஸனிங் முயற்சியில் GPT‑6 Sol-ஐ விட GPT‑6.1 Sol ஏழு சதவீதப் புள்ளிகள் அதிகம் பெறுகிறது; செலவோ பாதிக்கும் குறைவு. அதிகபட்ச ரீஸனிங் முயற்சியில் Astra-இன் மதிப்பெண்ணுக்கு 2.1 சதவீதப் புள்ளிகளுக்குள் நெருங்குகிறது; ஒரு பணிக்கான செலவோ ஏறத்தாழ ஏழில் ஒரு பங்கு மட்டுமே.
OSWorld 2.0(புதிய சாளரத்தில் திறக்கும்) சோதனையில், அன்றாடப் பணிகள் முதல் தொழில்சார் பணிகள் வரை நீண்ட தொடர் படிகளைக் கொண்ட கணினிப் பயன்பாட்டுப் பணிப்பாய்வுகளைச் செயற்கை நுண்ணறிவு முகவர்கள் மேற்கொள்ள முயல்கின்றனர். v2026.08.08 வெளியீட்டின் இணையமற்ற தொகுப்பில் கிடைத்த பகுதி வெகுமதி மதிப்பை இங்கு தெரிவிக்கிறோம்.
தரவுப் பகுப்பாய்வு, உருவகப்படுத்தல், தேற்றங்களை நிரூபித்தல் உள்ளிட்ட அறிவியல் பணிப்பாய்வுகளை மதிப்பிடும் Terminal-Bench Science 0.1-இல், அதிகபட்ச ரீஸனிங் முயற்சியில் GPT‑6 Sol-இன் மதிப்பெண்ணைவிட இருமடங்குக்கும் அதிகமாக GPT‑6.1 Sol பெறுகிறது; ஒரு பணிக்கான செலவோ பாதிக்கும் குறைவு. அதிகபட்ச முயற்சியில், GPT‑6.1 Sol-இல் ஒரு பணிக்குச் சராசரியாக $5.47 செலவாகிறது. இது Opus 5.5-இல் $23.21, Astra-இல் $23.80-ஆக உள்ளது. இரு மாடல்களையும்விட 75%-க்கும் அதிகமாகக் குறைந்த செலவில் குறிப்பிடத்தக்க அறிவியல் திறனை இது வழங்குகிறது.
சோதிக்கப்பட்ட மாடல்களில் GPT‑6 Astra தொடர்ந்து 68.1% என்ற மிக உயர்ந்த மதிப்பெண்ணைப் பெறுகிறது. மிகக் கடினமான அறிவியல் ஆராய்ச்சிப் பணிகளுக்கு அதையே பயன்படுத்த வேண்டும்.
Terminal-Bench Science 0.1(புதிய சாளரத்தில் திறக்கும்) மதிப்பீட்டில், முகவர்கள் நிரல் குறியீட்டையும் முனையக் கருவிகளையும் பயன்படுத்தி அறிவியல் ஆராய்ச்சிப் பணிச்செயல்முறைகளை நிறைவேற்றுகின்றன. தரவுகளைப் பகுப்பாய்வு செய்தல், உருவகப்படுத்தல்களை இயக்குதல், தரவுகளுக்கு ஏற்ப மாதிரிகளைப் பொருத்துதல் ஆகியவை இதில் அடங்கும்.
கடினமான ப்ராம்ப்ட்களுக்கான பதில்களில் உண்மைத் துல்லியத்தையும் GPT‑6.1 Sol மேம்படுத்துகிறது. மிக அதிக ரீஸனிங் முயற்சியில், இதன் உண்மைத் தகவல் பிழை விகிதம் 4.1% ஆகும். இது GPT‑6 Sol-இன் 4.5%-ஐ விடக் குறைவு; அதே அமைப்பில் Astra-இன் 4.0%-க்கு நெருக்கமானது. அதேசமயம், ஒரு பணிக்கான செலவு Astra-ஐ விட ஏறத்தாழ 83% குறைவு.
முந்தைய மாடலின் பிழையைப் பயனர்கள் சுட்டிக்காட்டிய உரையாடல்களிலிருந்து அடையாளத் தகவல்களை நீக்கி, அவற்றில் குறைந்தது ஓர் உண்மைத் தகவல் பிழையாவது உள்ள பதில்களின் விகிதத்தை இந்த மதிப்பீடு அளவிடுகிறது. வேண்டுமென்றே கடினமாகத் தேர்ந்தெடுக்கப்பட்ட இந்த ப்ராம்ப்ட்கள் வழக்கமான பயன்பாட்டைப் பிரதிபலிப்பவை அல்ல.
முந்தைய மாடலின் உண்மைத் தகவல் பிழையைப் பயனர்கள் சுட்டிக்காட்டிய ChatGPT உரையாடல்களிலிருந்து அடையாளத் தகவல்களை நீக்கி, அவற்றில் உண்மைத் துல்லியத்தை மதிப்பிடுகிறோம். பிழைகளைத் தூண்டும் இந்த உரையாடல்கள் வழக்கமான பயன்பாட்டைப் பிரதிபலிப்பவை அல்ல; வழக்கமான பயன்பாட்டில் உண்மைத் தகவல் பிழைகள் இன்னும் அரிதாகவே ஏற்படுகின்றன.
எங்களின் நோக்க இணக்க மதிப்பீடுகளில், GPT‑6 Sol-ஐ விட GPT‑6.1 Sol குறிப்பிடத்தக்க மேம்பாடுகளைக் காட்டி, GPT‑6 Astra-ஐ நெருங்குகிறது.
GPT‑6.1 Sol தனது வரம்புகளை இன்னும் வெளிப்படையாகத் தெரிவிப்பதோடு, பயனர் நோக்கத்தையும் பாதுகாப்புக் கட்டுப்பாடுகளையும் இன்னும் நம்பகமாக மதித்து நடக்கிறது. சவாலான மதிப்பீடுகளில், தேடல் கருவிகளின் செயலிழப்பை வெளிப்படையாகத் தெரிவித்தல், வெளிப்படையான கட்டுப்பாடுகளை மதித்தல், ஏஜென்ட் பணிகளில் அனுமதியற்ற விளைவுகளைத் தவிர்த்தல் ஆகியவற்றில் GPT‑6 Sol-ஐ விடக் குறைந்த தோல்வி விகிதங்களைக் காட்டுகிறது. GPT‑6 Astra மற்றும் GPT‑6 Sol போலவே, தானியங்கு பாதுகாப்பு மதிப்பாய்வாளரை மீறும் முயற்சிகள் எதையும் நாங்கள் காணவில்லை.
கீழுள்ள மதிப்பீடுகள் திட்டமிட்டுச் சவாலான சூழல்களைச் சோதிக்கின்றன; வழக்கமான பயன்பாட்டில் ஏற்படும் தோல்வி விகிதங்களை அளவிடுவதில்லை.
இன்று முதல் அனைத்து Plus, Pro, Business, Enterprise மற்றும் Edu பயனர்களுக்கும் ChatGPT வேலை மற்றும் Codex-இல் GPT‑6.1 Sol கிடைக்கிறது. இந்த மாடல்கள் அரட்டையில் இன்னும் கிடைக்கவில்லை. உருவாக்குநர்கள் OpenAI API வழியாகவும் gpt-6.1-sol என்ற பெயரில் இதை அணுகலாம். இதன் வழக்கமான API விலைகள்: பத்து லட்சம் உள்ளீட்டு டோக்கன்களுக்கு $2, தற்காலிகச் சேமிப்பிலுள்ள பத்து லட்சம் உள்ளீட்டு டோக்கன்களுக்கு $0.10, பத்து லட்சம் வெளியீட்டு டோக்கன்களுக்கு $10.
இதனுடன், GPT‑6 Astra-ஐ விட 8 மடங்கு வரை வேகமான, உலகின் அதிவேக அதிநவீன மாடலான GPT‑6 Astra Ultrafast-ஐயும், GPT‑6.1 Sol Ultrafast-ஐயும் அறிமுகப்படுத்துகிறோம். இவை API-இல் கிடைக்கின்றன. மேலும், மாதம் $500 விலையுள்ள, அதிகபட்சப் பயன்பாட்டை வழங்கும் எங்கள் புதிய Pro திட்டநிலைப் பயனர்களுக்கு ChatGPT வேலை மற்றும் Codex-இலும் கிடைக்கின்றன. GPT‑6.1 Sol Ultrafast மூலம், முன்பு GPT‑6 Astra-க்குச் செலவிட்ட ஏறத்தாழ அதே API செலவில், Astra-க்கு நெருக்கமான நுண்ணறிவை 8 மடங்கு வரை வேகத்தில் உருவாக்குநர்கள் பெறலாம்.
ஆசிரியர்/எழுத்தாளர்
GPT மதிப்பீடுகள் எங்கள் ஆராய்ச்சிச் சூழலில் அல்லது எங்கள் API வழியாக மேற்கொள்ளப்பட்டன. முறைமை ப்ராம்ப்ட்கள், கிடைக்கும் கருவிகள், முயற்சி நிலைகள் போன்றவற்றில் உள்ள வேறுபாடுகளால், பொதுப் பயன்பாட்டிலுள்ள ChatGPT-இன் வெளியீட்டிலிருந்து இவற்றின் வெளியீடு சற்றே மாறுபடலாம். போட்டி மாடல்களின் மதிப்பீடுகள் பொதுவில் கிடைக்கும் அறிக்கைகளிலிருந்து எடுக்கப்பட்டன.

