Kalo te përmbajtja kryesore
OpenAI

GPT-6.1Sol

Inteligjencë thuajse në nivelin e Astra-s, me një të pestën e çmimit

Ne po prezantojmë GPT‑6.1 Sol, një përmirësim të GPT‑6 Sol me performancë jashtëzakonisht të lartë në kodimin agjentik, si edhe në përdorimin e kompjuterit dhe detyrat profesionale. Ai e afron më shumë Sol me GPT‑6 Astra në detyra të vështira, me një të pestën e çmimeve standarde të Astra për token hyrës dhe dalës, duke u dhënë zhvilluesve më shumë hapësirë për të ndërtuar dhe vënë në punë agjentë të aftë brenda të njëjtit buxhet.

GPT‑6.1 Sol sjell performancë pranë nivelit të Astra me çmimet e Sol, duke u bërë modeli me raportin më të mirë të kostos dhe performancës të disponueshëm sot. Hyrja e ruajtur në memorien e përkohshme kushton vetëm 0,10 $ për një milion token - 95% më pak se çmimi standard i hyrjes - duke e bërë më të përballueshëm për ngarkesa pune agjentike që kërkojnë ripërdorimin e kontekstit në kërkesa të përsëritura.

GPT‑6 Astra mbetet modeli ynë avangardë më i aftë në tërësi. GPT‑6.1 Sol ofron një ekuilibër të ri mes aftësisë dhe kostos për detyrat e rëndësishme që përdoruesit duan t'i bëjnë më shpesh dhe për klientët e API-së që ndërtojnë dhe vënë në përdorim aplikacione në shkallë të gjerë.

Tri karta modelesh: GPT-6 Astra, modeli ynë më inteligjent për rezultatet më të mira, 10 $ për hyrjen, 50 $ për daljen dhe 1 $ për hyrjen në cache; GPT-6.1 Sol, inteligjencë pranë nivelit të Astra me një të pestën e çmimit, 2 $ për hyrjen, 10 $ për daljen dhe 0,10 $ për hyrjen në cache; GPT-6 Luna, punë e përditshme e shpejtë dhe efikase në shkallë të gjerë, 0,10 $ për hyrjen, 0,50 $ për daljen dhe 0,01 $ për hyrjen në cache.

Një Sol më i aftë në detyra të ndryshme

GPT‑6.1 Sol sjell përmirësime të ndjeshme krahasuar me GPT‑6 Sol në detyra profesionale komplekse, nga shkrimi i kodit dhe rregullimi i gabimeve në të e deri te kuptimi i dokumenteve dhe kryerja e proceseve të biznesit me shumë hapa. Në disa prej këtyre vlerësimeve, ai i afrohet performancës së GPT‑6 Astra me kosto dukshëm më të ulët.

Kodimi

Në DeepSWE v1.1, që vlerëson detyra komplekse të inxhinierisë softuerike në baza reale kodi, GPT‑6.1 Sol arrin performancën e GPT‑6 Astra me rreth një të pestën e kostos, ndërkohë që e tejkalon rezultatin më të mirë të GPT‑6 Sol me 6,4 pikë përqindjeje, me më pak përpjekje arsyetimi dhe me kosto më të ulët.

Në DeepSWE 1.1⁠⁠(hapet në një dritare të re), agjentët e IA-së zgjidhin detyra origjinale dhe afatgjata të inxhinierisë së softuerit.

Detyrat profesionale

Në GDP.pdf, që mat se me sa saktësi u përgjigjen modelet pyetjeve profesionale duke përdorur dokumente komplekse PDF, duke përfshirë tabela, grafikë, diagrame dhe detaje të hollësishme, GPT‑6.1 Sol siguron rezultat më të lartë se Opus 5.5 me alternativa rezervë, me më pak se gjysmën e kostos për detyrë në të gjitha nivelet e testuara të arsyetimit. Ai i afrohet gjithashtu performancës së nivelit më të lartë të GPT‑6 Astra me rreth një të pestën e kostos për detyrë.

Në GDP.pdf⁠(hapet në një dritare të re), modelet duhet t’u përgjigjen kërkesave nga praktika reale për dokumente komplekse PDF, të marra nga proceset e punës në financë, shëndetësi, drejtësi dhe shtatë fusha të tjera profesionale.

Në AutomationBench, që mat nëse agjentët kryejnë me saktësi procese biznesi me shumë hapa, GPT‑6.1 Sol shënon 2,2 pikë përqindjeje më shumë se Opus 5.5 në përpjekje mesatare arsyetimi, me rreth një të tretën e kostos. Ky rezultat është gjithashtu 4,8 pikë përqindjeje më i lartë se ai i GPT‑6 Sol në të njëjtin nivel.

Në AutomationBench 1.0.6⁠⁠(hapet në një dritare të re), agjentët e IA-së testohen në procese pune nga fillimi në fund, duke përdorur 47 mjete në shitje, marketing, operacione, mbështetje, financë dhe burime njerëzore. Vlera e paraqitur për Claude Fable 5.1 është më e ulët se kostoja e tij reale, pasi nuk përfshin koston e përdorimit të alternativave rezervë, të cilave iu desh t'u drejtohej në rreth 40% të detyrave.

Përdorimi i kompjuterit

GPT‑6.1 Sol siguron po ashtu një progres të konsiderueshëm në detyra që kërkojnë ndërveprim me aplikacione kompjuterike. Në grupin e testeve jashtë linje të OSWorld 2.0, që vlerëson agjentët në rrjedha të vështira pune kompjuterike, GPT‑6.1 Sol tejkalon GPT‑6 Sol me shtatë pikë përqindjeje në nivelin maksimal të përpjekjes së arsyetimit, me më pak se gjysmën e kostos. Në nivelin maksimal të përpjekjes së arsyetimit, ai arrin vetëm 2,1 pikë përqindjeje larg rezultatit të Astra, me rreth një të shtatën e kostos për detyrë.

Në OSWorld 2.0⁠⁠(hapet në një dritare të re), agjentët e IA-së përpiqen të kryejnë procese pune të zgjatura në kompjuter, që përfshijnë detyra të përditshme dhe profesionale. Ne raportojmë shpërblimin e pjesshëm për grupin e të dhënave jashtë linje nga versioni v2026.08.08.

Kërkimi shkencor

Në Terminal-Bench Science 0.1, që vlerëson rrjedhat e punës shkencore, duke përfshirë analizën e të dhënave, simulimin dhe vërtetimin e teoremave, GPT‑6.1 Sol arrin më shumë se dyfishin e rezultatit të GPT‑6 Sol në nivelin maksimal të përpjekjes së arsyetimit, me më pak se gjysmën e kostos për detyrë. Me përpjekje maksimale, GPT‑6.1 Sol kushton mesatarisht 5,47 $ për detyrë, krahasuar me 23,21 $ për Opus 5.5 dhe 23,80 $ për Astra, duke ofruar aftësi të konsiderueshme shkencore me kosto mbi 75% më të ulët se secili prej këtyre modeleve.

GPT‑6 Astra arrin përsëri rezultatin më të lartë mes modeleve të testuara, me 68,1%, dhe duhet të përdoret për detyrat më të vështira të kërkimit shkencor.

Në Terminal-Bench Science 0.1⁠(hapet në një dritare të re), agjentët kryejnë procese kërkimore shkencore duke përdorur kod dhe mjete të terminalit, përfshirë analizën e të dhënave, ekzekutimin e simulimeve dhe përshtatjen e modeleve.

Saktësia faktike

GPT‑6.1 Sol përmirëson gjithashtu saktësinë faktike në kërkesa të vështira. Me përpjekje shumë të lartë arsyetimi, shkalla e gabimeve faktike të tij është 4,1%, në ulje nga 4,5% e GPT‑6 Sol dhe më pranë nivelit 4,0% të Astra me të njëjtin cilësim, ndërkohë që kushton afërsisht 83% më pak për detyrë se Astra.

Ky vlerësim mat përqindjen e përgjigjeve që përmbajnë të paktën një gabim faktik në biseda me të dhëna jo identifikuese, ku përdoruesit kishin raportuar gabimin e një modeli të mëparshëm. Këto kërkesa, të zgjedhura qëllimisht për vështirësinë e tyre, nuk përfaqësojnë përdorimin tipik.

Ne e vlerësojmë saktësinë faktike në biseda të ChatGPT me të dhëna jo identifikuese, ku përdoruesit kishin raportuar një gabim faktik të një modeli të mëparshëm. Këto biseda që nxisin gabime nuk përfaqësojnë përdorimin tipik, ku gabimet faktike janë më të rralla.

Vënia në përdorim e GPT‑6.1 Sol në mënyrë të sigurt

GPT‑6.1 Sol tregon përmirësime të ndjeshme ndaj GPT‑6 Sol në vlerësimet tona të përputhjes me synimet dhe kufizimet, duke iu afruar GPT‑6 Astra.

GPT‑6.1 Sol është më transparent për sa i përket kufizimeve të veta dhe më i besueshëm në lidhje me respektimin e synimit të përdoruesit dhe kufizimeve të sigurisë. Në vlerësime të vështira, ai tregon shkallë më të ulëta dështimi se GPT‑6 Sol për transparencën rreth mjeteve të kërkimit që nuk funksionojnë, respektimin e kufizimeve të shprehura qartë dhe shmangien e rezultateve të paautorizuara gjatë detyrave agjentike. Ne nuk vumë re asnjë përpjekje për të anashkaluar një rishikues të automatizuar të sigurisë, njësoj si me GPT‑6 Astra dhe GPT‑6 Sol.

Vlerësimet më poshtë testojnë qëllimisht situata të vështira dhe nuk matin shkallët e dështimit në përdorim tipik.

Çmimet dhe disponueshmëria

GPT‑6.1 Sol është i disponueshëm duke filluar nga sot për të gjithë përdoruesit e Plus, Pro, Business, Enterprise dhe Edu në ChatGPT Work dhe Codex. Këto modele nuk janë ende të disponueshme në Chat. Zhvilluesit mund ta përdorin edhe përmes API-së së OpenAI si gpt-6.1-sol. Çmimet e tij standarde në API janë 2 $ për një milion token hyrës, 0,10 $ për një milion token hyrës të ruajtur në memorien e përkohshme dhe 10 $ për një milion token dalës.

Krahas tij, ne po prezantojmë GPT‑6 Astra Ultrafast, modelin avangardë më të shpejtë në botë, deri në 8 herë më të shpejtë se GPT‑6 Astra, si dhe GPT‑6.1 Sol Ultrafast. Këto janë të disponueshme në API, si edhe në ChatGPT Work dhe Codex për përdoruesit e nivelit tonë të ri Pro me kufijtë më të lartë të përdorimit, për 500 $/muaj. Me GPT‑6.1 Sol Ultrafast, zhvilluesit mund të marrin inteligjencë pranë nivelit të Astra me shpejtësi deri në 8×, duke shpenzuar në API afërsisht sa shpenzonin më parë për GPT‑6 Astra.

Autori

OpenAI

Vlerësimet e GPT u kryen në mjedisin tonë kërkimor ose përmes API-së sonë, ku përgjigjet mund të ndryshojnë pak nga ato të versionit të ChatGPT në përdorim, për shkak të dallimeve në udhëzimet e sistemit, mjetet e disponueshme, nivelet e përpjekjes etj. Vlerësimet e modeleve konkurruese u morën nga raporte të disponueshme në mënyrë publike.