GPT-6.1Sol
Inteligencija gotovo na razini modela Astra za petinu cijene
Predstavljamo GPT‑6.1 Sol, nadogradnju modela GPT‑6 Sol s iznimno snažnim performansama u kodiranju uz pomoć AI agenta, upotrebi računala i profesionalnom radu. Na zahtjevnim zadacima približava Sol modelu GPT‑6 Astra, uz petinu standardne cijene ulaznih i izlaznih tokena modela Astra, pa razvojni programeri uz isti proračun imaju više prostora za izradu i pokretanje sposobnih agenata.
GPT‑6.1 Sol donosi performanse bliske modelu Astra po cijeni modela Sol, što ga čini trenutačno najisplativijim modelom s obzirom na performanse. Predmemorirani ulaz košta samo 0,10 USD po milijunu tokena, što je 95 % manje od standardne cijene ulaza. Time je pristupačniji za radna opterećenja agenata koja zahtijevaju ponovnu upotrebu konteksta u višestrukim zahtjevima.
GPT‑6 Astra i dalje je naš ukupno najsposobniji granični model. GPT‑6.1 Sol nudi novu ravnotežu sposobnosti i troškova za važne poslove koje korisnici žele obavljati češće te za korisnike API-ja koji razvijaju i pokreću aplikacije u velikom opsegu.

GPT‑6.1 Sol donosi znatna poboljšanja u odnosu na GPT‑6 Sol u složenom profesionalnom radu, od pisanja koda i otklanjanja pogrešaka do razumijevanja dokumenata i izvođenja poslovnih procesa u više koraka. U nekoliko tih evaluacija približava se performansama modela GPT‑6 Astra uz znatno niži trošak.
Na testu DeepSWE v1.1, koji procjenjuje složene zadatke softverskog inženjerstva u stvarnim bazama koda, GPT‑6.1 Sol izjednačuje se s modelom GPT‑6 Astra uz otprilike petinu troška, a istodobno nadmašuje najbolji rezultat modela GPT‑6 Sol za 6,4 postotna boda uz manji napor pri rasuđivanju i niži trošak.
U testu DeepSWE 1.1(otvara se u novom prozoru) AI agenti rješavaju izvorne zadatke iz softverskog inženjerstva koji zahtijevaju dugotrajan rad.
Na testu GDP.pdf, koji mjeri koliko točno modeli odgovaraju na stručna pitanja koristeći složene PDF dokumente s tablicama, grafikonima, dijagramima i sitno tiskanim pojedinostima, GPT‑6.1 Sol postiže bolji rezultat od modela Opus 5.5 s pričuvnim modelima uz manje od polovice troška po zadatku na svim testiranim postavkama rasuđivanja. Također se približava vodećim performansama modela GPT‑6 Astra uz otprilike petinu troška po zadatku.
U testu GDP.pdf(otvara se u novom prozoru) modeli moraju odgovarati na upite iz stvarne prakse o složenim PDF dokumentima koji se upotrebljavaju u financijama, zdravstvu, pravu i još sedam stručnih područja.
Na testu AutomationBench, koji mjeri izvršavaju li agenti ispravno poslovne procese u više koraka, GPT‑6.1 Sol postiže rezultat 2,2 postotna boda bolji od modela Opus 5.5 uz srednju razinu napora pri rasuđivanju i otprilike trećinu troška. Taj je rezultat ujedno 4,8 postotnih bodova bolji od rezultata modela GPT‑6 Sol na istoj postavci.
U testu AutomationBench 1.0.6(otvara se u novom prozoru) AI agenti testiraju se na cjelovitim radnim procesima uz upotrebu 47 alata za prodaju, marketing, operativno poslovanje, podršku, financije i ljudske resurse. Prikazani trošak za Claude Fable 5.1 niži je od stvarnog jer ne uključuje trošak upotrebe rezervnih modela, do koje je došlo u približno 40 % zadataka.
GPT‑6.1 Sol također znatno napreduje u zadacima koji zahtijevaju interakciju s računalnim aplikacijama. Na izvanmrežnom skupu testa OSWorld 2.0, koji procjenjuje agente u zahtjevnim radnim procesima koji uključuju upotrebu računala, GPT‑6.1 Sol nadmašuje GPT‑6 Sol za sedam postotnih bodova uz maksimalni napor pri rasuđivanju i manje od polovice troška. Uz maksimalni napor pri rasuđivanju zaostaje samo 2,1 postotni bod za rezultatom modela Astra, uz otprilike sedminu troška po zadatku.
U testu OSWorld 2.0(otvara se u novom prozoru) AI agenti pokušavaju izvršiti dugotrajne radne procese na računalu koji obuhvaćaju svakodnevne i profesionalne zadatke. Prikazujemo djelomičnu nagradu na izvanmrežnom skupu iz izdanja v2026.08.08.
Na testu Terminal-Bench Science 0.1, koji procjenjuje znanstvene radne procese, uključujući analizu podataka, simulacije i dokazivanje teorema, GPT‑6.1 Sol postiže više nego dvostruko bolji rezultat od modela GPT‑6 Sol uz maksimalni napor pri rasuđivanju i manje od polovice troška po zadatku. Uz maksimalni napor GPT‑6.1 Sol u prosjeku košta 5,47 USD po zadatku, u usporedbi s 23,21 USD za Opus 5.5 i 23,80 USD za model Astra. Time pruža snažne sposobnosti za znanstveni rad uz više od 75 % niži trošak od oba modela.
GPT‑6 Astra i dalje postiže najbolji rezultat među testiranim modelima, 68,1 %, te ga treba upotrebljavati za najteže znanstvenoistraživačke zadatke.
U testu Terminal-Bench Science 0.1(otvara se u novom prozoru) agenti provode znanstvenoistraživačke postupke koristeći se kodom i terminalskim alatima, što uključuje analizu podataka, pokretanje simulacija i prilagodbu modela.
GPT‑6.1 Sol također poboljšava činjeničnu točnost na zahtjevnim upitima. Uz vrlo visok napor pri rasuđivanju njegova stopa činjeničnih pogrešaka iznosi 4,1 %, što je manje od 4,5 % za GPT‑6 Sol i bliže stopi od 4,0 % modela Astra na istoj postavci, dok je trošak po zadatku približno 83 % niži nego za model Astra.
Ova evaluacija mjeri udio odgovora koji sadrže barem jednu činjeničnu pogrešku u razgovorima iz kojih su uklonjeni identifikacijski podaci, a u kojima su korisnici označili pogrešku prethodnog modela. Ti namjerno zahtjevni upiti nisu reprezentativni za uobičajenu upotrebu.
Činjeničnu točnost procjenjujemo na razgovorima iz proizvoda ChatGPT iz kojih su uklonjeni identifikacijski podaci, a u kojima su korisnici označili činjeničnu pogrešku prethodnog modela. Ti razgovori koji potiču pogreške nisu reprezentativni za uobičajenu upotrebu, u kojoj su činjenične pogreške rjeđe.
GPT‑6.1 Sol pokazuje znatna poboljšanja u odnosu na GPT‑6 Sol u našim evaluacijama usklađenosti, čime se približava modelu GPT‑6 Astra.
GPT‑6.1 Sol otvorenije navodi svoja ograničenja i pouzdanije poštuje korisnikovu namjeru i sigurnosna ograničenja. U zahtjevnim evaluacijama pokazuje niže stope propusta od modela GPT‑6 Sol u obavještavanju o neispravnim alatima za pretraživanje, poštovanju izričitih ograničenja i izbjegavanju neovlaštenih ishoda tijekom agentskih zadataka. Nismo uočili pokušaje zaobilaženja automatiziranog sustava za sigurnosnu provjeru, kao ni kod modela GPT‑6 Astra i GPT‑6 Sol.
Evaluacije u nastavku namjerno ispituju zahtjevne situacije i ne mjere stope propusta u uobičajenoj upotrebi.
GPT‑6.1 Sol od danas je dostupan svim korisnicima paketa Plus, Pro, Business, Enterprise i Edu u načinu rada ChatGPT Work i alatu Codex. Ti modeli još nisu dostupni u načinu rada Chat. Razvojni programeri mogu mu pristupiti i putem API-ja OpenAI pod nazivom gpt-6.1-sol. Standardne cijene za upotrebu putem API-ja iznose 2 USD po milijunu ulaznih tokena, 0,10 USD po milijunu predmemoriranih ulaznih tokena i 10 USD po milijunu izlaznih tokena.
Istodobno predstavljamo GPT‑6 Astra Ultrafast, najbrži granični model na svijetu, do 8 puta brži od modela GPT‑6 Astra, kao i GPT‑6.1 Sol Ultrafast. Dostupni su putem API-ja te u načinu rada ChatGPT Work i alatu Codex korisnicima naše nove razine paketa Pro s najvišim ograničenjima upotrebe, po cijeni od 500 USD mjesečno. Uz GPT‑6.1 Sol Ultrafast razvojni programeri mogu dobiti inteligenciju blisku modelu Astra uz do 8 puta veću brzinu, za otprilike isti trošak API-ja kao dosad za GPT‑6 Astra.
Autor
Evaluacije modela GPT provedene su u našem istraživačkom okruženju ili putem našeg API-ja, što može dati nešto drukčije rezultate nego produkcijska verzija proizvoda ChatGPT zbog razlika u sistemskim uputama, dostupnim alatima, razinama napora itd. Evaluacije konkurentskih modela preuzete su iz javno dostupnih izvješća.

