Преминаване към основното съдържание
OpenAI

GPT-6.1Sol

Интелект, близък до този на Astra, на пет пъти по-ниска цена

Представяме GPT‑6.1 Sol — подобрена версия на GPT‑6 Sol с изключително силно представяне при агентно кодиране, работа с компютър и професионални задачи. Той доближава Sol до GPT‑6 Astra при сложни задачи на една пета от стандартните цени на Astra за входни и изходни токени. Така разработчиците имат повече възможности да създават и използват способни агенти със същия бюджет.

GPT‑6.1 Sol предлага представяне, близко до Astra, на цените на Sol, което го прави модела с най-добро съотношение между разходи и резултати, достъпен днес. Кешираните входни данни струват само 0,10 щ.д. за милион токени — с 95% по-малко от стандартната цена за входни данни. Това го прави по-достъпен за агентни задачи, които изискват повторно използване на контекста в множество заявки.

GPT‑6 Astra остава нашият авангарден модел с най-широки възможности като цяло. GPT‑6.1 Sol предлага нов баланс между възможности и цена — за важните задачи, които потребителите искат да изпълняват по-често, и за клиентите на API, които създават и използват приложения в голям мащаб.

Три карти с модели: GPT-6 Astra, най-интелигентният ни модел за най-добри резултати — 10 щ.д. за входни данни, 50 щ.д. за изходни данни и 1 щ.д. за кеширани входни данни; GPT-6.1 Sol, интелект, близък до Astra, на една пета от цената — 2 щ.д. за входни данни, 10 щ.д. за изходни данни и 0,10 щ.д. за кеширани входни данни; GPT-6 Luna, бърза и ефективна ежедневна работа в голям мащаб — 0,10 щ.д. за входни данни, 0,50 щ.д. за изходни данни и 0,01 щ.д. за кеширани входни данни.

По-способен Sol за разнообразни задачи

GPT‑6.1 Sol предлага значителни подобрения спрямо GPT‑6 Sol при сложни професионални задачи — от писане и отстраняване на грешки в код до разбиране на документи и изпълнение на многоетапни бизнес процеси. В няколко от тези оценки той се доближава до представянето на GPT‑6 Astra при значително по-ниски разходи.

Кодиране

В DeepSWE v1.1, който оценява сложни задачи по софтуерно инженерство в реални кодови бази, GPT‑6.1 Sol изравнява резултата на GPT‑6 Astra при приблизително една пета от разходите. Същевременно надминава най-добрия резултат на GPT‑6 Sol с 6,4 процентни пункта при по-ниско усилие за структурирано анализиране и по-ниски разходи.

В DeepSWE 1.1⁠⁠(отваря се в нов прозорец) агентите с ИИ решават оригинални задачи по софтуерно инженерство, изискващи продължителна работа.

Професионални задачи

В GDP.pdf, който измерва колко точно моделите отговарят на професионални въпроси чрез сложни PDF документи с таблици, графики, диаграми и детайли с дребен шрифт, GPT‑6.1 Sol постига по-висок резултат от Opus 5.5 с резервни варианти при под половината от разходите за задача при тестваните настройки за структурирано анализиране. Той се доближава и до водещото представяне на GPT‑6 Astra при приблизително една пета от разходите за задача.

В GDP.pdf⁠(отваря се в нов прозорец) моделите трябва да отговарят на реални запитвания за сложни PDF документи, използвани в работата на специалисти в областта на финансите, здравеопазването, правото и седем други професионални сфери.

В AutomationBench, който измерва дали агентите изпълняват правилно многоетапни бизнес процеси, GPT‑6.1 Sol постига резултат с 2,2 процентни пункта над Opus 5.5 при средно усилие за структурирано анализиране и приблизително една трета от разходите. Този резултат е и с 4,8 процентни пункта по-висок от този на GPT‑6 Sol при същата настройка.

В AutomationBench 1.0.6⁠⁠(отваря се в нов прозорец) агентите с ИИ се тестват върху цялостни работни процеси с 47 инструмента в областта на продажбите, маркетинга, оперативната дейност, обслужването на клиенти, финансите и човешките ресурси. Посоченият разход за Claude Fable 5.1 е по-нисък от действителния, тъй като не включва разходите за използване на резервни модели, до които се е прибягвало при около 40% от задачите.

Работа с компютър

GPT‑6.1 Sol постига значителен напредък и при задачи, които изискват взаимодействие с компютърни приложения. В офлайн набора на OSWorld 2.0, който оценява агентите при сложни работни процеси с компютър, GPT‑6.1 Sol надминава GPT‑6 Sol със седем процентни пункта при максимално усилие за структурирано анализиране и под половината от разходите. Той се доближава на 2,1 процентни пункта до резултата на Astra при максимално усилие за структурирано анализиране и приблизително една седма от разходите за задача.

В OSWorld 2.0⁠⁠(отваря се в нов прозорец) агентите с ИИ се опитват да изпълняват продължителни работни процеси на компютър, обхващащи ежедневни и професионални задачи. Отчитаме оценката за частично изпълнение върху офлайн набора от версия v2026.08.08.

Научни изследвания

В Terminal-Bench Science 0.1, който оценява научни работни процеси, включително анализ на данни, симулации и доказване на теореми, GPT‑6.1 Sol постига над два пъти по-висок резултат от GPT‑6 Sol при максимално усилие за структурирано анализиране и под половината от разходите за задача. При максимално усилие GPT‑6.1 Sol струва средно 5,47 щ.д. на задача спрямо 23,21 щ.д. за Opus 5.5 и 23,80 щ.д. за Astra, като предлага значителни възможности за научна работа при над 75% по-ниски разходи от всеки от двата модела.

GPT‑6 Astra все още постига най-високия резултат сред тестваните модели — 68,1% — и е препоръчителният избор за най-трудните научноизследователски задачи.

В Terminal-Bench Science 0.1⁠(отваря се в нов прозорец) агентите изпълняват научноизследователски работни процеси с помощта на код и инструменти за терминала, включително анализ на данни, провеждане на симулации и напасване на модели.

Фактическа точност

GPT‑6.1 Sol подобрява и фактическата точност при трудни подкани. При много високо усилие за структурирано анализиране делът на фактическите му грешки е 4,1% спрямо 4,5% за GPT‑6 Sol, доближавайки се до 4,0% на Astra при същата настройка. Същевременно разходът за задача е с около 83% по-нисък от този на Astra.

Тази оценка измерва дела на отговорите с поне една фактическа грешка в разговори с премахнати идентифициращи данни, в които потребителите са сигнализирали за грешка на предишен модел. Тези умишлено трудни подкани не са представителни за обичайната употреба.

Оценяваме фактическата точност чрез разговори в ChatGPT с премахнати идентифициращи данни, в които потребителите са сигнализирали за фактическа грешка на предишен модел. Тези разговори, предизвикващи грешки, не са представителни за обичайната употреба, при която фактическите грешки са по-редки.

Безопасно внедряване на GPT‑6.1 Sol

GPT‑6.1 Sol показва значителни подобрения спрямо GPT‑6 Sol в нашите оценки за съответствие с човешките намерения и изисквания, доближавайки се до GPT‑6 Astra.

GPT‑6.1 Sol е по-прозрачен относно ограниченията си и по-надеждно зачита намеренията на потребителя и ограниченията за безопасност. При трудни оценки той допуска по-малко грешки от GPT‑6 Sol при съобщаване за неработещи инструменти за търсене, спазване на изрични ограничения и избягване на неразрешени резултати при агентни задачи. Не наблюдавахме опити за заобикаляне на автоматизираната система за проверка на безопасността, както и при GPT‑6 Astra и GPT‑6 Sol.

Оценките по-долу умишлено проверяват трудни ситуации и не измерват честотата на грешките при обичайна употреба.

Цени и достъпност

От днес GPT‑6.1 Sol е достъпен в ChatGPT Work и Codex за всички потребители на Plus, Pro, Business, Enterprise и Edu. Тези модели все още не са достъпни в Chat. Разработчиците могат да го използват и чрез API на OpenAI като gpt-6.1-sol. Стандартните му API цени са 2 щ.д. за милион входни токени, 0,10 щ.д. за милион кеширани входни токени и 10 щ.д. за милион изходни токени.

Успоредно с това пускаме GPT‑6 Astra Ultrafast — най-бързия авангарден модел в света, до 8 пъти по-бърз от GPT‑6 Astra — както и GPT‑6.1 Sol Ultrafast. Те са достъпни чрез API, както и в ChatGPT Work и Codex за потребителите на новото ни ниво Pro с най-високи лимити за използване на цена от 500 щ.д. месечно. С GPT‑6.1 Sol Ultrafast разработчиците получават интелект, близък до Astra, при до 8 пъти по-висока скорост и приблизително същите разходи за API като преди за GPT‑6 Astra.

Автор

OpenAI

Оценките на GPT са проведени в нашата изследователска среда или чрез нашия API, където отговорите може да се различават леко от тези в публично достъпния ChatGPT поради разлики в системните подкани, наличните инструменти, нивата на усилие и др. Оценките на конкурентните модели са взети от публично достъпни доклади.