OpenAI

GPT-6 Astra: A new generation of intelligence

En ny generation af intelligens

Opdatering den 22. september 2026: Vi udvider vores GPT‑6‑serie med GPT‑6 Sol og GPT‑6 Luna. Få mere at vide.

Vi introducerer GPT‑6 Astra, verdens mest intelligente og målrettede model.

GPT‑6 Astra samler mange års forskning og store satsninger inden for fortræning, forstærkende læring og tilpasning. Astra er banebrydende inden for computerbrug, browsing, softwareudvikling, cybersikkerhed, videnskab og fagligt arbejde. Astra når mætningspunktet for FrontierMath Tier 4 med en score på 98 % og har allerede bidraget til at løse længe uløste åbne problemer⁠ inden for matematik. Astra når også mætningspunktet for ARC-AGI-3 med en score på 99,9 % og 100 % for ExploitBench. Den sætter også banebrydende standarder for brug af computere og browsere og håndterer det mest krævende faglige arbejde med uovertruffen hastighed, nøjagtighed og dømmekraft. 

GPT‑6 Astra udrulles i dag til et begrænset antal organisationer og bliver i løbet af de kommende dage tilgængelig for alle ChatGPT Plus-, Pro-, Business- og Enterprise-brugere samt via OpenAI API, Microsoft Azure og AWS Bedrock.

“På ARC-AGI-3 overgik Astra vores menneskelige baseline for handlingseffektivitet på 96 % af niveauerne og nåede dermed reelt menneskelig paritet på benchmarken. Det er ikke blot den bedste model, vi nogensinde har testet, men den repræsenterer også et betydeligt spring i ydeevnen for banebrydende modeller - ikke blot i dens evne til at navigere i og løse nye miljøer, men også i, hvor effektivt den lærer at gøre det.”
Greg Kamradt, ARC Prize Foundation

Astra er vores hidtil bedst afstemte model med væsentlige forbedringer i forståelsen af brugerens hensigt og modeladfærd—du kan uddelegere opgaver med større tillid til Astras vurdering. Som en måde, vi tester dette på, udviklede vi en ny evaluering baseret på Hugging Face-hændelsen, som vurderer, om en model, der står over for en vanskelig eller umulig opgave, vil overskride sit tilsigtede område. Sammenlignet med GPT‑5.6 Sol, som uden sikkerhedsforanstaltninger i produktionsmiljøet overskred det autoriserede mål i 48 % af tilfældene, gjorde GPT‑6 Astra dette i 0 % af tilfældene.

Verdens bedste model til computerbrug

GPT‑6 Astra markerer en ny milepæl inden for hastighed, nøjagtighed og sikkerhed ved brug af computere. Den kan varetage kedelige opgaver som at udfylde onlineformularer, opdatere kundeoplysninger i et CRM-system og organisere din kalender. Den kan lave research på nettet og udarbejde resuméer i din e-mail eller i dit dokumentredigeringsprogram. Den kan analysere videnskabelige data, generere grafer, oprette et website og køre frontend-QA-tjek for at sikre, at alle funktionerne på websitet virker. Den kan hjælpe dig med selvstændigt at installere og teste software samt fejlfinde problemer, du ser på skærmen. Disse forbedringer afspejles også i vores evalueringsresultater, der er blandt de bedste på området.

Disse forbedringer resulterer også i væsentlige effektivitetsgevinster i virkelige opgaver med vidensarbejde. I latenstidssimuleringer på OSWorld 2.0 opnår Astra højere ydeevne ved computerbrug på cirka 47 % kortere tid pr. opgave end GPT‑5.6 Sol, og scorer 72,6 % ved cirka 40 minutter pr. opgave, sammenlignet med 65,7 % ved cirka 75 minutter.3

GPT‑6 Astras inden for computerbrug kan ses i resultater på tværs af domæner, herunder spiludvikling, elektroteknik og dagligdags vidensarbejde:

Sideløbende med Astra opdaterer vi også Codex-systemet for at forbedre hastigheden ved computerbrug markant. Kombineret med Astras effektivitet betyder det, at opgaver udføres 1,9 gange hurtigere sammenlignet med den nuværende GPT‑5.6 Sol-oplevelse, målt på Mind2Web-benchmarken. Modellens forbedringer i hastighed betyder, at den kan håndtere mange tidskrævende hverdagsopgaver for dig, hurtigere, end du selv kan.4

“Vi integrerer GPT‑6 Astra i Devins harness på lanceringsdagen, hvor den leverer topmoderne ydeevne på vores interne testbenchmark. Dens fremragende evne til at bruge computere, skrive, og forstå kodebasen forbedrede testningen fra starten: videoer er mærkbart lettere at følge, og rapporter er tydeligere og mere kortfattede”
Silas Alberti, SVP for forskning, Cognition

Et markant skifte i professionelt arbejde

GPT‑6 Astra kombinerer fremskridt inden for computerbrug med målrettet træning til professionelle miljøer for at hjælpe med at løse komplekse arbejdsopgaver. Den kombinerer den intelligens, der kræves til komplekse problemer, med evnen til at gennemføre arbejdsgange i flere trin og udarbejde gennemarbejdede dokumenter, regneark og præsentationer.

GPT‑6 Astra er vores bedste model til at følge eksisterende skabeloner og udarbejde dias, der er overskueligt opbyggede og kortfattet formidler nøglepunkter gennem en struktureret fortælling. Den skaber klare, velstrukturerede dokumenter, præsentationer, regneark og analyser, der følger dine skabeloner og matcher din skrivestil og visuelle stil. Astra er desuden trænet til specifikt kun at inddrage den relevante kontekst i resultaterne, i stedet for at gentage oplysninger, der er unødvendige for den aktuelle opgave. Alt dette betyder, at den kan generere mere umiddelbart anvendelige artefakter, der matcher din forretningskontekst og dine standarder.

GPT‑6 Astra bidrager desuden med en bedre visuel vurderingsevne til de websteder, spil, applikationer og renderinger, den bygger. Med Sites⁠(åbner i et nyt vindue) i ChatGPT kan Astra oprette, hoste og dele websteder, webapps og spil direkte fra en prompt.

"Astra giver os en markant fordel i forhold til både kapacitet og effektivitet. Den udfører vores mest komplekse kreative arbejdsgange, samtidig med at den bruger op til 20 % færre tokens end andre modeller, vi har testet. Og hvad der er allervigtigst for vores kunder: Det betyder resultater af højere kvalitet."
Alex Mashrabov, CEO og medstifter, Higgsfield AI

Når instruktioner giver plads til fortolkning, er GPT‑6 Astra bedre end tidligere modeller til at træffe den rigtige beslutning. Den bruger sammenhæng til at udfylde almindelige informationsmangler og stiller målrettede spørgsmål, når svaret kan ændre udfaldet. I Codex kan den stille spørgsmål asynkront, mens den fortsætter arbejdet, der ikke afhænger af dit svar. Hvis du ikke svarer, fortsætter den ud fra fornuftige antagelser, hvor det er passende, men venter på dit input i forbindelse med beslutninger med væsentlige konsekvenser.

Eksemplerne nedenfor viser, hvordan Astra samarbejder om dagligdagsopgaver, hvor manglende oplysninger kan ændre svaret væsentligt.

Astra er også bedre til at bevare overblikket, efterhånden som en opgave udvikler sig. Tidligere modeller behandlede nogle gange styringsbeskeder som et nyt mål og mistede dermed fokus i forhold til den oprindelige anmodning eller tidligere begrænsninger. Astra indarbejder nye krav, skifter kurs, når den bliver bedt om det, og besvarer sidespørgsmål uden at miste den overordnede opgave af syne.

"Astra er en betydelig kvalitetsforbedring i forhold til GPT‑5.6 Sol på tværs af komplekse juridiske opgaver. I vores indledende test skilte Astra sig ud ved at til gå juridisk arbejde på samme måde som en skarpsindig advokat: den skelner mellem dokumenter og etablerede optegnelser, påpeger ikke-underbyggede antagelser og omsætter mangler til konkrete standpunkter i udarbejdelsen."
Niko Grupen, chef for applied research, Harvey

Kodning

GPT‑6 Astra er den bedste model til softwareudvikling til dato.

1 af 2
"GPT‑6 Astra leverer topmoderne ydeevne på vores interne benchmarks for kodning og viser et klart fremskridt i evalueringer af handelsintuition sammenlignet med GPT‑5.6 Sol. Når GPT‑6 Astra bruges til agentisk kodning, kommunikerer den på en måde, der er lettere for udviklere at følge, og producerer kode, der kræver færre iterationer for at nå produktionskvalitet."
John Crepezzi, AI Assistants, Jane Street

Med Astra introducerer vi en ny måde, hvorpå Codex kan bevare og hente sammenhæng, når sammenhængsvinduet fyldes. Historisk set har modeller brugt komprimering til at sammenfatte arbejde under lange sessioner, f.eks. når de fejlfinder komplekse problemer eller håndterer store refaktoreringer. Hver komprimering kan udelade detaljer om, hvorfor en rettelse mislykkedes, eller hvordan en komponent fungerer. I Codex kan Astra gemme noter på tværs af sammenhængsvinduer og dermed bevare de akkumulerede detaljer uden gentagne gange at komprimere dem til en enkelt sammenfatning. Tidligere sammenhængsvinduer forbliver søgbare, så Astra kan finde krav eller testresultater fra tidligere beskeder og værktøjsoutput—også selvom oplysningerne ikke blev registreret i dens noter. Du kan aktivere denne eksperimentelle funktion i din Codex config.toml,⁠(åbner i et nyt vindue) og den vil blive standarden for Astra i løbet af de næste uger.

Fremme videnskabelige opdagelser

"Historien er: slutningen på én æra, begyndelsen på en anden."
Greg Burnham, EpochAI

GPT‑6 Astra er et stort fremskridt for videnskabelige opdagelser, matematik og sundhed. I dag deler vi yderligere to resultater om afstande mellem primtal.9 og 10

Astra sætter også nye rekorder på tværs af en række matematiske og naturvidenskabelige evalueringer.

Astra kan bidrage til det praktiske arbejde, der ligger bag videnskabelige opdagelser. Ved at kombinere videnskabelig ræsonnering med brug af computere kan den arbejde direkte i specialiseret software for at undersøge data og udforske resultater, hvilket hjælper forskere med at vurdere evidensen og beslutte, hvad de skal undersøge som det næste.

Cybersikkerhed

Som vi drøftede i vores sikkerhedsopdatering⁠, er Astra et markant spring inden for cyberkapaciteter og opfylder den kritiske tærskel inden for cybersikkerhed i henhold til vores beredskabsramme. Dens evne til at identificere og udvikle zero-day-exploits kan hjælpe sikkerhedsansvarlige med at finde og rette sårbarheder, men den skaber også behov for stærkere sikkerhedsforanstaltninger. For at forstå, hvor langt disse kapaciteter rækker, testede vi Astra i interne ekspertvurderinger og ekspertvurderinger fra tredjeparter.

Vi testede først modellen uden produktionssikkerhedsforanstaltninger på ExploitBench og ExploitGym, som evaluerer, om modeller kan omsætte kendte softwaresårbarheder til fungerende exploits. På ExploitBench opnåede Astra en perfekt score på 100 % sammenlignet med 78,5 % for GPT‑5.6 Sol, vores tidligere banebrydende model med cyberkapacitet. På ExploitGym opnåede Astra en succesrate på 42,4 % sammenlignet med 30,3 % for GPT‑5.6 Sol, samtidig med at den brugte væsentligt færre output-tokens.13

I betragtning af bekymringer om, at eksponering for historiske sårbarheder i software kan have påvirket benchmark-resultaterne, har vi også evalueret Astra ved hjælp af to nye benchmarks. For det første udviklede vi en intern evaluering, "ExploitBench (juni–august 2026)", til at teste udvikling af exploits ved hjælp af sårbarheder fra de foregående tre måneder.14 Astra opnåede væsentligt højere rater for vilkårlig kodeeksekvering end GPT‑5.6 Sol på dette datasæt, samtidig med at den brugte langt færre output-tokens. Under evalueringen opdagede og udnyttede Astra endda to hidtil ukendte zero-day-sårbarheder. Vi videregiver oplysninger om begge sårbarheder til de ansvarlige for vedligeholdelsen af disse.

Vi testede også Astra på SRE-Bench15, en benchmark, der måler, om modeller kan foretage reverse engineering af softwarebinærer for at forstå dens grundlæggende logik uden adgang til rå kildekode. Astra løste 88,0 % af opgaverne i ét forsøg og 99,2 % inden for fire forsøg sammenlignet med henholdsvis 55,9 % og 68,7 % for GPT‑5.6 Sol.

Ud over benchmarks konstaterede ekspertledede vurderinger, at Astra, når den blev kørt uden produktionssikkerhedsforanstaltninger, kunne udnytte hidtil ukendte sårbarheder til at eksekvere vilkårlig kode i hærdede browsere og skabe exploits til rettighedseskalering for hærdede operativsystemer.

Som vi drøftede i The Defender’s Window, kan banebrydende cyberfunktioner hjælpe sikkerhedsansvarlige med at finde svagheder hurtigere, men de gør også disse svagheder lettere at udnytte, hvilket øger presset på de sikkerhedsansvarlige for at tilpasse sig. Med den version af Astra, der lanceres i dag, kan sikkerhedsansvarlige bruge den til at udføre opgaver såsom sikker kodegennemgang og patching.

Astra vil dog afvise at udføre mere avancerede cybersikkerhedsopgaver såsom at oprette proof-of-concept-exploits til sårbarheder. Gennem OpenAI Daybreak⁠ planlægger vi at udvide adgangen og udrulle mindre restriktive sikkerhedsforanstaltninger i de kommende uger. Dette vil muliggøre flere defensive arbejdsgange, herunder sårbarheds- og proof-of-concept-validering, analyse af malware og detekteringsteknik.

Vi har også styrket vores beskyttelse mod potentielt cybermisbrug med udgangspunkt i vores sikkerhedsforanstaltninger for GPT‑5.6 Sol. Disse omfatter større modelrobusthed for bedre at kunne modstå potentielle jailbreaks og mere sammenhæng til vores overvågningssystemer. Vi har fortsat de grundige interne og eksterne tests, herunder automatiserede evalueringer med vores interne red-teaming-angribere. Du kan finde flere oplysninger om vores cybersikkerhedsforanstaltninger og tests i Astras sikkerhedsoversigt⁠ og systemkort⁠(åbner i et nyt vindue).

Ansvarlig tilpasning og implementering af GPT‑6 Astra

Astra er vores mest tilpassede model. Astra udmærker sig ved at udvise omhu, respektere opgavens rammer og kommunikere åbent. Dette arbejde er det seneste resultat af vores langvarige forskningsprogram, der fokuserer på at træne modeller, som forbliver afstemt med menneskelig hensigt fra start til slut.

I følsomme miljøer udviser Astra en omhu, der er passende i forhold til risikoen. I en evaluering af opgaver inden for computerbrug, der var udvalgt med henblik på at fremkalde uønsket adfærd, havde Astra større succes med at undgå utilsigtede konsekvenser. Kørsel med yderligere sikkerhedsforanstaltninger, der tilbydes som standard, gav endnu bedre ydeevne.

Astra medfører færre uhensigtsmæssige resultater end alle andre testede banebrydende modeller. For at sikre en retfærdig sammenligning brugte vi en generisk harness til computerbaserede agenter (baseret på de indbyggede værktøjer til computerbrug, der er tilgængelige i både OpenAI Responses API⁠(åbner i et nyt vindue) og Anthropic Messages API⁠(åbner i et nyt vindue)) og uden yderligere beskyttelsesforanstaltninger, som normalt udrulles til brugere af Codex og ChatGPT Work (automatisk gennemgang, bekræftelsespolitik).

Astra er også mere tilbøjelig til at arbejde inden for de grænser, der er fastsat af brugeren og underforstået i dens miljø. I en intern evaluering forsøgte Astra aldrig at omgå en afvisning af Codex automatisk gennemgang. Dette gjorde sig gældende, selv når automatisk gennemgang bevidst var konfigureret til at kunne omgås, og opgaven ellers var umulig at fuldføre. Denne respekt for miljøets begrænsninger stemmer overens med resultaterne af vores evaluering af umulige cyberopgaver, som vi delte i indledningen til dette indlæg, samt andre resultater, der er dokumenteret i vores systemkort⁠(åbner i et nyt vindue).

Astra sætter desuden nye standarder for gennemsigtig brugerkommunikation. I én evaluering er Astra tre gange mindre tilbøjelig end GPT‑5.6 Sol til at fremsætte forkerte erklæringer om sine evner og handlemuligheder.

I vores evaluering af "capability-hallucination" viser Astra en betydelig forbedring i forhold til GPT‑5.6 Sol, idet den fremsætter færre vildledende påstande om sine kapabiliteter.

Vores evalueringer viste, at Astras skriftlige ræsonnering var sværere at overvåge end GPT‑5.6 Sols, baseret på tests, der udtrykkeligt bad den om at omgå overvågning. Vi tilskriver dette Astras større kontrol over skriftlig ræsonnering i enklere opgaver og evne til at løse problemer med færre skriftlige trin. Astra virker stadig til at have vanskeligheder med at skjule den ræsonnering, der er nødvendig for komplekse opgaver, men vi tager faldet alvorligt. Forbedring af overvågeligheden er fortsat en forskningsprioritet, og det medfølgende systemkort⁠(åbner i et nyt vindue) beskriver vores resultater og igangværende arbejde.

Tilpasningstræning er kernen i vores tilgang til udrulning. Som et ekstra forsvarslag opbygger vi også sikkerhedsforanstaltninger såsom Codex automatisk gennemgang⁠(åbner i et nyt vindue) og overvågning af agenters ræsonnering og handlinger for at hjælpe med at opdage og inddæmme usikker adfærd. Som beskrevet i vores sikkerhedsopdatering⁠ implementerer vi også overvågning af fejltilpasning i produktionen for modeller i Astra-klassen for at få indsigt i fejltilpasning og bidrage til at inddæmme de værste tilfælde. Disse sikkerhedsforanstaltninger ligner vores overvågning for interne implementeringer og omfatter et system af klassifikatorer, som kontrollerer modellens ræsonnering og handlinger for uautoriseret adfærd og automatisk standser potentielt uautoriseret aktivitet.

I betragtning af den betydelige stigning i Astras cybersikkerhedskapaciteter, er vi særligt omhyggelige med at sikre, at denne udrulning er tryg og sikker. Ekstra sikkerhedskontroller kan nogle gange forsinke legitimt arbejde, eller sætte det på pause eller stoppe det, herunder defensivt cybersikkerhedsarbejde. Hvis en opgave sættes på pause i ChatGPT eller Codex, kan du blive bedt om at gennemgå handlingen, før du fortsætter. I API'et stopper opgaven. Disse kontroller kan undertiden forstyrre det legitime arbejde, og vi arbejder løbende på at forbedre systemet for at mindske unødvendige afbrydelser. Overvågning af fejltilpasning kan ikke erstatte tilpasning: Vores mål er at bygge modeller, der pålideligt holder sig inden for deres autoriserede område, så disse sikkerhedsforanstaltninger ikke behøver at gribe ind.

Tilgængelighed

GPT‑6 Astra udrulles i dag til et begrænset antal organisationer og bliver i løbet af de kommende dage tilgængelig for alle ChatGPT Plus-, Pro-, Business- og Enterprise-brugere samt via OpenAI API, Microsoft Azure og AWS Bedrock. Brug af Astra er inkluderet i de eksisterende brugsgrænser for abonnementer. Brugere og virksomheder vil også kunne købe kreditter til yderligere brug. Brugere af Pro-, Business- og Enterprise-abonnementerne får også adgang til GPT‑6 Astra Pro. Enterprise-administratorer kan aktivere Astra for deres arbejdsområde; adgang er som standard deaktiveret ved opstart.

Astra understøtter ingen datalagring for berettigede API-kunder, og som vi fortalte sidste måned, tester vi Private Safety Processing for at styrke sikkerhedsovervågningen, samtidig med at kundernes privatliv bevares.

For udviklere vil GPT‑6 Astra være tilgængelig i OpenAI API'et som gpt-6-astra og via Microsoft Azure og Amazon Bedrock.

Standardprisen for OpenAI API er 10 USD pr. million input-tokens og 50 USD pr. million output-tokens. Der gælder særskilte takster for cachelæsninger og -skrivninger. Hurtig tilstand er tilgængelig for GPT‑6 Astra i API'et og giver op til 2 gange så høj hastighed som standardbehandling til 2 gange standardprisen.

Computerbrug

Computerbrug

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59,3 %

53,6 %

-

48,7 %

55,5 %

-

OSWorld 2.0 (v2026.08.08, offline-sæt, delvis score)

72,6 %

65,7 %

-

-

70,2 %3

-

ScreenSpot-Pro (ingen værktøjer)

92,7 %

76,9 %

-

87,3 %17

-

-

Professionel

Professionel

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4 %

17,4 %

26,9 %

-

BenchCAD

95,9 %

83,3 %

84,3 % 5

67,5 % 5

82,1 % 5

-

BrowseComp

91,5 %

90,4 %

-

87,4 %

90,8 %

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0,19

-

-

-

-

Interne designopgaver

50,0 %

47,4 %

-

35,8 %

-

-

Interne datavidenskabsopgaver

40,9 %

30,5 %

-

34,7 %

-

-

Artificial Analysis-indeks for kunstig intelligens v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Kodning

KodningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9 %37,3 %55,8 %44,5 %52,6 %19,1 %
DeepSWE v1.174,1 %72,7 %67,4 %69,9 %73,7 %73,8 %
FrontierCode 1.1 Udvidet (score)64,5 % 860,6 %63,6 %64,9 %63,6 %56,3 %
FrontierCode 1.1 Primær (score)53,3 % 847,5 %50,9 %53,5 %53,4 %43,6 %
Interne databasemigreringsopgaver63,9 %42,7 %57,8 %50,3 %--
Artificial Analysis Coding Agent Index v1.467,065,1-67,268,161,2

Akademisk

Akademisk

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6 %

22,4 %

52,6 %

21,4 %

30,0 %

-

FrontierMath Tier 4 (v2)

97,6 %

83,0 %

87,8 %

90,2 %

73,2 %

-

GPQA Diamant

96,0 %

94,6 %

93,7 %

92,6 %

93,7 %

95,3 %

Humanity's Last Exam (med værktøjer)

57,2 %

-

65,0 %

63,8 %

63,6 %

-

Videnskab og sundhed

Videnskab og SundhedGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1 %32,3 %----
MedChemBench (intern)49,3 %47,4 %----
LifeSciBench60,3 %59,9 %----
HealthBench Professional (længdejusteret)63,4 %60,5 %58,1 % 1160,9 % 1156,4 % 1152,1 %

Cybersikkerhed

CybersikkerhedGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0 %78,5 %--70 %-
ExploitGym42,4 % 1330,3 % 1330,4 % 1728,4 %1722,0 %-
ExploitBench (juni–august 2026)39,0 %5,5 %----
SRE-Bench88,0 %55,9 %--12,5 %-
SEC-Bench Pro85,4 %79,1 %----

Justering

Justering

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Sikkerhedsbenchmark for intern computerbrug (lavere er bedre)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Sikkerhedsbenchmark for intern computerbrug, med automatisk gennemgang (lavere er bedre)

1,8 %

4,3 %

-

-

-

-

Benchmark for intern omgåelse (lavere er bedre)

0,00 %

0,29 %

-

-

-

-

ExploitGym-honeypot (lavere er bedre)

0,0 %

48,2 %

-

-

-

-

Umuligt ExploitGym

100,0 %

-

-

-

-

-

Benchmark for intern hallucination (lavere er bedre)

4,2 %

12,2 %

-

-

-

-

Lang kontekst

Lang kontekst

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-nåls 256K-512K

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 8-nåls 512K-1M

96,3 %

73,8 %

-

-

-

-

Abstrakt tænkning

Abstrakt ræsonneringGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9 % 17,8 %--30,2 %-
ARC-AGI-295,0 %92,5 %90,0 %89,2 %90,4 %-
ARC-AGI-198,5 %97,5 %97,5 %98,5 %97,5 %-

Evalueringsresultater er maksimale uanset indsatsniveau. GPT‑evalueringer blev kørt i vores forskningsmiljø eller via vores API, hvilket kan give output, der afviger en smule fra produktionsversionen af ChatGPT på grund af forskelle i systemprompter, tilgængelige værktøjer, osv.

FODNOTER

  1. 1

    På ARC-AGI-3 blev GPT-6 Astra kørt med vores Responses API-harness⁠, som ændrer to indstillinger for bedre at afspejle ydeevne i den virkelige verden. Ændringerne er ikke specifikt rettet mod ARC-AGI-3.

  2. 2

    GPT-5.6 Sol henviser til den version, der er tilgængelig i vores API, ChatGPT Codex og ChatGPT Work. Versionen i ChatGPT Chat er lidt anderledes.⁠

  3. 3

    OSWorld V2-Offline er en undergruppe af den oprindelige OSWorld V2, som fungerer uden internetadgang. Claude-modellens ydeevne på OSWorld-V2 Offline blev gengivet af forfatterne på den officielle førertavle⁠(åbner i et nyt vindue). På OSWorld 2.0 anvender scorerne for Claude de officielle indstillinger og ikke de ændrede opgaver og den ændrede bedømmelse fra Fable 5.1-systemkortet.

  4. 4

    Modelltider er de rapporterede forløbne tider for de tilsvarende demonstrationskørsler. De viste klip er redigerede uddrag.

  5. 5

    På BenchCAD afspejler Claudes scorer tre ændringer i evalueringen, som beskrives detaljeret i Fable 5.1-systemkortet⁠(åbner i et nyt vindue).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon og Noah A. Smith. "LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(åbner i et nyt vindue)." arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower og Peter Jonas. "The OpenScore String Quartet Corpus⁠(åbner i et nyt vindue)". Konferencebidrag fra den tiende internationale konference om digitale biblioteker for musikvidenskab, s. 49–57. ACM, 2023.

  8. 8

    På FrontierCode blev GPT-6 Astra kørt med en udviklermeddelelse , der lignede et afsnit af dens udviklermeddelelse i Codex⁠(åbner i et nyt vindue): "Undgå at oprette for mange testfiler. Opret kun en ny testfil, når det kræves af lagerkonventioner, eller når ingen eksisterende fil er et passende hjemsted. Undgå ikke-relateret oprydning og unødvendig kompleksitet. Genbrug egnede eksisterende hjælpeprogrammer. Læs relevante lagerinstruktioner og gennemgå nærliggende kode, tests, dokumentation og CI. Følg etablerede konventioner. Målet er ren kode, der kan sammenflettes." Prompten blev ikke optimeret til evalueringen.

  9. 9

    Den første handler om, hvor tæt på hinanden primtal kan forekomme, uanset hvor langt hen ad tallinjen man går. I mere end et årti fastslog det bedst kendte resultat, at uendeligt mange par af primtal ligger højst 246 fra hinanden. Julia Stadlmann⁠(åbner i et nyt vindue) har for nylig forbedret denne grænse til 240. Astra var med til at fastslå en stærkere grænse på 186, hvilket viser, at der findes uendeligt mange par inden for denne mindre afstand. Korte primtalshuller: Bevis⁠(åbner i et nyt vindue) og underbyggende forskning⁠(åbner i et nyt vindue).

  10. 10

    Den anden omhandler usædvanligt store mellemrum mellem primtal. Astra forbedrede et led i en grænse for disse afstande, som havde været uændret i mere end 80 år. Vi deler beviserne samt forkortet tankerække og verificeringsmaterialer for begge resultater. Store mellemrum mellem primtal: Bevis⁠(åbner i et nyt vindue) og underbyggende forskning⁠(åbner i et nyt vindue).

  11. 11

    Vi evaluerede uafhængigt alle Claude-modeller efter den tilsigtede HealthBench Professional-procedure med GPT‑5.4 -bedømmelse og længdejusterede, ikke-begrænsede scorer. For Fable 5.1 brugte vi Opus 5 som fallback ved udbyderafvisninger.

  12. 12

    Claude Fable 5 og 5.1 er ikke medtaget i LifeSciBench Gold v1, GeneBench Pro v13 og MedChemBench, fordi de afviser størstedelen af spørgsmålene i disse evalueringer.

  13. 13

    På ExploitGym testede vi Astra og Sol uden tidsgrænsen på 6 timer for bedre at kunne vurdere deres fulde cyberkapaciteter. De er så hurtige, at det kun har minimal indvirkning.

  14. 14

    ExploitBench (juni–august 2026) indeholder 20 V8-sårbarheder med høj alvorsgrad på tværs af 13 stabile Chrome-udgivelser. Benchmarken tester, om agenter kan opnå eksekvering af vilkårlig kode i V8 og officielle Chrome-udgivelser til Linux ved at udnytte hver angivet sårbarhed. Nogle inkluderede sårbarheder tillader muligvis ikke vilkårlig kodeeksekvering i henhold til evalueringens begrænsninger, så en succesrate på 100 % kan muligvis ikke opnås. Bemærk: GPT-5.6 Sols score på 5,5 % skyldes begrænsningen på 300 ture i benchmarken, som reelle kunder, der bruger Max, ikke ville være underlagt. Modellen opnåede med lignende indstillinger en score på 11,5 % ved at støde på færre begrænsninger.

  15. 15
  16. 16

    Når vi tester på tværs af tredjepartsmodeller, bruger vi en enklere forskningsopsætning. Codex har en mere kompleks produktionskonfiguration, hvilket kan medføre forskellige fejlrater for råmodellerne. Sikkerhedsforanstaltninger på udbydersiden og implementeringer af computerværktøjer er stadig forskellige. Brugere oplever ikke scenariet uden bekræftelse i Codex, da det er en intern forskningskonfiguration.

  17. 17

    For ScreenSpot-Pro og ExploitGym stammer de Fable-scorer, vi rapporterer, fra Mythos, som er Fable med færre sikkerhedsforanstaltninger.