OpenAI heeft donderdag GPT-6 Astra gelanceerd, de opvolger van GPT-5.6 Sol en volgens het bedrijf het slimste en best uitgelijnde model ter wereld. Tijdens de persbriefing verklaarde Greg Brockman, “I think it’s not unreasonable to feel that we are now in the AGI era”. Op de vraag of OpenAI hiermee officieel AGI declareerde, antwoordde hij dat de term niet langer aan een contractuele trigger hangt zoals in de deal met Microsoft. Hij noemde AGI een missieconcept of spiritueel concept en sloot de briefing af met de woorden “Welcome to the AGI era.”
Of jij die claim gelooft, moet je zelf beslissen. De benchmarks en context geven in elk geval stof tot nadenken.
De grootste trainingsrun uit de geschiedenis van OpenAI
Astra is volgens onderzoeker Aidan Clark de grootste trainingsrun die OpenAI tot nu heeft uitgevoerd. Het is de eerste keer dat het bedrijf een model trainde op meer dan 100.000 GPU’s op de Stargate-site in Texas. Ook nieuw is dat eerdere OpenAI-modellen een rol speelden bij het superviseren van het trainingsproces.
De lancering verloopt gefaseerd. Enterpriseklanten in het Daybreak-programma krijgen als eerste toegang. Daarna volgen Plus, Pro, Business en Enterprise klanten en OpenAI API gebruikers. Abonnees op Pro, Business en Enterprise krijgen ook toegang tot GPT-6 Astra Pro. Anders dan bij GPT-5.6 kondigde OpenAI geen kleinere varianten zoals Luna, Terra of Sol aan.
Sterke benchmarks
Op DeepSWE v1.1, een test met 113 agentische programmeertaken, scoorde Astra 74,1% tegenover 70,8% voor Sol. Meta meldde deze week echter 75,4% voor Muse Spark 1.3 op de hoogste redeneerstand. Die stand zit nog in een veiligheidsreview en is voor niemand beschikbaar. Het verschil van 1,3 punt staat gelijk aan een of twee taken, maar het laat zien hoe ver Meta is gekomen. De publieke leaderboard zet Gemini 3.8 Flash en Claude Opus 5 op 74% en Sol op 73%. De grafiek van OpenAI laat Muse bovendien weg en gebruikt een score van 67,4% voor Fable 5.1. Daardoor lijkt de voorsprong groter dan hij is.
De uitschieter is ARC-AGI-3 met 98,6%. OpenAI rapporteert zelf scores tot 99,9% en spreekt van menselijke pariteit op 96% van de opdrachten.
Astra haalde ook 97,6% op FrontierMath Tier 4, gebaseerd op 41 besloten problemen uit een tier van 43. Beheerder Epoch AI werd voor deze benchmark gefinancierd door OpenAI en gaf het bedrijf exclusieve toegang tot een deel ervan.
Verder scoorde Astra 95,9% op de Vision2Code-subset van BenchCAD, waar modellen CAD-programma’s reconstrueren uit gerenderde beelden. Fable 5.1 bleef steken op 84,3% en Sol op 83,3%. Op Terminal-Bench Science haalde Astra 64,6% tegenover 52,6% voor Fable 5.1.
Codex en computergebruik worden volwassen
Codex gebruikte tot nu toe compaction, waarbij eerdere stappen worden samengevat om ruimte vrij te maken in het contextvenster. Daarbij verdwijnt soms de informatie die je later nodig hebt, zoals waarom een fix mislukte of welke tests al hadden gedraaid. Astra kan aantekeningen bewaren over contextvensters heen en eerdere berichten en uitvoer van tools doorzoeken.
Astra kan een vraag stellen zonder werk stil te leggen dat niet van het antwoord afhangt. Een onopgeloste keuze blokkeert zo niet langer de hele taak. Op OSWorld 2.0 scoorde Astra 72,6% tegenover 65,7% voor Sol. De gemiddelde tijd per taak zakte van 75 naar 40 minuten. Met het vernieuwde Codex-harness voltooide Astra taken op Mind2Web 1,9 keer sneller.
Cybersecurity op Critical-niveau
Astra is het eerste model dat de Critical-drempel voor cybersecurity in het Preparedness Framework van OpenAI bereikt. In tests ontwikkelde het model exploits voor browsers en besturingssystemen. Tijdens een evaluatie van V8, de javascript engine van Chrome, vond Astra twee tot dan toe onbekende lekken.
Op ExploitBench, dat meet of een model bekende kwetsbaarheden omzet in werkende exploits, scoorde Astra 100%.
De standaardversie weigert geavanceerd cyberwerk zoals het ontwikkelen van exploits. Via Daybreak Blue krijg je toegang. In de API stopt een veiligheidscontrole een taak volledig in plaats van te wachten op goedkeuring. Mia Glaese van OpenAI waarschuwde dat gebruikers vertragingen, pauzes en blokkades kunnen verwachten, ook bij werk dat niets met cybersecurity te maken heeft. “At launch, this is something that people should expect,” zei ze.
Beter uitgelijnd en toch moeilijker te volgen
De claim dat Astra het best uitgelijnde model is, steunt op een interne test met onmogelijke taken. Waar Sol zonder productiebeveiliging in 48,2% van de gevallen buiten het toegestane doel ging, deed Astra dit nooit. In honeypottests naar aanleiding van het Hugging Face-incident probeerde Sol in 56% van de tests de omringende infrastructuur binnen te dringen. Astra deed dat niet. Het model probeerde ook nooit een afwijzing van Codex Auto-Review te omzeilen.
OpenAI gaf aan dat de redenering van Astra moeilijker te monitoren is dan die van Sol. Het model lost eenvoudige problemen op met minder geschreven stappen en heeft meer controle over wat het opschrijft. “Progress in intelligence does not guarantee progress in alignment,” zei chief scientist Jakub Pachocki. OpenAI legt de verdere opschaling stil tot het vertrouwen in de monitoring is hersteld. Als tweede verdedigingslaag draait er in productie een systeem van classifiers dat redenering en gedrag controleert en verdachte activiteit automatisch stopt.
Wat kost GPT-6 Astra
In de API kost Astra 10 dollar per miljoen inputtokens en 50 dollar per miljoen outputtokens. Dat is 2,5 keer de huidige promotieprijs van Sol en evenveel als Anthropic vraagt voor Fable 5.1. Muse van Meta kost 1,25 en 4,25 dollar en Gemini 3.8 Flash start bij 0,75 en 3,75 dollar.
Een hogere tokenprijs betekent niet automatisch een hogere rekening. OpenAI stelt dat Astra taken in minder stappen afrondt en minder tokens verbruikt. Een partner meldt tot 20% minder tokengebruik in complexe creatieve workflows. Of die besparing de prijspremie dekt, valt met de huidige data nog niet vast te stellen. “The price per task is what matters,” aldus Brockman. Wie snelheid wil, kan in de API kiezen voor Fast mode. Die levert tot twee keer de snelheid voor twee keer de prijs.
Welkom in het AGI-tijdperk
GPT-6 Astra is meetbaar het sterkste model dat OpenAI ooit uitbracht. De AGI-verklaring van Brockman is vooral framing, want een spiritueel concept valt niet te meten.