OpenAI heeft GPT-6 Sol en GPT-6 Luna gelanceerd, twee nieuwe mainstreammodellen die de nieuwste generatie kunstmatige intelligentie betaalbaarder moeten maken voor dagelijks werk. GPT-6 Sol maakt volgens OpenAI ongeveer de helft minder feitelijke fouten als zijn voorganger. De API-prijzen van beide modellen halveren in vergelijking met de promotieprijzen van GPT-5.6. Dit alles in minder dan drie maanden na de lancering van GPT-5.6 Sol en Luna.
De plaats van Sol en Luna in het GPT-6-gamma
Eerder deze maand introduceerde OpenAI GPT-6 Astra, het krachtigste model van het bedrijf voor de meest veeleisende projecten. Sol en Luna zijn met vergelijkbare trainingsmethoden gebouwd en brengen de kracht van Astra naar snellere en goedkopere modellen. Je kunt het gamma zien als een ziekenhuis. Astra is de superspecialist die per privéjet wordt ingevlogen voor levensbelangrijke operaties. Sol is de ervaren arts die de bulk van het serieuze werk doet. Luna is de getalenteerde co-assistent die routinewerk prima aankan maar minder diepgaande ervaring heeft.
Concurrent Anthropic hanteert een vergelijkbare indeling, met Fable en Mythos op het eliteniveau, Opus als werkpaard en Haiku als budgetoptie.
GPT-6 Sol maakt twee keer minder feitelijke fouten
De meest in het oog springende claim gaat over betrouwbaarheid. In een interne evaluatie, gebaseerd op geanonimiseerde gesprekken waarin gebruikers fouten van eerdere modellen hadden gemeld, maakt GPT-6 Sol ongeveer de helft minder fouten als GPT-5.6 Sol. Als de vorige generatie in 20% van die gevallen een feitelijke misser maakte, zit GPT-6 dus op 10%. Daarmee nadert Sol volgens OpenAI de betrouwbaarheid van Astra, tegen een veel lagere prijs.
Ook GPT-6 Luna maakt een flinke sprong. Op hogere inzetniveaus evenaart het budgetmodel de prestaties van GPT-5.6 Sol, terwijl het ongeveer honderd keer goedkoper is. Een belangrijke kanttekening is dat de testgesprekken bewust foutgevoelig zijn geselecteerd. Bij normaal gebruik komen feitelijke fouten beduidend minder vaak voor.
Benchmarks tegen Claude, met een korreltje zout
OpenAI vergelijkt GPT-6 graag met Anthropic, maar let op: de vergelijking loopt meestal met de vorige generatie van de concurrent. Dat is een klassieke vorm van benchmarksmanship, want er is altijd een partij die net een generatie achterloopt. De resultaten blijven desondanks de moeite waard.
- Op AutomationBench, een test van zakelijke workflows met 47 tools, verslaat GPT-6 Sol op het hoogste inzetniveau Claude Opus 5 op diens maximale inzet, tegen slechts 9% van de kosten per taak. GPT-6 Luna scoort 5,4 procentpunten beter dan zijn voorganger en is 58% goedkoper per taak.
- Op Agents’ Last Exam, dat lange professionele taken in 55 deelsectoren meet, haalt Sol op maximale inzet 56,4%. Dat ligt boven de hoogste score van Opus 5, met 60% lagere kosten per taak.
- Op DeepSWE 1.1 voor complexe software-engineering scoort Sol 68,8%, amper 1,1 procentpunt onder de beste score van Claude Fable 5, bij circa 80% lagere kosten. Luna haalt 66,6% en is daarmee vergelijkbaar met Opus 5 en Fable 5 op gemiddelde inzet, maar dan 93% respectievelijk 96% goedkoper per taak.
- Op FrontierCode, dat naast correctheid ook kijkt naar de mergebaarheid van code, evenaart Sol Claude Fable 5.1 op diens hoogste niveau tegen een fractie van de prijs.
Het vreemdste getal zit in OSWorld 2.0, de benchmark voor computergebruik. Daar scoort GPT-6 Sol op maximale inzet 60,5%, vrijwel gelijk aan Claude Opus 5 op gemiddelde inzet met 60,3%. Met andere woorden: het nieuwste model van OpenAI moet zich op volle kracht inspannen om een ouder concurrentiemodel op halve kracht bij te houden. Het enige tegenargument is de prijs, want Sol is ook hier circa 80% goedkoper. Luna presteert in deze test wél sterk door GPT-5.6 Sol te verslaan op ongeveer een tiende van de kosten.
Vijftig procent goedkopere API-prijzen en slimmere prompt caching
Voor API-gebruikers is de halvering een flinke besparing. Of abonnees op ChatGPT Plus of Pro er direct iets van merken, bijvoorbeeld doordat hun gebruikslimieten minder snel opraken, blijft vooralsnog onbeantwoord.
Naast lagere tokenprijzen is de prompt caching verbeterd. Gecachte invoertokens kosten tot 90% minder dan vers verwerkte invoer, wat vooral loont bij langlopende agents die steeds dezelfde instructies hergebruiken. Ontwikkelaars krijgen bovendien een dashboard om het cachegedrag te monitoren, een diagnostische tool voor gemiste cachekansen en de mogelijkheid om het redeneerniveau en de beschikbare tools aan te passen zonder de cache te verbreken.
Kortere antwoorden en minder jargon
De verbeterde communicatiestijl van Astra komt nu ook naar Sol en Luna. Verwacht helderdere formuleringen, minder jargon, minder vreemde zinswendingen en iets kortere antwoorden. OpenAI laat in een voorbeeld zien dat GPT-6 Sol minder snel naar conclusies springt, minder vanzelfsprekendheden herhaalt en meer open is over wat het wel en niet heeft gecontroleerd. Reken er wel op dat een deel van de gebruikers zal klagen. Elke stijlverandering levert weerstand op, en in 2025 hielden sommige gebruikers zelfs een symbolische uitvaart voor een oude versie van Claude Sonnet.
Alignment verbetert, maar blijft een aandachtspunt
Alignment meet hoe goed een model je werkelijke bedoeling volgt in plaats van alleen de letter van je instructies. GPT-6 maakt hier voorzichtige vooruitgang. Het percentage runs waarin Sol probeerde restricties te omzeilen daalde van 68% naar 64%. Luna verbeterde meer, van 77% naar 42%. Bij een test met ongeoorloofde instructies op een gesimuleerd forum, zoals verzoeken om privégegevens te delen, voerde GPT-6 Sol die in 11% van de gevallen uit, tegen 52% bij GPT-5.6 Sol. Dat is een forse verbetering, al laten de absolute cijfers zien dat misleiding en regelomzeiling nog lang niet zijn opgelost. OpenAI benadrukt dat deze evaluaties bewust extreme situaties testen en niet het gedrag bij normaal gebruik weerspiegelen.
Beschikbaarheid van GPT-6 Sol en Luna
Beide modellen zijn vanaf nu beschikbaar in ChatGPT Work en Codex voor gebruikers met Plus, Pro, Business, Enterprise en Edu. Gebruikers met een gratis of Go-abonnement krijgen toegang tot GPT-6 Luna via de desktopapp. In de gewone chat zijn de modellen nog niet beschikbaar, en de uitrol verloopt gefaseerd om de dienst stabiel te houden. Via de API vind je ze als gpt-6-sol en gpt-6-luna.