Anthropic heeft op maandag 28 september Claude Sonnet 5.5 gelanceerd, zes dagen na Opus 5.5. Het is het tweede model in de Claude 5.5 familie, en het zet een duidelijke stap. Sonnet 5.5 genereert meer dan 30% sneller output, kost per taak tot 30% minder en komt op de meeste benchmarks binnen enkele punten van Opus 5.5. Opus 5.5 kost per token wel het dubbele.
Hoeveel Sonnet 5.5 je echt kost, hangt sterk af van de effort-instelling.
Wat is Claude Sonnet 5.5?
Sonnet is het werkpaard van Anthropic en zit tussen het grote Opus en het kleine, goedkope Haiku in. Anthropic positioneert Sonnet 5.5 als een snellere, goedkopere aanvulling op Opus 5.5. Volgens het bedrijf is het model het sterkst in afgebakende dagelijkse taken, het fixen van bugs en het maken van verzorgde documenten, slides en spreadsheets. Early testers wijzen daarnaast op een goed oog voor design. Het model werkt user interfaces netjes af en volgt slide templates zo nauwkeurig dat decks weinig nabewerking vragen.
In een interne test kreeg Sonnet 5.5 de kwartaalcijfers en call transcripts van een beursgenoteerd bedrijf, samen met een slide template. De opdracht was een operationele review van tien slides. Twee experts vonden de eerste versie meteen klaar om te versturen.
Sonnet 5.5 neemt ook de schrijfstijl van Opus 5.5 over. Teksten klinken helderder en natuurlijker dan bij de vorige generatie, en testers noemen het model een betere partner om mee samen te werken dan Sonnet 5.
Benchmarks van Sonnet 5.5 tegenover Opus 5.5 en GPT-6
De grootste sprong zit in coding. Enkele cijfers die Anthropic en onafhankelijke testers publiceerden:
- Terminal-Bench 4.0 meet hoe goed agents taken via de command line uitvoeren. Sonnet 5.5 scoort 70,6%, tegenover 10,3% voor Sonnet 5 en 66,4% voor Opus 5.5. De beheerders van de benchmark merken op dat Sonnet 5 geregeld tegen timeouts en tokenlimieten aanliep, wat die lage score deels verklaart.
- CursorBench 4.0 gebruikt taken uit echte Cursor sessies. Sonnet 5.5 haalt 55,5% en zit daarmee op ongeveer twee percent punten van Opus 5.5.
- FrontierCode van Cognition controleert of een codewijziging zonder menselijke aanpassingen gemerged kan worden. Sonnet 5.5 haalt 52,1%, Opus 5.5 54,4% en GPT-6 Sol van OpenAI 49,3%.
- GDPval-AA rangschikt modellen op echte taken uit 44 beroepen. Sonnet 5.5 scoort 1.844 Elo, twee punten onder Opus 5.5 en zo’n 400 punten boven Sonnet 5. GPT-6 Sol blijft steken op 1.487.
Ook op de Intelligence Index van Artificial Analysis, die elk model door dezelfde reeks tests haalt, springt Sonnet 5.5 meteen naar de tweede plaats met 56 punten. Opus 5.5 staat eerst met 58, GPT-6 Astra volgt met 53 en GPT-6 Sol met 48. Sonnet 5 zat op 38 punten, wat neerkomt op een sprong van 18 punten in één generatie.
Een lichtere test die toch iets zegt over langlopend werk en beeldbegrip: Sonnet 5.5 is het eerste Sonnet model dat Pokémon Red uitspeelt op basis van alleen screenshots.
Waar Sonnet 5.5 achterblijft
Op feitenkennis is het verschil met Opus groter. Op AA-Omniscience beantwoordt Sonnet 5.5 54% van de vragen correct, Opus 5.5 haalt 66%. Opvallend is dat Sonnet 5.5 minder vaak hallucineert, met een rate van 47% tegenover 59% bij Opus. Op Humanity’s Last Exam en SciCode zit het model ongeveer zes punten achter.
Prijs en tokengebruik bepalen de echte kost
De lijstprijs van Sonnet 5.5 blijft gelijk aan die van Sonnet 5. Je betaalt $2 per miljoen input tokens, $10 per miljoen output tokens en $0,20 per miljoen tokens voor cache reads. Dat is exact de helft van Opus 5.5, dat na een prijsverlaging op $4 en $20 staat, en even duur als GPT-6 Sol.
De besparing van tot 30% per taak komt uit efficiëntie. Sonnet 5.5 heeft voor hetzelfde werk doorgaans veel minder tokens nodig. Een financiële klant zag het gebruik dalen van zo’n 497.000 naar 121.000 tokens per antwoord, bij een betere kwaliteit. Op meerdere benchmarks verslaat Sonnet 5.5 op Low of Medium effort de beste score van Sonnet 5 voor ongeveer een tiende van de kost per taak.
De keerzijde van Max effort
Draai je het model op zijn hoogste stand, dan verandert het prijskaartje. Artificial Analysis mat in die modus gemiddeld 193.000 output tokens per taak, het hoogste cijfer dat de testers ooit registreerden. Dat is ongeveer 60% meer dan Opus 5.5 en zeven keer zoveel als GPT-6 Astra. Een taak uit de Intelligence Index kost daardoor ongeveer $7,60, tegenover $5,98 voor Opus 5.5 en $1,06 voor GPT-6 Sol.
De High-instelling bleek volgens Artificial Analysis het meest competitief. Op de laagste standen levert GPT-6 Sol meer prestaties met minder tokens. De praktische les is dat het goedkopere model duurder kan uitvallen dan Opus als je het op Max laat draaien.
Effort-instellingen slim kiezen
Met het effort level balanceer je kost en snelheid tegen kwaliteit. In Claude Code en de Claude apps staat de standaard op Medium, op het Claude Platform op High. Op lagere standen antwoordt Claude sneller en verbruikt het minder tokens. Op hogere standen redeneert het langer en controleert het zijn werk grondiger.
- Low of Medium is geschikt voor routinewerk, snelle iteraties en kleine bugfixes. Hier haal je het grootste prijsvoordeel.
- High werkt goed voor serieuzer codewerk en agents. Op FrontierCode evenaart Sonnet 5.5 op deze stand de beste score van GPT-6 Sol voor ongeveer een vijfde van de kost per taak.
- Max is zelden nodig. Op FrontierCode scoorde Sonnet 5.5 op Max zelfs lager dan op Xhigh, omdat het vaker een code review via subagents opstartte en daardoor buiten de scope van de taak ging.
Wat early testers melden
De ervaringen van enkele bedrijven:
- Epic Games liet Sonnet 5.5 tienduizenden regels code voor gameplay architectuur beheren. Volgens COO Daniel Vogel haalde het model “the same quality bar you’d expect from a higher-tier model”.
- Over 118 echte app builds haalde Sonnet 5.5 dezelfde kwaliteit als Opus 5, in gemiddeld 3,6 iteraties tegenover 7,7. Het had de minste mislukte tool calls en stopte zelden om de gebruiker een vraag te stellen.
- Bij Unity voltooide het model 90% van de taken in een benchmark met meerdere stappen in de Unity Editor.
- Een supportteam verwerkte tickets 20% sneller en zag minder foute beslissingen.
- Slackbot deed het beter op bijna alle offline evals, zonder aangepaste prompts, met ongeveer 14% minder output tokens.
- Atlassian verwacht dat teams hun Rovo Agents tot 30% sneller laten draaien.
Een terugkerend punt is dat Sonnet 5.5 tool calls vaker bundelt. Een tester zag een derde minder tool calls en ongeveer de helft minder shell runs per taak. Een andere tester merkte dat de neiging van Sonnet 5 om te vaak naar web search te grijpen verdwenen is.
Strengere safeguards en een migratiestap
Anthropic schat de cybersecurity capabilities van Sonnet 5.5 in op het niveau van Opus 5. Daarom is dit het eerste Sonnet model met dezelfde soort cyber safeguards als de krachtigste modellen. Gewoon bugs zoeken en fixen blijft mogelijk. Verzoeken met een hoger security risico vallen terug op Sonnet 5. Voor biologie gelden dezelfde safeguards als bij Sonnet 5.
Nieuw zijn ook classifiers tegen distillation, waarbij aanvallers via duizenden nepaccounts de redenering van een model proberen te extraheren om er hun eigen modellen mee te trainen.
Sonnet 5.5 is beschikbaar in de Claude apps, Claude Code en de API onder de model ID claude-sonnet-5-5, en via Amazon Web Services, Google Cloud en Microsoft Azure.
Welk model wordt je nieuwe standaard?
Voor de meeste teams ligt het voor de hand om Sonnet 5.5 als default te nemen en Opus 5.5 te reserveren voor architectuur, lange onderzoeken met veel onzekerheid en werk waar een verkeerde route duur is. Een tester vatte een goede werkverdeling samen: laat Opus het framework uitzetten en Sonnet het implementeren.
Voor toepassingen met enorme volumes heeft Anthropic nog geen antwoord. GPT-6 Luna kost $0,10 per miljoen input tokens, een twintigste van Sonnet 5.5. Haiku 5.5 volgt in de komende weken. Wie nu zijn modelkeuze herziet, doet er goed aan om tegelijk zijn effort-instellingen te herbekijken, want daar zit bij Sonnet 5.5 het grootste verschil in wat je betaalt.