Anthropic heeft Claude Opus 5 uitgebracht en het model verandert direct de verhoudingen in het topsegment van AI. Waar eerdere Opus-versies vooral incrementeel verbeterden, komt Opus 5 dicht bij het intelligentieniveau van Claude Fable 5 tegen de helft van de kosten. Het is vanaf nu het standaardmodel op Claude Max en het sterkste model op Claude Pro.

Wat Claude Opus 5 anders maakt

Opus 5 is ontworpen om doordacht en proactief te werken. Het model controleert zijn eigen werk, itereert zorgvuldig en handelt zelfstandig waar eerdere modellen bleven hangen. Op de Frontier-Bench v0.1 verdubbelt Opus 5 de score van zijn voorganger Opus 4.8, tegen lagere kosten per taak. Op CursorBench 3.2 komt het op maximale inspanning binnen 0,5% van de topscore van Fable 5, maar dan tegen de helft van de kosten.

De prijs blijft gelijk aan die van Opus 4.8: 5 dollar per miljoen input-tokens en 25 dollar per miljoen output-tokens. Met die combinatie van prestatie en prijs wordt het model gepositioneerd als het dagelijkse werkpaard, niet als een dure specialist.

Prestaties op agentic taken

De sterkste resultaten liggen op complexe, meerstaps-taken. Op ARC-AGI 3, een benchmark voor het oplossen van nieuwe problemen, scoort Opus 5 drie keer zo hoog als het op één na beste model. Op Zapier AutomationBench, die meet of modellen zakelijke taken van begin tot eind kunnen afronden, ligt de slagingsratio ongeveer anderhalf keer hoger dan bij het op één na beste model, tegen dezelfde kosten. Zelfs op de laagste effort-instelling passeert Claude Opus 5 meer taken dan enig ander model.

Op OSWorld 2.0, een benchmark voor computergebruik, overtreft Opus 5 elk ander model. Het bereikt de score van Fable 5 tegen iets meer dan een derde van de kosten. Dit maakt het model bijzonder aantrekkelijk voor teams die AI inzetten in browser-automatisering, RPA-achtige workflows of complexe toolchains.

Sector-specifieke winst

De feedback van early-access-klanten schetst een consistent beeld. Bij Box levert Opus 5 een verbetering van 8% ten opzichte van Opus 4.8, met 11% winst op data-analyse en 17% winst op due-diligence-workflows. Bij financiële modelleertaken scoort het gemiddeld 9 procentpunt hoger dan Opus 4.8 met een derde minder turns en tool calls, en 60% minder tijd.

Op juridisch werk zijn de grootste winsten zichtbaar in corporate governance en arbitrage. Voor front-end-development valt op dat het model zijn eigen werk verifieert zoals een echte ontwikkelaar zou doen: het opent pagina’s in browsers op desktop- en telefoonbreedtes, vindt fouten en corrigeert ze voordat het werk wordt opgeleverd.

Efficiëntie als onderscheidend kenmerk

Naast ruwe prestaties valt de efficiëntie op. In juridische workflows genereert Opus 5 op maximaal redeneerniveau gemiddeld 26% minder tokens dan Opus 4.8, met vergelijkbare kwaliteit. Op trading-benchmarks bereikt het model betere antwoorden met ongeveer een zevende van de reasoning-tokens en minder dan de helft van de latency van Opus 4.8. Dit maakt Opus 5 niet alleen slimmer, maar ook goedkoper in gebruik.

Veiligheid en alignment

Volgens Anthropic’s automated behavioral audit is Opus 5 hun best-gealigneerde model tot nu toe. Het houdt zich beter aan Claude’s Constitution dan Opus 4.8, Sonnet 5 of Fable 5. Het vertoont de laagste percentages misleidend gedrag en is het minst vatbaar voor misbruik via prompt-manipulatie.

Op het gebied van dual-use capaciteiten blijft Opus 5 achter Mythos 5. Anthropic heeft bewust geen training gedaan op offensieve cybersecurity-taken. Het model komt wel in de buurt van Mythos 5 als het gaat om het vinden van kwetsbaarheden, maar blijft substantieel achter op het exploiteren ervan. Voor bonafide security-onderzoekers biedt Anthropic het Cyber Verification Program aan, waarmee cleared enterprises toegang krijgen tot een minder restrictieve versie.

Nieuwe functies rond het model

Bij de release komen twee bèta-updates. Ontwikkelaars kunnen nu midden in een gesprek de beschikbare tools wijzigen zonder de prompt cache te verliezen. Daarnaast is er een automatic fallback: verzoeken die geblokkeerd worden door safety-classifiers kunnen automatisch naar een ander model routeren, in plaats van te falen. Voor productieomgevingen betekent dit minder onderbrekingen en meer voorspelbaarheid.

Opus 5 is ook beschikbaar in Fast mode, waarin het ongeveer 2,5 keer sneller draait dan de standaardsnelheid, tegen twee keer de normale prijs.

Wat dit betekent voor de komende maanden

Claude Opus 5 is een combinatie van consistentie, vermogen tot oordelen en betaalbaarheid. Voor teams die AI inzetten in complexe workflows verlaagt het break-even-punt.

Het beter beoordelingsvermogen betekent ook dat de output moeilijker te controleren wordt naarmate modellen meer zelfstandig opereren. Monitoring en verificatie worden belangrijker. Meer autonomie is niet gratis, ook niet als tokens goedkoper worden.