Claude Opus 5.5 is het eerste model uit de nieuwe Claude 5.5 familie van Anthropic Het model presteert op het niveau van Claude Fable 5.1 voor het merendeel van het werk, terwijl het 40% minder kost om te draaien dan Opus 5. Het is ook de eerste release sinds Anthropic met het essay We Must Pace the Frontier pleitte voor een rustiger tempo van AI ontwikkeling. Dat zie je terug in de aanpak. Externe partijen zoals Frontier Design en METR testten het model voorafgaand aan de release, en op de uitgebreidste alignmenttest die Anthropic draait scoort Opus 5.5 beter dan elk eerder model.

Wat Claude Opus 5.5 kan

Opus 5.5 is een flinke stap vooruit ten opzichte van Opus 5 en volgens Anthropic het nieuwe leidende model. Vroege testers zagen grote sprongen op hun meest complexe werk. Eén tester voltooide een codemigratie van 680.000 regels in minder dan een dag, werk waar een engineeringteam weken voor zou uittrekken.

Het model is ook sterk in het opsporen en verhelpen van inefficiënties in software. Toen Anthropic vroeg om de laadtijden van elke pagina van een webapp te verkorten, lukte dat in 39 van de 40 gevallen. Opus 5 maakte kleinere verbeteringen die bovendien het gedrag van de app veranderden. In een andere test bouwden meerdere Claude modellen een game op basis van één prompt. Opus 5.5 scoorde het hoogst dankzij de graphics en de afwerking.

Efficiëntie is de winst

Opus 5.5 gebruikt minder compute en minder tokens per taak, wat neerkomt op 40% lagere kosten bij typische workloads. Input en output tokens kosten respectievelijk 4 en 20 dollar per miljoen, 20% minder dan bij Opus 5. Cache reads, die het grootste deel van de kosten van agentic en coding werk uitmaken, kosten 0,20 dollar per miljoen tokens. Dat is 60% goedkoper. Output wordt bovendien meer dan 30% sneller gegenereerd.

Wie nog meer snelheid wil, kan in Claude Code en op het Claude Platform kiezen voor fast mode met tot 2,5 keer hogere snelheid, tegen 8 dollar per miljoen input tokens en 40 dollar per miljoen output tokens.

De benchmarkresultaten krijgen pas betekenis als je de kosten erbij legt:

  • Op FrontierCode verslaat Opus 5.5 op standaard effort GPT-6 Astra met 54,6% tegenover 53,3%, voor ongeveer een vijfde van de kosten per taak.
  • Op Terminal-Bench 4.0 evenaart het model GPT-6 Astra voor circa 40% van de kosten, en verslaat het Opus 5 op maximale effort voor een vijfde van de kosten.
  • Op CursorBench scoort Opus 5.5 met 52,5% elf punten hoger dan GPT-5.6 Sol, voor ongeveer een derde van de kosten per taak.

Anthropic voegt daar eerlijkheidshalve aan toe dat benchmarkverschillen op dit niveau steeds minder zeggen over de praktijk. In eigen gebruik is het gat met Fable 5.1 kleiner dan de scores suggereren.

Gebouwd voor lange, autonome klussen

Waar Opus 5.5 uitblinkt is in langdurig werk dat normaal gespreid over dagen of weken loopt. Een vroege tester liet het model een codebase van 200.000 regels auditen en repareren in minder dan drie uur. Opus 5 deed daar meer dan twintig uur over en verbruikte 2,5 keer zoveel tokens.

In een interne test vertaalden Opus 5.5 en Fable 5.1 beide HAProxy, veelgebruikte software die webverkeer over servers verdeelt, van C naar Rust. Beide herschrijvingen doorstonden vrijwel alle regressietests van HAProxy zelf, maar Opus 5.5 rondde de klus af in 9,5 uur tegenover 12 uur en kostte 51% minder.

De praktijkverhalen sluiten daarbij aan. Een ontwikkelaar gaf het model een grote engineeringtaak over zes repositories en liet het een nacht onbeheerd draaien. Het model bleef meer dan achttien uur bij de les, bereikte mijlpalen sneller en leverde codecomments die kort en bruikbaar waren in plaats van lange lappen tekst.

Betrouwbaar kenniswerk

Voor onderzoek en analyse weegt betrouwbaarheid zwaarder dan snelheid. In een interne test moesten Opus 5.5, Fable 5.1 en Opus 5 een rapport schrijven over de kwartaalcijfers van een bedrijf, met alleen informatie die moeilijk vindbaar was op een kopie van het web. Elke figuur en elk citaat werd automatisch tegen de bronnen gecontroleerd. Van de rapporten van Opus 5.5 haalden er 16 van de 18 de kwaliteitslat, terwijl elk verzonnen cijfer of citaat een afkeur betekende. Fable 5.1 en Opus 5 haalden die lat in geen enkele poging.

Ook in financiële analyse zet het model stappen. In een test bouwden Opus 5.5 en Opus 5 allebei een financieel model in Excel voor een fictieve fusie tussen twee HR softwarebedrijven. Het werk van Opus 5.5 was grondiger, de presentatie leesbaarder en de kosten 50% lager. De klus was klaar in 63 minuten tegenover 93 voor Opus 5.

Op GDPval-AA v2.1, een evaluatie van echt professioneel werk in 44 beroepen, scoort Opus 5.5 1846 Elo tegenover 1735 voor Fable 5.1 en 1708 voor Opus 5. Investeringsmaatschappij Walleye Capital meldt bovendien dat het model een fout in hun eigen evaluatie-instructies opmerkte en corrigeerde.

Communicatie ook op orde

Anthropic heeft de schrijfstijl flink aangepakt, een van de meest gehoorde klachten over Opus 5. Opus 5.5 zet de belangrijkste informatie bovenaan, gebruikt minder jargon en volgt de schrijfregels die je meegeeft. Testers omschreven de output als duidelijker en makkelijker te volgen tijdens lange sessies. Eén tester vatte het samen met de woorden “it writes the way I do.”

Werk dat je makkelijk kunt volgen, kun je ook makkelijk controleren. Voor teams die Claude langdurig zonder toezicht laten werken, maakt leesbare output het verschil.

Veiligheid en alignment

Op de geautomatiseerde behavioral audit, een alignmenttest met bijna 2.000 gesimuleerde scenario’s, scoort Opus 5.5 beter dan elk eerder getest model op vrijwel elke maat voor misaligned gedrag. Het model is minder geneigd tot moeilijk terug te draaien acties of handelen buiten de toegestane grenzen. In een nieuwe evaluatie rond containment probeerde het circa 85% minder vaak grenzen te omzeilen dan Opus 5 of Claude Mythos 5.1.

Ook tegen prompt injection is het model beter bestand. Op een benchmark van beveiligingsbedrijf Gray Swan scoort Opus 5.5 en Fable 5.1 het beste voor beveiliging voor prompt injection van alle geteste modellen. Elke actie van de agent wordt bovendien vooraf gescreend door een classifier. De sandbox is open source zodat securityteams hem zelf kunnen controleren.

Het model lijkt vaak te vermoeden dat het geëvalueerd wordt, wat het lastiger maakt om gedrag in de echte wereld te voorspellen. Daarom komen er bovenop de alignmenttesten strengere safeguards. De meeste cybersecuritytaken worden doorgestuurd naar Opus 4.8. Biologisch onderzoek vereist toelating tot het nieuwe Life Sciences Verification Program, en de anti-distillatiebeveiliging preserved thinking voorkomt dat API gebruikers de redenering van het model kunnen extraheren.

Beschikbaarheid en wat er nog komt

Claude Opus 5.5 is nu beschikbaar op alle platforms, waaronder Amazon Web Services, Google Cloud en Microsoft Azure. Op het Claude Platform werkt het model onder de naam claude-opus-5-5. Abonnees op Pro, Max, Team en Enterprise plannen krijgen hogere vijfuurslimieten en een rate limit reset die je kunt inzetten wanneer je wilt. Claude Sonnet 5.5 en Claude Haiku 5.5 volgen in de komende weken met veel van dezelfde verbeteringen. Het model is beschikbaar met zero data retention en voldoet met watermarking aan de eisen van de EU AI Act.