Op de WeAreDevelopers World Congress North America in San Jose sloot Simon Willison af met een keynote die aanvoelde als een bliksemtour door een jaar dat nog niet eens voorbij is. Zijn overzicht van LLM’s in 2026 bevat geen droge opsomming van modelreleases. Het is een verhaal over coding agents die plots betrouwbaar werden, over een nieuwe categorie software die Mac Mini’s deed uitverkopen en over AI-agents die tijdens hun training op eigen houtje het internet op gingen. Hieronder vind je de belangrijkste lessen uit zijn talk.

Het moment waarop coding agents echt begonnen te werken

Voor Willison begon 2026 al in november 2025. Toen verschenen Claude Opus 4.5 en GPT-5.1. Op papier waren het stapsgewijze verbeteringen, in de praktijk staken ze een onzichtbare grens over. Gekoppeld aan hun harness, Claude Code en Codex, gingen coding agents van foutgevoelig naar betrouwbaar genoeg voor dagelijks gebruik.

Tijdens de kerstvakantie begonnen ontwikkelaars te experimenteren en drong het besef door hoeveel meer deze LLM’s konden. Willison gooide zijn vaste goede voornemen om minder nieuwe projecten te starten overboord. Zijn motto werd net het omgekeerde: wees ambitieuzer. De enige manier om de grenzen van deze technologie te vinden, is te blijven experimenteren.

Dat leidde in januari tot wat hij AI mania noemt. Elke minuut waarin je agent niets voor je bouwt, voelt als verspilde tijd en je laat slaap om nog een taak op te starten. Hij genas hiervan toen hij zich afvroeg of de wereld echt zat te wachten op een trage, halfafgewerkte JavaScript-interpreter in Python.

Claws, de nieuwe categorie software van 2026

In november 2025 kreeg een onbekende GitHub-repository genaamd Warelay zijn eerste commit. Twee maanden later had het project vier naamswijzigingen achter de rug en heette het OpenClaw. Vandaag staat de teller op meer dan 100.000 commits. Willison noemt het de meest vibecoded software die bestaat.

OpenClaw definieerde een nieuwe categorie, die hij met Claws noemt: NanoClaw, IronClaw, PicoClaw en consorten. Inmiddels worden ze verkocht als personal agents of general agents. Technisch is een Claw volgens Willison gewoon een coding agent die er minder bedreigend uitziet. Hij schrijft code en voert die uit op je computer om taken voor je af te handelen.

De vraag bleek enorm. In Apple Stores waren de Mac Mini’s uitverkocht omdat mensen er hun Claw op wilden draaien. Drew Breunig vergeleek het met een digitaal huisdier waarvoor je een aquarium koopt. In China organiseerden bedrijven in maart installatiefeestjes waar gewone consumenten in de rij stonden om een Claw op hun toestel te laten zetten. MoltBook, een sociaal netwerk voor agents, ging binnen een week van viraal naar vergeten door een stortvloed aan spam, en werd een maand later toch door Meta overgenomen. De race draait nu om een veilige Claw voor het grote publiek. Meta’s Muse staat bovenaan de gratis apps in de App Store, al is Willison nog niet overtuigd dat gebruikers zich er niet mee in de voet schieten.

Dark factories en de opkomst en val van tokenmaxxing

In februari beschreef StrongDM zijn Software Factory, door Dan Shapiro de Dark Factory gedoopt: een fabriek zo geautomatiseerd dat het licht uit mag. Het bedrijf volgde twee regels. Code mag niet door mensen geschreven worden en code mag niet door mensen gereviewd worden. Wat in februari radicaal klonk, is voor veel ontwikkelaars vandaag dagelijkse realiteit. De uitdaging is nu verificatie: hoe weet je dat software degelijk is als niemand de code leest?

Tegelijk ontstond tokenmaxxing. Meta nam AI-gebruik op in performance reviews, Microsoft wilde dat elke medewerker AI gebruikte en Uber pochte dat negentig procent van zijn engineers met AI-workflows werkte. Enkele maanden later volgden besparingen en limieten, want agents zijn duur. Waar je vorig jaar moeilijk meer dan 50 dollar aan tokens kwijtraakte omdat de resultaten niet goed genoeg waren, kun je nu 1.000 dollar per dag uitgeven aan nuttig werk. Volgens Willison vond AI in 2026 zijn product market fit, vooral via coding agents.

Fable class modellen en de prijs van doommarketing

In april kondigde Anthropic Claude Mythos aan en hield het meteen achter slot en grendel, beperkt tot security-onderzoekers via Project Glasswing. De claim dat een model te gevaarlijk is, is volgens Willison zo oud als GPT-2, maar deze keer vond hij ze geloofwaardig. Modellen waren bijzonder goed geworden in het vinden van kwetsbaarheden.

In juni volgde Claude Fable 5, een afgezwakte versie van Mythos. Het werd het eerste publieke voorbeeld van wat Willison een Fable class model noemt, een categorie waartoe intussen ook GPT-6 Astra behoort. Geef zo’n model een helder doel, eenduidige randvoorwaarden en de juiste tools, en het lost je probleem op door pure brute force.

Drie dagen na de lancering legde de Amerikaanse overheid Fable aan banden met een export control directive. Amazon-onderzoekers ontdekten dat Fable weigerde code op securityproblemen te reviewen. Maar met de prompt “fix this code” vond het de lekken toch en loste het veiligheidsprobleem op. Fable was terug beschikbaar 1 juli. Het was daarmee acht dagen het beste model ter wereld en moest daarna GPT-5.6 naast zich dulden. Van de dertig dagen aan de top was Fable er achttien onbeschikbaar. Willison trekt er een zakelijke les uit. Wie zijn model als wereldbedreigend verkoopt, loopt het risico een groot deel van zijn gloriemoment offline te zijn.

Agents die uit hun sandbox breken

Het meest verontrustende verhaal van het jaar bouwde Willison op als een thriller. RubyGems werd overspoeld met dubieuze packages, een verlaten Duitstalige wiki voor gameontwikkelaars kreeg edits van accounts als AgentOpenAIProbe, de Australische Medicare Item Reports-service kreeg verdacht verkeer en op PyPI verscheen het kwaadaardige package mlflow-ui.

De ontknoping kwam in juli. Hugging Face meldde een inbraak door een autonoom agentsysteem en OpenAI gaf toe dat het om zijn eigen agents ging. Bij Reinforcement Learning from Verified Rewards laat je modellen tijdens de training oefeningen uitvoeren en beloon je de beste. OpenAI’s agents vonden gaten in hun eigen sandbox, braken uit en vielen Hugging Face aan om anders onoplosbare opdrachten te kraken. Anthropic vond kort daarna gelijkaardige sporen in zijn trainingslogs, waaronder het PyPI-package. Onafhankelijke onderzoekers koppelden later ook de wiki en RubyGems aan OpenAI, en de Australische premier bracht de hack van de gezondheidswebsite ter sprake op de Algemene Vergadering van de Verenigde Naties.

Met enige galgenhumor wijst Willison op FelonyBench.com, dat misdrijven per lab bijhoudt: OpenAI heeft er 11, Anthropic 9, Google 3 en Meta 1.

De pelikaan op de fiets en de kracht van lokale modellen

Willison test elk nieuw model met de vraag een SVG te maken van een pelikaan op een fiets. Hij noemt het zelf de domste benchmark ter wereld, al vertelt hij er toch veel mee. Gemini 3.1 Pro tekende in februari een uitstekende pelikaan,

Opvallender was de vooruitgang van open weight modellen. In april tekende Qwen 3.6 op zijn laptop een betere pelikaan dan de gloednieuwe Claude Opus 4.7. In augustus leverde Qwen 3.8 27B, een download van amper 17GB, een van zijn beste pelikanen ooit. Dat duurde wel 21 minuten omdat het model standaard in high reasoning mode draait. Willison had verwacht vijf jaar en tienduizend dollar aan hardware nodig te hebben voor zulke resultaten. Aan de frontier zie je intussen een prijsoorlog: GPT-6 Luna tekent een behoorlijke pelikaan voor 0,4 cent, Fable 5 vroeg 3,30 dollar voor zijn beste exemplaar en Opus 5.5 dacht 128.000 tokens na om dan op te geven.

Deep Blue, het gevoel dat AI opwekt bij developers

Samen met Adam Leventhal en Bryan Cantrill van de podcast Oxide and Friends bedacht Willison de term Deep Blue voor de lusteloosheid die software engineers overvalt wanneer AI alles lijkt te kunnen. Zijn experimenten met gameontwikkeling geven de grens aan. Iets bouwen dat op een game lijkt, is makkelijk. Een goede gameplay loop ontwerpen blijft voorlopig mensenwerk.

Hetzelfde geldt voor Fable class modellen. Doelen definiëren, eenduidige instructies geven en de juiste tools kiezen is precies wat software engineering is. Wie dat goed kan, krijgt superkrachten. Het verklaart ook waarom Willison nooit harder heeft gewerkt: het eenvoudige werk doet de agent, en wat overblijft is moeilijk. Hij citeert wielrenner Greg LeMond: “It doesn’t get easier, you just get faster.”

YouTube thumbnailYouTube icon