De benchmarks van Opus 5, en de vier rijen waar het verliest
AI / GenAI·6 min·26 juli 2026·Claude Opus 5 — Deel 3 van 4

De benchmarks van Opus 5, en de vier rijen waar het verliest

Ik lees modelreleases meestal niet voor de benchmarks. Deze keer wel, om één reden: de tabel die Anthropic publiceert bevat rijen waar hun eigen nieuwe model verliest. Dat komt niet vaak voor in een aankondiging, en het maakt de rest van de tabel geloofwaardiger.

Benchmarkvergelijking van Claude Opus 5, Fable 5, Opus 4.8 en GPT-5.6 Sol over veertien evaluaties

Bron: Anthropic, Introducing Claude Opus 5.

Wat er wel indrukwekkend is

Drie getallen springen eruit.

Op Frontier-Bench v0.1, agentisch werk in de terminal, gaat Opus 5 van 21,1 procent (Opus 4.8) naar 43,3 procent. Meer dan een verdubbeling in één generatie, en ruim boven GPT-5.6 Sol op 34,4. Dit is het soort werk waar ik zelf het meest mee bezig ben, en de sprong is groot genoeg om merkbaar te zijn buiten een testopstelling.

Op ARC-AGI-3, een test met problemen die het model niet eerder heeft gezien, staat 30,2 procent tegenover 1,5 procent voor Opus 4.8 en 7,8 voor GPT-5.6 Sol. Dat is een factor twintig ten opzichte van de vorige versie.

Op AutomationBench, zakelijke taken van begin tot eind, haalt Opus 5 26,0 procent waar het hele veld tussen 17 en 18 blijft hangen. Dat is de rij die het dichtst bij normaal kantoorwerk zit.

De vier rijen waar het verliest

En dan de interessantere kant.

Op DeepSWE v1.1 wint GPT-5.6 Sol met 72,7 procent tegen 68,8 voor Opus 5. Niet marginaal, gewoon beter. Op FrontierCode v1.1 wint Fable 5 met 53,5 tegen 53,4, wat binnen de ruis valt maar wel betekent dat Opus 5 daar niet de top is. Op de Legal Agent Benchmark wint Fable 5 met 13,3 tegen 11,7. En op HealthBench Professional staat Opus 5 op 59,8, onder zowel GPT-5.6 Sol (60,5) als Mythos 5 (66,0).

Vier van de veertien. Voor een model dat als nieuwe standaard wordt gepositioneerd is dat eerlijk gerapporteerd, en het is ook een bruikbaar signaal: als jouw werk zwaar in code-agents of in de zorg zit, is “het nieuwste Anthropic-model” niet automatisch het juiste antwoord.

Het getal dat alles in perspectief zet

Kijk nog eens naar die juridische rij. Het beste model in de tabel haalt 13,3 procent. Opus 5 haalt 11,7.

Dat is niet “bijna goed”. Dat is: op deze test faalt het beste model dat er is in bijna negen van de tien gevallen. Als je de aankondiging leest en denkt dat juridisch werk nu geautomatiseerd kan worden, staat er in dezelfde tabel het bewijs dat dat niet zo is.

Hetzelfde geldt zachter voor ARC-AGI-3. Twintig keer beter dan de vorige versie klinkt als een doorbraak, en in relatieve zin is het dat ook. In absolute zin blijft er staan dat zeventig procent van de nieuwe problemen onopgelost blijft.

Ik noem dat geen kritiek op het model. Ik noem het de context die uit persberichten verdwijnt zodra ze doorverteld worden.

Wat deze tabel niet vertelt

Twee dingen die je erbij moet weten.

De benchmarks zijn vervangen, niet alleen ingevuld. In deze tabel staat geen SWE-bench Verified, jarenlang het cijfer waar iedereen naar keek. Er staan Frontier-Bench, FrontierCode, DeepSWE en CursorBench. Dat is deels terecht, want oude tests raken verzadigd als iedereen er negentig procent op haalt. Maar het maakt vergelijken over generaties heen lastig, en het geeft de leverancier invloed op de meetlat. Als de test verandert tegelijk met het model, weet je niet precies wat je meet.

Het is een leverancier die zijn eigen product meet. De opzet oogt netjes en de verliezende rijen helpen, maar dit zijn geen onafhankelijke metingen. GDPval-AA en de AA Coding Agent Index komen van Artificial Analysis, wat een derde partij is; het meeste andere niet. Wacht op de onafhankelijke herhalingen voor je een cijfer in een presentatie zet.

Wat ik zelf zie

Ik werk sinds vandaag met dit model aan echte klussen, dus mijn indruk is vers en niet meer dan dat. Wat opvalt komt niet uit de tabel: het maakt taken vaker helemaal af, en het kondigt minder aan wat het gaat doen en doet het gewoon. Dat scheelt beurten, en beurten zijn tijd en geld.

Wat me ook opvalt: het rekt zijn opdracht op. Een paar keer kreeg ik meer terug dan ik vroeg, netjes uitgevoerd maar niet gevraagd. Dat is precies het gedrag waar het volgende deel over gaat, want als je met de API bouwt is dat geen charme maar een bug in je prompt.

This piece also appeared in English: The Opus 5 benchmarks, and the four rows it loses.