Effort is de knop waar het bij Opus 5 om draait
AI / GenAI·6 min·25 juli 2026·Claude Opus 5 — Deel 2 van 4

Effort is de knop waar het bij Opus 5 om draait

De prijs van Claude Opus 5 is precies gelijk aan die van zijn voorganger. Vijf dollar per miljoen tokens erin, vijfentwintig eruit. Dat klinkt als een non-nieuwtje, tot je bedenkt wat het betekent: als de prijs per token vastligt, dan bepaal je je rekening met het aantal tokens. En dat is precies wat de effort-knop doet.

Bij deze release is dat geen detail meer. Het is het hoofdverhaal.

Wat effort is

Effort is een instelling met vijf standen: low, medium, high, xhigh en max. Het bepaalt hoe diep het model nadenkt en hoeveel tokens het aan een klus mag besteden voordat het met een antwoord komt. Standaard staat hij op high.

Je vindt hem terug op verschillende plekken. Via de API zet je hem als parameter. In Claude Code is xhigh de standaard. Gebruik je Claude via de app, dan zit de knop niet in je scherm, maar beslist het model per beurt zelf hoeveel denkwerk nodig is.

Het interessante is niet dat de knop bestaat. Die was er op Opus 4.8 ook al. Het interessante is dat de standen dit keer iets anders betekenen.

De verrassing zit aan de onderkant

De gewoonte tot nu toe was: zet hem hoog, want anders wordt het model dom. Op Opus 4.8 klopte dat ook ongeveer.

Op Opus 5 niet meer. Het duidelijkste cijfer komt van Zapier’s AutomationBench, een test die meet of een model zakelijke taken van begin tot eind kan afmaken. Opus 5 haalt daar op zijn laagste stand meer taken dan welk ander model dan ook op zijn hoogste. Niet meer dan Opus 4.8. Meer dan alle andere modellen.

Anthropic zegt het zelf ook rechtstreeks in de handleiding: gebruik low en medium royaal, als je eigen tests laten zien dat de kwaliteit standhoudt. En: als je je effort-instelling hebt overgenomen van een vorig model, draai je testen opnieuw. Dat is ongebruikelijk direct advies voor een leverancier die per token verdient.

Welke stand waarvoor

Dit is hoe ik het nu indeel. Geen wet, wel een startpunt.

StandWaarvoorWat je merkt
lowSamenvatten, classificeren, korte vragen, alles waar snelheid teltSnel en goedkoop, kwaliteit die vroeger high vroeg
mediumHet meeste dagelijkse werk: schrijven, analyseren, losse code-vragenDe nieuwe standaard voor wie op kosten let
highStandaardwaarde. Werk waar precisie telt maar de klus overzichtelijk isWat je gewend was, nu voor minder tokens
xhighCoderen en agent-werk. Aanbevolen startpunt daarvoorMeerdere bestanden, langere ketens, minder afhaken
maxDe echt harde gevallen waar correctheid boven kosten gaatBeste resultaat, duidelijk duurder, soms overdenken

Wat opvalt aan die tabel: er is geen enkele reden meer om standaard op high te blijven staan zonder erover na te denken. Naar beneden is winst, naar boven is winst, stil blijven staan is het enige dat niks oplevert.

Wat de cijfers zeggen over de rekening

De metingen die klanten publiceren gaan bijna allemaal over hetzelfde: niet betere antwoorden voor meer geld, maar dezelfde of betere antwoorden voor minder.

Een financiële klant meet over alle effort-standen heen negen procentpunt hogere accuratesse, met een derde minder beurten en tool-aanroepen en zestig procent minder tijd. Een juridische klant haalt vergelijkbare prestaties met zesentwintig procent minder tokens dan Opus 4.8 op de hoogste stand. Op CursorBench komt het model op max binnen een halve procent van Fable 5, tegen de helft van de kosten per taak.

Vertaal dat naar je eigen situatie en je krijgt een ander gesprek dan bij eerdere releases. Niet “is de upgrade het waard”, maar “waar heb ik mijn instellingen te hoog staan”.

De kanttekening die niemand erbij zet

Twee dingen zitten me dwars.

Effort maakt je kosten minder voorspelbaar, niet meer. Je hebt nu een knop waarmee je kunt sturen, maar het model beslist binnen die stand nog steeds zelf hoeveel het nadenkt. Twee identieke vragen kunnen verschillend uitpakken. Voor wie een begroting moet maken is “het hangt ervan af” een slechter antwoord dan een vaste prijs, ook als het gemiddeld goedkoper is.

En het advies om je testen opnieuw te draaien klinkt redelijker dan het is. De meeste organisaties hebben geen eigen testset. Die hebben een gevoel en een factuur. Zonder eigen metingen wordt “zet hem lager als de kwaliteit standhoudt” in de praktijk “zet hem lager en hoop het beste”, en dat is een advies waar je pas over drie maanden achter komt of het klopte.

Als je één ding uit dit stuk meeneemt: maak een eigen setje van tien echte opdrachten uit je werk, draai die op low, medium en high, en kijk waar het misgaat. Dat is een middag werk en het beantwoordt de vraag die geen enkele benchmark voor je beantwoordt.

Volgende deel: de benchmarks zelf, inclusief de rijen waar Opus 5 verliest.

This piece also appeared in English: Effort is the dial that matters in Opus 5.