Anthropic heeft op 22 september Opus 5.5 uitgebracht. De belangrijkste verandering zit in het uitvoeren van omvangrijk werk: software aanpassen, fouten vinden en dossiers uitwerken. Onze beoordeling: een overtuigende kandidaat voor complex programmeerwerk, met minder reden om automatisch de hoogste denkstand te kiezen. Astra blijft een serieuze concurrent voor bedrijfsprocessen; Mistral en Kimi bieden eigen hosting en lagere tokenprijzen.

De sprong tegenover Opus 5 is meetbaar

In Anthropics Terminal-Bench 4.0 stijgt het aandeel geslaagde terminaltaken van 52,3% naar 66,4%: 14,1 procentpunt winst. Astra haalt 57,9%. Het gaat om afgeronde programmeeropdrachten, bij verschillende inspanningsstanden. Grafiekbegrip verbetert sterker zonder hulpmiddelen: Chartography stijgt van 29,8% naar 64,4%; mét hulpmiddelen van 83,4% naar 89%.

Programmeertaken: Terminal-Bench 4.0Geslaagde taken (%) · schaal begint bij 0
  1. Opus 5.566,4%
  2. GPT-6 Astra57,9%
  3. Opus 552,3%

Anthropic, 22 september. Opus 5.5: xhigh; Astra: high. Leveranciersresultaten; Claude met veiligheidsfallbacks.

Een grote codeklus met minder omwegen

Anthropic liet Opus 5.5 en Fable 5.1 HAProxy, software die webverkeer verdeelt, van C naar Rust omzetten. Beide versies doorstonden bijna alle bestaande regressietests; Opus 5.5 deed er 9,5 uur over tegenover 12 uur en kostte 51% minder. Dat is een concreter efficiëntievoorbeeld dan alleen een lagere tokenprijs. Het blijft een interne proef, geen garantie voor iedere migratie. Het bedrijf meldt bovendien ruim 30% snellere tekstuitvoer dan bij Opus 5.

Ook een externe test zet Opus bovenaan

Artificial Analysis meet in indexversie 4.3.2 een score van 58 voor Opus 5.5, tegenover 53 voor Astra. De index bundelt tien evaluaties. Kimi K3 haalt 44 en Mistral Medium 3.5 14 in dezelfde huidige index. Dit zijn indexpunten, geen percentages correcte antwoorden. Daarmee is Opus in deze vergelijking de sterkste algemene kandidaat; Mistrals lagere prijs koopt aantoonbaar een andere prestatieklasse.

Brede prestaties: dezelfde indexversieArtificial Analysis Intelligence Index v4.3.2 · schaal begint bij 0
  1. Opus 5.5 · max/fallback58
  2. GPT-6 Astra · max53
  3. Kimi K3 · max44
  4. Mistral Medium 3.514

Afgeronde scores, 22 september 2026. Onafhankelijke evaluatie; geteste instellingen verschillen.

Waar Astra nog voorligt

Bij wetenschappelijke terminaltaken staat Astra in Anthropics tabel hoger: 64,6% tegen 58,7% voor Opus 5.5. Het gaat om Terminal-Bench-Science 0.1; de foutmarges zijn meerdere procentpunten. Anthropic meldt voor Opus 5.5 daarnaast 40% op AutomationBench. Ook Zapier zet Astra op 41,4% in AutomationBench. Die test controleert of een agent bijvoorbeeld klantgegevens én de juiste vervolgmail correct afhandelt. De eindtoestand telt, niet het overtuigende antwoord. Het kleine scoreverschil bewijst geen vaste praktijkvoorsprong; Astra blijft hier een onderbouwde kandidaat.

Codecontrole: extra vondsten, maar ook gemiste fouten

Standard is CodeRabbits combinatie van instellingen, geen afzonderlijke API-stand. CodeRabbit vond met Opus 5.5 Standard 51 van 80 bekende foutpatronen, tegen 49 met zijn bestaande modellenmix. Elf extra vondsten stonden tegenover negen gemiste fouten. Eén nuttige vondst: twee gelijktijdige taken konden elkaars tellerupdate overschrijven; Opus stelde een atomaire databaseverhoging voor. Standard vond bovendien meer patronen dan Max, met minder opmerkingen. Voor codecontrole is méér denkwerk dus niet automatisch beter. Dit externe onderzoek ondersteunt de upgrade, maar geen blinde vervanging van je bestaande controle.

Thariq belooft duidelijkere antwoorden en meer ruimte

Thariq, die volgens zijn X-profiel aan Claude Code werkt, noemt Opus 5.5 het resultaat van gebruikersfeedback. Zijn bericht benadrukt duidelijker communiceren, efficiënt tokengebruik en bruikbaarheid op alle inspanningsstanden. Hij meldt ook hogere limieten per vijf uur en een reset die abonnees kunnen bewaren. Dat raakt dagelijkse gebruikers direct: langer kunnen doorwerken en beter kunnen volgen wat de assistent uitvoert. Zijn vergelijking met Fable 5.1 blijft een claim vanuit het productteam.

Goedkoper dan Opus 5, niet altijd goedkoper dan Astra

De gewone API-tarieven dalen van 5 naar 4 dollar per miljoen invoertokens en van 25 naar 20 dollar voor uitvoer: 20% minder. Het lezen van hergebruikte context daalt van 0,50 naar 0,20 dollar. Daar kan langdurig programmeerwerk extra van profiteren. Maar Artificial Analysis meet op zijn eigen taken gewogen gemiddeld 5,98 dollar voor Opus tegen 3,26 dollar voor Astra. Die maximumstanden zijn iets anders dan Anthropics typische gebruik. De sterkere score kan dus extra rekenwerk kosten.

Mistral: hoge doorvoer en eigen beheer, minder topkwaliteit

Mistral Medium 3.5 is vooral interessant als controle over de installatie zwaar weegt. De modelgewichten zijn beschikbaar onder een aangepaste MIT-licentie; Mistral noemt minimaal vier GPU’s voor eigen hosting. De context is 256.000 tokens, kleiner dan bij de andere besproken modellen. Artificial Analysis meet circa 137 uitvoertokens per seconde. Dat is snel, maar heft de grote achterstand in de brede kwaliteitstest niet op. Onze afweging: aantrekkelijk voor afgebakende taken waarbij beheersbaarheid en doorvoer belangrijker zijn dan maximale redeneerkracht.

Kimi: een sterker open alternatief dan Mistral

Kimi K3 zit in de brede index duidelijk dichter bij Opus dan Mistral en kost in diezelfde evaluatie gemiddeld 2 dollar per taak. Het biedt een contextvenster van ongeveer een miljoen tokens en vrijgegeven modelgewichten. De standaard denkstand is max. Moonshots technische paper beschrijft 2,8 biljoen parameters, waarvan 104 miljard actief worden gebruikt. Dat is infrastructuur op grote schaal, geen gewone laptopassistent. Onze afweging: een relevantere kandidaat voor wie zware taken én eigen hosting wil combineren, zolang de gemeten kwaliteitsachterstand aanvaardbaar is.

Voor bouwers verandert ook de bediening

Opus 5.5 redeneert altijd; nadenken uitschakelen geeft een foutmelding. De standaardstand verschuift van high naar medium, terwijl dezelfde stand meer denkwerk per beurt kan opleveren. Ook geforceerde gereedschapsaanroepen verdwijnen. Een app die verplicht eerst een bron moest ophalen, moet daarom controleren of dat werkelijk gebeurde. Dit is een migratiepunt voor Nederlandse en Belgische teams met eigen studiehulpen of werkassistenten: alleen de modelnaam vervangen is onvoldoende.

Ons oordeel: upgraden voor moeilijke code, gericht kiezen voor de rest

Voor lastige codecontroles geeft de externe proef een concrete reden om Opus 5.5 te proberen, eerst in Standard-achtige instellingen en met aandacht voor verloren vondsten. Voor volledige bedrijfsprocessen blijft Astra sterk: Zapier beoordeelt juist het afgeronde resultaat over meerdere apps. Wie vooral zelf wil hosten, heeft bij Mistral een kleiner model en bij Kimi meer capaciteit, met verschillende hardware-eisen. De beste keuze volgt daarmee uit het soort werk: kwaliteit, aantoonbaar afgeronde taken en controle over de uitvoering verdienen meer gewicht dan alleen een goedkoop token.

OpenAI reageert met lagere tarieven

Enkele uren na de introductie van Opus 5.5 reageerde OpenAI met de lancering van GPT-6 Sol en Luna, waarbij de API-tarieven met 50 procent werden verlaagd. Lees ons artikel over GPT-6 Sol en Luna voor de officiële benchmarks en tarieven.

Meer weten?

Kies de verdieping die je interessant vindt.

Verdieping · 2 min extraTwaalf maanden in enkele mijlpalenEen selectie van september 2025 tot september 2026; geen volledige releasekalender.

September 2025: langer zelfstandig werken

Op 23 september kwam GPT-5-Codex naar de Responses API. Op 29 september introduceerde Anthropic Sonnet 4.5, samen met onder meer Claude Code-checkpoints, een VS Code-uitbreiding en de Agent SDK. De inzet werd breder dan antwoorden schrijven: modellen moesten stappen in een werkproces kunnen uitvoeren en voortzetten.

Winter en voorjaar: nieuwe generaties

OpenAI bracht GPT-5.2 op 11 december 2025 naar de API. Anthropics overzicht dateert de systeemkaarten van Opus 4.5 op november en die van Opus 4.6 op februari 2026; Opus 4.7 volgde in april en 4.8 in mei. Mistrals changelog dateert Medium 3.5 op 28 april. De Vibe-blog van 22 mei beschrijft vervolgens de inzet voor taken die op afstand blijven doorlopen. Die twee datums beschrijven verschillende publicaties.

Zomer: grote modellen, meerdere vormen van toegang

Anthropic publiceerde de systeemkaart van Opus 5 in juli en die van Fable 5.1 en Mythos 5.1 in september. Moonshots officiële forum presenteerde Kimi K3 op 22 juli; de technische paper verscheen op 27 juli. Die beschrijft 2,8 biljoen parameters, waarvan 104 miljard actief worden gebruikt. Het totale aantal parameters is dus niet hetzelfde als het rekenwerk per token, en op zichzelf geen kwaliteitsranglijst.

September: van model naar volledig werkproces

Op 3 september volgde GPT-6 Astra in de OpenAI-API, met mogelijkheden voor langdurig werk en tussentijdse bijsturing. Opus 5.5 sluit deze selectie op 22 september af. De lijn door het jaar is onze duiding: steeds meer aandacht gaat naar bruikbare agents, hun omgeving en hun kosten. Hogere modelnummers vertellen slechts een deel van dat verhaal.

Verdieping · 1 min extraDe volledige prijsvergelijkingTarieven per token en de voorwaarden die de uiteindelijke rekening beïnvloeden.

De rekening naast de benchmarks

De grafieken vergelijken API-lijstprijzen op 22 september 2026. Sol kost evenveel per token als Opus 5.5; Astra meer, Mistral en Kimi minder. De benchmarkrekening hierboven laat zien waarom dat geen ranglijst van kosten per afgeronde taak oplevert.

Invoer: tarief zonder cacheUSD per miljoen tokens · schaal begint bij 0
  1. Claude Opus 5.5$4
  2. GPT-6 Astra$10
  3. GPT-5.6 Sol$4
  4. Mistral Medium 3.5$1,5
  5. Kimi K3$3

22 september 2026; OpenAI bij korte context. Cache, toeslagen en belasting uitgesloten.

Lange context en hergebruik veranderen de uitkomst

Boven 272.000 invoertokens verdubbelen bij Astra de invoer- en cachetarieven; uitvoer wordt voor de hele aanvraag anderhalf keer zo duur. Sols actietarief geldt minstens tot 21 november. Cache-opslag, gereedschappen, batchkorting, snellere verwerking, belasting en valuta kunnen de rekening verder veranderen. Controleer daarom zowel de tariefkaart als het werkelijk gemeten verbruik.

UitvoerUSD per miljoen tokens · schaal begint bij 0
  1. Claude Opus 5.5$20
  2. GPT-6 Astra$50
  3. GPT-5.6 Sol$20
  4. Mistral Medium 3.5$7,5
  5. Kimi K3$15

Zelfde peildatum en voorwaarden. Uitvoertarieven; geen kosten per geslaagde taak.

Verder bij de bron

Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.

Bronnen en werkwijze