Anthropic heeft op 22 september Opus 5.5 uitgebracht. De belangrijkste verandering zit in het uitvoeren van omvangrijk werk: software aanpassen, fouten vinden en dossiers uitwerken. Onze beoordeling: een overtuigende kandidaat voor complex programmeerwerk, met minder reden om automatisch de hoogste denkstand te kiezen. Astra blijft een serieuze concurrent voor bedrijfsprocessen; Mistral en Kimi bieden eigen hosting en lagere tokenprijzen.
De sprong tegenover Opus 5 is meetbaar
In Anthropics Terminal-Bench 4.0 stijgt het aandeel geslaagde terminaltaken van 52,3% naar 66,4%: 14,1 procentpunt winst. Astra haalt 57,9%. Het gaat om afgeronde programmeeropdrachten, bij verschillende inspanningsstanden. Grafiekbegrip verbetert sterker zonder hulpmiddelen: Chartography stijgt van 29,8% naar 64,4%; mét hulpmiddelen van 83,4% naar 89%.
- Opus 5.566,4%
- GPT-6 Astra57,9%
- Opus 552,3%
Anthropic, 22 september. Opus 5.5: xhigh; Astra: high. Leveranciersresultaten; Claude met veiligheidsfallbacks.
Een grote codeklus met minder omwegen
Anthropic liet Opus 5.5 en Fable 5.1 HAProxy, software die webverkeer verdeelt, van C naar Rust omzetten. Beide versies doorstonden bijna alle bestaande regressietests; Opus 5.5 deed er 9,5 uur over tegenover 12 uur en kostte 51% minder. Dat is een concreter efficiëntievoorbeeld dan alleen een lagere tokenprijs. Het blijft een interne proef, geen garantie voor iedere migratie. Het bedrijf meldt bovendien ruim 30% snellere tekstuitvoer dan bij Opus 5.
Ook een externe test zet Opus bovenaan
Artificial Analysis meet in indexversie 4.3.2 een score van 58 voor Opus 5.5, tegenover 53 voor Astra. De index bundelt tien evaluaties. Kimi K3 haalt 44 en Mistral Medium 3.5 14 in dezelfde huidige index. Dit zijn indexpunten, geen percentages correcte antwoorden. Daarmee is Opus in deze vergelijking de sterkste algemene kandidaat; Mistrals lagere prijs koopt aantoonbaar een andere prestatieklasse.
- Opus 5.5 · max/fallback58
- GPT-6 Astra · max53
- Kimi K3 · max44
- Mistral Medium 3.514
Afgeronde scores, 22 september 2026. Onafhankelijke evaluatie; geteste instellingen verschillen.
Waar Astra nog voorligt
Bij wetenschappelijke terminaltaken staat Astra in Anthropics tabel hoger: 64,6% tegen 58,7% voor Opus 5.5. Het gaat om Terminal-Bench-Science 0.1; de foutmarges zijn meerdere procentpunten. Anthropic meldt voor Opus 5.5 daarnaast 40% op AutomationBench. Ook Zapier zet Astra op 41,4% in AutomationBench. Die test controleert of een agent bijvoorbeeld klantgegevens én de juiste vervolgmail correct afhandelt. De eindtoestand telt, niet het overtuigende antwoord. Het kleine scoreverschil bewijst geen vaste praktijkvoorsprong; Astra blijft hier een onderbouwde kandidaat.
Codecontrole: extra vondsten, maar ook gemiste fouten
Standard is CodeRabbits combinatie van instellingen, geen afzonderlijke API-stand. CodeRabbit vond met Opus 5.5 Standard 51 van 80 bekende foutpatronen, tegen 49 met zijn bestaande modellenmix. Elf extra vondsten stonden tegenover negen gemiste fouten. Eén nuttige vondst: twee gelijktijdige taken konden elkaars tellerupdate overschrijven; Opus stelde een atomaire databaseverhoging voor. Standard vond bovendien meer patronen dan Max, met minder opmerkingen. Voor codecontrole is méér denkwerk dus niet automatisch beter. Dit externe onderzoek ondersteunt de upgrade, maar geen blinde vervanging van je bestaande controle.
Thariq belooft duidelijkere antwoorden en meer ruimte
Thariq, die volgens zijn X-profiel aan Claude Code werkt, noemt Opus 5.5 het resultaat van gebruikersfeedback. Zijn bericht benadrukt duidelijker communiceren, efficiënt tokengebruik en bruikbaarheid op alle inspanningsstanden. Hij meldt ook hogere limieten per vijf uur en een reset die abonnees kunnen bewaren. Dat raakt dagelijkse gebruikers direct: langer kunnen doorwerken en beter kunnen volgen wat de assistent uitvoert. Zijn vergelijking met Fable 5.1 blijft een claim vanuit het productteam.
Goedkoper dan Opus 5, niet altijd goedkoper dan Astra
De gewone API-tarieven dalen van 5 naar 4 dollar per miljoen invoertokens en van 25 naar 20 dollar voor uitvoer: 20% minder. Het lezen van hergebruikte context daalt van 0,50 naar 0,20 dollar. Daar kan langdurig programmeerwerk extra van profiteren. Maar Artificial Analysis meet op zijn eigen taken gewogen gemiddeld 5,98 dollar voor Opus tegen 3,26 dollar voor Astra. Die maximumstanden zijn iets anders dan Anthropics typische gebruik. De sterkere score kan dus extra rekenwerk kosten.
Mistral: hoge doorvoer en eigen beheer, minder topkwaliteit
Mistral Medium 3.5 is vooral interessant als controle over de installatie zwaar weegt. De modelgewichten zijn beschikbaar onder een aangepaste MIT-licentie; Mistral noemt minimaal vier GPU’s voor eigen hosting. De context is 256.000 tokens, kleiner dan bij de andere besproken modellen. Artificial Analysis meet circa 137 uitvoertokens per seconde. Dat is snel, maar heft de grote achterstand in de brede kwaliteitstest niet op. Onze afweging: aantrekkelijk voor afgebakende taken waarbij beheersbaarheid en doorvoer belangrijker zijn dan maximale redeneerkracht.
Kimi: een sterker open alternatief dan Mistral
Kimi K3 zit in de brede index duidelijk dichter bij Opus dan Mistral en kost in diezelfde evaluatie gemiddeld 2 dollar per taak. Het biedt een contextvenster van ongeveer een miljoen tokens en vrijgegeven modelgewichten. De standaard denkstand is max. Moonshots technische paper beschrijft 2,8 biljoen parameters, waarvan 104 miljard actief worden gebruikt. Dat is infrastructuur op grote schaal, geen gewone laptopassistent. Onze afweging: een relevantere kandidaat voor wie zware taken én eigen hosting wil combineren, zolang de gemeten kwaliteitsachterstand aanvaardbaar is.
Voor bouwers verandert ook de bediening
Opus 5.5 redeneert altijd; nadenken uitschakelen geeft een foutmelding. De standaardstand verschuift van high naar medium, terwijl dezelfde stand meer denkwerk per beurt kan opleveren. Ook geforceerde gereedschapsaanroepen verdwijnen. Een app die verplicht eerst een bron moest ophalen, moet daarom controleren of dat werkelijk gebeurde. Dit is een migratiepunt voor Nederlandse en Belgische teams met eigen studiehulpen of werkassistenten: alleen de modelnaam vervangen is onvoldoende.
Ons oordeel: upgraden voor moeilijke code, gericht kiezen voor de rest
Voor lastige codecontroles geeft de externe proef een concrete reden om Opus 5.5 te proberen, eerst in Standard-achtige instellingen en met aandacht voor verloren vondsten. Voor volledige bedrijfsprocessen blijft Astra sterk: Zapier beoordeelt juist het afgeronde resultaat over meerdere apps. Wie vooral zelf wil hosten, heeft bij Mistral een kleiner model en bij Kimi meer capaciteit, met verschillende hardware-eisen. De beste keuze volgt daarmee uit het soort werk: kwaliteit, aantoonbaar afgeronde taken en controle over de uitvoering verdienen meer gewicht dan alleen een goedkoop token.
OpenAI reageert met lagere tarieven
Enkele uren na de introductie van Opus 5.5 reageerde OpenAI met de lancering van GPT-6 Sol en Luna, waarbij de API-tarieven met 50 procent werden verlaagd. Lees ons artikel over GPT-6 Sol en Luna voor de officiële benchmarks en tarieven.
Meer weten?
Kies de verdieping die je interessant vindt.
Twaalf maanden in enkele mijlpalenEen selectie van september 2025 tot september 2026; geen volledige releasekalender.
September 2025: langer zelfstandig werken
Op 23 september kwam GPT-5-Codex naar de Responses API. Op 29 september introduceerde Anthropic Sonnet 4.5, samen met onder meer Claude Code-checkpoints, een VS Code-uitbreiding en de Agent SDK. De inzet werd breder dan antwoorden schrijven: modellen moesten stappen in een werkproces kunnen uitvoeren en voortzetten.
Winter en voorjaar: nieuwe generaties
OpenAI bracht GPT-5.2 op 11 december 2025 naar de API. Anthropics overzicht dateert de systeemkaarten van Opus 4.5 op november en die van Opus 4.6 op februari 2026; Opus 4.7 volgde in april en 4.8 in mei. Mistrals changelog dateert Medium 3.5 op 28 april. De Vibe-blog van 22 mei beschrijft vervolgens de inzet voor taken die op afstand blijven doorlopen. Die twee datums beschrijven verschillende publicaties.
Zomer: grote modellen, meerdere vormen van toegang
Anthropic publiceerde de systeemkaart van Opus 5 in juli en die van Fable 5.1 en Mythos 5.1 in september. Moonshots officiële forum presenteerde Kimi K3 op 22 juli; de technische paper verscheen op 27 juli. Die beschrijft 2,8 biljoen parameters, waarvan 104 miljard actief worden gebruikt. Het totale aantal parameters is dus niet hetzelfde als het rekenwerk per token, en op zichzelf geen kwaliteitsranglijst.
September: van model naar volledig werkproces
Op 3 september volgde GPT-6 Astra in de OpenAI-API, met mogelijkheden voor langdurig werk en tussentijdse bijsturing. Opus 5.5 sluit deze selectie op 22 september af. De lijn door het jaar is onze duiding: steeds meer aandacht gaat naar bruikbare agents, hun omgeving en hun kosten. Hogere modelnummers vertellen slechts een deel van dat verhaal.
De volledige prijsvergelijkingTarieven per token en de voorwaarden die de uiteindelijke rekening beïnvloeden.
De rekening naast de benchmarks
De grafieken vergelijken API-lijstprijzen op 22 september 2026. Sol kost evenveel per token als Opus 5.5; Astra meer, Mistral en Kimi minder. De benchmarkrekening hierboven laat zien waarom dat geen ranglijst van kosten per afgeronde taak oplevert.
- Claude Opus 5.5$4
- GPT-6 Astra$10
- GPT-5.6 Sol$4
- Mistral Medium 3.5$1,5
- Kimi K3$3
22 september 2026; OpenAI bij korte context. Cache, toeslagen en belasting uitgesloten.
Lange context en hergebruik veranderen de uitkomst
Boven 272.000 invoertokens verdubbelen bij Astra de invoer- en cachetarieven; uitvoer wordt voor de hele aanvraag anderhalf keer zo duur. Sols actietarief geldt minstens tot 21 november. Cache-opslag, gereedschappen, batchkorting, snellere verwerking, belasting en valuta kunnen de rekening verder veranderen. Controleer daarom zowel de tariefkaart als het werkelijk gemeten verbruik.
- Claude Opus 5.5$20
- GPT-6 Astra$50
- GPT-5.6 Sol$20
- Mistral Medium 3.5$7,5
- Kimi K3$15
Zelfde peildatum en voorwaarden. Uitvoertarieven; geen kosten per geslaagde taak.
Verder bij de bron
Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.
- [1] Anthropic
- [2] Claude Platform Docs
- [3] Anthropic — Opus 5.5 System Card
- [4] OpenAI News
- [5] OpenAI News
- [6] Mistral AI
- [7] Mistral AI
- [8] Kimi / Moonshot AI
- [9] Kimi / Moonshot AI
- [10] arXiv
- [11] OpenAI News
- [12] Mistral AI
- [13] Anthropic
- [14] Anthropic
- [15] Kimi / Moonshot AI
- [16] Claude Platform Docs
- [17] Mistral AI
- [18] CodeRabbit
- [19] Thariq (@trq212) — reactie op Opus 5.5
- [20] Artificial Analysis
- [21] Zapier
- [22] Artificial Analysis
- [23] Artificial Analysis
- [24] OpenAI — introductie GPT-6 Sol en Luna
