Bedrijven en onderzoekers die AI gebruiken voor documenten en ingewikkelde werkopdrachten, krijgen op 6 oktober een nieuw Europees alternatief. Mistral stelt Large 4 beschikbaar als publieke proefversie. Onafhankelijke evaluaties tonen een duidelijke vooruitgang tegenover voorganger Large 3. Voor Nederlandse en Belgische organisaties die zulke software inzetten, ontstaat daarmee een nieuwe afweging: meer vermogen om moeilijke opdrachten uit te werken, terwijl zelf installeren voorlopig nog moet wachten.
De toegang loopt nu via Mistral Studio en een softwarekoppeling waarmee toepassingen het model kunnen aanspreken. Mistral belooft de modelbestanden eind oktober vrij te geven. Dat is een ander startpunt dan bij Large 3: daarvan verschenen de bestanden op 2 december 2025 meteen onder de ruime Apache 2.0-licentie. Die eerdere vrijgave bood ontwikkelaars direct een basis om het model zelf aan te passen en te beheren.
Meer capaciteit, meer verbruik
De winst gaat verder dan het versienummer. Artificial Analysis geeft Large 4 een score van 38 tegenover 9 voor Large 3, op dezelfde versie van zijn brede testindex. Die bundelt onder meer documentwerk, programmeeropdrachten en redeneertaken. Een hogere score wijst op betere prestaties in die proeven, niet op een overeenkomstige vermenigvuldiging van iemands productiviteit. Large 4 gebruikt hierbij uitgebreid redeneren; de geteste Large 3 mist die denkstand. De koploper in deze brede vergelijking, Claude Opus 5.5, scoort nog duidelijk hoger; Large 4 is daarmee geen algemene winnaar.
- Mistral Large 3 — zonder uitgebreid redeneren9
- Mistral Large 4 Preview — met redeneren38
- Claude Opus 5.5 — max, standaardterugval58
Bron: Artificial Analysis, index v4.3.2, gecontroleerd op 6 oktober 2026. De gepubliceerde modelvarianten en denkstanden verschillen; de aanvullende denkstand van Large 4 is niet vermeld. Geen percentage geslaagde taken, snelheidstest of eigen Nxt-test. Schaal begint bij nul.
Grafiek: Nxt Generation News · CC BY 4.0
Grafiek overnemen
Je mag deze grafiek overnemen en aanpassen, ook commercieel. Zet de bronvermelding hieronder erbij, met de link, en noem ook de bron van de cijfers. Voorwaarden
Meer denkwerk heeft een prijs in middelen. In de indexproeven genereerde Large 4 circa 200 miljoen teksttokens, tegenover 9,8 miljoen voor Large 3. Tokens zijn stukjes gegenereerde tekst. Dit verschil betekent dat een betere uitkomst samen kan gaan met veel meer gegenereerde tekst. Voor wie AI in grote aantallen werkopdrachten laat verwerken, is alleen de kwaliteitsscore daarom onvoldoende om over te stappen: ook het verbruik per geslaagde opdracht telt.
Waar helpt het, en waar blijft controle nodig?
Voor programmeerwerk is het nieuwe model veelbelovend, maar niet zonder sterkere concurrent. In een door Mistral beschreven blinde beoordeling gaven professionele beoordelaars Large 4 gemiddeld 3,74 van 5 punten voor codekwaliteit. Claude Opus 5 kwam op 4,22. Dat onderzoek is door de maker gepresenteerd, niet door Nxt uitgevoerd. Ons oordeel: Large 4 verdient een gerichte proef bij programmeerwerk, maar deze vergelijking rechtvaardigt geen algemene claim dat het de beste code schrijft.
Ook de onafhankelijke taaktests geven een gemengd beeld. Vals AI zet Large 4 op de 32ste plaats van 44 modellen in zijn brede index. Dezelfde evaluatiepagina meldt een zesde plaats van 75 bij juridische werkopdrachten, maar een 38ste plaats van 74 bij juridisch onderzoek. Een model kan dus relatief goed presteren bij het uitvoeren van werk met aangeleverde bestanden, terwijl het op een andere juridische taak veel minder sterk staat. Voor medewerkers die dossiers verwerken is dat onderscheid relevanter dan één algemeen klassement.
De juridische werkproef laat modellen documenten, spreadsheets en presentaties gebruiken. Large 4 voltooit daarin 15,83 procent van de taken; de lijstaanvoerder Muse Spark 1.2 komt op 25,42 procent. Zelfs de best scorende variant lost dus lang niet alles op binnen deze proef. Dat maakt dit een aanwijzing voor ondersteuning bij documentwerk, geen basis om juridische beslissingen zonder deskundige controle uit te besteden. De taakdefinitie verklaart mede waarom een mooie rangpositie niet hetzelfde is als een betrouwbare dagelijkse vervanger.
Verder bij de bron
Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.
- [1] Mistral AI
- [2] Mistral AI
- [3] Mistral AI
- [4] Vals AI — Large 4 en taakresultaten
- [5] Artificial Analysis — Mistral Large 3 - Intelligence, Performance & Price Analysis | Artificial Analysis
- [6] Artificial Analysis — Mistral Large 4 Preview - Intelligence, Performance & Price Analysis | Artificial Analysis
- [7] Artificial Analysis — Artificial Analysis Intelligence Index v4.3.2 | Artificial Analysis
- [8] Vals AI — Harvey's Legal Agent Benchmark Leaderboard | Vals AI
