# Google toont sterkere Gemini 4, maar gewone gebruikers krijgen nog geen toegang

Gemini 4 Argon presteert sterk in proeven voor kantoorwerk en beveiliging. Voorlopig mogen alleen geselecteerde cyberverdedigers ermee werken; een AI Ultra-abonnement geeft nu geen toegang.

- Canonieke URL: https://nxtnews.nl/artikel/google-toont-sterkere-gemini-4-maar-gewone-gebruikers-krijgen-nog-geen-toegang
- Gepubliceerd: 2026-09-30T23:23:18Z
- Rubriek: Tech
- Uitgever: Nxt

Door Tim Bouchratan

![Conceptuele collage: een kantoormedewerker kijkt naar een afgeschermd AI-systeem terwijl een beveiliger het onderzoekt.](https://nxtnews.nl/web/images/nxt-c24740f86120f5b82e85.jpg)

AI-illustratie · Nxt Generation News · Geen foto van de beschreven gebeurtenis.

Google heeft op woensdag 30 september Gemini 4 Argon aangekondigd, een nieuw AI-model dat volgens onafhankelijke proeven sterker is in ingewikkeld kantoorwerk. Wie in Nederland of België nu een beter antwoord in de Gemini-app verwacht, kan het model echter nog niet kiezen. Google geeft eerst een beperkte groep goedgekeurde cyberbeveiligers toegang. Het bedrijf belooft later een betaalde programmeertoegang en toegang voor Google AI Ultra-abonnees, maar noemt daarvoor geen datum. Een abonnement nemen in de verwachting dat Argon er vandaag al in zit, is dus te vroeg.

Bronnen bij deze passage: [1. Google Blog](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) · [4. Google Blog](https://deepmind.google/fairwind-program/) · [5. Vals AI](https://www.vals.ai/benchmarks/vals_index) · [6. Zapier](https://zapier.com/benchmarks)

De volgorde is opmerkelijk: eerst krijgen beveiligingsteams het model voor het opsporen en repareren van kwetsbaarheden, daarna pas ontwikkelaars en gewone gebruikers. Google wil volgens zijn aankondiging de veiligheidsmaatregelen met vroege testers aanscherpen. Fairwind, het toegangsprogramma, is gericht op overheden, vitale infrastructuur en grote technologieplatforms. Ook een organisatie die zich aanmeldt, moet worden beoordeeld; individuele gebruikers en studenten krijgen via dat programma geen toegang. Voor wie nu een script, studieopdracht of zakelijke tekst wil laten maken, blijven de al beschikbare modellen de praktische keuze.

Bronnen bij deze passage: [1. Google Blog](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) · [4. Google Blog](https://deepmind.google/fairwind-program/)

## Wat wordt werkelijk beter?

Ten opzichte van Gemini 3.1 Pro vergroot Google de maximale lengte die het model in één opdracht mag produceren van 64.000 naar een miljoen tokens, ruim vijftien keer zo veel. Dat kan relevant zijn bij een lange code-ombouw of een uitgebreid onderzoeksdossier: het model hoeft zijn werk mogelijk minder vaak af te breken. Het gaat om een technische bovengrens, niet om een garantie dat een antwoord van die lengte foutloos, betaalbaar of prettig leesbaar is. Gemini 3.1 Pro kon al een miljoen tokens aan invoer verwerken; de nieuwe claim gaat juist over de uitvoer.

Bronnen bij deze passage: [1. Google Blog](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) · [3. Google Blog](https://deepmind.google/models/model-cards/gemini-3-1-pro/)

Bij kantoorwerk zijn er ook resultaten buiten Googles eigen presentatie. Vals AI zet Argon op 68,90 procent in zijn Index 2.1, tegenover 67,04 voor Claude Sonnet 5.5, 66,97 voor Claude Opus 5.5 en 63,13 voor GPT-6 Astra. Die index weegt opdrachten in financiën, programmeren, recht en belasting naar hun aandeel in de Amerikaanse economie. De voorsprong op de beste Claude-modellen is dus klein, en een Amerikaanse taakmix zegt niet vanzelf hoe goed het model een Nederlandse belastingbrief of een Belgische arbeidsovereenkomst behandelt. Wel laat de proef zien dat Argon meer doet dan alleen lang schrijven.

Bronnen bij deze passage: [5. Vals AI](https://www.vals.ai/benchmarks/vals_index)

Zapier test of een AI-agent een opdracht daadwerkelijk afrondt in nagebootste bedrijfssoftware, zoals een klantenbestand, mailbox en agenda. Op AutomationBench 1.0.6 haalt Argon op de hoge denkstand 51,29 procent, Claude Sonnet 5.5 op maximale stand 44,75 en GPT-6 Astra op maximale stand 41,40. Het verschil is nuttig voor bedrijven die routinetaken willen laten uitvoeren, maar ook de koploper voltooit in deze opzet ongeveer de helft niet. Bovendien verschilt de ingestelde rekeninspanning per model. Voor financieel werk is Argon niet overal eerste: Sonnet scoort in Zapiers financiële deel 50,00 tegen 49,17 procent voor Argon op middelhoge stand.

Grafiek: AI-agenten bij gesimuleerde kantoortaken

Percentage afgeronde taken · schaal begint bij 0

Gemini 4 Argon (High): 51,29%

Claude Sonnet 5.5 (Max): 44,75%

Claude Opus 5.5 (Max): 42,47%

GPT-6 Astra (Max): 41,40%

Bron: Zapier AutomationBench 1.0.6, gecontroleerd 1 oktober 2026. Ruim 600 verborgen bedrijfstaken; verschillende denkstanden, Claude met standaard terugvalmodel. Dit is geen Nederlandse praktijktest.

Grafiek: [Nxt Generation News](https://nxtnews.nl/artikel/google-toont-sterkere-gemini-4-maar-gewone-gebruikers-krijgen-nog-geen-toegang#grafiek-1) · [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/deed.nl)

Bronnen bij deze passage: [6. Zapier](https://zapier.com/benchmarks)

## Sterk bij veiligheid, maar geen wondermiddel

Argons eerste gebruikers zijn beveiligers, en daar is de belofte concreet te toetsen. In CWE-bench versie 1 moeten AI-agenten in open software een verborgen kwetsbaarheid vinden en repareren zonder bestaande functies te breken. Argon, GPT-6 Astra en Grok 4.7 komen alle drie op 68 procent bij één poging; Claude Opus 5.5 haalt 67 procent. Dit is dus een gedeelde koppositie, geen bewijs dat Argon elke concurrent verslaat. De kosten per proefrun verschillen sterk en de modellen gebruiken verschillende werkomgevingen. Zo'n test is bovendien geen vrijbrief om een gevonden patch zonder menselijke controle op een ziekenhuisnetwerk uit te rollen.

Bronnen bij deze passage: [7. CWE-bench](https://cwe-bench.com/)

Google zegt zelf dat Argon zijn eerdere, op beveiliging gerichte Gemini 3.8 Flash Cyber voorbijgaat bij het vinden van kwetsbaarheden. De gepubliceerde voorbeelden komen uit interne proeven van Google en partner Wiz; daaruit volgt nog niet hoe vaak een buitenstaander met eigen software hetzelfde resultaat haalt. Google verwijst ook naar een gevonden ernstig probleem in zorgsoftware, maar geeft in de aankondiging geen gegevens waarmee een lezer de precieze impact zelfstandig kan vaststellen. De keuze voor beperkte toegang beschermt die gevoelige mogelijkheden, maar maakt een eigen vergelijking door gewone gebruikers voorlopig onmogelijk.

Bronnen bij deze passage: [1. Google Blog](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) · [4. Google Blog](https://deepmind.google/fairwind-program/)

Voor langdurig programmeerwerk is het beeld minder eenduidig. In Googles vergelijking komt Argon bij FrontierSWE v2 op 55,0 procent, achter Astra met 65,5 en Opus 5.5 met 62,3. FrontierSWE bestaat uit 34 lastige bouw-, onderzoeks- en optimalisatieopdrachten met een tijdsbudget van twintig uur. De openbare ranglijst van de benchmarkmaker toonde Argon bij onze controle nog niet, zodat deze Argon-score voorlopig op Googles publicatie berust. Ook op Googles Terminal-bench 4.0-overzicht blijft Argon achter Opus. Wie vooral langdurige softwareprojecten laat uitvoeren, heeft daarmee geen reden om Argon bij voorbaat als beste keuze aan te wijzen.

Bronnen bij deze passage: [2. Google Blog](https://deepmind.google/models/gemini/) · [8. FrontierSWE](https://www.frontierswe.com/blog/v2)

## Wat moet je nu kiezen?

Voor de meeste lezers verandert vandaag niets aan hun Gemini-toegang. Een beveiligingsorganisatie die binnen Fairwind past, kan zich aanmelden en moet eigen controles, mensen en aansprakelijkheid rond AI-patches houden. Voor bedrijven die later toegang krijgen, ziet Argon er vooral kansrijk uit voor meerstaps kantoorwerk en beveiligingsonderzoek; bij financieel werk en zware codeopdrachten zijn rivalen op sommige metingen even goed of beter. Googles aangekondigde introductietarief voor de toekomstige API is twee dollar per miljoen invoertokens en tien dollar per miljoen uitvoertokens, later het dubbele. Zonder releasedatum, eigen test en zicht op werkelijk verbruik is dat nog geen aankoopadvies.

Bronnen bij deze passage: [1. Google Blog](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) · [4. Google Blog](https://deepmind.google/fairwind-program/) · [5. Vals AI](https://www.vals.ai/benchmarks/vals_index) · [6. Zapier](https://zapier.com/benchmarks) · [7. CWE-bench](https://cwe-bench.com/) · [2. Google Blog](https://deepmind.google/models/gemini/)

## Verdieping: Wat de twee werkproeven wel en niet meten

De cijfers vergelijken werkopdrachten, geen dagelijkse ervaringen met de Gemini-app.

De Vals Index 2.1 gebruikt een gewogen mix van Amerikaanse beroepsopdrachten. Daarom is 68,90 procent niet te vertalen naar een kans van 68,90 procent dat een willekeurige Nederlandse taak lukt. AutomationBench 1.0.6 zet modellen in een nagebootst bedrijf en beoordeelt de toestand van de gegevens na afloop, niet hoe overtuigend hun antwoord klinkt. De ranglijst gebruikt verschillende denkstanden en soms terugvalmodellen bij weigeringen; de scores zijn daardoor nuttig om een richting te zien, maar geen zuivere test van identieke kosten en instellingen. In een echte organisatie blijven toegangsrechten, privacy en controle van verzonden berichten afzonderlijke voorwaarden.

Bronnen bij deze passage: [5. Vals AI](https://www.vals.ai/benchmarks/vals_index) · [6. Zapier](https://zapier.com/benchmarks)

## Bronnen

- [1. Google Blog](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/)
- [2. Google Blog](https://deepmind.google/models/gemini/)
- [3. Google Blog](https://deepmind.google/models/model-cards/gemini-3-1-pro/)
- [4. Google Blog](https://deepmind.google/fairwind-program/)
- [5. Vals AI](https://www.vals.ai/benchmarks/vals_index)
- [6. Zapier](https://zapier.com/benchmarks)
- [7. CWE-bench](https://cwe-bench.com/)
- [8. FrontierSWE](https://www.frontierswe.com/blog/v2)

[Bronnen en werkwijze](https://nxtnews.nl/bronnen#werkwijze)
