Een nieuw pakket voor vaste keuzes

Laya wil AI laten kiezen zonder eerst een antwoordzin te schrijven. Op 20 september verscheen versie 0.3.4 van het open softwarepakket op PyPI. De maker presenteert het als bouwsteen voor toepassingen die bijvoorbeeld berichten moeten sorteren. Je geeft de mogelijke uitkomsten vooraf op; het model levert een keuze of getal met kansen erbij. Voor wie een app bouwt, is dat een andere taak dan een chatbot laten antwoorden.

Tekst begrijpen zonder een gesprek te voeren

Het technische uitgangspunt heeft een langere geschiedenis. Het oorspronkelijke BERT-onderzoek beschrijft een model dat woorden met zowel de context ervoor als erna verwerkt. Zo ontstaat een representatie van de tekst, waarop een extra uitvoerlaag voor een specifieke taak kan worden getraind. Denk aan het herkennen van een onderwerp in een bericht. Dat verklaart waarom een taalmodel niet noodzakelijk een schrijvende chatbot hoeft te zijn. Een model kan tekst ook gebruiken als invoer voor classificatie: materiaal in vooraf gekozen vakjes indelen. Die oudere onderzoekslijn maakt een nieuw product niet automatisch overbodig, maar voorkomt wel dat elke toepassing van een encoder als nieuwe uitvinding wordt gezien.

Waar de eerdere onderzoekslijn begon

Laya-maker Nandakishor Mukkunnoth verwijst naar zijn SalesRLAgent-preprint uit maart 2025. Daarin beschrijft hij het schatten van verkoopkansen tijdens gesprekken. Het systeem combineert tekstrepresentaties met kenmerken van het gesprek en beloont nauwkeurige voorspellingen via reinforcement learning, leren met beloningen. De beschreven trainingsgesprekken zijn synthetisch gegenereerd. Dat is eerdere, concrete documentatie van zijn werk aan kansschattingen. Het bewijst op zichzelf niet dat alle eigenschappen van de huidige Laya-versies toen al bestonden. Evenmin volgt eruit dat een ander bedrijf dezelfde techniek heeft overgenomen. Een tijdlijn van publicaties en een bewijs van technische gelijkheid zijn verschillende dingen; de preprint ondersteunt vooral het eerste.

Wanneer moet software hulp inschakelen?

Zijn tweede aangehaalde preprint behandelt een verwante, maar andere vraag: hoe bepaal je vóór tekstgeneratie of een taalmodel voldoende betrouwbaar lijkt? De beschreven aanpak combineert meerdere signalen en kiest vervolgens tussen lokaal antwoorden, informatie ophalen, een groter model inschakelen of menselijke beoordeling. Het onderzoek gebruikt een klein SmolLM2-model en noemt afhankelijkheid van referentiemodellen en aanpassing per toepassingsgebied als beperkingen. Dat levert een bruikbaar ontwerpidee op: bouw een uitwijkroute in als de zekerheid onvoldoende is. Het is geen bewijs dat het huidige Laya op elke nieuwe taak vanzelf de juiste grens kent. De beslissing om door te verwijzen blijft onderdeel van het ontwerp van de toepassing.

Ook Jev belooft beslissingen voor software

De directe aanleiding voor de discussie is Jev, dat TypeSafe op 15 september introduceerde. Ook dit model geeft vooraf gedefinieerde uitkomsten en kansen terug. TypeSafe noemt de trainingsmethode RLCD en positioneert het product voor automatische werkprocessen. Bij zijn evaluaties gebruikt het bedrijf voorspellingen van andere grote modellen als referentie. Dat meet overeenstemming met die referentie, niet rechtstreeks een universele waarheid. De toelichting nuanceert ook de claim over hallucinaties: overeenstemming met het uitvoerschema is gegarandeerd. Daaruit volgt niet dat de gekozen uitkomst inhoudelijk altijd klopt. Software kan bijvoorbeeld keurig een toegestane categorie ontvangen en toch een bericht naar de verkeerde afdeling sturen.

Een kansgetal is pas nuttig na controle

Hoe betrouwbaar is dan een zekerheid van 80 procent? Onderzoek van Chuan Guo en collega's uit 2017 geeft de relevante definitie: bij veel voorspellingen met ongeveer die zekerheid hoort ongeveer 80 procent correct te zijn. Dat heet kalibratie. Het is een eigenschap van groepen voorspellingen; één overtuigend getal bewijst niet dat een afzonderlijk antwoord juist is. De onderzoekers laten zien dat nauwkeurigheid en kalibratie uiteen kunnen lopen. Hun methode temperature scaling past de kansverdeling achteraf aan met een parameter, bepaald op aparte validatiegegevens. Voor een ontwikkelaar betekent dit dat je zowel fouten als zekerheid moet meten. Een fraaie kansverdeling in de interface is nog geen controle op hoe het systeem zich werkelijk gedraagt.

De vergelijking is geen gezamenlijke test

Juist daar vraagt Laya's benchmarkrapport om voorzichtig lezen. Het vermeldt expliciet dat Jev niet in dezelfde runs is gemeten: de vergelijkingscijfers komen uit andere publicaties, met andere aantallen voorbeelden en instructies. De hoge Laya-score voor typed-decisions hoort bovendien bij een model dat extra op de trainingsset van die benchmark is getraind. De basismodellen scoren daar veel lager. Voor Nederlandse voorbeelden in de MASSIVE-test met twintig keuzeopties rapporteert het project 39 procent correcte antwoorden voor het Engelse model en 45 procent voor de meertalige variant. Dat zijn eigen projectmetingen, geen onafhankelijke Nxt-test. Het rapport meldt ook te hoge zekerheid bij de geleverde modellen. De cijfers ondersteunen dus geen algemene belofte van foutloze beslissingen of een bewezen overwinning op Jev.

Wat zegt zo’n taaltest over jouw app?

MASSIVE is volgens de oorspronkelijke publicatie een dataset voor virtuele assistenten, met tekstvoorbeelden in 51 talen. Professionele vertalers hebben Engelstalige voorbeelden naar andere talen en lokale situaties omgezet. De taken betreffen onder meer het herkennen van een bedoeling en gegevens zoals een plaatsnaam. Dat maakt de test bruikbaar voor vergelijkingen binnen zo'n afgebakende taak. Het is geen representatieve steekproef van alle Nederlandse en Vlaamse berichten. Voor een lokale studentenapp, klantenservice of community blijft daarom een eigen controle nodig, met voorbeelden die lijken op het werkelijke gebruik. De onderzoeksvraag is niet alleen hoeveel talen op de productpagina staan, maar welke taken, formuleringen en fouten de evaluatie daadwerkelijk omvat.

Verder bij de bron

Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.

Bronnen en werkwijze