Acht nieuwe stemmen

Alibaba Cloud heeft op 20 september Qwen-Audio-3.1-Realtime-Plus toegevoegd aan zijn modelaanbod. De update krijgt acht extra standaardstemmen en behoudt de bestaande stemmen en het aansluitprotocol van 3.0 Plus. Het releaseoverzicht noemt daarnaast een contextvenster van 262.144 tokens, het aanroepen van externe functies, zoeken op het web en stemklonen. Die opsomming beschrijft mogelijkheden; ze bewijst niet dat iedere functie vandaag voor het eerst verschijnt. Voor makers van spraakapps is vooral interessant hoe natuurlijk zo'n gesprek werkelijk verloopt. Een stem kan prettig klinken terwijl de assistent je steeds onderbreekt. Nxt heeft dit model niet zelf getest. De aankondiging bevat geen onafhankelijke meting waaruit blijkt dat 3.1 gesprekken beter afhandelt.

Gesprekken hebben een ritme

Waarom valt een haperend gesprek zo op? Onderzoek van Tanya Stivers en collega's uit 2009 bekeek vraag-antwoordwisselingen in tien talen. De onderzoekers analyseerden informele gesprekken, met daarbinnen vragen waarop een ja-neeantwoord paste. In alle onderzochte talen lag de piek van de antwoordtiming tussen nul en tweehonderd milliseconden na het einde van de vraag. Mensen proberen zowel door elkaar praten als lange stiltes te beperken, al verschilden de gemiddelde tussenpozen per taal. Dat is achtergrondonderzoek naar mensen, geen snelheidsproef met Qwen. Het maakt wel duidelijk waarom gespreksritme aandacht verdient: een gesprekspartner wacht niet bij iedere beurt op een lange, ondubbelzinnige stilte. Voor een stemassistent is het daardoor onvoldoende om alleen achteraf een mooie gesproken zin te produceren. Ook het moment waarop die zin begint, bepaalt de ervaring.

Nederlands staat niet op de lijst

Qwens modelhandleiding beschrijft een verbinding waarin microfoongeluid naar de server stroomt terwijl spraak en tekst terugkomen. Dat gelijktijdige verkeer heet full duplex. De vermelde talen omvatten onder meer Engels, Frans en Duits; Nederlands staat niet op de lijst. Voor een Nederlandstalige studiehulp of Vlaamse klantenservice is ondersteuning dus niet aangetoond door deze documentatie. Er is bovendien een praktische grens aan het gespreksgeheugen: voor 3.1 Plus noemt de handleiding maximaal vijftig bewaarde audiobeurten en driehonderd seconden opgetelde audio. Oudere geschiedenis verdwijnt wanneer een grens wordt overschreden; standaard worden twintig beurten ingesteld. Dat gaat over behouden context, niet over een verplichte gespreksstop na vijf minuten. Wie een lang oefengesprek bouwt, moet dus controleren wat de assistent verderop nog weet. Een groot tokengetal vertelt daarvoor niet het hele verhaal.

Een korte pauze is geen punt

De instellingen voor de iOS-appbouwkit laten zien hoe gevoelig beurtwisseling is. In de gewone detectiestand activeert voldoende stilte na spraak een antwoord. Ontwikkelaars kunnen die wachtdrempel instellen; de standaard is achthonderd milliseconden. Lager instellen verkort het wachten, maar vergroot volgens de documentatie de kans dat een korte denkpauze al als het einde wordt opgevat. Dit getal is een instelling voor stiltedetectie, geen gemeten totale antwoordtijd. De alternatieve stand smart_turn combineert geluidssignalen met betekenis en moet aarzelgeluiden kunnen negeren. Dat is een beschreven werking van de leverancier, geen garantie voor ieder accent of rumoerig lokaal. Een bruikbare eigen proef zou daarom ook halve zinnen, zelfcorrecties en aarzelingen bevatten. Alleen een vloeiende vraag voorlezen zegt weinig over hoe de app zich tijdens een lastig gesprek gedraagt.

Wat de app achter de schermen doet

Ook de verbinding verdient aandacht wanneer studenten of kleine teams een eigen spraakapp maken. Alibaba's AOQ-handleiding voor 3.1 Plus beschrijft afzonderlijke stromen voor audio en besturingsgebeurtenissen. De app laat pas geluid door nadat de server de gespreksinstellingen heeft bevestigd. Aan het einde moeten de verbinding en de bijbehorende component worden afgesloten; daarbij sluit de bouwkit de audioapparaten. Dezelfde handleiding schrijft voor dat de vaste API-sleutel uitsluitend op de eigen applicatieserver staat. Een telefoon krijgt tijdelijke verbindingsgegevens, waarbij voor iedere nieuwe verbinding een nieuw token nodig is. Dat voorkomt dat de app de blijvende toegangssleutel aan elke gebruiker moet uitdelen. Voor de gebruiker hoort dit zich te vertalen in een duidelijk begin en einde van het gesprek. Een fraai pratend scherm alleen laat niet zien of die afhandeling klopt.

Stemklonen heeft een regiogrens

Een zelfgekozen stem vraagt weer andere controles. De handleiding voor stemklonen maakt onderscheid tussen losse spraaksynthese en Qwen-Audio-Realtime, het gespreksmodel. Voor die laatste categorie staat de kloonfunctie uitsluitend vermeld voor de regio China, Beijing. Beschikbaarheid van andere stemproducten in Singapore mag je daar dus niet zomaar op toepassen. De documentatie beschrijft een referentieopname waaruit een stem wordt aangemaakt, waarna het gespreksmodel die stem voor zijn antwoorden kan gebruiken. Een technisch geschikte opname moet duidelijke spraak bevatten, zonder achtergrondmuziek of andere sprekers. Dat zegt iets over bruikbaarheid van het geluidsmateriaal, niet over toestemming van degene die erop staat. Voor een schoolproject of prototype is een vooraf afgesproken eigen stem daarom een begrijpelijker uitgangspunt dan zomaar een opname van een docent, vriend of bekende persoon.

Een menselijke klank vraagt duidelijkheid

Voor Nederlandse en Belgische gebruikers speelt daarnaast herkenbaarheid. De Nederlandse Autoriteit Persoonsgegevens legde op 31 juli uit dat de Europese transparantieregels vanaf 2 augustus 2026 in veel situaties duidelijk moeten maken wanneer iemand met AI communiceert. Een organisatie moet bijvoorbeeld herkenbaar maken dat de klantenservicestem een AI-assistent is. De toezichthouder benadrukt dat die informatie uiterlijk bij de eerste interactie beschikbaar moet zijn. Dat is relevante context voor iedereen die een vriendelijke stem in een app zet: menselijk klinken mag de aard van de gesprekspartner niet verbergen. Voor jonge makers levert dat een concrete ontwerpkeuze op. Maak de kennismaking expliciet, zodat iemand weet met welk systeem die praat voordat het persoonlijke verhaal begint. Een geslaagde steminterface helpt de gebruiker niet alleen spreken, maar ook begrijpen aan wie het gesprek wordt toevertrouwd.

Verder bij de bron

Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.

Bronnen en werkwijze