Een filmpje voor school, een eigen podcast of een voorleesverhaal maken zonder zelf uren achter de microfoon te zitten: Google wil dat makkelijker maken. Op 23 september presenteerde het bedrijf twee nieuwe Gemini-modellen die geschreven tekst in gesproken audio veranderen. De ontwikkelaarsversies zijn sinds 22 september algemeen beschikbaar. De ene is bedoeld om stemmen en dialogen nauwkeurig vorm te geven, de andere om veel tekst goedkoper te laten inspreken. Voor Nederlandse en Belgische makers zit er meteen een belangrijke grens aan: een bestaande stem nabootsen via Google AI Studio is hier niet beschikbaar.
Wat hoor je anders?

Bij gewone tekst-naar-spraak kies je vaak een stem en laat je een zin voorlezen. Met Gemini 3.8 Flash TTS kun je volgens Google ook beschrijven hoe iemand moet klinken en per zin aangeven of die persoon fluistert, twijfelt of enthousiast reageert. Twee sprekers kunnen in hetzelfde script om beurten praten. Flash-Lite TTS is de lichtere variant voor grote hoeveelheden audio, bijvoorbeeld een reeks uitlegvideo’s. Het zijn geen chatbots die zelf een gesprek met je beginnen: je levert tekst en aanwijzingen aan, waarna het systeem geluid maakt. Een grappig accent in een demo bewijst bovendien nog niet dat een lange Nederlandse podcast natuurlijk klinkt.

Dat verschil met de eerdere Gemini 3.1 Flash TTS-preview is relevant voor wie regelmatig video’s of toegankelijk luistermateriaal maakt. De nieuwe modellen zijn nu volgens Googles logboek officieel beschikbaar via de Gemini-ontwikkelaarsdienst; de eerdere versie heette nog een preview. Google belooft vloeiender lange opnames en beter gescheiden stemmen in een dialoog. Dat zijn prestaties die het bedrijf zelf beschrijft. Wij hebben de nieuwe stemmen niet onafhankelijk beluisterd of met een menselijke inspreker vergeleken. Een maker moet dus zelf nagaan of namen, klemtonen en Nederlandse of Vlaamse uitspraak goed genoeg zijn voordat een opname online gaat.
Ook de plek waar je de stemmen tegenkomt, verdient nuance. Google noemt zijn dienst Gemini Notebook als toepassing voor luisterbare samenvattingen; die naam verving in juli het oude NotebookLM. Daarnaast zegt Google dat de lichtere stem naar Google Vids komt, de videotool voor werk en onderwijs. De aparte Vids-aankondiging van 23 september noemt die koppeling echter nog ‘binnenkort’. Dat het model voor ontwikkelaars beschikbaar is, betekent dus niet dat iedere Nederlandse of Belgische gebruiker vandaag al in elke Google-app dezelfde knoppen ziet.
Een stem ontwerpen is niet hetzelfde als iemands stem kopiëren
Je kunt een nieuwe, verzonnen stem laten ontwerpen met een omschrijving. Een echte persoon nadoen is iets anders: daarvoor noemt Google een opname van dertig seconden en een apart ingesproken toestemmingsverklaring van de stemhouder. De voetnoot bij de aankondiging sluit juist die nabootsfunctie via Google AI Studio uit in de Europese Economische Ruimte, dus ook in Nederland en België. Daaruit volgt niet dat alle vormen van nieuwe AI-stemmen in Europa verboden zijn, of dat dezelfde beperking voor elk ander Google-product geldt. Het is een productgrens die je vóór een opnameproject moet controleren, geen uitspraak over de hele Europese wet.
Google zegt gegenereerd geluid van een onzichtbaar digitaal watermerk en herkomstinformatie te voorzien. Zo’n verborgen kenmerk is niet hetzelfde als een hoorbare waarschuwing voor een luisteraar. Google verbiedt misleidende nabootsing in zijn gebruiksregels, maar een regel en een technisch merkteken kunnen op zichzelf niet bewijzen dat niemand een nepbericht maakt. Voor een schoolvideo of podcast blijft het verstandig duidelijk te melden dat een stem kunstmatig is. Krijg je een onverwacht spraakbericht van iemand die geld of een code vraagt, controleer dan via een ander contactkanaal of die persoon het echt was.
Wie liever niet van één Amerikaanse leverancier afhankelijk wordt, kan ook naar een Europese aanbieder kijken. Het Belgische Acapela Group noemt afzonderlijke stemmen voor Nederlands uit België en Nederland en heeft zijn statutaire zetel in Bergen. Die diensten richten zich deels op professionele productie en toegankelijkheid; we hebben de klank, prijs en gebruiksgemak niet onder dezelfde voorwaarden met Gemini vergeleken. Europese vestiging zegt op zichzelf niets beslissends over opslag, onderaannemers of contractuele zeggenschap. Vraag bij een serieus project vooral wie de stemopnamen bewaart, of je de audiobestanden kunt meenemen en welke rechten de inspreker behoudt.
Mijn oordeel: deze lancering maakt gesproken uitleg en een dialoog produceren waarschijnlijk laagdrempeliger voor makers die al met Google werken. De echte winst zit minder in een indrukwekkend klinkend stemvoorbeeld dan in het kunnen aanpassen van een script zonder iedereen opnieuw op te nemen. Tegelijk is een overtuigende kunststem geen vervanging voor toestemming, redactie of een echte Nederlandse luistertest. Voor een eenmalige schoolopdracht blijft zelf inspreken vaak de duidelijkste keuze. Voor terugkerende producties zou ik zowel de kwaliteit als de voorwaarden van Google en een alternatief vergelijken voordat iemands stem een vast onderdeel van het project wordt.
Verder bij de bron
Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.
