Google heeft zijn spraaktechnologie flink uitgebreid. Met Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS, op 23 september aangekondigd op het officiële Google-blog, kunnen ontwikkelaars tekst omzetten in opvallend expressieve spraak. De functie die de meeste aandacht trekt, is het klonen van een stem met slechts 30 seconden audio. Wie in Nederland of België woont, heeft daar voorlopig weinig aan: Google schrijft zelf dat stemklonen via AI Studio niet beschikbaar is in de Europese Economische Ruimte (EER). De overige functies kunt u wel gebruiken.
Wat kunnen de nieuwe spraakmodellen?
Google positioneert de twee modellen elk voor een ander soort werk:
- Flash TTS richt zich op creatief gebruik. U beschrijft in gewone taal welke stem u zoekt, bijvoorbeeld een rustige vertelstem met een zachte Vlaamse tongval, en het model maakt die stem vanaf nul. Per zin zijn aanwijzingen mogelijk voor toon, tempo, dialectwissels, fluisteren, lachen of zuchten.
- Flash-Lite TTS is de zuinigere variant voor grote volumes: nasynchronisatie, audiocontent op schaal en spraakassistenten die veel gesprekken tegelijk voeren.
Beide modellen kunnen vanuit één script een gesprek tussen twee sprekers maken en houden een stem volgens Google consistent, ook bij uren audio. Er zijn ruim 2.000 kant-en-klare stemmen. Het blog noemt meer dan 100 talen en regionale varianten; de technische documentatie van Flash TTS spreekt van ruim 130 talen met automatische taalherkenning. Nederlands hoort bij de ondersteunde talen.
Voor de kwaliteit verwijst Google naar metingen van Hume AI. In diens Voice Design Benchmark scoort Flash TTS 71,4 punten, de hoogste score, en ook bij het nabootsen van accenten staat het model bovenaan met 60,8. In de algemene kwaliteitsranglijst van Hume AI bezetten de twee modellen de eerste en tweede plaats. Dat zijn cijfers van Google en een externe beoordelaar; onze redactie heeft de modellen niet zelf gebruikt.
Stem klonen: hoe werkt het en waarom niet in de EER?
Google noemt het klonen voice replication. Er zijn twee opnames nodig van dezelfde volwassen persoon: een fragment gewone spraak (volgens de documentatie 10 tot 30 seconden) en een vaste toestemmingszin die de eigenaar van de stem zelf uitspreekt. Komen de stemmen niet overeen, dan wordt er geen stemprofiel gemaakt. Opgeslagen stemmen blijven maximaal een jaar aan een project gekoppeld, met een limiet van 200 per project. Er is ook een tijdelijke sleutel die zeven dagen geldig is.

Volgens het Google-blog werkt stemklonen via AI Studio niet in Illinois, Texas, de EER, het Verenigd Koninkrijk, Zwitserland en India. Een reden geeft Google niet. Wel valt op dat bijna al die gebieden strenge regels hebben voor biometrische gegevens. Onder de AVG geldt een stem die wordt gebruikt om iemand te identificeren als bijzonder persoonsgegeven, en Illinois en Texas hebben eigen biometriewetten. In de API-documentatie staat overigens geen regionale beperking vermeld. Of de uitsluiting ook geldt voor wie de API rechtstreeks aanroept, is daarom nog onduidelijk; Google heeft dat niet toegelicht.
Voor Nederland en België geldt hetzelfde: beide landen vallen onder de EER. Ook voor Franstalige Belgen maakt de taal van de interface dus geen verschil.
Waar zijn de modellen al te gebruiken?
| Product | Model | Voor wie |
|---|---|---|
| Gemini API en Google AI Studio | Flash TTS en Flash-Lite TTS | Ontwikkelaars, per direct |
| Gemini Notebook | Flash TTS | Alle gebruikers |
| Google Vids | Flash-Lite TTS | Alle gebruikers |
| Gemini Enterprise | Beide via de API | "Binnenkort" |
In de aankondiging staan geen API-prijzen. Partners die de modellen inbouwen zijn onder meer Figma, HeyGen, Wondercraft, LiveKit en Vercel. Voor Google Vids, dat sinds kort gratis video's met Gemini laat maken, betekent dit nieuwe stemmen voor voice-overs. Eerder deze week toonde Google al Gemini 3.8 Live met bewegende avatars voor bedrijven.
Wat betekent dit voor fraude met nepstemmen?
Alle audio die de modellen maken, krijgt SynthID: een onhoorbaar watermerk waarmee de audio later als kunstmatig te herkennen is. Gekloonde stemmen krijgen daarnaast C2PA-gegevens, een open standaard die de herkomst van content vastlegt.
Die voorzichtigheid is begrijpelijk. In Nederland en België kent vrijwel iedereen de "hoi mam"-fraude, waarbij oplichters zich via WhatsApp voordoen als familielid. Een stem die overtuigend als uw zoon of dochter klinkt, maakt zo'n truc gevaarlijker. De Europese AI-verordening (AI Act) verplicht daarom tot transparantie over kunstmatig gemaakte content, waaronder audio die echte mensen nabootst. Een klonen-functie voor iedereen met een halve minuut audio zou in Europa dan ook snel vragen van toezichthouders oproepen.
Een praktische tip die los staat van Google: spreek met familie een controlevraag of codewoord af voor onverwachte telefoontjes of spraakberichten waarin om geld wordt gevraagd.
Veelgestelde vragen
Kan ik vanuit Nederland of België mijn stem klonen met Gemini?
Nee. Volgens Google is stemklonen via AI Studio niet beschikbaar in de EER, waartoe Nederland en België behoren. Google zegt niet of en wanneer dat verandert.
Spreekt het model Nederlands?
Ja, Nederlands is een van de ondersteunde talen. U kunt een bestaande stem kiezen of een nieuwe laten maken op basis van een beschrijving.
Hoe herken ik audio die met Gemini is gemaakt?
Elk bestand bevat het SynthID-watermerk. Dat is niet te horen, maar wel op te sporen met de controlemiddelen van Google. Gekloonde stemmen dragen ook C2PA-herkomstgegevens.
Wat kost het?
De aankondiging noemt geen API-prijzen. Voor Gemini Notebook en Google Vids spreekt Google van beschikbaarheid "voor iedereen", zonder extra kosten te noemen.











