
Gemini 3.8 Flash TTS regisseert stemmen, maar klonen vereist toestemming

Google presenteerde in de aankondiging van 23 september 2026 Gemini 3.8 Flash TTS voor het ontwerpen van stemmen en het regisseren van spraak per tekstregel, met een bibliotheek van meer dan 2.000 productierijpe stemmen. Het model kan ook een herkenbare stem nabootsen, maar daarvoor is een gesproken toestemmingsopname nodig van de persoon van wie de stem afkomstig is. Voor podcasts, voice-overs en nasynchronisatie zijn dit verschillende productieroutes: een nieuwe verteller ontwerpen, een dialoog ensceneren of een bestaande stem met toestemming behouden.
De API-releasenotities van 22 september 2026 melden de algemene beschikbaarheid van Gemini 3.8 Flash TTS, de snellere Flash-Lite-variant en de Voices-endpoint, waarmee meer dan 150 vooraf gebouwde en aangepaste stemmen opvraagbaar zijn. Dat API-cijfer gaat over opvraagbare stemmen; het grotere getal uit de productaankondiging beschrijft de aangeboden stemmenbibliotheek. Ontwikkelaars krijgen toegang via de Gemini API en Google AI Studio, terwijl de uitrol naar andere Google-producten per model verschilt.
Een verteller begint met een stemomschrijving
Voor een voice-over kan een maker het script combineren met een omschrijving van rol, accent en stemkarakter. Flash TTS ontwerpt op basis van die tekst een nieuwe stem, zonder opname van een voorbeeldspreker. Een bestaande stem uit de bibliotheek kiezen is een andere mogelijkheid. In beide gevallen is het script de inhoud van de opname; de stemomschrijving bepaalt hoe de verteller in grote lijnen klinkt.
De speelrichting kan daarna per tekstregel veranderen. Een ingetogen opening, een nadrukkelijke kernzin en een zachtere afsluiting krijgen ieder hun eigen aanwijzing voor tempo, emotie of uitspraak. Dat is relevant voor een voice-over die binnen één opname van toon wisselt: de maker hoeft daarvoor niet telkens een nieuw stemprofiel te ontwerpen. De aanwijzingen sturen de voordracht, terwijl tekst en stemidentiteit herkenbaar blijven.
Voor een Nederlandstalige en een anderstalige versie zijn afzonderlijke scripts nodig. Het model ondersteunt Nederlands en een groot aantal andere talen, maar de tekstkeuze voor Nederland en Vlaanderen blijft een redactionele keuze: eigennamen, aanspreekvormen en regionale woorden kunnen per publiek verschillen. Een stem met een beschreven accent lost een ongeschikte vertaling niet op. Bij een meertalige productie liggen vertaling, stemontwerp en voordracht daarom op verschillende plekken in dezelfde audioketen.
Een tweegesprek vraagt regie per spreekbeurt
Voor een podcastscène bestaat de invoer uit een script met herkenbare spreekbeurten en een stem voor iedere rol. Flash TTS kan een gesprek met twee sprekers als scène uitvoeren, met beurtwisselingen en afzonderlijke aanwijzingen voor de voordracht. Een aarzelend antwoord of een zacht uitgesproken reactie komt dan voort uit de regie bij die passage, niet uit een algemene opdracht aan de hele aflevering.
Ook korte vocale reacties zijn onderdeel van die regie. Een lach, zucht of instemmend geluid kan tussen woorden worden geplaatst, terwijl het script vastlegt wie aan het woord is. Voor een fictieve podcast of een nagespeelde uitleg levert dat een andere vorm van controle op dan twee losse voice-overs achter elkaar monteren. Het resultaat is gegenereerd spel; het is geen opname van een werkelijk gevoerd interview.
In de Gemini API ondersteunt één aanvraag voor twee sprekers vooraf gebouwde stemmen. Wie eigen ontworpen of gerepliceerde stemprofielen in dezelfde dialoog wil combineren, genereert de beurten afzonderlijk en monteert ze samen. Daarmee wordt de keuze voor een originele personagestem ook een keuze voor de productiewijze. De voorwaarden voor replicatie verdwijnen niet wanneer een echte stem maar één korte repliek krijgt.
Een terugkerend personage kan ontworpen of gerepliceerd zijn
Bij een serie is stemcontinuïteit belangrijker dan een eenmalige geslaagde opname. Een ontworpen stem kan worden opgeslagen en opnieuw gebruikt bij een volgend script, terwijl aanwijzingen voor tempo en emotie per scène veranderen. De invoer voor zo'n personage is aanvankelijk een tekstuele stemomschrijving; latere afleveringen gebruiken het bewaarde profiel en nieuwe tekst. Er is dan geen referentieopname van een persoon nodig.
Replicatie heeft een andere bron. Wie de herkenbare stem van een presentator, acteur of andere echte spreker wil behouden voor nieuwe tekst, levert een opname van die stem aan. De referentie kan ongeveer dertig seconden duren. Daarnaast moet de stemhouder zelf een gesproken toestemmingsverklaring opnemen; het systeem vergelijkt die met de referentiestem voordat het stemprofiel wordt gemaakt. Alleen een bruikbaar fragment uit een bestaande aflevering aanleveren voldoet dus niet.
Dat onderscheid telt ook bij nasynchronisatie. Een andere taal met een ontworpen stem is een nieuwe uitvoering van het script. De persoonlijke stem van dezelfde vertolker in die taal behouden vraagt eerst om diens geverifieerde toestemming. De gegenereerde audio draagt een SynthID-watermerk; bij replicatie worden ook C2PA-herkomstgegevens genoemd. Die signalen markeren de herkomst van de uitvoer; de toestemmingsopname hoort bij het maken van het profiel.
De toegang verschilt per model en regio
Flash TTS is beschikbaar voor ontwikkelaars in Google AI Studio en via de Gemini API en wordt uitgerold in Gemini Notebook. Google Vids krijgt de Flash-Lite-variant voor AI-voice-overs; wie daar een video inspreekt, gebruikt dus niet automatisch de creatieve Flash-variant. Voor Gemini Enterprise was toegang via een API bij de aankondiging nog aangekondigd voor later. Het product waarin een maker werkt, bepaalt daardoor welke bediening en welk model daadwerkelijk voorhanden zijn.
Voor makers in Nederland en Vlaanderen geldt een concrete regionale grens: Android Authority's uitrolbericht vermeldt dat stemreplicatie via Google AI Studio in de Europese Economische Ruimte geblokkeerd is. Die beperking betreft die functie in AI Studio; uit de melding volgt geen algemene blokkade van stemontwerp, dialoogregie of elke andere toegang tot het model. Een productie met een ontworpen stem kan daar dus een ander traject volgen dan een productie die afhankelijk is van de persoonlijke stem van een vertolker.
Lees ook:
Gerelateerde artikelen


Otter of Fireflies: beter transcript of veel ruimere taalkeuze?

Riverside of Zencastr: video-eerst botst met een complete podcastworkflow

Buzzsprout of Podbean: uploaduren botsen met onbeperkte opslag

OpusClip of Descript: clips laten kiezen of eerst het hele gesprek bewerken

DeepL of Google Translate: nuance wint niet in elke taal
Abonneer je op onze nieuwsbrief
Ontvang het laatste nieuws over Web3, AI en crypto rechtstreeks in je inbox.