Gepubliceerd: 24 september 2026
Google bracht Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS uit op 23 september 2026. Flash-Lite TTS kost $6 per miljoen audio-outputtokens tot het eind van dit jaar, daarna verdubbelt dat naar $12. Beide modellen komen met meer dan 2.000 kant-en-klare stemmen in ruim 100 talen, en je maakt een nieuwe stem door hem in een zin te beschrijven.
Wat kan Gemini 3.8 Flash TTS?
Het zet tekst om in spraak, en je kunt de voordracht sturen. Je zet een regieaanwijzing naast een zin, bijvoorbeeld fluisterend of gehaast, en het model volgt die per regel. Dat konden de oude Gemini TTS-modellen niet.
De stemmenbibliotheek is de tweede verandering. Google ging van 30 vaste stemmen naar ruim 2.000, en met generatief stemontwerp schrijf je een beschrijving in plaats van iets uit een lijst te kiezen. Je kunt ook een stem klonen uit een fragment van 30 seconden, al moet je de spreker eerst mondeling toestemming laten geven op band.
De twee modellen verdelen het werk. Flash TTS is de kwaliteitsvariant, bedoeld voor voice-over, personagestemmen en dialoog met meerdere sprekers. Flash-Lite TTS is de volumevariant, bedoeld voor nasynchronisatie en spraakagenten waarbij je de hele dag audio genereert.
Wat je bij allebei krijgt:
- Model-ID’s: gemini-3.8-flash-tts en gemini-3.8-flash-lite-tts
- Ruim 100 talen en dialecten, waaronder Quebecees Frans en Schots Engels
- SynthID-watermerk op elk audiobestand dat de modellen maken
- Lange opnames die de kwaliteit urenlang vasthouden
- Nu beschikbaar in de Gemini API en Google AI Studio, Gemini Enterprise volgt later
- Alleen via de API, dus er zijn geen gewichten om zelf te hosten
Gemini 3.8 Flash TTS prijzen en benchmarks
Dit haal je uit de tabel: je betaalt evenveel om tekst in te sturen, dus de echte keuze is wat een uur afgemaakte audio je kost.
| Wat wordt er gemeten | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| Tekstinput, per miljoen tokens | $0,50 | $0,50 |
| Audio-output tot 31 december 2026, per miljoen tokens | $9,00 | $6,00 |
| Audio-output vanaf 1 januari 2027, per miljoen tokens | $18,00 | $12,00 |
| Hume AI Overall Quality Index (hoe goed het klinkt) | 1e | 2e |
| Hume AI Voice Design Benchmark (beschreven stem nabootsen) | 71,4, 1e algemeen | niet gepubliceerd |
| Accentnabootsing, zelfde benchmark | 60,8, 1e | niet gepubliceerd |
De prijzen komen van de eigen prijspagina van Google, niet uit de lanceringspost. De posities zijn van Hume AI, een derde partij, gemeten op de Voice Design Benchmark en de Overall Quality Index. Google publiceerde geen eigen meting voor beide modellen. Dat is ongebruikelijk en per saldo in het voordeel van Google: een scorebord van buiten is lastiger naar je toe te rekenen.
Wat Google niet vertelt over de nieuwe TTS-modellen
De prijsverdubbeling op 1 januari 2027 staat alleen in de prijstabel. De lanceringspost noemt hem niet. Bouw je een businesscase op $6 per miljoen audiotokens, dan heb je ongeveer drie maanden tegen dat tarief.
Er staat ook nergens een cijfer over vertraging. Voor voice-over maakt dat niet uit. Voor een spraakagent is het juist het getal dat bepaalt of het product levend aanvoelt, en Google publiceerde niets over de tijd tot de eerste audio. De facturering gaat per token en niet per seconde of per teken, dus je kunt uit de gepubliceerde cijfers ook niet afleiden wat een minuut spraak kost. Dat moet je zelf meten.
Stemklonen is geblokkeerd in Illinois, Texas, de EER, het Verenigd Koninkrijk, Zwitserland en India. Daarmee valt die functie voor de meeste Europese teams af.
Wat dit betekent
Nu het testen waard als je spraak op volume genereert. Een nasynchronisatieteam of een klantenserviceplatform met spraakagenten zet Flash-Lite TTS deze week naast wat het nu gebruikt, want $6 per miljoen audiotokens gaat onder de meeste gespecialiseerde stemleveranciers door, en 100 talen uit een enkel endpoint scheelt een berg integratiewerk. Meet de vertraging zelf op je eigen verkeer, want Google publiceerde die niet, en reken het tarief van 2027 mee in alles met een horizon van een jaar.
Het volgen waard, maar nog niet overstappen, als je een Europees team bent dat het vooral om stemklonen te doen was. Die functie is voor jou niet beschikbaar, en wat overblijft is een heel goede standaardstemmenbibliotheek in plaats van wat je zocht. Het grotere punt is dat Google nu op prijs concurreert in een markt die gespecialiseerde leveranciers hebben opgebouwd, en dat het zich laat beoordelen op de benchmark van een ander in plaats van op een eigen meting. Allebei zetten ze druk op ElevenLabs en op de audiomodellen van OpenAI, en geen van beide heeft geantwoord.
Voor meer informatie, bekijk de officiële aankondiging van Gemini 3.8 Flash TTS op de blog van Google.