16 september 2026
Google bracht op 15 september 2026 Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking uit, twee spraakmodellen die tegelijk luisteren en praten. Gemini 3.8 Live Extended Thinking scoort 82,6 op de Artificial Analysis Speech to Speech Index, de hoogste score van alle spraakmodellen die dat bureau heeft getest, en kost $3,50 per uur ingesproken audio tegenover $5,83 voor GPT-Live-1 van OpenAI. Beide modellen zijn vanaf nu beschikbaar in de Gemini API en Google AI Studio.
Wat kunnen Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking?
Dit zijn speech-to-speech-modellen: audio gaat erin, audio komt eruit, zonder aparte stap die eerst tekst maakt en daarna weer spraak. Juist het weglaten van die tussenstappen zorgt ervoor dat het model midden in een zin onderbroken kan worden in plaats van te wachten tot je uitgepraat bent.
De twee modellen verdelen het werk. Gemini 3.8 Live is de snelle, goedkope variant, bedoeld voor grote aantallen gesprekken. Gemini 3.8 Live Extended Thinking redeneert en praat tegelijk, dus het kan “even kijken” zeggen en vervolgens hardop vertellen hoe het vordert terwijl een taak met meerdere stappen op de achtergrond loopt.
Beide modellen verwerken audio, beelden, video en tekst, met een contextvenster van 128.000 tokens en 64.000 tokens uitvoer. Gemini 3.8 Live leest beeld vrijwel realtime mee en herkent en wisselt tussen 97 talen midden in een gesprek. Alle audio die eruit komt draagt een SynthID-watermerk. De modelkaart van Google vermeldt dat beide modellen op Gemini 3 Pro zijn gebouwd en niet op een Flash-model.
Benchmarks van Gemini 3.8 Live en de vergelijking met GPT-Live-1
OpenAI bracht GPT-Live-1 vijf dagen eerder uit in zijn API, dus de twee landen in dezelfde week. De tabel laat zien waarom de keuze op kwaliteit dicht bij elkaar ligt en op prijs juist niet.
| Wat wordt gemeten | Gemini 3.8 Live Extended Thinking | OpenAI GPT-Live-1 (Astra, medium) |
|---|---|---|
| Speech to Speech Index (algemene kwaliteit) | 82,6 | 81,5 |
| Big Bench Audio (redeneren vanuit spraak) | 98% | 90% |
| Tau-Voice (afgeronde klantenservicetaken) | 68,6% | 67,9% |
| Full Duplex Bench (onderbrekingen en pauzes) | 91,9% | 94,9% |
| Tijd tot eerste geluid | 1,35 seconden | 1,34 seconden |
| Kosten per uur ingesproken audio | $3,50 | $5,83 |
Dit zijn metingen van Artificial Analysis en niet van Google, al noemt Google dezelfde cijfers voor Tau-Voice en Big Bench Audio in zijn aankondiging. Artificial Analysis vermeldt dat de rij voor GPT-Live-1 op een enkele meting berust terwijl de meeste modellen er drie krijgen, dus behandel de OpenAI-kolom als de minst stabiele van de twee.
Wat Gemini 3.8 Live kost
De prijslijst van Google zet Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking en het oudere Gemini 3.1 Flash Live Preview op een enkele regel, dus de twee nieuwe modellen kosten per token evenveel:
- Audio-invoer: $3,00 per miljoen tokens, of $0,005 per minuut
- Audio-uitvoer: $12,00 per miljoen tokens, of $0,018 per minuut
- Tekstinvoer $0,75 en tekstuitvoer $4,50 per miljoen tokens
- Beeld- en video-invoer: $1,00 per miljoen tokens, of $0,002 per minuut
- Via Google AI Studio is een gratis laag beschikbaar
Dezelfde lijstprijs betekent niet dezelfde rekening. Extended Thinking produceert redeneertokens en die worden afgerekend tegen het uitvoertarief. Op dezelfde vaste set taken mat Artificial Analysis $3,50 per uur ingesproken audio voor Extended Thinking tegenover $0,84 voor het gewone Gemini 3.8 Live: dezelfde prijskaart, ongeveer vier keer de factuur.
Wat Google niet vertelt
Drie dingen staan niet in de aankondiging. Het eerste is de marge. Een score van 82,6 verslaat de 81,5 van GPT-Live-1 met 1,1 punt op een samengestelde index. Google noemt het de eerste plaats en laat het verschil onbenoemd.
Het tweede is de zwakkere helft van het duo. Gemini 3.8 Live rondt 30,1% van de Tau-Voice klantenservicetaken af, tegenover 68,6% voor Extended Thinking. Google drukt die 68,6% af en zegt over Gemini 3.8 Live alleen dat het tweede werd in de Speech Agent Arena. Die arena meet met welk model mensen liever praatten. Ze meet niet of de taak ook werd afgerond. Bouw je een agent die een vlucht moet omboeken of een bestelling moet terugstorten, dan is 30,1% het cijfer dat de keuze bepaalt. Die tweede plaats ligt bovendien achter het eigen Gemini 3.1 Flash Live Minimal van Google en niet achter een concurrent.
Het derde is het veiligheidspapierwerk. De modelkaart meldt dat Google Gemini 3.7 Flash onder zijn Frontier Safety Framework heeft beoordeeld en die conclusie heeft overgenomen, omdat geen van beide nieuwe modellen wezenlijk nieuwe mogelijkheden laat zien. Er is dus geen nieuwe frontier-veiligheidsevaluatie gedaan op deze twee releases. Dezelfde kaart noemt een kennisgrens van januari 2025, twintig maanden voor de lancering.
Wat dit betekent
Draai je al een spraakagent op GPT-Live-1 of GPT-Realtime, dan is Gemini 3.8 Live Extended Thinking het deze week waard om te testen, en de reden is de prijs en niet de kwaliteit. Een voorsprong van 1,1 punt op een index valt binnen de ruis van elke benchmark. Kosten die 40% lager liggen per uur audio niet. Voor een klantcontactteam met duizenden gesprekken per dag komt dat verschil direct op de maandfactuur terecht, en de overstap kost een paar dagen werk aan je harness.
Behandel de twee modellen als losse producten en niet als een snelle en een langzame variant van hetzelfde. Gemini 3.8 Live is met $0,84 per uur het goedkoopste serieuze spraakmodel dat er ligt en het praat prettig, dus het past bij triage, doorverwijzen, openingstijden en alles waar een mens de moeilijke gevallen oppakt. Het past niet bij taken die zonder toezicht afgerond moeten worden, en de score van 30,1% op Tau-Voice zegt dat onomwonden. Extended Thinking is het model dat je op echte processen zet. Begroot het als een apart model met een aparte rekening, want dat is het.
Voor meer informatie, bekijk de officiële aankondiging van Gemini 3.8 Live op de blog van Google.