Publicatiedatum: 18 september 2026
xAI heeft Grok Voice Transcribe 2.0 beschikbaar gemaakt via de Speech to Text API. Daarmee staat naast versie 1.0 nu een tweede vast te pinnen transcriptiemodel klaar voor bestanden en realtime WebSocket-streaming. De nieuwe model-ID werd op 18 september 2026 voor het eerst in de publieke xAI-documentatie waargenomen.
Voor kopers is vooral de manier van uitrollen relevant. Versie 2.0 heeft geen hogere gepubliceerde lijstprijs, maar xAI houdt Transcribe 1.0 als standaardmodel. Productiesystemen gaan dus pas over wanneer ontwikkelaars 2.0 expliciet kiezen.
Grok Voice Transcribe 2.0 is een opt-in API-upgrade
Dezelfde `/v1/stt` API accepteert nu `grok-voice-transcribe-1.0` en `grok-voice-transcribe-2.0`. Bij streaming wordt het model gekozen bij het openen van de WebSocket-verbinding. Zonder modelparameter blijft xAI versie 1.0 gebruiken.
Dat maakt een gecontroleerde uitrol eenvoudig. Teams kunnen 2.0 op een deel van gesprekken of opnames testen en 1.0 als controlegroep behouden. Integraties die stabiel gedrag nodig hebben, worden niet automatisch naar de nieuwe versie omgezet.
De bredere STT-functies omvatten batch- en streamingtranscriptie, tussentijdse streamingresultaten, timestamps per woord, multichannel transcriptie, keyterm prompting en inverse text normalization. Batchbestanden mogen maximaal 500 MB zijn. Multichannel ondersteunt maximaal acht kanalen.
De lijstprijs blijft gelijk, maar een 2.0-benchmark ontbreekt
| Beslisfactor | Transcribe 2.0 | Transcribe 1.0 |
|---|---|---|
| REST-transcriptie | $0,10 per uur | $0,10 per uur |
| Streaming | $0,20 per uur | $0,20 per uur |
| Standaard zonder modelparameter | Nee | Ja |
| Publieke 1.0 versus 2.0-benchmark | Niet gepubliceerd | Baseline |
Voor inkoop maakt het ontbreken van een prijsopslag een test laagdrempelig. Voor engineering is de ontbrekende benchmark belangrijker. xAI publiceert nog geen vergelijkbare 1.0 versus 2.0-tabel voor nauwkeurigheid of latency. De winst bij accenten, ruis, namen en telefonie is dus nog niet publiek gekwantificeerd.
De algemene STT-documentatie noemt 10 requests per seconde voor REST, 10 voor streaming en 100 gelijktijdige streamingsessies per team. De gepubliceerde modelpagina plaatst de dienst in `us-east-1`. Enterprise-klanten kunnen hogere limieten aanvragen.
Meet correctiewerk in plaats van alleen WER
Speech-teams moeten een nieuw versienummer niet verwarren met een migratieargument. De relevante vraag is of 2.0 fouten vermindert die vervolgwerk veroorzaken: namen, producttermen, adressen, getallen, overlappende sprekers en rumoerige telefoonaudio.
Wie ook Deepgram, ElevenLabs of andere transcriptieproviders beoordeelt, moet voorzichtig zijn met benchmarks tussen leveranciers. Audio, taal, codec en scoringsmethode moeten gelijk zijn. Voor Transcribe 2.0 publiceert xAI zo’n vergelijking niet. Een A/B-test met eigen productiedata geeft daarom meer besliswaarde.
De gepubliceerde API-prijs is zo laag dat menselijke correctietijd een groter kostenaandeel kan vormen dan de transcriptie zelf. Bij dezelfde modelprijs kan minder correctie, minder retries of minder mislukte automatisering de totale kosten dus merkbaar verlagen.
Privacy en deployment vragen nog om inkoopcontrole
Volgens de enterprisevoorwaarden verwijdert xAI user content normaal binnen 30 dagen, met uitzonderingen voor afgesproken bewaartermijnen, wettelijke verplichtingen en veiligheids- of beveiligingsonderzoek. Er zijn ook Zero Data Retention-enabled API’s onder aparte voorwaarden. Organisaties met persoonsgegevens of gereguleerde audio moeten bevestigen dat hun gekozen STT-deployment onder de vereiste retentie-instelling valt.
De belangrijkste reden om niet direct over te stappen is bewijs, niet integratiewerk. Versie 2.0 is selecteerbaar en kost volgens de publieke tariefkaart hetzelfde als 1.0, maar een onafhankelijke evaluatie of gedetailleerde kwaliteitsvergelijking ontbreekt. Houd 1.0 gepind totdat eigen acceptatiemetrics een duidelijke winst laten zien.
Wat dit betekent
Contactcenters, meeting-transcriptieteams en voice-productteams die xAI al gebruiken kunnen Grok Voice Transcribe 2.0 nu testen. Begin met opnames met bekende fouten en vergelijk entity-accuracy, correctietijd, latency en retries met het gepinde 1.0-model.
Voor nieuwe kopers hoort 2.0 in een STT-bake-off omdat de lijstprijs gelijk blijft. Het is nog geen zelfstandige reden om van provider te wisselen, omdat xAI geen publieke benchmark heeft gepubliceerd die de omvang van de kwaliteitswinst aantoont.
Voor meer informatie, bekijk de officiële documentatie van Grok Voice Transcribe 2.0 op de website van xAI.