{"id":3444655,"date":"2026-10-02T09:13:24","date_gmt":"2026-10-02T07:13:24","guid":{"rendered":"https:\/\/datanorth.ai\/?post_type=news&#038;p=3444655"},"modified":"2026-10-02T09:13:15","modified_gmt":"2026-10-02T07:13:15","slug":"microsoft-lanceert-mai-transcribe-2-streaming","status":"publish","type":"news","link":"https:\/\/datanorth.ai\/nl\/nieuws\/microsoft-lanceert-mai-transcribe-2-streaming","title":{"rendered":"Microsoft lanceert MAI-Transcribe-2-Streaming"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Microsoft bracht op 1 oktober 2026 MAI-Transcribe-2-Streaming uit, het eerste model voor transcriptie in realtime, samen met twee spraakmodellen: MAI-Voice-2.1 en MAI-Voice-2.1-Flash. Microsoft meldt een woordfoutpercentage van 2,5% en een definitief transcript 0,13 seconde nadat iemand is uitgesproken. Streaming kost $0,54 per uur audio als introductietarief tot eind 2026.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat is er nieuw aan MAI-Transcribe-2-Streaming?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Microsoft had al MAI-Transcribe-2, een batchmodel dat een afgeronde opname omzet in tekst. Streaming is een ander probleem. Het model moet woorden tonen terwijl iemand nog praat, en ze daarna stil corrigeren zodra er meer audio binnenkomt. Volgens Microsoft verschijnen de eerste woorden ruim 100 milliseconden nadat de audio begint te lopen, ongeveer twee keer zo snel als de naaste concurrenten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Het model dekt 60 talen met automatische taalherkenning, dus je hoeft vooraf niet te zeggen welke taal eraan komt. Dat scheelt bij een supportlijn die op \u00e9\u00e9n nummer gesprekken uit een stuk of twaalf landen aanneemt.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">De twee spraakmodellen doen het omgekeerde en zetten tekst om in spraak. MAI-Voice-2.1 doet 23 talen in 26 locales en houdt daarbij \u00e9\u00e9n herkenbare stem aan, zodat een tweetalige assistent niet halverwege een zin van karakter verandert. MAI-Voice-2.1-Flash is de goedkope, snelle variant: 150 milliseconden end-to-end om 45 seconden audio te gaan produceren, met inferentie die Microsoft 55% sneller meet dan bij het standaardmodel. Beide ondersteunen stemklonen met ingebouwde toestemmingscontroles.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">MAI-Transcribe-2-Streaming benchmarks en prijzen<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Het verschil in nauwkeurigheid is klein en het verschil in snelheid is groot, precies omgekeerd aan hoe de lancering leest.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Aspect<\/th><th>MAI-Transribe-2-Streaming<\/th><th>Concurrent<\/th><\/tr><\/thead><tbody><tr><td>Woordfoutpercentage (fouten per 100 woorden)<\/td><td>2,5%<\/td><td>Grok Voice Transcribe 2.0: 2,73%<\/td><\/tr><tr><td>Definitief transcript na einde spraak<\/td><td>0,13 seconde<\/td><td>Grok Voice Transcribe 2.0: 0,49 s, Muse Voice Transcribe: 0,16 s<\/td><\/tr><tr><td>Aantal talen<\/td><td>60, met automatische herkenning<\/td><td>MAI-Voice-2.1: 23 talen, 26 locales<\/td><\/tr><tr><td>Streamingprijs per 1.000 minuten<\/td><td>$9,00 introductie<\/td><td>ElevenLabs en Deepgram Flux: ongeveer $6,50<\/td><\/tr><tr><td>Prijs tegenover het eigen batchmodel<\/td><td>$0,54 per uur<\/td><td>MAI-Transcribe-2 batch: $0,10 per uur<\/td><\/tr><tr><td>Spraakuitvoer per 1 miljoen tekens<\/td><td>MAI-Voice-2.1: $22<\/td><td>MAI-Voice-2.1-Flash: $15<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Het woordfoutpercentage en de latencycijfers komen van Microsoft zelf, uit de lanceringspost, die de eerste plaats op de Artificial Analysis-ranglijst claimt. Op het moment van schrijven staat het model nog niet in de publieke streaminglijst van die ranglijst, waar Grok Voice Transcribe 2.0 nog steeds bovenaan staat. Behandel de ranking als onbevestigd en de twee snelheidscijfers als de reden om te kijken.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Waar je de MAI-modellen kunt draaien<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Microsoft Foundry, voor productieworkloads binnen Azure<\/li>\n\n\n\n<li>MAI Playground, om het te proberen zonder iets aan te sluiten<\/li>\n\n\n\n<li>Vercel AI Gateway en OpenRouter, voor teams die daar al doorheen routeren<\/li>\n\n\n\n<li>LiveKit-ondersteuning is aangekondigd, zonder datum<\/li>\n\n\n\n<li>Geen open gewichten: alle drie de modellen zijn alleen gehost<\/li>\n<\/ul>\n\n\n\n<h2 class=\"wp-block-heading\">Wat Microsoft niet vertelt<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Drie gaten tellen als je een echte uitrol doorrekent. Er is geen claim over sprekerherkenning bij het streamingmodel, dus als je wilt weten wie wat zei in een vergadering, biedt dit daar nog geen antwoord op. Er is geen uitsplitsing per taal over die 60 talen, en een woordfoutpercentage op schone Engelse audio zegt niets over Nederlands via een mobiele verbinding.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En er is niet getest op ruis of microfoons op afstand. Transcriptiescores zakken in bij zaalmicrofoons en achtergrondgeluid, en dat is precies waar een callcenter of een vergaderrecorder zich bevindt. De voorsprong van 0,23 punt op Grok Voice Transcribe 2.0 komt neer op ongeveer twee extra goede woorden per duizend. Dat is echt, en het is geen reden om iets te migreren.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat dit betekent<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De moeite waard om nu te testen als je een spraakagent bouwt waarbij de gebruiker op het antwoord wacht. Een team van vier dat een telefoonassistent bovenop een LLM bouwt, heeft twee latencybudgetten: het model dat nadenkt en de audiopijplijn eromheen. De transcriptvertraging terugbrengen van ruwweg een halve seconde naar 0,13 seconde haalt een hoorbare pauze uit elke beurt, en samen met MAI-Voice-2.1-Flash op 150 milliseconden krijg je een rondgang die niet meer als een portofoon aanvoelt. Test het op jouw eigen audio, in jouw eigen talen, niet op de benchmark.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In de gaten houden maar nog niet overstappen als je al Deepgram of ElevenLabs draait en je transcripten goed genoeg zijn. Microsoft rekent ongeveer 38% meer per minuut dan beide, en 5,4 keer wat het eigen batchmodel kost, voor een verschil in nauwkeurigheid dat je nauwelijks gaat merken. Het ene geval waarin de som duidelijk klopt is het omgekeerde van de kop: is jouw audio al afgerond wanneer die binnenkomt, blijf dan bij het batchmodel voor $0,10 per uur en geef hier niets aan uit. Streaming is een product voor gesprekken, en Microsoft prijst het ook zo.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Voor meer informatie, bekijk <a href=\"https:\/\/microsoft.ai\/news\/our-first-streaming-transcription-model\/\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">de offici\u00eble aankondiging van MAI-Transcribe-2-Streaming op de blog van Microsoft AI<\/a>.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Microsoft bracht op 1 oktober 2026 MAI-Transcribe-2-Streaming uit, het eerste realtime transcriptiemodel, samen met MAI-Voice-2.1 en MAI-Voice-2.1-Flash. Microsoft meldt 2,5% woordfouten en een definitief transcript 0,13 seconde na het einde van de spraak, in 60 talen met automatische herkenning.<\/p>\n","protected":false},"author":12,"featured_media":3444653,"template":"","tags":[],"news-category":[],"class_list":["post-3444655","news","type-news","status-publish","has-post-thumbnail"],"meta_box":[],"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news\/3444655","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/news"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/12"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3444653"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3444655"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3444655"},{"taxonomy":"news-category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news-category?post=3444655"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}