{"id":3443131,"date":"2026-09-02T10:32:50","date_gmt":"2026-09-02T08:32:50","guid":{"rendered":"https:\/\/datanorth.ai\/?post_type=news&#038;p=3443131"},"modified":"2026-09-02T10:32:41","modified_gmt":"2026-09-02T08:32:41","slug":"meta-lanceert-muse-voice-transcribe","status":"publish","type":"news","link":"https:\/\/datanorth.ai\/nl\/nieuws\/meta-lanceert-muse-voice-transcribe","title":{"rendered":"Meta lanceert Muse Voice Transcribe"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em>Publicatiedatum: 2 september 2026<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Meta heeft Muse Voice Transcribe uitgebracht, een nieuw realtime speech-to-text-model op de Meta Model API. Meta noemt een prijs van $0,18 per audio-uur en zegt dat het model live transcriptie kan combineren met sprekerherkenning voor meer dan 20 sprekers.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Daarmee krijgen contactcenters, vergadertools en bouwers van voice-agents een extra productieoptie zonder aparte diarization-pipeline.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat kan Muse Voice Transcribe?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De meeste spraakproducten plakken vandaag drie systemen aan elkaar. E\u00e9n schrijft de tekst, een tweede bepaalt wie er sprak en een derde beslist wanneer de spreker klaar is. Elke overdracht kost tijd en levert een extra faalpunt op. Muse Voice Transcribe doet alle drie in \u00e9\u00e9n doorloop, zonder nabewerking.<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Sprekers: labelt meer dan twintig stemmen in dezelfde opname.<\/li>\n\n\n\n<li>Lengte: verwerkt audio van langer dan een uur zonder die op te knippen.<\/li>\n\n\n\n<li>Talen: getraind op meer dan zeventig, waarvan er vijfentwintig zijn geverifieerd bij de lancering.<\/li>\n\n\n\n<li>Wisselen van taal: herkent een spreker die midden in een zin overschakelt.<\/li>\n\n\n\n<li>Beschikbaarheid: de Meta Model API als muse-voice-transcribe-1.0, met een zero data retention-optie.<\/li>\n\n\n\n<li>Draait al in de dictatiefunctie van Meta AI op Mac en in Muse Code.<\/li>\n<\/ul>\n\n\n\n<h2 class=\"wp-block-heading\">Hoe het model kiest tussen luisteren en schrijven<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De audio komt binnen in korte stukjes. Na elk stukje maakt het model \u00e9\u00e9n keuze: doorluisteren, of het volgende woord schrijven. Omdat het die keuze zelf bepaalt, bepaalt het ook hoeveel audio er achter elk woord zit. Meer audio betekent een betere gok, maar een tragere reactie.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Meta legde die afweging niet met de hand vast. Het trainde het model met reinforcement learning en beloonde nauwkeurigheid en snelheid tegelijk, zodat het alleen langer wacht bij moeilijke woorden. Sprekerlabels en eindmarkeringen zijn gewoon extra tokens in dezelfde stroom. Daarom is er geen tweede model nodig.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Muse Voice Transcribe benchmarks en prijs<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De interessante vergelijking is niet nauwkeurigheid alleen, maar nauwkeurigheid tegenover snelheid en prijs tegelijk.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Wat wordt er gemeten<\/th><th>Muse Voice Transcribe<\/th><th>Cartesia Ink-2<\/th><\/tr><\/thead><tbody><tr><td>Woordfoutpercentage op het eindtranscript (lager is beter)<\/td><td>3.1%<\/td><td>3.4%<\/td><\/tr><tr><td>Vertraging nadat de spreker stopt<\/td><td>0.16 seconde<\/td><td>0.43 seconde<\/td><\/tr><tr><td>Prijs per 1.000 audiominuten<\/td><td>$3.00<\/td><td>$4.00<\/td><\/tr><tr><td>Gemiddelde sprekerfout, drie publieke sets<\/td><td>17.5%<\/td><td>concurrenten scoorden 21.1% tot 28.6%<\/td><\/tr><tr><td>Sprekerherkenning in hetzelfde model<\/td><td>ja<\/td><td>nee<\/td><\/tr><tr><td>Gewichten die je zelf kunt draaien<\/td><td>nee<\/td><td>nee<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">De spraakcijfers komen van Artificial Analysis, de sprekercijfers van Meta zelf. ElevenLabs Scribe v2 Realtime antwoordt iets sneller, in 0.14 seconde, maar is minder nauwkeurig en kost $6.50 voor dezelfde minuten. Meta rapporteert de diarisatiecijfers zelf, dus die helft van de tabel is niet onafhankelijk gemeten.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat Meta niet vertelt<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Er zijn geen gewichten. Meta bracht dit jaar wel open modellen uit, waaronder Muse Glimmer, dus dit is een keuze en geen gewoonte. Wil je juist \u00e9\u00e9n model omdat opnames je gebouw niet uit mogen, dan helpt deze release je niet.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Meta noemt vijfentwintig geverifieerde talen van de ruim zeventig getrainde, zonder te zeggen welke vijfentwintig. Er is ook geen woordfoutpercentage per taal gepubliceerd. Voor een Nederlands of Europees team is dat juist het cijfer dat de keuze bepaalt, en het ontbreekt.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat dit betekent<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Muse Voice Transcribe is nu het testen waard als je vergadernotities, callanalyse of live ondertiteling draait en daar nu drie leveranciers voor betaalt. De prijs is ongeveer de helft van die van ElevenLabs. Drie systemen terugbrengen tot \u00e9\u00e9n haalt bovendien twee plekken weg waar je pijplijn uit de pas kan lopen. Een klein productteam voelt die vereenvoudiging sterker dan de winst in nauwkeurigheid.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Sla het over als je gereguleerd bent, on-premise draait of al op open gewichten hebt ingezet. Er is geen zelfgehoste route en geen aankondiging daarvan. De voorsprong op Cartesia is drie tiende procentpunt, wat op zichzelf geen migratie rechtvaardigt. De prijs en de eenvoudigere stack zijn het echte argument, dus test eerst op je eigen audio.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Voor meer informatie, bekijk <a href=\"https:\/\/research.meta.ai\/blog\/introducing-muse-voice-transcribe\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">de offici\u00eble aankondiging van Muse Voice Transcribe op de blog van Meta<\/a>.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Meta\u2019s nieuwe Muse Voice Transcribe combineert streaming transcriptie met live sprekerherkenning via de Meta Model API. Met een prijs van $0,18 per audio-uur is het een relevante test voor contactcenters, vergadertools en bouwers van voice-agents.<\/p>\n","protected":false},"author":12,"featured_media":3443129,"template":"","tags":[],"news-category":[],"class_list":["post-3443131","news","type-news","status-publish","has-post-thumbnail"],"meta_box":[],"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news\/3443131","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/news"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/12"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3443129"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3443131"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3443131"},{"taxonomy":"news-category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news-category?post=3443131"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}