ByteDance lanceert SeedRealtime

06-08-2026

SeedRealtime is een native audiovisueel full-duplexmodel dat zelf bepaalt wanneer het spreekt, dat volgens ByteDance de problemen met gespreksritme halveert ten opzichte van gekoppelde systemen, en waarvan benchmarkdetails en ontwikkelaarstoegang nog niet bekend zijn.

Geschreven door:

Jorick van Weelie

Marketing Lead bij DataNorth | Next-Gen AI-enthousiast & Tech Storyteller

Meld je aan voor de Nieuwsbrief

Gepubliceerd: 6 augustus 2026

De Seed-afdeling van ByteDance lanceerde op 5 augustus 2026 SeedRealtime, een native audiovisueel full-duplex taalmodel dat doorlopende audio-, video- en tekststromen verwerkt en tegelijk luistert en antwoordt. SeedRealtime voegt de drie modaliteiten samen in één architectuur in plaats van losse modules voor spraakherkenning, beeldbegrip en spraaksynthese aan elkaar te knopen. ByteDance meldt dat het model problemen met het gespreksritme in audiovisuele interactie halveert ten opzichte van gekoppelde systemen. Het model is uitgerold in de Doubao-app.

Wat is SeedRealtime en hoe werkt het?

SeedRealtime is gebouwd om tegelijkertijd te kijken, te luisteren en te spreken over doorlopende stromen. Audio, video en tekst komen samen in één architectuur, waardoor waarnemen, begrijpen, beslissen en uiten parallel kunnen verlopen. Gangbare spraakassistenten geven het stokje door van een spraakherkenningsmodule naar een beeldtaalmodel en vervolgens naar spraaksynthese, en bij elke overdracht komt vertraging bij en gaat context verloren. SeedRealtime haalt die overdrachten weg.

De grote verandering is dat het model zelf bepaalt wanneer het spreekt, in plaats van te vertrouwen op externe regels voor spraakdetectie. Het volgt scènes, sprekers, pauzes en achtergrondgeluid om in te schatten wat ertoe doet en wanneer een antwoord past. Visuele context doet daarbij echt werk: het model kan homoniemen oplossen, woorden als ‘dit’ koppelen aan een gebaar of een eerdere handeling, en informatie vasthouden die inmiddels buiten beeld is geraakt.

Het model kan ook spreken zonder nieuwe prompt. ByteDance geeft twee voorbeelden: het kan een herinnering geven zodra een gevraagd object in beeld komt, en het kan een fout benoemen op het moment dat die gebeurt.

Wat kan SeedRealtime in de praktijk?

ByteDance demonstreerde het model in rumoerige, open omgevingen in plaats van in een gecontroleerde opstelling. Het koppelde namen, gezichten en stemmen tijdens een groepsdiner, duidde gerechten en gesproken tekst in een restaurant, en gaf een seintje toen een gevraagd museumobject in beeld kwam.

In andere voorbeelden corrigeerde het een fout bij het zetten van espresso op het moment zelf, vond het een gevraagde passage terwijl de pagina’s van een artikel werden omgeslagen, negeerde het ongerelateerd geroezemoes op een luchthaven en volgde het het wijzen van een kind tijdens een Engelse les. In het luchthavenvoorbeeld zocht het online op bij welke bagageband de koffers zouden komen, wat laat zien dat het model live waarneming combineert met een externe opzoekactie.

Bij elkaar zijn dit precies de situaties waarop gekoppelde assistenten stuklopen: meerdere mensen die door elkaar praten, relevante visuele details die nooit hardop worden benoemd, en achtergrondspraak die geen reactie zou moeten uitlokken.

Prestaties van SeedRealtime en wat ByteDance niet deelt

In end-to-end evaluatie door mensen zegt ByteDance dat SeedRealtime problemen met het gespreksritme in audiovisuele interactie halveert ten opzichte van gekoppelde modellen. Beoordelaars zagen minder afgekapte zinnen, minder trage antwoorden na een pauze en minder valse triggers door spraak in de buurt, terwijl meer gesprekken soepel werden afgerond.

Daar houdt de openheid op. De aankondiging noemt geen steekproefgroottes, geen benchmarktabel en geen exact cijfer voor de winst in afgeronde gesprekken, waardoor de halveringsclaim op dit moment niet tegen een gepubliceerde methodologie te toetsen is. Er is ook geen parameteraantal en geen architectuurdetail buiten de beschrijving van een geïntegreerd ontwerp voor audio, video en tekst.

Seed stelt dat het model volledig is uitgerold, maar noemt geen API, ondersteunde regio’s, prijzen of toegangsvoorwaarden. De beschikbaarheid loopt via de Doubao-app, waar het gratis is en spraak- en videogesprekken ondersteunt.

Waar SeedRealtime staat en wat er nog komt

De release valt in dezelfde week als Muse Spark 1.2 van Meta en Alpamayo 2 Super van NVIDIA, en wijst een andere kant op dan beide. Waar die zich richten op programmeren en autonoom rijden, mikt SeedRealtime op doorlopende interactie in de echte wereld. ByteDance presenteert het als stap richting omni-modale systemen die waarnemen, converseren en handelen in veranderende omgevingen.

De routekaart van Seed noemt lagere latentie, fijnere timing voor onderbrekingen en korte tussenwerpsels, beter volgen van sprekers in scènes met meerdere mensen, meer proactieve beslissingen en taken met tools zoals opzoeken en boeken. Het bagagevoorbeeld op de luchthaven is een vroege vorm van dat laatste.

Voor teams die realtime multimodale assistenten beoordelen is toegang de praktische vraag. Zonder gedocumenteerde API, prijzen of regionale beschikbaarheid is SeedRealtime op dit moment een consumentenproduct in de Doubao-app en nog geen bouwsteen.

SeedRealtime draait in de Doubao-app en de technische aankondiging van SeedRealtime staat op de blog van ByteDance Seed.

Maak DataNorth AI je Google favoriet