Google DeepMind lanceert SL2T: model voor gebarentaal

13-08-2026

SL2T is het nieuwe, op grote schaal meertalige model van Google DeepMind voor gebarentaal naar tekst, aangekondigd op 12 augustus 2026, dat vanaf 20 augustus 2026 ASL-naar-Engels dicteren mogelijk maakt in Gboard en Live Transcribe op de Pixel 11.

Geschreven door:

Jorick van Weelie

Marketing Lead bij DataNorth | Next-Gen AI-enthousiast & Tech Storyteller

Meld je aan voor de Nieuwsbrief

Gepubliceerd: 13 augustus 2026

Google DeepMind kondigde op 12 augustus 2026 SL2T (sign-language-to-text) aan, een op grote schaal meertalig vertaalmodel dat gebarentaal naar tekst dicteren mogelijk maakt in Gboard en Live Transcribe. Het model start met Amerikaanse gebarentaal (ASL) naar Engels en bereikt gebruikers op 20 augustus 2026, wanneer de Pixel 11 op de markt komt.

Wat kan SL2T?

Met SL2T kunnen Dove en slechthorende gebruikers naar hun telefoon gebaren op elk moment waarop ze normaal zouden typen. In Gboard kunnen gebruikers gebaren om op het web te zoeken, berichten of documenten op te stellen, of Gemini om een antwoord of een taak te vragen. In Live Transcribe kunnen gebruikers hun deel van een gesprek gebaren in plaats van heen en weer te typen met een horende gesprekspartner.

Het model is gebouwd voor gebruik in de praktijk en niet alleen onder laboratoriumomstandigheden. Google DeepMind zegt de streaming-latentie te hebben geminimaliseerd, gewerkt te hebben aan het voorkomen van hallucinaties wanneer de camera niet-gebarende beweging opvangt, en de prestaties te hebben afgestemd op de ongeveer 10 procent van de gebaarders die linkshandig zijn, evenals op eenhandig gebaren, wat gangbaar is wanneer een gebruiker de telefoon in de andere hand houdt.

Hoe werkt SL2T?

In tegenstelling tot transcriptie van gesproken taal, waarbij geluid wordt omgezet naar tekst in dezelfde taal, zijn gebarentalen onafhankelijke talen met een eigen grammatica en woordenschat. SL2T is daarom gebouwd als een echt machinevertalingssysteem in plaats van een omzetting van gebaar naar woord, en moet ook fysieke beweging interpreteren: gelijktijdige bewegingen van handen, armen, romp, hoofd en gezicht, vastgelegd met hoge framerates.

Om de privacy te beschermen, stuurt SL2T geen video naar de servers van Google. Een model op het apparaat zelf, genaamd MediaPipe Holistic, volgt houdingspunten van de gebarende persoon, en alleen die geometrische coördinaten worden verstuurd voor vertaling, waarna de originele video wordt verwijderd. SL2T vertaalt de reeks coördinaten rechtstreeks naar tekst, zonder de tussenliggende glosnotaties die in eerder onderzoek naar gebarentaal werden gebruikt en die volgens Google DeepMind geen recht doen aan non-manuele markeringen en ruimtelijke constructies.

SL2T benchmarks en technische specificaties

SL2T is getraind op meer dan 100.000 uur aan data, verspreid over meer dan 50 gebarentalen, waarvan ongeveer een kwart in ASL. Google DeepMind zegt dat gezamenlijk trainen over talen, dialecten en vaardigheidsniveaus het model helpt om gedeelde onderliggende structuren te leren en beter te presteren dan modellen die op een enkele taal zijn getraind.

Op FLEURS-ASL (sd-test), een benchmark voor de vertaalkwaliteit van ASL naar Engels, rapporteert Google DeepMind een zero-shot score van 70 BLEURT, wat het bedrijf omschrijft als aanzienlijk hoger dan elke eerder gerapporteerde score op deze benchmark. Dit cijfer is door de leverancier zelf gerapporteerd: Google DeepMind heeft geen vergelijkingstabel van eerdere scores gepubliceerd en noemt geen specifiek concurrerend model waartegen is gemeten, dus de claim moet worden gelezen als een eigen opgave en niet als onafhankelijk geverifieerd.

Hoe verhoudt SL2T zich tot eerdere gebarentaaltechnologie?

AI voor gebarentaal loopt van oudsher ver achter op AI voor gesproken taal. Google DeepMind wijst erop dat wereldwijd meer dan 200 gebarentalen worden gebruikt door naar schatting 70 miljoen Dove en slechthorende mensen, en dat eerdere benaderingen zoals gebarentaalhandschoenen fundamenteel beperkt waren omdat gebarentalen niet simpelweg gesproken taal op de handen zijn. Er bestaat geen wijdverspreid concurrerend consumentenproduct dat dezelfde functie van gebaar naar tekst op vergelijkbare schaal uitvoert, dus SL2T moet vooral worden gezien als een vroege speler in een grotendeels onaangeboorde categorie en niet als een directe vervanging van een bestaand model.

Beschikbaarheid en uitrol van SL2T

SL2T is beschikbaar in Gboard en Live Transcribe vanaf de Pixel 11, die op 20 augustus 2026 uitkomt, zonder extra kosten. Google DeepMind zegt dat er binnenkort meer apparaten volgen, samen met ondersteuning voor aanvullende gebarentalen naast ASL.

De release is mede vormgegeven door het AI Sign Language Advisory Committee (AISLAC), een groep van Dovenorganisaties en vakexperts waarmee Google DeepMind zegt te hebben samengewerkt op het gebied van evaluatie en impactbeoordeling. Naast het model publiceerden Google DeepMind en AISLAC gezamenlijk een impactrapport waarin de mogelijkheden en huidige beperkingen van SL2T worden beschreven, waaronder incidentele fouten bij zeldzame gebaren, snel vingerspellen, passieve constructies en classificator beelden.

De volledige details vind je op de officiële aankondiging voor SL2T van Google DeepMind.

Maak DataNorth AI je Google favoriet