Fastino lanceert GLiNER2.5-Decide

25-09-2026

Fastino bracht GLiNER2.5-Decide uit op 24 september 2026, een open-weight model van 340M parameters dat tekst classificeert en routeert. Het scoort 60,1% op de eigen benchmark met 17 datasets, voor JevK5 met 57,5%, en geeft in 167 ms antwoord op een CPU met 48 cores, zonder GPU. De licentie is Apache 2.0. We kijken naar de benchmark die Fastino koos, het doorvoercijfer dat ontbreekt, en wie dit zou moeten testen.

Geschreven door:

Diederik Knol

Online Marketeer at DataNorth | Passionate about AI

fastino releases gliner2.5 decide
Meld je aan voor de Nieuwsbrief

Published: 25 september 2026

Fastino bracht GLiNER2.5-Decide uit op 24 september 2026, een open-weight model van 340M parameters dat tekst classificeert en routeert in plaats van praat. Het scoort gemiddeld 60,1% op de eigen Fast Decisions-suite van Fastino met 17 datasets, voor JevK5 met 57,5%, en antwoordt in 167 ms op een CPU met 48 cores, zonder videokaart. De licentie is Apache 2.0.

Wat kan GLiNER2.5-Decide?

Het beantwoordt in één keer een vaste set vragen over een stuk tekst. Je geeft het een supportticket en een lijst getypeerde vragen: over welk product dit gaat, hoe urgent het is, of er een mens bij moet. Het model geeft gestructureerde antwoorden terug in één doorloop, dus één ticket kost één aanroep in plaats van meerdere.

Daarmee is het een router en geen assistent. Fastino is duidelijk over de grens. Het model redeneert niet, legt niets uit en beantwoordt geen open vragen. Wat het wel doet is beslissen, elke keer op dezelfde manier, en dat is wat de meeste classificatie in productie echt nodig heeft.

Je bepaalt de labels op het moment dat je het model aanroept, dus een nieuwe categorie toevoegen betekent niet dat je iets opnieuw traint. Naast classificatie doet het entiteitsextractie met posities op tekenniveau, relatie-extractie en het opbouwen van gestructureerde records, met regels die overal worden afgedwongen.

De praktische details:

  • 340M parameters onder Apache 2.0, dus commercieel gebruik vraagt geen onderhandeling
  • Twee varianten kwamen dezelfde dag uit: GLiNER2.5-Decide-1B en GLiNER2.5-multi-Decide
  • Installeren met pip install gliner2, daarna laden met AutoExtractor.from_pretrained
  • Draait op CPU of GPU, met de gewichten op Hugging Face bij fastino/GLiNER2.5-Decide
  • Een gehoste API op agent.fastino.ai, als je het liever niet zelf draait
  • Geen algemeen model: geen redeneren, geen uitleg, geen open antwoorden

GLiNER2.5-Decide benchmarks en snelheid

Dit haal je uit de tabel: een encoder van 340M verslaat een taalmodel van 4B in het kiezen van het juiste label, en doet dat zonder videokaart.

Wat wordt gemetenGLiNER2.5-Decide (340M)Het alternatief
Fast Decisions gemiddeld, 17 classificatiesets60,1%JevK5: 57,5%
Zelfde suite, tegen een taalmodel van 4B60,1%SemIf (Qwen3.5-4B): 56,4%
Zelfde suite, tegen een encoder van gelijke omvang60,1%Laya (ModernBERT, 421M): 46,6%
Support intent routing, losse taak75,3%niet gepubliceerd voor concurrenten
Antwoordtijd, NVIDIA T4, 64 tokens43,6 msA100: 47,3 ms
Antwoordtijd, Xeon-CPU met 48 cores167,3 msgeen GPU nodig

Dit zijn de cijfers van Fastino op de testset van Fastino: 5.100 voorbeelden uit 17 domeinen, en het bedrijf zegt er zelf bij dat dit een interne benchmark is en niet JevBench. Waar de cijfers van JevK5, SemIf en Laya vandaan komen, vermeldt het niet. Lees de verschillen dus als de voorstelling van de leverancier en niet als een onafhankelijke uitkomst. De antwoordtijden zijn medianen, bij batchgrootte 1.

Wat Fastino niet vertelt

Er is geen score op een openbare benchmark die anderen ook draaien. Dat weegt hier zwaarder dan normaal, want de hele claim is een vergelijking met genoemde concurrenten, en Fastino koos zowel de tests als de tegenstanders. Een voorsprong van 3,6 punten op een eigen suite is een reden om zelf te meten, niet om dat over te slaan.

Ook de doorvoer ontbreekt. Elk snelheidscijfer geldt bij batchgrootte 1. Dat zegt hoe snel één ticket terugkomt en niets over hoeveel je er per uur doorheen krijgt. Voor het werk waar dit model voor bedoeld is, bepaalt juist dat tweede getal je rekening. Het geheugengebruik staat er evenmin bij.

Wat dit betekent

Nu het testen waard als je een duur topmodel betaalt om administratief sorteerwerk te doen. Het concrete geval: een team van vier mensen dat een paar honderdduizend tickets per maand door een GPT-6 Luna-aanroep haalt, alleen om te bepalen waar ze heen moeten. Met 340M parameters draait dit op de webservers die je toch al huurt, komt het antwoord in ruwweg 167 ms terug op gewone CPU, en hoeft niemand iets goed te keuren dankzij Apache 2.0. Haal een week aan echte tickets door beide en kijk hoe vaak de labels overeenkomen. Die test kost je een dag, en als hij standhoudt is de besparing blijvend.

Te negeren als je wilt dat het model uitlegt waarom. Er is geen uitleg, geen redeneerspoor en geen nette uitweg bij invoer die je labels niet dekken, en Fastino zegt dat zelf in plaats van het weg te moffelen. Het bredere patroon is het opmerken waard. Dit is het derde kleine specialistische model in een maand dat verkocht wordt op goedkoop en smal in plaats van krachtig en breed. De grote labs concurreren op wat een model kan; een groeiende laag eronder concurreert op wat je hun niet meer hoeft te betalen.

Voor meer informatie, bekijk de officiële aankondiging van GLiNER2.5-Decide op de blog van Fastino.

Maak DataNorth AI je Google favoriet