Liquid AI brengt LFM2.5-VL-3B-DSpark uit

25-09-2026

De nieuwe DSpark-drafter van Liquid AI versnelt LFM2.5-VL-3B zonder het onderliggende visionmodel te vervangen. Vendor-tests tonen tot 3,13x snellere decoding en 2,62x end-to-end winst, vooral wanneer generatie een groot deel van de requesttijd bepaalt.

Geschreven door:

Jorick van Weelie

Marketing Lead bij DataNorth | Next-Gen AI-enthousiast & Tech Storyteller

liquid ai released lfm2.5 vl 3b dspark
Meld je aan voor de Nieuwsbrief

Gepubliceerd: 25 september 2026

Liquid AI bracht op 24 september LFM2.5-VL-3B-DSpark uit als open-weight model voor speculative decoding naast zijn 3B vision-language model. De drafter van 279,5 miljoen parameters staat op Hugging Face en versnelt het bestaande model zonder de outputdistributie van het targetmodel te veranderen.

De zakelijke waarde is concreet. Teams met lokale OCR, schermherkenning of visual agents ruilen 8,9% extra parameters in voor door Liquid gemeten end-to-end versnellingen tot 2,62x op Apple silicon en 2,27x op een H100.

Wat DSpark verandert in een vision-pipeline

LFM2.5-VL-3B-DSpark is geen vervangend foundation model. Het is een klein draftmodel dat naast LFM2.5-VL-3B draait. De drafter voorspelt blokken kandidaat-tokens en het oorspronkelijke targetmodel controleert die. Bij greedy decoding is de uiteindelijke tekst volgens Liquid exact gelijk aan wat het targetmodel zelfstandig zou produceren.

Dat is relevant voor teams die hun bestaande vision-pipeline al hebben gevalideerd. De release is bedoeld om serving sneller te maken zonder over te stappen op een ander basismodel. De drafter heeft vier attention-lagen, een block size van negen tijdens training en 279,5 miljoen parameters.

Het target blijft LFM2.5-VL-3B. Liquid bracht dat model in augustus uit voor documentbegrip, OCR, scherm- en UI-herkenning, grounding, multi-image input en function calling.

De decodewinst is groot, de totale winst kleiner

Workload en hardwareDecodewinstEnd-to-end winst
COCO, M5 Max met MLX-VLM3,13x2,59x
MMMU-Pro, M5 Max met MLX-VLM2,93x2,62x
COCO, H100 met SGLang2,66x2,27x
MMMU-Pro, H100 met SGLang2,43x1,97x

Dit zijn metingen van Liquid AI en geen onafhankelijke benchmarks. De tests gebruikten 16-bit verwerking, batch size één en temperature nul. Op Apple gebruikte Liquid block size acht, op de H100 block size negen.

Het verschil tussen decode- en end-to-end winst is de belangrijkste beslisfactor. DSpark versnelt de vision encoder en prompt prefill niet. Bij vision-workloads nemen juist die stappen vaak een groot deel van de totale tijd in, vooral op edgehardware. Snellere tokengeneratie betekent dus niet automatisch een even grote versnelling van de hele request.

Open weights, maar met specifieke runtime-eisen

De modelkaart gebruikt Liquids LFM 1.0-licentie. Liquid beschrijft het model als open-weight en beschikbaar om te downloaden, fine-tunen en deployen. Safetensors- en GGUF-artifacts staan op Hugging Face.

Voor de release noemt Liquid SGLang, MLX-VLM en llama.cpp. De modelkaart vereist SGLang 0.5.19 of nieuwer en MLX-VLM 0.7.2 of nieuwer. Voor llama.cpp is er een aparte GGUF-checkpoint.

Er is geen aparte API-prijs, omdat dit een downloadbaar draftmodel is en geen hosted inference-product. De relevante rekensom is of extra geheugen en verificatiecompute worden terugverdiend door lagere latency of hogere throughput op de eigen hardware.

Wie moet testen en wat kan adoptie blokkeren?

Edge AI-teams, bouwers van visual agents en documentproducten die LFM2.5-VL-3B al gebruiken hebben het meeste aan deze release. Test eerst een productiemix van OCR, screenshots, grafieken en multi-turn beeldgesprekken. Vergelijk daarna p50- en p95-latency, geheugengebruik en requests per euro.

De belangrijkste reden om nog niet over te stappen is een mismatch met de workload. Korte antwoorden, beeldzware prompts en lange prefill-fasen laten weinig decodewerk over om te versnellen. Liquid noemt de drafter bovendien experimenteel en de gepubliceerde resultaten komen uit de eigen Pipette-infrastructuur.

Teams met quantized deployments moeten extra voorzichtig zijn. Liquid meldt dat alle gepubliceerde inferentiemetingen 16-bit verwerking gebruiken. Versnelling van gequantiseerde modellen valt expliciet buiten deze release.

Wat dit betekent

Voor teams die LFM2.5-VL-3B al gebruiken is DSpark nu het testen waard. Het belooft een snelheidswinst zonder de outputdistributie van het targetmodel te veranderen. Begin met de traagste interactieve vision-workflow en niet met een synthetische throughputtest.

Voor teams die nog een visionmodel moeten kiezen is deze release op zichzelf geen reden om te wisselen. Bepaal eerst of LFM2.5-VL-3B de vereiste nauwkeurigheid haalt en meet daarna of DSpark de totale requestlatency genoeg verlaagt om extra geheugen en runtimecomplexiteit te rechtvaardigen.

Voor meer informatie, bekijk de officiële aankondiging van LFM2.5-VL-3B-DSpark op de website van Liquid AI.

Maak DataNorth AI je Google favoriet