Gepubliceerd: 21 augustus 2026
Liquid AI bracht op 20 augustus 2026 LFM2.5-DSpark uit, drie draft-modellen voor speculative decoding die de LFM2.5-familie tot 3,18x sneller maken op een H100 zonder ook maar een token in de uitvoer te veranderen. Elke drafter voegt ongeveer 300M parameters toe en werkt met LFM2.5-1.2B-Instruct, LFM2.5-2.6B en LFM2.5-8B-A1B. De weights staan vandaag op Hugging Face.
Wat is LFM2.5-DSpark en hoe werkt het?
Speculative decoding laat een klein model de volgende tokens raden en een groter model die in een enkele doorloop controleren. LFM2.5-DSpark past dat toe op de eigen familie van Liquid AI: een drafter van vijf lagen en ongeveer 300M parameters stelt een blok van negen tokens voor, waarna het doelmodel het hele blok in een keer verifieert.
Bij greedy decoding is de uitvoer identiek aan het doelmodel dat alleen draait, dus de benchmarkscores veranderen niet. De prijs is geheugen: de drafter-repository voor LFM2.5-2.6B is 655 MB in BF16. Liquid AI trainde de drafters uitsluitend op AMD-hardware, en llama.cpp en SGLang ondersteunen ze vanaf dag een.
LFM2.5-DSpark benchmarks: 3,18x op een H100, 2,87x op een MacBook
- Op een enkele H100 in BF16 via SGLang haalt LFM2.5-2.6B gemiddeld 2,67x, van 323 naar 864 tokens per seconde. LFM2.5-8B-A1B piekt op 3,18x bij MATH500, van 428 naar 1362 tokens per seconde.
- Op een M4 Max MacBook Pro via llama.cpp haalt LFM2.5-1.2B-Instruct 2,87x bij HumanEval, van 136 naar 389 tokens per seconde.
De winst volgt het acceptatiepercentage en schommelt dus per werklast. LFM2.5-8B-A1B accepteert 8,27 van de 10 voorgestelde tokens bij MATH500, maar slechts 4,02 bij GSM8K, waardoor hetzelfde model op dezelfde GPU terugvalt naar 1,29x. Alle cijfers komen van Liquid AI zelf, gemeten bij batchgrootte 1 en temperatuur 0 over MATH500, GSM8K, HumanEval, MBPP en MT-Bench.
Hoe verhoudt LFM2.5-DSpark zich tot EAGLE-3 en DFlash?
DSpark is geen uitvinding van Liquid AI. Het komt uit een paper van juli 2026 en bouwt voort op EAGLE-3, de methode die de meeste stacks voor speculative decoding nu gebruiken, en op DFlash, dat een heel blok in een doorloop opstelt. DSpark voegt een Markov-head toe die elk voorgesteld token laat afhangen van het vorige, wat de acceptatie verderop in het blok verhoogt.
Voor een team dat al op LFM2.5 draait is het alternatief het doelmodel alleen draaien, en DSpark wint met ruwweg 2x voor 655 MB extra geheugen. Belangrijker is dat Liquid AI de drafter zelf publiceert en onderhoudt. Speculative decoding komt normaal op het bord van wie het model uitrolt, en daarom staat het in de meeste on-device stacks nooit aan.
Licentie, beschikbaarheid en de zwakke plek bij mixture-of-experts
Apple silicon is de enige plek waar DSpark nauwelijks helpt. LFM2.5-8B-A1B wint gemiddeld 1,18x op de M4 Max, tegenover 2,54x op de H100. Liquid AI wijst naar de huidige mixture-of-experts-implementatie in de Metal-backend van llama.cpp en naar het feit dat het verifiëren van negen tokens meer experts activeert dan een enkele decodestap, en publiceert de zwakke cijfers toch.
De blog noemt de weights open zonder beperkingen, maar de LFM Open License v1.0 is smaller: gratis commercieel gebruik geldt alleen zolang je organisatie onder $10M jaaromzet blijft, en daarboven heb je een commerciële licentie van Liquid AI nodig. De checkpoints komen als Safetensors en GGUF, en geen enkele hosted provider serveert ze, dus dit is een release om zelf te hosten.
Wat dit betekent
Nu de moeite waard om te testen als je LFM2.5 al op eigen hardware draait, en anders gerust te negeren. De drafters horen bij specifieke doelmodellen, dus voor een team op Qwen3.8, Gemma 4 of een hosted API zit hier niets in. De winst zit bij on-device agents: 57% minder latency bij function calling met meerdere tools op LFM2.5-2.6B voel je direct.
Het zwakke mixture-of-experts-resultaat verdient waardering in plaats van kritiek, want een cijfer van 1,18x publiceren naast een kop van 3,18x laat zien waar het werk nog ligt. Onze reserve zit bij de licentie. Een omzetplafond van $10M op gratis commercieel gebruik is lastig voor precies de middelgrote bedrijven met on-premise eisen die Liquid AI wil bedienen, dus lees de voorwaarden voordat je erop bouwt.
De volledige informatie staat op de officiële aankondiging van de DSpark modellen door LiquidAI.