Perplexity bracht op 30 september 2026 pplx-embed-v2-context-9b-preview uit, een embeddingmodel met open gewichten onder de MIT-licentie dat 45,5% answer recall haalt op context-bench, 14,4 punten voor op Voyage Context 4. Het leest een document van maximaal 32.768 tokens in één keer en geeft niet alleen de passage met het antwoord terug, maar ook de passages die dat antwoord onderbouwen.
Wat doet pplx-embed-v2-context-9b-preview anders?
De meeste zoeksystemen knippen een document in stukken en embedden elk stuk los. Een fragment met “het steeg naar 14 procent in dezelfde periode” verliest zijn betekenis zodra het de pagina verlaat waar het vandaan komt, want het model ziet nooit waar “het” naar verwijst.
Dit model gebruikt late chunking: het leest het hele document in één doorgang en haalt daarna per fragment een vector uit die gedeelde lezing. Elk fragment houdt zo zijn context. Perplexity veranderde ook het trainingsdoel. In plaats van één juiste passage per vraag aan te wijzen, scoort een leraarmodel losse tokens. Daardoor leert het model de keten van bewijs achter een antwoord op te halen in plaats van alleen het beste citaat.
Benchmarks van pplx-embed-v2-context-9b-preview
De kop is het gat op answer recall. De bewijscijfers zijn wat telt zodra een agent ergens naar verwijst.
| Wat wordt gemeten | pplx-embed-v2-context-9b-preview | Vergelijking |
|---|---|---|
| Answer recall bij K=10 (een fragment bevat het antwoord) | 45,5% | 14,4 punten voor op Voyage Context 4 |
| Evidence recall bij K=10 (fragmenten onderbouwen dat antwoord) | 40,6% | Geen cijfer van concurrenten gepubliceerd |
| All-evidence recall bij K=10 (alle onderbouwende fragmenten) | 31,1% | Geen cijfer van concurrenten gepubliceerd |
| ConTEB gemiddelde nDCG@10 (suite voor contextueel zoeken) | Hoogste van de geteste modellen | Scores per model niet gepubliceerd |
| Documentlengte in één doorgang | 32.768 tokens | Modellen per fragment zien elk stuk los |
| Opslag bij 1024 dimensies, int8 | 1 KB per vector | Gelijk aan Voyage Context 4, minder opslag |
Dit zijn de eigen evaluaties van Perplexity, uit de onderzoekspost. Perplexity zegt niet of het Voyage Context 4 zelf opnieuw heeft gedraaid of een gepubliceerd cijfer overnam, dus die voorsprong van 14,4 punten is een claim waarvan de methode niet is getoond. Die 31,1% op all-evidence is het eerlijke getal: bij twee derde van de vragen mist het model nog minstens één onderbouwende passage.
Licentie, gewichten en hoe je het draait
- Licentie: MIT, dus commercieel gebruik is toegestaan
- Gewichten: open op Hugging Face, onder perplexity-ai/pplx-embed-v2-context-9b-preview
- Omvang: Perplexity noemt 9B parameters, de modelkaart vermeldt 8B
- Output: 2048 dimensies, terug te brengen naar 1024 via Matryoshka-training, met native int8
- Vereisten: transformers 5.4.0 of nieuwer, geladen met trust_remote_code op true
- Toegang: voorlopig alleen zelf hosten, geen endpoint op de Perplexity API en geen gepubliceerde prijs
Eén detail in het gebruik breekt je pijplijn als je het mist. Queries en documenten zijn met verschillende prefixen getraind, dus roep je encode_queries() aan voor een vraag en encode() voor een fragment. Haal je die door elkaar, dan zakt de zoekkwaliteit zonder dat je een foutmelding krijgt.
Wat Perplexity niet vertelt
Dit is een preview, en Perplexity zegt er duidelijk bij dat gewichten, embeddings en de interface kunnen veranderen zonder achterwaartse compatibiliteit. In de praktijk betekent dat dat een volgende versie elke opgeslagen vector waardeloos kan maken. Er is bovendien geen API, geen prijs en geen datum voor allebei, dus de enige manier om het vandaag te gebruiken is zelf hosten op hardware die je zelf betaalt.
Het aantal parameters spreekt zichzelf tegen in twee bronnen van Perplexity zelf: 9B in de naam en in de post, 8B op de modelkaart. Een kleinigheid, maar wel het soort kleinigheid dat laat zien hoe af deze release is.
Wat dit betekent
Nu het testen waard als je zoeken met retrieval op eigen servers draait en je gebruikers moet laten zien waar een antwoord vandaan komt. Een compliance- of juridisch zoekteam dat de onderbouwende passages moet kunnen tonen en niet alleen het antwoord, past hier het beste bij, en met de MIT-licentie hoef je geen inkooptraject in. Test eerst all-evidence recall op je eigen documenten, want 31,1% is het getal dat je gebruikers ervaren als een ontbrekende bronvermelding.
Negeer het gerust als je zoeken afneemt als dienst. Er is geen endpoint, geen prijs en een expliciete waarschuwing dat de gewichten veranderen. Cohere bracht dezelfde dag Embed 5 uit met een API, prijzen en drie hostingopties, en voor een team zonder GPU-capaciteit is dat simpelweg het bruikbare product. Kijk hier opnieuw naar zodra Perplexity het label preview laat vallen.
Voor meer informatie, bekijk de officiële aankondiging van pplx-embed-v2-context-9b-preview op de blog van Perplexity.