{"id":3444968,"date":"2026-10-08T11:01:37","date_gmt":"2026-10-08T09:01:37","guid":{"rendered":"https:\/\/datanorth.ai\/?post_type=news&#038;p=3444968"},"modified":"2026-10-08T11:01:39","modified_gmt":"2026-10-08T09:01:39","slug":"perplexitys-pplx-embed-v2-late-doorzoekt-pdf-paginas-als-beeld-met-mit-licentie","status":"publish","type":"news","link":"https:\/\/datanorth.ai\/nl\/nieuws\/perplexitys-pplx-embed-v2-late-doorzoekt-pdf-paginas-als-beeld-met-mit-licentie","title":{"rendered":"Perplexity&#8217;s pplx-embed-v2-late doorzoekt pdf-pagina&#8217;s als beeld, met MIT-licentie"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em>Gepubliceerd: 8 oktober 2026<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Perplexity bracht op 7 oktober 2026 pplx-embed-v2-late uit: twee open embeddingmodellen die tekst, afbeeldingen en pdf-pagina&#8217;s in een enkele index doorzoeken, zonder de pagina&#8217;s eerst naar tekst om te zetten. Beide vallen onder de MIT-licentie, dus je mag ze commercieel op je eigen servers draaien. Dat is interessant als documenten vanwege de AVG je eigen omgeving niet mogen verlaten.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Sterk op vragen over pdf&#8217;s, niet de beste op pagina-afbeeldingen<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Een embeddingmodel zet documenten om in getallen, zodat een zoeksysteem op betekenis kan zoeken. Deze modellen bewaren een kleine vector per token in plaats van een per document, een opzet die late interaction heet. Het kleine model van 0.6B kan een index doorzoeken die het 9B-model heeft gebouwd. Het zware werk gebeurt dus een keer, en elke zoekopdracht blijft goedkoop.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Wat wordt gemeten<\/th><th>pplx-embed-v2-late 9B<\/th><th>Beste concurrent volgens Perplexity<\/th><\/tr><\/thead><tbody><tr><td>MADQA (vragen over 800 pdf&#8217;s)<\/td><td>92,4%<\/td><td>Mixedbread Agentic Search 93,4%, Mixedbread retriever 88,9%<\/td><\/tr><tr><td>Q2D-Web, Recall@1000 (webpagina&#8217;s vinden)<\/td><td>74,8%<\/td><td>Vorige beste 69,3%<\/td><\/tr><tr><td>Zoeken in vakteksten (72 taken)<\/td><td>81,3%<\/td><td>Nummer twee 1,6 punt lager<\/td><\/tr><tr><td>ViDoRe v3 visueel (pagina-afbeeldingen)<\/td><td>65,2%<\/td><td>Alleen EVIE scoort hoger<\/td><\/tr><tr><td>BrowseComp+ (onderzoeksagent)<\/td><td>64,0%<\/td><td>Beste andere late-interaction-model 4,9 punt lager<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Alle resultaten komen van Perplexity zelf; het volledige technische rapport volgt later dit jaar. Op MADQA valt het verschil met Mixedbread Agentic Search volgens Perplexity binnen de foutmarge.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Er zijn grenzen. De opslag groeit mee met de lengte van documenten, omdat elk token een vector van 128 getallen krijgt. Een invoer kan niet tegelijk tekst en beeld bevatten. Het 9B-model heeft volgens een schatting van MarkTechPost zo&#8217;n 16 tot 18 GB GPU-geheugen nodig. Een gehoste API van Perplexity is gepland, zonder datum of prijs.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Test dit als je gescande contracten, rapporten of handleidingen doorzoekt waarin tabellen en opmaak ertoe doen en tekstherkenning steeds misgaat. Perplexity trainde op 46 talen, maar noemt Nederlands niet. Probeer het dus eerst op je eigen Nederlandse bestanden voordat je een index opnieuw opbouwt. Werkt zoeken op platte tekst al goed, dan is er weinig reden om over te stappen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Voor meer informatie, bekijk<\/em> <em><a href=\"https:\/\/www.perplexity.ai\/hub\/blog\/multimodal-embeddings-beyond-a-single-vector\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">de offici\u00eble aankondiging van pplx-embed-v2-late op de blog van Perplexity<\/a>.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Perplexity lanceerde op 7 oktober 2026 pplx-embed-v2-late, twee embeddingmodellen van 0.6B en 9B parameters onder MIT-licentie die tekst, afbeeldingen en pdf-pagina&#8217;s in een gedeelde index doorzoeken. In de eigen tests van Perplexity haalt het 9B-model 92,4% op MADQA, een benchmark met vragen over 800 pdf&#8217;s, net onder Mixedbread Agentic Search. Het kleine model kan de index van het grote doorzoeken. Een gehoste API volgt later, zonder datum.<\/p>\n","protected":false},"author":23,"featured_media":3444971,"template":"","tags":[],"news-category":[],"class_list":["post-3444968","news","type-news","status-publish","has-post-thumbnail"],"meta_box":[],"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news\/3444968","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/news"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/23"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3444971"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3444968"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3444968"},{"taxonomy":"news-category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news-category?post=3444968"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}