Een knowledge graph, ook wel kennisgraaf, is een machineleesbare kaart van de entiteiten in je organisatie (klanten, producten, contracten, machines) en de relaties daartussen. Feiten staan er als verbindingen in, niet als rijen. Daardoor beantwoorden mensen én AI-systemen vragen die tientallen systemen tegelijk raken, met een herleidbaar pad naar elk antwoord.
Knowledge graphs zijn niet nieuw: Google lanceerde er in 2012 al een. Generatieve AI maakte ze urgent, want een model dat goed redeneert maar niets kan opzoeken is niet beter dan de context die je meegeeft. Gartner verwacht dat 40% van de organisaties in 2029 GraphRAG-technieken gebruikt om de feitelijke juistheid van large language models te verbeteren.
Wat is een knowledge graph?
Een knowledge graph slaat informatie op als een netwerk van nodes en edges. Een node is een ding: een klant, een factuur, een pomp, een klinische studie. Een edge is een gelabelde, gerichte relatie, bijvoorbeeld Klant 4412 – tekende – Contract 88. Beide dragen eigenschappen, zodat een machine het model relatie voor relatie kan aflopen.
Twee ingrediënten onderscheiden een knowledge graph van zomaar een netwerk. Het eerste is een ontologie: een expliciete definitie van welke typen dingen bestaan en welke relaties zijn toegestaan. Het tweede is identiteit: elke entiteit uit de echte wereld krijgt één stabiele identifier, zodat de klant in je CRM en de klant in je facturatiesysteem aantoonbaar dezelfde klant zijn. Zonder die twee heb je een netwerktekening, geen kennis.
Er bestaan twee standaardfamilies en beide zijn volwassen. De W3C-stack gebruikt RDF voor de data, OWL voor de ontologie, SPARQL om te bevragen en SHACL om te valideren, met de formele semantiek die gereguleerde of gedeelde data nodig heeft. Het labeled property graph-model zet eigenschappen direct op nodes en edges en werd in april 2024 een ISO-standaard onder de naam GQL, de eerste nieuwe ISO-databasetaal sinds SQL.
Waarom zijn knowledge graphs belangrijk?
Knowledge graphs zijn belangrijk omdat ze oplossen waar de meeste AI-trajecten op stuklopen: het model mist een betrouwbaar, samenhangend beeld van de organisatie. Gartner meldde in februari 2025 dat organisaties tot en met 2026 60% van hun AI-projecten zullen staken als de data er niet klaar voor is.
Het effect op nauwkeurigheid is meetbaar. In een benchmark op een verzekeringsdatamodel met 199 tabellen beantwoordde GPT-4 zakelijke vragen 16,7% van de tijd goed als het rechtstreeks SQL op het schema schreef, en 54,2% als dezelfde vragen via een knowledge graph liepen. Bij complexe vragen op een complex schema scoorde directe SQL 0% en de graph 38,7%.
Productieresultaten wijzen dezelfde kant op. Het klantenserviceteam van LinkedIn publiceerde een systeem dat historische tickets eerst in een knowledge graph zet. Het verbeterde de mean reciprocal rank met 77,6% en verlaagde na ongeveer zes maanden in productie de mediane doorlooptijd per issue met 28,6%.
Daarnaast is er een governance-argument. Een antwoord uit een graph draagt zijn eigen pad mee: welk record, welk bronsysteem, welke relatie. Dat helpt als een auditor of de EU AI Act vraagt waarom je systeem zei wat het zei, en het maakt een DPIA concreter. Let wel op de keerzijde: het koppelen van persoonsgegevens uit losse systemen is onder de AVG een verwerking met een eigen doelbinding. Leg dus vast waarom je koppelt, voordat je koppelt. Gartner verwacht dat universele semantische lagen in 2030 als kritieke infrastructuur gelden.
Hoe werkt een knowledge graph?
Een knowledge graph werkt door records uit je bronsystemen om te zetten in opgeloste entiteiten en getypeerde relaties, die te valideren tegen een ontologie, en het resultaat als bevraagbare laag aan te bieden. Zes stappen.
- Modelleer het domein. Kies de entiteitstypen en relaties die je nodig hebt. Tien tot twintig is in het begin ruim voldoende.
- Lees in en map. Haal data uit CRM, ERP, ticketing en documenten, en map elk bronveld op de ontologie.
- Los identiteiten op. Voeg de records die hetzelfde ding uit de echte wereld beschrijven samen onder één identifier.
- Valideer. Leg constraints, SHACL-shapes of schemaregels op, zodat onjuiste feiten aan de deur worden geweigerd.
- Ontsluit. Bied de graph aan via een querytaal, en als tools die een AI-agent kan aanroepen.
- Onderhoud. Bronsystemen veranderen. Een graph die niet ververst wordt, liegt binnen een kwartaal met overtuiging.
Bij stap drie sneuvelen de meeste trajecten. Entity resolution is kwadratisch van aard, omdat elk record met elk ander vergeleken moet worden tenzij je blocking en filtering toevoegt. Een enquete uit 2023 naar de bouw van knowledge graphs noemde het de minst ondersteunde taak in de beschikbare tooling.
Hoe AI de graph leest: GraphRAG
GraphRAG is retrieval-augmented generation waarbij de retrieval door een graph loopt in plaats van, of naast, een vector index. Microsoft bouwde in zijn onderzoek uit 2024 een entiteitsgraph uit een corpus, clusterde die in communities en vatte elke community samen. Tegenover een vector RAG-baseline won het op volledigheid in 72% tot 83% van de vergelijkingen en op diversiteit in 62% tot 82%.
Het kostenplaatje verrast de meeste mensen. Antwoorden uit de samenvattingen op het hoogste niveau gebruikten ruim 97% minder context-tokens dan het samenvatten van de brontekst zelf. Microsofts LazyGraphRAG gaat verder: indexeren kost 0,1% van volledige GraphRAG, bij ongeveer 4% van de querykosten.
Voorbeeld: hoe gebruik je een knowledge graph?
Het duidelijkste voorbeeld is een vraag die je stack niet kan beantwoorden omdat het antwoord in de koppelingen zit. Neem een maakbedrijf met een CRM, een ERP, een ticketsysteem en twintig jaar aan pdf-handleidingen. De directie vraagt: welke klanten draaien apparatuur met een component dat twee keer in het veld is uitgevallen, en welk risico lopen we contractueel?
- Definieer acht entiteitstypen. Klant, Locatie, Machine, Component, Leverancier, Ticket, Contract, Handleidingssectie. Genoeg om de vraag te beantwoorden, klein genoeg om af te maken.
- Laad de ruggengraat. CRM en ERP leveren klanten, locaties, machines, stuklijsten en contracten, met hun bestaande sleutels.
- Los identiteiten op. “Acme B.V.”, “ACME BV” en “Acme Groep, Rotterdam” worden één Klant-node. Laat een mens meekijken bij de twijfelgevallen.
- Verrijk met tekst. Haal tickets en handleidingen door een LLM-extractiestap om faalvormen aan de juiste Component-nodes te hangen. Controleer een steekproef met de hand.
- Bied het aan de assistent aan. Geef het model graph-queries als tools, zodat het feiten ophaalt in plaats van documenten te parafraseren.
De vraag van de directie wordt nu één traversal: component, naar machines die hem bevatten, naar locaties, naar klanten, naar lopende contracten. Het antwoord komt terug mét de ticketnummers en contractnummers eronder.
Dit patroon is op schaal gedocumenteerd. AstraZeneca’s Biological Insights Knowledge Graph bevat 10,9 miljoen nodes en ruim 118 miljoen edges; getraind op data van vóór 2015 vond de pijplijn 16 van de 95 relevante nieuwe medicijndoelwitten die tussen 2015 en 2020 zijn gevonden. De chief knowledge architect van NASA beschreef hoe het Orion-programma een les uit het Apollo-tijdperk terugvond in vijftig jaar aan dossiers, wat twee jaar werk en een miljoen dollar bespaarde.
Wat kost een knowledge graph?
Het hosten van een knowledge graph is goedkoop. Het bouwen niet. Platformprijzen zijn gepubliceerd en voorspelbaar, terwijl ontologieontwerp, integratie en entity resolution het grootste deel van het budget voor het eerste jaar opslokken.
| Optie | Instapprijs | Wat je krijgt | Aandachtspunten |
|---|---|---|---|
| Neo4j AuraDB Free | $0 | 200.000 nodes, 400.000 relaties | Wordt na 30 dagen zonder activiteit verwijderd; geen SLA |
| Neo4j Community, self-hosted | $0 licentie | Volledige single-instance database | GPL v3; je betaalt je eigen infrastructuur en beheer |
| Neo4j AuraDB Professional | Vanaf $65 per GB per maand | Een instance van 1 GB kost $65,70 per maand | Single zone, geen uptime-SLA, ook gefactureerd tijdens pauze |
| Neo4j AuraDB Business Critical | Vanaf $146 per GB per maand | Minimaal 2 GB, dus $292 per maand | Multi-zone, 99,95% SLA, 24/7 support |
| Amazon Neptune Serverless (Ierland) | $0,1774 per NCU-uur | De ondergrens van 1 NCU continu is ongeveer $130 per maand | Plus $0,10 per GB-maand opslag en $0,22 per miljoen I/O-requests |
| TigerGraph Savanna | $45 per GB per maand | Gratis proefworkspace beschikbaar | Dublin en Frankfurt kennen een regiofactor van 1,125x |
| Memgraph, Stardog, Ontotext GraphDB | Gratis editie, betaalde tiers op aanvraag | Wisselend | Geen van de drie publiceert lijstprijzen voor betaalde tiers |
Prijzen opgehaald op 3 augustus 2026 bij de leveranciers zelf en uit de AWS-prijslijst, in de valuta waarin zij publiceren. Let op de regiokeuze als je data in de EU moet blijven: Neptune Serverless kost in Frankfurt $0,1941 per NCU-uur, ongeveer negen procent meer dan in Ierland.
Dan het getal dat je budget bepaalt. Reken voor een eerste productieversie op één ontoloog, twee data engineers en domeinexperts in deeltijd gedurende zes maanden. Tegen Europese consultancytarieven van €800 tot €1.200 per dag kom je uit tussen ruwweg €250.000 en €450.000. Daartegenover kost een heel jaar managed instance van 8 tot 16 GB, à $525 tot $1.051 per maand, $6.300 tot $12.600: een paar procent van de bouw. Op die verhouding plan je, niet op de licentie. Onze eigen inschatting op basis van de tarieven hierboven, geen analistencijfer.
Voor de opbrengstkant is er één stevig onderzoek, in opdracht van de leverancier gemaakt. Een Total Economic Impact-analyse van Forrester voor Neo4j uit oktober 2021 modelleerde een samengestelde organisatie op 417% ROI en $4,18 miljoen NPV over drie jaar, tegenover $1,0 miljoen aan contante waarde van licentie- en beheerkosten. Zie het als een indicatie: het kostenmodel dekt alleen licenties en een halve fte beheer.
Je kunt ook op nul beginnen: de gratis Aura-tier biedt ruimte aan 200.000 nodes en 400.000 relaties, genoeg om een idee binnen twee weken te bewijzen of af te schieten.
Alternatieven en vergelijking
Een knowledge graph is een van de vijf redelijke antwoorden op “onze AI kan niets vinden”, en de meeste organisaties combineren er uiteindelijk twee.
| Aanpak | Sterk in | Zwak in | Instapkosten |
|---|---|---|---|
| Knowledge graph | Vragen over meerdere records heen, governance, antwoorden met herkomst | Vraagt een ontologie en entity resolution; maanden bouwtijd | $0 self-hosted, vanaf $65 per GB per maand managed |
| Vector database en RAG | De passage vinden die een vraag beantwoordt; snel op te zetten | Multi-hop redeneren, tellen, aggregeren | Gratis tiers; Pinecone vanaf $20 per maand, Weaviate vanaf $45 per maand |
| Relationele database of warehouse | Aggregatie, rapportage en transacties op een bekend schema | Open vragen over veel tabellen; GPT-4 scoorde 16,7% op een schema met 199 tabellen | Je bestaande licentie |
| Datacatalogus of semantische laag | Gedeelde definities, lineage, toegangsbeheer | Redeneert over metadata, niet over de data zelf | Vaak inbegrepen bij je dataplatform |
| Full-text en documentzoeken | Een document vinden waarvan je weet dat het bestaat | Alles wat over twee documenten heen gaat | Laag, meestal al aanwezig |
De eerlijke vergelijking is niet graph tegen vectoren, maar welke vragen je stelt. Benchmarks zijn daar helder over. In de HippoRAG 2-evaluatie op ICML 2025 haalde een sterke vector retriever gemiddeld 57,0 F1 over zeven vraag-antwoorddatasets, terwijl Microsofts community GraphRAG op 49,6 uitkwam: slechter dan gewone vector RAG op simpele feitvragen. De GraphRAG-Bench-studie uit 2026 komt op hetzelfde uit: basis-RAG evenaart of verslaat GraphRAG op simpele feitvragen, en GraphRAG loopt uit op complex redeneren en samenvatten over een corpus. Graph-indexering is bovendien 40 tot 57 keer trager te bouwen.
De vuistregel is simpel. Gebruik vectoren voor “zoek de passage”. Gebruik een graph voor “reken het antwoord uit over records heen”. Zit het grootste deel van je verkeer in de eerste categorie, koop dan een vector database en stop hier. Zitten je dure vragen in de tweede, en hebben foute antwoorden juridisch of financieel gewicht, dan verdient de graph zijn bouwkosten terug. Op gemengd verkeer wint een hybride.
Conclusie
Een knowledge graph is geen database-upgrade. Het is de keuze om vast te leggen wat je organisatie werkelijk weet, in een vorm die een machine kan aflopen en een auditor kan volgen. De technologie is stabiel en ISO-gestandaardiseerd, de platformkosten zijn een afrondingsfout, en het faalpunt is entity resolution, niet queryperformance. Begin met één vraag die je stack niet kan beantwoorden, en bewijs de waarde voordat je een platform koopt.
Benieuwd of jouw data hier klaar voor is? Een AI-assessment brengt in kaart wat je hebt en wat ontbreekt.
Veelgestelde vragen (FAQ)
Wat is het verschil tussen een knowledge graph en een graph database?
Een graph database is opslagtechnologie. Een knowledge graph is wat je erin stopt: een ontologie die vastlegt welke typen dingen bestaan, plus opgeloste identiteiten zodat elke entiteit uit de echte wereld precies één keer voorkomt.
Heb ik een knowledge graph nodig als ik al RAG gebruik?
Alleen als je vragen over meerdere records heen gaan. Vector search is sterk in het vinden van de passage die een vraag beantwoordt, en zwak in het combineren van feiten, tellen of het volgen van een keten van relaties. Benchmarks laten zien dat vector RAG wint op simpele feitvragen en verliest op multi-hop redeneren.
Hoe lang duurt het om een knowledge graph te bouwen?
Een proof of value op één vraag kost twee tot zes weken. Een productiegraph over drie of vier bronsystemen duurt meestal vier tot negen maanden, en het grootste deel daarvan gaat op aan entity resolution en datakwaliteit.
Wat is GraphRAG?
GraphRAG is retrieval-augmented generation waarbij de retrieval-stap door een knowledge graph loopt in plaats van, of naast, een vector index. Microsoft rapporteerde in 2024 win rates op volledigheid van 72% tot 83% tegenover een vector RAG-baseline. Gartner verwacht dat 40% van de organisaties het in 2029 gebruikt.
Kies ik RDF of een property graph?
Kies RDF als je formele semantiek, redeneren, gedeelde vocabulaires of uitwisseling tussen organisaties nodig hebt. Kies een labeled property graph als je vooral snelle traversals met veel attributen wilt. Het property graph-model werd in april 2024 een ISO-standaard onder de naam GQL.
Wat is het lastigste onderdeel van een knowledge graph-traject?
Entity resolution: aantonen dat de klant in je CRM, je ERP en je ticketsysteem één klant is. Het is kwadratisch van aard, het vraagt menselijk oordeel, en een survey uit 2023 noemde het de minst ondersteunde stap in de beschikbare tooling.