OpenEvidence lanceert vier medische AI-modellen

04-09-2026

OpenEvidence bracht Osler, Sackett, Snow en Darwin uit op 3 september 2026. Darwin is de eerste AI met 100% op MedQA en is alleen op aanvraag.

Geschreven door:

Jorick van Weelie

Marketing Lead bij DataNorth | Next-Gen AI-enthousiast & Tech Storyteller

Meld je aan voor de Nieuwsbrief

Gepubliceerd 4 september 2026

OpenEvidence bracht op 3 september 2026 een familie van vier medische AI-modellen uit. Drie ervan, Osler, Sackett en Snow, zijn vanaf vandaag gratis voor geverifieerde zorgverleners. Het vierde, OpenEvidence Darwin, is alleen op aanvraag beschikbaar en zou het eerste AI-model zijn dat 100% scoort op MedQA, de toonaangevende onafhankelijke benchmark voor medische AI.

Wat zijn Osler, Sackett en Snow?

De drie productiemodellen verschillen op één punt: hoe lang ze nadenken. OpenEvidence houdt ze alle drie aan dezelfde norm voor klinische nauwkeurigheid en laat de zorgverlener kiezen op basis van de beschikbare tijd.

  • Osler: ongeveer 5 seconden voor een antwoord, gemaakt voor het tempo van een consult, nu standaard
  • Sackett: ongeveer 30 seconden, vraagt de arts om meer context en weegt het bewijs
  • Snow: ongeveer 5 minuten, doorzoekt eerst de volledige literatuur voordat het schrijft
  • Waar: openevidence.com en de OpenEvidence-apps voor iOS en Android
  • Prijs: gratis voor geverifieerde zorgverleners
  • Darwin: research preview, alleen op aanvraag

De namen zijn het argument. William Osler bracht de geneeskunde naar het bed van de patiënt, David Sackett legde de basis voor evidence-based medicine, en John Snow herleidde de cholera-uitbraak van 1854 tot één waterpomp. Osler vervangt het model dat eerder de antwoorden van OpenEvidence gaf, en Snow volgt de functie Deep Consult op.

Hoe goed is OpenEvidence Darwin?

Darwin is de reden dat deze release ertoe doet, en zijn scores zijn de enige die OpenEvidence publiceerde.

BenchmarkOpenEvidence DarwinGenoemde concurrenten
MedQA (standaard medische examenvragen)100%Eerste model ooit dat dit haalt
HealthBench Professional (klinisch oordeel)82,7%Boven Claude Fable 5 en Gemini 3.7
NOHARM (veiligheid van klinisch advies)87,2%Boven Claude Fable 5 en Gemini 3.7
MedXpertQA (medisch redeneren op expertniveau)72,8%Boven Claude Fable 5 en Gemini 3.7
Antwoordsnelheid, snelste productiemodelOsler: ongeveer 5 secondenSnow: ongeveer 5 minuten
Prijs voor geverifieerde zorgverlenersGratisDarwin: alleen op aanvraag

Dit zijn de eigen cijfers van OpenEvidence. Het bedrijf noemt Claude Fable 5 en Gemini 3.7 als de eerstvolgende modellen, maar publiceert hun scores niet, dus je ziet dat Darwin voorloopt zonder te zien met hoeveel. Wel zegt het de MedQA-resultaten te publiceren samen met de uitleg van Darwin bij elk antwoord, en dat is meer dan een kale score en maakt de claim controleerbaar op een manier die bij de meeste benchmarkberichten ontbreekt.

Een perfecte score verdient een zorgvuldige lezing. Meestal betekent dat dat een benchmark verzadigd is, niet dat een probleem is opgelost. MedQA bestaat uit vragen van medische examens, en dat is iets smallers dan de klinische praktijk.

Waarom is Darwin afgeschermd?

OpenEvidence geeft een directe reden: kunde in de geneeskunde is tweezijdig bruikbaar. Een model dat redeneert op de grens van virologie, immunologie en menselijke genetica kan ook onderzoek naar biowapens versnellen of kiembaanbewerking buiten het reguliere toezicht. Daarom gaat Darwin naar institutionele partners zoals de National Organization for Rare Disorders, naar onderzoekspartners en naar erkende academische onderzoekers die klinische AI-veiligheid meten.

Het plan is dat de kunde van Darwin doorstroomt naar Osler, Sackett en Snow zodra de waarborgen zijn gevalideerd. Dit is inmiddels de standaardvorm van een frontier-lancering. OpenAI deed hetzelfde met GPT-6 Astra en het Daybreak-programma op dezelfde dag, en Google deed het een dag eerder met het via Fairwind afgeschermde Gemini 3.8 Flash Cyber.

Wat dit betekent

Bouw je klinische software, dan verandert dit je uitgangspunt. Volgens OpenEvidence gebruiken meer Amerikaanse artsen het platform dan alle andere AI-platforms samen, en het is gratis voor geverifieerde Amerikaanse zorgverleners. De drie productiemodellen worden dus de maatstaf waarmee je product wordt vergeleken. De snelheidsniveaus zijn het praktische detail: een antwoord van vijf seconden past binnen een consult, een van vijf minuten niet, en het model bij het moment kiezen is een productbeslissing en geen modelbeslissing.

Behandel de cijfers van Darwin voorlopig als een claim en niet als een bevinding. Alle getallen komen van de partij zelf, de scores van concurrenten ontbreken, en geen onafhankelijke groep heeft een herhaling gepubliceerd. Dat is geen reden om het weg te wuiven, zeker niet omdat OpenEvidence uitleg per antwoord publiceert, maar wel een reden om te wachten op de academische partners die het noemt. Werk je buiten de zorg, dan is het interessante deel niet de geneeskunde. Het is dat in drie dagen een vierde leverancier zijn beste model achter een aanvraagprocedure zette op grond van tweezijdig gebruik. Zo werken frontier-releases nu.

Voor meer informatie, bekijk de officiële aankondiging van de OpenEvidence Model Family in het nieuwsbericht van OpenEvidence.

Maak DataNorth AI je Google favoriet