Cohere bracht op 30 september 2026 Embed 5 uit, twee embeddingmodellen die één vectorruimte delen: Embed 5 Pro om te indexeren en Embed 5 Fast voor queries, voor $0,12 en $0,08 per miljoen teksttokens. Omdat ze die ruimte delen, bouw je je index één keer met Pro en beantwoord je live queries met Fast, met 1,6 punt verlies aan zoekkwaliteit in de eigen tests van Cohere.
Wat is er nieuw in Cohere Embed 5?
Een embeddingmodel zet tekst of een afbeelding om in een rij getallen, zodat een zoeksysteem de passages kan vinden die qua betekenis het dichtst bij een vraag liggen. Tot nu toe koos je één model en gebruikte je dat overal voor. Indexkwaliteit en querysnelheid trokken aan twee kanten, en die compromis betaalde je bij elke zoekopdracht.
Embed 5 splitst die keuze. Pro en Fast maken vectoren in dezelfde ruimte, dus ze zijn bij het zoeken uitwisselbaar op een index die door een van beide is gebouwd. Fast verwerkt in de tests van Cohere ongeveer 2,4 keer zoveel documenten per seconde als Pro. Beide modellen nemen tekst, afbeeldingen of tekst en beeld samen, beide hebben een contextvenster van 128.000 tokens en beide dekken meer dan 100 talen.
Cohere Embed 5 benchmarks en zoekkwaliteit
De interessante cijfers zijn de documentbenchmarks en het kwaliteitsverlies bij het mixen van beide modellen, niet de gemiddelden in de kop.
| Wat wordt gemeten | Resultaat Embed 5 | Genoemde vergelijking |
|---|---|---|
| ViDoRe V3 (visueel rijke documenten) | 85,8 (Pro) | Voyage 4 Large: 83,7, OpenAI text-embedding-3-large: 75,5 |
| FinanceBench (vragen over jaarverslagen) | 80,1 (Pro) | Eerste plaats in de vergelijkingsset van Cohere |
| FinQA (getallen in financiële documenten) | 90,0 (Pro) | Eerste plaats in de vergelijkingsset van Cohere |
| ViDoRe Finance (financiële documenten als beeld) | 85,0 (Pro) | Eerste plaats in de vergelijkingsset van Cohere |
| Zoekkwaliteit: index met Pro, query met Fast | 98,4 | Pro voor beide: 100 |
| Zoekkwaliteit: index en query met Fast | 96,6 | Pro voor beide: 100 |
Dit zijn de eigen evaluaties van Cohere over 40 datasets. Cohere scoort met RCP-nDCG@10, die een vaste set kandidaatpassages herordent in plaats van je volledige corpus van voor af aan te doorzoeken. Dat is een vriendelijker test dan zoeken in productie, dus reken erop dat het gat tussen Pro en Fast op jouw data groter is dan die 1,6 punt suggereert.
Prijzen en beschikbaarheid van Embed 5 Pro en Embed 5 Fast
- Embed 5 Pro: $0,12 per miljoen teksttokens, $0,40 per miljoen beeldtokens
- Embed 5 Fast: $0,08 per miljoen teksttokens, $0,40 per miljoen beeldtokens
- Contextvenster: 128.000 tokens bij beide modellen
- Outputdimensies: 2048, 1536, 1024, 768, 512 of 256, met float-, int8- of binaire vectoren
- Talen: meer dan 100
- Waar je het draait: de API van Cohere, Microsoft Foundry, Amazon SageMaker of zelf gehost via Model Vault
De keuze voor dimensie en formaat is waar het geld zit. Het rekenvoorbeeld van Cohere gaat uit van een corpus van 100 miljoen fragmenten: als 2048-dimensionale float32-vectoren vraagt dat ongeveer 819 GB, als 256-dimensionale binaire vectoren ongeveer 3,2 GB. Dat is een rekening voor je vectordatabase die met meer dan een factor honderd daalt, en je maakt die keuze eenmalig bij het indexeren.
Wat de benchmarks niet vertellen
Cohere publiceert doorvoer maar geen latency. Er is geen cijfer in milliseconden voor Pro tegenover Fast, wat vreemd is voor een model dat verkocht wordt op snelheid bij het zoeken. Doorvoer is een batchmaat en dat is niet wat een gebruiker voelt na een druk op enter.
Cohere noemt ook geen faalgevallen. Die 98,4 is een gemiddelde over 40 datasets, en een gemiddelde verbergt de datasets waar het mixen van Pro en Fast veel meer dan 1,6 punt kostte. Heb je een afwijkend corpus, met gescande formulieren, dichte tabellen of één kleine taal, dan zit je in de staart van dat gemiddelde en Cohere zegt niet hoe lang die staart is.
Wat dit betekent
Nu het testen waard als je zoeken op schaal draait en je queryvolume veel groter is dan je indexvolume. Een supportzoekfunctie met een miljoen queries per dag op een corpus dat je wekelijks herindexeert is het duidelijkste geval: je betaalt Pro-prijzen één keer en Fast-prijzen daarna. Draai beide opstellingen een week naast elkaar op je eigen queries en meet het kwaliteitsverlies zelf, want 1,6 punt op een herordentest is niet het getal dat jij krijgt.
Negeer het gerust als je zoekfunctie al werkt en je embeddingrekening geen post is die opvalt. Van embeddingmodel wisselen betekent alles opnieuw indexeren, en die kosten zijn echt, wat de tokenprijs ook zegt. Het echt interessante hier is niet de voorsprong van 2,1 punt op Voyage 4 Large, die de volgende release niet overleeft. Het is de gedeelde vectorruimte, die van indexkwaliteit en querykosten twee losse beslissingen maakt in plaats van één.
Voor meer informatie, bekijk de officiële aankondiging van Embed 5 op de blog van Cohere.