{"id":3443821,"date":"2026-09-16T09:29:04","date_gmt":"2026-09-16T07:29:04","guid":{"rendered":"https:\/\/datanorth.ai\/?post_type=news&#038;p=3443821"},"modified":"2026-09-16T09:38:55","modified_gmt":"2026-09-16T07:38:55","slug":"salesforce-lanceert-koa-een-crm-redeneermodel","status":"publish","type":"news","link":"https:\/\/datanorth.ai\/nl\/nieuws\/salesforce-lanceert-koa-een-crm-redeneermodel","title":{"rendered":"Salesforce lanceert Koa, een CRM-redeneermodel"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em>Gepubliceerd op: 16 september 2026<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Salesforce en NVIDIA kondigden op 15 september 2026 Koa aan, het eerste redeneermodel van Salesforce voor zijn agentplatform Agentforce. Koa is een bijgetrainde versie van Nemotron-3-Super-120B, het open-weightsmodel van NVIDIA, en het eigen technisch rapport van Salesforce geeft het een score van 69,41 op de klantenservicebenchmark Tau2Bench: voor op GPT-4.1, maar 14,58 punten achter GPT-5.5. Het model draait nu in een pilot bij een handvol klanten, met algemene beschikbaarheid verwacht in de winter van 2026 en alleen in de Verenigde Staten.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat is Salesforce Koa?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Koa is een taalmodel dat op een taak is afgestemd: een CRM-taak met meerdere stappen doorlopen en onderweg de juiste tools aanroepen. Denk aan een lead kwalificeren, een servicecase doorzetten of een vervolgafspraak inplannen. Dat vraagt telkens om een paar handelingen in de juiste volgorde, niet om een enkel goed antwoord.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Salesforce bouwde het door Nemotron-3-Super-120B bij te trainen, het open-weightsmodel van NVIDIA met 120 miljard parameters, met supervised fine-tuning en reinforcement learning via Group Relative Policy Optimization, een methode die een reeks pogingen tegen elkaar afweegt. Het gereedschap kwam van NVIDIA: NeMo RL, NeMo Gym en NeMo AutoModel. De reinforcement-learningrun liep op vijf NVIDIA B200-nodes.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Er ging geen klantdata in de training. De trainingsset is synthetisch: scenario&#8217;s die werkstromen in meer dan veertien branches nabootsen, waarbij elk scenario een persona koppelt aan een taak en aan de reeks tool-aanroepen die nodig is om die af te ronden.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Het commerci\u00eble punt is controle. Salesforce beheert de gewichten, doet de natraining en draait de inferentie op de eigen infrastructuur, dus er gaat tijdens inferentie geen klantdata over de vertrouwensgrens. Je kunt Koa niet downloaden en je kunt het niet buiten Agentforce aanroepen. Salesforce zet het model intern al in als Slack-agent, en tot de pilotklanten horen 1-800Accountant, Baxter Credit Union, Engine, Formula 1, UChicago Medicine en Xero.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Benchmarks van Salesforce Koa: de vergelijking met GPT-5.5 en Claude Opus 4.8<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De cijfers hieronder komen uit het eigen technisch rapport van Salesforce, op 14 september op arXiv gezet. Lees ze als een model dat zijn eigen startpunt met ongeveer een punt verslaat en tien of meer punten achterblijft op de huidige top.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Benchmark<\/th><th>Salesforce Koa<\/th><th>Beste score in de eigen tabel van Salesforce<\/th><\/tr><\/thead><tbody><tr><td>Tau2Bench (klantenservice over meerdere beurten)<\/td><td>69,41<\/td><td>83,99 (OpenAI GPT-5.5)<\/td><\/tr><tr><td>BFCL (correct tools aanroepen)<\/td><td>66,63<\/td><td>78,18 (Claude Opus 4.8)<\/td><\/tr><tr><td>CRM Bench (Salesforce-werkstromen, 0 tot 1)<\/td><td>0,86<\/td><td>0,90 (OpenAI GPT-5.5)<\/td><\/tr><tr><td>Nauwkeurigheid van CRM-functieaanroepen (0 tot 1)<\/td><td>0,77<\/td><td>0,85 (OpenAI GPT-4.1)<\/td><\/tr><tr><td>Tau2Bench, tegenover het eigen basismodel<\/td><td>69,41<\/td><td>68,64 (Nemotron-3-Super-120B)<\/td><\/tr><tr><td>BFCL, tegenover het eigen basismodel<\/td><td>66,63<\/td><td>64,73 (Nemotron-3-Super-120B)<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Alle cijfers hier komen van Salesforce zelf. Het rapport meldt dat Koa is vergeleken met drie propri\u00ebtaire modellen, maar noemt voor geen van die modellen een API-versie, datum of instelling. De kolom met concurrenten is dus geen gecontroleerde directe vergelijking. De eigen checkpoints van Salesforce draaiden via vLLM op BF16-precisie.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat Salesforce niet vertelt<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Het persbericht stelt dat Koa op CRM-acties de prestaties van toonaangevende modellen evenaart of overtreft met drie keer minder fouten, en verwijst naar het rapport als bron. Die zin staat niet in het rapport. Geen enkele tabel in het rapport meldt \u00fcberhaupt een foutpercentage. De eigen samenvatting van het rapport klinkt anders: Koa overtreft een sterke propri\u00ebtaire referentie maar blijft onder de sterkste topmodellen. Die referentie is GPT-4.1, dat OpenAI in april 2025 uitbracht.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Salesforce publiceert daarnaast een ablatie die de eigen keuze onderuithaalt. Een checkpoint dat alleen met supervised fine-tuning is getraind scoort 70,04 op Tau2Bench en 0,88 op CRM Bench, tegenover 69,41 en 0,86 voor het reinforcement-learningcheckpoint dat Koa werd. Salesforce koos de lagere score omdat die veel beter is in tool-gebruik over meerdere beurten, waar hij 59,50 haalt op BFCL tegenover 53,25. Dat is een verdedigbare afweging, en eerlijker dan het persbericht.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Drie cijfers ontbreken volledig: prijs, contextvenster en responstijd. Voor een model dat als gehoste optie binnen Agentforce wordt verkocht, is de prijs het cijfer dat bepaalt of iemand het probeert.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat dit betekent<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Koa is het waard om te volgen, maar niet om je plannen op te bouwen, en het interessante zit in de methode en niet in het model. Salesforce nam een open-weightsmodel van 120B, stak een bescheiden hoeveelheid rekenkracht in reinforcement learning die wordt aangestuurd door uitgeschreven werkstroomspecificaties, en dichtte het gat naar GPT-4.1 terwijl elke byte inferentie binnen de eigen grens bleef. Zit je op tien jaar procesdocumentatie en heb je een toezichthouder boven je, dan is dat rapport de moeite waard, want het recept reikt verder dan dit ene model.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Het model zelf is een smaller voorstel. Draai je Agentforce, zit je in een Amerikaanse regio en is jouw blokkade dat klantdata de grens van je leverancier niet over mag, meld je dan aan voor de pilot. De rest kan wachten. Koa blijft 14,58 punten achter op GPT-5.5 op de benchmark die Salesforce zelf vooropstelt, er is geen prijs gepubliceerd en algemene beschikbaarheid is nog een seizoen weg. Een gespecialiseerd model dat onder de algemene top zit, moet winnen op kosten, op controle of op allebei. Tot nu toe heeft Salesforce alleen de helft over controle gepubliceerd.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Voor meer informatie, bekijk <a href=\"https:\/\/www.salesforce.com\/news\/press-releases\/2026\/09\/15\/koa-reasoning-model\/\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">de offici\u00eble aankondiging van Koa in de newsroom van Salesforce<\/a>.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Salesforce en NVIDIA kondigden op 15 september 2026 Koa aan, het eerste CRM-redeneermodel voor Agentforce. Koa is een bijgetrainde NVIDIA Nemotron-3-Super-120B en scoort 69,41 op Tau2Bench: voor op GPT-4.1, maar 14,58 punten achter GPT-5.5.<\/p>\n","protected":false},"author":12,"featured_media":3443819,"template":"","tags":[],"news-category":[],"class_list":["post-3443821","news","type-news","status-publish","has-post-thumbnail"],"meta_box":[],"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news\/3443821","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/news"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/12"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3443819"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3443821"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3443821"},{"taxonomy":"news-category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news-category?post=3443821"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}