{"id":3442510,"date":"2026-08-12T09:31:32","date_gmt":"2026-08-12T07:31:32","guid":{"rendered":"https:\/\/datanorth.ai\/?post_type=news&#038;p=3442510"},"modified":"2026-08-12T09:30:50","modified_gmt":"2026-08-12T07:30:50","slug":"nvidia-brengt-nemotron-3-5-lightning-en-nemo-switchyard-uit","status":"publish","type":"news","link":"https:\/\/datanorth.ai\/nl\/nieuws\/nvidia-brengt-nemotron-3-5-lightning-en-nemo-switchyard-uit","title":{"rendered":"NVIDIA brengt Nemotron 3.5 Lightning en NeMo Switchyard uit"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em>Gepubliceerd: 12 augustus 2026<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">NVIDIA bracht op 11 augustus 2026 Nemotron 3.5 Lightning uit, een open mixture of experts model van 30 miljard parameters met 3 miljard actieve parameters, gebouwd voor de uitvoeringslaag van langlopende AI-agents met veel aanroepen. Daarnaast bracht NVIDIA NeMo Switchyard uit, een opensource bibliotheek die elke stap in een agentworkflow naar het best passende model routeert. NVIDIA rapporteert 86 procent nauwkeurigheid op PinchBench terwijl het 10.000 taken 30 procent sneller afrondt dan Qwen3.6 35B bij vergelijkbare nauwkeurigheid, en publiceert de weights, trainingsdata en recepten onder de OpenMDW-1.1 licentie.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Waarvoor is Nemotron 3.5 Lightning gebouwd?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Langlopende agents besteden het grootste deel van hun tijd aan repetitief uitvoeringswerk in plaats van aan plannen: tools aanroepen, resultaten valideren en taken doorgeven aan subagents. Voor elke van die stappen een frontier redeneermodel inzetten kost geld en tijd. Nemotron 3.5 Lightning is specifiek voor die uitvoeringslaag gebouwd. Het is het kleinste model in de Nemotron 3 familie en volgt op Nemotron 3 Nano. NVIDIA plaatst het onder een frontier planner zoals Nemotron 3 Ultra of GPT-5.6 in een systeem van modellen, waar het de routinematige aanroepen afhandelt die het tokenbudget van een agent domineren.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">De <a href=\"https:\/\/datanorth.ai\/nl\/blog\/wat-is-mixture-of-experts-moe-en-waarom-is-het-belangrijk\">mixture of experts<\/a> opzet maakt dat rendabel. Een router stuurt elk token naar een klein deel van de experts van het model, waardoor per token slechts 3 van de 30 miljard parameters draaien. Dat levert de capaciteit van een groter dicht model tegen ongeveer de rekenkosten van een klein model. NVIDIA trainde het model bovendien op veelgebruikte agent harnesses, waaronder OpenClaw en Hermes Agent, die allebei worden ondersteund door NVIDIA NemoClaw, de opensource beveiligings- en beheerstack voor altijd actieve agents.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Bedrijven passen het model nu al aan voor smalle domeinen. NVIDIA noemt CrowdStrike voor cybersecurity, Harvey met Trajectory voor juridische dienstverlening, CodeRabbit met Baseten voor codereviews, Lila Sciences voor redeneren binnen natuur- en levenswetenschappen, en Fastino Labs voor softwareontwikkeling, finance en zorg. Doordat het model klein is, is finetunen goedkoper en draait het op bescheidener hardware dan een frontier model nodig heeft.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Benchmarks en technische specificaties van Nemotron 3.5 Lightning<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Alle benchmarkcijfers komen uit evaluaties van NVIDIA zelf.<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Op PinchBench haalt Nemotron 3.5 Lightning 86 procent nauwkeurigheid en rondt het 10.000 taken 30 procent sneller af dan Qwen3.6 35B bij vergelijkbare nauwkeurigheid.<\/li>\n\n\n\n<li>NVIDIA plaatst het model daarnaast op de Pareto frontier van nauwkeurigheid tegen snelheid in de Artificial Analysis Intelligence Index, een index die negen evaluaties combineert over agenttaken, programmeren, wetenschappelijk redeneren en algemene intelligentie, en claimt tot 4 keer de uitvoersnelheid van modellen van vergelijkbare grootte. NVIDIA heeft de volledige evaluatieopzet en de promptsets achter de PinchBench vergelijking niet gepubliceerd.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">De snelheid komt uit twee technieken. Multi token prediction is tijdens een aparte pretrainingsfase in het model ingebakken, net als bij Nemotron 3 Super en Nemotron 3 Ultra, gevolgd door een extra fase die de nauwkeurigheid daarvan verbeterde. Daarbovenop levert NVIDIA twee draft modellen voor speculative decoding: DSpark, aanbevolen voor inferentie op DGX Spark en datacenterworkloads met lage gelijktijdigheid, en DFlash. Multi token prediction past beter bij gemiddelde tot hoge gelijktijdigheid, waarbij de optimale draftlengte afneemt naarmate de gelijktijdigheid stijgt.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Voor precisie levert Nemotron 3.5 Lightning een NVFP4 checkpoint naast een BF16 checkpoint, met dezelfde NVFP4 kernels die Nemotron 3 Ultra aandrijven op NVIDIA Blackwell, Hopper en Ampere GPU&#8217;s. Hetzelfde bestand werkt zowel in een datacenter als op een DGX Spark op het bureau. NVIDIA publiceert ook Nemotron-RL-Agentic-Terminal-Pivot, de agentische reinforcement learning dataset die is gebruikt om een deel van de codeeragent-capaciteiten na te trainen.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat NeMo Switchyard doet en wat het bespaart<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">NeMo Switchyard is de tweede helft van de release: <strong>een opensource bibliotheek voor modelrouting bij AI-agents<\/strong>. Die stuurt elke prompt in een agentworkflow naar het meest capabele en efficiente model voor die stap, over de eigen mix van open, propri\u00ebtaire en NVIDIA-modellen heen, zonder dat de applicatie herschreven hoeft te worden. Ontwikkelaars kunnen het routeringsalgoritme aanpassen of vervangen op basis van hun prioriteiten rond kwaliteit, latency of kosten. In de praktijk gaan plannen omhoog naar een frontier model en gaat uitvoering omlaag naar een model als Nemotron 3.5 Lightning.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Interne benchmarks van NVIDIA laten zien dat Switchyard nauwkeurigheid op frontier niveau behoudt terwijl de kosten per afgeronde taak dalen tot bijna een derde van het gebruik van alleen Claude Opus 4.8. De resultaten van partners zijn concreter. LangChain rapporteert <strong>74 procent<\/strong> lagere kosten over 145 meerbeurtige Deep Agents taken door slechts 7 procent van de aanroepen naar een frontier model te sturen, tegen een verlies van 6 procentpunt nauwkeurigheid. Ramp evenaarde de prestaties van een frontier model op Ramp SWE-Bench met <strong>58 procent<\/strong> lagere kosten en 33 procent kortere doorlooptijd. Cognition integreerde de gefaseerde router in Devin Desktop voor intern gebruik bij NVIDIA en verlaagde de gemiddelde kosten op FrontierCode Main met <strong>28 procent<\/strong> ten opzichte van alles naar een frontier model sturen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Andere partners melden kleinere winsten. Boomi mat 100 procent nauwkeurigheid in domeinrouting over vijf routeringsmogelijkheden, stuurde 59 procent van het verkeer naar een gefinetuned model dat 5 keer sneller is dan de standaardkeuze en verlaagde de latency in latere beurten met 21 procent. Classmethod draait opencode en Fireworks workloads intern op Switchyard, waarbij eerste tests 27 procent kostenbesparing laten zien bij gelijke kwaliteit. Cadence verbeterde de efficientie met 9,9 procent bij een formele verificatietoepassing. Kong levert Switchyard routing native via Kong AI Gateway, LiteLLM voegt het toe als plug-in in de proxylaag en Nous Research heeft het in Hermes geintegreerd.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Beschikbaarheid, licentie en hardware van Nemotron 3.5 Lightning<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Nemotron 3.5 Lightning is nu beschikbaar op Hugging Face als nvidia\/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4, op ModelScope, via OpenRouter op een gratis tier en op build.nvidia.com als NVIDIA NIM microservice. NeMo Switchyard staat op GitHub onder NVIDIA-NeMo\/Switchyard en komt binnenkort naar partnerplatformen. De weights, trainingsdata en recepten vallen onder OpenMDW-1.1, die vrij downloaden, aanpassen en commercieel wijzigen toestaat zonder licentiekosten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Het model is klein genoeg om lokaal te draaien. NVIDIA noemt NVIDIA Jetson, de GeForce RTX 5090, DGX Spark en DGX Station als ondersteunde lokale systemen, oplopend via RTX PRO workstations naar datacenters en cloud. Het draait ook via de gangbare lokale tooling, waaronder LM Studio, llama.cpp, Ollama en Unsloth. NVIDIA werkte samen met EXO Labs om de prestaties op DGX Spark in kaart te brengen en plaatst het model op de Pareto frontier voor kleine open modellen op het local.ai klassement van EXO Labs.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Voor maatwerk wijst NVIDIA op LoRA of volledige supervised finetuning met NeMo Automodel en NeMo Megatron Bridge, en op reinforcement learning met omgevingsgebaseerde evaluaties via NeMo RL en NeMo Gym. Gehoste inferentie is onder meer beschikbaar bij Baseten, CoreWeave, Crusoe, DeepInfra, Fireworks AI, FriendliAI, GMI Cloud, Modal, Nebius en Together AI. Het model is ontwikkeld met bijdragen van de Nemotron Coalition, waarvan de leden evaluatiemethodes, inferentiesoftware en datasets aanleverden.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Bekijk voor meer details <a href=\"https:\/\/blogs.nvidia.com\/blog\/nemotron-lightning-switchyard-rtx-dgx\/\" target=\"_blank\" rel=\"noreferrer noopener\">de offici\u00eble aankondiging van Nemotron 3.5 Lightning en NeMo Switchyard door NVIDIA<\/a>.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Nemotron 3.5 Lightning is het open mixture of experts model van NVIDIA met 30 miljard parameters en 3 miljard actieve parameters, uitgebracht op 11 augustus 2026 voor de uitvoeringslaag van langlopende agents, met 86 procent nauwkeurigheid op PinchBench en een OpenMDW-1.1 licentie.<\/p>\n","protected":false},"author":12,"featured_media":3442508,"template":"","tags":[],"news-category":[],"class_list":["post-3442510","news","type-news","status-publish","has-post-thumbnail"],"meta_box":[],"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news\/3442510","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/news"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/12"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3442508"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3442510"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3442510"},{"taxonomy":"news-category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news-category?post=3442510"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}