NVIDIA Nemotron 3.5 Lightning en NeMo Switchyard zorgen voor snellere, slimmer en efficiëntere agentische AI

Nu AI verschuift van chatbots naar autonome agenten, is er een groeiende marktvraag naar open modellen die volledige controle bieden over waar AI wordt uitgevoerd en hoe deze wordt geïmplementeerd en ontwikkeld.

NVIDIA breidt de Nemotron 3-modelfamilie uit met Nemotron 3.5 Lightning, het meest efficiënte model in zijn klasse voor langdurige agentische AI-workloads. Deze release volgt op Nemotron 3 Nano en onderstreept de inzet van NVIDIA om open modellen continu te verbeteren voor een hogere nauwkeurigheid en snelheid.

Nemotron 3.5 Lightning is een mixture-of-experts-model met 30 miljard parameters, gebouwd voor gespecialiseerde taken binnen grotere multi-agent-systemen. Hiermee kunnen slimmer en efficiëntere agentische applicaties worden gecreëerd.

Daarnaast lanceert NVIDIA NeMo Switchyard, een open-source bibliotheek voor slimme routing binnen populaire agent-tools. Bedrijven kunnen hiermee een router bouwen die is afgestemd op hun specifieke behoeften. NeMo Switchyard kan elk verzoek intelligent dirigeren naar het meest capabele en geschikte model voor de taak, ongeacht of dit gaat om open, propriëtaire of NVIDIA-modellen, zonder dat ontwikkelaars hun applicaties hoeven te herschrijven.

Samen zorgen Nemotron 3.5 Lightning en NeMo Switchyard voor meer controle over de implementatie, de locatie van uitvoering en de operationele efficiëntie van AI over pc's, workstations, datacenters en de cloud.

Altijd actieve agenten hebben een systeem van modellen nodig

Moderne agentische systemen — zogenaamde always-on agents — werken steeds vaker als systemen van modellen, of model-ensembles, waarbij verschillende modellen gespecialiseerd zijn in verschillende taken.

De open Nemotron-modellen van NVIDIA zijn ontworpen voor deze architectuur. Een geavanceerd redeneermodel (frontier reasoning model), zoals Nemotron 3 Ultra of GPT-5.6, kan een workflow plannen en orkestreren, terwijl kleinere gespecialiseerde modellen zoals Nemotron 3.5 Lightning gerichte taken uitvoeren. Voorbeelden hiervan zijn:

  • Code reviews;
  • Gebruik van tools;
  • Monitoring van beveiligingsmeldingen;
  • Beantwoorden van facturatievragen.

Gespecialiseerde taken met een hoog volume via Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning is een volledig aanpasbaar open model, gebouwd voor taken met een hoog volume die altijd actieve agenten aandrijven. Het model is ontwikkeld met bijdragen van het Nemotron Coalition, dat evaluatiemethodieken, inferentie-software en datasets heeft geleverd.

Het model biedt tot 4x snellere output, wat resulteert in een 30% snellere voltooiing van agentische taken vergeleken met andere modellen in zijn klasse. Omdat het open en aanpasbaar is, kan Nemotron 3.5 Lightning eenvoudig worden getraind via NVIDIA NeMo met eigen domeindata, tools en workflows om de nauwkeurigheid voor specifieke taken te verhogen.

PinchBench-benchmarks tonen aan dat Nemotron 3.5 Lightning agentische taken sneller voltooit met een precisie op frontier-niveau in vergelijking met concurrenten in dezelfde klasse.

Sectorale toepassingen

AI-leiders uit diverse sectoren passen Nemotron 3.5 Lightning reeds aan voor hun specifieke workloads:

  • CrowdStrike: Cybersecurity.
  • Harvey (met Trajectory): Juridische diensten.
  • CodeRabbit (met Baseten): Code reviews.
  • Lila Sciences: Redeneervermogen voor taken in de fysieke en levenswetenschappen.
  • Fastino Labs: Softwareontwikkeling, financiën en gezondheidszorg.

Privacy en implementatie

Nemotron 3.5 Lightning biedt organisaties controle over privacy en uitrol. Het kan lokaal draaien op AI-systemen zoals NVIDIA RTX pc's, NVIDIA DGX Spark, NVIDIA DGX Station en NVIDIA Jetson. Daarnaast kan het worden geschaald over edge AI-apparaten, NVIDIA RTX PRO workstations, datacenters en cloudomgevingen. Voor taken met een hoog volume die snelle reacties vereisen, kan het model volledig on-premises of lokaal worden uitgevoerd.

In lijn met elke Nemotron-lancering publiceert NVIDIA zoveel mogelijk trainingsdata en technieken als de licenties toelaten voor traceerbaarheid en auditing. Naast Lightning brengt NVIDIA Nemotron-RL-Agentic-Terminal-Pivot uit, een dataset voor agentic reinforcement learning die is gebruikt om de coderingsmogelijkheden van het model te trainen.

Efficiëntere AI-applicaties via modelrouting

Verschillende modellen zijn geoptimaliseerd voor verschillende doelen: sommige zijn beter in coderen, andere in redeneren of lichte taken, en sommige zijn geoptimaliseerd voor lokale uitvoering vanwege privacy en efficiëntie. Wanneer klanten vertrouwen op één standaardmodel, riskeren ze overmatige kosten of kwaliteitsverlies. Handmatige routing kan bovendien de implementatie vertragen.

NVIDIA NeMo Switchyard is een open-source modelrouting-bibliotheek voor AI-agenten. De technologie routeert prompts automatisch naar het meest capabele en efficiënte model voor elke stap in een agent-workflow, gebaseerd op specifieke behoeften. Ontwikkelaars kunnen de router afstemmen met verschillende algoritmen om prioriteiten zoals kwaliteit, latentie en kosten te optimaliseren. Hiermee kunnen bedrijven krachtige AI-agenten creëren met verbeterde tokenomics.

Interne benchmarks tonen aan dat NeMo Switchyard nauwkeurigheid op frontier-niveau behoudt, terwijl de kosten voor het voltooien van taken worden teruggebracht tot bijna een derde van wat Opus 4.8 alleen zou kosten.

Partnerintegraties en resultaten

NVIDIA werkt samen met partners in het AI-ecosysteem om intelligente modelrouting te integreren in bestaande tools:

  • Boomi: Behaalde 100% nauwkeurigheid bij domeinrouting, stuurde 59% van het verkeer naar een 5x sneller fine-tuned model en verminderde de latentie in latere beurten met 21%.
  • Cadence: Verbeterde de efficiëntie met 9,9% door gebruik van de ChipStack AI Super Agent voor formele verificatie.
  • Classmethod: Integreert opencode en Fireworks workloads; initiële tests tonen een kostenreductie van 27% bij gelijkblijvende kwaliteit.
  • Cognition: Integreerde de staged router in Devin Desktop (intern gebruik), met prestaties nabij het frontier-niveau op FrontierCode Main en een gemiddelde kostenreductie van 28% ten opzichte van één enkel frontier-model.
  • Kong: Biedt routing via NeMo Switchyard native aan via de Kong AI Gateway.
  • LangChain: Behaalde 74% lagere kosten in 145 multi-turn Deep Agents-taken door slechts 7% van de calls naar een frontier-model te sturen (bij een kwaliteitsverlies van 6%).
  • LiteLLM: Voegt NeMo Switchyard toe als plug-in aan de proxy-laag.
  • Nous Research: Integreerde NeMo Switchyard in Hermes voor een eenvoudig configureerbaar routingsysteem.
  • Ramp: Matched de prestaties van frontier-modellen terwijl de kosten met 58% en de runtime met 33% werden verlaagd in Ramp SWE-Bench.
  • Siemens: Voert benchmarks uit om de efficiëntie van de Fuse EDA AI Agent te verbeteren.

Beschikbaarheid

Nemotron 3.5 Lightning is beschikbaar op Hugging Face, ModelScope, OpenRouter en via build.nvidia.com als een NVIDIA NIM-microservice, evenals via diverse cloudpartners en inferentieplatforms. NeMo Switchyard is beschikbaar op GitHub en wordt binnenkort uitgerold naar partnerplatforms.