NVIDIA Nemotron 3.5 Lightning 30B A3B NVFP4

Modeloverzicht

  • Totaal aantal parameters: 30B (waarvan 3B actief)
  • Architectuur: MoE - Mamba-2 + MoE + Attention hybride
  • Contextlengte: Tot 1M tokens
  • Implementatie op enkele GPU: 1× DGX Spark (GB10) of 1× H100
  • Ondersteunde hardware: NVIDIA Blackwell (DGX Spark / GB10, GB200, GeForce RTX 5090); NVIDIA Hopper (H100, H200); NVIDIA Ampere via W4A16
  • Ondersteunde talen: Engels (en programmeertalen), Spaans, Frans, Duits, Italiaans, Japans
  • Speculatieve decodering: DSpark voor low-concurrency datacenters en DGX Spark workflows; daarnaast zijn MTP (Multi-Token Prediction) en DFlash beschikbaar.
  • Aanbevolen sampling: Temperatuur 1.0, Top_P 0.95
  • Best geschikt voor: Autonome agenten voor langdurige taken, sub-agent werkpaard-implementaties en efficiënte lokale inferentie op persoonlijke hardware
  • Licentie: OpenMDW License Agreement, versie 1.1
  • Releasedatum: 11 augustus 2026

Ontwikkeling

  • Modelontwikkelaar: NVIDIA Corporation
  • Ontwikkelingsperiode: December 2025 - Mei 2026
  • Actualiteit van data: De pre-training data heeft een cutoffdatum van september 2025. De post-training data heeft een cutoffdatum van mei 2026.

Wat is Nemotron?

NVIDIA Nemotron™ is een familie van open modellen met open gewichten, trainingsdata en recepten, die leidende efficiëntie en nauwkeurigheid bieden voor het bouwen van gespecialiseerde AI-agenten.

Beschrijving

De NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 is een groot taalmodel (LLM) getraind door NVIDIA. Het model maakt gebruik van een hybride Mixture-of-Experts architectuur, met afwisselende Mamba-2 en MoE lagen, samen met geselecteerde Attention lagen.

Het Lightning 3.5 model is uitgebracht samen met diverse methoden voor speculatieve decodering om tekstgeneratie te versnellen. Het model heeft in totaal 30 miljard parameters, waarvan er 3 miljard actief zijn per token. Dit model is klaar voor commercieel gebruik.

Snelstart

Voor een snelle start op DGX Spark (GB10) kan het volgende commando worden gebruikt:

# Haal het model op
export MODEL_CKPT=nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
export DSPARK_CKPT=nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark

# Voer het uit met vLLM (gebruikt DSpark speculatieve decodering, afgestemd op DGX Spark)
# Gebruik vLLM Nightly: vllm/vllm-openai:v0.27.1
vllm serve --model $MODEL_CKPT \
--moe-backend marlin \
--kv-cache-dtype fp8 \
--enable-prefix-caching \
--speculative_config.num_speculative_tokens 3 \
--mamba-backend flashinfer \
--mamba-cache-mode align \
--reasoning-parser nemotron_v3 \
--speculative_config.model $DSPARK_CKPT \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice

Licentie en Gebruiksvoorwaarden

Het gebruik van dit model wordt beheerst door de OpenMDW-1.1 modellicentie.

Benchmarks

Evaluaties van Redeneren (Reasoning)

TaakNemotron-3.5-Lightning-30B-A3B-BF16Nemotron-3.5-Lightning-30B-A3B-NVFP4
Algemene Kennis
MMLU Pro81.9481.62
AA-Omniscience17.5016.63
Redeneren
GPQA Diamond (geen tools)75.4475.57
HLE (alleen tekst, geen tools)11.7210.47
SciCode32.6031.38
Coderen & Agentisch
SWE-bench Verified51.5652.80
SWE-bench Multilingual39.3336.47
Terminal-Bench 2.124.5823.46
PinchBench85.3783.43
BrowseComp36.9736.81
$\tau^3$-bench (Banking)9.289.48
GDPval-AA-V2832865
Instructieopvolging
IFBench (loose)71.8872.88
Lange Context
AA-LCR52.0049.19

Nauwkeurigheidsgetallen zijn gemeten door NVIDIA onder een consistent harness (NeMo Gym / Nemo Evaluator SDK). De resultaten voor NVFP4 zijn gebaseerd op het officiële checkpoint.

Modelarchitectuur en Ontwerp

Architectuur

  • Type architectuur: Mixture-of-Experts Hybride (Mamba + Transformer)
  • Netwerkarchitectuur: Nemotron-3-Lightning + Multi-Token Prediction (MTP)
  • Aantal parameters: 30B totaal / 3B actief

Ontwerp

Het model is gepre-traind met meer dan 20 biljoen tokens en ondersteunt een contextlengte tot 1 miljoen tokens. De pre-training fase maakte gebruik van een NVFP4 recept. Het model bevat Multi-Token Prediction (MTP) lagen, die meerdere toekomstige tokens voorspellen om rijkere trainingssignalen te bieden.

Trainingsmethodologie

Stap 1: Pre-Training Het model is gepre-traind met een NVFP4 recept gebruikmakend van gecrawlde en synthetische data over code, wiskunde, wetenschap en algemene kennis. Software gebruikt: Megatron-LM.

Stap 2: Doorlopende Pre-Training voor Multi-Token Prediction (MTP) In deze fase zijn de MTP-lagen getraind om meerdere toekomstige tokens te voorspellen, waardoor de basisdistributie van het model wordt versterkt.

Stap 3: Supervised Fine-Tuning (SFT) Het model is verder gefinetuned op synthetische data voor code, wiskunde, wetenschap, tool calling, instructieopvolging, gestructureerde outputs en algemene kennis. Er is specifieke data toegevoegd om long-range retrieval en aggregatie van meerdere documenten te ondersteunen.

Stap 4: Reinforcement Learning (RL) Er is gebruikgemaakt van multi-environment reinforcement learning via GRPO (Group Relative Policy Optimization) voor domeinen zoals wiskunde, code, wetenschap en multi-turn conversaties. De architectuur ontkoppelt training van inferentie en gebruikt MTP om rollout-generatie te versnellen. Software gebruikt: NeMo RL, NeMo Gym.

Stap 5: Post-training Quantization (PTQ) Er is PTQ uitgevoerd met de Nvidia Model Optimizer via het "Four Over Six NVFP4" recept (een variant van statische MSE kalibratie) W4A16 op routed en shared experts. Voor mamba in\proj/out\proj en KV cache zijn FP8 per-tensor dynamische schalen gebruikt.

Gebruik en Implementatie

Use Case

Het model is een algemeen doelmodel voor redeneren en chat, primair bedoeld voor het Engels en programmeertalen. Andere talen (Spaans, Frans, Duits, Italiaans, Japans) worden eveneens ondersteund. Het is ideaal voor ontwikkelaars van AI Agent-systemen, chatbots, RAG-systemen en typische instructieopvolgende taken.

Input en Output

  • Input type: Tekst (Strings / 1D Sequenties)
  • Output type: Tekst (Strings / 1D Sequenties)
  • Maximale contextlengte: Tot 1 miljoen tokens.

Software Integratie

  • Runtime Engine: PyTorch
  • Hardwarecompatibiliteit: NVIDIA Blackwell; NVIDIA Hopper (NVFP4 / W4A16); NVIDIA Ampere (W4A16)
  • Besturingssysteem: Linux

Implementatiegids

Alle onderstaande snippets gaan uit van: export MODELCKPT=nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 En voor DSpark: export DSPARKCKPT=nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark

Speculatieve Decoderingsstrategieën

Het model ondersteunt drie methoden om tekstgeneratie te versnellen:

  1. DSpark: Een semi-autoregressieve drafter die een blok kandidaat-tokens voorstelt in één forward pass. Aanbevolen voor DGX Spark en low-concurrency datacenters.
  2. DFlash: Maakt gebruik van een lichtgewicht block-diffusion model om een draft-blok te genereren.
  3. MTP (Multi-Token Prediction): Een techniek waarbij het netwerk meerdere toekomstige tokens per positie voorspelt.

vLLM Implementatie

1x DGX Spark (GB10) - DSpark Methode:

vllm serve --model $MODEL_CKPT \
--moe-backend marlin \
--kv-cache-dtype fp8 \
--max-model-len 1048576 \
--enable-prefix-caching \
--speculative_config.num_speculative_tokens 3 \
--mamba-backend flashinfer \
--mamba-cache-mode align \
--reasoning-parser nemotron_v3 \
--speculative_config.method dspark \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice

1x H100 (Maximale doorvoer):

vllm serve --model $MODEL_CKPT \
--max-num-seqs 256 \
--max-num-batched-tokens 16384 \
--enable-prefix-caching \
--async-scheduling \
--mamba-backend flashinfer \
--moe-backend humming \
--linear-backend humming \
--mamba-ssu-algorithm horizontal \
--mamba-cache-mode align \
--mamba-ssm-cache-dtype float16 \
--enable-mamba-cache-stochastic-rounding \
--mamba-cache-philox-rounds 5 \
--reasoning-parser nemotron_v3 \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice

8x H100 (Long-context, TP8):

vllm serve --model $MODEL_CKPT \
--mamba-backend flashinfer \
--async-scheduling \
--enable-prefix-caching \
--mamba-cache-mode align \
--enable-expert-parallel \
--tensor-parallel-size 8 \
--reasoning-parser nemotron_v3 \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice

NVIDIA Ampere (W4A16):

vllm serve --model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
--moe-backend humming \
--linear-backend humming \
--max-num-seqs 256 \
--max-num-batched-tokens 32768 \
--enable-prefix-caching \
--async-scheduling \
--quantization modelopt_fp4 \
--mamba-backend flashinfer \
--mamba-cache-mode align \
--mamba-ssu-algorithm simple \
--reasoning-parser nemotron_v3 \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice

TensorRT-LLM Implementatie (1x H100)

Configureer eerst de YAML:

kv_cache_config:
  dtype: fp8
  enable_block_reuse: false
mamba_state_config:
  periodic_snapshot_interval: 8192
  free_gpu_memory_fraction: 0.8
  mamba_ssm_cache_dtype: float16
  mamba_ssm_stochastic_rounding: true
  mamba_ssm_philox_rounds: 5
moe_config:
  backend: MARLIN
nvfp4_gemm_config:
  allowed_backends: [marlin, cutlass, cublaslt, cuda_core]
cuda_graph_config:
  enable_padding: true
  max_batch_size: 8
speculative_config:
  decoding_type: MTP
  max_draft_len: 3
  allow_advanced_sampling: true
enable_chunked_prefill: true
num_postprocess_workers: 4
print_iter_log: true
stream_interval: 10
disable_overlap_scheduler: false

Start de server:

trtllm-serve \
$MODEL_CKPT \
--max_batch_size 8 \
--max_num_tokens 8192 \
--reasoning_parser nemotron-v3 \
--tool_parser qwen3_coder \
--config nemotron-35-lightning-nvfp4-mtp.yaml

SGLang Implementatie (1x H100)

sglang serve \
--model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
--max-running-requests 256 \
--trust-remote-code \
--chunked-prefill-size 32768 \
--mem-fraction-static 0.9 \
--speculative-algorithm EAGLE \
--speculative-draft-model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--mamba-backend flashinfer \
--mamba-radix-cache-strategy extra_buffer \
--reasoning-parser nemotron_3 \
--tool-call-parser qwen3_coder

API Client Gebruik

De modelback-ends maken gebruik van een OpenAI-compatibele client op poort 8000. Aanbevolen sampling: Temperatuur 1.0 en Top\_P 0.95.

Basis Configuratie (Python)

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
MODEL = "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4"

Redenering aan/uit schakelen (Reasoning Control)

Het model biedt controle over het redeneerproces via chattemplatekwargs.

Redeneren AAN (Standaard):

response = client.chat.completions.create(
    model=MODEL,
    messages=[{"role": "user", "content": "Schrijf een haiku over GPU's"}],
    max_tokens=16000,
    temperature=1.0,
    top_p=0.95,
    extra_body={"chat_template_kwargs": {"enable_thinking": True}}
)
print(response.choices[0].message.content)

Redeneren UIT (Direct antwoord):

response = client.chat.completions.create(
    model=MODEL,
    messages=[{"role": "user", "content": "Wat is de hoofdstad van Japan?"}],
    max_tokens=16000,
    temperature=1.0,
    top_p=0.95,
    extra_body={"chat_template_kwargs": {"enable_thinking": False}}
)
print(response.choices[0].message.content)

Tool Calling

Voor coding agents is het aanbevolen om forcenonemptycontent: True toe te voegen.

tools = [{
    "type": "function",
    "function": {
        "name": "get_weather",
        "description": "Haal het huidige weer op voor een stad",
        "parameters": {
            "type": "object",
            "properties": {"city": {"type": "string"}},
            "required": ["city"],
        },
    },
}]

response = client.chat.completions.create(
    model=MODEL,
    messages=[{"role": "user", "content": "Wat is het weer in Santa Clara?"}],
    tools=tools,
    max_tokens=16000,
    temperature=1.0,
    top_p=0.95,
    extra_body={"chat_template_kwargs": {"force_nonempty_content": True}},
)
print(response.choices[0].message.tool_calls)

Trainings- en Evaluatiedata

Algemene Trainingsinformatie

  • Data Modaliteit: Tekst
  • Omvang trainingsdata: Meer dan 20 biljoen tokens
  • Periode van collectie: 2013 tot december 2025
  • Collectiemethode: Hybride (geautomatiseerd, handmatig verzameld, synthetisch)

Het model is getraind in het Engels, 19 andere gesproken talen en 43 programmeertalen. De bronnen omvatten webpages, dialogen en artikelen binnen domeinen als recht, wiskunde, wetenschap en financiën.

Data Filteringsproces

Er is een uniforme filteringspijplijn toegepast:

  1. Structurele checks: Verwijderen van foutieve voorbeelden (bijv. ontbrekende tool-definities).
  2. Redenering-filters: Verwijderen van pathologische herhalingen in redeneertrajecten.
  3. Inhoudelijke filters: Gebruik van keywords en regex om politieke bias of nationalistische narratieven uit synthetisch gegenereerde data te verwijderen.

Pre-Training Corpus (Nemotron 3 Foundation)

Dataset CollectieToken AantalBeschrijving
Nemotron-CC-v2 & v2.19.1TEngelse webdata gefilterd uit Common Crawl.
Nemotron-CC-Code-v1427.9BHoogwaardige code tokens uit Common Crawl via Lynx + LLM pipeline.
Nemotron-Pretraining-Code-v1/v2/v31.7TGecureerde GitHub code met synthetische data.
Nemotron-CC-Math-v1133.3BWiskundige pre-training data in LaTeX formaat.
Nemotron-Pretraining-Specialized (v1/v1.1/v1.2/SFT)660.0BSynthetische datasets voor STEM en wetenschappelijk coderen.
Nemotron-Pretraining-Legal-v14.3BSynthetische datasets voor het juridische domein.

Gebruikte Publieke Datasets (Selectie)

  • Algemeen: Common Crawl, Wikimedia, FineWeb-2, Reddit Dataset.
  • Wiskunde & Wetenschap: arXiv, PubMed Abstracts, OpenWebMath, MathPile, NuminaMath CoT.
  • Coding: GitHub Crawl, Stack Exchange Data Dump, SWE-Gym.
  • Reasoning/QA: GSM8K, HotpotQA, SQuAD2.0, MMLU Auxiliary Train.

Synthetische Datasets (Pre-Training)

NVIDIA heeft uitgebreid gebruikgemaakt van synthetische data gegenereerd door modellen zoals Qwen3, DeepSeek-V3 en GPT-OSS:

  • Wiskunde & Logica: Nemotron-PrismMath, Synthetic Art of Problem Solving.
  • Wetenschap: Synthetic STEM seeded with OpenStax.
  • Code: Synthetic Scientific Coding (Qwen3-235B), Synthetic CUDA 100k.
  • Juridisch/Economie: Nemotron-Pretraining-Legal, Nemotron-Pretraining-Economics.

Synthetische Datasets (Post-Training)

Focus op agent-capaciteiten en specifieke redeneertaken:

  • Agentic Reasoning: Synthetic Hermes Agent Reasoning Traces, Synthetic Terminal Bench tasks.
  • Code/SWE: Synthetic Agentless SWE, Synthetic CUDA Traces.
  • Veiligheid: Synthetic Multilingual Safety (Riva-Translate), Synthetic Abstention Data.

Ethische Overwegingen en Inferentie

Ethiek

NVIDIA hanteert het principe dat "Trustworthy AI" een gedeelde verantwoordelijkheid is. Ontwikkelaars worden geadviseerd om interne modelteams te raadplegen om te garanderen dat het model voldoet aan industriële eisen en misbruik voorkomt. Het omzeilen van veiligheidsmechanismen zonder passende alternatieve waarborgen wordt afgeraden.

Inferentie Hardware

Het model is geoptimaliseerd voor NVIDIA GPU-versnelde systemen via CUDA libraries. Geteste hardware omvat:

  • NVIDIA Hopper: 1-8x H100, 1-8x H200
  • NVIDIA Blackwell: GB200, DGX Spark (GB10), GeForce RTX 5090