Models

NVIDIA Nemotron 3.5 Lightning - 30B-MoE-Modell mit NVFP4-Quantisierung

nvidia nemotron llm quantization moe

Neues effizientes SLM aus der Nemotron-Familie

NVIDIA hat Nemotron 3.5 Lightning als NVFP4-quantisierten Checkpoint veroeffentlicht - ein hybrides Mixture-of-Experts-Modell mit 30B Gesamt- und nur 3B aktiven Parametern. Die Architektur kombiniert Mamba-2- und MoE-Schichten mit selektiven Attention-Schichten sowie Multi-Token-Prediction-Layern und richtet sich an langlaufende autonome Agenten und ressourceneffiziente lokale Inferenz.

Eckdaten

  • Kontextlaenge: bis zu 1M Token
  • Single-GPU-Deployment: 1x DGX Spark (GB10) oder 1x H100
  • Hardware-Unterstuetzung: NVIDIA Blackwell, Hopper (H100/H200), Ampere via W4A16
  • Sprachen: Englisch, Spanisch, Franzoesisch, Deutsch, Italienisch, Japanisch
  • Lizenz: OpenMDW 1.1 (kommerziell nutzbar)

Spekulatives Decoding

Neben MTP- und DFlash-Draftern liefert NVIDIA DSPark - einen speziell fuer DGX Spark und niedrige Nebenlaeufigkeit abgestimmten Draft-Modell-Checkpunkt fuer deutlich schnellere Textgeneration. Integrationen gibt es fuer vLLM, SGLang, TRT-LLM, Ollama und llama.cpp.

Benchmark-Highlights

  • MMLU Pro: 81,62 - GPQA Diamond: 75,57 - SWE-bench Verified: 52,80
  • Die NVFP4-Variante erreicht nahezu BF16-Genauiigkeit bei deutlich reduziertem Speicherbedarf (18B safetensors-Groesse).

Das Modell eignet sich ideal als Workhorse fuer Sub-Agenten und effiziente Edge-Deployment-Szenarien auf einer einzelnen GPU.

Original: huggingface.co