Models
NVIDIA Nemotron 3.5 Lightning - 30B-MoE-Modell mit NVFP4-Quantisierung
Neues effizientes SLM aus der Nemotron-Familie
NVIDIA hat Nemotron 3.5 Lightning als NVFP4-quantisierten Checkpoint veroeffentlicht - ein hybrides Mixture-of-Experts-Modell mit 30B Gesamt- und nur 3B aktiven Parametern. Die Architektur kombiniert Mamba-2- und MoE-Schichten mit selektiven Attention-Schichten sowie Multi-Token-Prediction-Layern und richtet sich an langlaufende autonome Agenten und ressourceneffiziente lokale Inferenz.
Eckdaten
- Kontextlaenge: bis zu 1M Token
- Single-GPU-Deployment: 1x DGX Spark (GB10) oder 1x H100
- Hardware-Unterstuetzung: NVIDIA Blackwell, Hopper (H100/H200), Ampere via W4A16
- Sprachen: Englisch, Spanisch, Franzoesisch, Deutsch, Italienisch, Japanisch
- Lizenz: OpenMDW 1.1 (kommerziell nutzbar)
Spekulatives Decoding
Neben MTP- und DFlash-Draftern liefert NVIDIA DSPark - einen speziell fuer DGX Spark und niedrige Nebenlaeufigkeit abgestimmten Draft-Modell-Checkpunkt fuer deutlich schnellere Textgeneration. Integrationen gibt es fuer vLLM, SGLang, TRT-LLM, Ollama und llama.cpp.
Benchmark-Highlights
- MMLU Pro: 81,62 - GPQA Diamond: 75,57 - SWE-bench Verified: 52,80
- Die NVFP4-Variante erreicht nahezu BF16-Genauiigkeit bei deutlich reduziertem Speicherbedarf (18B safetensors-Groesse).
Das Modell eignet sich ideal als Workhorse fuer Sub-Agenten und effiziente Edge-Deployment-Szenarien auf einer einzelnen GPU.
Original: huggingface.co