Models
IBM Granite 4.2: Reasoning-Modelle mit agentic RL und 512K-Kontext
IBM hat mit Granite 4.2 seine erste Familie von dense Reasoning-LLMs veröffentlicht — in drei Groessen (3B, 8B, 30B) und unter Apache 2.0. Das ist ein richtiger Tech-Tiefgang, den man sich anschauen sollte.
Architektur und Pre-Training
- Decoder-only Dense Transformer mit Grouped Query Attention, RoPE und SwiGLU
- Training from scratch auf rund 15 Billionen Tokens in fuenf Phasen
- Kontextfenster wird bis auf 512K Tokens erweitert
- bfloat16-Precision, getrennte Input/Output-Embeddings
Reasoning und Thinking-Modi
- Jedes Modell hat einen Thinking/Non-Thinking-Schalter plus einen Low-Effort-Modus fuer einfache Fragen
- Chain-of-Thought-Daten im SFT (~7,2M Samples, 100B Tokens) mit agentic- und nicht-agentic-Mix
- Qualitaetskontrolle ueber LLM-Judge (GPT-OSS-120B, Gemma 4) und Deduplizierung
Multi-Stage RL-Pipeline
- GRPO-basierte Pipeline mit verifizierbaren Rewards, Skill-Boostern und RLHF
- 8B und 30B bekommen zusaetzlich Agentic RL: SWE-Agent, Terminal-Agent, Search-Agent in echten Sandbox-Umgebungen
- 3B nimmt den gekuerzten Pfad ohne agentic Block
- Infrastruktur: NeMo-RL (Training) + NeMo-Gym (Rollouts) auf NVIDIA GB200-Clustern bei CoreWeave
Ergebnisse
- Starke Reasoning-Scores (AIME25: 89,17% beim 30B) und solide agentic Werte (SWE-Bench Verified: 57%)
- Quantized Varianten in FP8, FP4 und GGUF verfuegbar
- Tool Calling nativ im OpenAI-Format, kompatibel mit vLLM und SGLang
Originalquelle: Granite 4.2 LLMs: How They’re Built