Models

IBM Granite 4.2: Reasoning-Modelle mit agentic RL und 512K-Kontext

llm ibm granite enterprise

IBM hat mit Granite 4.2 seine erste Familie von dense Reasoning-LLMs veröffentlicht — in drei Groessen (3B, 8B, 30B) und unter Apache 2.0. Das ist ein richtiger Tech-Tiefgang, den man sich anschauen sollte.

Architektur und Pre-Training

  • Decoder-only Dense Transformer mit Grouped Query Attention, RoPE und SwiGLU
  • Training from scratch auf rund 15 Billionen Tokens in fuenf Phasen
  • Kontextfenster wird bis auf 512K Tokens erweitert
  • bfloat16-Precision, getrennte Input/Output-Embeddings

Reasoning und Thinking-Modi

  • Jedes Modell hat einen Thinking/Non-Thinking-Schalter plus einen Low-Effort-Modus fuer einfache Fragen
  • Chain-of-Thought-Daten im SFT (~7,2M Samples, 100B Tokens) mit agentic- und nicht-agentic-Mix
  • Qualitaetskontrolle ueber LLM-Judge (GPT-OSS-120B, Gemma 4) und Deduplizierung

Multi-Stage RL-Pipeline

  • GRPO-basierte Pipeline mit verifizierbaren Rewards, Skill-Boostern und RLHF
  • 8B und 30B bekommen zusaetzlich Agentic RL: SWE-Agent, Terminal-Agent, Search-Agent in echten Sandbox-Umgebungen
  • 3B nimmt den gekuerzten Pfad ohne agentic Block
  • Infrastruktur: NeMo-RL (Training) + NeMo-Gym (Rollouts) auf NVIDIA GB200-Clustern bei CoreWeave

Ergebnisse

  • Starke Reasoning-Scores (AIME25: 89,17% beim 30B) und solide agentic Werte (SWE-Bench Verified: 57%)
  • Quantized Varianten in FP8, FP4 und GGUF verfuegbar
  • Tool Calling nativ im OpenAI-Format, kompatibel mit vLLM und SGLang

Originalquelle: Granite 4.2 LLMs: How They’re Built