Article

Ornith-1.0: Self-Improving Open-Source Modelle für Agentic Coding

LLM Open Source RL Coding Agentic

Ornith-1.0 ist eine neue Familie von Open-Source-Modellen für agentic Coding mit einem innovativen Ansatz: Self-Improvement durch Reinforcement Learning.

Verfügbare Varianten:

  • Ornith-1.0-9B-Dense
  • Ornith-1.0-31B-Dense
  • Ornith-1.0-35B-MoE
  • Ornith-1.0-397B-MoE (post-trained auf Gemma 4 und Qwen 3.5)

Der Clou – Joint Scaffold-Solution RL: Ornith lernt durch RL nicht nur Solution Rollouts zu generieren, sondern auch die Scaffolds (Struktur/Vorarbeit), die diese Rollouts antreiben. Durch gemeinsame Optimierung von Scaffold und Solution entdeckt das Modell bessere Suchtrajektorien und generiert höherequalitäts Lösungen.

Benchmarks: State-of-the-Art unter Open-Source-Modellen vergleichbarer Größe auf Terminal-Bench 2.1, SWE-Bench, NL2Repo und OpenClaw.

Lizenz: MIT – global verfügbar, ohne regionale Einschränkungen.

Ein spannender Ansatz, da er über reines Imitation Learning hinausgeht und Modelle lehrt, nicht nur Lösungen zu reproduzieren, sondern auch den Problemlösungsprozess zu strukturieren. Die 397B-MoE-Variante ist post-trained auf Gemma 4 und Qwen 3.5 – ein interessanter Multi-Teacher-Ansatz.