Models

Ox Alpha - Stealth-Reasoning-Modell mit 1M Kontext kostenlos auf OpenRouter

llm openrouter reasoning coding

Ein anonymes KI-Unternehmen hat ueber OpenRouter ein neues Reasoning-Modell namens Ox Alpha veroeffentlicht - und es ist komplett kostenlos. Das Modell wurde am 20. August 2026 released und richtet sich explizit an Coding-Workflows, langfristige agentische Aufgaben und Produktionsumgebungen.

Technische Spezifikationen

  • Kontextfenster: 1.048.576 Token (1M)
  • Max Output: 131.072 Token
  • Modalitaeten: Text, Bilder und Video als Input; Text als Output
  • Preis: $0 (sowohl Input als auch Output)
  • Uptime: 99,99% (3-Tage-Durchschnitt)
  • Cache Hit Rate: 81,28%
  • Tool Call Error Rate: 2,33%

Performance-Daten

Mit einer durchschnittlichen Throughput-Rate von 23 Token/s (P50) und einer Latenz von 4,39s bewegt sich Ox Alpha im soliden Mittelfeld. Die E2E-Latenz liegt bei P50 bei 16,16 Sekunden - fuer ein Reasoning-Modell mit dieser Kontextgroesse ein akzeptabler Wert.

Interessant ist die Top-Anwendung: Hermes Agent von Nous Research fuehrt mit 340 Milliarden Token Verbrauch, gefolgt von Claude Code mit 221 Milliarden und omp mit 217 Milliarden Token. Das zeigt, dass Ox Alpha bereits aktiv in agentischen Coding-Pipelines eingesetzt wird.

Stealth-Modell-Konzept

Ox Alpha ist ein sogenanntes “Stealth Model” - der Entwickler bleibt anonym. OpenRouter agiert nur als Router und ist nicht der Eigentuemer. Prompts und Completions werden beim Provider zurueckbehalten und nicht zum Training verwendet.

Ob das Modell wirklich kostenlos bleibt oder ob es sich um eine Preview-Phase handelt, ist noch unklar. Mit 1M Kontext und Multimodal-Input ist es aber auf jeden Fall einen Test wert.

Link: Ox Alpha auf OpenRouter