Article

Google Android Bench Update: Claude Fable 5 führt, Gemini hinkt hinterher

LLM Benchmark Android Claude Gemini OpenAI Qwen

Google hat seinen Android Bench Benchmark aktualisiert und acht neue LLMs hinzugefügt. Die Ergebnisse zeigen eine deutliche Verschiebung in der Leaderboard-Hierarchie – mit Claude Fable 5 an der Spitze und Googles eigenes Gemini auf dem fünften Platz.

Das Update im Überblick

Android Bench evaluiert, wie gut LLMs 100 Android-Entwicklungsaufgaben bewältigen. Nach dem Launch im März hat Google nun Metriken wie Kosten und Effizienz sowie Open-Weight-Modelle hinzugefügt. Das aktuelle Update bringt acht neue Modelle ins Rennen:

  • Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8
  • GLM 5.2, Kimi K2.7 Code
  • MiniMax M3, Qwen 3.7 Plus, Qwen 3.7 Max

Die überraschende Leaderboard-Position

Claude Fable 5 dominiert mit 84,5% Genauigkeit und einem deutlichen Vorsprung vor GPT 5.4 und Claude Sonnet 5. Googles Gemini 3.1 Pro landet nur auf Platz fünf – ein „Home-Field Disadvantage" für das eigene Produkt.

Kosten vs. Performance

Die Top-Modelle sind teuer: Fable 5 und GPT 5.5 verbrauchen über $130 für den 100-Probleme-Benchmark mit 10 Durchläufen. Gemini 3.1 Pro kostet $87 – weniger Punkte, aber günstiger. Die größte Überraschung: Gemini 3.5 Flash ist mit $165 pro Lauf und 28 Stunden Laufzeit das teuerste Modell im Test, weil es deutlich länger für die Aufgaben braucht.

Community-Integration

Google lädt Entwickler ein, eigene Tests durchzuführen und Feedback einzureichen. Das Android Bench GitHub-Repository enthält alle Werkzeuge, um die Benchmarks lokal zu reproduzieren und zur Weiterentwicklung beizutragen.

Fazit

Die LLM-Landschaft für Code-Generierung ist volatiler als je zuvor. Googles eigener Benchmark zeigt, dass externe Modelle aktuell die Nase vorn haben – was die Frage aufwirft, wie schnell Gemini aufholen kann.