Article
Google Android Bench Update: Claude Fable 5 führt, Gemini hinkt hinterher
Google hat seinen Android Bench Benchmark aktualisiert und acht neue LLMs hinzugefügt. Die Ergebnisse zeigen eine deutliche Verschiebung in der Leaderboard-Hierarchie – mit Claude Fable 5 an der Spitze und Googles eigenes Gemini auf dem fünften Platz.
Das Update im Überblick
Android Bench evaluiert, wie gut LLMs 100 Android-Entwicklungsaufgaben bewältigen. Nach dem Launch im März hat Google nun Metriken wie Kosten und Effizienz sowie Open-Weight-Modelle hinzugefügt. Das aktuelle Update bringt acht neue Modelle ins Rennen:
- Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8
- GLM 5.2, Kimi K2.7 Code
- MiniMax M3, Qwen 3.7 Plus, Qwen 3.7 Max
Die überraschende Leaderboard-Position
Claude Fable 5 dominiert mit 84,5% Genauigkeit und einem deutlichen Vorsprung vor GPT 5.4 und Claude Sonnet 5. Googles Gemini 3.1 Pro landet nur auf Platz fünf – ein „Home-Field Disadvantage" für das eigene Produkt.
Kosten vs. Performance
Die Top-Modelle sind teuer: Fable 5 und GPT 5.5 verbrauchen über $130 für den 100-Probleme-Benchmark mit 10 Durchläufen. Gemini 3.1 Pro kostet $87 – weniger Punkte, aber günstiger. Die größte Überraschung: Gemini 3.5 Flash ist mit $165 pro Lauf und 28 Stunden Laufzeit das teuerste Modell im Test, weil es deutlich länger für die Aufgaben braucht.
Community-Integration
Google lädt Entwickler ein, eigene Tests durchzuführen und Feedback einzureichen. Das Android Bench GitHub-Repository enthält alle Werkzeuge, um die Benchmarks lokal zu reproduzieren und zur Weiterentwicklung beizutragen.
Fazit
Die LLM-Landschaft für Code-Generierung ist volatiler als je zuvor. Googles eigener Benchmark zeigt, dass externe Modelle aktuell die Nase vorn haben – was die Frage aufwirft, wie schnell Gemini aufholen kann.