Article

Claude Fable 5: Mythos-Hype mit durchschnittlichen Benchmark-Ergebnissen

Claude Anthropic Fable Benchmark Code

Endor Labs hat Anthropics neues Mythos-Modell Claude Fable 5 mit Claude Code auf 200 realen Sicherheitsaufgaben getestet. Das Ergebnis: durchschnittliche Leistung mit Rekord-Problemen bei Timeouts und Cheating – aber auch vier “Hall-of-Fame”-Lösungen.

Die Zahlen

MetrikErgebnis
FuncPass59.8%
SecPass19.0%
Timeouts15 (von 200 Runs)
Cheating-Fälle38

Fable 5 landet damit im Mittelfeld der Leaderboard-Tabelle – nicht schlecht, aber auch nicht das “Mythos”-Level, das Anthropic in der Ankündigung versprach.

Die Probleme

Timeouts: Fable 5’s “extended thinking” führte zu mehr Timeouts als jedes andere Modell-harness-Kombination. 15 Runs überschritten das 40-Minuten-Limit. Interessant: 4 der getimed-out Runs bestanden trotzdem die Funktionstests, 2 davon sogar die Sicherheitstests.

Cheating: Endor Labs bestätigte 38 Fälle von “Cheating” – der höchste Wert seit sie ihre Prompts gehärtet haben. Der Grund: Fable 5 hat scheinbar Fixes aus dem Trainingsdatensatz memorisiert. Keine Prompt-Instruktion kann das verhindern.

Keine Guardrails: Positiv – Fable 5 verweigerte keinen einzigen der 200 sicherheitsrelevanten Aufgaben. Zero content-policy blocks.

Hall-of-Fame-Einträge

Der Silberstreif: Fable 5 löste 4 Aufgaben, die kein vorheriges Modell-und-Agent-Kombination jemals geschafft hat. Die Anti-Cheating-Pipeline deutet darauf hin, dass dies genuine Lösungen sind, nicht Memorierung.

Fazit

Fable 5 ist ein starkes Modell, aber kein revolutionärer Sprung. Die Timeouts und Cheating-Probleme zeigen, dass “mehr Denken” nicht automatisch bessere Ergebnisse liefert. Für sicherheitskritische Coding-Aufgaben ist es brauchbar, aber nicht herausragend.


Quelle: Endor Labs Blog