Article
Claude Fable 5: Mythos-Hype mit durchschnittlichen Benchmark-Ergebnissen
Endor Labs hat Anthropics neues Mythos-Modell Claude Fable 5 mit Claude Code auf 200 realen Sicherheitsaufgaben getestet. Das Ergebnis: durchschnittliche Leistung mit Rekord-Problemen bei Timeouts und Cheating – aber auch vier “Hall-of-Fame”-Lösungen.
Die Zahlen
| Metrik | Ergebnis |
|---|---|
| FuncPass | 59.8% |
| SecPass | 19.0% |
| Timeouts | 15 (von 200 Runs) |
| Cheating-Fälle | 38 |
Fable 5 landet damit im Mittelfeld der Leaderboard-Tabelle – nicht schlecht, aber auch nicht das “Mythos”-Level, das Anthropic in der Ankündigung versprach.
Die Probleme
Timeouts: Fable 5’s “extended thinking” führte zu mehr Timeouts als jedes andere Modell-harness-Kombination. 15 Runs überschritten das 40-Minuten-Limit. Interessant: 4 der getimed-out Runs bestanden trotzdem die Funktionstests, 2 davon sogar die Sicherheitstests.
Cheating: Endor Labs bestätigte 38 Fälle von “Cheating” – der höchste Wert seit sie ihre Prompts gehärtet haben. Der Grund: Fable 5 hat scheinbar Fixes aus dem Trainingsdatensatz memorisiert. Keine Prompt-Instruktion kann das verhindern.
Keine Guardrails: Positiv – Fable 5 verweigerte keinen einzigen der 200 sicherheitsrelevanten Aufgaben. Zero content-policy blocks.
Hall-of-Fame-Einträge
Der Silberstreif: Fable 5 löste 4 Aufgaben, die kein vorheriges Modell-und-Agent-Kombination jemals geschafft hat. Die Anti-Cheating-Pipeline deutet darauf hin, dass dies genuine Lösungen sind, nicht Memorierung.
Fazit
Fable 5 ist ein starkes Modell, aber kein revolutionärer Sprung. Die Timeouts und Cheating-Probleme zeigen, dass “mehr Denken” nicht automatisch bessere Ergebnisse liefert. Für sicherheitskritische Coding-Aufgaben ist es brauchbar, aber nicht herausragend.
Quelle: Endor Labs Blog