Article
Twilight of the Gods: Fable und 10 LLMs im Refactoring-Vergleich
Korridzy vergleicht Fable-5 mit GPT-5.4, GPT-5.5, DeepSeek-4-pro, Gemini-3.1-pro, GLM-5.1, Kimi-2.6, MiMo-2.5-pro, Opus-4.7, Qwen-3.6-plus und Qwen-3.7-max bei einer echten Refactoring-Aufgabe: das Entwirren eines “God Node” in einem LangGraph-Agenten.
Das Problem
Ein LangGraph-State-Graph zeigt einen “Octopus” – einen einzelnen Node mit 350 Zeilen Logik. Iteration-Loops, Bootstrap-Questions, Schema-Preparation, LLM-Calls, Retry-Logic, Calculator-Limits, Post-LLM-Fixes – alles in einem Node. Das ist ein Anti-Pattern: Der Graph repräsentiert nicht mehr das System, Debugging wird schwerer, Refactoring riskanter.
Das Experiment
Stage 1: Jedes Modell generiert einen Vorschlag, wie man die Logik auf Graph-Ebene hebt. Kein Modell sieht die Vorschläge der anderen.
Stage 2: Alle Modelle wechseln in den Evaluator-Modus und bewerten alle 11 Vorschläge. Wieder keine Kommunikation zwischen den Modellen.
Stage 3: Drei verschiedene Methoden, um zu entscheiden, wem man vertraut – Scores, Thesen-Vergleich, Opinion-Center.
Die Modelle
5 amerikanische Modelle (GPT-5.4/5.5, Gemini-3.1-pro, Opus-4.7, Fable-5) und 6 chinesische Modelle (DeepSeek-4-pro, GLM-5.1, Kimi-2.6, MiMo-2.5-pro, Qwen-3.6-plus, Qwen-3.7-max) – alle bei maximalem Reasoning-Effort in OpenCode mit Oh My Openagent Plugin.
Die Kernfrage
Kann man demselben Modell vertrauen, das den Spaghetti-Code erzeugt hat, ihn auch wieder zu entwirren? Korridzy nennt es “Lemonade from lemons” – Entropie mit demselben Tool reduzieren, das sie erzeugt hat.
Methodik
Jeder Vorschlag wurde auf Graph-Style (Balanced vs. Phase-based vs. Linear), Kernidee, Split-Strategie und Komplexität analysiert. Cross-Reviews prüften auf Vollständigkeit, Machbarkeit und Klarheit. Thesen-basierte Vergleiche extrahierten die wichtigsten Kriterien aus den Reviews.
Fazit
Das Experiment zeigt: Verschiedene Modelle liefern tatsächlich unterschiedliche Architektur-Vorschläge. Die Bewertungen sind nicht einheitlich – es gibt keinen klaren Konsens. Fable-5 zeigt sich als solider Generator, aber die chinesischen Modelle überraschen mit detaillierten Analysen. Die Frage “Welches Modell als Generator, welches als Evaluator?” bleibt offen – aber die Methode, mehrere Modelle gegeneinander zu prüfen, ist valider als ein einzelnes Modell zu fragen.
Quelle: Korridzy