Tools
Project HydraFusion: GitHub Copilot orchestriert mehrere KI-Modelle im Hintergrund
GitHub hat mit Project HydraFusion eine Research Preview fuer GitHub Copilot gestartet, die frontier-nahe Qualitaet durch Laufzeit-Orchestrierung mehrerer Modelle erreicht. Statt ein einzelnes Modell auszuwaehlen, erstellt HydraFusion pro Aufgabe einen kompletten Ausfuehrungsplan und verteilt Drafting, Kritik und Revision auf Modelle verschiedener Provider. Der Entwickler waehlt einfach HydraFusion wie jedes andere Modell - die Komplexitaet bleibt dahinter.
Drei Ausfuehrungsmuster
- Single: Ein Modell loest die Aufgabe direkt - schnell und guenstig.
- Cascade: Ein effizientes Modell entwirft eine Loesung, ein Quality-Gate entscheidet, ob sie akzeptiert wird oder an ein staerkeres Modell eskaliert.
- Critique: Ein Modell entwirft, ein unabhaengiger Read-only-Kritiker aus einer anderen Modellfamilie prueft das Ergebnis, danach folgt genau eine Revision.
Die Muster werden als Optimierungsproblem behandelt: Capability-Signals fuer Reasoning, Codegenerierung, Debugging und Tool-Use bestimmen den jeweils effizientesten Workflow. Die Routing-Policies wurden per Beam Search ueber drei Benchmarks hinweg verfeinert, nicht manuell getunt.
Benchmark-Ergebnisse
Gegen Claude Opus 5 und GPT-5.6 Sol zeigte HydraFusion in Offline-Evaluationen:
- TerminalBench 2.1: +4.9 Prozentpunkte Qualitaet bei 67% niedrigeren geschätzten Kosten
- DeepSWE: -1.5 Prozentpunkte bei 36% niedrigeren Kosten
- CheckpointBench (intern, aus echten Copilot-Sessions): -0.1 Prozentpunkte bei 65% niedrigeren Kosten
Fuenf Betriebsprinzipien sichern den Ablauf: vollstaendige Kostenabrechnung ueber alle Workflow-Legs, begrenzte Ausfuehrung mit Timeouts, isolierte toollose Review-Schritte, Fail-safe-Anwendung (kein Patch bei Abbruch) und validiertes Routing vor der Ausfuehrung. Die Preview zielt zunaechst auf First-Turn-Einzel-Prompts in Copilot; Multi-Turn-Performance folgt naechsten.
Link: Original-Artikel