Article
GitHub Copilot optimiert Token-Nutzung durch intelligentes Model-Routing
GitHub hat neue Optimierungen für Copilot veröffentlicht, die die Token-Effizienz in agentischen Workflows deutlich verbessern. Der Fokus liegt auf zwei Innovationen: verbessertes Prompt-Caching und eine neue Auto-Modellauswahl namens HyDRA.
Prompt-Caching und Tool-Search
Längere Copilot-Sessions benötigen wiederkehrende Kontexte: Instruktionen, Repository-Informationen, Conversation History und verfügbare Tools. Bisher wurde dieser Kontext bei jeder Anfrage neu übertragen. Mit Prompt-Caching kann Copilot nun wiederkehrende Prompt-Prefixe wiederverwenden, statt sie jedes Mal neu zu berechnen.
Tool-Search geht einen Schritt weiter: Statt alle Tool-Schemas in jeden Prompt zu laden, können Modelle nun Tool-Definitionen on-demand laden. Das reduziert den Fixed-Cost-Overhead pro Turn signifikant, besonders bei Sessions mit vielen MCP-Tools, Terminal-Befehlen und Datei-Operationen.
HyDRA: Task-aware Model Routing
Die neue Auto-Funktion beantwortet die Frage: Welches Modell passt am besten zur aktuellen Aufgabe? HyDRA (Hybrid Dynamic Routing Architecture) kombiniert zwei Signale:
- Real-time Model Health: Verfolgt Verfügbarkeit, Auslastung, Geschwindigkeit, Fehlerraten und Kosten jedes Modells
- Task-aware Routing: Berücksichtigt Reasoning-Tiefe, Code-Komplexität, Debugging-Schwierigkeit und Tool-Orchestration-Needs
Die Evaluierungen zeigen, dass kein einzelnes Modell über alle Aufgaben hinweg am besten abschneidet. Oft erreicht ein effizienteres Modell dasselbe Ergebnis – stärkere Modelle sind nur bei tieferem Reasoning notwendig. HyDRA routet dynamisch nach oben, wenn die Aufgabe es erfordert, und bleibt effizient, wenn nicht.
Messbare Ergebnisse
In der Produktion spart HyDRA bis zu 72,5% der Kosten bei gleicher Qualität im aggressiven Modus, oder 12,9% im Peak-Modus bei Qualitätssteigerung gegenüber Sonnet. Das Ziel ist nicht, Qualität gegen Kosten zu tauschen, sondern das passende Modell für die jeweilige Aufgabe zu wählen.
Die technische Deep-Dive-Dokumentation erklärt Implementierungsdetails wie Cache-Control-Breakpoints, Provider-spezifische Tool-Search und wie diese Änderungen über lange Agent-Sessions hinweg funktionieren.
Fazit
Diese Verbesserungen machen Copilot effizienter in agentischen Szenarien, ohne dass Nutzer manuell Modell-Einstellungen anpassen müssen. Auto wählt das passende Modell basierend auf Aufgaben-Intent und System-Health – eine wichtige Entwicklung für produktive AI-gestützte Entwicklung.
Quelle: GitHub Blog