Article

GitHub Copilot Agentic Harness übertrifft native Model-Harnesses bei Token-Effizienz

GitHub Copilot Claude GPT LLM Agenten

GitHub hat detaillierte Benchmarks seines Agentic Harness veröffentlicht – der Orchestrierungsschicht, die alle Copilot-Erlebnisse (CLI, App, Code Review) antreibt. Die Ergebnisse sind bemerkenswert.

Vergleich mit nativen Harnesses: GitHub verglich seinen Copilot CLI direkt mit Claude Code (Anthropic) und Codex CLI (OpenAI). Dabei wurden dieselben Modelle (Claude Sonnet 4.6, Opus 4.7, GPT-5.4, GPT-5.5), dieselben Benchmarks und normalisierte Parameter verwendet.

Getestete Benchmarks:

  • SWE-bench Verified: 500 human-validierte Bug-Fix-Tasks
  • SWE-bench Pro: Komplexe Multi-Step-Engineering-Aufgaben
  • SkillsBench: Skill-Nutzung und Triggering
  • TerminalBench: Terminal-basierte Workflows
  • Win-Hill: Interne Windows-Container-Benchmarks

Token-Effizienz als Schlüsselvorteil: Der GitHub-Harness zeigt konsistent niedrigere Token-Zahlen bei gleicher Aufgabenstellung – ein kritischer Kostenfaktor bei agentic Workflows. Die Verbesserungen resultieren aus optimiertem Context-Handling, intelligenterem Model-Routing und delegationsbasierten Optimierungen.

Die Flexibilität bleibt erhalten: Entwickler können aus über 20 Modellen wählen, ohne die Harness-Vorteile zu verlieren. GitHub betont, dass der Harness kontinuierlich verbessert wird – jede Optimierung profitiert alle Copilot-Oberflächen gleichzeitig.