Article
Senior SWE-Bench: Benchmark bewertet AI-Agents wie Senior-Entwickler
Das Problem
Bestehende Benchmarks wie SWE-Bench testen Coding-Agenten mit über-spezifizierten Requirements. Die Instruktionen sind durchschnittlich 6.008 Zeichen lang und listen exakt auf, was zu tun ist – völlig unrealistisch für Senior-Ingenieure.
“We treat agents like senior engineers, so why evaluate them like junior engineers?”
Senior SWE-Bench
Der neue Benchmark von Snorkel AI ändert den Ansatz radikal:
1. Realistische Instruktionen
Feature-Tasks haben natürlichsprachliche Anforderungen, die wie echte PR-Beschreibungen klingen – nicht wie Schritt-für-Schritt-Anleitungen.
2. Echte Bug-Fixing-Aufgaben
Bug-Tasks basieren auf realen User-Reports und erfordern:
- Logs-Analyse
- Profiling-Daten-Interpretation
- Reproduktionsschritte
- Runtime-Investigation
3. Taste Scoring
Der Benchmark bewertet nicht nur Korrektheit, sondern auch Code-Qualität basierend auf:
- Beobachteten Codebase-Praktiken
- Lasttragenden Konventionen
- Stil-Konsistenz
Der Validierungs-Agent
Ein Validation Agent schreibt verhaltensbasierte Tests, die sich an eingereichten Lösungen anpassen. Das ermöglicht faire Bewertung ohne over-fitting auf spezifische Lösungen.
Technische Beiträge
- Validation Agent: Automatische Test-Generierung
- Taste Scoring: Qualitätsmetrik für Code-Stil
- Quality Control: Prüfung gegen implizite Codebase-Praktiken
Verfügbarkeit
Der Benchmark ist Open Source auf GitHub verfügbar.
Links: Senior SWE-Bench, Dataset auf GitHub