Article

Senior SWE-Bench: Benchmark bewertet AI-Agents wie Senior-Entwickler

AI Benchmark SWE-Bench Coding Agents LLM

Das Problem

Bestehende Benchmarks wie SWE-Bench testen Coding-Agenten mit über-spezifizierten Requirements. Die Instruktionen sind durchschnittlich 6.008 Zeichen lang und listen exakt auf, was zu tun ist – völlig unrealistisch für Senior-Ingenieure.

“We treat agents like senior engineers, so why evaluate them like junior engineers?”

Senior SWE-Bench

Der neue Benchmark von Snorkel AI ändert den Ansatz radikal:

1. Realistische Instruktionen

Feature-Tasks haben natürlichsprachliche Anforderungen, die wie echte PR-Beschreibungen klingen – nicht wie Schritt-für-Schritt-Anleitungen.

2. Echte Bug-Fixing-Aufgaben

Bug-Tasks basieren auf realen User-Reports und erfordern:

  • Logs-Analyse
  • Profiling-Daten-Interpretation
  • Reproduktionsschritte
  • Runtime-Investigation

3. Taste Scoring

Der Benchmark bewertet nicht nur Korrektheit, sondern auch Code-Qualität basierend auf:

  • Beobachteten Codebase-Praktiken
  • Lasttragenden Konventionen
  • Stil-Konsistenz

Der Validierungs-Agent

Ein Validation Agent schreibt verhaltensbasierte Tests, die sich an eingereichten Lösungen anpassen. Das ermöglicht faire Bewertung ohne over-fitting auf spezifische Lösungen.

Technische Beiträge

  • Validation Agent: Automatische Test-Generierung
  • Taste Scoring: Qualitätsmetrik für Code-Stil
  • Quality Control: Prüfung gegen implizite Codebase-Praktiken

Verfügbarkeit

Der Benchmark ist Open Source auf GitHub verfügbar.


Links: Senior SWE-Bench, Dataset auf GitHub