Article

Is it agentic enough? Open Source Modelle auf eigener Tooling-Benchmark testen

Agents Benchmark Hugging Face LLM Transformers

Coding Agents arbeiten zunehmend mit unserer Software statt dass wir sie schreiben. Du beschreibst einen Task, und der Agent wählt die Library, schreibt die Aufrufe, führt sie aus und debuggt seine eigenen Fehler. Das wirft eine neue Frage auf: Ist deine Library agent-optimiert?

Warum herkömmliche Benchmarks nicht reichen

Die meisten Benchmarks schauen nur auf das Endergebnis: Hat der Agent die richtige Antwort gegeben? Aber das verrät nichts über den Weg dahin. Ein Agent könnte einen Task mit einem einzigen CLI-Aufruf lösen. Ein anderer schreibt ein 40-Zeilen-Python-Skript, importiert die Library, debuggt einen Shape-Fehler, läuft zweimal neu und erreicht schließlich das gleiche Ergebnis.

Beide produzieren “POSITIVE (0.9999)” - aber zu sehr unterschiedlichen Kosten in Tokens, Zeit und Fehlversuchen.

Das Harness von Hugging Face

Das Team hat ein Benchmarking-Tool entwickelt, das den ganzen Prozess misst:

  • Match %: Hat der Agent das richtige Ergebnis erreicht?
  • Tokens: Neue Tokens, gecachte Tokens, generierte Tokens
  • Zeit: Median-Laufzeit pro Task
  • Error Rate: Wie oft schlägt der Lauf fehl?
  • Marker-Adoption: Welche APIs nutzt der Agent?

Das Besondere: Du kannst es auf deine eigene Library anwenden. Das Harness ist profilbasiert und so konzipiert, dass du eigene Tasks und erwartete Ergebnisse definieren kannst.

Die drei Varianten

Jeder Task läuft unter drei Varianten:

  1. bare: Nur pip install transformers, nichts weiter
  2. clone: Der volle Repository-Checkout im Arbeitsverzeichnis
  3. skill: Ein paketiertes Skill-Dokument mit CLI-Doku und Beispielen

Das ermöglicht interessante Vergleiche: Hilft die Skill-Dokumentation oder schadet sie? Nutzen große Modelle die neue CLI oder bleiben sie bei der gewohnten Python-API?

Überraschende Ergebnisse bei Transformers

Das Team testete transformers mit einem neuen CLI + Skill-Commit. Die Erkenntnisse:

Große Modelle (Kimi-K2.6, GLM-5.1, MiniMax-M2.7): Der Skill hilft. Weniger Turns, weniger Zeit, die CLI wird aktiv genutzt (55% Adoption).

Kleine Modelle (Qwen3-4B, Qwen3-14B): Der Skill kann schaden. Qwen3-14B stürzt von 67% auf 43% Match-Rate ab, weil es das Skill-Dokument falsch interpretiert und versucht, eine nicht existierende Tool-API aufzurufen.

Die Lektion: Neue Features, die große Modelle beschleunigen, können kleine Modelle verwirren. Agent-orientierte APIs sollten über alle Modellgrößen evaluiert werden.

Selbst ausprobieren

Das Tool (agent-eval) ist verfügbar als CLI. Du installierst es, definierst Tasks, lässt sie parallel über verschiedene Modelle × Revisionen auf Hugging Face Jobs laufen, und veröffentlichst den Report als Space.

Vorsicht: Das Harness läuft mit umgehenden Berechtigungen und führt Code aus. Nur auf vertrauenswürdigem Code verwenden.

Der vollständige Blogpost mit allen Details steht auf Hugging Face Blog.