Article

Every Eval Ever: Standardisierte KI-Evaluationen auf HuggingFace

HuggingFace Evaluation Benchmarks EEE LLM Open-Source

HuggingFace und die EvalEval Coalition haben ihre Evaluations-Systeme interoperabel gemacht. Every Eval Ever (EEE) und Community Evals können nun Ergebnisse austauschen, interpretieren und mit offenen Modellen sowie Leaderboards verknüpfen.

Das Problem

Evaluationsresultate sind verstreut und schwer vergleichbar. Sie leben in Papers, Leaderboards, Blog-Posts und Harness-Logs – jedes in seinem eigenen Format. Dasselbe Modell auf demselben Benchmark liefert oft unterschiedliche Scores je nach Durchführendem und Methode. LLaMA 65B beispielsweise wurde auf MMLU sowohl mit 63,7 als auch mit 48,8 bewertet.

Diese Diskrepanzen entstehen durch unberichtete Evaluationseinstellungen: Temperatur, Sampling-Strategien, Prompt-Varianten und mehr.

Die Lösung: EEE Schema

EEE ist ein JSON-Schema für Evaluationsresultate, das dokumentiert:

  • Wer hat evaluiert
  • Welches Modell
  • Wie wurde zugegriffen (API, lokal, etc.)
  • Generationseinstellungen (Temperatur, max_tokens, etc.)
  • Benchmark-Details

Das Schema erzwingt explizite Dokumentation aller Variablen, die Ergebnisse beeinflussen können.

Community Evals auf HuggingFace

Community Evals dezentralisieren die Ergebnisberichterstattung auf dem Hub. Jeder kann Benchmarks zu Modellen hinzufügen, ohne Hub-Betreiber zu kontaktieren. Ergebnisse verlinken auf:

  • Offene Modelle
  • Leaderboards
  • Standardisierte Metadaten

Interoperabilität

Die Verknüpfung von EEE und Community Evals ermöglicht:

  • Cross-Posting von Resultaten zwischen Plattformen
  • Einheitliche Interpretation verschiedener Evaluationsquellen
  • Nachvollziehbare Provenienz von Benchmark-Scores
  • Bessere Vergleichbarkeit zwischen Evaluatoren

Für ML-Praktiker und Forscher bedeutet das: Zuverlässigere Modellvergleiche, transparente Benchmark-Methodologie und reduzierte Verwirrung durch widersprüchliche Scores.

Die Initiative adressiert eine der größten Schwachstellen im aktuellen KI-Ökosystem – die Fragmentierung und Intransparenz von Evaluationsresultaten.