Article

GitHub veröffentlicht multilingual Repositories Dataset (80M+ Einträge)

ai llm coding github claude

GitHub veröffentlicht den „GitHub Multilingual Repositories Dataset" unter CC0-1.0 – ein Metadaten-Datensatz zur Entdeckung von Repositories mit nicht-englischem Content.

Umfang: Über 80 Millionen Klassifikations-Zeilen für mehr als 40 Millionen Repositories.

Enthaltene Daten:

  • Sprachklassifikation von READMEs, Issues und Pull Requests (mittels fastText, gcld3, lingua-py)
  • Confidence-Scores für jede Klassifikation (>0.5 Threshold)
  • Repository-Metadaten: Stars, Forks, License, Disk Usage, Programming Language

Anwendungsfälle:

  • Evaluationssets für multilingual funktionierende AI-Coding-Tools
  • Untersuchung nicht-englischsprachiger Entwickler-Communities
  • Messung der Repräsentation unterrepräsentierter Sprachen

Interessanter Fund: Koreanisch dominiert bei Issues, während Portugiesisch mit über 3 Millionen Repositories die häufigste nicht-englische Sprache in READMEs ist.