Article
GitHub veröffentlicht multilingual Repositories Dataset (80M+ Einträge)
GitHub veröffentlicht den „GitHub Multilingual Repositories Dataset" unter CC0-1.0 – ein Metadaten-Datensatz zur Entdeckung von Repositories mit nicht-englischem Content.
Umfang: Über 80 Millionen Klassifikations-Zeilen für mehr als 40 Millionen Repositories.
Enthaltene Daten:
- Sprachklassifikation von READMEs, Issues und Pull Requests (mittels fastText, gcld3, lingua-py)
- Confidence-Scores für jede Klassifikation (>0.5 Threshold)
- Repository-Metadaten: Stars, Forks, License, Disk Usage, Programming Language
Anwendungsfälle:
- Evaluationssets für multilingual funktionierende AI-Coding-Tools
- Untersuchung nicht-englischsprachiger Entwickler-Communities
- Messung der Repräsentation unterrepräsentierter Sprachen
Interessanter Fund: Koreanisch dominiert bei Issues, während Portugiesisch mit über 3 Millionen Repositories die häufigste nicht-englische Sprache in READMEs ist.