Article

PRX Part 4: Datenstrategie für Large-Scale Pre-Training

PRX Data Pipeline Pre-Training VLM Photoroom

Photoroom veröffentlicht Teil 4 der PRX-Serie: Eine detaillierte Analyse ihrer Data Pipeline für das Training eines 7B Vision-Language Models. Von Re-Captioning mit VLMs bis zu Mosaic Data Shards.

Nach Architektur, Training-Design und einem 24-Stunden-Speedrun zieht Photoroom nun das Daten-Rückwärtshoch: Die Pipeline, die PRXs Qualität maßgeblich bestimmte. Wenig glamour, aber essenziell.

Die Philosophie: Vielfalt über Perfektion

Die zentrale Erkenntnis: Pre-Training braucht Coverage und Diversity, nicht pro-Bild-Perfektion. Ein breites, repräsentatives Corpus lehrt das Modell mehr über die visuelle Welt als ein kleinerer, “schönerer” Datensatz.

Over-Filtering für Ästhetik würde die Verteilung verengen und dem Modell Konzepte und kompositorische Vielfalt kosten, die später nicht rekonstruierbar sind.

Pre-Training ist für Breite; Fine-Tuning ist für Geschmack.

Daten-Quellen-Mix

PRX kombiniert:

  • Öffentliche Datensätze - bereits quality-gefiltert, dedupliziert, NSFW-geprüft
  • Interne Datensätze - proprietäre Quellen

Statt das Rad neu zu erfinden, baut Photoroom auf existierende Kuration auf. Pragmatisch statt perfektionistisch.

Captions-Philosophie

Die Erfahrung: Lange, akkurate Captions sind entscheidend. Part 2 zeigte: Der Wechsel von kurzen zu langen Captions verbesserte die Sample-Qualität signifikant.

Wenn Captions treu sind, werden Screenshots, Werbung, Logos und Text im Bild zu konditionierbaren Attributen - nicht zu Störquellen. Akkurates Captioning verwandelt “Noise” in etwas, das man prompten oder ausschließen kann.

Tech-Stack: MDS und Lance

Mosaic Data Shards (MDS):

  • Streambares Format für distributed training
  • Effektives Mischen und Shuffeln
  • Direktes Training aus S3/GCS

Lance-Format:

  • Flexibel für Iteration und Filterung
  • Ergänzt die Starrheit von MDS

Pipeline: Quelldaten → Lance (iterierbar) → MDS (trainierbar)

Re-Captioning mit VLM

Alle Bilder werden mit einem Vision-Language Model neu beschriftet. Das VLM generiert:

  • Lange, akkurate Beschreibungen
  • Alle visuellen Details
  • Strukturierte Attribute

Dieser Schritt standardisiert Captions über heterogene Quellen hinweg und maximiert die Trainingsqualität.

Fazit

PRXs Daten-Pipeline zeigt: Large-Scale Pre-Training erfordert pragmatische Entscheidungen. Die Balance zwischen Breite und Qualität, die Wahl der richtigen Formate (Lance für Flexibilität, MDS für Performance), und VLM-Powered Re-Captioning bilden das Fundament.

Nicht glamour, aber unentbehrlich.

Quelle

PRX Part 4: Our Data Strategy - Hugging Face Blog