Article
PRX Part 4: Datenstrategie für Large-Scale Pre-Training
Photoroom veröffentlicht Teil 4 der PRX-Serie: Eine detaillierte Analyse ihrer Data Pipeline für das Training eines 7B Vision-Language Models. Von Re-Captioning mit VLMs bis zu Mosaic Data Shards.
Nach Architektur, Training-Design und einem 24-Stunden-Speedrun zieht Photoroom nun das Daten-Rückwärtshoch: Die Pipeline, die PRXs Qualität maßgeblich bestimmte. Wenig glamour, aber essenziell.
Die Philosophie: Vielfalt über Perfektion
Die zentrale Erkenntnis: Pre-Training braucht Coverage und Diversity, nicht pro-Bild-Perfektion. Ein breites, repräsentatives Corpus lehrt das Modell mehr über die visuelle Welt als ein kleinerer, “schönerer” Datensatz.
Over-Filtering für Ästhetik würde die Verteilung verengen und dem Modell Konzepte und kompositorische Vielfalt kosten, die später nicht rekonstruierbar sind.
Pre-Training ist für Breite; Fine-Tuning ist für Geschmack.
Daten-Quellen-Mix
PRX kombiniert:
- Öffentliche Datensätze - bereits quality-gefiltert, dedupliziert, NSFW-geprüft
- Interne Datensätze - proprietäre Quellen
Statt das Rad neu zu erfinden, baut Photoroom auf existierende Kuration auf. Pragmatisch statt perfektionistisch.
Captions-Philosophie
Die Erfahrung: Lange, akkurate Captions sind entscheidend. Part 2 zeigte: Der Wechsel von kurzen zu langen Captions verbesserte die Sample-Qualität signifikant.
Wenn Captions treu sind, werden Screenshots, Werbung, Logos und Text im Bild zu konditionierbaren Attributen - nicht zu Störquellen. Akkurates Captioning verwandelt “Noise” in etwas, das man prompten oder ausschließen kann.
Tech-Stack: MDS und Lance
Mosaic Data Shards (MDS):
- Streambares Format für distributed training
- Effektives Mischen und Shuffeln
- Direktes Training aus S3/GCS
Lance-Format:
- Flexibel für Iteration und Filterung
- Ergänzt die Starrheit von MDS
Pipeline: Quelldaten → Lance (iterierbar) → MDS (trainierbar)
Re-Captioning mit VLM
Alle Bilder werden mit einem Vision-Language Model neu beschriftet. Das VLM generiert:
- Lange, akkurate Beschreibungen
- Alle visuellen Details
- Strukturierte Attribute
Dieser Schritt standardisiert Captions über heterogene Quellen hinweg und maximiert die Trainingsqualität.
Fazit
PRXs Daten-Pipeline zeigt: Large-Scale Pre-Training erfordert pragmatische Entscheidungen. Die Balance zwischen Breite und Qualität, die Wahl der richtigen Formate (Lance für Flexibilität, MDS für Performance), und VLM-Powered Re-Captioning bilden das Fundament.
Nicht glamour, aber unentbehrlich.