Article

LeMario: JEPA World Model lernt Super Mario Bros - und scheitert

AI JEPA World Model Super Mario Bros Reinforcement Learning Yann LeCun

Benjamin Bai hat ein faszinierendes Experiment durchgeführt: Er reproduzierte LeWorldModel, eine kleine Joint-Embedding Predictive Architecture (JEPA), trainierte sie aber nicht auf Push-T, sondern auf Super Mario Bros. Das Ergebnis ist sowohl technisch lehrreich als auch enttäuschend – und zeigt, wo die Grenzen von Weltmodellen liegen.

Was LeMario macht

JEPA-Architekturen, wie sie Yann LeCun propagiert, lernen nicht durch Belohnungsfunktionen, sondern durch Vorhersage: Das Model sagt latente Repräsentationen zukünftiger Frames voraus, basierend auf vergangenen Frames und Aktionen.

Die Architektur von LeMario besteht aus:

  1. Vision Encoder: Komprimiert jeden Frame in einen 192-dimensionalen Latent-Vektor
  2. Action Encoder: Komprimiert 5×6 Button-Sequenzen in einen weiteren 192-D-Vektor
  3. Causal Predictor: 6 Transformer-Blöcke mit AdaLN-Zero (Adaptive LayerNorm)

Die Aktionen werden nicht einfach angehängt, sondern über AdaLN-Zero injiziert: Shift, Scale und Gate steuern, wie stark die Transformer-Attention und MLP durch die Aktion beeinflusst werden.

SIGReg gegen Collapse

Das Problem: Das Model könnte “schummeln”, indem alle Latent-Vektoren gleich werden – perfekte Vorhersage, aber nutzlose Repräsentation. Die Lösung ist SIGReg, ein Regularisierungsterm, der die echten Frame-Latents variiert und informativ hält.

Die Ergebnisse – und das Problem

Das Model bestand alle anfänglichen Tests:

  • Generalisierte auf gehaltene Episoden
  • Nutzte Aktionen korrekt
  • Sagte 5-Schritt-Zukünfte besser als starke Baselines

Reward-Free Planning konnte Mario zu nahen Bildzielen bewegen, mit 2-5 Pixel Genauigkeit.

Doch dann kam der Reality-Check: Als Bai das Ziel weiter ins Level verschob, konnte Mario nicht zuverlässig über das erste größere Hindernis springen oder zu einem entfernten Ziel navigieren.

“The model had learned to predict the game, but that did not mean it had learned how to make progress through it.”

Das Fazit

Das Model lernte die Dynamik des Spiels, aber nicht das Spiel zu spielen. Es ist ein klassisches Problem: Vorhersage ≠ Planung ≠ Fortschritt.

Die Lessons, wie Bai selbst schreibt, wirken im Nachhinein offensichtlich:

  • Lokale Vorhersage ist nicht gleich globales Verständnis
  • Reward-Free Planning funktioniert nur für nahe Ziele
  • Test-Suiten müssen anspruchsvoller sein

Der volle Blogpost enthält alle architektonischen Details, die SIGReg-Formeln und die Experiment-Postmortem. Code ist auf GitHub verfügbar.