Article
MolmoMotion: Allen AI veröffentlicht Sprach-geführtes 3D-Bewegungsprognose-Modell
Vorhersage statt Beobachtung
Allen AI hat MolmoMotion veröffentlicht – ein Modell, das nicht Bewegungen beobachtet, sondern sie vorhersagt. Während aktuelle Computer-Vision-Systeme exzellent darin sind, Bewegungen in Videos zu tracken, bleibt die Fähigkeit, vorauszuschauen, wie sich Objekte bewegen werden, eine härtere und nützlichere Herausforderung.
Ein Roboter, der nach einer Tasse greift, muss antizipieren, wie sich die Tasse bewegen wird, bevor er sie berührt. Ein Video-Generator muss wissen, welche realistische Bewegung als nächstes kommt, um physikalisch plausible Frames zu erzeugen.
Wie MolmoMotion funktioniert
Das Modell benötigt drei Inputs:
- Video-Frame (RGB-Beobachtung)
- 3D-Punkte auf einem Objekt markiert
- Natürlichsprachliche Beschreibung der geplanten Aktion
Beispiel: “Move and rotate the wooden bowl with fruit on the table” – MolmoMotion sagt vorher, wo sich diese Punkte in den nächsten Sekunden im 3D-Raum bewegen werden.
MolmoMotion-1M: Das größte 3D-Trajectory-Dataset
Parallel zum Modell veröffentlicht Allen AI:
- MolmoMotion-1M: 1.16M Videos mit 3D-Punkt-Trajektorien und Aktionsbeschreibungen
- PointMotionBench: Mensch-validiertes Benchmark mit 2.7K Videoclips zur Messung von objekt-zentrierter 3D-Bewegungsprognose
Use Cases
Die vorhergesagten Trajektorien können direkt für Downstream-Applikationen genutzt werden:
- Robotik-Planung: Roboter können Bewegungen antizipieren
- Trajectory-Conditioned Video Generation: Physikalisch plausible Video-Generierung
- Autonome Systeme: Bewegungsvorhersage für Sicherheit und Navigation
Verfügbarkeit
Alles ist Open Source:
- 🧠 Modelle: huggingface.co/collections/allenai/molmomotion
- 📊 Data: MolmoMotion-1M Dataset
- 💻 Code: github.com/allenai/molmo-motion
- 🌐 Project Page: molmomotion.github.io
Das ist ein signifikanter Schritt: Bewegungsvorhersage statt -beobachtung ist der Schlüssel zu wirklich autonomen Systemen, die mit der physischen Welt interagieren können.