Article
Mistral Robostral Navigate: Single-Camera Robot Navigation
Mistral AI hat mit Robostral Navigate sein erstes Modell für embodied Navigation vorgestellt. Der 8-Milliarden-Parameter-Vision-Language-Model ermöglicht Robotern, komplexe Umgebungen autonom zu navigieren - mit nur einer einzigen RGB-Kamera und ohne Tiefensensoren.
Performance-Highlights
Das Modell erreicht 76,6% Success-Rate auf dem R2R-CE Benchmark (Room-to-Room in Continuous Environments) für ungesehene Validierungs-Umgebungen. Das ist bemerkenswert:
- +9,7 Punkte besser als der beste Single-Camera-Ansatz
- +4,5 Punkte besser als Systeme mit Tiefensensoren oder mehreren Kameras
- Trotz Verzicht auf LiDAR, Tiefensensoren oder Stereokameras
Wie es funktioniert
Robostral Navigate nimmt RGB-Bilder und einen natürlichsprachigen Befehl entgegen, zum Beispiel:
“Verlasse die Lobby, gehe durch den Korridor, betritt den Vorratsraum und halte vor dem zweiten Regal.”
Das Modell kombiniert:
- Pointing-basierte Navigation für präzise Zielerfassung
- Reinforcement Learning für kontinuierliche Verbesserung
- Simulation-trained Data für Robustheit
Besonderheiten
- Vollständig in-house entwickelt bei Mistral
- Token-effiziente Techniken für ressourcenschonende Inferenz
- Generalisiert über verschiedene Robotertypen
- Adaptiert an echte Hindernisse, die nicht im Training vorkamen
Das Modell markiert einen wichtigen Schritt Richtung unified embodied AI in der Robotik und zeigt, dass Mistral nun auch im Robotics-Bereich aktiv forscht.