Article

Mistral Robostral Navigate: Single-Camera Robot Navigation

Mistral Robotics Navigation Embodied AI

Mistral AI hat mit Robostral Navigate sein erstes Modell für embodied Navigation vorgestellt. Der 8-Milliarden-Parameter-Vision-Language-Model ermöglicht Robotern, komplexe Umgebungen autonom zu navigieren - mit nur einer einzigen RGB-Kamera und ohne Tiefensensoren.

Performance-Highlights

Das Modell erreicht 76,6% Success-Rate auf dem R2R-CE Benchmark (Room-to-Room in Continuous Environments) für ungesehene Validierungs-Umgebungen. Das ist bemerkenswert:

  • +9,7 Punkte besser als der beste Single-Camera-Ansatz
  • +4,5 Punkte besser als Systeme mit Tiefensensoren oder mehreren Kameras
  • Trotz Verzicht auf LiDAR, Tiefensensoren oder Stereokameras

Wie es funktioniert

Robostral Navigate nimmt RGB-Bilder und einen natürlichsprachigen Befehl entgegen, zum Beispiel:

“Verlasse die Lobby, gehe durch den Korridor, betritt den Vorratsraum und halte vor dem zweiten Regal.”

Das Modell kombiniert:

  • Pointing-basierte Navigation für präzise Zielerfassung
  • Reinforcement Learning für kontinuierliche Verbesserung
  • Simulation-trained Data für Robustheit

Besonderheiten

  • Vollständig in-house entwickelt bei Mistral
  • Token-effiziente Techniken für ressourcenschonende Inferenz
  • Generalisiert über verschiedene Robotertypen
  • Adaptiert an echte Hindernisse, die nicht im Training vorkamen

Das Modell markiert einen wichtigen Schritt Richtung unified embodied AI in der Robotik und zeigt, dass Mistral nun auch im Robotics-Bereich aktiv forscht.

Quelle: https://mistral.ai/news/robostral-navigate/