Article

Ultralytics YOLO26: NMS-freie Echtzeit-Erkennung

Computer Vision YOLO Object Detection AI

Ultralytics hat YOLO26 vorgestellt, die neueste Generation der beliebten Echtzeit-Objekterkennungsmodelle. Die wichtigste Neuerung: YOLO26 eliminiert die Abhängigkeit von Non-Maximum Suppression (NMS) und Distribution Focal Loss (DFL) und bietet damit einen echten End-to-End-Ansatz für Echtzeit-Vision.

Architektur-Verbesserungen

Dual-Head Design

YOLO26 verwendet ein Dual-Head-Design für native NMS-freie Inferenz. Dies ermöglicht echte End-to-End-Erkennung ohne Post-Processing-Schritte, was die Deployment-Komplexität erheblich reduziert.

DFL-freier Regressionskopf

Durch die Entfernung von DFL wird der Erkennungskopf leichter und bietet einen unbeschränkten Regressionsbereich für Bounding-Box-Vorhersagen. Dies vereinfacht die Trainingspipeline und reduziert den Speicherbedarf.

STAL: Small Object Coverage

Ein häufiges Problem bei YOLO-Modellen war die schlechte Abdeckung sehr kleiner Objekte. YOLO26 führt STAL (Small-object Target Assignment) ein, eine Label-Zuweisungsstrategie, die garantiert positive Samples auch für winzige Objekte liefert.

Training Pipeline

Die Trainingsverbesserungen sind direkt aus dem LLM-Training übernommen:

  • MuSGD: Ein hybrider Muon-SGD-Optimizer, angepasst aus dem Large-Language-Model-Training
  • Progressive Loss: Verschiebt die Supervision Richtung des Inference-Time-Heads
  • Effizientere Trainings-Zeitpläne im Vergleich zu früheren YOLO-Versionen

Multi-Task-Fähigkeiten

YOLO26 ist nicht nur ein Detektionsmodell. Es unterstützt fünf Vision-Tasks in einer einzigen Pipeline:

  1. Objekterkennung (Object Detection)
  2. Instanzsegmentierung (Instance Segmentation)
  3. Posenschätzung (Pose Estimation)
  4. Klassifizierung (Classification)
  5. Orientierte Erkennung (Oriented Detection)

Jeder Task hat spezialisierte Head- und Loss-Designs, die konsistente Verbesserungen über alle Skalen hinweg liefern.

Modellskalen

Wie bei YOLO üblich, gibt es fünf Größen:

SkalaCOCO mAPT4 TensorRT Latency
n40.91.7 ms
s--
m--
l--
x57.511.8 ms

Die Modelle verschieben die Accuracy-Latency-Pareto-Front gegenüber allen bisherigen Echtzeit-Detektoren.

YOLOE-26: Open-Vocabulary-Erweiterung

Für Anwendungen jenseits fester Klassen bietet YOLOE-26 eine Open-Vocabulary-Erweiterung mit:

  • Text-Prompting: Erkennung über natürlichsprachliche Beschreibungen
  • Visual-Prompting: Few-Shot-Erkennung aus Beispielbildern
  • Prompt-Free Inference: Zero-Shot-Erkennung ohne explizite Prompts

YOLOE-26x erreicht 40.6 AP auf LVIS minival unter Text-Prompting - konkurrenzfähig mit spezialisierten Open-Vocabulary-Detektoren.

Verfügbarkeit

Code und Modelle sind auf GitHub verfügbar:

Die Integration in die Ultralytics-Bibliothek ermöglicht den einfachen Wechsel von früheren YOLO-Versionen mit minimalen Code-Änderungen.