Article
Ultralytics YOLO26: NMS-freie Echtzeit-Erkennung
Ultralytics hat YOLO26 vorgestellt, die neueste Generation der beliebten Echtzeit-Objekterkennungsmodelle. Die wichtigste Neuerung: YOLO26 eliminiert die Abhängigkeit von Non-Maximum Suppression (NMS) und Distribution Focal Loss (DFL) und bietet damit einen echten End-to-End-Ansatz für Echtzeit-Vision.
Architektur-Verbesserungen
Dual-Head Design
YOLO26 verwendet ein Dual-Head-Design für native NMS-freie Inferenz. Dies ermöglicht echte End-to-End-Erkennung ohne Post-Processing-Schritte, was die Deployment-Komplexität erheblich reduziert.
DFL-freier Regressionskopf
Durch die Entfernung von DFL wird der Erkennungskopf leichter und bietet einen unbeschränkten Regressionsbereich für Bounding-Box-Vorhersagen. Dies vereinfacht die Trainingspipeline und reduziert den Speicherbedarf.
STAL: Small Object Coverage
Ein häufiges Problem bei YOLO-Modellen war die schlechte Abdeckung sehr kleiner Objekte. YOLO26 führt STAL (Small-object Target Assignment) ein, eine Label-Zuweisungsstrategie, die garantiert positive Samples auch für winzige Objekte liefert.
Training Pipeline
Die Trainingsverbesserungen sind direkt aus dem LLM-Training übernommen:
- MuSGD: Ein hybrider Muon-SGD-Optimizer, angepasst aus dem Large-Language-Model-Training
- Progressive Loss: Verschiebt die Supervision Richtung des Inference-Time-Heads
- Effizientere Trainings-Zeitpläne im Vergleich zu früheren YOLO-Versionen
Multi-Task-Fähigkeiten
YOLO26 ist nicht nur ein Detektionsmodell. Es unterstützt fünf Vision-Tasks in einer einzigen Pipeline:
- Objekterkennung (Object Detection)
- Instanzsegmentierung (Instance Segmentation)
- Posenschätzung (Pose Estimation)
- Klassifizierung (Classification)
- Orientierte Erkennung (Oriented Detection)
Jeder Task hat spezialisierte Head- und Loss-Designs, die konsistente Verbesserungen über alle Skalen hinweg liefern.
Modellskalen
Wie bei YOLO üblich, gibt es fünf Größen:
| Skala | COCO mAP | T4 TensorRT Latency |
|---|---|---|
| n | 40.9 | 1.7 ms |
| s | - | - |
| m | - | - |
| l | - | - |
| x | 57.5 | 11.8 ms |
Die Modelle verschieben die Accuracy-Latency-Pareto-Front gegenüber allen bisherigen Echtzeit-Detektoren.
YOLOE-26: Open-Vocabulary-Erweiterung
Für Anwendungen jenseits fester Klassen bietet YOLOE-26 eine Open-Vocabulary-Erweiterung mit:
- Text-Prompting: Erkennung über natürlichsprachliche Beschreibungen
- Visual-Prompting: Few-Shot-Erkennung aus Beispielbildern
- Prompt-Free Inference: Zero-Shot-Erkennung ohne explizite Prompts
YOLOE-26x erreicht 40.6 AP auf LVIS minival unter Text-Prompting - konkurrenzfähig mit spezialisierten Open-Vocabulary-Detektoren.
Verfügbarkeit
Code und Modelle sind auf GitHub verfügbar:
- GitHub:
ultralytics/ultralytics - Paper: arXiv:2606.03748
Die Integration in die Ultralytics-Bibliothek ermöglicht den einfachen Wechsel von früheren YOLO-Versionen mit minimalen Code-Änderungen.