Article
vLLM Transformers Backend erreicht Native-Speed
HuggingFace hat einen wichtigen Meilenstein erreicht: Der Transformers-Modeling-Backend für vLLM ist nun so schnell (oder schneller) als handgeschriebene native vLLM-Implementierungen für viele LLM-Architekturen.
Was ist neu?
Bisher war der Transformers-Backend in vLLM langsamer als die nativen Implementierungen. Mit den neuen Optimierungen erreicht er nun Native-Speed - und übertrifft teilweise sogar die handoptimierten Versionen.
Die Benchmarks zeigen beeindruckende Ergebnisse:
- Qwen3-4B (Single GPU): Transformers-Backend matches native
- Qwen3-32B (Tensor Parallel): Transformers-Backend matches native
- Qwen3-235B-A22B-FP8 MoE (8×H100): Transformers-Backend matches native
Einfache Nutzung
Ein einzelnes Flag aktiviert den Transformers-Backend:
# Dense Model, Single GPU
vllm serve Qwen/Qwen3-4B --model-impl transformers
# Tensor Parallel
vllm serve Qwen/Qwen3-32B --model-impl transformers --tensor-parallel-size 2
# MoE mit Expert Parallel
vllm serve Qwen/Qwen3-235B-A22B-FP8 --model-impl transformers --data-parallel-size 8 --enable-expert-parallel
Was das bedeutet
Für Modell-Autoren: Neue Architekturen können direkt in Transformers implementiert werden und profitieren automatisch von vLLMs optimierter Inferenz - ohne zusätzlichen Portierungsaufwand.
Für Nutzer: Alle 450+ Transformers-Architekturen sind nun mit voller Performance in vLLM nutzbar.
Die einzigen aktuellen Einschränkungen: Linear-Attention-Modelle werden noch nicht unterstützt, und Custom-Models aus Hub-Repos müssen konform geschrieben sein.
Blog: https://huggingface.co/blog/native-speed-vllm-transformers-backend