Article

vLLM Transformers Backend erreicht Native-Speed

vLLM Transformers HuggingFace Inference

HuggingFace hat einen wichtigen Meilenstein erreicht: Der Transformers-Modeling-Backend für vLLM ist nun so schnell (oder schneller) als handgeschriebene native vLLM-Implementierungen für viele LLM-Architekturen.

Was ist neu?

Bisher war der Transformers-Backend in vLLM langsamer als die nativen Implementierungen. Mit den neuen Optimierungen erreicht er nun Native-Speed - und übertrifft teilweise sogar die handoptimierten Versionen.

Die Benchmarks zeigen beeindruckende Ergebnisse:

  • Qwen3-4B (Single GPU): Transformers-Backend matches native
  • Qwen3-32B (Tensor Parallel): Transformers-Backend matches native
  • Qwen3-235B-A22B-FP8 MoE (8×H100): Transformers-Backend matches native

Einfache Nutzung

Ein einzelnes Flag aktiviert den Transformers-Backend:

# Dense Model, Single GPU
vllm serve Qwen/Qwen3-4B --model-impl transformers

# Tensor Parallel
vllm serve Qwen/Qwen3-32B --model-impl transformers --tensor-parallel-size 2

# MoE mit Expert Parallel
vllm serve Qwen/Qwen3-235B-A22B-FP8 --model-impl transformers --data-parallel-size 8 --enable-expert-parallel

Was das bedeutet

Für Modell-Autoren: Neue Architekturen können direkt in Transformers implementiert werden und profitieren automatisch von vLLMs optimierter Inferenz - ohne zusätzlichen Portierungsaufwand.

Für Nutzer: Alle 450+ Transformers-Architekturen sind nun mit voller Performance in vLLM nutzbar.

Die einzigen aktuellen Einschränkungen: Linear-Attention-Modelle werden noch nicht unterstützt, und Custom-Models aus Hub-Repos müssen konform geschrieben sein.

Blog: https://huggingface.co/blog/native-speed-vllm-transformers-backend