Article

vLLM Server auf Hugging Face Jobs mit einem Befehl starten

vLLM HuggingFace LLM-Serving Tutorial Inference

Hugging Face hat eine elegante Lösung für LLM-Serving ohne Infrastruktur-Frickelei veröffentlicht: vLLM auf HF Jobs mit einem einzigen Befehl.

Der Setup:

huggingface-cli job create \
  --image vllm/vllm-openai:latest \
  --gpu A10G-small \
  --port 8000 \
  --expose

Das wars. Kein Kubernetes, keine Server-Provisionierung, pay-per-second.

So funktioniert’s:

  1. Der Befehl startet einen Container mit dem offiziellen vLLM-Image auf HF-Infrastruktur
  2. --expose routet den Port durch HFs öffentlichen Jobs-Proxy
  3. Die URL wird automatisch generiert: https://<job_id>--8000.hf.jobs

Query von überall: vLLM spricht OpenAI API. Ein einfacher curl-Befehl mit HF-Token als Bearer-Token reicht:

curl https://<job_id>--8000.hf.jobs/v1/chat/completions \
  -H "Authorization: Bearer $HF_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"model": "Qwen/Qwen3-4B", "messages": [{"role": "user", "content": "Hello!"}]}'

Python geht genauso über den OpenAI-Client mit base_url auf die generierte URL.

Wann HF Jobs vs. Inference Endpoints?

  • HF Jobs: Ideal für Tests, Evals, Batch-Generation – schnell hochgefahren, transient
  • Inference Endpoints: Managed, produktionsreif, persistent, mit SLAs

Die Logs zeigen Application startup complete, sobald das Modell geladen ist. Danach ist der Endpunkt live und bereit für Anfragen.