Article
vLLM Server auf Hugging Face Jobs mit einem Befehl starten
Hugging Face hat eine elegante Lösung für LLM-Serving ohne Infrastruktur-Frickelei veröffentlicht: vLLM auf HF Jobs mit einem einzigen Befehl.
Der Setup:
huggingface-cli job create \
--image vllm/vllm-openai:latest \
--gpu A10G-small \
--port 8000 \
--expose
Das wars. Kein Kubernetes, keine Server-Provisionierung, pay-per-second.
So funktioniert’s:
- Der Befehl startet einen Container mit dem offiziellen vLLM-Image auf HF-Infrastruktur
--exposeroutet den Port durch HFs öffentlichen Jobs-Proxy- Die URL wird automatisch generiert:
https://<job_id>--8000.hf.jobs
Query von überall: vLLM spricht OpenAI API. Ein einfacher curl-Befehl mit HF-Token als Bearer-Token reicht:
curl https://<job_id>--8000.hf.jobs/v1/chat/completions \
-H "Authorization: Bearer $HF_TOKEN" \
-H "Content-Type: application/json" \
-d '{"model": "Qwen/Qwen3-4B", "messages": [{"role": "user", "content": "Hello!"}]}'
Python geht genauso über den OpenAI-Client mit base_url auf die generierte URL.
Wann HF Jobs vs. Inference Endpoints?
- HF Jobs: Ideal für Tests, Evals, Batch-Generation – schnell hochgefahren, transient
- Inference Endpoints: Managed, produktionsreif, persistent, mit SLAs
Die Logs zeigen Application startup complete, sobald das Modell geladen ist. Danach ist der Endpunkt live und bereit für Anfragen.