Models

DeepSeek V4 Flash Vision - Experimentelles Vision-Modell mit multimodalen Faehigkeiten

deepseek vision multimodal llm models

DeepSeek hat mit deepseek-v4-flash-vision-exp ein experimentelles Vision-Modell veroeffentlicht. Das Modell akzeptiert Bilder neben Text und kann Bilder beschreiben, Text aus Screenshots lesen, Charts analysieren und mehr. Unterstuetzte Formate: JPEG, PNG, GIF und WebP. Das Format wird aus dem Dateiinhalt erkannt, nicht aus dem Dateinamen.

Drei Eingabemethoden

  1. Base64-kodiert (Inline): Bild wird als data-URL direkt im Request eingebettet. Limit: 48 MiB Request-Body
  2. Externe Bild-URL: Oeffentlich verfuegbare http(s)-Links, die das Modell selbst laedt. Max 8192 Zeichen URL, 32 MiB Bildgroesse, 60 Sekunden Download-Timeout
  3. Files API: Bild einmal hochladen, dann ueber file_id referenzieren. Optimal fuer wiederverwendete Bilder. Limit: 64 MiB, kein 32 MiB-Check

OpenAI-kompatibel

Alle Methoden nutzen das Standard OpenAI Chat Completions Format, bei dem content ein Array von Bloecken statt eines Strings ist. Die Responses API wird ebenfalls unterstuetzt, wo Bilder als input_image Content Parts uebergeben werden. Das bedeutet: bestehender OpenAI-Code funktioniert mit minimalem Aufwand – einfach base_url auf https://api.deepseek.com setzen und den Modellnamen anpassen.

Das Modell ist als “exp” (experimental) markiert, was auf eine fruehe Phase hinweist. DeepSeek positioniert sich damit im wachsenden Markt fuer multimodale APIs, die Vision-Faehigkeiten ueber OpenAI-kompatible Endpunkte anbieten.

Link: api-docs.deepseek.com/guides/vision