DeepSeek V4-Flash-Vision API nutzen: Bildeingabe-Anleitung

DeepSeeks günstigstes Modell kann jetzt sehen. Modell-ID, Flash-Preise mit 384-Token-Bildern, drei Eingabemethoden, Grenzwerte und ein durchgerechnetes Kostenbeispiel.

Ashley Innocent

Ashley Innocent

24 August 2026

DeepSeek V4-Flash-Vision API nutzen: Bildeingabe-Anleitung

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

DeepSeeks günstigstes Modell kann jetzt sehen. Am 21. August 2026 veröffentlichte DeepSeek deepseek-v4-flash-vision-exp, eine visionsfähige Version von V4-Flash, die Bilder über dieselbe Produktions-API zum gleichen Preis wie das reine Textmodell akzeptiert, wobei jedes Bild mit nicht mehr als 384 Eingabetokens abgerechnet wird. Die offizielle Versionshinweis stellt es klar dar: dieselbe Textfähigkeit wie V4-Flash, plus Bildverständnis, das laut DeepSeek die multimodale Agentenleistung nahe an Opus 4.8 heranführt.

Dieser Leitfaden behandelt, was das Modell ist, was „Exp“ im Namen für den Produktionseinsatz bedeutet, die drei Möglichkeiten, Bilder zu senden, die Limits, die Ihnen Schwierigkeiten bereiten werden, und wie man multimodale Anfragen richtig testet. Da Vision-Anfragen Inhaltstypen mischen und schnell groß werden, sind sie genau die Art von API-Aufruf, die es wert ist, in Apidog erstellt zu werden, anstatt JSON manuell in einem Terminal zu bearbeiten.

Schaltfläche

Was deepseek-v4-flash-vision-exp ist

Das Modell ist V4-Flash-0731 mit einem angehängten Bild-Encoder. Laut DeepSeek entspricht es dem Basismodell bei Textaufgaben, einschließlich Agenten-Workloads, Argumentation und Weltwissen, sodass Sie es einsetzen können, ohne die Fähigkeiten von V4-Flash zu verlieren. Das OpenRouter-Angebot beschreibt es als ein spärliches Mixture-of-Experts-Modell mit 13 Milliarden aktiven Parametern von insgesamt 284 Milliarden.

Der wichtige Kontext: V4-Flash ist DeepSeeks Budget-Linie. Wir haben das Textmodell bei seiner Einführung in unserem DeepSeek V4-Flash API-Leitfaden behandelt, und die wirtschaftlichen Bedingungen haben sich nicht geändert. Vision zu Flash-Preisen unterbietet fast jede multimodale API auf dem Markt, weshalb die Behauptung „nahe an Opus 4.8 bei multimodalen Agenten-Benchmarks“, DeepSeeks eigene Formulierung, Aufmerksamkeit erregte. Behandeln Sie Anbieter-Benchmark-Behauptungen als Behauptungen; führen Sie Ihre eigenen Bewertungen an Ihren eigenen Dokumenten durch, bevor Sie etwas migrieren.

Trotz des experimentellen Labels ist dies kein Sandbox-Spielzeug. Das Modell läuft auf Produktions-API-Endpunkten mit denselben Ratenbegrenzungen und SLAs wie die anderen V4-Modelle, und es gibt keine Warteliste oder spezielle Zugriffsanfrage.

Preise: Flash-Tarife, Bilder inklusive

Die Preisliste ist identisch mit dem reinen Textmodell deepseek-v4-flash, gemäß DeepSeeks Preisübersicht:

Nebenzeiten Spitzenzeiten
Eingabe, Cache-Hit (pro 1 Mio. Tokens) $0.007 $0.014
Eingabe, Cache-Miss (pro 1 Mio. Tokens) $0.22 $0.44
Ausgabe (pro 1 Mio. Tokens) $0.66 $1.32

Bilder werden für die Abrechnung mit bis zu 384 Tokens pro Bild tokenisiert und zum Eingabetarif berechnet. Bei Spitzenzeiten-Cache-Miss-Preisen kostet ein Bild mit vollem Preis etwa 0,00017 US-Dollar. Tausend Bilder kosten weniger als ein Kaffee.

Zwei Abrechnungsverhaltensweisen werden vom Textmodell übernommen. Nebenzeittarife sind halb so hoch wie Spitzenzeittarife, wobei die Spitzenzeiten an Wochentagen von 01:00 bis 04:00 Uhr und von 06:00 bis 10:00 Uhr UTC liegen, sodass Batch-Vision-Jobs, die außerhalb dieses Zeitfensters geplant sind, halb so viel kosten. Und Kontext-Caching gilt für wiederholte Eingaben, was wichtig ist, wenn Sie denselben System-Prompt bei verschiedenen Bildern erneut senden. Die Preisübersicht listet ein 1-Millionen-Token-Kontextfenster für die V4-Linie auf, wobei die Ausgabe in der Praxis weit darunter begrenzt ist.

Drei Möglichkeiten, ein Bild zu senden

Das Modell funktioniert über DeepSeeks Standard-Chat-Completions-Endpunkt unter https://api.deepseek.com/chat/completions (Messages-Stil- und Responses-Stil-Aufrufe werden ebenfalls unterstützt, wie die Einführung der V4-Flash Responses API zeigte). Bilder werden im content-Array einer Benutzernachricht übertragen, und Sie haben drei Lieferoptionen.

1. Base64 Inline. Kodieren Sie das Bild als Daten-URL. Einfach, eigenständig und auf 32 MiB pro Bild begrenzt:

import base64
from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")

with open("invoice.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extrahieren Sie die Posten und Summen als JSON."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
        ]
    }]
)
print(response.choices[0].message.content)

2. Externe URL. Übergeben Sie stattdessen einen öffentlich erreichbaren Link (bis zu 8.192 Zeichen), anstatt zu kodieren:

{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}

3. Files API Referenz. Einmal hochladen, per ID wiederverwenden. DeepSeeks Files API akzeptiert jetzt kostenlose Bild-Uploads, und eine file_id-Referenz überspringt das erneute Hochladen desselben Bildes bei mehreren Anfragen, mit einer höheren Obergrenze von 64 MiB pro Bild:

{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}

Verwenden Sie Base64 für einmalige Aufrufe, URLs, wenn Ihre Bilder bereits auf einem CDN liegen, und Datei-IDs für jeden Workflow, der dasselbe Bild mehr als einmal verwendet.

Der Detail-Parameter

Ein optionales detail-Feld für jedes Bild steuert die Vorverarbeitung:

Intern werden Bilder für die Token-Zählung auf etwa 800x800 normalisiert, wodurch die Obergrenze von 384 Tokens pro Bild eingehalten wird. Wenn Sie OCR-ähnliche Arbeiten an Belegen oder Dashboards durchführen, testen Sie "low" gegen "high" an Ihrem realen Korpus; der Kostenunterschied ist bei diesen Preisen gering, aber der Genauigkeitsunterschied kann groß sein.

Wichtige Limits vor der Produktion

Einschränkung Wert
Max. Bilder pro Anfrage 600
Inline (Base64) Bildgröße 32 MiB
Files API Bildgröße 64 MiB
Gesamter Anfragekörper 48 MiB
Bildabmessungen 8.192 px pro Seite (4.096 px, wenn eine Anfrage 15+ Bilder enthält)
Länge der externen URL 8.192 Zeichen
Bildplatzierung Nur user-Nachrichten

Die letzte Zeile ist ein echter 400-Fehler-Generator: Bilder in system- oder assistant-Nachrichten werden abgelehnt. Multi-Bild-Anfragen werden unterstützt und lassen sich frei mit Text verschachteln, was das Modell für Agenten-Schleifen nutzbar macht, die Screenshots erstellen, folgern und handeln. Wenn Sie diese Schleifen orchestrieren, hat DeepSeek am selben Tag native Unterstützung für dieses Modell in DeepSeek Harness 0.1.1 ausgeliefert; unsere DeepSeek Harness Übersicht behandelt diesen Stack. Beachten Sie auch, dass das Tool-Calling neben der Vision funktioniert, genau wie der Workflow des Textmodells, der in unserem Leitfaden zum Funktionsaufruf beschrieben ist.

Was „Exp“ für Sie bedeutet

Der Suffix ist eine ehrliche Kennzeichnung, keine Paywall. Erwarten Sie, dass das Modell kurzfristig überarbeitet oder ersetzt wird, so wie es bei experimentellen DeepSeek-Endpunkten schon früher der Fall war. Praktische Absicherungen:

Praxisbeispiel: Was eine Dokumenten-Pipeline kostet

Zahlen machen die Preisgestaltung konkret. Angenommen, Sie verarbeiten monatlich 50.000 gescannte Rechnungen, jeweils ein Bild, mit einem 200-Token-Anweisungs-Prompt und etwa 400 Tokens JSON-Ausgabe pro Aufruf:

Gesamt: etwa 35 bis 40 $ pro Monat zu Spitzenzeiten, und etwa die Hälfte davon, wenn der Batch außerhalb der Wochentagsfenster von 01:00 bis 10:00 Uhr UTC läuft. Die Ausgabe-Tokens dominieren, was die nützliche Lektion ist: Bei so günstigen Bildern optimieren Sie eine Vision-Pipeline, indem Sie das Antwortformat straffen, nicht indem Sie Bilder herunterskalieren. Das Prompting für kompaktes JSON anstelle von Prosa-Beschreibungen senkt die Kosten stärker als jede Bildvorverarbeitung.

Dieses Kostenprofil ist auch der Grund, warum das Modell die Berechnung für Agenten-Schleifen ändert. Ein Screenshot-Reason-Act-Zyklus, der bei Flaggschiff-Multimodal-Modellen zu teuer war, um kontinuierlich ausgeführt zu werden, wird mit 384 Tokens pro Frame realisierbar.

Testen multimodaler Anfragen in Apidog

Vision-Anfragen sind mühsam manuell zu iterieren: Base64-Blobs machen Roh-JSON unlesbar, und der Vergleich von detail-Einstellungen bedeutet, nahezu identische Payloads jonglieren zu müssen. Eine sauberere Schleife:

  1. Speichern Sie die Anfrage einmal in einem Apidog-Projekt, mit {{model_id}}, {{detail}} und dem Bild-Payload als Variablen. Das Austauschen von Testbildern oder Detailebenen wird zu einer Dropdown-Änderung.
  2. Skripten Sie die Kodierung. Ein Pre-Request-Skript liest das Bild und injiziert den Base64-String, sodass der sichtbare Anfragetext lesbar bleibt.
  3. Beurteilen Sie die Struktur, nicht das Gefühl. Wenn Sie eine JSON-Ausgabe (Posten, Begrenzungsbeschreibungen, Diagrammwerte) anfordern, fügen Sie Assertions hinzu, die die Antwort parsen und Felder überprüfen. Das verwandelt „das Modell scheint in Ordnung“ in ein Bestehen/Nichtbestehen, das Sie nach jeder Exp-Modell-Revision erneut ausführen können.
  4. Mocken Sie die Antwortform für Ihr Frontend, während der Prompt noch abgestimmt wird; Apidogs Smart Mock stellt das Schema bereit, ohne API-Aufrufe zu verbrauchen.

Laden Sie Apidog kostenlos herunter und die gesamte Einrichtung dauert Minuten; das erneute Ausführen, wenn DeepSeek das experimentelle Modell überarbeitet, ist ein Klick.

FAQ

Ist deepseek-v4-flash-vision-exp kostenlos? Nein, aber es kommt dem nahe. Es wird genau zu den Flash-Raten des Textmodells abgerechnet, wobei Bilder auf jeweils 384 Eingabetokens begrenzt sind. DeepSeeks Files API Bildspeicher ist kostenlos; Sie zahlen nur, wenn Bilder in eine Anfrage eingehen.

Ersetzt es deepseek-v4-flash? Nein. Das Textmodell bleibt die stabile ID. Die Vision-Build stimmt bei Textaufgaben damit überein, sodass Sie sich auf die Vision-ID konzentrieren können, wenn Sie experimentelle Änderungen akzeptieren, aber das konservative Muster ist, nur bildbezogenen Traffic dorthin zu leiten.

Kann ich es über das Anthropic-Stil-API-Format verwenden? Ja. DeepSeeks V4-Endpunkte akzeptieren Chat Completions, Messages-Format und Responses-Format-Aufrufe, sodass bestehende Clients in jedem der drei Stile Bildblöcke hinzufügen können, ohne die Anfragedialekte zu wechseln. Unser V4 Pro API Walkthrough zeigt die Endpunkt-Mechanismen, die in der Familie geteilt werden.

Wie verhält sich die Preisgestaltung im Vergleich zu GPT oder Claude Vision? Mit 0,22 $ bis 0,44 $ pro Million Eingabetokens mit 384-Token-Bildern liegt es eine Größenordnung unter den multimodalen Flaggschiff-Tarifen. Die offene Frage ist die Genauigkeit bei Ihrer Arbeitslast, wofür das oben genannte Bewertungsszenario dient.

Zusammenfassung

DeepSeek setzt weiterhin das gleiche Schema um: Nehmen Sie die Fähigkeit, für die jeder Premium-Preise verlangt, liefern Sie sie zu Flash-Preisen und kennzeichnen Sie sie ehrlich, während sie sich stabilisiert. deepseek-v4-flash-vision-exp bietet Ihnen Bildverständnis auf Produktions-Endpunkten für Bruchteile eines Cents pro Bild, mit drei Eingabepfaden und echten Limits, die Sie umgehen können. Erstellen Sie die Anfrage einmal in Apidog, fixieren Sie Ihre Assertions, und Sie sind bereit, das Exp-Modell heute zu nutzen und seinen Nachfolger am Tag seiner Veröffentlichung zu beurteilen.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen