DeepSeek V4.1 Flash Preise: Stoßzeit/Nebenzeit, Cache-Treffer-Preis, so setzt sich die Rechnung zusammen
Stoßzeit, Cache-Treffer und so setzt sich die Rechnung zusammen
DeepSeek berechnet V4.1 Flash pro 1 Mio. Tokens, wobei die Nebenzeit genau die Hälfte der Stoßzeit kostet; 1M Kontext und 384K maximale Ausgabe. Alle sechs Preise und die Stoßzeiten, umgerechnet in Ihre lokale Zeitzone, finden Sie unten.
Aktualisiert 2026-09-20
Preise ändern sich: Bei QCode zahlen Sie für Claude, GPT und chinesische Modelle pro Token — aktuelle Preise unter /models.
- Bezahlung pro Token — aktuelle Preise unter /models
- Zahlung per Karte (Visa / Mastercard / AMEX), Apple Pay, Google Pay oder Krypto
- Selbstbedienung: aufladen und sofort aktivieren
Sechs Preise und zwei Limits
Input (Cache-Miss)
$0.15 in der Nebenzeit, $0.3 in der Stoßzeit, pro 1 Mio. Tokens.
Output
$0.6 in der Nebenzeit, $1.2 in der Stoßzeit, pro 1 Mio. Tokens.
Input (Cache-Treffer)
Input mit Cache-Treffer sinkt auf $0.003 in der Nebenzeit / $0.006 in der Stoßzeit.
Parallelität
Flash 2500; V4 Pro liegt auf derselben Seite bei 500.
Worum es geht
Die offizielle Preisliste nennt Preise pro 1 Mio. Tokens und unterscheidet beim Input zwischen Cache-Treffer und Cache-Miss, dann zwischen Nebenzeit und Stoßzeit. Die Nebenzeit kostet die Hälfte der Stoßzeit; die Stoßzeiten sind 01:00-04:00 und 06:00-10:00 UTC, Montag bis Freitag, alle übrigen Zeiten sind Nebenzeit.
Was passiert ist
Die neuen Preise gelten seit 04:00 UTC am 2026-09-10, dem Start von V4.1 Flash; der Changelog-Eintrag vom 2026-09-10 bestätigte, dass V4 Pro mit unveränderter Abrechnung weiterläuft.
Zeitachse
2026-08-13 DeepSeek-V4-Pro-0813 wurde GA – die V4-Pro-Spalte der heutigen Preisliste.
2026-09-10 04:00 UTC V4.1 Flash geht mit den neuen Preisen live (ab $0.15 / $0.6).
Der Changelog-Eintrag vom 2026-09-10 bestätigt, dass V4 Pro weiterläuft und die Abrechnung unverändert bleibt.
Bestätigt vs. Vorsicht
Offiziell bestätigt
Die Preisseite nennt als aktuelle Versionen DeepSeek-V4.1-Flash und DeepSeek-V4-Pro-0813 (GA 2026-08-13) und gibt an, dass die Nebenzeit die Hälfte der Stoßzeit kostet, mit Stoßzeiten von 01:00-04:00 und 06:00-10:00 UTC an Werktagen.
⚠️ Vorsicht
Ein Enddatum ist nicht veröffentlicht; die Fußnote besagt, dass sich Preise ändern können und die Seite maßgeblich ist. Diese drei Preise gelten seit 2026-09-10 04:00 UTC – legen Sie sie nicht in einem langfristigen Kundenangebot fest.
Gleich vs. anders
Gleich
Beide werden pro 1 Mio. Tokens abgerechnet, mit drei Preisen (Input mit Cache-Treffer, Input mit Cache-Miss, Output), beide unterscheiden Stoßzeit/Nebenzeit, die Nebenzeit kostet die Hälfte der Stoßzeit.
Anders
Input mit Cache-Miss $0.66 gegenüber $0.15 bei Flash; Output $1.98 gegenüber $0.6; Parallelität 500 gegenüber 2500; V4 Pro hat keine Bildverarbeitung.
Was zu tun ist
Wenden Sie die drei Preise auf Ihren eigenen Input-/Output-Mix an und entscheiden Sie dann, ob Sie langen Kontext als cachefähiges Präfix aufbauen. Wiederholte identische Prompts senken die Input-Kosten um eine Größenordnung.
Bei QCode
Setzen Sie bei QCode deepseek-v4.1-flash; abgerechnet wird zum offiziellen Preis × Servicegebühr, mit denselben Stoßzeit- und Cache-Regeln. Zum Vergleich wechseln Sie mit demselben Key zu deepseek-v4-pro ($0.66 / $1.98).
FAQ
Wie lauten die sechs Preise?
Input mit Cache-Miss $0.15 in der Nebenzeit / $0.3 in der Stoßzeit; Output $0.6 / $1.2; Input mit Cache-Treffer $0.003 / $0.006 – jeweils pro 1 Mio. Tokens.
Wann ist Stoßzeit?
Die Stoßzeit ist 01:00-04:00 und 06:00-10:00 UTC, Montag bis Freitag; alle anderen Zeiten sind Nebenzeit, Wochenenden eingeschlossen. Das entspricht 09:00-12:00 und 14:00-18:00 in Peking, 10:00-13:00 und 15:00-19:00 in Tokio, 04:00-07:00 und 09:00-13:00 in Moskau.
Wie viel günstiger als V4 Pro?
Input mit Cache-Miss $0.15 gegenüber $0.66, Output $0.6 gegenüber $1.98, Input mit Cache-Treffer $0.003 gegenüber $0.022. Flash erlaubt 2500 gleichzeitige Anfragen gegenüber 500, und V4 Pro hat keine Bildverarbeitung.
Wann lohnt sich ein Cache-Treffer?
Ein Treffer senkt den Input von $0.15 auf $0.003 – also auf 1/50. Setzen Sie den unveränderlichen System-Prompt und lange Dokumente an den Anfang und variieren Sie nur das Ende.
Kostet der Thinking-Modus mehr?
Thinking erzeugt zusätzliche Thinking-Tokens, die als Output abgerechnet werden. Bei demselben Output-Preis von $1.2/M in der Stoßzeit bedeutet eine längere Gedankenkette eine höhere Rechnung – legen Sie zuerst eine Baseline ohne Thinking fest.
Bleibt dieser Preis bestehen?
Die Fußnote behält sich Anpassungen vor und verweist auf die offizielle Seite; deshalb trägt diese Seite das Erfassungsdatum 2026-09-18. Prüfen Sie vor einer langfristigen Angebotserstellung erneut.
Quellen
Offizielle DeepSeek-Seiten Models & Pricing, Changelog und news260910, erfasst am 2026-09-18. Alle Preise pro 1 Mio. Tokens.
Ihre eigene Rechnung zum offiziellen Preis × Gebühr berechnen
Ein QCode-Key: deepseek-v4.1-flash setzen, zum Vergleich zu deepseek-v4-pro wechseln.
Weiterführend
Auto Mode in Claude Code
Interaktive Sitzungen starten standardmäßig im auto mode (Doku: ab 2.1.283, Changelog: ab 2.1.284): die sechs Berechtigungsmodi, wie Sie ihn abschalten und was Teams und CI beachten sollten.
V4.1 Flash vs. V4 Pro
Welche Stufe Sie wählen sollten.
1M-Kontext in Claude Code hinter eigener Base URL
Ab 2.1.285 bekommt eine eigene Base URL automatisch 1M; endet Ihr Gateway bei 200K, hilft /autocompact 200k, dazu Hinweis-Header und 529-Backoff.
Diese Seite gibt nur die offizielle Preistabelle und die Zeitfenster wieder – keine Benchmarks von Drittanbietern, keine Spekulationen. DeepSeek behält sich Preisanpassungen vor.