DeepSeek API Preise ändern sich am 16. August – Hier sind die tatsächlichen Kosten
Berechnen Sie die Kosten für DeepSeek V4 Pro und Flash unter dem Spitzen- und Nebenzeiten-Preisplan vom 16. August mit praktischen Budgetierungsbeispielen.

DeepSeek steht kurz davor, die API-Budgetierung komplizierter – und möglicherweise kontrollierbarer – zu machen. Am 16. August 2026 um 16:00 Uhr UTC plant das Unternehmen, seine aktuellen pauschalen V4-Tarife durch Spitzen- und Nebenzeitenpreise zu ersetzen. Die Nutzung außerhalb der Spitzenzeiten kostet die Hälfte des Spitzentarifs, was einen direkten Anreiz schafft, flexible Arbeitslasten von den Stoßzeiten wegzuverlagern.
Die Änderung betrifft sowohl DeepSeek-V4-Flash als auch das neu allgemein verfügbare DeepSeek-V4-Pro. Sie verändert die Kostenstruktur so stark, dass alte Kostenvergleiche irreführend werden. Dieser Artikel übersetzt die offizielle Tabelle pro Million Token in realistische Arbeitslasten und erklärt, wie man die häufigsten Budgetierungsfehler vermeidet.
Zuerst das Timing
Zum Prüfdatum dieses Artikels—14. August—ist der neue Zeitplan angekündigt, aber noch nicht aktiv. DeepSeek gibt an, dass er um 16:00 UTC am 16. August beginnt. Die ausgewiesenen Spitzenfenster sind 01:00–04:00 UTC und 06:00–10:00 UTC. Alle anderen Stunden sind neben der Spitzenzeit.
Da die Preisgestaltung live operative Informationen sind, bestätigen Sie die offizielle Preisseite, bevor Sie ein Konto aufladen oder einen Rechner veröffentlichen. Die unten stehenden Tarife spiegeln diese Seite vom 14. August 2026 wider.
Die geplante Preistabelle
Preise gelten pro einer Million Tokens.
| Modell und Zeitraum | Zwischengespeicherte Eingabe | Nicht zwischengespeicherte Eingabe | Ausgabe | |---|---:|---:|---:| | V4 Flash außerhalb der Spitzenzeiten | $0,007 | $0,22 | $0,66 | | V4 Flash peak | 0,014 $ | 0,44 $ | 1,32 $ | | V4 Pro außerhalb der Spitzenzeiten | $0,022 | $0,66 | $1,98 | | V4 Pro Spitze | 0,044 $ | 1,32 $ | 3,96 $ |
Drei Muster sind sofort erkennbar. Ausgabe ist die teure Kategorie. Ein Cache-Fehler kostet weit mehr als ein Cache-Treffer. Pro kostet etwa das Dreifache des entsprechenden Flash-Preises. Diese Verhältnisse sind nützlicher als ein einzelner Schlagzeilenpreis, da reale Anwendungen unterschiedliche Eingabe-/Ausgabe-Mischungen aufweisen.
Was eine typische Anfrage kostet
Stellen Sie sich einen Support-Assistenten vor, der 8.000 ungecachte Eingabe-Tokens liest und 1.000 Ausgabe-Tokens produziert. Bei den Flash-Preisen außerhalb der Spitzenzeiten betragen die Modellkosten ungefähr:
(8.000 / 1.000.000 × 0,22 $) + (1.000 / 1.000.000 × 0,66 $) = 0,00242 $
Bei Spitzenpreisen für Flash verdoppelt sich der Preis auf etwa 0,00484 $. Mit Pro kostet der gleiche Token-Mix außerhalb der Spitzenzeiten etwa 0,00726 $ und zu Spitzenzeiten 0,01452 $.
Diese Zahlen wirken winzig, aber das Volumen verändert das Bild. Bei einer Million solcher Anfragen pro Monat beträgt der modellbezogene Unterschied zwischen Flash außerhalb der Spitzenzeiten und Pro während der Spitzenzeiten grob 12.100 $. Tool-Aufrufe, Such-APIs, Speicher, Beobachtbarkeit, Wiederholungen und menschliche Überprüfung würden weitere Kosten hinzufügen.
Betrachten Sie nun einen Codierungsagenten, der 120.000 ungecachte Eingabe-Token verbraucht und 20.000 Ausgabe-Token pro Aufgabe ausgibt. Flash kostet etwa 0,0396 $ außerhalb der Spitzenzeiten oder 0,0792 $ zu Spitzenzeiten. Pro kostet etwa 0,1188 $ außerhalb der Spitzenzeiten oder 0,2376 $ zu Spitzenzeiten. Wenn das Pro-Modell fehlgeschlagene Versuche wesentlich reduziert, kann es dennoch wirtschaftlich sein. Sie benötigen die Erfolgsrate, um zu entscheiden.
## Cache-Treffer können das Ergebnis verändern
Die Lücke zwischen gecachtem und ungecachtem Input ist enorm. Für V4 Pro außerhalb der Spitzenzeiten kosten eine Million ungecachte Input-Tokens 0,66 $, während gecachter Input 0,022 $ kostet. Das macht die Prompt-Architektur zu einer wirtschaftlichen Frage.
Platziere stabiles, wiederverwendbares Material dort, wo der Cache-Mechanismus des Anbieters es erkennen kann. Vermeide es, Leerzeichen, Reihenfolge, Zeitstempel oder irrelevante Metadaten in einem großen statischen Präfix zu ändern. Trenne dauerhafte Anweisungen und Referenzdokumente von anfragebezogenen Benutzerinhalten. Miss dann die tatsächliche Cache-Treffer-Nutzung, anstatt anzunehmen, dass das Design funktioniert.
Caching sollte nicht genutzt werden, um das Senden von allem zu rechtfertigen. Ein kleinerer, relevanter Prompt ist oft zuverlässiger als ein gecachter Berg von Rauschen. Optimieren Sie zuerst die Relevanz, dann die Cache-Fähigkeit.
## So nutzen Sie die Nebenzeiten-Preisgestaltung
Viele KI-Aufgaben sind nicht wirklich in Echtzeit. Nächtliche Berichtserstellung, Repository-Indizierung, Embedding-Aktualisierungen, Dokumentenklassifizierung, Erstellung synthetischer Daten, Evaluierungsläufe und Entwürfe mit niedriger Priorität können warten.
Erstellen Sie eine Warteschlange mit drei Serviceklassen:
1. **Interaktiv:** sofort ausführen und den aktuellen Kurs akzeptieren.
2. **Flexibel:** Planen Sie für das nächste Nebenzeitenfenster.
3. **Batch:** Verarbeitung in kontrollierten Blöcken während verkehrsarmer Zeiten.
Übersetzen Sie UTC-Fenster sorgfältig. Sommerzeitumstellungen können lokale Uhrzuordnungen verschieben. Speichern Sie Zeitpläne in UTC und zeigen Sie die Umrechnung den Bedienern an. Fügen Sie Jitter hinzu, damit nicht jeder in der Warteschlange befindliche Auftrag exakt an der Grenze startet, und begrenzen Sie die Parallelität, um einen Wiederholungssturm zu vermeiden.
## Die Fehler, die Kostenprognosen zunichtemachen
Der erste Fehler ist das Zählen nur des sichtbaren Texts. Tokenizer teilen Wörter, Code, Satzzeichen, JSON und mehrsprachige Inhalte unterschiedlich auf. Verwende die von der API gemeldete Nutzung.
Der zweite Punkt ist das Ignorieren von Agenten-Schleifen. Eine einzige "Benutzeranfrage" kann Dutzende von Modellaufrufen, Suchvorgängen, Testläufen und Reparaturen auslösen. Budget pro abgeschlossenem Auftrag, nicht pro Chat-Nachricht.
Der dritte ist die Annahme, dass maximales Denken kostenlose Qualität bedeutet. Höherer Denkaufwand kann Latenz und Verbrauch erhöhen. Leiten Sie einfache Arbeiten an geringen Aufwand, tägliche Agentenaufgaben an hohen Aufwand weiter und verwenden Sie Max nur, wenn Auswertungen einen Vorteil zeigen.
Der vierte ist das Vergessen von Fehlern. Timeouts, ungültige Tool-Argumente, Kontextüberlauf und abgelehnte Ausgaben kosten alle Geld. Verfolge die Gründe für Wiederholungen und behebe systemische Fehler, anstatt für Wiederholungen zu bezahlen.
Der fünfte Punkt ist die Veröffentlichung zukünftiger Preise als aktuelle Preise. Bis zum angegebenen Aktivierungszeitpunkt bleiben die alten Tarife gültig. Nach der Aktivierung ist die offizielle Seite die maßgebliche Quelle.
## Ein besseres Modellbudget
Erstellen Sie ein Arbeitsblatt mit diesen Spalten:
- Name der Arbeitslast;
- Anfragen pro Monat;
- durchschnittlicher zwischengespeicherter Input;
- durchschnittliche ungecachte Eingabe;
- durchschnittliche Ausgabe;
- erwartete Spitzen-/Nebenzeitenaufteilung;
- Multiplikator für Wiederholungen;
- Flash oder Pro;
- Werkzeug- und Suchkosten;
- menschliche Prüfungsprotokolle;
- Erfolgsabschlussrate.
Berechnen Sie ein niedriges, erwartetes und hohes Szenario. Das hohe Szenario sollte einen Cache-Miss-Spike und zusätzliche Agenten-Schleifen umfassen. Legen Sie Warnungen auf Dollar pro erfolgreicher Aufgabe fest, nicht nur auf Tokens pro Anfrage.
Falls Ihre Organisation noch dabei ist, herauszufinden, wo KI in ihre Content- oder Creative-Pipeline passt, kann das Experimentieren mit [Elser AI](https://www.elser.ai/) helfen, den nützlichen Workflow zu definieren, bevor Sie sich für eine API-Skalierungsarchitektur entscheiden. Ein klarer Prozess verhindert, dass Teams Token-Preise für eine Aufgabe optimieren, die die Nutzer nicht benötigten.
## FAQ
### Wann beginnen die neuen Preise von DeepSeek?
DeepSeek sagt 16:00 UTC am 16. August 2026. Überprüfen Sie die Live-Seite, falls sich der Zeitplan ändert.
### Wann sind die Hauptverkehrszeiten?
Die angekündigten Spitzenzeiten sind 01:00–04:00 UTC und 06:00–10:00 UTC. Andere Stunden gelten als Nebenzeiten.
### Ist V4 Pro dreimal so teuer wie Flash?
Die geplanten Tarife liegen in jeder Token-Kategorie etwa beim Dreifachen von Flash. Die Gesamtkosten pro erfolgreicher Aufgabe können abweichen, da auch Qualität, Wiederholungen und menschliche Nachbesserungen eine Rolle spielen.
### Was ist der einfachste Weg, Geld zu sparen?
Nutze Flash für validierte einfache Arbeiten, plane flexible Jobs außerhalb der Spitzenzeiten, reduziere unnötige Ausgaben, verbessere Cache-Treffer und stoppe wiederholte fehlgeschlagene Agenten-Schleifen.
## Quellen und Überprüfung
Dieser Artikel verwendet das offizielle API-Änderungsprotokoll von DeepSeek, die Modell- und Preisgestaltungsdokumentation sowie das V4-Release-Material als Primärquellen. Produktbezeichnungen werden bewusst beibehalten: V4 Pro 0813 ist allgemein verfügbar, während V4 Flash 0731 zum Überprüfungsdatum als öffentliche Beta beschrieben wird. Benchmark-Zahlen werden als vom Anbieter angegeben identifiziert und nicht als unabhängige Elser-AI-Ergebnisse dargestellt. Die geplante Preisgestaltung wird bis zum angekündigten Aktivierungszeitpunkt als zukünftig bezeichnet. Leser, die Produktions- oder Kaufentscheidungen treffen, sollten die Live-Dokumentation erneut überprüfen, da sich Modell-Aliase, Preise, Ratenbegrenzungen, Beta-Status und Funktionsverhalten nach der Veröffentlichung ändern können. Eine unabhängige Bewertung anhand repräsentativer Aufgaben bleibt notwendig.
## Fazit
DeepSeek's Peak-/Off-Peak-System macht die Zeitsteuerung zu einer erstklassigen Kostenvariable. Die größten Einsparungen erzielen Sie durch die Kombination von Planung, Caching, Modell-Routing, Ausgabesteuerung und Fehlerreduzierung. Das bloße Kopieren der Preistabelle reicht nicht aus. Modellieren Sie Ihren tatsächlichen Token-Mix und messen Sie die Kosten eines erfolgreichen Geschäftsergebnisses.









































































