DeepSeek APIの価格が8月16日に変更されます—実際のコストはこちら
DeepSeek V4 ProとFlashのコストを8月16日のピーク時およびオフピーク時の料金スケジュールに基づいて計算し、実用的な予算例を示します。

DeepSeekは、APIの予算管理をより複雑にしつつ、より制御しやすくしようとしています。2026年8月16日16:00 UTCに、同社は現在の一律のV4料金をピーク時とオフピーク時の価格に置き換える予定です。オフピーク時の利用料金はピーク時の半額となり、柔軟なワークロードを混雑時間帯から移動させる直接的なインセンティブを生み出します。
この変更は、DeepSeek-V4-Flashと新たにGAとなったDeepSeek-V4-Proの両方に影響します。また、経済性が十分に変わるため、以前のコスト比較は誤解を招くものになります。本記事では、公式の100万トークンあたりの表を現実的なワークロードに変換し、最も一般的な予算編成のミスを回避する方法を説明します。
まず、タイミングについて
本記事の確認日(8月14日)時点では、新しいスケジュールは発表されているものの、まだ有効になっていません。DeepSeekによると、8月16日16:00 UTCから開始される予定です。指定されたピーク時間帯は01:00~04:00 UTCと06:00~10:00 UTCです。それ以外の時間帯はオフピークとなります。
料金はリアルタイムの運用情報であるため、アカウントへの入金や計算機の公開前に、公式料金ページをご確認ください。以下の料金は、2026年8月14日時点の同ページを反映したものです。
予定価格表
料金は100万トークンあたりです。
| モデルと期間 | キャッシュされた入力 | キャッシュされていない入力 | 出力 | |---|---:|---:|---:| | V4 フラッシュオフピーク | $0.007 | $0.22 | $0.66 | | V4 Flash ピーク | $0.014 | $0.44 | $1.32 | | V4 Pro オフピーク | $0.022 | $0.66 | $1.98 | | V4 Pro ピーク | $0.044 | $1.32 | $3.96 |
3つのパターンがすぐにわかる。出力は高コストなカテゴリである。キャッシュミスはキャッシュヒットよりもはるかにコストがかかる。Proは対応するFlashレートの約3倍である。これらの比率は単一の見出し価格よりも有用である。なぜなら、実際のアプリケーションでは入出力の混合比率が異なるからである。
典型的なリクエストのコスト
8,000 個のキャッシュされていない入力トークンを読み取り、1,000 個の出力トークンを生成するサポートアシスタントを考えます。オフピーク時のFlash料金では、モデルコストはおおよそ次のようになります:
(8,000 / 1,000,000 × $0.22) + (1,000 / 1,000,000 × $0.66) = $0.00242
Flashのピーク時価格では、約0.00484ドルに倍増します。Proでは、同じトークンミックスがオフピーク時で約0.00726ドル、ピーク時で0.01452ドルかかります。
これらの数字は小さく見えますが、ボリュームが状況を変えます。月に100万件のそのようなリクエストがある場合、オフピークのFlashとピーク時のProのモデルのみの差はおよそ12,100ドルです。ツール呼び出し、検索API、ストレージ、可観測性、再試行、および人間によるレビューがさらに追加されるでしょう。
ここで、1タスクあたり120,000の未キャッシュ入力トークンを消費し、20,000の出力トークンを生成するコーディングエージェントを考えます。Flashのコストはオフピーク時で約$0.0396、ピーク時で$0.0792です。Proのコストはオフピーク時で約$0.1188、ピーク時で$0.2376です。Proモデルが失敗試行を大幅に減らすなら、それでも経済的であり得ます。判断には成功率が必要です。
## キャッシュヒットが結果を変える可能性がある
キャッシュされた入力とキャッシュされていない入力の差は非常に大きいです。V4 Proのオフピーク時では、キャッシュされていない100万入力トークンは0.66ドルかかるのに対し、キャッシュされた入力は0.022ドルです。このため、プロンプトの設計は経済的な関心事となります。
安定した再利用可能な素材を、プロバイダーのキャッシュ機構が認識できる場所に配置してください。大きな静的プレフィックス内で、空白、順序、タイムスタンプ、または無関係なメタデータを変更しないようにしてください。耐久性のある指示や参照ドキュメントを、リクエストごとのユーザーコンテンツから分離してください。そして、設計が機能していると仮定するのではなく、実際のキャッシュヒット使用率を測定してください。
キャッシュは、すべてを送信することを正当化するために使用すべきではありません。小さくて関連性の高いプロンプトは、キャッシュされた大量のノイズよりも信頼性が高いことがよくあります。まず関連性を最適化し、次にキャッシュ可能性を最適化してください。
## オフピーク料金の使い方
多くのAIタスクは真のリアルタイムではありません。夜間のレポート生成、リポジトリのインデックス作成、埋め込みの更新、文書分類、合成データの作成、評価実行、優先度の低いコンテンツの下書きは待つことができます。
3つのサービスクラスでキューを構築します。
1. **インタラクティブ:** すぐに実行し、現在のレートを受け入れます。
2. **柔軟性:** 次のオフピーク時間帯のスケジュールを設定します。
3. **バッチ:** オフピーク時間に制御されたチャンクで処理します。
UTC の時間帯は慎重に変換してください。サマータイムの変更により、ローカル時刻のマッピングがずれる可能性があります。スケジュールは UTC で保存し、オペレーターには変換後の時刻を表示してください。キューに入ったジョブが正確な境界で開始しないようにジッターを追加し、リトライの集中を避けるために同時実行数を制限してください。
## コスト予測を狂わせるミス
最初の間違いは、表示されているテキストだけを数えることです。トークナイザーは単語、コード、句読点、JSON、多言語コンテンツをそれぞれ異なる方法で分割します。APIが報告する使用量を使用してください。
2つ目は、エージェントループを無視することです。1つの「ユーザーリクエスト」が、数十回のモデル呼び出し、検索操作、テスト実行、修正を引き起こす可能性があります。チャットメッセージごとではなく、完了したジョブごとに予算を設定してください。
3つ目は、最大思考が無料の品質であると仮定することです。推論の努力を増やすと、レイテンシと消費量が増加する可能性があります。簡単な作業は低努力に、日常のエージェントタスクは高努力にルーティングし、評価が利益を示す場合にのみ最大を使用してください。
4つ目は、失敗を忘れることです。タイムアウト、無効なツール引数、コンテキストオーバーフロー、拒否された出力はすべてコストがかかります。リトライの理由を追跡し、繰り返しの支払いをする代わりにシステム的なエラーを修正しましょう。
5つ目は、将来の価格を現在の価格として公開することです。指定された有効化時間までは、旧料金が適用されます。有効化後は、公式ページが真実の情報源となります。
## より良いモデル予算
以下の列を含むワークシートを作成してください:
- ワークロード名;
- 月間リクエスト数;
- 平均キャッシュ入力;
- 平均未キャッシュ入力;
- 平均出力;
- 予想されるピーク/オフピークの分割。
- リトライ乗数;
- Flash もしくは Pro;
- ツールと検索コスト;
- 人間によるレビュー議事録;
- 正常完了率。
低・標準・高の3つのシナリオを計算します。高シナリオにはキャッシュミススパイクと追加のエージェントループを含める必要があります。トークン数ではなく、タスク成功あたりのドルに基づいてアラートを設定してください。
もしあなたの組織が、AIをコンテンツやクリエイティブパイプラインのどこに位置づけるべきかをまだ模索しているなら、[Elser AI](https://www.elser.ai/)を通じて実験することで、API規模のアーキテクチャに取り組む前に、有用なワークフローを定義するのに役立ちます。明確なプロセスがあれば、チームがユーザーの必要としないタスクのためにトークン価格を最適化することを防げます。
## よくある質問
### DeepSeekの新しい料金体系はいつから始まりますか?
DeepSeekは2026年8月16日16:00 UTCと述べています。スケジュールが変更される可能性があるため、ライブページで確認してください。
### ピーク時間帯はいつですか?
発表されたピークウィンドウは、UTC 01:00~04:00 と 06:00~10:00 です。それ以外の時間帯はオフピークと指定されています。
### V4 ProはFlashの3倍の費用がかかりますか?
予定レートは、各トークンカテゴリにおいてFlashの約3倍です。成功したタスクあたりの総コストは、品質、再試行、および人的修正も重要であるため、異なる場合があります。
### 最も簡単なお金を節約する方法は何ですか?
検証済みの単純作業にはFlashを使用し、オフピーク時に柔軟なジョブをスケジュールし、不要な出力を削減し、キャッシュヒット率を向上させ、エージェントの失敗ループの繰り返しを停止します。
## 情報源と検証
この記事は、DeepSeekの公式API変更ログ、モデルおよび価格設定のドキュメント、V4リリース資料を一次情報源として使用しています。製品ラベルは意図的に保持されています。V4 Pro 0813はGAであり、V4 Flash 0731は検証日時点でパブリックベータと記載されています。ベンチマーク数値はベンダー報告として特定され、独立したElser AIの結果として提示されていません。予定価格は、発表された有効化時間まで将来のものとしてラベル付けされています。本番環境での意思決定や購入を検討している読者は、モデルのエイリアス、価格、レート制限、ベータステータス、機能の動作が公開後に変更される可能性があるため、ライブドキュメントを再確認する必要があります。代表的なタスクに対する独立した評価も引き続き必要です。
## 結論
DeepSeekのピーク/オフピークシステムは、タイミングを最優先のコスト変数に変えます。最大の節約は、スケジューリング、キャッシング、モデルルーティング、出力制御、障害削減を組み合わせることで実現します。価格表をコピーするだけでは不十分です。実際のトークンミックスをモデル化し、ビジネス成果の成功にかかるコストを測定してください。









































































