DeepSeek API 定價將於 8 月 16 日調整——以下是實際費用
根據8月16日尖峰與離峰定價方案,計算DeepSeek V4 Pro與Flash的成本,並提供實用預算範例。

DeepSeek 即將讓 API 預算管理變得更複雜——同時也可能更具可控性。2026 年 8 月 16 日 UTC 時間 16:00,該公司計劃以尖峰與離峰價格取代現行的 V4 固定費率。離峰時段的使用費用將僅為尖峰費率的一半,這直接鼓勵將彈性工作負載移離繁忙時段。
此變更同時影響 DeepSeek-V4-Flash 與新正式上市的 DeepSeek-V4-Pro。這也足以改變經濟效益,使得舊的成本比較將變得誤導。本文將官方每百萬 Token 表格轉化為實際工作負載,並說明如何避免最常見的預算錯誤。
首先,時機
截至本文的驗證日期(8月14日),新時程表已公布但尚未生效。DeepSeek 表示將於 UTC 時間 8 月 16 日 16:00 開始實施。指定的尖峰時段為 UTC 時間 01:00–04:00 與 06:00–10:00,其餘所有時段均為離峰時段。
由於定價為即時營運資訊,請在為帳戶充值或發布計算工具前,確認官方定價頁面的內容。以下費率反映的是2026年8月14日該頁面的資訊。
預定價格表
價格以每百萬個代幣計算。
| 型號與期間 | 快取輸入 | 非快取輸入 | 輸出 | |---|---:|---:|---:| | V4 離峰閃電方案 | $0.007 | $0.22 | $0.66 | | V4 Flash 峰值 | $0.014 | $0.44 | $1.32 | | V4 Pro 離峰時段 | $0.022 | $0.66 | $1.98 | | V4 Pro 峰值 | $0.044 | $1.32 | $3.96 |
三個模式立即顯而易見。輸出是昂貴的類別。快取未命中比快取命中耗費更多成本。Pro 約為對應 Flash 速率的三倍。這些比率比單一標題價格更有用,因為實際應用程式有不同的輸入/輸出組合。
一般請求的費用
考慮一個支援助理,讀取8,000個未快取的輸入token並產生1,000個輸出token。在離峰時段的Flash定價下,模型成本約為:
(8,000 / 1,000,000 × $0.22) + (1,000 / 1,000,000 × $0.66) = $0.00242
在Flash定价高峰时,价格翻倍至约0.00484美元。使用Pro方案,相同的代币组合在非高峰期费用约为0.00726美元,高峰期则为0.01452美元。
這些數字看起來很小,但流量會改變情況。若每月有一百萬次這類請求,離峰時段的Flash與尖峰時段的Pro之間,僅模型部分的差異就約為12,100美元。工具呼叫、搜尋API、儲存、可觀測性、重試機制以及人工審查還會增加更多費用。
現在考慮一個編碼代理,每個任務消耗 120,000 個未快取的輸入 token 並產生 20,000 個輸出 token。Flash 在離峰時段約花費 $0.0396,尖峰時段約 $0.0792。Pro 在離峰時段約花費 $0.1188,尖峰時段約 $0.2376。如果 Pro 模型能大幅減少失敗嘗試次數,它仍然可能符合經濟效益。你需要成功率來做決定。
## 快取命中可能改變結果
快取與未快取輸入之間的差距極為巨大。以V4 Pro離峰時段為例,一百萬個未快取輸入Token成本為0.66美元,而快取輸入成本僅為0.022美元。這使得提示詞架構成為一項經濟考量。
將穩定且可重複使用的素材置於提供者的快取機制可識別的位置。避免在大型靜態前綴中變更空白、順序、時間戳記或不相關的中繼資料。將持久性的指令與參考文件從每次請求的使用者內容中分離出來。接著應實際測量快取命中率的使用情況,而非假設設計能正常運作。
快取不應被用來合理化傳送所有內容。一個較小且相關的提示,往往比快取的大量雜訊更可靠。應優先最佳化相關性,其次才是快取能力。
## 如何使用離峰定價
許多AI任務並非真正的即時處理。隔夜報表生成、儲存庫索引、嵌入更新、文件分類、合成資料建立、評估執行以及低優先順序的內容草稿都可以等待。
建立一個包含三個服務類別的佇列:
1. **互動式:** 立即執行並接受當前匯率。
2. **靈活安排:** 排定下一個離峰時段。
3. **批次處理:** 在離峰時段以受控區塊進行處理。
仔細翻譯 UTC 時間區段。日光節約時間的變更可能會改變本地時鐘的對應關係。將排程儲存為 UTC 時間,並向操作員顯示轉換後的結果。加入抖動(jitter),使每個排隊的工作不會在精確的邊界點開始,並限制並行數量以避免重試風暴。
## 導致成本預測失準的常見錯誤
第一個錯誤是只計算可見的文字。分詞器會以不同方式拆分單詞、程式碼、標點符號、JSON 和多語言內容。請使用 API 回報的使用量。
第二點是忽略代理循環。一次「使用者請求」可能觸發數十次模型調用、搜尋操作、測試運行和修復操作。應按完成的任務計算預算,而非按每則聊天訊息計算。
第三是假設最大思考量能帶來免費的品質提升。更深入的推理會增加延遲與消耗。將簡單任務分配給低耗能處理,日常代理任務則交給高耗能處理,並僅在評估顯示有助益時才使用最大思考量。
第四是忘記失敗。超時、無效的工具參數、上下文溢出以及被拒絕的輸出都會耗費金錢。追蹤重試原因並修復系統性錯誤,而不是為重複付出代價。
第五項是將未來的定價標示為當前定價。在標示的啟用時間之前,舊費率仍然適用。啟用後,官方頁面為最終依據。
## 更佳的模型預算
建立一個包含以下欄位的工作表:
- 工作負載名稱;
- 每月請求次數;
- 平均快取輸入;
- 平均未快取輸入;
- 平均輸出;
- 預期尖峰/離峰拆分;
- 重試倍數;
- Flash 或 Pro;
- 工具與搜尋成本;
- 人工審核分鐘;
- 成功完成率。
計算低、預期及高情境。高情境應包含快取未命中峰值及額外的代理程式迴圈。設定警報時應以每成功任務的美元成本為依據,而非僅看每請求的代幣數量。
如果您的組織仍在確認AI在內容或創意流程中的定位,透過 [Elser AI](https://www.elser.ai/) 進行實驗,可以在您投入API規模架構之前,先定義出有用的工作流程。清晰的流程能防止團隊為了使用者不需要的任務,去最佳化token價格。
## 常見問題
### DeepSeek 的新定價何時開始?
DeepSeek 表示時間為 2026 年 8 月 16 日 16:00 UTC。請確認即時頁面,以防時程有所變動。
### 什麼時候是尖峰時段?
公告的尖峰時段為 01:00–04:00 UTC 與 06:00–10:00 UTC,其他時間則劃定為離峰時段。
### V4 Pro 的價格是 Flash 的三倍嗎?
排程費率在每個代幣類別中約為 Flash 的三倍。每項成功任務的總成本可能有所不同,因為品質、重試次數以及人工修復也會影響。
### 最簡單的存錢方法是什麼?
使用 Flash 處理已驗證的簡單工作,在離峰時段安排彈性任務,減少不必要的輸出,提升快取命中率,並停止重複失敗的代理循環。
## 來源與驗證
本文以DeepSeek官方API變更日誌、模型與定價文件,以及V4發布資料為主要來源。產品標籤刻意保留:V4 Pro 0813為正式發布(GA),而V4 Flash 0731在驗證日期被描述為公開測試版。基準測試數據標示為廠商回報,而非以獨立Elser AI結果呈現。預定定價在其公告啟用時間前標記為未來事項。進行生產或採購決策的讀者應重新查閱即時文件,因為模型別名、價格、速率限制、測試版狀態及功能行為可能在發布後變更。針對代表性任務的獨立評估仍有其必要性。
## 結論
DeepSeek 的離峰/尖峰系統將時間轉變為一級成本變數。最大的節省來自於結合排程、快取、模型路由、輸出控制與故障降低。光複製價格表是不夠的。要針對實際的 Token 組合建模,並衡量達成成功商業成果的成本。









































































