I prezzi dell'API DeepSeek cambieranno il 16 agosto—ecco quanto costerà effettivamente
Calcola i costi di DeepSeek V4 Pro e Flash secondo il programma tariffario di picco e fuori picco del 16 agosto, con esempi pratici di budget.

DeepSeek sta per rendere la gestione del budget delle API più complicata—e potenzialmente più controllabile. Alle 16:00 UTC del 16 agosto 2026, l'azienda prevede di sostituire le attuali tariffe fisse V4 con prezzi di punta e fuori punta. L'utilizzo fuori punta costerà la metà della tariffa di punta, creando un incentivo diretto a spostare i carichi di lavoro flessibili lontano dalle ore di maggiore attività.
La modifica riguarda sia DeepSeek-V4-Flash che il nuovo DeepSeek-V4-Pro, ora disponibile in versione GA. Cambia anche l'economia al punto che i vecchi confronti sui costi diventeranno fuorvianti. Questo articolo traduce la tabella ufficiale dei costi per milione di token in carichi di lavoro realistici e spiega come evitare gli errori di budget più comuni.
Prima di tutto, il tempismo
Alla data di verifica di questo articolo—14 agosto—il nuovo orario è annunciato ma non ancora attivo. DeepSeek afferma che inizierà alle 16:00 UTC del 16 agosto. Le finestre di punta designate sono 01:00–04:00 UTC e 06:00–10:00 UTC. Tutte le altre ore sono fuori punta.
Poiché i prezzi sono informazioni operative in tempo reale, conferma la pagina ufficiale dei prezzi prima di finanziare un account o pubblicare un calcolatore. Le tariffe seguenti riflettono quella pagina al 14 agosto 2026.
La Tabella dei Prezzi Programmata
I prezzi sono per milione di token.
| Modello e periodo | Input in cache | Input non in cache | Output | |---|---:|---:|---:| | V4 Flash fuori orario di punta | $0.007 | $0.22 | $0.66 | | Picco Flash V4 | $0.014 | $0.44 | $1.32 | | V4 Pro fuori punta | $0.022 | $0.66 | $1.98 | | V4 Pro peak | $0,044 | $1,32 | $3,96 |
Tre pattern sono immediatamente visibili. L'output è la categoria costosa. Un cache miss costa molto più di un cache hit. Pro costa circa tre volte la corrispondente tariffa Flash. Questi rapporti sono più utili di un singolo prezzo headline perché le applicazioni reali hanno combinazioni diverse di input/output.
Quanto Costa una Richiesta Tipica
Considera un assistente di supporto che legge 8.000 token di input non memorizzati nella cache e produce 1.000 token di output. Con la tariffa Flash non di punta, il costo del modello è approssimativamente:
(8.000 / 1.000.000 × $0,22) + (1.000 / 1.000.000 × $0,66) = $0,00242
Con la tariffazione massima di Flash, il prezzo raddoppia a circa $0.00484. Con Pro, la stessa combinazione di token costa circa $0.00726 fuori dal picco e $0.01452 in periodo di picco.
Questi numeri sembrano piccoli, ma il volume cambia la prospettiva. Con un milione di tali richieste al mese, la differenza solo del modello tra Flash in fascia non di punta e Pro in fascia di punta è di circa 12.100 dollari. Le chiamate agli strumenti, le API di ricerca, l'archiviazione, l'osservabilità, i tentativi e la revisione umana aggiungerebbero altro.
Ora considera un agente di codifica che consuma 120.000 token di input non memorizzati nella cache ed emette 20.000 token di output per attività. Flash costa circa $0,0396 in orario non di punta o $0,0792 in orario di punta. Pro costa circa $0,1188 in orario non di punta o $0,2376 in orario di punta. Se il modello Pro riduce materialmente i tentativi falliti, può comunque essere economico. Hai bisogno del tasso di successo per decidere.
## I colpi in cache possono cambiare il risultato
Il divario tra input in cache e non in cache è enorme. Per V4 Pro in orario non di punta, un milione di token di input non in cache costa $0.66, mentre l'input in cache costa $0.022. Questo rende l'architettura del prompt una questione economica.
Posiziona materiale stabile e riutilizzabile dove il meccanismo di cache del provider possa riconoscerlo. Evita di modificare spazi bianchi, ordinamento, timestamp o metadati irrilevanti in un ampio prefisso statico. Separa le istruzioni durevoli e i documenti di riferimento dal contenuto utente per richiesta. Quindi misura l'effettivo utilizzo della cache-hit invece di presumere che il design funzioni.
La memorizzazione nella cache non dovrebbe essere usata per giustificare l'invio di tutto. Un prompt più piccolo e pertinente è spesso più affidabile di una montagna di rumore memorizzata nella cache. Ottimizza prima la pertinenza, poi la possibilità di caching.
## Come Utilizzare il Prezzo Fuori Punta
Molte attività di IA non sono realmente in tempo reale. La generazione di report notturni, l'indicizzazione dei repository, gli aggiornamenti degli embedding, la classificazione dei documenti, la creazione di dati sintetici, le esecuzioni di valutazione e le bozze di contenuti a bassa priorità possono attendere.
Crea una coda con tre classi di servizio:
1. **Interattivo:** esegui immediatamente e accetta la tariffa corrente.
2. **Flessibile:** pianifica per la prossima finestra di bassa domanda.
3. **Batch:** elabora in blocchi controllati durante le ore non di punta.
Traduci attentamente le finestre UTC. I cambi dell'ora legale possono spostare le mappature dell'orologio locale. Memorizza i programmi in UTC e mostra la conversione agli operatori. Aggiungi jitter così che ogni lavoro in coda non inizi esattamente al confine, e limita la concorrenza per evitare una tempesta di nuovi tentativi.
## Gli errori che compromettono le previsioni dei costi
Il primo errore è contare solo il testo visibile. I tokenizzatori suddividono parole, codice, punteggiatura, JSON e contenuti multilingue in modo diverso. Utilizza l'utilizzo riportato dall'API.
Il secondo è ignorare i cicli degli agenti. Una "richiesta utente" può innescare decine di chiamate al modello, operazioni di ricerca, esecuzioni di test e riparazioni. Budget per lavoro completato, non per messaggio di chat.
Il terzo è presumere che il massimo sforzo di pensiero sia qualità gratuita. Un maggiore impegno di ragionamento può aumentare la latenza e il consumo. Instradare il lavoro semplice verso uno sforzo basso, le attività quotidiane degli agenti verso uno sforzo alto, e utilizzare il massimo solo quando le valutazioni mostrano un beneficio.
Il quarto è dimenticare i fallimenti. Timeout, argomenti di strumenti non validi, overflow del contesto e output rifiutati costano tutti denaro. Tieni traccia dei motivi dei tentativi e correggi gli errori sistemici invece di pagare per la ripetizione.
Il quinto è pubblicare i prezzi futuri come prezzi correnti. Fino all'orario di attivazione indicato, rimangono applicabili le vecchie tariffe. Dopo l'attivazione, la pagina ufficiale è la fonte di verità.
## Un Budget Modello Migliore
Crea un foglio di lavoro con queste colonne:
- nome del workload;
- richieste al mese;
- input medio memorizzato nella cache;
- input medio non memorizzato nella cache;
- output medio;
- distribuzione prevista tra picco e fuori picco;
- moltiplicatore di tentativi;
- Flash o Pro;
- costo degli strumenti e della ricerca;
- minuti di revisione umana;
- tasso di completamento con successo.
Calcola uno scenario basso, previsto e alto. Lo scenario alto dovrebbe includere un picco di cache-miss e ulteriori cicli dell'agente. Imposta avvisi sui dollari per attività riuscita, non solo sui token per richiesta.
Se la tua organizzazione sta ancora cercando di capire dove l'AI si inserisce nel suo processo creativo o di contenuti, sperimentare tramite [Elser AI](https://www.elser.ai/) può aiutare a definire il flusso di lavoro utile prima di impegnarsi in un'architettura su scala API. Un processo chiaro evita che i team ottimizzino i costi dei token per un'attività di cui gli utenti non avevano bisogno.
## FAQ
### Quando inizieranno i nuovi prezzi di DeepSeek?
DeepSeek dice 16:00 UTC del 16 agosto 2026. Verifica la pagina live in caso di modifiche al programma.
### Quando sono le ore di punta?
Le finestre di picco annunciate sono 01:00–04:00 UTC e 06:00–10:00 UTC. Le altre ore sono designate come fuori picco.
### Il V4 Pro costa tre volte tanto quanto Flash?
Le tariffe programmate sono circa tre volte quelle di Flash in ciascuna categoria di token. Il costo totale per attività riuscita può differire perché anche qualità, tentativi e riparazione umana contano.
### Qual è il modo più semplice per risparmiare denaro?
Usa Flash per lavori semplici e validati, pianifica lavori flessibili fuori dai picchi, riduci output inutili, migliora i colpi in cache e interrompi i cicli ripetuti di agenti falliti.
## Fonti e Verifica
Questo articolo utilizza il changelog ufficiale dell'API di DeepSeek, la documentazione sui modelli e i prezzi, e il materiale di rilascio di V4 come fonti primarie. Le etichette dei prodotti sono conservate deliberatamente: V4 Pro 0813 è GA, mentre V4 Flash 0731 è descritto come beta pubblica alla data di verifica. Le cifre dei benchmark sono identificate come riportate dal fornitore e non presentate come risultati indipendenti di Elser AI. I prezzi programmati sono etichettati come futuri fino alla loro attivazione annunciata. I lettori che prendono decisioni di produzione o acquisto dovrebbero ricontrollare la documentazione live perché alias di modelli, prezzi, limiti di velocità, stato beta e comportamento delle funzionalità possono cambiare dopo la pubblicazione. Rimane necessaria una valutazione indipendente su compiti rappresentativi.
## Conclusione
Il sistema peak/off-peak di DeepSeek trasforma la tempistica in una variabile di costo di prima classe. I maggiori risparmi deriveranno dalla combinazione di pianificazione, caching, instradamento dei modelli, controllo dell'output e riduzione dei fallimenti. Copiare la tabella dei prezzi non è sufficiente. Modella la tua combinazione effettiva di token e misura il costo di un risultato aziendale di successo.








































































