Prezzi di GPT-5.6 Spiegati: Costi API, Piani ChatGPT e Livelli del Modello
Comprendi i prezzi di GPT-5.6 per Sol, Terra e Luna, incluse le tariffe correnti dei token, input in cache, costi per contesto lungo, accesso a ChatGPT e modellazione del costo per risultato.

I prezzi di GPT-5.6 sembrano semplici quando ridotti alle tariffe per token di input e output. I costi reali sono determinati da cinque variabili: livello del modello, sforzo di ragionamento, lunghezza del contesto, comportamento della cache e numero di tentativi necessari per ottenere un risultato accettato.
Esiste anche una trappola della recente. OpenAI ha modificato i prezzi di GPT-5.6 dopo il lancio originale, includendo riduzioni per Terra e Luna e prezzi promozionali per Sol. Un articolo che copia la tabella di lancio senza controllare le pagine attuali del modello è già sbagliato.
Questa guida utilizza prezzi verificati dalle pagine ufficiali di OpenAI il 3 settembre 2026. Trattala come un quadro di calcolo, non come un listino prezzi permanente.
Prezzi attuali dell'API GPT-5.6
| Modello | Input per 1 milione di token | Input memorizzato nella cache per 1 milione di token | Output per 1 milione di token | Posizionamento | | GPT-5.6 Sol | $4.00 | $0.40 | $20.00 | Lavoro complesso di punta | | GPT-5.6 Terra | $2.00 | $0.20 | $12.00 | Intelligenza bilanciata e costo | | GPT-5.6 Luna | $0.20 | $0.02 | $1.20 | Volume elevato sensibile ai costi |
La pagina Sol attuale di OpenAI afferma che i suoi prezzi di $4/$20 sono promozionali almeno fino al 21 novembre 2026. L'azienda può estendere, sostituire o terminare le tariffe promozionali, quindi i budget di produzione dovrebbero includere una data di revisione.
Come funziona la fatturazione dei token
Token di input
L'input include le istruzioni, il contenuto dell'utente, la conversazione precedente inclusa nella richiesta, le prove recuperate e i risultati degli strumenti restituiti al modello. Un lungo prompt di sistema ripetuto in ogni chiamata può diventare un centro di costo significativo.
Token di output
L'output copre il testo generato e può essere prezzato molto più dell'input. Chiedere dieci alternative quando i revisori ne necessitano tre, o richiedere una riscrittura completa invece di una correzione mirata, aumenta sia l'utilizzo che il carico di revisione.
Input memorizzato
La memorizzazione nella cache dei prompt premia i prefissi stabili. Se molte richieste condividono le stesse policy, schema e conoscenza del prodotto, mantenere quel prefisso stabile in termini di byte può ridurre il costo di input ripetuto. GPT-5.6 supporta punti di interruzione espliciti della cache, mentre la memorizzazione automatica nella cache rimane disponibile.
Non dare per scontato che ogni prompt dall'aspetto ripetuto sia un cache hit. Timestamp dinamici, esempi riordinati o contenuti specifici dell'utente posizionati all'inizio della richiesta possono ridurre il riutilizzo. Misura i token memorizzati nella cache dalle risposte effettive dell'API.
Scritture nella cache
Le linee guida attuali di GPT-5.6 stabiliscono che le scritture in cache vengono fatturate a 1,25 volte la tariffa di input non memorizzato, mentre le letture sono scontate. La memorizzazione nella cache è quindi un investimento: ripaga quando un prefisso stabile viene riutilizzato un numero sufficiente di volte.
La Formula Base del Costo
Per una semplice richiesta di testo:
costo = token in input ÷ 1.000.000 × tariffa input + token in output ÷ 1.000.000 × tariffa output
Supponiamo che una chiamata Terra utilizzi 20.000 token di input non memorizzati nella cache e produca 3.000 token di output:
- Input: 20.000 / 1.000.000 × $2 = $0,04
- Output: 3.000 / 1.000.000 × $12 = $0,036
- Costo stimato dei token di testo: $0,076
Questo esclude strumenti, tentativi e eventuali costi di elaborazione speciali.
Ora supponiamo che 15.000 dei token di input siano qualificati come letture in cache:
- 5.000 input non memorizzato: $0,01
- 15.000 input in cache: $0,003
- 3.000 output: $0,036
- Costo totale stimato: $0,049
L'esempio mostra perché la disciplina dell'output e la progettazione della cache possono essere importanti tanto quanto il prezzo di input principale.
Il Prezzo del Contesto Lungo Può Cambiare le Carte in Tavola
La pagina del modello GPT-5.6 Sol elenca una finestra di contesto di 1,05 milioni di token, ma afferma anche che i prompt con oltre 272.000 token di input vengono addebitati al doppio della tariffa di input e a 1,5 volte la tariffa di output per l'intera richiesta.
Questo crea una soglia di progettazione importante. Combinare un intero repository o archivio di documenti in una singola richiesta può costare di più rispetto al recupero più diverse chiamate più piccole. Prima di utilizzare un contesto molto lungo, chiedi:
- Ogni documento influenza la stessa decisione?
- Il recupero può selezionare un insieme di prove più piccolo?
- Il materiale di sfondo stabile può essere memorizzato nella cache?
- Una gestione a fasi dell'inventario e una sintesi migliorerebbero la tracciabilità?
- Superare la soglia migliora abbastanza l'accettazione da giustificare il moltiplicatore?
Il contesto ampio è una capacità, non una raccomandazione per massimizzare l'input.
Sforzo di Ragionamento e Costo
GPT-5.6 supporta none, low, medium, high, xhigh e max nell'API. Un ragionamento più elevato può utilizzare più token e tempo. L'impostazione economicamente corretta non è necessariamente la più bassa: un compito più difficile potrebbe essere più economico con un alto sforzo se evita diversi tentativi falliti a basso sforzo.
Valuta i livelli di impegno utilizzando:
costo per output accettato = costo totale del modello e degli strumenti / numero di output che superano la revisione
Se lo sforzo basso costa $0.03 ma solo il 50% degli output supera il controllo, il costo diretto del modello per risultato accettato è di almeno $0.06 prima di tentativi e revisioni. Una configurazione da $0.05 con un tasso di superamento del 95% potrebbe essere operativamente più economica.
Modalità Veloce, Batch e Strumenti
OpenAI riferisce che la modalità Fast per GPT-5.6 Sol può fornire un'elaborazione API più rapida a un prezzo più elevato. Sostituisce l'elaborazione prioritaria per questo modello. Utilizzala quando la latenza ha un valore misurabile—codifica interattiva, operazioni sensibili al tempo o flussi di lavoro umani bloccati su una risposta—non semplicemente perché più veloce suona meglio.
L'elaborazione batch può essere adatta per carichi di lavoro asincroni, mentre la ricerca web, l'uso del computer e altri strumenti possono comportare costi separati. Stima sempre il percorso completo della richiesta, inclusi i cicli degli strumenti e le chiamate fallite.
I piani di ChatGPT non sono pacchetti di token
L'accesso all'abbonamento ChatGPT non dovrebbe essere confrontato direttamente con le tariffe dei token API. Un abbonamento fornisce accesso a funzionalità del prodotto e opzioni del modello soggette ai limiti del piano, alle politiche di utilizzo e ai controlli dell'area di lavoro; non crea un saldo API intercambiabile.
Le linee guida ufficiali attuali dicono:
- Plus include GPT-5.6 Sol Medium e High.
- Pro, Business e Enterprise includono Medio, Alto, Extra Alto e Pro.
- Free e Go usano GPT-5.6 Luna per chat e Think quotidiani.
- I limiti possono dipendere dal piano e dalla configurazione dello spazio di lavoro gestito.
Usa ChatGPT quando gli esseri umani interagiscono direttamente con il modello. Usa l'API quando il software necessita di accesso programmabile, misurato e controllo operativo.
Scelta di un Tier in base all'Economia Unitaria
Luna: ottimizza per volume con validazione
Usa Luna per classificazione, estrazione, metadati, bozze di prima stesura e altri compiti in cui la correttezza può essere verificata a basso costo. Le sue tariffe basse possono supportare sperimentazioni che sarebbero antieconomiche con un modello di punta.
Terra: ottimizza per una produzione bilanciata
Terra è un utile punto di riferimento per il lavoro professionale ricorrente. Può ridurre la gestione delle eccezioni rispetto a Luna, rimanendo comunque più economico di Sol.
Sol: ottimizza per decisioni costose e casi difficili
Usa Sol quando il costo del fallimento domina il costo dei token: sintesi finale, lavoro complesso dell'agente, modifiche difficili al codice, revisione progettuale sfumata o eccezioni ad alto impatto.
Progettazione dei costi per un flusso di lavoro di animazione
Una pipeline di animazione non dovrebbe inviare ogni fase allo stesso livello di ragionamento.
- Luna può normalizzare i nomi degli asset, taggare le scene e creare varianti di metadati.
- Terra può redigere suddivisioni delle scene, brief dei personaggi e prompt di produzione.
- Sol può esaminare una lunga narrazione per individuare contraddizioni o rivedere un piano finale complesso.
- Elser AI può eseguire il flusso di lavoro specializzato per personaggi, storyboard, animazione, voce e montaggio dopo l'approvazione del brief scritto.
Questa separazione impedisce che costose chiamate di ragionamento vengano spese per la formattazione di routine ed evita di fingere che il prezzo dei token di un modello linguistico includa la generazione di media.
Costruisci una Previsione dei Costi Mensili
Crea una tabella con queste colonne:
- Tipo di attività.
- Volume di richieste mensili.
- Modello scelto e impegno.
- Token di input medi non memorizzati nella cache.
- Media dei token di input memorizzati nella cache.
- Token medi di output.
- Chiamate agli strumenti e addebiti.
- Tasso di ripetizione.
- Verbali della revisione umana.
- Tasso di accettazione.
Esegui scenari di base, ad alto volume e con cache scarsa. Aggiungi un caso di sensibilità per la fine dei prezzi promozionali. Rivedi l'utilizzo effettivo settimanalmente durante il rollout e aggiorna le previsioni con i conteggi di token osservati, non stimati.
FAQ
Quanto costa GPT-5.6 Sol?
Come verificato il 3 settembre 2026, la pagina ufficiale del modello elenca $4 per milione di token di input, $0,40 per milione di token di input in cache e $20 per milione di token di output. I prezzi promozionali sono dichiarati validi almeno fino al 21 novembre 2026.
GPT-5.6 Luna è sempre l'opzione più economica?
Ha le tariffe di token più basse della famiglia, ma i costi di tentativi, revisione ed errori possono rendere un altro modello più economico per risultato accettato.
L'abbonamento a ChatGPT include l'uso dell'API?
Tratta la fatturazione di ChatGPT e delle API come prodotti separati. Le richieste API vengono misurate secondo i prezzi delle API; l'accesso in abbonamento segue i limiti e le funzionalità del piano ChatGPT.
La memorizzazione nella cache dei prompt avviene automaticamente?
La memorizzazione automatica nella cache è disponibile, e GPT-5.6 supporta anche punti di interruzione espliciti della cache. I risparmi effettivi dipendono dalla stabilità e dal riutilizzo del prefisso.
I costi di generazione di immagini o video sono inclusi qui?
No. Queste tariffe coprono l'utilizzo dei token di testo di GPT-5.6. Gli endpoint multimediali specializzati e gli strumenti di produzione di terze parti hanno i propri prezzi.
Conclusione
Il prezzo di GPT-5.6 è gestito al meglio come un problema di sistema. Scegli il livello in base al rischio del compito, imposta lo sforzo di ragionamento tramite valutazione, progetta prefissi stabili per il riutilizzo della cache, evita soglie di contesto lungo non necessarie e misura il costo per risultato accettato.
Il prezzo più basso per token è utile. Un costo inferiore per il lavoro finito e approvato è ciò che conta davvero.
















































































