Prezzi di GPT-5.6 spiegati: Quale modello offre il miglior rapporto qualità-prezzo?
Comprendi la tariffazione delle API GPT-5.6 Sol, Terra e Luna con esempi svolti, fattori di costo nascosti, strategie di routing e calcoli del costo per risultato.

La tariffazione di GPT‑5.6 sembra semplice: tre livelli, due tariffe per token ciascuno. Il costo effettivo diventa complicato non appena un modello riprova, chiama strumenti, produce una risposta inutilmente lunga o rimanda un revisore alla fonte.
di OpenAI luglio 9, 2026 annuncio di GPT‑5.6 elenca questi prezzi API:
| Fascia | Input per 1M tokens | Output per 1M tokens | |---|---:|---:| | Luna | $1.00 | $6.00 | | Terra | $2,50 | $15,00 | | Sole | $5.00 | $30.00 |
Queste cifre confermate sono le tariffe dei token API al 28 luglio. Non devono essere confuse con i prezzi degli abbonamenti a ChatGPT. Controlla la documentazione attuale per la memorizzazione nella cache, l'uso in batch, gli strumenti, il fine-tuning, i termini regionali, i limiti di frequenza e eventuali modifiche successive.
La prima lezione: l'output è costoso
All'interno di ogni livello, i token di output costano sei volte i token di input. Un progetto di ottimizzazione dei prompt che risparmia 1.000 token di input non è equivalente a un'interfaccia che impedisce 1.000 token di output inutili.
Chiedi il formato di cui hai bisogno:
- uno schema fisso invece di un saggio;
- una risposta di 100 parole invece di «essere completo»;
- una patch e un breve riassunto invece di ripetere ogni file;
- ID sorgente invece di lunghe citazioni di origine;
- un piano consigliato e i relativi rischi invece di dieci opzioni generiche.
Non tagliare il contesto necessario per risparmiare pennini e poi pagare per un fallimento. Ottimizza gli sprechi, non le informazioni.
Tre esempi svolti
Bozza di piccolo supporto
Input: 2,000 token
Risultato: 300 token
- Luna: $0,002 + $0,0018 = $0,0038
- Terra: $0,005 + $0,0045 = $0,0095
- Sole: $0.010 + $0.009 = $0.019
Con una singola richiesta, tutte sembrano a buon mercato. Con dieci milioni di richieste, la differenza tra Luna e Sol è di 152.000 dollari prima di altri addebiti.
Revisione di un documento lungo
Input: 100,000 tokeni
Output: 5.000 token
- Luna: $0,10 + $0,03 = $0,13
- Terra: $0,25 + $0,075 = $0,325
- Sole: $0.50 + $0.15 = $0.65
Se Sol fa risparmiare a un professionista anche cinque minuti, il premio potrebbe essere irrilevante. Se tutti e tre estraggono gli stessi campi in modo accurato, Luna vince.
Sessione di codifica agentica
Si supponga che tutte le chiamate insieme utilizzino 400,000 token di input e 40,000 token di output:
- Luna: $0.40 + $0.24 = $0.64
- Terra: $1,00 + $0,60 = $1,60
- Sol: 2,00 $ + 1,20 $ = 3,20 $
Il costo del modello potrebbe ancora essere basso rispetto al tempo degli ingegneri, ma i cicli degli strumenti, i tentativi di ripetizione e la scalabilità possono modificare il totale. Traccia l'intera sessione.
La metrica che conta: costo per risultato accettato
Supponiamo che Luna costi $0,04 per tentativo e abbia successo nel 70% dei casi. Terra costa $0,10 e ha successo nel 92% dei casi. Sol costa $0,20 e ha successo nel 96% dei casi.
Ignorando i tentativi di ripetizione e la revisione, il costo del modello per un risultato riuscito al primo tentativo è approssimativamente:
- Luna: $0,057
- Terra: $0,109
- Sol: $0.208
Ma se ogni risposta non riuscita di Luna richiede cinque minuti a un revisore pagato $60 all'ora, il suo vantaggio apparente scompare.
Uso:
Costi totali del modello + costi degli strumenti + infrastruttura + lavoro di revisione + impatto del guasto, diviso per i risultati accettati.
Assegna costi realistici di manodopera e di incidente. Non usare il prezzo del token come sostituto della contabilità.
Fattore di costo nascosto 1: ritentativi
I ritentativi moltiplicano sia i token che la latenza. Registra perché si verificano:
- formato non valido;
- contesto mancante;
- guasto dello strumento;
- errore fattuale;
- prompt vago;
- limite di capacità del modello;
- Preferenza utente.
Risolvi i problemi deterministici nel codice. Inoltra i problemi di capacità. Non chiedere ciecosamente allo stesso livello di riprovare per cinque volte.
Fattore di costo nascosto 2: accumulo di contesto
Le lunghe conversazioni inviano ripetutamente materiale vecchio. Le tracce degli agenti, gli output degli strumenti, i documenti duplicati e le istruzioni di sistema verbose possono diventare il costo di input più elevato.
Uso:
- recupero pertinente;
- rappresentazioni compatte dello stato;
- contesto deduplicato;
- Output di strumento strutturato;
- riassunto di conversazioni con verifica;
- Sessioni separate per lavori non correlati.
Non rimuovere mai le istruzioni di sicurezza o i fatti critici solo per ridurre il contesto.
Fattore di costo nascosto 3: output verboso
I modelli spesso rispondono nell'ambito implicito massimo. Specifica il pubblico, la decisione, la lunghezza e il formato. Interrompi lo streaming quando il prodotto ha già ciò di cui ha bisogno, laddove l'API consente un controllo sicuro.
In creative work, generate a few intentional variants rather than 50 near-duplicates. A visual storytelling team using Elser AI can keep approved character and scene references, reducing repeated exploration and downstream correction.
4° fattore di costo nascosto: revisione umana
La revisione non è un carico superfluo da nascondere; fa parte del sistema.
Misura:
minuti per verificare i fatti;
- minuti per ispezionare il codice;
- riscrivi la percentuale;
- tasso di escalation;
- qualifiche di esperto richieste;
- Errori gravi riscontrati.
Un livello superiore può essere più economico se riduce la revisione qualificata. Può anche creare una falsa sicurezza, quindi campiona continuamente gli output accettati.
Fattore di costo nascosto 5: impatto del guasto
Un tag interno impreciso e un'istruzione medica imprecisa non hanno lo stesso costo. Valuta la categoria delle conseguenze, non solo la richiesta.
Il lavoro ad alto impatto richiede supervisione da parte di esperti e strumenti controllati indipendentemente dal livello. La scheda di sistema GPT‑5.6 di OpenAI è una prova di sicurezza utile, ma la tua distribuzione deve essere valutata nel contesto.
Quale livello offre il miglior rapporto qualità-prezzo?
Luna vince quando
L'attività è a alto volume, limitata, sensibile alla latenza, reversibile e verificabile da macchina. Estrazione, classificazione, formattazione e trasformazioni semplici sono ottimi candidati.
Terra vince quando
Il carico di lavoro combina redazione, analisi, supporto, codifica normale e utilizzo moderato degli strumenti. Terra può semplificare le operazioni come impostazione predefinita ampia, mantenendo un costo inferiore a Sol.
Sol vince quando
Il compito è difficile o di alto valore, e il premium di capacità riduce i guasti, risparmia tempo agli esperti o sblocca lavori che altri livelli non possono completare.
Non esiste un campione universale di valore. La stessa azienda può avere tutti e tre i vincitori.
Un modello di routing mensile di esempio
Immagina 100,000 richieste con una media di 8,000 token di input e 1,000 token di output. Un router invia:
- 70% a Luna;
- 25% a Terra;
- 5% a Sol.
Costi approssimativi per token per richiesta:
- Luna: $0,008 + $0,006 = $0,014
- Terra: $0,020 + $0,015 = $0,035
- Sol: $0,040 + $0,030 = $0,070
Costo mensile del modello combinato:
- Luna: 70,000 × $0.014 = $980
- Terra: 25.000 × $0,035 = $875
- Sole: 5,000 × $0.070 = $350
- Totale: $2,205
All-Sol costerebbe 7.000 $ con le stesse ipotesi semplificate. All-Luna costerebbe 1.400 $ ma potrebbe causare guasti inaccettabili. Il routing acquista la capacità dove necessario.
Controlli di bilancio che vale la pena implementare
- limiti di token per utente e per flusso di lavoro;
- lunghezza massima di output;
- Liste di consentiti per livelli specifici per compito;
- avviso in caso di picchi di ritentativi;
- registri delle versioni del modello e del prompt;
- Dashboard dei costi per risultato accettato;
- chiamata strumento maiuscole;
- approvazione per l'uso insolito di Sol;
- fallback automatico durante gli errori;
- rivalutazione mensile.
Non rendere la visibilità dei costi punitiva. Se gli utenti nascondono le attività difficili per evitare un piano premium, la qualità ne risente. Rendi l'escalazione intenzionale e spiegabile.
Domande frequenti
Incertezza delle previsioni, non solo la media
Un bilancio responsabile ha almeno tre casi:
- previsto: traffico normale, lunghezza dell'output e escalata;
- Alto: traffico di lancio, contesto più lungo o una regressione di qualità temporanea;
- stress: ciclo di ritentativo, bug dell'agente o routing premium accidentale.
Imposta gli avvisi al di sotto del caso di stress in modo che qualcuno possa agire prima che scomparga l'intero budget mensile. Limita i passaggi e i token di output a livello di applicazione quando appropriato. Traccia i costi per cliente, funzionalità, ambiente e versione del prompt; un totale combinato del conto nasconde la fonte di crescita.
Separa inoltre gli esperimenti dalla produzione. Il traffico di valutazione può essere considerevole, ma ridurlo per far sembrare la linea di modelli meno costosa crea un'economia falsa. Assegna ai test il proprio budget e la propria etichetta.
Le modifiche ai prezzi richiedono un modello ripetibile
Memorizza le ipotesi in una piccola calcolatrice invece che in uno screenshot di presentazione. Gli input devono includere traffico, token medi, tasso di hit della cache dove applicabile, tentativi di ripetizione, quota di escalation, costi degli strumenti, minuti di revisione umana e stime di incidenti.
Quando OpenAI aggiorna un prezzo o il tuo carico di lavoro cambia, sostituisci un input e riesegui gli scenari. Registra la data ufficiale della pagina dei prezzi. Questo impedisce che un articolo SEO, una vecchia fattura o la memoria di un collega diventino una fonte di approvvigionamento dopo mesi.
Qual è il modello GPT-5.6 più economico?
Luna ha le tariffe ufficiali per i token API più basse: $1 di input e $6 di output per milione di token.
Terra è esattamente la metà del prezzo di Sol?
Ai tassi di token di input e output indicati, sì. Il costo totale del carico di lavoro potrebbe non essere la metà perché l'utilizzo, le ripetizioni e gli strumenti possono differire.
Le sottoscrizioni di ChatGPT sono incluse?
No. I prezzi riportati in questo articolo sono prezzi API. Controlla separatamente le pagine dei piani attuali di ChatGPT.
Come posso stimare i token?
Usa i report di utilizzo supportati dal provider o un tokenizzatore compatibile per le stime, quindi sostituisci le stime con i registri di utilizzo API effettivi durante una fase pilota.
Devo sempre iniziare con Luna?
Inizia con Luna quando il compito è limitato e convalidato. Per lavori generali con sfumature, Terra può ridurre il costo totale. Per lavori complessi o di conseguenza rilevante, testa Sol e richiedi una revisione.
Conclusione
Il token più economico di GPT‑5.6 appartiene a Luna, ma il miglior rapporto qualità-prezzo appartiene alla fascia che produce un risultato accettato con il costo totale minore.
Controlla la lunghezza dell'output, taglia il contesto irrilevante, indaga sui tentativi di ripetizione, conta il lavoro di revisione e calcola i costi dei guasti. Assegna il lavoro routine a Luna, la parte intermedia ampia a Terra e la parte difficile finale a Sol.
Quando un foglio di calcolo dei prezzi include solo i token di input e di output, non è finito. Aggiungi le persone, gli strumenti, i tentativi di ripetizione e le conseguenze — di solito il modello corretto diventa molto più facile da individuare.

















































