AI nelle imprese, con i numeri veriLinkedIn ↗
RassegnaAI

Riferimentoaggiornato il 5 settembre 2026

Prezzi delle api dei modelli e quando scadono

Quanto costa un milione di token sui listini ufficiali dei sei fornitori che contano, e quali di questi prezzi hanno una data di scadenza già scritta dentro. Ogni riga è letta alla fonte, non ripresa da chi la cita.

I prezzi con una data dentro

Questa è la parte che nei confronti non compare. Un prezzo promozionale non è un prezzo, è una promozione con una scadenza, e chi dimensiona una spesa ricorrente su quel numero si trova l'aumento in fattura senza che nessuno abbia toccato niente.

CosaPrezzo di oggiFino aPoi
OpenAI GPT-5.6 Sol, prezzo promozionale in/outOpenAI4,00 / 20,002026-11-21fine promozione, il listino non specifica il prezzo successivo
Google Gemini 3.8/3.7/3.6 Flash, prezzo in/out/cacheGoogle0,75 / 3,75 / 0,0752026-12-31aumento a 1,50 / 7,50 / 0,15
Claude Sonnet 5, aumento a 3,00/15,00 in/out annunciato e poi annullatoAnthropic2,00 / 10,002026-09-01aumento non avverrà, 2,00/10,00 resta prezzo standard definitivo

OpenAI

Listino ufficiale verificato il 5 settembre 2026. Fonte

ModelloIngressoCacheUscitaNote
GPT-6 Astra10,001,0050,00oltre soglia contesto: 20,00/2,00/75,00
GPT-5.6 Sol4,000,4020,00prezzo promozionale fino al 2026-11-21; oltre soglia contesto: 8,00/0,80/30,00
GPT-5.6 Terra2,000,2012,00oltre soglia contesto: 4,00/0,40/18,00
GPT-5.6 Luna0,200,021,20oltre soglia contesto: 0,40/0,04/1,80
GPT-5.55,000,5030,00max 272K contesto; oltre soglia: 10,00/1,00/45,00
GPT-5.42,500,2515,00max 272K contesto; oltre soglia: 5,00/0,50/22,50
GPT-5.4 Mini0,750,0754,50
GPT-5.4 Nano0,200,021,25
GPT-5.21,750,17514,00
GPT-5.11,250,12510,00
GPT-51,250,12510,00
GPT-4.12,000,508,00
  • Contesto lungo, oltre la finestra standard, al doppio del prezzo. Su gpt-5.6-sol sono 8 in ingresso e 30 in uscita, cioè più del prezzo pieno di prima della promozione.
  • Residenza dei dati, sugli endpoint regionali, più 10 per cento per i modelli usciti dal 5 marzo 2026.
  • Modalità veloce al doppio delle tariffe standard.
  • Batch e flex a metà prezzo.

Google

Listino ufficiale verificato il 5 settembre 2026. Fonte

ModelloIngressoCacheUscitaNote
Gemini 3.1 Pro Preview2,000,2012,00per prompt ≤200k token; oltre: 4,00/0,40/18,00
Gemini 2.5 Pro1,250,12510,00per prompt ≤200k token; oltre: 2,50/0,25/15,00
Gemini 3.8 Flash0,750,0753,75prezzo valido fino al 2026-12-31, poi 1,50/0,15/7,50
Gemini 3.7 Flash0,750,0753,75prezzo valido fino al 2026-12-31, poi 1,50/0,15/7,50
Gemini 3.6 Flash0,750,0753,75prezzo valido fino al 2026-12-31, poi 1,50/0,15/7,50
Gemini 3.5 Flash1,500,159,00
Gemini 3.5 Flash-Lite0,30—2,50
Gemini 3.1 Flash-Lite0,25—1,50
Gemini 2.5 Flash0,300,032,50
Gemini 2.5 Flash-Lite0,10—0,40
  • Batch a metà prezzo.
  • Ricerca Google come fonte, 5.000 richieste al mese comprese sui modelli 3.x, poi 14 dollari ogni mille.
  • Su diversi modelli il prezzo cambia sopra i 200mila token di prompt, quindi un agente che si porta dietro documenti interi entra nella fascia alta senza che nessuno lo decida.

Anthropic

Listino ufficiale verificato il 5 settembre 2026. Fonte

ModelloIngressoCacheUscitaNote
Claude Fable 5.110,000,2550,00cache hit a 0,025x input, non 0,1x standard
Claude Mythos 5.110,000,2550,00disponibilità limitata; cache hit a 0,025x input
Claude Fable 510,001,0050,00
Claude Opus 55,000,5025,00
Claude Opus 4.85,000,5025,00
Claude Opus 4.75,000,5025,00
Claude Opus 4.65,000,5025,00
Claude Opus 4.55,000,5025,00
Claude Sonnet 52,000,2010,00aumento a 3,00/15,00 previsto per 2026-09-01 annunciato e poi annullato
Claude Sonnet 4.63,000,3015,00
Claude Sonnet 4.53,000,3015,00
Claude Haiku 4.51,000,105,00
  • La colonna cache è la lettura, a un decimo del prezzo di ingresso. Scrivere in cache costa invece più dell'ingresso, 1,25 volte per la cache da 5 minuti e 2 volte per quella da un'ora.
  • Contesto fino a un milione di token al prezzo standard sui modelli dal 4.6 in poi, senza fascia alta. È la differenza più grossa rispetto agli altri due listini.
  • Residenza dei dati, con inferenza solo negli Stati Uniti, moltiplicatore 1,1 sui modelli dal 4.6 in poi. Endpoint regionali su Bedrock e Google Cloud più 10 per cento.
  • Modalità veloce su Opus 5, 10 in ingresso e 50 in uscita.
  • Batch a metà prezzo. Ricerca web 10 dollari ogni mille ricerche.
  • I modelli dal 4.7 in poi usano un tokenizzatore che produce circa il 30 per cento di token in più a parità di testo, quindi il prezzo per token non basta a confrontarli con i precedenti.

xAI

Listino ufficiale verificato il 5 settembre 2026. Fonte

ModelloIngressoCacheUscitaNote
Grok 4.62,000,506,00per prompt <200k token; ≥200k: 4,00/1,00/12,00
Grok 4.52,000,306,00per prompt <200k token; ≥200k: 4,00/0,60/12,00
Grok 4.31,250,202,50per prompt <200k token; ≥200k: 2,50/0,40/5,00
Grok 4.201,250,202,50per prompt <200k token; ≥200k: 2,50/0,40/5,00
Grok Build 0.11,000,202,00per prompt <200k token; ≥200k: 2,00/0,40/4,00
Grok 4.20 Multi-Agent1,250,202,50per prompt <200k token; ≥200k: 2,50/0,40/5,00
  • Il listino non indica scadenze né prezzi promozionali.

Mistral

Listino ufficiale verificato il 5 settembre 2026. Fonte

ModelloIngressoCacheUscitaNote
Mistral Large 30,500,051,50
Mistral Medium 3.51,500,157,50
Mistral Small 40,150,0150,60
Ministral 3 14B0,200,020,20
Ministral 3 8B0,150,0150,15
Ministral 3 3B0,100,010,10
Codestral0,300,030,90
Z.ai GLM 5.21,400,144,40modello di terze parti ospitato su Mistral
  • Il listino non indica scadenze. È il fornitore europeo con i prezzi più bassi della fascia alta.

DeepSeek

Listino ufficiale verificato il 25 agosto 2026. Fonte

ModelloIngressoCacheUscitaNote
deepseek-v4-pro0,660,0221,98prezzi fuori punta. Nelle ore di punta raddoppiano, 1,32 e 3,96
deepseek-v4-flash0,220,0070,66fuori punta. In punta 0,44 e 1,32
  • Unico listino che cambia per ora del giorno. Le ore di punta sono 01-04 e 06-10 UTC dal lunedì al venerdì, cioè in Italia 03-06 e 08-12 d'estate, quindi buona parte della mattinata lavorativa italiana cade nella fascia cara.

Come si legge questa tabella senza sbagliare il conto

Il prezzo per token è il numero meno importante dei quattro che servono. Contano quanto del contesto viene riusato, perché la cache costa un decimo dell'ingresso e in un agente di assistenza la parte riusata è quasi tutta. Conta la soglia del contesto lungo, perché su OpenAI, Google e xAI oltre una certa dimensione di prompt il prezzo cambia fascia da solo, mentre su Anthropic dal 4.6 in poi non cambia. Conta il moltiplicatore per la residenza dei dati, che per chi tratta dati di clienti o di iscritti non è un'opzione ma il presupposto per firmare. E conta il tokenizzatore, perché a parità di prezzo per token due modelli possono consumare quantità diverse di token sullo stesso testo.

Tutti i prezzi sono in dollari per milione di token, al netto di iva e di cambio. Sono esclusi i modelli ritirati e i listini dei rivenditori cloud, che hanno prezzi propri.

Errori e segnalazioni

Se un prezzo qui è cambiato o è sbagliato, scrivetemi a lukas.ferrazzi@rassegnaai.com e correggo con la data della verifica. Il conto completo di un agente reale, con volumi e assunzioni dichiarate, sta nella rubrica Il conto.