Cos'è un calcolatore di token per l'intelligenza artificiale?
Un token non è una parola. È l'unità minima di testo che un modello linguistico (LLM) come GPT, Claude, Gemini, Grok o DeepSeek legge e genera: può coincidere con una parola intera, con parte di una parola, con un singolo carattere o con un segno di punteggiatura. In inglese, un token equivale in media a circa 4 caratteri, ovvero a circa 0,75 parole. Poiché le API degli LLM fatturano in base al numero di token, ogni prompt inviato e ogni risposta ricevuta consumano credito. Un calcolatore di token AI converte il testo in un conteggio di token sui principali modelli e applica il prezzo per milione di token di ciascuno, così puoi vedere i costi di input e output prima di avviare la chiamata.
Per sviluppatori e aziende che costruiscono applicazioni basate sull'AI, comprendere il costo dei token è essenziale per la pianificazione del budget e il controllo delle spese. Ogni chiamata API a un LLM viene fatturata in base al numero di token di input (il prompt inviato) e token di output (la risposta generata dal modello). Una singola richiesta può costare frazioni di centesimo, ma su larga scala -- migliaia o milioni di richieste al giorno -- i costi dei token possono diventare una voce di spesa significativa.
La regola generale è che 1 token corrisponde a circa 4 caratteri di testo inglese, ovvero circa 0,75 parole. Per l'italiano il rapporto è meno favorevole: un testo di 1.000 parole italiane genera circa 1.500-1.700 token, perché i tokenizer dei modelli principali sono stati addestrati prevalentemente su testi in inglese e tendono a suddividere le parole italiane più lunghe in più sotto-token. La stessa frase può produrre conteggi diversi a seconda del modello, poiché ogni provider utilizza un tokenizer differente: OpenAI usa tiktoken (basato su BPE), Anthropic il proprio tokenizer e Google SentencePiece.
Come calcolare il costo dei token AI
Per calcolare il costo di una chiamata API a un modello AI servono tre informazioni: il numero di token di input, il numero di token di output e il prezzo per token del modello scelto.
Ecco il procedimento passo dopo passo:
1. Stimare i token di input. Incolla il testo del prompt nel nostro calcolatore oppure usa l'approssimazione di 1 token ogni 4 caratteri per l'inglese. Per l'italiano, considera circa 1,3-1,5 token per parola a causa della maggiore complessità morfologica.
2. Stimare i token di output. Corrisponde alla lunghezza attesa della risposta del modello. Una risposta breve è di circa 100-300 token, una spiegazione dettagliata può arrivare a 1.000-2.000 token.
3. Consultare il listino prezzi del modello. I provider AI pubblicano le tariffe come costo per 1 milione di token, con prezzi separati per input e output.
4. Applicare la formula di calcolo del costo (vedi sotto).
Esempio pratico: invii un prompt di 2.000 token a Claude Sonnet 4.6 (3 $ per 1M di token di input) e ricevi una risposta di 500 token (15 $ per 1M di token di output). Il costo è: (2.000 / 1.000.000 x 3) + (500 / 1.000.000 x 15) = 0,006 + 0,0075 = 0,0135 $ per richiesta, pari a circa 0,012 EUR. Con 10.000 richieste al giorno, il totale è circa 120 EUR giornalieri, ovvero circa 3.600 EUR al mese.
I token di output costano in genere 3-5 volte di più rispetto ai token di input, perché la generazione di ogni token richiede un passaggio separato attraverso il modello (forward pass sequenziale), mentre tutti i token di input vengono elaborati in parallelo in un unico passaggio.
Esempi pratici di calcolo dei costi dei token AI
Chatbot di assistenza clienti per un e-commerce italiano
Un negozio online italiano utilizza un chatbot AI per il supporto clienti basato su GPT-5.4 Nano (0,20 $ per 1M di token di input, 1,25 $ per 1M di token di output). Ogni conversazione ha in media 800 token di input (prompt di sistema + messaggio del cliente + storico conversazione) e 400 token di output (risposta del bot). Volume mensile: 50.000 conversazioni.
Costo input: 50.000 x 800 / 1.000.000 x 0,20 = 8,00 $
Costo output: 50.000 x 400 / 1.000.000 x 1,25 = 25,00 $
Costo mensile totale: 33,00 $ -- circa 30 EUR
Usando il prompt caching per il prompt di sistema di 300 token (cache hit fatturati al 10% della tariffa di input), il costo di input scende a circa 5,30 $ -- un risparmio di 2,70 $ al mese. Con un modello premium come Claude Sonnet 4.6 (3 $/15 $ per 1M token), lo stesso carico costerebbe 420 $ al mese (circa 385 EUR), quasi 13 volte di più. La scelta del modello è la leva più importante per l'ottimizzazione dei costi.
Analisi documenti per uno studio legale
Uno studio legale di Milano usa l'AI per analizzare quotidianamente 25 contratti (circa 3.000 token ciascuno) e generare riepiloghi (circa 800 token di output per documento). Su base mensile (22 giorni lavorativi): 550 richieste x (3.000 input + 800 output). Con Gemini 2.5 Flash (0,30 $/2,50 $ per 1M):
Costo input: 550 x 3.000 x 0,30 / 1.000.000 = 0,50 $
Costo output: 550 x 800 x 2,50 / 1.000.000 = 1,10 $
Totale: circa 1,60 $ al mese, ovvero meno di 1,50 EUR
Con GPT-5.4 (2,50 $/15 $ per 1M), il costo salirebbe a 10,73 $ (circa 9,90 EUR). In entrambi i casi, l'AI fa risparmiare allo studio ore di lavoro manuale per meno del costo di un caffè al giorno.
Assistente di programmazione per un team di sviluppo
Una startup tecnologica romana con un team di 15 sviluppatori usa un assistente AI basato su Claude Sonnet 4.6 (3 $ per 1M input, 15 $ per 1M output). Ogni sviluppatore effettua circa 40 richieste al giorno, con una media di 2.500 token di input (contesto del codice + domanda) e 800 token di output (suggerimenti + spiegazione).
Richieste giornaliere: 15 x 40 = 600
Costo input giornaliero: 600 x 2.500 / 1.000.000 x 3,00 = 4,50 $
Costo output giornaliero: 600 x 800 / 1.000.000 x 15,00 = 7,20 $
Totale giornaliero: 11,70 $ | Totale mensile (22 giorni): 257,40 $ -- circa 237 EUR
Ciò equivale a circa 15,80 EUR per sviluppatore al mese -- meno del costo di due pranzi. Rispetto ai guadagni di produttività derivanti dalla programmazione assistita dall'AI, il ritorno sull'investimento è notevole. Attivando il prompt caching per il prompt di sistema condiviso, i costi potrebbero ridursi di un ulteriore 15-25%.
Domande frequenti sui token AI e i costi delle API
Quanti token ci sono in 1.000 parole di testo italiano?
Circa 1.500-1.700 token. In italiano il rapporto è meno favorevole rispetto all'inglese (dove 1.000 parole corrispondono a circa 1.333 token) perché i tokenizer dei modelli AI sono stati addestrati prevalentemente su testi in inglese. Le parole italiane più lunghe e la maggiore complessità morfologica causano una suddivisione in più sotto-token. Ad esempio, 'assicurazione' potrebbe essere scomposta in 3-4 token, mentre parole brevi come 'il' o 'con' restano un singolo token. Il codice e i testi con molti caratteri speciali tendono a usare ancora più token.
Perché i token di output costano più di quelli di input?
I token di output costano 3-5 volte di più a causa del funzionamento interno degli LLM. I token di input vengono elaborati in un singolo passaggio (forward pass), con tutti i token calcolati in parallelo. I token di output, invece, devono essere generati uno alla volta in modo sequenziale: ogni nuovo token richiede un passaggio separato attraverso il modello. Questa generazione sequenziale è molto più dispendiosa in termini di calcolo e memoria GPU. Ad esempio, Claude Sonnet 4.6 addebita 3 $ per milione di token di input ma 15 $ per milione di token di output -- un rapporto 5:1.
Qual è il modello AI più economico per le API nel 2026?
A giugno 2026, i modelli API più economici per provider sono: Amazon Nova Micro (0,035 $/0,14 $ per 1M token), Amazon Nova Micro (0,035 $/0,14 $), Cohere Command R7B (0,0375 $/0,15 $), Gemini 2.5 Flash-Lite (0,10 $/0,40 $), DeepSeek V4 Flash (0,14 $/0,28 $) e Mistral Small 4 (0,15 $/0,60 $). Per budget intermedi: Gemini 3.1 Flash-Lite (0,25 $/1,50 $), Gemini 2.5 Flash (0,30 $/2,50 $), DeepSeek V4 Pro (0,435 $/0,87 $), Mistral Large 3 (0,50 $/1,50 $), GPT-5.4 Mini (0,75 $/4,50 $), Claude Haiku 4.5 (1 $/5 $) e Grok 4.3 (1,25 $/2,50 $). Per le massime prestazioni: GPT-5.4 (2,50 $/15 $), Claude Sonnet 4.6 (3 $/15 $), Claude Opus 4.8 (5 $/25 $), GPT-5.5 (5 $/30 $) e Claude Fable 5 (10 $/50 $). La scelta migliore dipende dai requisiti qualitativi dell'applicazione.
Come funziona il prompt caching e quanto si risparmia?
Il prompt caching memorizza i vettori chiave-valore dei prefissi di prompt ripetuti (come i prompt di sistema) in modo che non debbano essere ricalcolati ad ogni richiesta. I token memorizzati nella cache vengono fatturati a circa il 10-25% della tariffa standard, a seconda del provider -- sia la famiglia GPT-5.4/5.5 di OpenAI sia i modelli Claude di Anthropic fatturano i cache hit al 10% del prezzo di input. Per le applicazioni che inviano lo stesso prompt di sistema ad ogni richiesta -- chatbot, assistenti alla programmazione, processori di documenti -- il prompt caching può ridurre i costi totali di input fino al 90%. OpenAI lo applica automaticamente, mentre Anthropic e Google richiedono una configurazione esplicita.
I testi in italiano costano di più rispetto all'inglese con le API AI?
Sì, tipicamente il 20-35% in più. I testi italiani generano più token rispetto alla stessa informazione scritta in inglese, perché i tokenizer BPE si basano su dati di addestramento a predominanza anglofona. Parole italiane lunghe come 'commercializzazione' o 'sottoscrizione' vengono suddivise in più token. Anche le lettere accentate (à, è, ù) possono generare token aggiuntivi. Chi sviluppa applicazioni AI per il mercato italiano dovrebbe considerare questo sovrapprezzo nella pianificazione dei costi.
Qual è la differenza tra token e parole?
Una parola è un'unità linguistica separata da spazi. Un token è un'unità definita dal tokenizer del modello: può essere una parola intera, parte di una parola, un singolo carattere o un segno di punteggiatura. Parole comuni come 'il' o 'che' sono di solito un token. Parole più lunghe o meno frequenti vengono suddivise in più token: 'incredibile' potrebbe diventare 'in', 'cred', 'ibile' (3 token). Numeri, codice e testo non inglese richiedono generalmente più token per parola, motivo per cui la fatturazione basata sui token non corrisponde direttamente al conteggio delle parole.
Quanto costa elaborare un documento di 10.000 parole con GPT?
Un documento di 10.000 parole italiane corrisponde a circa 15.000-17.000 token di input (la stima è superiore rispetto all'inglese). Con GPT-5.4 (2,50 $ per 1M token di input), il costo del solo input è circa 0,038-0,043 $. Se il modello genera un riassunto di 500 parole (circa 750-850 token di output a 15,00 $ per 1M), il costo dell'output è circa 0,011-0,013 $. Costo totale per documento: circa 0,049-0,056 $ (poco più di 0,05 EUR). Elaborare 1.000 documenti simili costerebbe circa 49-56 EUR. Con il più economico GPT-5.4 Mini (0,75 $/4,50 $), la stessa operazione costa circa 0,016 $ per documento -- oltre 3 volte meno.
Come si confrontano i prezzi di GPT, Claude e Gemini nel 2026?
A giugno 2026 (input/output per 1M token): Budget -- Amazon Nova Micro (0,035 $/0,14 $), Cohere Command R7B (0,0375 $/0,15 $), Gemini 2.5 Flash-Lite (0,10 $/0,40 $), DeepSeek V4 Flash (0,14 $/0,28 $), Mistral Small 4 (0,15 $/0,60 $) e GPT-5.6 Luna (0,20 $/1,20 $). Fascia media -- Gemini 3.1 Flash-Lite 0,25 $/1,50 $, Gemini 2.5 Flash 0,30 $/2,50 $, Gemini 3.5 Flash-Lite 0,30 $/2,50 $, Codestral 0,30 $/0,90 $, DeepSeek V4 Pro 0,435 $/0,87 $, Mistral Large 3 0,50 $/1,50 $, Llama 3.3 70B via Groq 0,59 $/0,79 $, GPT-5.4 Mini 0,75 $/4,50 $, Claude Haiku 4.5 1 $/5 $, Grok 4.3 1,25 $/2,50 $. Premium -- Gemini 2.5 Pro 1,25 $/10 $, Gemini 3.5 Flash 1,50 $/9 $, Mistral Medium 3.5 1,50 $/7,50 $, Gemini 3.1 Pro 2 $/12 $, Cohere Command R+ 2,50 $/10 $, GPT-5.4 2,50 $/15 $, Amazon Nova Premier 2,50 $/12,50 $, Claude Sonnet 4.6 3 $/15 $, Claude Opus 4.8 5 $/25 $, GPT-5.5 5 $/30 $, Claude Fable 5 10 $/50 $. Nota: OpenAI ha rimosso i modelli più vecchi (GPT-4.1, GPT-4o, o3, da GPT-5 a 5.3) dal suo listino standard e DeepSeek ha consolidato V3.2 e R1 nella famiglia V4.
Quali modelli AI sono i migliori per programmazione, ragionamento e scrittura creativa?
Programmazione: Claude Fable 5, Claude Opus 4.8 e Claude Sonnet 4.6 (Anthropic) sono leader nei benchmark per il codice, seguiti da GPT-5.5 e GPT-5.4 (OpenAI) -- i modelli Claude includono una finestra di contesto da 1M token a prezzo standard, ideale per basi di codice estese. Codestral di Mistral è specializzato per il codice a un costo contenuto (0,30 $/0,90 $ per 1M token), affiancato da Devstral 2 (0,40 $/2,00 $) per i flussi di lavoro di coding agentico. Ragionamento e matematica: GPT-5.5 e GPT-5.4 (OpenAI) usano il chain-of-thought reasoning, DeepSeek V4 Pro (0,435 $/0,87 $) è il campione del ragionamento a basso costo, Gemini 3.1 Pro (Google) eccelle nell'analisi complessa. Scrittura creativa e attività generali: Claude Sonnet 4.6 bilancia qualità e costo, Gemini 3.5 Flash gestisce input multimodali ad alta velocità e Grok 4.3 di xAI (1,25 $/2,50 $) offre buone prestazioni con accesso ai dati in tempo reale. Per volumi elevati a basso costo: DeepSeek V4 Flash, Amazon Nova Micro, Mistral Small 4 e Llama 4 via Groq offrono i prezzi per token più bassi.
Quanto costa GPT-5.6 Sol per milione di token?
GPT-5.6 Sol costa 5 $ per milione di token in input e 30 $ per milione in output. Terra è a 2 $/12 $ e Luna a 0,20 $/1,20 $. Per un chatbot con 2.000 token in input e 500 in output, a 100 richieste al giorno, sono 75,00 $ al mese con Sol, 30,00 $ con Terra e 3,00 $ con Luna: tra il livello più economico e quello più caro c'è esattamente un fattore 25.
Quanto costa Claude Opus 5 ed è più economico di GPT-5.6 Sol?
Claude Opus 5 costa 5 dollari per milione di token in input e 25 in output; Claude Sonnet 5 è a 3 $/15 $ dollari. Opus 5 ha lo stesso prezzo in input di GPT-5.6 Sol ma un output più economico, quindi la risposta dipende dal tuo rapporto: sullo stesso chatbot 2.000/500 a 100 richieste al giorno Opus 5 costa 67,50 dollari al mese contro i 75,00 di Sol, mentre su carichi dominati dall'input i due restano a meno di un centesimo di differenza per richiesta.
Un modello nuovo allo stesso prezzo costa davvero uguale?
Non sempre. I modelli da Claude 4.7 in poi (Opus 5, Opus 4.8, Sonnet 5) usano un nuovo tokenizzatore che divide lo stesso testo in circa il 30% di token in più rispetto a Sonnet 4.6 e precedenti. Sonnet 5 e Sonnet 4.6 sono entrambi a 3/15 dollari, ma un carico che su Sonnet 4.6 costava 40,50 dollari al mese su Sonnet 5 arriva a circa 52,65. Il passaggio da Opus 4.8 a Opus 5 è invece neutro, perché entrambi usano già il nuovo tokenizzatore.