Calculadora de custo de tokens. Preço por milhão de tokens de GPT-5.6 Sol, Terra e Luna, Claude Opus 5, Sonnet 5, Gemini e DeepSeek.
Esta calculadora de tokens põe preço em qualquer chamada de API de IA: GPT-5.6 Sol, Terra ou Luna, Claude Opus 5 ou Sonnet 5, Gemini, Grok e DeepSeek. Aplica a tarifa oficial por milhão de tokens à sua entrada e à sua saída e mostra o custo por requisição, por dia, por mês e por ano.
O que é um token e por que as APIs de IA cobram por token
Um token é o pedaço de texto que um modelo de linguagem realmente lê e escreve — não uma palavra inteira, mas um fragmento de palavra. Em inglês, um token equivale em média a cerca de 4 caracteres ou 0,75 palavra, então 1.000 palavras saem por aproximadamente 1.333 tokens. Todos os modelos das famílias GPT-5.6, Claude, Gemini, Grok e DeepSeek quebram o seu texto nesses fragmentos antes de fazer qualquer outra coisa, e o contador começa a rodar no primeiro deles.
As APIs faturam por token e dividem a conta em duas partes: os tokens de entrada (as instruções do sistema, o contexto, o histórico da conversa e a sua pergunta) e os tokens de saída (a resposta do modelo). Os provedores publicam as duas tarifas em dólares por milhão de tokens, e a saída quase sempre é o lado caro. O múltiplo é surpreendentemente estável dentro de cada família: os três níveis do GPT-5.6 cobram a saída exatamente seis vezes mais que a entrada, toda a linha Claude cobra cinco vezes mais, o Grok 4.5 três vezes e só modelos como o DeepSeek V4 Pro deixam a diferença no dobro. Uma chamada isolada pode custar uma fração de centavo de dólar, mas multiplique isso por dezenas de milhares de requisições por dia e o gasto com tokens vira uma linha de verdade no orçamento.
O português paga um pedágio silencioso, e essa é a conta que nenhuma tabela de preços mostra. Para o mesmo conteúdo, um texto em português consome de 30% a 40% mais tokens que em inglês nos tokenizadores atuais — algo entre 1,7 e 1,9 tokens por palavra, contra os cerca de 1,33 do inglês. O motivo é que o vocabulário dos tokenizadores foi treinado majoritariamente em inglês: palavras comuns em inglês ganham um token dedicado, enquanto "desenvolvimento", "inteligência" ou "disponibilidade" são remontadas a partir de sub-pedaços. A boa notícia é que a defasagem vem encolhendo geração a geração: medições publicadas colocam o português em cerca de 1,94 vez os tokens do inglês no tokenizador do GPT-2, 1,48 vez no do GPT-4 e algo entre 1,3 e 1,4 vez nos tokenizadores da geração o200k_base que a família GPT-5.x usa. Em caracteres, o português fica por volta de 3 a 3,5 caracteres por token, contra os cerca de 4 do inglês. Na prática: 1.000 palavras em português ficam entre 1.700 e 1.900 tokens, uma página A4 (cerca de 500 palavras) sai por volta de 875 tokens, e a regra repetida por aí de que "1.000 tokens equivalem a 750 palavras" só vale para o inglês — em português, 1.000 tokens rendem cerca de 570 palavras.
A contagem exata do mesmo texto muda de um modelo para outro porque cada provedor carrega o seu próprio tokenizador: os GPT novos usam a codificação o200k_base, e Anthropic, Google e DeepSeek têm o deles. O que pega a maioria dos times de surpresa é que a contagem também muda entre gerações da mesma família. A documentação da Anthropic é explícita: o Claude Sonnet 5 usa um tokenizador novo e "o mesmo texto de entrada produz aproximadamente 30% mais tokens do que no Claude Sonnet 4.6". A tarifa não se moveu — os dois figuram a 3 USD de entrada e 15 de saída por milhão —, então o mesmo prompt fatura cerca de 30% mais no Sonnet 5. O detalhe fino que quase ninguém conta: migrar do Opus 4.8 para o Opus 5 é neutro de verdade, porque os dois já usam o tokenizador novo. Código, JSON, números e texto não inglês são os que se fragmentam mais, e é por isso que preço por token nunca se traduz limpo em contagem de palavras.
Julho de 2026 mexeu no topo do mercado duas vezes. No dia 9, a OpenAI colocou o GPT-5.6 em disponibilidade geral como três modelos separados, em vez de um modelo com esforço de raciocínio ajustável: Sol como carro-chefe, Terra como o nível equilibrado do dia a dia e Luna como o mais rápido e barato. No dia 24, a Anthropic publicou o Claude Opus 5 ao lado do Claude Fable 5 e do Claude Sonnet 5. O que chama atenção está na tabela de preços: o Sol custa o mesmo que o GPT-5.5 (5 e 30 USD), o Terra o mesmo que o GPT-5.4 (2,50 e 15), o Opus 5 o mesmo que o Opus 4.8 (5 e 25) e o Sonnet 5 o mesmo que o Sonnet 4.6 (3 e 15). Chegou uma geração inteira de capacidade a preço plano, então a pergunta interessante deixou de ser "quanto subiu" e passou a ser "de qual nível eu preciso de verdade". O único ponto de preço realmente novo é o GPT-5.6 Luna a 1 e 6 USD, que aterrissa colado no Claude Haiku 4.5 (1 e 5): idênticos na entrada, um dólar de diferença na saída.
Esta calculadora já vem com as tarifas padrão publicadas de nove provedores: OpenAI, Anthropic, Google, xAI, DeepSeek, Mistral, Amazon, Meta e Cohere. O leque é de quase três ordens de magnitude. O Amazon Nova Micro está em uma ponta, com 0,035 USD de entrada e 0,14 de saída por milhão; o GPT-5.5 Pro na outra, com 30 e 180 — ou seja, 857 vezes a entrada do Nova Micro. No meio ficam o Claude Fable 5 a 10/50 USD, o GPT-5.6 Sol a 5/30 USD, o Claude Opus 5 a 5/25 USD, o Claude Sonnet 5 a 3/15 USD, o GPT-5.6 Terra a 2/12 USD, o Grok 4.5 a 2/6 USD, o Gemini 3.6 Flash a 1,50/7,50 USD, o GPT-5.6 Luna a 0,20/1,20 USD e o DeepSeek V4 Pro a 0,435/0,87 USD. Todos os números são a tarifa padrão sob demanda, sem lote, sem cache e sem faixa de contexto longo, e o Claude Sonnet 5 aparece pelo preço padrão e não pelo promocional de lançamento, para que um orçamento montado aqui não quebre quando a promoção vencer. Se o seu modelo não está na lista, escolha "Personalizado" e informe o preço por mil ou por milhão de tokens: o custo por requisição, mensal e anual é calculado do mesmo jeito. Todos os valores aparecem em dólares (USD), que é a moeda com que esses provedores faturam a API — para chegar ao custo efetivo em reais, veja o método do IOF e do spread no sexto exemplo.
Como usar a calculadora de custo de tokens
Do nome do modelo até a conta do mês são poucos passos.
1. Escolha o modelo. O menu agrupa os preajustes por provedor: ao selecionar GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5, Claude Sonnet 5, DeepSeek V4 Pro ou qualquer outro, a tarifa oficial é preenchida automaticamente. Se você usa algo que não está na lista (um modelo interno, um recém-lançado ou o modo rápido do Opus 5, faturado a 10 / 50 USD por milhão), escolha "Personalizado" e digite o preço à mão.
2. Confirme o preço e a unidade. O botão 1K / 1M ao lado do preço alterna entre "por mil tokens" e "por milhão de tokens". Quase todos os provedores publicam a tarifa por milhão, mas se você só tem o preço por mil, troque a unidade em vez de dividir na mão. Tudo é calculado em USD.
3. Preencha os tokens e a frequência. Informe os tokens de entrada, os de saída e o número de requisições por dia. Não sabe quantos tokens gasta? Passe o seu texto pelo estimador que fica mais abaixo na página.
4. Leia os quatro cartões de resultado. Você vê o custo por requisição, por dia, por mês e por ano, com o custo de entrada e o de saída separados — assim dá para saber se o problema é um prompt comprido demais ou uma resposta que se alonga sem freio.
5. Estime tokens a partir de texto. Cole qualquer texto e a ferramenta mostra caracteres, palavras e tokens estimados com a heurística geral máx(⌈caracteres/4⌉, ⌈palavras×1,33⌉). Serve para orçar; para uma contagem exata, use o tiktoken ou o campo usage que a API devolve.
O custo de uma chamada isolada obedece a esta fórmula:
C=1.000.000Tin×Pin+Tout×Pout
Ou seja: tokens de entrada vezes a tarifa de entrada, mais tokens de saída vezes a tarifa de saída, tudo escalado de "por milhão" para "por token". Multiplique pelas requisições por dia para o número diário e depois por 30 para o orçamento mensal ou por 365 para o anual — a calculadora usa um mês plano de 30 dias, então duas projeções feitas com um mês de diferença continuam comparáveis.
Um ajuste que quase ninguém faz e que importa muito aqui: o estimador de texto usa a heurística de 4 caracteres por token, calibrada para o inglês. Como o português fica em torno de 3 a 3,5 caracteres por token, para texto todo em português some entre 15% e 30% ao número que o estimador mostra antes de jogá-lo no campo de tokens de entrada. Se você mede em produção, nem precisa estimar: leia o campo usage que a API devolve em algumas chamadas reais e use aqueles valores.
O hábito mais útil é passar os mesmos números de tokens por três níveis antes de decidir: precifique a sua carga de trabalho no carro-chefe, no equilibrado e no barato da mesma família e depois veja se o salto de qualidade justifica a diferença do cartão anual. Todo o cálculo acontece no seu navegador: o texto que você cola não é enviado a nenhum servidor nem consome cota de nenhum modelo.
Fórmula do custo de tokens
C=1.000.000Tin×Pin+1.000.000Tout×Pout
C = Custo total por requisição (em dólares, a moeda com que os provedores faturam)
Tin = Número de tokens de entrada (o prompt que você envia: sistema, contexto, histórico e pergunta)
Tout = Número de tokens de saída (a resposta gerada pelo modelo, incluindo tokens de pensamento)
Pin = Preço por milhão de tokens de entrada do modelo escolhido
Pout = Preço por milhão de tokens de saída do modelo escolhido
Para projetar o custo de um projeto inteiro, as variáveis se ampliam com o volume de uso:
Onde N é o número de requisições por dia. A projeção mensal usa um mês plano de 30 dias de propósito, para que dois orçamentos feitos em meses diferentes possam ser comparados; sobre a fatura real, um mês de 31 dias sai cerca de 3% acima e fevereiro cerca de 7% abaixo.
Para estimar tokens a partir de texto, a regra geral é que 1 token equivale a cerca de 4 caracteres em inglês. Em português a eficiência cai, por causa das conjugações, dos acentos e das palavras mais longas:
T≈3,25caracteresouT≈palavras×1,75
Isso coloca o mesmo conteúdo de 30% a 40% acima da versão inglesa. O número depende do tokenizador, então trate-o como ordem de magnitude e não como constante: medições publicadas apontam 1,94 vez os tokens do inglês no tokenizador do GPT-2, 1,48 vez no do GPT-4 e algo entre 1,3 e 1,4 vez nos da geração o200k_base.
Há uma variável que a fórmula esconde: o número de tokens de entrada e de saída não é uma propriedade do texto, mas do par texto-modelo. O mesmo prompt dá contagens diferentes em cada tokenizador, e dentro da Anthropic o Claude Sonnet 5 produz aproximadamente 30% mais tokens que o Sonnet 4.6 para o mesmo conteúdo. Por isso, ao comparar dois modelos, o correto é medir os tokens contra cada um deles (com o campo usage da API) em vez de reaproveitar uma única contagem para toda a comparação: se você mantém os tokens fixos e só troca os preços de entrada e de saída, está comparando tarifas, não custos.
E uma última camada, essa fora da fórmula do provedor: para chegar ao custo efetivo em reais, multiplique o resultado pela cotação do dia, pelo spread do seu banco e pelo IOF de câmbio de 3,5%. O fator extra fica entre 1,045 e 1,076, dependendo do spread.
Preço por milhão de tokens de cada modelo (quanto custa 1M de tokens)
Modelo
Entrada (USD / milhão)
Saída (USD / milhão)
Saída ÷ entrada
Amazon Nova Micro
0,035 USD
0,14 USD
4×
Cohere Command R7B
0,0375 USD
0,15 USD
4×
Gemini 2.5 Flash-Lite
0,10 USD
0,40 USD
4×
DeepSeek V4 Flash
0,14 USD
0,28 USD
2×
Mistral Small 4
0,15 USD
0,60 USD
4×
GPT-5.6 Luna
0,20 USD
1,20 USD
6×
GPT-5.4 Nano
0,20 USD
1,25 USD
6,3×
Gemini 3.1 Flash-Lite
0,25 USD
1,50 USD
6×
Codestral
0,30 USD
0,90 USD
3×
Gemini 3.5 Flash-Lite
0,30 USD
2,50 USD
8,3×
Gemini 2.5 Flash
0,30 USD
2,50 USD
8,3×
DeepSeek V4 Pro
0,435 USD
0,87 USD
2×
Mistral Large 3
0,50 USD
1,50 USD
3×
Llama 3.3 70B
0,59 USD
0,79 USD
1,3×
GPT-5.4 Mini
0,75 USD
4,50 USD
6×
Amazon Nova Pro
0,80 USD
3,20 USD
4×
Claude Haiku 4.5
1 USD
5 USD
5×
Grok 4.3
1,25 USD
2,50 USD
2×
Gemini 2.5 Pro
1,25 USD
10 USD
8×
Gemini 3.6 Flash
1,50 USD
7,50 USD
5×
Mistral Medium 3.5
1,50 USD
7,50 USD
5×
Gemini 3.5 Flash
1,50 USD
9 USD
6×
GPT-5.3 Codex
1,75 USD
14 USD
8×
Grok 4.5
2 USD
6 USD
3×
GPT-5.6 Terra
2 USD
12 USD
6×
Gemini 3.1 Pro
2 USD
12 USD
6×
Cohere Command R+
2,50 USD
10 USD
4×
Amazon Nova Premier
2,50 USD
12,50 USD
5×
GPT-5.4
2,50 USD
15 USD
6×
Claude Sonnet 5
3 USD
15 USD
5×
Claude Sonnet 4.6
3 USD
15 USD
5×
Claude Opus 5
5 USD
25 USD
5×
Claude Opus 4.8
5 USD
25 USD
5×
GPT-5.6 Sol
5 USD
30 USD
6×
GPT-5.5
5 USD
30 USD
6×
Claude Fable 5
10 USD
50 USD
5×
GPT-5.5 Pro
30 USD
180 USD
6×
Exemplos de custo com números reais do motor de cálculo
Chatbot de atendimento no GPT-5.6: 100 conversas por dia
Um chatbot de e-commerce atende 100 conversas por dia. Cada uma gasta cerca de 2.000 tokens de entrada (instruções do sistema + histórico + pergunta do cliente) e cerca de 500 tokens de saída.
Com GPT-5.6 Sol (5/30 USD por milhão): 0,025 USD por conversa, 2,50 USD por dia, 75,00 USD por mês e 912,50 USD por ano.
Com GPT-5.6 Terra (2/12 USD): 0,01 USD por conversa, 1,00 USD por dia, 30,00 USD por mês e 365,00 USD por ano. É 40% do Sol em todas as linhas, porque o Terra cobra essa mesma proporção nos dois lados.
Com GPT-5.6 Luna (0,20/1,20 USD): 0,001 USD por conversa, 0,10 USD por dia, 3,00 USD por mês e 36,50 USD por ano.
Com Claude Opus 5 (5/25 USD): 0,0225 USD por conversa, 2,25 USD por dia, 67,50 USD por mês e 821,25 USD por ano.
Com Claude Sonnet 5 (3/15 USD): 0,0135 USD por conversa, 1,35 USD por dia, 40,50 USD por mês e 492,75 USD por ano.
Com Claude Haiku 4.5 (1/5 USD): 0,0045 USD por conversa, 0,45 USD por dia, 13,50 USD por mês e 164,25 USD por ano.
Com Gemini 3.6 Flash (1,50/7,50 USD): 0,0068 USD por conversa, 0,675 USD por dia, 20,25 USD por mês e 246,38 USD por ano.
Com DeepSeek V4 Pro (0,435/0,87 USD): 0,0013 USD por conversa, 0,1305 USD por dia, 3,92 USD por mês e 47,63 USD por ano.
Mesmo tráfego, e o leque mensal vai de 75,00 USD no alto a 3,00 USD embaixo: um fator de 25. E não precisa trocar de provedor para mexer o ponteiro: ficando dentro do GPT-5.6 e descendo de Sol para Luna você tem esse salto inteiro, 912,50 USD por ano contra 36,50 USD. Repare também que o Claude Haiku 4.5 pede 5 vezes a entrada do Luna estando na mesma faixa, o tipo de diferença que vale calcular em vez de supor. Um aviso importante: estes números tratam as contagens de tokens como já medidas. Se os seus prompts são em português, suba-os (veja o quinto exemplo); e se você migrar o mesmo texto do Sonnet 4.6 para o Sonnet 5, suba-os mais 30% (quarto exemplo). Escolher o modelo é quase sempre a maior alavanca da conta.
GPT-5.6 Sol contra Claude Opus 5: agente de código com 200 chamadas por dia
O agente de código é a carga de trabalho em que os dois novos carros-chefe competem de verdade. Suponha que cada chamada leve 20.000 tokens de entrada (o contexto do repositório, o diff e as instruções) e devolva 3.000 tokens de saída, com 200 chamadas por dia.
Com GPT-5.6 Sol (5/30 USD): 0,10 USD de entrada mais 0,09 USD de saída dão 0,19 USD por chamada, 38,00 USD por dia, 1.140,00 USD por mês e 13.870,00 USD por ano.
Com Claude Opus 5 (5/25 USD): 0,10 USD mais 0,075 USD dão 0,175 USD por chamada, 35,00 USD por dia, 1.050,00 USD por mês e 12.775,00 USD por ano.
Os dois carros-chefe cobram a mesma entrada de 5 USD, então toda a diferença vem da saída: 90,00 USD por mês e 1.095,00 por ano — o Sol custa 8,6% mais que o Opus 5. É um número real, mas pequeno, e ele se inverte no momento em que a sua carga fica mais pesada de saída ou de entrada. É justamente por isso que vale precificar a sua própria mistura de tokens em vez de confiar em uma manchete.
O dinheiro está no nível de baixo. Com GPT-5.6 Terra (2/12 USD): 0,076 USD por chamada, 15,20 USD por dia, 456,00 USD por mês e 5.548,00 USD por ano. Com Claude Sonnet 5 (3/15 USD): 0,105 USD por chamada, 21,00 USD por dia, 630,00 USD por mês e 7.665,00 USD por ano. Com GPT-5.6 Luna (0,20/1,20 USD): 0,0076 USD por chamada, 1,52 USD por dia, 45,60 USD por mês e 554,80 USD por ano.
E uma surpresa que só aparece quando você faz a conta: o GPT-5.3 Codex (1,75/14 USD), um modelo especializado da geração anterior, sai por 0,077 USD por chamada, 15,40 por dia, 462,00 por mês e 5.621,00 por ano. Com esta mistura de tokens ele é mais barato que o Terra (462,00 USD contra 456,00 USD por mês), porque a entrada dele é 30% menor e um agente de código é intensivo em entrada.
O teto: o Claude Fable 5 (10/50 USD) custa 0,35 USD por chamada, 70,00 por dia, 2.100,00 por mês e 25.550,00 por ano — exatamente o dobro do Opus 5. Entre o Luna e o Fable 5, com as mesmas 200 chamadas por dia, há 22.776,00 USD de diferença por ano.
Documento longo ou RAG: ler 100.000 tokens de uma vez
Cenário de RAG ou documento longo: você coloca um relatório de cerca de 100.000 tokens de entrada (mais ou menos um livro curto) e pede um resumo de 2.000 tokens de saída, em uma única requisição.
Com GPT-5.6 Sol: 0,50 USD de entrada mais 0,06 USD de saída, 0,56 USD no total.
Com Claude Opus 5 (5/25 USD): 0,50 mais 0,05, ou seja 0,55 USD por requisição — um centavo abaixo do Sol, porque com esta mistura a entrada compartilhada de 5 USD leva cerca de 90% da fatura e a tarifa de saída quase não vota.
Com Claude Sonnet 5 (3/15 USD): 0,30 mais 0,03, ou seja 0,33 USD.
Com GPT-5.6 Terra (2/12 USD): 0,25 mais 0,03, ou seja 0,28 USD.
Com Gemini 3.6 Flash (1,50/7,50 USD): 0,15 mais 0,015, ou seja 0,165 USD.
Com GPT-5.6 Luna (0,20/1,20 USD): 0,10 mais 0,012, ou seja 0,112 USD.
Com DeepSeek V4 Pro: 0,0435 mais 0,00174, ou seja 0,0452 USD por requisição — cerca de um doze avos do Sol (0,56 contra 0,0452). A lição é a imagem espelhada do caso do chatbot: com contexto longo, a entrada come quase todo o custo, então em documentos e RAG o fator decisivo é o preço de entrada, não o de saída. Isso também explica por que Sol e Opus 5 parecem intercambiáveis aqui e se separam no tráfego de chat.
A armadilha do mesmo preço: Claude Sonnet 5 contra Sonnet 4.6
Este é o caso que uma tabela de tarifas nunca vai te mostrar. O Claude Sonnet 5 e o Claude Sonnet 4.6 figuram os dois a 3 USD de entrada e 15 de saída por milhão, então no papel a atualização sai de graça. Mas a documentação da Anthropic diz, com essas palavras, que o Sonnet 5 usa um tokenizador novo e que "o mesmo texto de entrada produz aproximadamente 30% mais tokens do que no Claude Sonnet 4.6".
Pegue o chatbot do primeiro exemplo: 2.000 tokens de entrada e 500 de saída por conversa, 100 conversas por dia. Com o Sonnet 4.6 são 0,0135 USD por conversa, 40,50 USD por mês e 492,75 USD por ano.
Mande o texto idêntico ao Sonnet 5 e o mesmo prompt tokeniza em cerca de 2.600 tokens de entrada e 650 de saída. Às mesmas tarifas de 3 e 15 USD: 0,01755 USD por conversa, 1,755 por dia, 52,65 USD por mês e 640,58 por ano.
Mesmo texto, mesma tabela de tarifas, 12,15 USD mais por mês e 147,83 mais por ano — uma alta de 30% que não aparece em nenhuma página de preços. Em prosa a inflação fica na parte baixa da faixa; em código, JSON e cargas estruturadas ela sobe, e a própria Anthropic avisa que "o aumento exato depende do conteúdo", então trate os 30% como número de planejamento e não como multiplicador fixo.
O detalhe que quase ninguém conta: isso não vale para o Opus. O Claude Opus 4.8 e o Claude Opus 5 usam os dois o tokenizador novo, então esse salto é neutro de verdade e os 67,50 USD por mês do primeiro exemplo valem para os dois.
Como usar a calculadora aqui: não reaproveite as contagens de tokens que você mediu com um modelo antigo. Passe uma amostra real pelo estimador ou, melhor, leia o campo usage que a API devolve em algumas chamadas de verdade contra o modelo novo e informe esses números. Uma migração que parece neutra na tarifa pode terminar 30% acima do orçamento.
O pedágio do português: o mesmo bot em inglês e em português
Aqui está a conta que só interessa a quem escreve em português — e que nenhuma tabela de preços em dólar mostra. Praticamente todo benchmark de custo publicado mede tokens em inglês. Se o seu prompt de sistema, o seu contexto e as respostas do seu produto são em português, os números de que você partiu já estão baixos de 30% a 40%.
Volte ao chatbot do primeiro exemplo, mas agora com a origem explícita: a versão em inglês mede 2.000 tokens de entrada e 500 de saída. O mesmo conteúdo em português, a 1,35 vez os tokens do inglês, mede cerca de 2.700 de entrada e 675 de saída.
Com GPT-5.6 Terra (2/12 USD), a versão em inglês custa 0,0125 USD por conversa, 37,50 por mês e 456,25 por ano. A versão em português custa 0,016875 USD por conversa, 1,6875 por dia, 50,63 USD por mês e 615,94 por ano. São 13,13 USD mais por mês e 159,69 mais por ano — exatamente os 35% do pedágio, sem que ninguém tenha mexido em uma vírgula da tarifa.
Com GPT-5.6 Sol (5/30 USD) o mesmo pedágio pesa mais em valor absoluto: de 75,00 para 101,25 USD por mês, ou 26,25 USD a mais. E com DeepSeek V4 Pro (0,435/0,87 USD), de 3,92 para 5,29 USD por mês — os 35% continuam lá, só que sobre uma base pequena.
Agora o pior cenário, o que empilha os dois efeitos: prompts em português rodando em um Claude Sonnet 5, que ainda por cima tokeniza 30% acima do Sonnet 4.6. O português leva os 2.000 / 500 originais para 2.700 / 675, e o tokenizador novo leva esses para cerca de 3.510 de entrada e 878 de saída. Às tarifas de 3 e 15 USD: 0,0237 USD por conversa, 2,37 por dia, 71,10 USD por mês e 865,05 por ano. Contra os 40,50 USD por mês que você leria de um benchmark em inglês no Sonnet 4.6, são 75,6% mais — e nenhum desses pontos percentuais aparece em qualquer página de preços.
O que fazer com isso, na ordem: meça em produção com o campo usage em vez de estimar; escreva o prompt de sistema em inglês e deixe o português só para o que o usuário lê (é a parte que importa, e costuma ser a menor); e, se for estimar mesmo assim, informe na calculadora os tokens já corrigidos, não os do benchmark em inglês.
Do dólar ao real: o IOF e o spread que não estão na tarifa
Todos os provedores desta lista faturam em dólar, então a tarifa por milhão de tokens é a mesma para você e para um time em San Francisco. O que não é igual é o que sai da sua conta no fim do mês, e essa parte quase nenhuma comparação brasileira calcula direito — várias ainda repetem que o IOF de câmbio está zerado, o que deixou de valer quando o Decreto nº 12.499/2025 unificou a alíquota das operações de câmbio em 3,5%.
O custo efetivo tem três camadas e uma fórmula simples: valor em USD × cotação do dia × (1 + spread do seu banco) × (1 + IOF). A cotação muda todo dia e por isso não faz sentido fixar nenhuma aqui; o que é estável é o multiplicador das outras duas camadas. Com um spread de 1%, típico de fintechs de câmbio, o fator fica em 1,01 × 1,035 = 1,0453, ou seja 4,5% acima da conversão simples. Com 2%, vai a 5,6%. Com os 4% que cartões de crédito de banco tradicional costumam cobrar, chega a 7,6%.
Aplicado ao chatbot do primeiro exemplo no GPT-5.6 Terra: os 30,00 USD por mês da tarifa viram entre 31,36 e 32,30 USD de custo efetivo, dependendo do seu spread. No ano, os 365,00 USD viram entre 381,56 e 392,88 — de 16,56 a 27,88 USD só de imposto e spread, sem uma única chamada extra à API.
Na prática são de 4,5% a 7,6% que ninguém coloca na planilha. Não quebram um orçamento pequeno, mas mudam a resposta de duas perguntas comuns: se vale mais a pena a API ou a assinatura mensal do produto, e em quanto tempo um investimento em cache de prompts se paga. Como usar a calculadora aqui: rode a comparação entre modelos com a tarifa limpa em USD (o ranking entre dois modelos não muda, porque o multiplicador é o mesmo para todos) e aplique o fator uma única vez, no total anual, quando for levar o número para o orçamento em reais.
Estimar tokens a partir de texto: quantos tokens tem isto
O estimador de texto converte com máx(⌈caracteres/4⌉, ⌈palavras×1,33⌉).
Uma frase curta em inglês, "The quick brown fox jumps over the lazy dog.", tem 44 caracteres e 9 palavras: por caracteres ⌈44/4⌉ = 11, por palavras ⌈9×1,33⌉ = 12; a ferramenta fica com o maior, 12 tokens.
Um documento de 500 palavras com 3.999 caracteres: por caracteres ⌈3999/4⌉ = 1.000, por palavras ⌈500×1,33⌉ = 665; toma-se o maior, 1.000 tokens, e ganha o lado dos caracteres.
Em texto normal com espaços, o lado de "caracteres divididos por 4" quase sempre manda. Três ressalvas: código, JSON e cadeias longas sem espaços se fragmentam em mais tokens; o português é mais denso e consome de 30% a 40% mais tokens que o mesmo conteúdo em inglês, ficando por volta de 3 a 3,5 caracteres por token contra os 4 do inglês; e os modelos Claude mais novos tokenizam o mesmo texto cerca de 30% acima dos anteriores. Traduzindo para o uso prático: em texto todo em português, some entre 15% e 30% ao número que o estimador mostra. A heurística é uma aproximação genérica de BPE, não a contagem de um modelo específico. Sobra para orçar; para fechar a conta no centavo, use o tiktoken ou o campo usage da API.
Erros comuns ao estimar o custo de tokens
Confundir o preço de entrada com o de saída. A saída quase sempre é mais cara, e o múltiplo é um traço de família: os três níveis do GPT-5.6 cobram a saída seis vezes mais que a entrada (Sol 5 contra 30, Terra 2,5 contra 15, Luna 1 contra 6), toda a linha Claude exatamente cinco vezes, o Grok 4.5 três vezes e só modelos como o DeepSeek V4 Pro deixam no dobro (0,435 contra 0,87 USD). Ao orçar, olhe primeiro o lado da saída: cortar o tamanho da resposta com max_tokens costuma economizar mais do que encurtar o prompt.
Achar que um sucessor ao mesmo preço custa o mesmo. Claude Sonnet 5 e Sonnet 4.6 figuram os dois a 3 / 15 USD, mas a Anthropic documenta que o Sonnet 5 usa um tokenizador novo que produz aproximadamente 30% mais tokens para o mesmo texto. Mesma tarifa sobre mais tokens faturáveis é uma fatura maior: 52,65 USD por mês em vez de 40,50 no exemplo do chatbot. Meça de novo as suas contagens reais contra o modelo novo antes de assinar que a migração é neutra. E atenção ao detalhe inverso: entre Opus 4.8 e Opus 5 ela é neutra mesmo, porque os dois já usam o tokenizador novo.
Copiar contagens de tokens de um benchmark em inglês quando o produto fala português. É o erro mais caro e o mais invisível: o mesmo conteúdo em português consome de 30% a 40% mais tokens, então um orçamento montado sobre números em inglês já nasce baixo em mais de um terço. Meça com o campo usage da API em prompts reais em português, ou corrija a estimativa antes de informá-la na calculadora.
Orçar sobre um preço de lançamento. Modelos novos costumam sair com uma tarifa introdutória temporária que reverte em uma data publicada, e muitas tabelas de terceiros copiam a cifra promocional sem avisar. Um orçamento construído sobre uma promoção quebra no dia em que ela vence. Esta calculadora e esta página usam a tarifa padrão sob demanda de cada modelo exatamente por isso: se você viu um número mais baixo em outro lugar, confira se ele tem data de validade antes de colocá-lo em uma previsão.
Esquecer o IOF e o spread ao levar o número para reais. A tarifa está em dólar, mas o que sai da sua conta passa por câmbio: o IOF das operações de câmbio está em 3,5% desde o Decreto nº 12.499/2025, e o spread do banco ou da fintech soma de 1% a 4% em cima. O multiplicador efetivo fica entre 1,045 e 1,076. Vários comparativos brasileiros ainda dizem que o IOF é zero e erram o custo real por essa margem.
Ignorar que no Sonnet 5 o pensamento adaptativo vem ligado por padrão. A documentação da Anthropic é clara: requisições sem o campo thinking, que no Sonnet 4.6 rodavam sem pensamento, agora rodam com pensamento adaptativo. Esses tokens de pensamento entram na saída, o lado que custa cinco vezes mais, e o max_tokens é um limite duro sobre pensamento mais resposta. Se você não revisar esse limite, ou a fatura sobe além dos 30% do tokenizador, ou a resposta sai truncada.
Olhar só o custo por requisição e não multiplicar pela escala. 0,0135 USD por requisição parece nada, mas a 100 requisições por dia são 40,50 USD por mês e 492,75 por ano com o Claude Sonnet 5 (veja o primeiro exemplo). Quem decide o orçamento é preço × frequência × dias: preencha sempre as requisições por dia na calculadora.
Esquecer que cada turno de uma conversa reenvia todo o histórico. A API não tem memória: no turno 10 você manda de novo os 9 turnos anteriores, e os tokens de entrada crescem de forma quase quadrática; uma conversa um pouco longa vira dezenas de milhares de tokens por requisição. Use uma janela deslizante com os últimos turnos ou resuma o histórico de tempos em tempos.
Puxar o carro-chefe para toda a carga de trabalho. Desde que o GPT-5.6 saiu como três modelos separados, o nível mais barato e o mais caro de uma mesma família estão a cinco vezes de distância nos dois lados (Luna 1 / 6 contra Sol 5 / 30), e a própria linha da Anthropic vai do Haiku 4.5 a 1 / 5 até o Fable 5 a 10 / 50. Classificar, extrair, rotear ou reescrever você pode entregar ao Luna, ao Haiku 4.5, ao GPT-5.4 Mini ou ao DeepSeek V4 Pro; guarde Sol, Opus 5 ou Fable 5 para raciocínio de verdade, código difícil ou texto longo. Um roteador de "primeiro o modelo pequeno e só subo se precisar" corta muitas vezes metade da conta.
Ignorar o cache de prompts e o desconto por lote. São descontos documentados de primeira parte, não truques. Um acerto de cache é faturado a 10% da tarifa de entrada — no GPT-5.6 Sol, 0,50 USD por milhão contra os 5 USD padrão; no Terra, 0,20 USD contra 2 USD; no Luna, 0,02 USD contra 0,20 USD — e a Anthropic cobra a escrita do cache de 5 minutos a 1,25× a entrada, de modo que o cache se paga com uma única leitura. O trabalho que não tem pressa vai pela Batch API com 50% de desconto em entrada e saída. Coloque o texto fixo no começo do prompt para aumentar os acertos.
Comparar tarifas sem olhar as faixas de contexto. Gemini Pro e Grok passam a uma tarifa superior acima de 200.000 tokens de prompt, enquanto Claude 4.6 e posteriores incluem a janela inteira de 1 milhão a preço padrão: uma requisição de 900.000 tokens é faturada à mesma tarifa por token que uma de 9.000. Se você trabalha com contexto longo, a faixa pode pesar mais que a diferença de preço base.
Dicas para otimizar o consumo de tokens e reduzir custos
Escolha o nível adequado a cada tarefa, não só o provedor. Desde que o GPT-5.6 saiu como três modelos separados, você tem Sol (5/30 USD), Terra (2/12 USD) e Luna (0,20/1,20 USD) dentro da mesma família: classificar e-mails ou extrair campos você pode entregar ao Luna, ao GPT-5.4 Nano (0,20 USD de entrada), ao DeepSeek V4 Flash (0,14), ao Mistral Small 4 (0,15) ou ao Amazon Nova Micro (0,035), e reservar Sol, Claude Opus 5 ou Claude Fable 5 para raciocínio complexo, código difícil e texto longo.
Escreva o prompt de sistema em inglês e deixe o português para o que o usuário lê. Como o mesmo conteúdo em português consome de 30% a 40% mais tokens, e o prompt de sistema é justamente a parte que se repete em toda requisição, essa única mudança corta um pedaço real da entrada sem mexer em nada que o cliente veja. O modelo entende a instrução em inglês e responde em português sem problema.
Meça a inflação de tokens antes de migrar, não depois. Passe a mesma requisição duas vezes, uma contra o modelo atual e outra contra o novo, e compare o campo usage: se o destino é o Claude Sonnet 5, espere cerca de 30% mais tokens de entrada e de saída para o mesmo texto, e orce com essas contagens já corrigidas. E revise o max_tokens: com o pensamento adaptativo ligado por padrão, um limite calibrado para o Sonnet 4.6 pode truncar a resposta.
Coloque o texto fixo no começo do prompt e ative o cache. Um acerto de cache é faturado a 10% da tarifa de entrada: no GPT-5.6 Sol são 0,50 USD por milhão contra os 5 USD padrão, no Terra 0,20 USD contra 2 USD e no Luna 0,02 USD contra 0,20 USD. No chatbot dos exemplos, com 1.600 dos 2.000 tokens de entrada em cache, o Terra cai de 37,50 para 26,70 USD por mês. A escrita do cache de 5 minutos custa 1,25× a entrada na Anthropic, então ele se paga com uma única leitura.
Mande para a Batch API tudo o que não tem pressa. Relatórios noturnos, rotulagem em massa, tradução em volume ou avaliações têm 50% de desconto em entrada e saída: o Claude Opus 5 cai de 5/25 USD para 2,50 / 12,50 USD por milhão e o Claude Sonnet 5 de 3/15 USD para 1,50 / 7,50. No chatbot dos exemplos, o GPT-5.6 Sol cairia de 75,00 para 37,50 USD por mês. O desconto se acumula com o do cache.
Limite o tamanho das respostas com max_tokens. É a alavanca com a melhor relação esforço-resultado, porque a saída custa de duas a seis vezes mais que a entrada: seis vezes em toda a família GPT-5.6 e cinco em toda a linha Claude. Se você só precisa de um rótulo ou de um resumo de 100 palavras, ponha o limite e não deixe o modelo se alongar.
Vigie a eficiência de tokens, não só a tarifa. Dois modelos com a mesma tarifa podem dar faturas muito diferentes para o mesmo trabalho: a Anthropic documenta que a geração nova do Claude gera cerca de 30% mais tokens para o mesmo texto, enquanto a linha Flash do Gemini é vendida justamente pela eficiência em tarefas de vários passos. A comparação honesta se faz com tokens medidos em cada modelo, não com a tabela de preços.
Some o câmbio antes de fechar o orçamento em reais. A tarifa é em dólar, mas o custo efetivo passa pela cotação do dia, pelo spread do banco e pelo IOF de câmbio de 3,5%, o que soma de 4,5% a 7,6%. Faça a comparação entre modelos em USD, porque o multiplicador é igual para todos, e aplique o fator uma única vez sobre o total anual.
Corte o histórico das conversas em vez de deixá-lo crescer. Como a API é sem estado, cada turno reenvia tudo o que veio antes e os tokens de entrada crescem de forma quase quadrática. Uma janela deslizante com os últimos turnos, ou um resumo do histórico a cada tantas mensagens, costuma cortar mais tokens do que qualquer otimização de redação.
Monitore o consumo com os painéis do provedor e configure alertas de gasto. OpenAI, Anthropic e Google oferecem painéis de uso. Um desvio de 100 tokens por requisição não aparece em uma chamada, mas a 10.000 requisições por dia é 1 milhão de tokens extras todo dia — e um bug que gera laços infinitos de chamadas pode queimar o orçamento do mês em algumas horas.
Considere modelos abertos para volume alto. Llama 3.3 70B (0,59/0,79 USD), Mistral Small 4 (0,15/0,60 USD) ou DeepSeek V4 Flash (0,14/0,28 USD) através de provedores gerenciados como a Groq saem muito abaixo das APIs proprietárias. Hospedar por conta própria elimina o custo por token, mas exige investimento em GPU e só compensa em volumes muito altos: faça a conta com o cartão anual da calculadora antes de comprar hardware.
Glossário de termos
Token
Unidade mínima de texto que um modelo de linguagem processa. Pode ser uma palavra completa, um pedaço de palavra, um sinal de pontuação ou um espaço. Em inglês equivale em média a cerca de 4 caracteres ou 0,75 palavra; em português, a cerca de 3 a 3,5 caracteres.
Tokenizador
O componente que quebra o texto em tokens antes de o modelo processá-lo. Cada provedor usa o seu (os GPT novos, a codificação o200k_base), por isso o mesmo texto pode dar contagens diferentes conforme o modelo, e até conforme a geração dentro de uma mesma família.
BPE (Byte Pair Encoding)
Algoritmo de tokenização usado por GPT e pela maioria dos modelos de linguagem. Divide o texto em sub-tokens fundindo iterativamente os pares de caracteres mais frequentes do corpus de treinamento, majoritariamente em inglês — o que explica por que outros idiomas consomem mais tokens.
Inflação de tokens
Aumento da fatura sem aumento de tarifa, provocado por um tokenizador que produz mais tokens para o mesmo texto. O caso de referência é o Claude Sonnet 5, que segundo a Anthropic gera aproximadamente 30% mais tokens que o Sonnet 4.6. O português tem a sua própria versão do fenômeno: de 30% a 40% acima do inglês para o mesmo conteúdo.
Tokens de entrada (input)
Os tokens que você envia ao modelo: instruções do sistema, contexto, histórico da conversa, definições de ferramentas e o seu prompt. São faturados a um preço menor que os tokens de saída.
Tokens de saída (output)
Os tokens que o modelo gera como resposta, incluindo os tokens de pensamento quando o modo de raciocínio está ativo. Custam de 2 a 6 vezes mais que os de entrada conforme o modelo (seis vezes em toda a família GPT-5.6, cinco em toda a linha Claude, três no Grok 4.5 e o dobro no DeepSeek V4 Pro), porque a geração é sequencial.
Preço por milhão de tokens (MTok)
A unidade padrão de faturamento das APIs de IA. Os provedores publicam tarifas separadas para entrada e saída, em dólares por cada milhão de tokens processados, e muitos acrescentam colunas específicas para leituras e escritas de cache.
Janela de contexto
O número máximo de tokens (entrada + saída) que um modelo processa em uma única requisição. O GPT-5.6 Sol trabalha com 1.050.000 tokens e até 128.000 de saída; o Claude Sonnet 5 traz 1 milhão por padrão com até 128.000 de saída; o Gemini 2.5 Pro chega a 1 milhão; o DeepSeek V4 se move em torno de 128.000.
Cache de prompts
Mecanismo que reaproveita a parte já processada de um prompt entre chamadas. As leituras de cache são faturadas a 10% da tarifa de entrada tanto na OpenAI como na Anthropic; a escrita do cache de 5 minutos custa 1,25× a entrada e a de 1 hora 2×, de modo que o cache se paga já na primeira leitura.
Batch API
Modo de processamento assíncrono para trabalho que não é urgente, com 50% de desconto sobre entrada e saída. Com ela, o Claude Opus 5 cai de 5/25 USD para 2,50 / 12,50 USD por milhão e o GPT-5.6 Sol de 5/30 USD para 2,50 / 15. O desconto se acumula com o do cache de prompts.
Pensamento adaptativo
Modo de raciocínio que o Claude Sonnet 5 traz ligado por padrão, ao contrário do Sonnet 4.6, que rodava sem pensamento quando a requisição não pedia. Os tokens de pensamento são faturados como saída e contam dentro do limite de max_tokens, então um limite calibrado para o modelo antigo pode truncar a resposta no novo.
IOF de câmbio
Imposto brasileiro que incide sobre operações de câmbio, incluindo compras internacionais no cartão e remessas ao exterior — o caminho pelo qual você paga uma API faturada em dólar. A alíquota está em 3,5% desde o Decreto nº 12.499/2025 e entra no custo efetivo junto com o spread do banco.
LLM (Large Language Model)
Modelo de linguagem de grande escala treinado com bilhões de parâmetros sobre enormes corpus de texto. Exemplos atuais: GPT-5.6 Sol, Terra e Luna (OpenAI), Claude Opus 5 e Sonnet 5 (Anthropic), Gemini 3.6 Flash (Google), Grok 4.5 (xAI), Llama 4 (Meta), DeepSeek V4 (DeepSeek), Mistral Large 3 (Mistral AI), Command R+ (Cohere) e Nova Premier (Amazon).
Perguntas frequentes sobre tokens e o custo das APIs de IA
Quanto custa o GPT-5.6 Sol por milhão de tokens?
O GPT-5.6 Sol custa 5 USD por milhão de tokens de entrada e 30 USD por milhão de saída na tarifa padrão sob demanda. É o mesmo preço do GPT-5.5, então o nível carro-chefe não encareceu nesta geração.
Qual a diferença de preço entre GPT-5.6 Sol, Terra e Luna?
O GPT-5.6 saiu em 9 de julho de 2026 como três modelos separados, e de ponta a ponta há um fator de 25. O Sol, carro-chefe, vai a 5/30 USD por milhão. O Terra, o nível equilibrado, a 2/12 USD — 40% do Sol nos dois lados. O Luna, o mais rápido e barato, a 0,20/1,20 USD. Os três mantêm a mesma razão de 6 para um entre saída e entrada, então trocar de nível escala toda a sua conta sem mudar a forma dela: o chatbot dos exemplos custa 75,00 USD por mês no Sol, 30,00 USD no Terra e 3,00 USD no Luna.
Quanto custa o Claude Opus 5 por milhão de tokens?
O Claude Opus 5 custa 5 USD por milhão de tokens de entrada e 25 por milhão de saída, o mesmo preço do Claude Opus 4.8. É a metade do Claude Fable 5, que vai a 10 e 50 USD.
Quanto custa o Claude Sonnet 5 e vale a pena migrar do Sonnet 4.6?
O Claude Sonnet 5 custa 3 USD por milhão de tokens de entrada e 15 por milhão de saída — exatamente o mesmo do Sonnet 4.6. Mas a tarifa igual esconde uma conta maior: a Anthropic documenta que o Sonnet 5 usa um tokenizador novo que produz aproximadamente 30% mais tokens para o mesmo texto, e que o pensamento adaptativo passa a vir ligado por padrão, engordando o lado da saída. No chatbot dos exemplos, isso leva os 40,50 USD por mês do Sonnet 4.6 para 52,65 no Sonnet 5. A migração de código é trivial (troca o ID do modelo), mas a de orçamento não é: recontem os prompts contra o modelo novo antes de decidir. Vale a pena quando você precisa de mais capacidade que o Sonnet 4.6 sem subir para a classe Opus.
Sai mais barato GPT-5.6 Sol ou Claude Opus 5?
Depende inteiramente de quanta saída você gera, porque os dois carros-chefe cobram os mesmos 5 USD por milhão de entrada e só se diferenciam na saída: 30 USD no Sol contra 25 no Opus 5. Em um trabalho de documento longo com 100.000 tokens de entrada e 2.000 de saída, ficam a um centavo de distância (0,56 contra 0,55 USD). Em um agente de código pesado de saída, com 20.000 de entrada e 3.000 de saída e 200 chamadas por dia, o Opus 5 sai por 1.050,00 USD por mês contra os 1.140,00 USD do Sol — 8,6% menos. Informe a sua própria mistura de tokens em vez de confiar em uma manchete, porque o ranking é decidido por essa razão e por mais nada.
Um modelo novo ao mesmo preço custa o mesmo?
Não necessariamente, e essa é a armadilha da geração atual. A documentação da Anthropic diz que o Claude Sonnet 5 usa um tokenizador novo e que o mesmo texto de entrada produz aproximadamente 30% mais tokens do que no Sonnet 4.6. Como a tarifa não mudou (3 e 15 USD nas duas gerações), uma carga de trabalho idêntica fatura cerca de 30% mais: 52,65 USD por mês em vez de 40,50 no exemplo do chatbot. Paridade de tarifa não é paridade de custo. Entre Opus 4.8 e Opus 5, por outro lado, é paridade de verdade, porque os dois já usam o tokenizador novo.
Por que esta calculadora usa a tarifa padrão do Claude Sonnet 5 e não a de lançamento?
Porque um orçamento construído sobre uma promoção quebra quando a promoção acaba. A Anthropic lançou o Sonnet 5 com uma tarifa introdutória temporária que reverte para os 3 USD de entrada e 15 de saída por milhão em uma data publicada, e muitas tabelas de preços copiam a cifra promocional sem dizer. O detalhe importante: o desconto introdutório foi calibrado justamente para compensar os 30% extras de tokens do tokenizador novo, de forma que a migração pareça neutra enquanto ele vale — quando a tarifa padrão entra, aquela diferença vira aumento real. Esta calculadora usa a tarifa padrão, que é também exatamente a mesma do Sonnet 4.6, para que os números mensais e anuais daqui continuem valendo depois. Se você quiser modelar a janela promocional, escolha "Personalizado" e informe a tarifa mais baixa à mão.
Qual é a API de IA mais barata?
Entre os modelos de fronteira, os mais baratos são o Grok 4.5 a 2 USD de entrada e 6 de saída por milhão e o Gemini 3.1 Pro a 2 e 12, com o GPT-5.6 Terra logo acima a 2,50 e 15. Descendo um nível, o GPT-5.6 Luna a 1 e 6 ou o Claude Haiku 4.5 a 1 e 5 cortam isso quase pela metade de novo. E se o que manda é o preço bruto, o DeepSeek V4 Pro vai a 0,435 e 0,87, e o Amazon Nova Micro a só 0,035 e 0,14. Duas ressalvas: Gemini 3.1 Pro e Grok passam a uma tarifa superior acima de 200.000 tokens de prompt, e o modelo capaz mais barato para a sua tarefa é decidido pelo seu conjunto de avaliação, não pela tabela de tarifas.
Quanto custa um token de IA?
Um único token custa uma fração minúscula de centavo de dólar — por isso os provedores cobram por milhão. No GPT-5.6 Luna, um token de entrada sai por 0,000001 USD; no GPT-5.6 Sol e no Claude Opus 5, por 0,000005 USD. Um token de saída no GPT-5.5 Pro chega a 0,00018 USD.
Quanto custa 1 milhão de tokens em GPT, Claude e DeepSeek?
Depende do modelo e de ser entrada ou saída. Um milhão de tokens de entrada vai de 0,035 USD no Amazon Nova Micro e 0,435 no DeepSeek V4 Pro até 5 USD no GPT-5.6 Sol e no Claude Opus 5, e 30 no GPT-5.5 Pro; um milhão de saída, de 0,14 até 180 USD. A faixa de fronteira é mais estreita do que o intervalo completo sugere: os modelos de topo se movem entre 2 e 5 USD de entrada, com saídas de 6 USD no Grok 4.5 a 30 no GPT-5.6 Sol. O detalhamento completo está na tabela acima.
Quantos tokens tem um texto de 1.000 palavras em português?
Entre 1.700 e 1.900 tokens nos tokenizadores atuais, contra cerca de 1.333 do mesmo conteúdo em inglês — de 30% a 40% mais. Como regra rápida, multiplique as palavras em português por 1,75. Uma página A4, com aproximadamente 500 palavras, sai por volta de 875 tokens. E se o modelo for um Claude Sonnet 5, acrescente outros 30%.
Escrever o prompt em português custa mais caro que em inglês?
Sim, de 30% a 40% mais para o mesmo conteúdo. O vocabulário dos tokenizadores foi treinado sobretudo em inglês, então palavras portuguesas longas são remontadas a partir de vários sub-pedaços: o português fica por volta de 3 a 3,5 caracteres por token, contra os cerca de 4 do inglês. A defasagem vem encolhendo — medições publicadas apontam 1,94 vez os tokens do inglês no tokenizador do GPT-2, 1,48 vez no do GPT-4 e algo entre 1,3 e 1,4 vez nos atuais —, mas ela não desapareceu. No chatbot dos exemplos, rodar em português leva o GPT-5.6 Terra de 37,50 para 50,63 USD por mês. A saída prática é escrever o prompt de sistema em inglês e reservar o português para o texto que o usuário lê, que é onde ele importa.
1 milhão de tokens dá quantas páginas em português?
Cerca de 570 mil palavras, ou aproximadamente 1.140 páginas A4 de 500 palavras. Com 2 milhões de tokens você chega a cerca de 2.300 páginas. Repare que a conta é diferente da regra em inglês: 1.000 tokens rendem cerca de 750 palavras em inglês, mas apenas cerca de 570 em português.
Como converto o custo da API de dólar para real?
Multiplique o valor em USD pela cotação do dia e depois por dois fatores que quase todo comparativo esquece: o spread do seu banco ou fintech e o IOF de câmbio, que está em 3,5% desde o Decreto nº 12.499/2025. A fórmula é: USD × cotação × (1 + spread) × (1 + IOF). Com 1% de spread o multiplicador extra fica em 1,0453, ou seja 4,5% acima da conversão simples; com 4%, típico de cartão de crédito de banco tradicional, chega a 7,6%. Aplicado ao chatbot dos exemplos no GPT-5.6 Terra, os 365,00 USD do ano viram entre 381,56 e 392,88 de custo efetivo. Não fixe uma cotação em nenhuma planilha de longo prazo: use a do dia da fatura e mantenha a comparação entre modelos em USD, porque o multiplicador é o mesmo para todos e não muda o ranking.
Por que os tokens de saída custam mais que os de entrada?
De duas a seis vezes mais, conforme o modelo. Gerar texto é sequencial: o modelo produz um token, adiciona ao contexto e calcula o próximo, enquanto a entrada é lida de uma só vez em paralelo. Por isso os três níveis do GPT-5.6 cobram a saída seis vezes mais que a entrada, a família Claude exatamente cinco vezes, o Grok 4.5 três e o DeepSeek V4 Pro o dobro. Ao otimizar, cortar a saída é o que mais economiza.
Quanto custa um chatbot com IA por mês?
Depende do modelo e do volume. Para um chatbot típico de 2.000 tokens de entrada e 500 de saída por requisição, a 100 requisições por dia: o GPT-5.6 Sol sai por 75,00 USD por mês (912,50 USD por ano), o Claude Opus 5 por 67,50 USD, o Claude Sonnet 5 por 40,50 USD, o GPT-5.6 Terra por 30,00 USD, o Claude Haiku 4.5 por 13,50 USD, o DeepSeek V4 Pro por 3,92 USD e o GPT-5.6 Luna por apenas 3,00 USD por mês (36,50 USD por ano). Se os prompts forem em português, suba tudo de 30% a 40%: no Terra, os 30,00 USD viram 39,00 USD. Mude os tokens e a frequência na calculadora para ajustar ao seu caso — e se a sua cifra mensal passar de uns 200 USD, as alavancas de roteamento e cache mais abaixo compensam um dia de trabalho de engenharia.
Como conto tokens de forma exata antes de chamar a API?
Você tem três caminhos. O mais exato para os modelos da OpenAI é a biblioteca tiktoken (os GPT novos usam a codificação o200k_base). O mais rápido é colar o texto no estimador desta página, que dá tokens e custo por modelo sem escrever código — lembrando de somar de 15% a 30% se o texto for todo em português. O terceiro é a regra aproximada de 4 caracteres por token. Tenha em mente que Claude, Gemini e Llama usam tokenizadores próprios que não são públicos, e que a geração mais nova do Claude conta cerca de 30% acima da anterior, então em produção a fonte confiável é o campo usage que cada API devolve.
Esta calculadora de tokens é gratuita e segura?
Sim, é gratuita e não pede cadastro. O texto que você cola no estimador é processado no seu próprio navegador: não é enviado a nenhum servidor nem consome cota de nenhum modelo, então não há risco de vazar o seu prompt. Os preços vêm das tarifas públicas de OpenAI, Anthropic, Google, DeepSeek e dos demais provedores, e o resultado é uma estimativa para orçar; a fatura final é sempre a que o console de cada API mostra.
Qual a precisão desta estimativa de custo?
A aritmética é exata: a calculadora multiplica as suas contagens de tokens pelas tarifas publicadas por milhão, então com os dados certos o valor por requisição fecha com a linha da sua fatura. Três coisas movem o valor real. As contagens de tokens são aproximadas a menos que você as tire do campo usage da API — e em português a heurística de 4 caracteres por token subestima de 15% a 30%. A projeção mensal usa um mês plano de 30 dias, então um mês de 31 sai cerca de 3% mais alto e fevereiro cerca de 7% mais baixo. E os descontos não são aplicados: cache de prompts, Batch API e acordos empresariais faturam abaixo da tarifa padrão. Trate o resultado como um número de planejamento bem fundamentado, não como orçamento fechado.
Minha fatura real veio maior que a estimativa, por quê?
Quase sempre por algo que a tarifa base não inclui. Passe por esta lista: o modo rápido do Claude Opus 5 é faturado a 10 / 50 USD por milhão, o dobro do padrão; as escritas de cache custam 1,25× a entrada (2× se você escolher o cache de uma hora), mesmo que as leituras caiam a 10%; no Sonnet 5 o pensamento adaptativo vem ligado por padrão e esses tokens entram na saída, o lado que custa cinco vezes mais; se você migrou para um Claude Sonnet 5, o mesmo texto gera cerca de 30% mais tokens; se os seus prompts são em português e você orçou com números de um benchmark em inglês, faltam de 30% a 40%; e um mês de 31 dias é 3% mais longo que o mês plano de 30 que a projeção usa. No extrato em reais, some ainda de 4,5% a 7,6% de IOF e spread de câmbio.
O que é a janela de contexto e como ela afeta o custo?
A janela de contexto é o número máximo de tokens que um modelo processa em uma única requisição, somando entrada e saída. O GPT-5.6 Sol trabalha com uma janela de 1.050.000 tokens e até 128.000 de saída, e o Claude Sonnet 5 traz 1 milhão de tokens por padrão com até 128.000 de saída, a preço padrão — uma requisição de 900.000 tokens é faturada à mesma tarifa por token que uma de 9.000. Gemini Pro e Grok, em contrapartida, passam a uma tarifa superior acima de 200.000 tokens de prompt, e o DeepSeek V4 se move em torno de 128.000. Um detalhe do tokenizador novo do Claude: a janela continua de 1 milhão, mas cada token cobre menos texto, então ela comporta menos conteúdo que antes. De qualquer forma, janela grande não faz barato usá-la inteira: uma conversa longa reenvia todo o histórico como tokens de entrada em cada chamada.
Por que uma conversa de poucos turnos gasta tantos tokens?
Porque a API não guarda estado: em cada turno você reenvia toda a conversa anterior. No turno 10 a entrada inclui os 9 turnos anteriores, então os tokens crescem de forma quase quadrática e uma conversa nem tão longa termina em dezenas de milhares de tokens de entrada. Para conter: ative o cache de prompts, use uma janela deslizante com os últimos turnos ou resuma o histórico de tempos em tempos.
As imagens e os arquivos também consomem tokens?
Sim. Os modelos multimodais dividem cada imagem em blocos e os convertem em tokens: uma imagem pode custar de algumas centenas a mais de mil tokens conforme a resolução. PDF, Word ou Excel costumam ser convertidos antes para texto e cobrados como tal, o que significa que um documento em português também paga o pedágio de 30% a 40% do idioma. Aplicações com muita imagem (OCR, análise de prints) são as que mais disparam a conta, então meça o consumo real em um conjunto de teste antes de confiar no orçamento.
Já sei meu custo mensal, como reduzo a conta?
Cinco alavancas, da maior para a menor. Uma: roteie por dificuldade e mande as tarefas simples para GPT-5.6 Luna, Claude Haiku 4.5, GPT-5.4 Mini ou DeepSeek V4 Pro, deixando GPT-5.6 Sol ou Claude Opus 5 só para o difícil — descer de Sol para Luna já é dividir por cinco. Duas: ative o cache de prompts para os prefixos repetidos, que fatura os acertos a 10% da entrada; no chatbot dos exemplos, com 1.600 dos 2.000 tokens de entrada em cache, o GPT-5.6 Terra cai de 37,50 para 26,70 USD por mês, uma economia de 28,8%. Três: passe o trabalho sem pressa pela Batch API, com 50% de desconto em entrada e saída. Quatro: limite a saída com max_tokens, que é onde mais dói o múltiplo de seis para um. Cinco: escreva o prompt de sistema em inglês e enxugue as instruções. Informe os números novos na calculadora e veja a economia mensal e anual.