Smart Calculators SmartCalculators

Calculadora de tokens

Calcula el coste de usar modelos de lenguaje IA. Estima tokens desde texto y compara precios entre modelos como GPT-5, Claude y Gemini.

$

$

1K / 1M

Coste por petición

$0.02

Entrada: $0.0050 · Salida: $0.01

Coste diario

$1.75

100 peticiones por día

Coste mensual

$52.50

30 días

Coste anual

$638.75

365 días

Estimar tokens desde texto

Calculadora de coste de tokens. Precio por millón de tokens de GPT-5.6 Sol, Terra y Luna, Claude Opus 5, Sonnet 5, Gemini y DeepSeek.

Esta calculadora de tokens pone precio a cualquier llamada a la API: GPT-5.6 Sol, Terra o Luna, Claude Opus 5 o Sonnet 5, Gemini, Grok y DeepSeek. Aplica la tarifa oficial por millón de tokens a tu entrada y tu salida y muestra el coste por consulta, al día, al mes y al año.

Qué es un token y por qué las APIs de IA cobran por token

Un token es el fragmento de texto que un modelo de lenguaje lee y escribe de verdad: no una palabra entera, sino un trozo de palabra. En inglés un token equivale de media a unos 4 caracteres o 0,75 palabras, así que 1.000 palabras salen por unos 1.333 tokens. Todos los modelos de las familias GPT-5.6, Claude, Gemini, Grok y DeepSeek parten tu texto en estos fragmentos antes de hacer nada más, y el contador empieza a correr con el primero.
Las APIs facturan por token y dividen la factura en dos: los tokens de entrada (las instrucciones del sistema, el contexto, el historial de la conversación y tu pregunta) y los tokens de salida (la respuesta del modelo). Los proveedores publican las dos tarifas en dólares por millón de tokens, y la salida casi siempre es el lado caro. El múltiplo es sorprendentemente estable dentro de cada familia: los tres niveles de GPT-5.6 cobran la salida exactamente seis veces más que la entrada, toda la línea Claude la cobra cinco veces más, Grok 4.5 tres veces y solo modelos como DeepSeek V4 Pro la dejan en el doble. Una llamada suelta puede costar una fracción de céntimo, pero multiplícala por decenas de miles de peticiones al día y el gasto en tokens pasa a ser una partida real del presupuesto.
El español paga un recargo silencioso. Para el mismo contenido consume en torno a un 15-25 % más de tokens que el inglés, alrededor de 1,4-1,6 tokens por palabra frente a los ~1,33 del inglés, porque los artículos, las tildes y las conjugaciones alargan el texto y el vocabulario de los tokenizadores está entrenado sobre todo con inglés. La horquilla varía mucho según el tokenizador, así que tómala como orden de magnitud y no como cifra fija. En la práctica esto significa que un texto español de 1.000 palabras ronda los 1.500-1.650 tokens, y que el lado de «caracteres entre 4» del estimador de esta página absorbe buena parte de ese recargo, mientras que el lado de «palabras × 1,33» se queda corto.
El recuento exacto del mismo texto cambia de un modelo a otro porque cada proveedor lleva su propio tokenizador: los GPT nuevos usan la codificación o200k_base, y Anthropic, Google o DeepSeek tienen el suyo. Lo que sorprende a la mayoría de los equipos es que también cambia entre generaciones de la misma familia. La documentación de precios de Anthropic dice que Claude 4.7 y modelos posteriores (ahí entran Claude Opus 5, Opus 4.8, Sonnet 5 y Fable 5) usan un tokenizador más nuevo que produce aproximadamente un 30 % más de tokens para el mismo texto, mientras que Claude Sonnet 4.6 y anteriores siguen con el anterior. La tarifa no se ha movido, así que el mismo prompt factura alrededor de un 30 % más en Sonnet 5 que en Sonnet 4.6 aunque los dos figuren a 3 USD de entrada y 15 de salida. El detalle fino, que casi nadie cuenta: migrar de Opus 4.8 a Opus 5 sí es neutro de verdad, porque ambos usan ya el tokenizador nuevo. El código, el JSON, los números y el texto no inglés son los que se fragmentan más, y por eso el precio por token nunca se traduce limpio a un recuento de palabras.
Julio de 2026 movió la cima del mercado dos veces. El día 9, OpenAI puso GPT-5.6 en disponibilidad general como tres modelos separados en lugar de un modelo con esfuerzo de razonamiento ajustable: Sol como insignia, Terra como nivel equilibrado del día a día y Luna como el más rápido y barato. El 24, Anthropic publicó Claude Opus 5 junto a Claude Fable 5 y Claude Sonnet 5. Lo llamativo está en la hoja de precios: Sol cuesta lo mismo que GPT-5.5 (5 y 30 USD), Terra lo mismo que GPT-5.4 (2,50 y 15), Opus 5 lo mismo que Opus 4.8 (5 y 25) y Sonnet 5 lo mismo que Sonnet 4.6 (3 y 15). Ha llegado una generación entera de capacidad a precio plano, así que la pregunta interesante ha dejado de ser «cuánto ha subido» y es «qué nivel necesito de verdad». El único punto de precio realmente nuevo es GPT-5.6 Luna a 1 y 6 USD, que aterriza justo al lado de Claude Haiku 4.5 (1 y 5): idénticos en entrada, un dólar de diferencia en salida.
Esta calculadora trae precargadas las tarifas estándar publicadas de nueve proveedores: OpenAI, Anthropic, Google, xAI, DeepSeek, Mistral, Amazon, Meta y Cohere. El abanico es de casi tres órdenes de magnitud. Amazon Nova Micro está en un extremo con 0,035 USD de entrada y 0,14 de salida por millón; GPT-5.5 Pro en el otro con 30 y 180, es decir 857 veces la entrada de Nova Micro. Entre medias tienes Claude Fable 5 a 10/50 USD, GPT-5.6 Sol a 5/30 USD, Claude Opus 5 a 5/25 USD, Claude Sonnet 5 a 3/15 USD, GPT-5.6 Terra a 2/12 USD, Grok 4.5 a 2/6 USD, Gemini 3.6 Flash a 1,50/7,50 USD, GPT-5.6 Luna a 0,20/1,20 USD y DeepSeek V4 Pro a 0,435/0,87 USD. Todas las cifras son la tarifa estándar bajo demanda, sin lotes, sin caché y sin tramos de contexto largo, y Claude Sonnet 5 aparece a su precio estándar y no al promocional de lanzamiento, para que un presupuesto hecho aquí no se rompa cuando caduque la promoción. Si tu modelo no está en la lista, elige «Personalizado» y mete su precio por mil o por millón de tokens: el coste por consulta, mensual y anual se calcula igual. Todos los importes van en dólares (USD), la moneda con la que estos proveedores facturan la API.

Cómo usar la calculadora de coste de tokens

Del nombre del modelo a la factura mensual solo hay unos pasos.
1. Elige el modelo. El desplegable agrupa los preajustes por proveedor: al seleccionar GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5, Claude Sonnet 5, DeepSeek V4 Pro o cualquier otro, se rellena automáticamente su tarifa oficial. Si usas algo que no está en la lista (un modelo interno, un recién publicado o el modo rápido de Opus 5, que se factura a 10 / 50 USD por millón), elige «Personalizado» e introduce el precio a mano.
2. Confirma el precio y la unidad. El conmutador 1K / 1M que hay junto al precio alterna entre «por mil tokens» y «por millón de tokens». Casi todos los proveedores publican la tarifa por millón, pero si solo tienes el precio por mil, cambia la unidad en vez de dividir a mano. Todo se calcula en USD.
3. Rellena los tokens y la frecuencia. Introduce los tokens de entrada, los de salida y el número de peticiones al día. ¿No sabes cuántos tokens gastas? Pasa antes tu texto por el estimador que hay más abajo en la página.
4. Lee las cuatro tarjetas de resultado. Verás el coste por consulta, al día, al mes y al año, con el coste de entrada y el de salida por separado, para saber si el problema es un prompt demasiado largo o una respuesta que se va de las manos.
5. Estima tokens desde texto. Pega cualquier texto y la herramienta muestra caracteres, palabras y tokens estimados con la heurística general máx(⌈caracteres/4⌉, ⌈palabras×1,33⌉). Sirve para presupuestar; para un recuento exacto, usa tiktoken o el campo usage que devuelve la API.
El coste de una llamada suelta responde a esta fórmula:
C=Tin×Pin+Tout×Pout1.000.000C = \frac{T_{in} \times P_{in} + T_{out} \times P_{out}}{1{.}000{.}000}
Es decir: tokens de entrada por la tarifa de entrada, más tokens de salida por la tarifa de salida, todo escalado de «por millón» a «por token». Multiplícalo por las peticiones al día para el dato diario, y luego por 30 para el presupuesto mensual o por 365 para el anual; la calculadora usa un mes plano de 30 días, así que dos proyecciones hechas con un mes de diferencia siguen siendo comparables.
La costumbre más útil es pasar los mismos recuentos de tokens por tres niveles antes de decidir: pon precio a tu carga de trabajo en el modelo insignia, en el equilibrado y en el barato de la misma familia, y luego mira si el salto de calidad justifica la diferencia de la tarjeta anual. Y si tu política de datos te obliga a fijar la inferencia en una región concreta, presupuesta un 10 % más: en Amazon Bedrock y Google Cloud los endpoints regionales y multirregionales llevan ese recargo sobre el enrutamiento global, y en la API de primera parte de Anthropic el parámetro inference_geo aplica un multiplicador de 1,1×. Todo el cálculo ocurre en tu navegador: el texto que pegas no se envía a ningún servidor ni consume cuota de ningún modelo.

Fórmula para calcular el coste de tokens

C=Tin1.000.000×Pin+Tout1.000.000×PoutC = \frac{T_{in}}{1.000.000} \times P_{in} + \frac{T_{out}}{1.000.000} \times P_{out}
  • CC = Coste total por petición (en la divisa del proveedor, normalmente USD)
  • TinT_{in} = Número de tokens de entrada (el prompt que envías al modelo)
  • ToutT_{out} = Número de tokens de salida (la respuesta generada por el modelo)
  • PinP_{in} = Precio por millón de tokens de entrada del modelo seleccionado
  • PoutP_{out} = Precio por millón de tokens de salida del modelo seleccionado
Para calcular el coste de un proyecto completo, se amplían las variables con el volumen de uso:
Cdiario=C×NCdiario = C \times N Cmensual=Cdiario×30Cmensual = Cdiario \times 30 Canual=Cdiario×365Canual = Cdiario \times 365
Donde N es el número de peticiones al día. La proyección mensual usa un mes plano de 30 días a propósito, para que dos presupuestos hechos en meses distintos se puedan comparar; sobre la factura real, un mes de 31 días sale alrededor de un 3 % por encima y febrero un 7 % por debajo.
Para estimar los tokens a partir de texto, la regla general es que 1 token equivale a unos 4 caracteres en inglés. En español la eficiencia baja: alrededor de 1 token por cada 3,5-4 caracteres, por las conjugaciones, las tildes y las palabras más largas, lo que sitúa el mismo contenido en torno a un 15-25 % más de tokens que su versión inglesa. La cifra depende del tokenizador, así que trátala como orden de magnitud.
Hay una variable que la fórmula esconde: el número de tokens de entrada y de salida no es una propiedad del texto, sino del par texto-modelo. El mismo prompt da recuentos distintos en cada tokenizador, y dentro de Anthropic la generación 4.7 y posteriores produce alrededor de un 30 % más de tokens que la anterior para el mismo contenido. Por eso, cuando compares dos modelos, lo correcto es medir los tokens contra cada uno de ellos (con el campo usage de la API) y no reutilizar un único recuento para toda la comparativa: si mantienes fijos los tokens y solo cambias los precios de entrada y de salida, estás comparando tarifas, no costes.

Precio por millón de tokens de cada modelo (cuánto cuesta 1M de tokens)

ModeloEntrada (USD / millón)Salida (USD / millón)Salida ÷ entrada
Amazon Nova Micro0,035 USD0,14 USD
Cohere Command R7B0,0375 USD0,15 USD
Gemini 2.5 Flash-Lite0,10 USD0,40 USD
DeepSeek V4 Flash0,14 USD0,28 USD
Mistral Small 40,15 USD0,60 USD
GPT-5.6 Luna0,20 USD1,20 USD
GPT-5.4 Nano0,20 USD1,25 USD6,3×
Gemini 3.1 Flash-Lite0,25 USD1,50 USD
Codestral0,30 USD0,90 USD
Gemini 3.5 Flash-Lite0,30 USD2,50 USD8,3×
Gemini 2.5 Flash0,30 USD2,50 USD8,3×
DeepSeek V4 Pro0,435 USD0,87 USD
Mistral Large 30,50 USD1,50 USD
Llama 3.3 70B0,59 USD0,79 USD1,3×
GPT-5.4 Mini0,75 USD4,50 USD
Amazon Nova Pro0,80 USD3,20 USD
Claude Haiku 4.51 USD5 USD
Grok 4.31,25 USD2,50 USD
Gemini 2.5 Pro1,25 USD10 USD
Gemini 3.6 Flash1,50 USD7,50 USD
Mistral Medium 3.51,50 USD7,50 USD
Gemini 3.5 Flash1,50 USD9 USD
GPT-5.3 Codex1,75 USD14 USD
Grok 4.52 USD6 USD
GPT-5.6 Terra2 USD12 USD
Gemini 3.1 Pro2 USD12 USD
Cohere Command R+2,50 USD10 USD
Amazon Nova Premier2,50 USD12,50 USD
GPT-5.42,50 USD15 USD
Claude Sonnet 53 USD15 USD
Claude Sonnet 4.63 USD15 USD
Claude Opus 55 USD25 USD
Claude Opus 4.85 USD25 USD
GPT-5.6 Sol5 USD30 USD
GPT-5.55 USD30 USD
Claude Fable 510 USD50 USD
GPT-5.5 Pro30 USD180 USD

Ejemplos de coste con números reales del motor de cálculo

Chatbot de atención al cliente en GPT-5.6: 100 conversaciones al día

Un chatbot de e-commerce atiende 100 conversaciones al día. Cada una gasta unos 2.000 tokens de entrada (instrucciones del sistema + historial + pregunta del cliente) y unos 500 tokens de salida.
Con GPT-5.6 Sol (5/30 USD por millón): 0,025 USD por conversación, 2,50 USD al día, 75,00 USD al mes y 912,50 USD al año.
Con GPT-5.6 Terra (2/12 USD): 0,01 USD por conversación, 1,00 USD al día, 30,00 USD al mes y 365,00 USD al año. Es el 40 % de Sol en todas las líneas, porque Terra cobra esa misma proporción en los dos lados.
Con GPT-5.6 Luna (0,20/1,20 USD): 0,001 USD por conversación, 0,10 USD al día, 3,00 USD al mes y 36,50 USD al año.
Con Claude Opus 5 (5/25 USD): 0,0225 USD por conversación, 2,25 USD al día, 67,50 USD al mes y 821,25 USD al año.
Con Claude Sonnet 5 (3/15 USD): 0,0135 USD por conversación, 1,35 USD al día, 40,50 USD al mes y 492,75 USD al año.
Con Claude Haiku 4.5 (1/5 USD): 0,0045 USD por conversación, 0,45 USD al día, 13,50 USD al mes y 164,25 USD al año.
Con Gemini 3.6 Flash (1,50/7,50 USD): 0,0068 USD por conversación, 0,675 USD al día, 20,25 USD al mes y 246,38 USD al año.
Con DeepSeek V4 Pro (0,435/0,87 USD): 0,0013 USD por conversación, 0,1305 USD al día, 3,92 USD al mes y 47,63 USD al año.
Mismo tráfico y el abanico mensual va de 75,00 USD arriba a 3,00 USD abajo: un factor de 25. Y no hace falta cambiar de proveedor para mover la aguja: quedándote dentro de GPT-5.6 y bajando de Sol a Luna tienes ese salto entero, 912,50 USD al año frente a 36,50 USD. Fíjate también en que Claude Haiku 4.5 pide 5 veces la entrada de Luna estando en la misma franja, que es la clase de diferencia que conviene calcular en vez de dar por supuesta. Los recuentos de tokens de este ejemplo se toman como medidos: si migras el mismo texto de Sonnet 4.6 a Sonnet 5, súbelos un 30 % (ver el cuarto ejemplo). Elegir modelo es casi siempre la palanca más grande de la factura.

GPT-5.6 Sol frente a Claude Opus 5: agente de código con 200 llamadas al día

El agente de código es la carga de trabajo donde los dos nuevos modelos insignia compiten de verdad. Supón que cada llamada lleva 20.000 tokens de entrada (el contexto del repositorio, el diff y las instrucciones) y devuelve 3.000 tokens de salida, con 200 llamadas al día.
Con GPT-5.6 Sol (5/30 USD): 0,10 USD de entrada más 0,09 USD de salida son 0,19 USD por llamada, 38,00 USD al día, 1140,00 USD al mes y 13.870,00 USD al año.
Con Claude Opus 5 (5/25 USD): 0,10 USD más 0,075 USD son 0,175 USD por llamada, 35,00 USD al día, 1050,00 USD al mes y 12.775,00 USD al año.
Los dos insignia cobran la misma entrada de 5 USD, así que toda la diferencia sale de la salida: 90,00 USD al mes, 1.095,00 al año; Sol cuesta un 8,6 % más que Opus 5. Es una cifra real, pero pequeña, y se da la vuelta en cuanto tu carga se vuelve más pesada de salida o de entrada. Por eso conviene poner precio a tu propia mezcla de tokens en vez de fiarte de un titular.
El dinero está en el nivel de abajo. Con GPT-5.6 Terra (2/12 USD): 0,076 USD por llamada, 15,20 USD al día, 456,00 USD al mes y 5548,00 USD al año. Con Claude Sonnet 5 (3/15 USD): 0,105 USD por llamada, 21,00 USD al día, 630,00 USD al mes y 7665,00 USD al año. Con GPT-5.6 Luna (0,20/1,20 USD): 0,0076 USD por llamada, 1,52 USD al día, 45,60 USD al mes y 554,80 USD al año.
Y una sorpresa que solo aparece al calcularlo: GPT-5.3 Codex (1,75/14 USD), un modelo especializado de la generación anterior, sale por 0,077 USD por llamada, 15,40 al día, 462,00 al mes y 5.621,00 al año. Con esta mezcla de tokens es más barato que Terra (462,00 USD frente a 456,00 USD al mes) porque su entrada es un 30 % menor y el agente de código es intensivo en entrada.
El techo: Claude Fable 5 (10/50 USD) cuesta 0,35 USD por llamada, 70,00 al día, 2.100,00 al mes y 25.550,00 al año, exactamente el doble de Opus 5. Entre Luna y Fable 5 con las mismas 200 llamadas al día hay 22.776,00 USD al año de diferencia.

Documento largo o RAG: leer 100.000 tokens de una vez

Escenario de RAG o documento largo: metes un informe de unos 100.000 tokens de entrada (más o menos un libro corto) y pides un resumen de 2.000 tokens de salida, en una sola petición.
Con GPT-5.6 Sol: 0,50 USD de entrada más 0,06 USD de salida, 0,56 USD en total.
Con Claude Opus 5 (5/25 USD): 0,50 más 0,05, es decir 0,55 USD por petición, un céntimo por debajo de Sol, porque con esta mezcla la entrada compartida de 5 USD se lleva alrededor del 90 % de la factura y la tarifa de salida casi no vota.
Con Claude Sonnet 5 (3/15 USD): 0,30 más 0,03, o sea 0,33 USD.
Con GPT-5.6 Terra (2/12 USD): 0,25 más 0,03, o sea 0,28 USD.
Con Gemini 3.6 Flash (1,50/7,50 USD): 0,15 más 0,015, o sea 0,165 USD.
Con GPT-5.6 Luna (0,20/1,20 USD): 0,10 más 0,012, o sea 0,112 USD.
Con DeepSeek V4 Pro: 0,0435 más 0,00174, o sea 0,0452 USD por petición, alrededor de la duodécima parte de Sol (0,56 frente a 0,0452). La lección es la imagen especular del caso del chatbot: con contexto largo la entrada se come casi todo el coste, así que en documentos y RAG el factor decisivo es el precio de entrada, no el de salida. También explica por qué Sol y Opus 5 parecen intercambiables aquí y se separan en el tráfico de chat.

La trampa del mismo precio: Claude Sonnet 5 frente a Sonnet 4.6

Este es el caso que una hoja de tarifas nunca te va a enseñar. Claude Sonnet 5 y Claude Sonnet 4.6 figuran los dos a 3 USD de entrada y 15 de salida por millón, así que sobre el papel actualizar sale gratis. Pero Anthropic documenta que Claude 4.7 y posteriores usan un tokenizador más nuevo que produce aproximadamente un 30 % más de tokens para el mismo texto, y Sonnet 4.6 se quedó con el anterior.
Toma el chatbot del primer ejemplo: 2.000 tokens de entrada y 500 de salida por conversación, 100 conversaciones al día. Con Sonnet 4.6 son 0,0135 USD por conversación, 40,50 USD al mes y 492,75 USD al año.
Pasa el texto idéntico a Sonnet 5 y el mismo prompt tokeniza en unos 2.600 tokens de entrada y 650 de salida. A las mismas tarifas de 3 y 15 USD: 0,01755 USD por conversación, 1,755 al día, 52,65 USD al mes y 640,58 al año.
Mismo texto, misma hoja de tarifas, 12,15 USD más al mes y 147,83 más al año: una subida del 30 % que no aparece en ninguna página de precios. En prosa la inflación se queda en la parte baja de la horquilla; en código, JSON y cargas estructuradas sube, y las mediciones independientes publicadas van bastante más allá del 30 % en algunos casos.
El matiz que casi nadie cuenta: esto no se aplica a Opus. Claude Opus 4.8 y Claude Opus 5 usan los dos el tokenizador nuevo, así que ese salto sí es neutro de verdad y los 67,50 USD al mes del primer ejemplo valen para los dos.
Cómo usar la calculadora aquí: no reutilices los recuentos de tokens que midieras con un modelo antiguo. Pasa una muestra real por el estimador o, mejor, lee el campo usage que devuelve la API en unas cuantas llamadas de verdad contra el modelo nuevo y mete esos números. Una migración que parece neutra en la tarifa puede acabar un 30 % por encima del presupuesto.

Residencia de datos en la UE: el recargo del 10 % que no está en la tarifa

Un equipo que trata datos personales en Europa normalmente no puede dejar la inferencia en enrutamiento global: necesita fijar región. Ese requisito tiene precio y no aparece en la tabla de tarifas. Anthropic documenta que en Amazon Bedrock y Google Cloud los endpoints regionales y multirregionales llevan un recargo del 10 % sobre los globales, y que en su API de primera parte pedir inferencia solo en EE. UU. con el parámetro inference_geo aplica un multiplicador de 1,1× a entrada, salida, escrituras de caché y lecturas de caché.
Traducido a la calculadora: elige «Personalizado» y multiplica las dos tarifas por 1,1. Claude Sonnet 5 pasa de 3/15 USD a 3,30 / 16,50 USD por millón.
Con el chatbot del primer ejemplo (2.000 tokens de entrada, 500 de salida, 100 conversaciones al día), el coste sube de 0,0135 a 0,01485 USD por conversación, de 40,50 a 44,55 USD al mes y de 492,75 a 542,03 USD al año. Son 4,05 USD al mes y 49,28 al año solo por la restricción de región.
No es una cifra que rompa un presupuesto, pero sí una que se olvida sistemáticamente al comparar proveedores, y al multiplicarse por un volumen de producción real deja de ser calderilla. Si tu proyecto tiene requisitos de residencia de datos, haz la comparativa entre modelos con las tarifas ya multiplicadas por 1,1: el ranking entre dos modelos cercanos no cambia, pero el total anual sí.

Estimar tokens desde texto: cuántos tokens tiene esto

El estimador de texto convierte con máx(⌈caracteres/4⌉, ⌈palabras×1,33⌉).
Una frase corta en inglés, «The quick brown fox jumps over the lazy dog.», tiene 44 caracteres y 9 palabras: por caracteres ⌈44/4⌉ = 11, por palabras ⌈9×1,33⌉ = 12; la herramienta se queda con el mayor, 12 tokens.
Un documento de 500 palabras con 3.999 caracteres: por caracteres ⌈3999/4⌉ = 1.000, por palabras ⌈500×1,33⌉ = 665; se toma el mayor, 1.000 tokens, y gana el lado de los caracteres.
En texto normal con espacios, el lado de «caracteres entre 4» casi siempre manda. Tres advertencias: el código, el JSON y las cadenas largas sin espacios se fragmentan en más tokens; el español es más denso y consume en torno a un 15-25 % más de tokens que el mismo texto en inglés, unos 1,4-1,6 tokens por palabra; y los modelos Claude más nuevos tokenizan el mismo texto alrededor de un 30 % más que sus predecesores. La heurística es una aproximación genérica de BPE, no el recuento de un modelo concreto. Sobra para presupuestar; para cuadrar la factura al céntimo, usa tiktoken o el campo usage de la API.

Errores frecuentes al estimar el coste de tokens

  • Confundir el precio de entrada con el de salida. La salida casi siempre es más cara, y el múltiplo es un rasgo de familia: los tres niveles de GPT-5.6 cobran la salida seis veces más que la entrada (Sol 5 frente a 30, Terra 2,5 frente a 15, Luna 1 frente a 6), toda la línea Claude exactamente cinco veces, Grok 4.5 tres veces y solo modelos como DeepSeek V4 Pro la dejan en el doble (0,435 frente a 0,87 USD). Al presupuestar, mira primero el lado de la salida: recortar la longitud de la respuesta con max_tokens suele ahorrar más que acortar el prompt.
  • Dar por hecho que un sucesor al mismo precio cuesta lo mismo. Claude Sonnet 5 y Sonnet 4.6 figuran los dos a 3 / 15 USD, pero Anthropic documenta que Claude 4.7 y modelos posteriores usan un tokenizador más nuevo que produce alrededor de un 30 % más de tokens para el mismo texto. Misma tarifa sobre más tokens facturables es una factura más alta. Vuelve a medir tus recuentos reales contra el modelo nuevo antes de firmar que la migración es neutra. Ojo al matiz: entre Opus 4.8 y Opus 5 sí es neutra, porque los dos usan ya el tokenizador nuevo.
  • Presupuestar sobre un precio de lanzamiento. Los modelos nuevos suelen salir con una tarifa introductoria temporal que revierte en una fecha publicada, y muchas tablas de terceros copian la cifra promocional sin avisar. Un presupuesto construido sobre una promoción se rompe el día que caduca. Esta calculadora y esta página usan la tarifa estándar bajo demanda de cada modelo justo por eso: si has visto una cifra más baja en otro sitio, comprueba si tiene fecha de caducidad antes de meterla en una previsión.
  • Creer que un token es una palabra y olvidar el tokenizador. En español un texto ocupa alrededor de 1,4-1,6 tokens por palabra, en torno a un 15-25 % más que en inglés, y el código o el JSON aún más. El estimador de esta página usa la heurística general de 4 caracteres por token; para el recuento exacto de cada modelo, usa tiktoken (GPT) o el campo usage que devuelve la API.
  • Mirar solo el coste por consulta y no multiplicarlo por la escala. 0,0135 USD por consulta parece nada, pero a 100 peticiones al día son 40,50 USD al mes y 492,75 al año con Claude Sonnet 5 (ver el primer ejemplo). Lo que decide el presupuesto es precio × frecuencia × días: rellena siempre las peticiones al día en la calculadora.
  • Olvidar que cada turno de una conversación reenvía todo el historial. La API no tiene memoria: en el turno 10 vuelves a mandar los 9 anteriores, y los tokens de entrada crecen de forma casi cuadrática; una charla algo larga son decenas de miles de tokens por petición. Usa una ventana deslizante con los últimos turnos o resume el historial cada cierto tiempo.
  • Tirar del modelo insignia para toda la carga de trabajo. Desde que GPT-5.6 salió como tres modelos separados, el nivel más barato y el más caro de una misma familia están a cinco veces de distancia en los dos lados (Luna 1 / 6 frente a Sol 5 / 30), y la propia línea de Anthropic va de Haiku 4.5 a 1 / 5 hasta Fable 5 a 10 / 50. Clasificar, extraer, enrutar o reescribir se lo puedes dar a Luna, Haiku 4.5, GPT-5.4 Mini o DeepSeek V4 Pro; reserva Sol, Opus 5 o Fable 5 para razonamiento de verdad, código difícil o texto largo. Un enrutador de «primero el modelo pequeño y subo solo si hace falta» corta a menudo la mitad de la factura.
  • Ignorar la caché de prompts y el descuento por lotes. Son descuentos documentados de primera parte, no trucos. Un acierto de caché se factura al 10 % de la tarifa de entrada (en Claude Opus 5, 0,50 USD por millón frente a los 5 USD estándar; en GPT-5.6 Sol, 0,50 USD frente a 5 USD), y Anthropic cobra la escritura de caché de 5 minutos a 1,25× la entrada, de modo que la caché se amortiza con una sola lectura. El trabajo que no corre prisa va por la Batch API con un 50 % de descuento en entrada y salida (Opus 5 baja a 2,50 / 12,50 USD). Coloca el texto fijo al principio del prompt para maximizar los aciertos.
  • No contar los tokens invisibles de las herramientas. Activar herramientas añade un prompt de sistema que también facturas: en Claude Opus 5 son 286 tokens con elección automática y 406 si fuerzas una herramienta, la herramienta bash suma otros 325, y una búsqueda web se cobra además a 10 USD por cada 1.000 búsquedas. En un agente que hace muchas llamadas cortas, esa sobrecarga fija puede ser una fracción nada despreciable de la entrada.
  • Comparar tarifas sin mirar los tramos. Gemini Pro y Grok pasan a una tarifa superior por encima de 200.000 tokens de prompt, mientras que Claude 4.6 y posteriores incluyen la ventana completa de 1 millón a precio estándar: una petición de 900.000 tokens se factura a la misma tarifa por token que una de 9.000. Si trabajas con contexto largo, el tramo puede pesar más que la diferencia de precio base.

Consejos para optimizar el consumo de tokens y reducir costes

  • Elige el nivel adecuado para cada tarea, no solo el proveedor. Desde que GPT-5.6 se publicó como tres modelos separados, tienes Sol (5/30 USD), Terra (2/12 USD) y Luna (0,20/1,20 USD) dentro de la misma familia: clasificar correos o extraer campos se lo puedes dar a Luna, GPT-5.4 Nano (0,20 USD de entrada), DeepSeek V4 Flash (0,14), Mistral Small 4 (0,10) o Amazon Nova Micro (0,035), y reservar Sol, Claude Opus 5 o Claude Fable 5 para razonamiento complejo, código difícil y texto largo.
  • Mide la inflación de tokens antes de migrar, no después. Pasa la misma petición dos veces, una contra tu modelo actual y otra contra el nuevo, y compara el campo usage: si el destino es un Claude 4.7 o posterior, espera alrededor de un 30 % más de tokens de entrada y de salida a igualdad de texto, y presupuesta con esos recuentos ya corregidos.
  • Escribe prompts concisos y coloca el texto fijo al principio. Cada palabra de más son tokens facturados, y poner las instrucciones estables antes de la parte variable es lo que permite que la caché de prompts acierte. Un prompt bien estructurado de 200 tokens rinde a menudo más que uno farragoso de 800.
  • Activa la caché de prompts para los prefijos repetidos. Un acierto se factura al 10 % de la tarifa de entrada (0,50 USD por millón en Claude Opus 5 y en GPT-5.6 Sol, frente a los 5 estándar) y la escritura de la caché de 5 minutos cuesta 1,25× la entrada, así que se amortiza con una sola lectura. Si el prefijo se reutiliza durante más de una hora, compara la caché de 1 hora (2× la escritura) con la de 5 minutos.
  • Manda a la Batch API todo lo que no corra prisa. Informes nocturnos, etiquetado masivo, traducción en volumen o evaluaciones tienen un 50 % de descuento en entrada y salida: Claude Opus 5 baja de 5/25 USD a 2,50 / 12,50 USD por millón y Claude Sonnet 5 de 3/15 USD a 1,50 / 7,50. El descuento se acumula con la caché.
  • Limita la longitud de las respuestas con max_tokens. Es la palanca con mejor relación esfuerzo-resultado, porque la salida cuesta entre dos y seis veces más que la entrada según el modelo: seis en toda la familia GPT-5.6 y cinco en toda la línea Claude. Si solo necesitas una etiqueta o un resumen de 100 palabras, pon el límite y no dejes que el modelo se explaye.
  • Vigila la eficiencia de tokens, no solo la tarifa. Google afirma que Gemini 3.6 Flash consume alrededor de un 17 % menos de tokens en tareas de varios pasos, y Anthropic documenta lo contrario para su generación nueva (un 30 % más). Dos modelos con la misma tarifa pueden dar facturas muy distintas para el mismo trabajo, así que la comparación honesta se hace con tokens medidos en cada uno.
  • Usa el inglés como idioma base del prompt del sistema cuando puedas. Los tokenizadores BPE están entrenados sobre todo con inglés: el mismo texto genera en torno a un 15-20 % menos tokens en inglés que en español. Deja el español para lo que el usuario ve, que es donde importa.
  • Monitoriza el consumo con las herramientas del proveedor y pon alertas de presupuesto. OpenAI, Anthropic y Google ofrecen paneles de uso; una desviación de 100 tokens por petición no se nota en una llamada, pero a 10.000 peticiones al día es un millón de tokens diarios de más.
  • Considera modelos abiertos para volumen alto. Llama 3.3 70B (0,59/0,79 USD), Mistral Small 4 (0,15/0,60 USD) o DeepSeek V4 Flash (0,14/0,28 USD) a través de proveedores gestionados como Groq salen muy por debajo de las APIs propietarias. Autoalojar elimina el coste por token, pero exige inversión en GPU y solo compensa a volúmenes muy altos: haz la cuenta con la tarjeta anual de la calculadora antes de comprar hardware.

Glosario de términos clave

Token

Unidad mínima de texto que procesa un modelo de lenguaje. Puede ser una palabra completa, un trozo de palabra, un signo de puntuación o un espacio. En inglés equivale de media a unos 4 caracteres o 0,75 palabras; en español, a unos 3,5-4 caracteres.

Tokenizador

El componente que parte el texto en tokens antes de que el modelo lo procese. Cada proveedor usa el suyo (los GPT nuevos, la codificación o200k_base), por lo que el mismo texto puede dar recuentos distintos según el modelo, e incluso según la generación dentro de una misma familia.

Inflación de tokens

Subida de la factura sin subida de tarifa, provocada por un tokenizador que produce más tokens para el mismo texto. El caso de referencia es Claude 4.7 y posteriores (Opus 5, Opus 4.8, Sonnet 5, Fable 5), que según Anthropic generan aproximadamente un 30 % más de tokens que los modelos anteriores.

BPE (Byte Pair Encoding)

Algoritmo de tokenización que usan GPT y la mayoría de los modelos de lenguaje. Divide el texto en subtokens fusionando de forma iterativa los pares de caracteres más frecuentes del corpus de entrenamiento, mayoritariamente en inglés, lo que explica que otros idiomas consuman más tokens.

Tokens de entrada (input tokens)

Los tokens que envías al modelo: instrucciones del sistema, contexto, historial de conversación, definiciones de herramientas y tu prompt. Se facturan a un precio inferior al de los tokens de salida.

Tokens de salida (output tokens)

Los tokens que genera el modelo como respuesta. Cuestan entre 2 y 6 veces más que los de entrada según el modelo (seis veces en toda la familia GPT-5.6, cinco en toda la línea Claude, tres en Grok 4.5 y el doble en DeepSeek V4 Pro) porque la generación es secuencial.

Ventana de contexto

El número máximo de tokens (entrada + salida) que un modelo procesa en una sola petición. GPT-5.6 Sol trabaja con 1.050.000 tokens y hasta 128.000 de salida; Claude 4.6 y posteriores incluyen la ventana completa de 1 millón a precio estándar; Gemini 2.5 Pro llega a 1 millón; DeepSeek V4 se mueve en torno a 128.000.

Precio por millón de tokens (MTok)

La unidad estándar de facturación de las APIs de IA. Los proveedores publican tarifas separadas para entrada y salida, en dólares por cada millón de tokens procesados, y muchos añaden columnas específicas para lecturas y escrituras de caché.

Caché de prompts

Mecanismo que reutiliza la parte ya procesada de un prompt entre llamadas. En Anthropic, una lectura de caché cuesta 0,1× la tarifa de entrada, la escritura de 5 minutos 1,25× y la de 1 hora 2×, de modo que la caché se amortiza tras una sola lectura; en la familia GPT-5.6, la entrada en caché baja a 0,50 USD por millón frente a los 5 estándar de Sol.

Batch API

Modo de procesamiento asíncrono para trabajo que no es urgente, con un 50 % de descuento sobre entrada y salida. Con ella, Claude Opus 5 baja de 5/25 USD a 2,50 / 12,50 USD por millón. El descuento se acumula con el de la caché de prompts.

LLM (Large Language Model)

Modelo de lenguaje grande entrenado con miles de millones de parámetros sobre enormes corpus de texto. Ejemplos actuales: GPT-5.6 Sol, Terra y Luna (OpenAI), Claude Opus 5 y Sonnet 5 (Anthropic), Gemini 3.6 Flash (Google), Grok 4.5 (xAI), Llama 4 (Meta), DeepSeek V4 (DeepSeek), Mistral Large 3 (Mistral AI), Command R+ (Cohere) y Nova Premier (Amazon).


Preguntas frecuentes sobre tokens y el coste de las APIs de IA

¿Cuánto cuesta GPT-5.6 Sol por millón de tokens?

GPT-5.6 Sol cuesta 5 USD por millón de tokens de entrada y 30 USD por millón de salida en la tarifa estándar bajo demanda. Es el mismo precio que GPT-5.5, así que el nivel insignia no se ha encarecido esta generación.

¿Qué diferencia de precio hay entre GPT-5.6 Sol, Terra y Luna?

GPT-5.6 salió el 9 de julio de 2026 como tres modelos separados, y de punta a punta hay un factor de 25. Sol, el insignia, va a 5/30 USD por millón. Terra, el nivel equilibrado, a 2/12 USD: el 40 % de Sol en los dos lados. Luna, el más rápido y barato, a 0,20/1,20 USD. Los tres mantienen el mismo ratio de 6 a uno entre salida y entrada, así que cambiar de nivel escala toda tu factura sin cambiarle la forma: el chatbot de los ejemplos cuesta 75,00 USD al mes con Sol, 30,00 USD con Terra y 3,00 USD con Luna.

¿Cuánto cuesta Claude Opus 5 por millón de tokens?

Claude Opus 5 cuesta 5 USD por millón de tokens de entrada y 25 por millón de salida, el mismo precio que Claude Opus 4.8. Es la mitad de Claude Fable 5, que va a 10 y 50 USD.

¿Sale más barato GPT-5.6 Sol o Claude Opus 5?

Depende por completo de cuánta salida generes, porque los dos insignia cobran los mismos 5 USD por millón de entrada y solo se diferencian en la salida: 30 USD Sol frente a 25 Opus 5. En un trabajo de documento largo con 100.000 tokens de entrada y 2.000 de salida están a un céntimo (0,56 frente a 0,55 USD). En un agente de código pesado de salida, con 20.000 de entrada y 3.000 de salida y 200 llamadas al día, Opus 5 sale por 1050,00 USD al mes frente a los 1140,00 USD de Sol: un 8,6 % menos. Mete tu propia mezcla de tokens en vez de fiarte de un titular, porque el ranking lo decide ese ratio y nada más.

¿Un modelo nuevo al mismo precio cuesta lo mismo?

No necesariamente, y esta es la trampa de la generación actual. La documentación de Anthropic dice que Claude 4.7 y modelos posteriores (Opus 5, Opus 4.8, Sonnet 5 y Fable 5) usan un tokenizador más nuevo que convierte el mismo texto en aproximadamente un 30 % más de tokens, mientras que Sonnet 4.6 y anteriores siguen con el anterior. Como la tarifa no cambia (3 y 15 USD en las dos generaciones de Sonnet), una carga de trabajo idéntica factura alrededor de un 30 % más en Sonnet 5 que en Sonnet 4.6: 52,65 USD al mes en lugar de 40,50 USD en el ejemplo del chatbot. Paridad de tarifa no es paridad de coste. Entre Opus 4.8 y Opus 5, en cambio, sí lo es, porque los dos usan ya el tokenizador nuevo.

¿Por qué esta calculadora usa la tarifa estándar de Claude Sonnet 5 y no la de lanzamiento?

Porque un presupuesto construido sobre una promoción se rompe cuando la promoción acaba. Anthropic lanzó Sonnet 5 con una tarifa introductoria temporal que revierte a los 3 USD de entrada y 15 de salida por millón en una fecha publicada, y muchas tablas de precios copian la cifra promocional sin decirlo. Esta calculadora usa la tarifa estándar, que además es exactamente la misma que cobra Sonnet 4.6, para que las cifras mensuales y anuales que saques aquí sigan siendo válidas después. Si quieres modelar la ventana promocional, elige «Personalizado» y mete la tarifa más baja a mano.

¿Cuál es la API de IA más barata?

Entre los modelos de gama frontera, los más baratos son Grok 4.5 a 2 USD de entrada y 6 de salida por millón y Gemini 3.1 Pro a 2 y 12, con GPT-5.6 Terra justo encima a 2,50 y 15. Si bajas un nivel, GPT-5.6 Luna a 1 y 6 o Claude Haiku 4.5 a 1 y 5 vuelven a partir eso casi por la mitad. Y si lo que manda es el precio bruto, DeepSeek V4 Pro va a 0,435 y 0,87, y Amazon Nova Micro a solo 0,035 y 0,14. Dos advertencias: Gemini 3.1 Pro y Grok pasan a una tarifa superior por encima de 200.000 tokens de prompt, y el modelo capaz más barato para tu tarea lo decide tu conjunto de evaluación, no la hoja de tarifas.

¿Cuánto cuesta un millón de tokens en GPT, Claude y DeepSeek?

Depende del modelo y de si es entrada o salida. Un millón de tokens de entrada va desde 0,035 USD en Amazon Nova Micro y 0,435 en DeepSeek V4 Pro hasta 5 USD en GPT-5.6 Sol y Claude Opus 5, y 30 en GPT-5.5 Pro; un millón de salida, desde 0,14 hasta 180 USD. La banda de frontera es más estrecha de lo que sugiere el rango completo: los modelos de gama alta se mueven entre 2 y 5 USD de entrada, con salidas de 6 USD en Grok 4.5 a 30 en GPT-5.6 Sol. Tienes el desglose completo en la tabla de arriba.

¿Cuántos tokens tiene un texto de 1.000 palabras en español?

Unos 1.500-1.650 tokens. El español consume en torno a un 15-25 % más de tokens que el inglés para el mismo contenido, alrededor de 1,4-1,6 tokens por palabra frente a los ~1,33 del inglés. Como regla rápida, multiplica las palabras en español por 1,5, y añade otro 30 % si el modelo es un Claude 4.7 o posterior.

¿Por qué los tokens de salida cuestan más que los de entrada?

Entre dos y seis veces más, según el modelo. Generar texto es secuencial: el modelo produce un token, lo añade al contexto y calcula el siguiente, mientras que la entrada se lee de una sola pasada en paralelo. Por eso los tres niveles de GPT-5.6 cobran la salida seis veces más que la entrada, la familia Claude exactamente cinco veces, Grok 4.5 tres y DeepSeek V4 Pro el doble. Al optimizar, recortar la salida es lo que más ahorra.

¿Cuánto cuesta un chatbot con IA al mes?

Depende del modelo y del volumen. Para un chatbot típico de 2.000 tokens de entrada y 500 de salida por consulta, a 100 consultas al día: GPT-5.6 Sol sale por 75,00 USD al mes (912,50 USD al año), Claude Opus 5 por 67,50 USD, Claude Sonnet 5 por 40,50 USD, GPT-5.6 Terra por 30,00 USD, Claude Haiku 4.5 por 13,50 USD, DeepSeek V4 Pro por 3,92 USD y GPT-5.6 Luna por apenas 3,00 USD al mes (36,50 USD al año). Cambia los tokens y la frecuencia en la calculadora para ajustarlo a tu caso: si tu cifra mensual se pone por encima de unos 200 USD, las palancas de enrutamiento y caché de más abajo compensan un día de trabajo de ingeniería.

¿Cómo cuento tokens de forma exacta antes de llamar a la API?

Tienes tres caminos. El más exacto para los modelos de OpenAI es la librería tiktoken (los GPT nuevos usan la codificación o200k_base). El más rápido es pegar el texto en el estimador de esta página, que te da tokens y coste por modelo sin escribir código. El tercero es la regla aproximada de 4 caracteres por token. Ten en cuenta que Claude, Gemini o Llama usan tokenizadores propios que no son públicos, y que la generación más nueva de Claude cuenta alrededor de un 30 % por encima de la anterior, así que en producción la fuente fiable es el campo usage que devuelve cada API.

¿Es gratis y segura esta calculadora de tokens?

Sí, es gratuita y no necesita registro. El texto que pegas en el estimador se procesa en tu propio navegador: no se envía a ningún servidor ni consume cuota de ningún modelo, así que no hay riesgo de filtrar tu prompt. Los precios salen de las tarifas públicas de OpenAI, Anthropic, Google, DeepSeek y el resto de proveedores, y el resultado es una estimación para presupuestar; la factura final es siempre la que marca la consola de cada API.

¿Qué precisión tiene esta estimación de coste?

La aritmética es exacta: la calculadora multiplica tus recuentos de tokens por las tarifas publicadas por millón, así que con los datos correctos la cifra por consulta cuadra con la línea de tu factura. Tres cosas mueven el importe real. Los recuentos de tokens son aproximados salvo que los tomes del campo usage de la API. La proyección mensual usa un mes plano de 30 días, de modo que un mes de 31 sale alrededor de un 3 % más alto y febrero un 7 % más bajo. Y no se aplican descuentos: la caché de prompts, la Batch API y los acuerdos empresariales facturan por debajo de la tarifa estándar. Trátalo como una cifra de planificación bien fundamentada, no como un presupuesto en firme.

Mi factura real es más alta que la estimación, ¿por qué?

Casi siempre por algo que la tarifa base no incluye. Repasa esta lista: el modo rápido de Claude Opus 5 se factura a 10 / 50 USD por millón, el doble del estándar; las escrituras de caché cuestan 1,25× la entrada (2× si eliges la caché de una hora), aunque las lecturas bajen al 10 %; activar herramientas añade un prompt de sistema facturable (286 o 406 tokens en Opus 5, más 325 de la herramienta bash); la búsqueda web se cobra aparte a 10 USD por cada 1.000 búsquedas; fijar la inferencia en una región concreta suma un 10 %; y si has migrado a un Claude 4.7 o posterior, el mismo texto genera alrededor de un 30 % más de tokens. Añade a eso que un mes de 31 días es un 3 % más largo que el mes plano de 30 que usa la proyección.

¿Qué es la ventana de contexto y cómo afecta al coste?

La ventana de contexto es el número máximo de tokens que un modelo procesa en una sola petición, sumando entrada y salida. GPT-5.6 Sol trabaja con una ventana de 1.050.000 tokens y hasta 128.000 de salida, y Anthropic incluye la ventana completa de 1 millón a precio estándar en Claude 4.6 y posteriores, así que una petición de 900.000 tokens se factura a la misma tarifa por token que una de 9.000. Gemini Pro y Grok, en cambio, pasan a una tarifa superior por encima de 200.000 tokens de prompt, y DeepSeek V4 se mueve en torno a 128.000. En cualquier caso, una ventana grande no hace barato usarla entera: una conversación larga reenvía todo el historial como tokens de entrada en cada llamada.

¿Por qué una conversación de pocos turnos gasta tantos tokens?

Porque la API no guarda estado: en cada turno le vuelves a enviar toda la conversación anterior. En el turno 10 la entrada incluye los 9 turnos previos, así que los tokens crecen de forma casi cuadrática y una charla no muy larga acaba en decenas de miles de tokens de entrada. Para contenerlo: activa la caché de prompts, usa una ventana deslizante con los últimos turnos o resume el historial cada cierto tiempo.

¿Las imágenes y los archivos también consumen tokens?

Sí. Los modelos multimodales trocean cada imagen en bloques y los convierten en tokens: una imagen de 1024×1024 suele salir por entre 700 y 1.300 tokens según el modelo, y en Claude el coste es ⌈ancho/28⌉ × ⌈alto/28⌉ tokens visuales. Los documentos se convierten antes a texto y se facturan como tal: Anthropic estima unos 2.500 tokens para una página web de 10 kB y unos 125.000 para el PDF de un artículo de investigación de 500 kB. Las aplicaciones con mucha imagen (OCR, análisis de capturas) son las que más disparan la factura, así que mide el consumo real en un conjunto de prueba antes de fiarte del presupuesto.

¿Pago más por fijar la inferencia en Europa?

Sí, alrededor de un 10 % más. Anthropic documenta que en Amazon Bedrock y Google Cloud los endpoints regionales y multirregionales llevan un recargo del 10 % sobre el enrutamiento global, y que en su API de primera parte pedir inferencia acotada con el parámetro inference_geo aplica un multiplicador de 1,1× a entrada, salida y caché. Si tu proyecto tiene requisitos de residencia de datos, elige «Personalizado» y multiplica las tarifas por 1,1: Claude Sonnet 5 pasa de 3/15 USD a 3,30 / 16,50 USD por millón, y el chatbot de los ejemplos sube de 40,50 a 44,55 USD al mes.

Ya sé mi coste mensual, ¿cómo bajo la factura?

Cinco palancas, de mayor a menor efecto. Una: enruta por dificultad y manda las tareas simples a GPT-5.6 Luna, Claude Haiku 4.5, GPT-5.4 Mini o DeepSeek V4 Pro, dejando GPT-5.6 Sol o Claude Opus 5 solo para lo difícil; bajar de Sol a Luna ya es dividir por cinco. Dos: activa la caché de prompts para los prefijos repetidos, que factura los aciertos al 10 % de la entrada. Tres: pasa el trabajo sin prisa por la Batch API, con un 50 % de descuento. Cuatro: limita la salida con max_tokens, que es donde más duele el múltiplo de seis a uno. Cinco: recorta las instrucciones del sistema. Vuelve a meter los números nuevos en la calculadora y verás el ahorro mensual y anual.

Fuentes y referencias

  1. Hugging Face — Tokenización BPE explicada
  2. OpenAI — Precios de la API
  3. Anthropic Claude — Precios de la API
  4. Anthropic Claude — Documentación de conteo de tokens
  5. Google Gemini — Precios de la API

Contenido verificado por el equipo de Smart Calculators