Token 计算器
计算使用 AI 语言模型的成本,从文本估算 token 数量,并比较 GPT-5、Claude、Gemini 等模型的计费。
$0.02
输入: $0.0050 · 输出: $0.01
$1.75
100 每日请求次数
$52.50
30 天
$638.75
365 天
从文本估算 token 数
字符
0
字数
0
估算 token 数
~0
Token 计算器。估算大模型 token 数量与 GPT、Claude、DeepSeek 的 API 费用。
什么是 token?大模型 API 为什么按 token 收费
Token 计算器怎么用
大模型 API 费用计算公式
- = 单次 API 调用费用(美元或人民币,与单价单位一致)
- = 输入 token 数(system prompt + 对话历史 + 当前请求)
- = 输出 token 数(模型生成的回答 / JSON / 代码)
- = 输入价格(每 1,000,000 token 的费率)
- = 输出价格(每 1,000,000 token 的费率)
各大模型每百万 token 价格速查(1M tokens 是多少钱)
| 模型 | 输入(美元 / 百万 token) | 输出(美元 / 百万 token) | 输出 ÷ 输入 |
|---|---|---|---|
| Amazon Nova Micro | 0.035 美元 | 0.14 美元 | 4× |
| Cohere Command R7B | 0.0375 美元 | 0.15 美元 | 4× |
| Gemini 2.5 Flash-Lite | 0.10 美元 | 0.40 美元 | 4× |
| DeepSeek V4 Flash | 0.14 美元 | 0.28 美元 | 2× |
| Mistral Small 4 | 0.15 美元 | 0.60 美元 | 4× |
| GPT-5.6 Luna | 0.20 美元 | 1.20 美元 | 6× |
| GPT-5.4 Nano | 0.20 美元 | 1.25 美元 | 6.3× |
| Gemini 3.1 Flash-Lite | 0.25 美元 | 1.50 美元 | 6× |
| Codestral | 0.30 美元 | 0.90 美元 | 3× |
| Gemini 3.5 Flash-Lite | 0.30 美元 | 2.50 美元 | 8.3× |
| Gemini 2.5 Flash | 0.30 美元 | 2.50 美元 | 8.3× |
| DeepSeek V4 Pro | 0.435 美元 | 0.87 美元 | 2× |
| Mistral Large 3 | 0.50 美元 | 1.50 美元 | 3× |
| Llama 3.3 70B | 0.59 美元 | 0.79 美元 | 1.3× |
| GPT-5.4 Mini | 0.75 美元 | 4.50 美元 | 6× |
| Amazon Nova Pro | 0.80 美元 | 3.20 美元 | 4× |
| Claude Haiku 4.5 | 1 美元 | 5 美元 | 5× |
| Grok 4.3 | 1.25 美元 | 2.50 美元 | 2× |
| Gemini 2.5 Pro | 1.25 美元 | 10 美元 | 8× |
| Gemini 3.6 Flash | 1.50 美元 | 7.50 美元 | 5× |
| Mistral Medium 3.5 | 1.50 美元 | 7.50 美元 | 5× |
| Gemini 3.5 Flash | 1.50 美元 | 9 美元 | 6× |
| GPT-5.3 Codex | 1.75 美元 | 14 美元 | 8× |
| Grok 4.5 | 2 美元 | 6 美元 | 3× |
| GPT-5.6 Terra | 2 美元 | 12 美元 | 6× |
| Gemini 3.1 Pro | 2 美元 | 12 美元 | 6× |
| Cohere Command R+ | 2.50 美元 | 10 美元 | 4× |
| Amazon Nova Premier | 2.50 美元 | 12.50 美元 | 5× |
| GPT-5.4 | 2.50 美元 | 15 美元 | 6× |
| Claude Sonnet 5 | 3 美元 | 15 美元 | 5× |
| Claude Sonnet 4.6 | 3 美元 | 15 美元 | 5× |
| Claude Opus 5 | 5 美元 | 25 美元 | 5× |
| Claude Opus 4.8 | 5 美元 | 25 美元 | 5× |
| GPT-5.6 Sol | 5 美元 | 30 美元 | 6× |
| GPT-5.5 | 5 美元 | 30 美元 | 6× |
| Claude Fable 5 | 10 美元 | 50 美元 | 5× |
| GPT-5.5 Pro | 30 美元 | 180 美元 | 6× |
费用估算实例:中国开发者常见场景(数字来自计算器引擎)
中文客服机器人:每天 100 次对话,一年差多少钱
长文档 / RAG:一次读入 10 万 token 要花多少
从文本估算 token:这段话到底多少 token
估算 token 成本时最容易踩的坑
- 把输入价当成输出价。输出几乎总是更贵:GPT-5.4 输出是输入的 6 倍(2.5 → 15 美元),Claude 系约 5 倍,只有 DeepSeek V4 Pro 这类国产模型压到 2 倍(0.435 → 0.87 美元)。规划预算要先盯输出侧,砍回答长度(设 max_tokens)往往比压 prompt 更省。
- 以为 token 数就是字数,忽略分词器差异。同一段中文在 GPT 系约 1–1.5 token/字,在 DeepSeek、Qwen 上常常 ≤1 token/字,在中文密集的文本上常常比英文还更省 token。用错换算会整体高估或低估账单;本页估算器用的是通用的 4 字符≈1 token 启发式,纯中文的精确值请用 tiktoken 或看 API 的 usage 字段。
- 只看单次成本,忘了乘规模。单次 0.0135 美元看着微不足道,可每天 100 次就是每月 40.50 美元、每年 492.75 美元(Claude Sonnet 4.6,见实例)。真正决定预算的是「单价 × 频率 × 天数」,一定要把日调用量填进计算器。
- 忘了多轮对话每轮都重发历史。API 是无状态的,第 10 轮要把前 9 轮完整发一遍,token 近似二次方增长,对话稍长就是几万 token 的输入。用滑动窗口只保留最近几轮,或每隔几轮做一次摘要压缩。
- 用最贵的模型做最简单的活。分类、抽取、改写这类任务交给 DeepSeek V4 Pro、GPT-5.4 Mini、Claude Haiku 4.5;推理、复杂代码、长文创作再上 GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.8。一个「先小模型判断、必要时升级」的路由策略常能砍掉一半账单。
- 忽略缓存与 Batch 折扣。重复的系统指令、知识库前缀开启 prompt 缓存后,命中部分通常按输入价的一折左右计费(DeepSeek 更低);离线报表、批量打标签、批量翻译这类不赶时间的任务走 Batch API,普遍再打五折。把固定长文本放在 prompt 最前面,能最大化缓存命中率。
降低大模型 API 成本的实战建议
- 按任务难度分流模型。简单的分类、抽取、关键词匹配交给 DeepSeek V4 Flash、豆包 Lite、Qwen-Turbo、Kimi K1、GPT-5.4 Nano、Gemini 2.5 Flash-Lite 这类 0.1–0.4 元/百万 token 区间的轻量模型;推理、复杂代码、长文创作再上 Claude Sonnet 4.6、GPT-5.4、Claude Opus 4.8、Gemini 3.1 Pro、Grok 4.3、Qwen-Max。一个简单的「先小模型判断,必要时升级」的路由策略,往往能把账单砍掉 40%–60%。
- 中文场景优先国产模型。OpenAI 的 tiktoken 对中文不友好,1 汉字常被切成 1.5–2 token;通义千问、千帆、DeepSeek、Kimi 的分词器对中文做过优化,同样的中文输入便宜 30%–50%。再叠加豆包、DeepSeek 的低单价,处理中文语料的总成本能压到 GPT 的 1/10 以下。
- 把 system prompt 和重复上下文塞进缓存。OpenAI 自动缓存(GPT-5.4/5.5 系命中按输入价 10% 计费)、Claude 显式 cache_control(命中 10% 计费)、阿里云百炼上下文缓存、Kimi 自动缓存(命中 16.9%)、DeepSeek V4 缓存命中(命中价仅 0.0028 美元/百万 token)。RAG、客服、Code Copilot 这类反复发送同一段长 prompt 的应用,命中率超过 80% 是常态,输入成本可省 70%–90%。
- 用 Batch API 处理离线任务。OpenAI、Anthropic、阿里云、Kimi 都提供 50% 左右折扣的批量接口,适合夜间报表、历史数据回填、批量打标签、离线翻译。一份原本要 1,000 元的批量任务,跑批量接口能压到 500 元甚至 400 元(Kimi 是 4 折)。
- 压 prompt、压输出。把 system prompt 从 2,000 token 削到 500 token,输入费用立省 75%;用 max_tokens 限定输出长度(FAQ 答案设 200,代码片段设 600),避免模型啰嗦。中文项目把固定的 system 指令换成英文,token 数还能再降 30%–50%,对回答质量基本无影响。
- 监控用量、设支出告警。OpenAI、Anthropic、阿里云、火山引擎、智谱后台都提供按模型、按 endpoint、按 API key 的用量看板。给每个项目设硬性月度上限,避免 bug 或循环调用导致一夜烧光预算(业内每年都有几起新闻级事故)。
- 高并发、高合规场景考虑自部署。Llama 4、DeepSeek V4、Qwen3、Mistral 都是开源权重,可以在自有 GPU 上跑。Groq、SiliconFlow、阿里云 PAI 也提供托管推理,0.11–0.5 美元/百万 token,比闭源 API 便宜 5–10 倍。日调用百万级以上的应用,自部署回本周期通常在 3–6 个月内。
Token 与大模型 API 术语表
Token
大模型处理文本的最小单位,可以是 1 个汉字、1 个英文单词、1 个标点,或者英文长单词的若干字节片段。所有主流 API 都按 token 计费,输入与输出分开标价。
分词器(Tokenizer)
把原始文本切成 token 的算法。不同厂商用不同分词器:OpenAI 用 tiktoken(cl100k_base / o200k_base),Anthropic 用自研 BPE,Google 用 SentencePiece,通义千问、文心一言对中文专项优化。同一段文本在不同分词器下 token 数差距可达 50%。
BPE(Byte Pair Encoding)
字节对编码——主流 LLM 最常用的分词算法,通过反复合并最高频字节对构建词表。GPT、Claude、Llama、DeepSeek、Qwen 都用 BPE 或其变体。BPE 对英文压缩率高,对中文相对偏低,是「中文比英文贵」的技术根因。
上下文窗口(Context Window)
模型单次请求能处理的最大 token 数(输入 + 输出之和)。2026 年主流:GPT-5.4 与 GPT-5.5 系 1M、Claude Fable 5 / Opus 4.8 / Sonnet 4.6 1M、Grok 4.3 1M、Gemini 2.5 Pro 1M、Qwen3-Max 1M、Kimi K2.6 256K。超过 200K 通常切换到更高费率。
Prompt 缓存
厂商把重复的 prompt 前缀(system prompt、长上下文、历史对话)的 KV 张量保存在显存里,下次同前缀直接复用。命中价为基础输入价的 10%–50%,可让 RAG、客服等高重复应用的输入成本下降 70%–90%。OpenAI/Kimi/DeepSeek 自动管理,Anthropic/阿里云需显式声明。
输入 token vs 输出 token
输入 token = 你发给模型的 prompt(含 system prompt、对话历史、RAG 上下文);输出 token = 模型生成的回答。输出价通常是输入价的 3–8 倍,因为生成需要逐 token 串行推理,GPU 开销远高于并行处理输入。
每百万 token 单价($/MTok 或 元/百万 token)
大模型 API 的标准计费单位。海外厂商多用美元/百万 token($/MTok),国产厂商常见两种:元/百万 token(如通义千问)或元/千 token(如豆包、文心)。换算时注意单位差三个数量级。
Batch API
异步批量调用接口,OpenAI、Anthropic、阿里云百炼、Kimi 都提供,输入和输出均享 50% 左右折扣(Kimi 为 4 折)。适合非实时任务:夜间报表、历史回填、离线打标签、批量翻译。延迟从秒级变成 24 小时内,但成本砍半。