Smart Calculators SmartCalculators

Token 计算器

计算使用 AI 语言模型的成本,从文本估算 token 数量,并比较 GPT-5、Claude、Gemini 等模型的计费。

$

$

1K / 1M

每次请求成本

$0.02

输入: $0.0050 · 输出: $0.01

每日成本

$1.75

100 每日请求次数

每月成本

$52.50

30 天

年度成本

$638.75

365 天

从文本估算 token 数

Token 计算器。估算大模型 token 数量与 GPT、Claude、DeepSeek 的 API 费用。

Token 计算器根据文本或 token 数,按每百万 token 单价估算 GPT、Claude、Gemini、DeepSeek 等大模型的输入与输出 API 费用。它同时给出单次、每天、每月和每年成本——例如 100 万输入 token 从 DeepSeek V4 Pro 的 0.435 美元到 Claude Opus 4.8 的 5 美元不等,输出 token 通常更贵。

什么是 token?大模型 API 为什么按 token 收费

Token 是大语言模型处理文本的最小单位,也是几乎所有大模型 API 的计费单位。一个 token 可能是一个汉字、一个英文单词、一个词根、一个标点,甚至一个英文长单词里的若干字节片段。你发给模型的提示词(prompt)、系统指令、对话历史、检索到的资料,加上模型生成的回答,全部按 token 计量;OpenAI、Anthropic、Google、DeepSeek 等厂商都以「每百万 token 多少美元」标价,而且输入 token 与输出 token 分开计费,输出通常明显更贵。
中文和英文的 token 密度并不一样,关键在分词器。OpenAI、Anthropic 早期的词表以英文为默认语言,中文是后来「塞进」词表的,所以在 GPT、Claude 上 1 个汉字大约折合 1 到 1.5 个 token,同样意思的中文往往比英文更费 token——这就是常被讨论的「中文税」。但 2026 年的情况已经出现反转:DeepSeek、通义千问(Qwen)等国产模型从一开始就把大量常用汉字与词组作为整字、整词纳入词表,1 个汉字常常只算 1 个 token 甚至更少,在中文密集的文本上常常比英文还更省 token。因此「中文一定更贵」在国产模型上已经不成立,处理中文语料时选对分词器本身就是省钱。
对中国开发者来说,估算 token 早已不只是「看 OpenAI 账单」,而是在中外十几款模型里挑性价比最高的那一个。本计算器内置 OpenAI、Anthropic、Google、DeepSeek、xAI、Mistral、Amazon、Meta、Cohere 等厂商的预设单价,其中 DeepSeek 是价格极低的国产代表——V4 Pro 每百万输入 token 仅 0.435 美元、输出 0.87 美元,官方定价页可查。通义千问、Kimi、豆包、智谱 GLM 等尚未内置的模型,可切到「自定义」手动填入它们每百万或每千 token 的单价,同样能算出从单次到每年的完整成本。

Token 计算器怎么用

从选模型到看懂每月账单,只要几步。
1. 选模型。下拉列表按厂商分组,选 GPT-5.4、Claude Sonnet 4.6、DeepSeek V4 Pro 等预设会自动带入官方单价;列表里没有的模型,如通义千问、Kimi、豆包,选「自定义」后手动填单价。
2. 确认单价与单位。单价框旁的「1K / 1M」开关可在「每千 token」和「每百万 token」之间切换——国产厂商常按元/千 token 报价,海外多按美元/百万 token,本工具统一以美元结算。
3. 填 token 数与频率。分别填入输入 token、输出 token 和每天调用次数。不确定 token 数?用下方的文本估算器先估一版。
4. 读结果四张卡。单次、每天、每月、每年费用一目了然,输入成本与输出成本也分开列出,方便你判断到底是提示词太长还是回答太啰嗦。
5. 用文本估算器。粘贴任意文本,立刻看到字符数、词数和估算 token 数;它采用 max(⌈字符/4⌉, ⌈词数×1.33⌉) 的通用启发式——对英文和中英混排够用,纯中文偏保守,追求精确请用 tiktoken 或直接读 API 返回的 usage 字段。
单次费用的公式是:
C=Tin×Pin+Tout×Pout1,000,000C = \frac{T_{in} \times P_{in} + T_{out} \times P_{out}}{1{,}000{,}000}
换句话说:输入 token 数 × 输入单价,加上 输出 token 数 × 输出单价,再除以 100 万,就是单次费用;把它乘以每天调用次数、再乘以 30,就是每月预算。本工具全部在浏览器本地计算,粘贴的文本不会上传到任何服务器,也不消耗任何模型配额。

大模型 API 费用计算公式

C=Tin×Pin1,000,000+Tout×Pout1,000,000C = \frac{T_{in} \times P_{in}}{1{,}000{,}000} + \frac{T_{out} \times P_{out}}{1{,}000{,}000}
  • CC = 单次 API 调用费用(美元或人民币,与单价单位一致)
  • TinT_{in} = 输入 token 数(system prompt + 对话历史 + 当前请求)
  • ToutT_{out} = 输出 token 数(模型生成的回答 / JSON / 代码)
  • PinP_{in} = 输入价格(每 1,000,000 token 的费率)
  • PoutP_{out} = 输出价格(每 1,000,000 token 的费率)
若按月规划预算,把单次费用乘以日调用量与天数即可:
Cmonthly=(Tin×Pin+Tout×Pout1,000,000)×R×30C_{monthly} = \left(\frac{T_{in} \times P_{in} + T_{out} \times P_{out}}{1{,}000{,}000}\right) \times R \times 30
其中 R 为日均请求数。
开启 prompt 缓存(OpenAI 自动、Anthropic 显式声明、阿里云百炼上下文缓存、Kimi/DeepSeek 自动命中)后,命中部分按基础输入价的 10%–50% 计费。Claude Sonnet 4.6 缓存命中是 0.30 美元/百万 token(输入 3 美元 的 10%),DeepSeek V4 Flash 缓存命中低至 0.0028 美元/百万 token,Kimi K2.6 缓存命中按 16.9% 计费。如果 system prompt 与 RAG 上下文每次重复发送 2,000 token,开缓存可节省 70%–90% 的输入成本。Batch API(OpenAI、Anthropic、阿里云、Kimi)通常再给 50% 折扣,适合非实时报表、批量打标签、离线总结这类任务。

各大模型每百万 token 价格速查(1M tokens 是多少钱)

模型输入(美元 / 百万 token)输出(美元 / 百万 token)输出 ÷ 输入
Amazon Nova Micro0.035 美元0.14 美元
Cohere Command R7B0.0375 美元0.15 美元
Gemini 2.5 Flash-Lite0.10 美元0.40 美元
DeepSeek V4 Flash0.14 美元0.28 美元
Mistral Small 40.15 美元0.60 美元
GPT-5.6 Luna0.20 美元1.20 美元
GPT-5.4 Nano0.20 美元1.25 美元6.3×
Gemini 3.1 Flash-Lite0.25 美元1.50 美元
Codestral0.30 美元0.90 美元
Gemini 3.5 Flash-Lite0.30 美元2.50 美元8.3×
Gemini 2.5 Flash0.30 美元2.50 美元8.3×
DeepSeek V4 Pro0.435 美元0.87 美元
Mistral Large 30.50 美元1.50 美元
Llama 3.3 70B0.59 美元0.79 美元1.3×
GPT-5.4 Mini0.75 美元4.50 美元
Amazon Nova Pro0.80 美元3.20 美元
Claude Haiku 4.51 美元5 美元
Grok 4.31.25 美元2.50 美元
Gemini 2.5 Pro1.25 美元10 美元
Gemini 3.6 Flash1.50 美元7.50 美元
Mistral Medium 3.51.50 美元7.50 美元
Gemini 3.5 Flash1.50 美元9 美元
GPT-5.3 Codex1.75 美元14 美元
Grok 4.52 美元6 美元
GPT-5.6 Terra2 美元12 美元
Gemini 3.1 Pro2 美元12 美元
Cohere Command R+2.50 美元10 美元
Amazon Nova Premier2.50 美元12.50 美元
GPT-5.42.50 美元15 美元
Claude Sonnet 53 美元15 美元
Claude Sonnet 4.63 美元15 美元
Claude Opus 55 美元25 美元
Claude Opus 4.85 美元25 美元
GPT-5.6 Sol5 美元30 美元
GPT-5.55 美元30 美元
Claude Fable 510 美元50 美元
GPT-5.5 Pro30 美元180 美元

费用估算实例:中国开发者常见场景(数字来自计算器引擎)

中文客服机器人:每天 100 次对话,一年差多少钱

一个电商客服机器人:每次对话的输入约 2,000 token(系统指令 + 对话历史 + 用户问题),回答约 500 输出 token,每天 100 次。
用 GPT-5.4(输入 2.50 美元、输出 15 美元/百万 token):单次 0.0125 美元,每天 1.25 美元,每月 37.50 美元,每年 456.25 美元。
换 Claude Sonnet 4.6(3/15 美元):单次 0.0135 美元,每天 1.35 美元,每月 40.50 美元,每年 492.75 美元。
换 Claude Haiku 4.5(1/5 美元):单次 0.0045 美元,每月 13.50 美元,每年 164.25 美元。
换 DeepSeek V4 Pro(0.435/0.87 美元):单次 0.001305 美元,每天 0.1305 美元,每月 3.92 美元,每年 47.63 美元——月成本约为 GPT-5.4 的十分之一(3.92 美元 对 37.50 美元)。同样一套对话量,选对模型一年就差出四百多美元,模型选型几乎是账单上最大的杠杆。

长文档 / RAG:一次读入 10 万 token 要花多少

媒体或知识库场景,一次把一份长报告(约 100,000 输入 token,大致相当于 6–8 万汉字、一本中篇小说)喂给模型,生成 2,000 token 的摘要。
用 GPT-5.4:输入 0.25 美元 + 输出 0.03 美元 = 单次 0.28 美元。
用 Claude Opus 4.8(5/25 美元):输入 0.50 美元 + 输出 0.05 美元 = 单次 0.55 美元。
用 Gemini 3.5 Flash(1.50/9 美元):输入 0.15 美元 + 输出 0.018 美元 = 单次 0.168 美元。
用 DeepSeek V4 Pro:输入 0.0435 美元 + 输出 0.0017 美元 = 单次 0.0452 美元——约为 GPT-5.4 的六分之一(0.28 美元 对 0.0452 美元)。注意长上下文里输入 token 占绝对大头,所以「输入单价」才是长文档任务的决定因素,这也是国产长文本模型在这类场景几乎闭眼选的原因。

从文本估算 token:这段话到底多少 token

文本估算器用 max(⌈字符/4⌉, ⌈词数×1.33⌉) 换算。
一句英文短句「The quick brown fox…」共 44 个字符、9 个词:按字符 ⌈44/4⌉ = 11,按词数 ⌈9×1.33⌉ = 12,取较大值 = 12 token。
一篇 500 词的英文文档共 3,999 个字符:按字符 ⌈3999/4⌉ = 1,000,按词数 ⌈500×1.33⌉ = 665,取较大值 = 1,000 token(字符项胜出)。
可见对正常带空格的文本,字符/4 一侧几乎总是主导。要提醒的是:纯中文没有空格、字符密度更高,字符/4 会低估真实 token;在 GPT 系上实际约 1–1.5 token/字,在 DeepSeek、Qwen 上约 1 token/字甚至更少。要报预算就够用,要精确对账请以 API 的 usage 字段为准。

估算 token 成本时最容易踩的坑

  • 把输入价当成输出价。输出几乎总是更贵:GPT-5.4 输出是输入的 6 倍(2.5 → 15 美元),Claude 系约 5 倍,只有 DeepSeek V4 Pro 这类国产模型压到 2 倍(0.435 → 0.87 美元)。规划预算要先盯输出侧,砍回答长度(设 max_tokens)往往比压 prompt 更省。
  • 以为 token 数就是字数,忽略分词器差异。同一段中文在 GPT 系约 1–1.5 token/字,在 DeepSeek、Qwen 上常常 ≤1 token/字,在中文密集的文本上常常比英文还更省 token。用错换算会整体高估或低估账单;本页估算器用的是通用的 4 字符≈1 token 启发式,纯中文的精确值请用 tiktoken 或看 API 的 usage 字段。
  • 只看单次成本,忘了乘规模。单次 0.0135 美元看着微不足道,可每天 100 次就是每月 40.50 美元、每年 492.75 美元(Claude Sonnet 4.6,见实例)。真正决定预算的是「单价 × 频率 × 天数」,一定要把日调用量填进计算器。
  • 忘了多轮对话每轮都重发历史。API 是无状态的,第 10 轮要把前 9 轮完整发一遍,token 近似二次方增长,对话稍长就是几万 token 的输入。用滑动窗口只保留最近几轮,或每隔几轮做一次摘要压缩。
  • 用最贵的模型做最简单的活。分类、抽取、改写这类任务交给 DeepSeek V4 Pro、GPT-5.4 Mini、Claude Haiku 4.5;推理、复杂代码、长文创作再上 GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.8。一个「先小模型判断、必要时升级」的路由策略常能砍掉一半账单。
  • 忽略缓存与 Batch 折扣。重复的系统指令、知识库前缀开启 prompt 缓存后,命中部分通常按输入价的一折左右计费(DeepSeek 更低);离线报表、批量打标签、批量翻译这类不赶时间的任务走 Batch API,普遍再打五折。把固定长文本放在 prompt 最前面,能最大化缓存命中率。

降低大模型 API 成本的实战建议

  • 按任务难度分流模型。简单的分类、抽取、关键词匹配交给 DeepSeek V4 Flash、豆包 Lite、Qwen-Turbo、Kimi K1、GPT-5.4 Nano、Gemini 2.5 Flash-Lite 这类 0.1–0.4 元/百万 token 区间的轻量模型;推理、复杂代码、长文创作再上 Claude Sonnet 4.6、GPT-5.4、Claude Opus 4.8、Gemini 3.1 Pro、Grok 4.3、Qwen-Max。一个简单的「先小模型判断,必要时升级」的路由策略,往往能把账单砍掉 40%–60%。
  • 中文场景优先国产模型。OpenAI 的 tiktoken 对中文不友好,1 汉字常被切成 1.5–2 token;通义千问、千帆、DeepSeek、Kimi 的分词器对中文做过优化,同样的中文输入便宜 30%–50%。再叠加豆包、DeepSeek 的低单价,处理中文语料的总成本能压到 GPT 的 1/10 以下。
  • 把 system prompt 和重复上下文塞进缓存。OpenAI 自动缓存(GPT-5.4/5.5 系命中按输入价 10% 计费)、Claude 显式 cache_control(命中 10% 计费)、阿里云百炼上下文缓存、Kimi 自动缓存(命中 16.9%)、DeepSeek V4 缓存命中(命中价仅 0.0028 美元/百万 token)。RAG、客服、Code Copilot 这类反复发送同一段长 prompt 的应用,命中率超过 80% 是常态,输入成本可省 70%–90%。
  • 用 Batch API 处理离线任务。OpenAI、Anthropic、阿里云、Kimi 都提供 50% 左右折扣的批量接口,适合夜间报表、历史数据回填、批量打标签、离线翻译。一份原本要 1,000 元的批量任务,跑批量接口能压到 500 元甚至 400 元(Kimi 是 4 折)。
  • 压 prompt、压输出。把 system prompt 从 2,000 token 削到 500 token,输入费用立省 75%;用 max_tokens 限定输出长度(FAQ 答案设 200,代码片段设 600),避免模型啰嗦。中文项目把固定的 system 指令换成英文,token 数还能再降 30%–50%,对回答质量基本无影响。
  • 监控用量、设支出告警。OpenAI、Anthropic、阿里云、火山引擎、智谱后台都提供按模型、按 endpoint、按 API key 的用量看板。给每个项目设硬性月度上限,避免 bug 或循环调用导致一夜烧光预算(业内每年都有几起新闻级事故)。
  • 高并发、高合规场景考虑自部署。Llama 4、DeepSeek V4、Qwen3、Mistral 都是开源权重,可以在自有 GPU 上跑。Groq、SiliconFlow、阿里云 PAI 也提供托管推理,0.11–0.5 美元/百万 token,比闭源 API 便宜 5–10 倍。日调用百万级以上的应用,自部署回本周期通常在 3–6 个月内。

Token 与大模型 API 术语表

Token

大模型处理文本的最小单位,可以是 1 个汉字、1 个英文单词、1 个标点,或者英文长单词的若干字节片段。所有主流 API 都按 token 计费,输入与输出分开标价。

分词器(Tokenizer)

把原始文本切成 token 的算法。不同厂商用不同分词器:OpenAI 用 tiktoken(cl100k_base / o200k_base),Anthropic 用自研 BPE,Google 用 SentencePiece,通义千问、文心一言对中文专项优化。同一段文本在不同分词器下 token 数差距可达 50%。

BPE(Byte Pair Encoding)

字节对编码——主流 LLM 最常用的分词算法,通过反复合并最高频字节对构建词表。GPT、Claude、Llama、DeepSeek、Qwen 都用 BPE 或其变体。BPE 对英文压缩率高,对中文相对偏低,是「中文比英文贵」的技术根因。

上下文窗口(Context Window)

模型单次请求能处理的最大 token 数(输入 + 输出之和)。2026 年主流:GPT-5.4 与 GPT-5.5 系 1M、Claude Fable 5 / Opus 4.8 / Sonnet 4.6 1M、Grok 4.3 1M、Gemini 2.5 Pro 1M、Qwen3-Max 1M、Kimi K2.6 256K。超过 200K 通常切换到更高费率。

Prompt 缓存

厂商把重复的 prompt 前缀(system prompt、长上下文、历史对话)的 KV 张量保存在显存里,下次同前缀直接复用。命中价为基础输入价的 10%–50%,可让 RAG、客服等高重复应用的输入成本下降 70%–90%。OpenAI/Kimi/DeepSeek 自动管理,Anthropic/阿里云需显式声明。

输入 token vs 输出 token

输入 token = 你发给模型的 prompt(含 system prompt、对话历史、RAG 上下文);输出 token = 模型生成的回答。输出价通常是输入价的 3–8 倍,因为生成需要逐 token 串行推理,GPU 开销远高于并行处理输入。

每百万 token 单价($/MTok 或 元/百万 token)

大模型 API 的标准计费单位。海外厂商多用美元/百万 token($/MTok),国产厂商常见两种:元/百万 token(如通义千问)或元/千 token(如豆包、文心)。换算时注意单位差三个数量级。

Batch API

异步批量调用接口,OpenAI、Anthropic、阿里云百炼、Kimi 都提供,输入和输出均享 50% 左右折扣(Kimi 为 4 折)。适合非实时任务:夜间报表、历史回填、离线打标签、批量翻译。延迟从秒级变成 24 小时内,但成本砍半。


关于 token 与大模型 API 费用的常见问题

1,000 个 token 大约等于多少汉字?

OpenAI 官方给的经验值是 1,000 token ≈ 750 个英文单词。在 GPT、Claude 上 1 个汉字约 1–1.5 token,1,000 token 大致对应 650–1,000 个汉字;在通义千问、DeepSeek 这类对中文友好的分词器上,1 个汉字常只算 1 token,1,000 token 能装下约 1,000 个汉字。中英混排要分别估算后相加。

100 万 token(1M tokens)到底是多少钱?

取决于模型和输入/输出。按主流单价,100 万个输入 token 从 DeepSeek V4 Pro 的 0.435 美元到 Claude Opus 4.8 的 5 美元;100 万个输出 token 从 0.87 到 25 美元不等。完整对照见上方速查表。

为什么输出 token 比输入 token 贵?

因为生成机制不同。输入 token 可以一次并行读入 GPU,一次前向传播就能处理几千个;输出 token 却必须一个接一个串行生成,每生成一个就要重新跑一次推理,显存带宽开销大得多。所以 GPT-5.4 输出 15 美元是输入 2.5 美元的 6 倍,Claude 系约 5 倍,DeepSeek V4 Pro 约 2 倍。优化账单时,砍输出长度的边际收益最大。

中文比英文更费 token 吗?

看分词器。GPT、Claude 的词表以英文为默认,中文约 1–1.5 token/字,同样意思往往比英文贵,也就是所谓「中文税」。但 DeepSeek、通义千问(Qwen)等国产模型把汉字整字纳入词表,中文常常 ≤1 token/字,在中文密集的文本上常常比英文还更省 token。所以中文项目优先国产分词器,反而更省钱。

怎么精确数 token?不调 API 能算吗?

三条路。第一,用 OpenAI 的 tiktoken 库(新版 GPT 系统一用 o200k_base 编码)。第二,把文本粘进上方的在线估算器,立刻看到 token 数和各模型费用,不用写代码。第三,用「英文 4 字符≈1 token、中文约 1–1.5 token/字」的经验公式心算。生产环境最准的还是 API 返回的 usage 字段,输入、输出、缓存命中都有。

这个 token 计算器免费吗?数据安全吗?

完全免费,无需登录或注册。粘贴的文本只在你的浏览器本地估算 token 数,不会发送到任何服务器,也不会消耗任何模型的 token 配额,因此没有提示词泄露风险。模型单价来自 OpenAI、Anthropic、Google、DeepSeek 等厂商的公开报价;结果仅作预算参考,最终以各家 API 控制台的 usage 账单为准。

上下文窗口和 token 限制是一回事吗?

不是。上下文窗口(context window)指模型单次能处理的最大 token 总数(输入 + 输出),是架构上限;token 限制有时还指 API 层的 max_tokens 参数,即你愿意为输出付多少 token。2026 年常见窗口:GPT-5.4 与 5.5 系约 1M,Claude Opus 4.8、Sonnet 4.6 约 1M,Gemini 2.5 Pro 约 1M,DeepSeek V4 约 128K。注意「窗口大」不等于「实际效果好」,超长上下文往往还要付更贵的费率。

为什么对话才 10 轮就烧掉几万 token?

因为 API 是无状态的,每一轮都要把完整历史重新发一遍。第 10 轮的输入包含前 9 轮全部内容,token 近似二次方增长。省法:开 prompt 缓存、用滑动窗口只留最近几轮、或每隔几轮做一次摘要压缩。

图片、文件也要算 token 吗?

要。多模态模型会把图片按小块(tile)切分再转成 token,一张高清图从几百到上千 token 不等;PDF、Word、Excel 通常先被解析成纯文本再分词,按文本计费。OCR、UI 截图分析这类视觉密集应用最容易爆账单,建议上线前先在测试集上实测 token 用量,再用本计算器套上单价估预算。

算出月成本后,怎么把账单降下来?

五个杠杆,按收益从大到小:一是按任务难度分流模型,简单任务用 DeepSeek V4 Pro、GPT-5.4 Mini、Claude Haiku 4.5,复杂任务才上 GPT-5.4、Claude Opus 4.8;二是开 prompt 缓存,重复前缀命中后大幅降价;三是离线任务走 Batch API,普遍五折;四是压缩系统指令、用 max_tokens 限制输出长度;五是中文语料优先国产分词器省 token。把新单价填回计算器,就能看到每月、每年省了多少。

GPT-5.6 Sol 每百万 token 多少钱?

GPT-5.6 Sol 输入每百万 token 5 美元,输出 30 美元;Terra 为 2/12 美元,Luna 为 0.20/1.20 美元。以每次 2,000 输入 token、500 输出 token、每天 100 次请求的客服机器人为例,Sol 每月约 75.00 美元,Terra 30.00 美元,Luna 3.00 美元——三档之间正好相差 25 倍。

Claude Opus 5 多少钱?比 GPT-5.6 Sol 便宜吗?

Claude Opus 5 输入每百万 token 5 美元,输出 25 美元;Claude Sonnet 5 为3/15 美元。Opus 5 的输入单价与 GPT-5.6 Sol 相同,但输出更便宜,所以结论取决于你的输入输出比例:同样是 2,000/500、每天 100 次请求,Opus 5 每月 67.50 美元,Sol 为 75.00 美元;而在输入占比很高的长文场景里,两者每次调用的差距不到一分钱。

同样的价格,新模型的花费真的一样吗?

不一定。Claude 4.7 及之后的模型(Opus 5、Opus 4.8、Sonnet 5)换用了新的分词器,同一段文字会切出比 Sonnet 4.6 多约 30% 的 token。Sonnet 5 与 Sonnet 4.6 的单价都是 3/15 美元,但原本在 Sonnet 4.6 上每月 40.50 美元 的负载,迁到 Sonnet 5 后约为 52.65 美元。从 Opus 4.8 升到 Opus 5 则没有这个问题,因为两者用的已经是同一个新分词器。

参考资料

  1. Hugging Face — BPE 分词技术讲解
  2. OpenAI — API 定价
  3. Anthropic Claude — API 定价
  4. Anthropic Claude — Token 计数文档
  5. Google Gemini — API 定价

由 Smart Calculators 团队审核