🧮 Token 用量价格计算器

支持 Claude、GPT、Gemini、DeepSeek 等主流模型,涵盖输入 / 输出 / 缓存读取 / 缓存写入

快速选择模型
基于 OpenRouter 实时数据,Top 模型按使用量排序
定价设置
所有价格单位:美元 / 百万 Token

Token 单价

未缓存的输入 Token 单价
模型生成的输出 Token 单价
命中 Prompt Caching 的输入 Token 单价(通常为输入价的 10%)
写入 Prompt Cache 的 Token 单价(5 分钟 TTL,Anthropic/Gemini)
写入 Prompt Cache 的 Token 单价(1 小时 TTL,Anthropic)
用于换算为人民币(CNY)
Token 用量
填写本次请求中各类 Token 的数量

输入侧 Token

未命中缓存的新输入 Token
命中缓存的输入 Token(按缓存读取价计费)
写入 5 分钟缓存的 Token 数
写入 1 小时缓存的 Token 数

输出侧 Token

模型生成的 Token 数量
重复上述请求多少次(用于估算批量场景)

💰 总成本

未选择预设
$0.000000
≈ ¥0.00
输入
$0.00
输出
$0.00
缓存读取
$0.00
缓存写入 5m
$0.00
缓存写入 1h
$0.00
📚 计费说明
Token 是什么?不同类型如何计费?

Token 是模型处理文本的基本单位。英文约 1 Token ≈ 4 字符 ≈ 0.75 单词;中文 1 个汉字通常消耗约 1.5–2 个 Token。

现代 LLM API 通常按 4 类 Token 分别计费:

① 输入 Token:新送入模型、未命中缓存的部分,按"输入价格"计费。
② 缓存读取 Token:命中 Prompt Cache 的部分,按"缓存读取价"计费(通常为输入价的 10%,节省 90%)。
③ 缓存写入 Token:第一次写入缓存的 Token 数,按"缓存写入价"计费(比输入价更贵,相当于预付)。
④ 输出 Token:模型生成的 Token,按"输出价格"计费(通常最贵)。

什么时候该用 Prompt Caching?

当你的请求有大量重复的系统提示 / 上下文(如 RAG 中的固定文档、Few-shot 示例、长对话历史)时,开启 Prompt Caching 可以显著降低成本。

适用场景:
• 长文档问答、代码库上下文
• 多轮对话(把历史 system prompt 缓存)
• Agent 工具调用(固定的工具描述)

⚠️ 注意:第一次请求仍要付"写入价",从第二次开始同前缀的请求才能享受"读取价"。写入价通常 ≥ 输入价,所以仅在请求复用 2 次以上时才有收益。

不同模型的缓存机制
厂商 / 模型 读取价/输入价 写入价/输入价 最小缓存
Anthropic (Claude 4.x) 10% 125% (5m) / 200% (1h) 1024 Tokens
OpenAI (GPT-5.x / 4.1) 10% 不支持显式写入 1024 Tokens
Google (Gemini 2.5/3.x) 10% 免费 / 自动 无最小限制
DeepSeek (V3 / R1) ~65% 不支持 64 Tokens
xAI (Grok 4.x) 16% 不支持
当前预设模型价格表(来源:OpenRouter)

所有价格为每百万 Token 的美元价格。带 ✦ 表示支持 Prompt Caching。

模型 输入 输出 缓存读取 缓存写入 5m 缓存写入 1h
已应用预设