支持 Claude、GPT、Gemini、DeepSeek 等主流模型,涵盖输入 / 输出 / 缓存读取 / 缓存写入
Token 是模型处理文本的基本单位。英文约 1 Token ≈ 4 字符 ≈ 0.75 单词;中文 1 个汉字通常消耗约 1.5–2 个 Token。
现代 LLM API 通常按 4 类 Token 分别计费:
① 输入 Token:新送入模型、未命中缓存的部分,按"输入价格"计费。
② 缓存读取 Token:命中 Prompt Cache 的部分,按"缓存读取价"计费(通常为输入价的 10%,节省 90%)。
③ 缓存写入 Token:第一次写入缓存的 Token 数,按"缓存写入价"计费(比输入价更贵,相当于预付)。
④ 输出 Token:模型生成的 Token,按"输出价格"计费(通常最贵)。
当你的请求有大量重复的系统提示 / 上下文(如 RAG 中的固定文档、Few-shot 示例、长对话历史)时,开启 Prompt Caching 可以显著降低成本。
适用场景:
• 长文档问答、代码库上下文
• 多轮对话(把历史 system prompt 缓存)
• Agent 工具调用(固定的工具描述)
⚠️ 注意:第一次请求仍要付"写入价",从第二次开始同前缀的请求才能享受"读取价"。写入价通常 ≥ 输入价,所以仅在请求复用 2 次以上时才有收益。
| 厂商 / 模型 | 读取价/输入价 | 写入价/输入价 | 最小缓存 |
|---|---|---|---|
| Anthropic (Claude 4.x) | 10% | 125% (5m) / 200% (1h) | 1024 Tokens |
| OpenAI (GPT-5.x / 4.1) | 10% | 不支持显式写入 | 1024 Tokens |
| Google (Gemini 2.5/3.x) | 10% | 免费 / 自动 | 无最小限制 |
| DeepSeek (V3 / R1) | ~65% | 不支持 | 64 Tokens |
| xAI (Grok 4.x) | 16% | 不支持 | — |
所有价格为每百万 Token 的美元价格。带 ✦ 表示支持 Prompt Caching。
| 模型 | 输入 | 输出 | 缓存读取 | 缓存写入 5m | 缓存写入 1h |
|---|