如何节省 Claude API 的 Token — 实用省钱技巧
长会话、Prompt Caching、合理选模型、缩短 Prompt。用最简单的方式真正降低 Claude API 的 Token 消耗。
为什么 Token 消耗得这么快
Claude API 按 Token 计费——发送的内容是输入 Token,模型回复的内容是输出 Token。来回的文字越多,账单越高。省钱的关键不是少用 Claude,而是不要把同一段上下文反复发送。
技巧 1 — 在长会话中工作
这是最有效的一招。在 Claude Code、Cursor、Cline 等 IDE 智能体中开发时,请把同一个任务保持在同一个长会话里,而不是每一步都新开一个聊天。
同一会话会自动启用 Prompt Caching:系统提示、项目文件、规则和历史消息会以大约原价的 10% 计费。新开聊天,缓存就会清零,整段上下文又按全价重新发送。
技巧 2 — 选对模型
不要什么都用 Opus。 Opus 最强但最贵。日常编码、改写、问答用 Sonnet 已经能搞定 90% 的事情,价格只是 Opus 的一小部分。
Haiku 适合简单场景:自动补全、分类、短答案。比 Sonnet 便宜数倍,速度也完全够用。
技巧 3 — Prompt 写短、写准
输出 Token 大约是输入 Token 价格的 5 倍,但输入也会累积——尤其当你"以防万一"地把整个文件都贴进去。两个简单习惯:
- 只贴文件中真正相关的那段,而不是整份文件。
- 问一个明确的问题,而不是堆一大段上下文然后期待模型自己理解。
技巧 4 — 限制输出长度
大多数客户端都支持 max_tokens 参数。只需要一个函数、一段话、一个短答案?设个上限。模型会提前停下来,你只为真正需要的内容付费。
技巧 5 — 不要每次改动都新开会话
这是 IDE 智能体里最常见的错误。打开 Cursor,问一件事,得到答复,再开个新聊天问下一件小事。一天 30 次,余额很快就消失了。
每开一个新聊天 = 新的系统提示 + 重新加载的项目上下文 + 重新上传的文件,全部按原价计费。同样这 30 个问题如果在同一个会话里问,价格只有几分之一——因为第一条消息之后就开始命中缓存。
技巧 6 — 关注用量
头一周每天都看一眼仪表板。最贵的几种模式很快就会暴露:失控的 Agent 循环、过长的系统提示、忘了关掉的"总结整个仓库"请求。修掉一个,就比所有其他技巧加起来省得还多。
一句话总结
- 一个任务 = 一个长会话,让 Prompt Caching 发挥作用。
- 默认 Sonnet,Opus 留给真正复杂的任务,Haiku 处理轻量场景。
- 精简 Prompt,设置
max_tokens,不要整段贴文件。 - 不要在 IDE 智能体里每一步都新开聊天。
- 定期查看用量,干掉最贵的那个用法。