ai for designersJuly 26, 20269 min read

AI 智能体的 Token 成本:你到底在为什么付费

基于 157,670 次真实 Claude Code 交互轮次的实测数据:可见输出仅占账单的 12%,缓存读取占 48%,而你付费的大部分 token 你从未见过。

By Boone
XLinkedIn
ai agent token costs

所有人都在优化模型写多少字。可写作大约只占账单的八分之一。

简短的答案

真正花钱的地方,是你每一轮都要重新发送的上下文,以及你被计费却从未看到的推理过程。我们对一台工作站进行了埋点,记录了 2026 年 4 月 26 日至 7 月 26 日期间 157,670 次去重后的 Claude Code API 响应中的 usage 对象,数据截止于最后一天的 UTC 时间 08:25。这是实测数据,不是估算。

在这批数据中,可见输出占 Opus 4.8 支出的 12.1%。缓存读取占 48%。缓存写入占 39%,而真正未缓存的输入占比不到 1%,只是个可以忽略的误差项。

这只是一台工作站运行一类工作的数据,所以这些比例应该被视为一种形态,而不是普适常数。重要的是这个形态,而这个形态恰恰不是大多数人被教导要去优化的东西。

体素风格插画:一座账单冰山,水面上是很小的可见尖端,水下是巨大的隐藏部分。
体素风格插画:一座账单冰山,水面上是很小的可见尖端,水下是巨大的隐藏部分。

你到底在为什么付费

一轮智能体交互不是一条聊天消息。每一轮都会重新发送整个工作上下文:系统提示词、工具定义、已经读取过的文件,以及此前的全部对话记录。如果你对这个机制还不熟悉,我们在上下文窗口到底是如何运作的一文中做了详细拆解。

Anthropic 的提示词缓存文档(2026 年 7 月 26 日核实)对这些重发内容分三档计价。5 分钟 TTL 的缓存写入费用是基础输入费率的 1.25 倍,1 小时 TTL 的写入费用是 2 倍,缓存读取费用是 0.1 倍。同一份文档指出,设置断点本身是免费的,你只会为实际写入或读取的 token 付费。

下面是一份真实账单的解剖图,采用我们实测的占比。

Token 类型占实测账单比例相对基础输入的费率实际含义
缓存读取48%0.1 倍上下文被重新发送,并在之后的轮次中命中缓存
缓存写入39%5 分钟档 1.25 倍,1 小时档 2 倍存储上下文,以便下一轮能以低价读取
输出12.1%Opus 5 上为 5 倍可见文本加上被计费的推理内容
未缓存输入不到 1%1 倍罕见的缓存未命中情况

把这张表多看一遍。单价最便宜的那一项,恰恰是账单上金额最大的一项,因为用量胜过单价。

体素风格插画:一个 AI 智能体每一轮都在重新发送完整的上下文堆栈。
体素风格插画:一个 AI 智能体每一轮都在重新发送完整的上下文堆栈。

你的大部分输出 token 是不可见的

Anthropic 的扩展思考文档,解释了被计费的推理 token 与可见推理 token 的区别。
Anthropic 的扩展思考文档,解释了被计费的推理 token 与可见推理 token 的区别。

在 platform.claude.com 上阅读

推理 token 会按标准输出费率计入输出计费。Anthropic 的扩展思考文档明确指出,你会为完整的思考 token 付费,而 API 返回给你的只是一份精简摘要,所以你付费的数字和你能读到的数字并不是同一个数字。

根据 Anthropic 自适应思考文档,一个重要的推论是:被计费的思考量不会随 display 设置而改变。关掉推理面板只会让你的终端更安静,账单却分毫不变。

我们可以从外部观察到这个差距。在纯文本轮次中,我们的数据记录显示,Opus 5 每个计费输出 token 对应 2.7 个可见字符,而普通英文文本大约是每个 token 对应 4.0 个字符。也就是说,你为输出付费的内容中,大约有三分之一从未出现在你的屏幕上。

这并不是什么丑闻。产品本来就是这样设计的,推理深度是一个你可以通过effort 等级来调节的旋钮,而不是通过显示开关。

缓存读取才是账单的主体

Anthropic 提示词缓存文档,展示了 5 分钟缓存生命周期和刷新规则。
Anthropic 提示词缓存文档,展示了 5 分钟缓存生命周期和刷新规则。

在 platform.claude.com 上阅读

缓存读取本身既便宜又稳定。但被读取的上下文会在整个会话中不断增长,而且每一轮都会被重新读取一次,于是这个便宜的东西就这样累积成了账单的主体。

这也是为什么闲置时间也要花钱。Anthropic 的提示词缓存文档(2026 年 7 月 26 日核实)将默认缓存生命周期设定为 5 分钟,每次使用缓存内容都会刷新计时。如果会话闲置超过这个时长,下一轮就得按 1.25 倍输入费率重新写入缓存,而不是按 0.1 倍读取。在智能体工作流里,一次喝咖啡的休息都是要计费的事件。

Anthropic 自己的 Claude Code 成本文档显示,企业级使用的平均成本大约是每个开发者每个活跃日 13 美元,每个开发者每月 150 到 250 美元,90% 的用户每个活跃日花费不到 30 美元。我们的数据同样落在这个区间内,Opus 4.8 每轮大约 0.25 美元。真正的变量是轮次数量乘以上下文规模,而不是啰嗦程度。

Opus 5 写得更多,花费却差不多

Claude Opus 5 明显比 Opus 4.8 更“话痨”。在我们数据中对比的匹配轮次里,Opus 5 平均输出 3,882 个 token,而 Opus 4.8 是 2,582 个,增幅达 50%,两者的 bootstrap 95% 置信区间不重叠。这是真实的行为差异,不是采样噪音。

接下来是大多数人搞错的地方。Anthropic 公开的价格表(2026 年 7 月 26 日核实)显示,Opus 5 和 Opus 4.8 的价格完全一致:每百万输入 token 5 美元,每百万输出 token 25 美元,缓存档位也相同。既然输出只占账单的 12.1%,输出增加 50% 也只会让总费用上涨大约 6%。

我们用两个模型各自的费率,对整整两个月的工作量重新计价。结果是 Opus 5 比 Opus 4.8 高出大约 5%。如果你喜欢旧模型的性价比,正如我们在《Opus 4.8 实测笔记》中所说的那样,那么新模型并不会像看起来那样是一场预算灾难。

模型每百万输入 token5 分钟缓存写入1 小时缓存写入缓存读取每百万输出 token
Claude Opus 5$5.00$6.25$10.00$0.50$25.00
Claude Opus 4.8$5.00$6.25$10.00$0.50$25.00
Claude Fable 5$10.00不适用不适用不适用$50.00
Claude Sonnet 5,发布至 2026 年 8 月 31 日$2.00不适用不适用不适用$10.00
Claude Sonnet 5,自 2026 年 9 月 1 日起$3.00不适用不适用不适用$15.00
Claude Haiku 4.5$1.00不适用不适用不适用$5.00

缓存倍率是结构性的,所以你可以从基础输入费率推导出每一行。Anthropic 的文档中包含了 Sonnet 5 的首发价格,以及将于 2026 年 9 月 1 日起取代它的 3 美元和 15 美元。

真正贵的模型,是输入费率高的那个

在 platform.claude.com 上查看价格表

既然输入占大头,真正让人肉疼的是输入费率高的模型,而不是输出数字最大的那个。根据 Anthropic 的价格表,Claude Fable 5 的输入价格是每百万 10 美元,而 Opus 5 只要 5 美元,这个翻倍的输入费率,恰好砸在你账单中占 87% 的缓存流量上。

用同样的两个月工作量重新计价,Fable 5 的成本大约是 Opus 5 的 1.9 倍,几乎正好等于它的输入倍率,这正是问题的关键所在。我们在《Fable 5 评测》中讨论了这份能力在什么情况下值得多花这笔钱。

反过来往下看,同样的逻辑也成立。按首发价格每百万输入 2 美元计算,Sonnet 5 相较 Opus 档位,能把账单中占大头的这一项砍掉 60%,而我们的匹配轮次数据显示,它每轮的输出量比 Opus 4.8 略少,而不是更多。

两个有用的杠杆,一个没用的杠杆

Anthropic 自适应思考文档确认,无论显示设置如何,被计费的 token 数量都保持不变。
Anthropic 自适应思考文档确认,无论显示设置如何,被计费的 token 数量都保持不变。

在 platform.claude.com 上阅读

没用的那个杠杆,就是要求模型给出更短的回答。你在优化账单里 12% 的那部分,同时却在削弱你真正花钱买的东西,这也是我们在《AI Token 节食陷阱》中点名批评这种做法的原因。

真正有用的两个杠杆:

  • 减少被重新发送的内容。上下文中放更少文件,缩小读取范围,在对话记录膨胀之前进行压缩,结束会话而不是让它闲置到超过 TTL
  • 让模型匹配输入费率。把常规的智能体轮次路由到更便宜的输入档位,把昂贵档位留给那些准确度真正值回票价的轮次

这两者都是上下文层面的纪律,而不是提示词层面的纪律。具体操作方法见《Claude Code 上下文管理指南》

如何测算你自己的花费

在 platform.claude.com 上查看 API 参考文档

不要盲信任何人给出的比例,包括我们的。每个 API 响应都携带一个 usage 对象,它才是你自己工作负载的真实数据来源。

  • 记录每一次响应的 usage,而不是抽样,聚合前按响应 id 去重
  • 把输入拆分成四个桶:缓存读取、5 分钟写入、1 小时写入、未缓存,因为它们的定价各不相同
  • 用各自的费率乘以对应的桶,而不是只报告原始 token 数量,因为数量会掩盖缓存读取和输出 token 之间高达 50 倍的差距
  • 对比可见字符数与被计费的输出 token 数,看看你到底为多少推理内容买了单

花两个下午做埋点,得到的信息会比网上所有讲定价的博客加起来都多,包括这一篇在内。

常见问题

隐藏思考输出会降低我的账单吗?

不会。Anthropic 的自适应思考文档指出,被计费的思考 token 数量不会随显示设置改变,变化的只是返回给你的内容。

Claude Opus 5 比 Opus 4.8 更贵吗?

几乎不贵。根据 Anthropic 的价格表,它与 Opus 4.8 共享同一份价格卡,均为每百万 token 5 美元和 25 美元。虽然我们的数据显示它每轮多写 50%,但用同样的工作量重新计价后,总体只贵了大约 5%。

我应该切换到 Sonnet 5 来省钱吗?

对于常规的智能体轮次来说,大概率应该。Anthropic 的价格表列出,截至 2026 年 8 月 31 日的首发价格为每百万输入 2 美元,这直接打在你账单中金额最大的一项上,而不是最小的那项。

要求更短的回答能省钱吗?

几乎没用。输出只占我们实测账单的 12.1%,把它砍半也只能让总费用下降大约六个百分点,却会让工作质量变差。

为什么我几乎没干活的那天,账单反而飙升了?

因为闲置时间太长。Anthropic 的文档显示默认缓存生命周期是 5 分钟,一旦过期,下一轮就要按 1.25 倍的输入费率重写整个上下文,而不是按 0.1 倍读取。

正常的月度花费是多少?

Anthropic 的 Claude Code 成本文档给出的数据是,每个开发者每个活跃日大约 13 美元,每月 150 到 250 美元,90% 的用户每个活跃日花费不到 30 美元。重度智能体使用场景的花费会远高于这个水平。

账单本质上是个上下文问题

你的账单衡量的不是模型说了多少话,而是你让它重新读了多少遍你的项目。

本文中的所有数据,都来自对一台工作站长达三个月的实测,涵盖 2026 年 4 月 26 日至 7 月 26 日期间的 157,670 次 API 响应。它不构成行业基准,也不是厂商预测,它只是说明了我们的钱花在了哪里,细节足够详实,你可以据此检验同样的情况是否也适用于你。

然后据此给你的工作定价,因为每轮的工具成本如今已经是一份设计合作中真实存在的一项,而不是可以忽略的误差。我们在《AI 增强型设计工作如何定价》中详细介绍了应对方法。

Want the working version of this, every week? Join the Brainy creator list.

Get Started

More from Brainy Papers

Keep reading