返回
Kevin Riedl

9 分钟 阅读 · 02 Jul 2026
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

每 token 更便宜,每任务仍可能更贵

Artificial Analysis 按 Claude Sonnet 5 原先宣布的未来标准费率计算,也就是每百万输入 token 3 美元、输出 token 15 美元。在此基础上,Intelligence Index 每任务约花费 2.29 美元,而 Opus 4.8 约为 1.99 美元。该基准明确没有采用 Sonnet 5 的上市优惠价(1)。

这个历史比较有参考价值,但已不是当前价格比较。Anthropic 后来把输入 2 美元、输出 10 美元的上市价格改为永久标准价。把三分之一的降幅按比例应用到已公布估算,得到每任务约 1.53 美元,低于上述 Opus 4.8 数字。这只是算术示例,不是新的基准测试。

每百万 token 的数字仍没有回答真正决定账单的问题:模型要使用多少计费 token 和工具操作,才能得到可接受结果?

一个绕圈子推理的模型并不便宜。它只是起步便宜。

选择模型时,应比较每完成一个任务的总成本,而不仅是每 token 标价。

没人给它定价的数字:得出答案所需的 token 数

每百万 token 的价格只是贴在橱窗上的标价。它告诉你单价,却对模型要开多远才能抵达目的地只字未提。

一次 API 调用背后藏着两笔成本:

  • 单价。每百万输入和输出 token 的美元价格。这是每个定价页面都在宣传的数字。
  • 完整使用路径。输入、缓存输入、输出和思考 token,加上重复模型轮次和单独计价的服务器工具。

账单需要把适用费率、实际用量和单独计价操作结合起来。Artificial Analysis 把其基准指标称为每任务成本,即完成一项 Intelligence Index 任务的加权平均 token 成本。每 token 价格相同时,更长答案或更多推理 token 会提高该基准成本(2)。

把单价砍掉 40%,却让 token 消耗上升得更多,你就让模型看起来更便宜,实际上却更贵。

Sonnet 5 到底发生了什么

Sonnet 5 上市案例很有价值,因为采用不同的实际费率会得出不同答案。

上市时,Anthropic 宣布输入每百万 token 2 美元、输出 10 美元的价格持续到 2026 年 8 月 31 日,之后原计划涨至 3 和 15 美元。Anthropic 后来取消了涨价。截至 2026 年 9 月 2 日,Sonnet 5 仍为 2 和 10 美元,Opus 4.8 为 5 和 25 美元(3)。所以 Sonnet 5 的基础输入和输出费率都低 60%。

然后你真的去跑它。Artificial Analysis 发现,在最高推理强度下,Sonnet 5 在每个 Intelligence Index 任务上使用的输出 token 比 Sonnet 4.6 多出约 40%,智能体轮次约为其三倍。在知识工作类评测中,它在最高强度下烧掉的轮次约为最低强度时的六倍。性能提升来自更长的推理链和更多的工具调用,而不是来自效率(1)。

还要考虑另一个变化:Anthropic 称 Claude 4.7 及更新模型采用了新分词器,同一文本产生的 token 数比旧模型约多 30%,具体增幅取决于内容和负载(3)。应为计划使用的模型重新计算真实提示词,而不是机械套用 30%。

纠正后的结论不是 Sonnet 5 当前比 Opus 4.8 更贵,而是每任务排名同时取决于实际用量和生效价格。当优惠价变为永久价格时,同一组基准用量也可能改变排名。

Kevin Riedl

"一个绕圈子推理的模型,就算单价更便宜,也不是折扣。那是一张延后开出的账单。真正赢的团队读的是整张收据,而不是货架上的标价。"

数据已于 2026 年 9 月 2 日核查。Artificial Analysis 的 2.29 美元估算采用原计划的 3 和 15 美元费率,而 Anthropic 当前标准价为 2 和 10 美元。你的负载并非该基准,请直接测量。

为什么推理模型会打破标价逻辑

这并非 Sonnet 独有,而是思考量和工具使用可变的模型与智能体都面临的通用计量问题。

Anthropic 定价文档说明,工具使用通过输入和输出 token 计费,服务器工具还可能有额外用量费。Effort 控制会影响文本、工具调用和思考,因此较高档位可能同时改变能力和开支(3、5)。产品公开思考和工具块时,这些内容可在 API 响应中观察,不应描述为不可见工作。

所以一个模型可以是:

  • 每 token 更便宜,但每任务更贵,因为它想得更久。
  • 每 token 更贵,但每任务更便宜,因为它一遍就得出答案,而不是五遍。

标价和真实成本不只是两个不同的数字。它们可以指向相反的方向。

每任务成本的定义

如果你只想从这篇文章里带走一个指标,就带走这个。

每完成一个任务的成本,是把一个真实任务做到你的质量标准所花的总开支,横跨每一个 token、每一轮交互。不是每 token,不是每次请求。而是每一个已完成、可接受的答案。

它捕捉到了标价所掩盖的东西:

  • 思考 token。提供商公开或计量时,用于推理的计费模型输出。
  • 输出长度。一个啰嗦的模型即便费率相同也会多计费。
  • 智能体轮次和工具。更多模型轮次会消耗 token,部分服务器工具另行收费。
  • 重试。答错后你不得不重跑,这可不是免费的。
  • 分词器漂移。同样的文本在更新的模型上可能被算成更多的 token。

一个起步便宜、收尾昂贵的模型,在这个衡量标准下就是不及格的。而这正是使用这个标准的全部意义。

想直截了当地弄清楚哪个模型对你的工作负载才是真正最便宜的?

 预约免费咨询

如何衡量每完成一个任务的成本

你不需要一个研究实验室。你需要的是你自己的任务和一杆秤。下面是我们在向客户推荐某个模型之前会跑的流程。

  1. 定义任务和质量标准。不是"帮我总结这个",而是"产出一份能通过这套评分标准的总结"。任务只有达到标准才算完成,否则重试的成本就该算进去。
  2. 用真实工作搭一个小型评测集。二十到五十个代表性任务可以作为实用起点。公开基准提供背景,但并不是你的工作负载。
  3. 让每个候选模型跑到完成为止。用同样的任务、同样你会上线的设置。让它按上线后的方式去推理、调用工具和重试。
  4. 记录直到完成的全部用量。记录未缓存输入、缓存写入与命中、输出、思考、每轮模型调用及单独计价工具。Anthropic 的 token 计数端点估算输入,实际响应用量和账单才是计费记录(4)。
  5. 为整条路径计价,包括失败。把 token 乘以真实费率,加上模型第一次答错的任务上重试的成本。这个总数除以已完成的任务数,就是你的每完成一个任务的成本。

排名可能反转。每 token 费率更高的模型可能以更低成本完成任务,而低费率模型可能产生更多计费用量。

这对模型选型意味着什么

这里的教训不是"永远选贵的模型"。而是"别再按标价选"。

我们遵循的几条规则:

  • 让模型匹配任务,而不是匹配价目表。一个一遍就能答对的强模型,可能比一个绕圈子的弱模型每任务更便宜。把简单、高频的工作路由给便宜的模型,把困难、含糊的工作路由给强模型。我们在如何在 2026 年削减 LLM token 成本里写下了完整的路由手册。
  • 调好强度旋钮。Anthropic 把 Effort 描述为软性行为信号,而不是严格 token 预算。较低档位通常以部分能力换取 token 效率。请在自有评测中测试支持的档位,不要默认最高档最好(5)。
  • 关注轮次和工具,而不只是模型输出。额外调用可能增加输入、输出和工具费用。轮次较少的模型即使 token 费率更高,也可能成本更低。
  • 模型更新时重跑数字。一个新版本可能同时改变分词器和推理行为,就像 Sonnet 5 那样。上个季度的成本排名不等于这个季度的。

每 token 的价格是营销数字。每完成一个任务的成本才是落到你账单上的数字。去优化你真正付钱的那个。

最终思考

最初的 Sonnet 5 比较采用了 Anthropic 后来取消的计划涨价。按当前标准费率,已公布的基准用量不再支持 Sonnet 5 每任务成本高于 Opus 4.8 的说法。这一纠正反而强化了方法:每完成一个任务的总成本必须使用当前价格和实际观察用量。

自行测量质量门槛、token、缓存类别、轮次、工具、重试与失败。模型、分词器、价格或工作流变化时重新计算。

References

  1. Artificial Analysis(2026):按原计划 3/15 美元费率,Claude Sonnet 5 的 Intelligence Index 每任务成本约 2.29 美元,Opus 4.8 约为 1.99 美元;该计算排除了优惠价。来源(访问日期:2026 年 9 月 2 日)。
  2. Artificial Analysis:Intelligence Index 加权平均每任务成本的计算方法和定义。来源(访问日期:2026 年 9 月 2 日)。
  3. Anthropic:当前价格、取消 3/15 美元涨价后 Sonnet 5 永久采用 2/10 美元、工具成本,以及新分词器约多 30% token。来源(访问日期:2026 年 9 月 2 日)。
  4. Anthropic:Token Counting 端点估算包括工具在内的输入 token 并支持当前模型,实际计费可能略有差异。来源(访问日期:2026 年 9 月 2 日)。
  5. Anthropic:Effort 会影响文本、工具调用和思考,它是行为信号而非严格 token 预算。来源(访问日期:2026 年 9 月 2 日)。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

9 分钟 阅读 · 02 Jul 2026
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。