返回
Christof Jori

8 分钟 阅读 · 2026年5月26日
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

2026 年 LLM API 成本:你的架构应如何调整?

更低的标价可以成为重新测试旧 AI 架构的理由,但不能证明同等生产负载普遍便宜了 80%。厂商在调整价格的同时,也改变了模型系列、质量、token 计费、上下文限制、缓存规则、服务层级、工具和速率限制。有效比较必须保持产品结果与工作负载不变。

本指南说明我们如何在 AI 产品开发中评估成本变化。它是测量框架,不是报价。每次比较都应记录厂商页面、模型版本、区域、服务层级、币种和观察日期。

正在重建 AI 技术栈?

 预约免费咨询

推理真的便宜了 80% 吗?

没有任何一条前沿或中端模型价格序列可以支持这个笼统结论。跨年度比较两个模型名称,可能同时改变能力、输出质量、延迟、模态、上下文和推理强度。即便 token 单价可比,也没有计入重试、更长输出、工具使用,以及获得合格结果所需的调用次数。

当前厂商目录说明了为什么单一百分比会误导。OpenAI 分别列出输入、缓存输入和输出价格,并展示不同的上下文与功能支持 (OpenAI 模型比较)。Google 分别定价模型、批处理、缓存、存储、grounding 和服务模式 (Gemini API 定价)。Anthropic 区分基础输入、缓存写入、缓存读取、输出、批处理和长上下文调整项 (Anthropic 定价)。这些页面是成本模型的动态输入,不是可以长期写死在架构里的数字。

成本模型应包含什么?

成本领域从接近生产的 trace 中测量
模型推理按请求类型统计未缓存输入、缓存输入、缓存写入、输出、推理与模态单位
工具与检索搜索、grounding、代码执行、外部 API、embedding、reranking、向量存储与数据传输
Agent 执行规划调用、工具调用、重试、循环长度、失败运行与恢复路径
容量服务层级、预留容量、速率限制、限流、排队与区域路由
质量评测、标注、审核、升级、返工、事故与支持
生命周期集成、可观测性、安全、数据治理、迁移与厂商退出

应计算每个合格结果的成本,而不只是每次请求的成本。如果更便宜的路径需要更多重试或人工审核,token 折扣可能无法转化为产品层面的节省。

低价是否意味着可以移除 RAG?

价格不应单独决定选择长上下文还是 RAG。检索可以提供新鲜度、来源选择、权限过滤和引用。相关材料能够容纳时,长上下文可以保留文档关系并降低检索复杂度。两种方法都需要评测答案质量、证据使用、延迟与失败行为。

不要使用 50 万或 100 万 token 的通用阈值。把解析后的生产内容、指令、对话、工具结果和输出余量,对照所选模型的当前限制计算,再在同一负载上比较完整成本和质量。我们的 RAG、微调与长上下文指南提供了实验设计。

Prompt 缓存何时有帮助?

如果大量请求按照厂商规则重复使用符合条件的稳定前缀,缓存可能有效。它也可能产生写入与存储费用,因前缀或时间不同而未命中,按照厂商特定条款保留内容,或者在所选模型或接口中不可用。

根据 API 建议一致安排稳定内容,同时测量实际计费的缓存写入和读取单位。80% 命中率目标或数量级节省并不通用。应使用真实命中分布、首 token 延迟、失效模式、保留要求和当前价格表。

每次请求都应从便宜模型开始吗?

只有当路由改善了实测的质量、延迟、可靠性和成本组合时,它才有价值。定义请求类型,依据可观察信号路由,并评测路由错误。较弱的首次尝试再升级,可能比直接使用达标模型更贵、更慢。

跟踪首次通过的合格结果比例、升级、错误置信、重试、延迟分位数和每个合格结果的成本。对于更强模型持续胜出的请求类型,保留直达路径。

便宜 token 能否支持更深的 Agent 循环?

token 降价不会让某个固定工具调用次数自动变得经济或可靠。更多步骤会增加模型调用、工具费用、延迟、权限、外部副作用、局部失败与恢复工作。只有当额外步骤足以改善合格结果时,才构建 Agent 循环。

按任务类型设置预算和停止条件。安全记录每个工具结果与重试,但默认不要记录完整敏感上下文。测试超时、重复操作、过期状态、权限失败和人工升级。

哪些工作适合批处理?

异步且相互独立,并符合所选 API 功能、时限、区域、配额和数据处理约束的任务,可以考虑批处理。不要假设每个厂商、模型或工具调用都有 50% 折扣。部分批处理接口不支持交互式工具或结构化功能,延迟完成也会改变运营要求。

按当前条款比较 batch、flex、standard、priority 和预留容量选项。计入排队延迟、失败记录、重试、存储、监控和期限风险。

成本实际花在哪里?

没有依据支持推理占运行成本 30% 到 45% 之类的通用比例。分布取决于流量、输出长度、工具、检索、人工审核、风险、可用性和团队模式。轻量分类器与受监管的决策支持 Agent 会有不同结构。

按功能、租户、请求类型、模型、路径和结果标记用量。将厂商账单与应用遥测核对,并把评测和人工运营放在同一视图中,避免 token 优化只是把成本转移到别处。

何时考虑开放权重模型?

在同一验收集上比较托管 API 与开放权重部署。自托管可以增加对基础设施、模型版本和部分数据流的控制,但也会带来服务容量、利用率风险、模型运维、安全、监控、升级和事故责任。

不存在每天 5,000 万 token 的通用分界点。估算负载形态、加速器利用率、冗余、工程覆盖、许可、支持、数据义务和迁移成本。承诺之前先执行受控的负载与质量测试。

Christof Jori

"更低的 token 价格是重做实验的理由,不是跳过实验的许可。"

应该怎样评审架构?

  1. 固定有代表性的评测集、质量阈值、请求组合、延迟目标和风险约束。
  2. 按输入类型、缓存状态、输出、推理、工具、重试和结果导出当前用量。
  3. 根据账单和当前官方条款计算基线,包括非 token 成本和人工成本。
  4. 每次只改变一个变量:模型、路由、上下文、检索、缓存、批处理模式、循环预算或托管方式。
  5. 在同一负载上比较质量、可靠性、延迟和完整成本。
  6. 通过可逆控制逐步上线,并确认节省没有降低结果质量。
  7. 模型、价格、负载、合同或产品要求发生实质变化时重新评审。

如何估算 AI 项目?

将实施价格与运行场景分开。说明流量、请求组合、输入与输出分布、缓存假设、工具使用、升级、评测量、保留、可用性和支持。给出低位、预期和压力场景,并为每项厂商价格注明来源和日期。

不要承诺现代功能只需某个假设 2024 年报价的 30% 到 60%。展示当前基线、建议配置、实测差异、一次性迁移、置信区间和会使估算失效的条件。我们的 LLM 成本降低指南进一步介绍运营杠杆。

最终思考

LLM 价格变化可以推动结构性评审,但单一百分比不能替你选择架构。当前目录分别计算模型输入、缓存输入、缓存写入、输出、推理、工具、批处理模式、服务层级和长上下文调整项。生产成本还包括检索、可靠性、评测、人员、容量、治理和迁移。

在固定且有代表性的工作负载上测量每个合格结果的成本。每次测试一个改动,并保留回滚路径。出现新模型或新价格时,应重新验证证据,而不是延续口号。如果你需要对 AI 负载进行埋点和比较,我们的工程团队可以与你一起界定评审范围。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Christof Jori

8 分钟 阅读 · 2026年5月26日
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。