本文内容
2026 年 LLM API 成本:你的架构应如何调整?
更低的标价可以成为重新测试旧 AI 架构的理由,但不能证明同等生产负载普遍便宜了 80%。厂商在调整价格的同时,也改变了模型系列、质量、token 计费、上下文限制、缓存规则、服务层级、工具和速率限制。有效比较必须保持产品结果与工作负载不变。
本指南说明我们如何在 AI 产品开发中评估成本变化。它是测量框架,不是报价。每次比较都应记录厂商页面、模型版本、区域、服务层级、币种和观察日期。
正在重建 AI 技术栈?
预约免费咨询推理真的便宜了 80% 吗?
没有任何一条前沿或中端模型价格序列可以支持这个笼统结论。跨年度比较两个模型名称,可能同时改变能力、输出质量、延迟、模态、上下文和推理强度。即便 token 单价可比,也没有计入重试、更长输出、工具使用,以及获得合格结果所需的调用次数。
当前厂商目录说明了为什么单一百分比会误导。OpenAI 分别列出输入、缓存输入和输出价格,并展示不同的上下文与功能支持 (OpenAI 模型比较)。Google 分别定价模型、批处理、缓存、存储、grounding 和服务模式 (Gemini API 定价)。Anthropic 区分基础输入、缓存写入、缓存读取、输出、批处理和长上下文调整项 (Anthropic 定价)。这些页面是成本模型的动态输入,不是可以长期写死在架构里的数字。
成本模型应包含什么?
| 成本领域 | 从接近生产的 trace 中测量 |
|---|---|
| 模型推理 | 按请求类型统计未缓存输入、缓存输入、缓存写入、输出、推理与模态单位 |
| 工具与检索 | 搜索、grounding、代码执行、外部 API、embedding、reranking、向量存储与数据传输 |
| Agent 执行 | 规划调用、工具调用、重试、循环长度、失败运行与恢复路径 |
| 容量 | 服务层级、预留容量、速率限制、限流、排队与区域路由 |
| 质量 | 评测、标注、审核、升级、返工、事故与支持 |
| 生命周期 | 集成、可观测性、安全、数据治理、迁移与厂商退出 |
应计算每个合格结果的成本,而不只是每次请求的成本。如果更便宜的路径需要更多重试或人工审核,token 折扣可能无法转化为产品层面的节省。
低价是否意味着可以移除 RAG?
价格不应单独决定选择长上下文还是 RAG。检索可以提供新鲜度、来源选择、权限过滤和引用。相关材料能够容纳时,长上下文可以保留文档关系并降低检索复杂度。两种方法都需要评测答案质量、证据使用、延迟与失败行为。
不要使用 50 万或 100 万 token 的通用阈值。把解析后的生产内容、指令、对话、工具结果和输出余量,对照所选模型的当前限制计算,再在同一负载上比较完整成本和质量。我们的 RAG、微调与长上下文指南提供了实验设计。
Prompt 缓存何时有帮助?
如果大量请求按照厂商规则重复使用符合条件的稳定前缀,缓存可能有效。它也可能产生写入与存储费用,因前缀或时间不同而未命中,按照厂商特定条款保留内容,或者在所选模型或接口中不可用。
根据 API 建议一致安排稳定内容,同时测量实际计费的缓存写入和读取单位。80% 命中率目标或数量级节省并不通用。应使用真实命中分布、首 token 延迟、失效模式、保留要求和当前价格表。
每次请求都应从便宜模型开始吗?
只有当路由改善了实测的质量、延迟、可靠性和成本组合时,它才有价值。定义请求类型,依据可观察信号路由,并评测路由错误。较弱的首次尝试再升级,可能比直接使用达标模型更贵、更慢。
跟踪首次通过的合格结果比例、升级、错误置信、重试、延迟分位数和每个合格结果的成本。对于更强模型持续胜出的请求类型,保留直达路径。
便宜 token 能否支持更深的 Agent 循环?
token 降价不会让某个固定工具调用次数自动变得经济或可靠。更多步骤会增加模型调用、工具费用、延迟、权限、外部副作用、局部失败与恢复工作。只有当额外步骤足以改善合格结果时,才构建 Agent 循环。
按任务类型设置预算和停止条件。安全记录每个工具结果与重试,但默认不要记录完整敏感上下文。测试超时、重复操作、过期状态、权限失败和人工升级。
哪些工作适合批处理?
异步且相互独立,并符合所选 API 功能、时限、区域、配额和数据处理约束的任务,可以考虑批处理。不要假设每个厂商、模型或工具调用都有 50% 折扣。部分批处理接口不支持交互式工具或结构化功能,延迟完成也会改变运营要求。
按当前条款比较 batch、flex、standard、priority 和预留容量选项。计入排队延迟、失败记录、重试、存储、监控和期限风险。
成本实际花在哪里?
没有依据支持推理占运行成本 30% 到 45% 之类的通用比例。分布取决于流量、输出长度、工具、检索、人工审核、风险、可用性和团队模式。轻量分类器与受监管的决策支持 Agent 会有不同结构。
按功能、租户、请求类型、模型、路径和结果标记用量。将厂商账单与应用遥测核对,并把评测和人工运营放在同一视图中,避免 token 优化只是把成本转移到别处。
何时考虑开放权重模型?
在同一验收集上比较托管 API 与开放权重部署。自托管可以增加对基础设施、模型版本和部分数据流的控制,但也会带来服务容量、利用率风险、模型运维、安全、监控、升级和事故责任。
不存在每天 5,000 万 token 的通用分界点。估算负载形态、加速器利用率、冗余、工程覆盖、许可、支持、数据义务和迁移成本。承诺之前先执行受控的负载与质量测试。

"更低的 token 价格是重做实验的理由,不是跳过实验的许可。"
应该怎样评审架构?
- 固定有代表性的评测集、质量阈值、请求组合、延迟目标和风险约束。
- 按输入类型、缓存状态、输出、推理、工具、重试和结果导出当前用量。
- 根据账单和当前官方条款计算基线,包括非 token 成本和人工成本。
- 每次只改变一个变量:模型、路由、上下文、检索、缓存、批处理模式、循环预算或托管方式。
- 在同一负载上比较质量、可靠性、延迟和完整成本。
- 通过可逆控制逐步上线,并确认节省没有降低结果质量。
- 模型、价格、负载、合同或产品要求发生实质变化时重新评审。
如何估算 AI 项目?
将实施价格与运行场景分开。说明流量、请求组合、输入与输出分布、缓存假设、工具使用、升级、评测量、保留、可用性和支持。给出低位、预期和压力场景,并为每项厂商价格注明来源和日期。
不要承诺现代功能只需某个假设 2024 年报价的 30% 到 60%。展示当前基线、建议配置、实测差异、一次性迁移、置信区间和会使估算失效的条件。我们的 LLM 成本降低指南进一步介绍运营杠杆。
最终思考
LLM 价格变化可以推动结构性评审,但单一百分比不能替你选择架构。当前目录分别计算模型输入、缓存输入、缓存写入、输出、推理、工具、批处理模式、服务层级和长上下文调整项。生产成本还包括检索、可靠性、评测、人员、容量、治理和迁移。
在固定且有代表性的工作负载上测量每个合格结果的成本。每次测试一个改动,并保留回滚路径。出现新模型或新价格时,应重新验证证据,而不是延续口号。如果你需要对 AI 负载进行埋点和比较,我们的工程团队可以与你一起界定评审范围。