返回
Kevin Riedl

9 min 阅读 · 15 Jun 2026
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

如何在 2026 年降低 LLM Token 成本:路由、缓存、压缩与合适的模型

低廉的标示 token 单价并不能保证 LLM 产品账单也低。智能体可能为一个任务多次调用模型、重复发送上下文、生成推理 token、调用工具或重试失败步骤。因此,更有用的单位是每个成功任务的成本,并同时衡量产品真正需要的质量、延迟和可靠性。本文介绍如何降低这一成本,而不假定所有工作负载都相同。

这是工程视角,不是供应商推销。供应商价格、缓存规则、批处理资格、区域可用性和模型名称都会频繁变化。采购前请查看链接中的一手文档,并用自己的流量重新计算。参考经验也来自 Wavect 的 AI 产品工作。

Token 账单失控了?

 预约免费咨询

模型变便宜后,为什么账单仍可能很高?

以下三个变量往往比输入 token 的标示单价更重要:

  • 调用量与重试。一个智能体可为每个任务发起多次调用。工具故障、验证重试和回退路径会产生单纯 token 比价看不到的成本。
  • 输入与输出组合。重复指令、检索文档、对话历史和生成的推理内容会在不同负载中占主导。应检查供应商的 usage 字段,不要假定固定比例都是浪费。
  • 模型分配。把每个请求都交给能力最强的模型可能没有必要,但较弱模型也可能增加重试和失败。决定需要针对任务的评估。

从测量轨迹中占主导的变量开始。部分优化只是配置变更,而路由、语义缓存和自托管可能改变架构及故障方式。

最快的收益是什么?Prompt 缓存与批处理。

改变架构前,先测试适合该负载的供应商机制。它们并非自动、普遍或没有运维成本。

  • Prompt 缓存。支持这一功能的供应商可以降低重复 prompt 内容的计费。折扣和最小 prompt 长度因模型而异,显式缓存还可能收取存储费。稳定前缀可以提高命中率,但要验证响应中的 cache-read token,并计入写入或存储费。
  • 批处理。OpenAI 和 Anthropic 为符合条件的异步批处理负载记录了 50% 的折扣,其他供应商有自己的价格与完成条件。它只适合可以容忍延迟,并能接受重试、截止时间、数据保留和故障处理条件的工作。

部分供应商允许叠加缓存与批处理修饰项,但结果取决于模型、缓存写入与存储费、命中率、输出量和失败工作。应使用当前价格表计算有代表性的轨迹,而不是直接相乘宣传折扣。

Kevin Riedl

"更换模型前,先检查重复的 prompt 前缀能否产生可验证的缓存命中,并降低总成本。"

模型路由怎样降本而不损害质量?

路由是把请求分配给不同模型,或在首次尝试后升级。它可以降本,但模型自己报告的置信度不能保证正确。应根据带标签样本制定规则,并衡量包括重试和验证调用在内的整个级联。

  • 默认路径与升级。小模型可处理经过验证的任务子集。遇到 schema 失败、工具错误、策略标记或独立任务分类器等可观察条件时升级。应一起跟踪升级、重试、延迟和最终任务成功率。
  • 路由器与网关。RouteLLM 报告,在特定基准和模型组合上,保留 95% GPT-4 表现的同时,成本最多降低 85%。这是值得测试路由的研究证据,不是生产保证。网关可集中管理路由和预算,但也会成为可靠性与治理依赖。

我们在包括 Twinsoft AI 在内的生产 AI 项目中采用升级模式。安全使用它的关键是评估框架,它能证明便宜路径是否真的守住质量。

2026 年到底应该选哪个模型?

不存在长期有效的排名,也没有适合所有任务的单一最佳模型。请用自己的输入、区域要求、工具支持、延迟、rate limit、合同条款和任务总成本比较候选项。

  • 托管专有模型。OpenAI、Anthropic、Google 等供应商提供不同的能力、价格、区域和服务组合。价格更高的模型如果能减少重试或人工修正,每个成功任务反而可能更便宜。
  • 托管或自行管理的开放权重模型。Llama、Qwen、DeepSeek 和 Mistral 等模型家族可能适用,但许可证、服务成本、支持、量化和基准迁移都很重要。“开放权重”本身不表示更便宜、开源或合规。

不要使用静态的跨供应商价格表,而应建立工作负载表:

变量衡量内容影响原因
Token 组合未缓存输入、缓存输入、输出,以及计费的推理或工具调用供应商对各类别定价不同
任务结果成功、重试、回退调用和人工审查最便宜的调用未必带来最便宜的完成任务
运维延迟、rate limit、可观测性、支持和工程时间API 单价不含集成与运维成本
治理处理区域、保留、训练条款、分包商和合同部署与产品档位决定真实数据路径

欧盟团队必须核实个人数据的处理和存储地点、分包商与传输,以及所选产品档位的合同。在欧盟基础设施上运行权重可以增强对数据路径的控制,但不会自动满足 GDPR,也不会自动保留相对 API 的价格优势。无论如何,更换前都要运行自己的评估

本地与 frontier 混合:自托管开放权重何时划算?

一种混合模式是让小模型或开放权重模型处理经过验证的任务子集,再用托管 API 处理需要其他能力的任务。是否在内部运行第一条路径取决于工作负载和治理。

  • 盈亏平衡计算包括加速器、利用率、冗余、网络、存储、可观测性、安全、值班、评估和升级。工程时间与闲置容量可能高于推理成本。
  • 不存在通用的每日 token 门槛。应在自己的延迟、上下文长度、可用性和并发目标下,把 API 轨迹与实测服务基准进行比较。
  • vLLM 等服务引擎支持生产推理,但模型兼容性、量化精度、容量规划和安全发布仍需测试。

托管 API 可减少早期运维工作,自托管则提供不同的控制和成本特征。需求与流量可测量后再比较二者。更多架构影响见低价 token 如何改变 AI 架构

怎样不再为模型不需要的 token 付费?

测量轨迹后,减少对任务没有贡献的输入,并测试调整后的质量。

  • 语义缓存。存储响应并为足够相似的请求复用。它可以避免模型调用,但相似不等于相同。启用前应定义租户隔离、授权、时效、失效、隐私和经过测量的误命中阈值。
  • 上下文压缩。智能体和编码工作流会重复发送文件、日志和历史。压缩层把内容减少到当前步骤所需。我们的LeanCTX 技术报告记录了集成路径、测量比例和 raw 回退。原则比工具重要:发送最小的正确上下文,而不是整个工作区。
  • 推理层 KV-cache 控制。自托管时,量化和缓存管理可减轻内存压力,但会带来特定于模型和负载的质量或吞吐权衡。API 用户通常无法直接控制这一层。

浏览器智能体还有另一个杠杆:把模型移出稳定回放。我们的 Lightpanda 生产评估说明了 PandaScript 如何把探索过的流程变成经过审查且无需运行时推理的 JavaScript,以及仍需衡量的兼容性和可靠性成本。

应该按什么顺序实施?

  1. 测量有代表性的基线。记录每个成功任务的成本、延迟、重试、token 类别和质量。
  2. 测试 prompt 缓存。改善稳定前缀复用,并验证真实缓存读取及全部费用。
  3. 批处理合适的异步工作。只在产品可以容忍时使用当前折扣与完成条件。
  4. 测试带升级的路由。定义可观察的升级条件,并跟踪成功、重试、延迟和总级联成本。
  5. 为模型选择合适档位。针对任务评估专有与开放权重候选项。
  6. 有意识地减少上下文。移除无关输入,并使用时效、隐私和误命中控制测试语义缓存。
  7. 按总成本评估自托管。比较实测基础设施与运维要求和当前 API 条款。
  8. 建立评估框架。它用于证明更便宜的路径仍保持质量。参见 SDLC

顺序取决于轨迹。上下文密集型负载可能先受益于缓存,离线任务可能适合批处理,请求类型差异大时可能值得路由。每次变更后重新评估,避免用隐藏的质量回退换取节省。

对于上下文可重复的编码智能体循环,请参阅更高效地使用 AI 编码智能体 Token

最终思考

2026 年降低 LLM 成本,不是寻找一个便宜模型或照搬通用顺序。应衡量每个成功任务的成本,找出轨迹中的主要成本,再测试合适的杠杆:prompt 缓存、异步批处理、路由、模型选择或上下文缩减。

每项变更都需要有代表性的评估和运维测量。供应商价格与产品条款会变化,研究基准未必能迁移,自托管的成本也不只是加速器时间。应让模型组合和价格计算可审查,并在流量、质量要求或供应商条款变化时重新评估。

来源与当前参考资料

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

9 min 阅读 · 15 Jun 2026
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。