本文内容
如何在 2026 年降低 LLM Token 成本:路由、缓存、压缩与合适的模型
低廉的标示 token 单价并不能保证 LLM 产品账单也低。智能体可能为一个任务多次调用模型、重复发送上下文、生成推理 token、调用工具或重试失败步骤。因此,更有用的单位是每个成功任务的成本,并同时衡量产品真正需要的质量、延迟和可靠性。本文介绍如何降低这一成本,而不假定所有工作负载都相同。
这是工程视角,不是供应商推销。供应商价格、缓存规则、批处理资格、区域可用性和模型名称都会频繁变化。采购前请查看链接中的一手文档,并用自己的流量重新计算。参考经验也来自 Wavect 的 AI 产品工作。
Token 账单失控了?
预约免费咨询模型变便宜后,为什么账单仍可能很高?
以下三个变量往往比输入 token 的标示单价更重要:
- 调用量与重试。一个智能体可为每个任务发起多次调用。工具故障、验证重试和回退路径会产生单纯 token 比价看不到的成本。
- 输入与输出组合。重复指令、检索文档、对话历史和生成的推理内容会在不同负载中占主导。应检查供应商的 usage 字段,不要假定固定比例都是浪费。
- 模型分配。把每个请求都交给能力最强的模型可能没有必要,但较弱模型也可能增加重试和失败。决定需要针对任务的评估。
从测量轨迹中占主导的变量开始。部分优化只是配置变更,而路由、语义缓存和自托管可能改变架构及故障方式。
最快的收益是什么?Prompt 缓存与批处理。
改变架构前,先测试适合该负载的供应商机制。它们并非自动、普遍或没有运维成本。
- Prompt 缓存。支持这一功能的供应商可以降低重复 prompt 内容的计费。折扣和最小 prompt 长度因模型而异,显式缓存还可能收取存储费。稳定前缀可以提高命中率,但要验证响应中的 cache-read token,并计入写入或存储费。
- 批处理。OpenAI 和 Anthropic 为符合条件的异步批处理负载记录了 50% 的折扣,其他供应商有自己的价格与完成条件。它只适合可以容忍延迟,并能接受重试、截止时间、数据保留和故障处理条件的工作。
部分供应商允许叠加缓存与批处理修饰项,但结果取决于模型、缓存写入与存储费、命中率、输出量和失败工作。应使用当前价格表计算有代表性的轨迹,而不是直接相乘宣传折扣。

"更换模型前,先检查重复的 prompt 前缀能否产生可验证的缓存命中,并降低总成本。"
模型路由怎样降本而不损害质量?
路由是把请求分配给不同模型,或在首次尝试后升级。它可以降本,但模型自己报告的置信度不能保证正确。应根据带标签样本制定规则,并衡量包括重试和验证调用在内的整个级联。
- 默认路径与升级。小模型可处理经过验证的任务子集。遇到 schema 失败、工具错误、策略标记或独立任务分类器等可观察条件时升级。应一起跟踪升级、重试、延迟和最终任务成功率。
- 路由器与网关。RouteLLM 报告,在特定基准和模型组合上,保留 95% GPT-4 表现的同时,成本最多降低 85%。这是值得测试路由的研究证据,不是生产保证。网关可集中管理路由和预算,但也会成为可靠性与治理依赖。
我们在包括 Twinsoft AI 在内的生产 AI 项目中采用升级模式。安全使用它的关键是评估框架,它能证明便宜路径是否真的守住质量。
2026 年到底应该选哪个模型?
不存在长期有效的排名,也没有适合所有任务的单一最佳模型。请用自己的输入、区域要求、工具支持、延迟、rate limit、合同条款和任务总成本比较候选项。
- 托管专有模型。OpenAI、Anthropic、Google 等供应商提供不同的能力、价格、区域和服务组合。价格更高的模型如果能减少重试或人工修正,每个成功任务反而可能更便宜。
- 托管或自行管理的开放权重模型。Llama、Qwen、DeepSeek 和 Mistral 等模型家族可能适用,但许可证、服务成本、支持、量化和基准迁移都很重要。“开放权重”本身不表示更便宜、开源或合规。
不要使用静态的跨供应商价格表,而应建立工作负载表:
| 变量 | 衡量内容 | 影响原因 |
|---|---|---|
| Token 组合 | 未缓存输入、缓存输入、输出,以及计费的推理或工具调用 | 供应商对各类别定价不同 |
| 任务结果 | 成功、重试、回退调用和人工审查 | 最便宜的调用未必带来最便宜的完成任务 |
| 运维 | 延迟、rate limit、可观测性、支持和工程时间 | API 单价不含集成与运维成本 |
| 治理 | 处理区域、保留、训练条款、分包商和合同 | 部署与产品档位决定真实数据路径 |
欧盟团队必须核实个人数据的处理和存储地点、分包商与传输,以及所选产品档位的合同。在欧盟基础设施上运行权重可以增强对数据路径的控制,但不会自动满足 GDPR,也不会自动保留相对 API 的价格优势。无论如何,更换前都要运行自己的评估。
本地与 frontier 混合:自托管开放权重何时划算?
一种混合模式是让小模型或开放权重模型处理经过验证的任务子集,再用托管 API 处理需要其他能力的任务。是否在内部运行第一条路径取决于工作负载和治理。
- 盈亏平衡计算包括加速器、利用率、冗余、网络、存储、可观测性、安全、值班、评估和升级。工程时间与闲置容量可能高于推理成本。
- 不存在通用的每日 token 门槛。应在自己的延迟、上下文长度、可用性和并发目标下,把 API 轨迹与实测服务基准进行比较。
- vLLM 等服务引擎支持生产推理,但模型兼容性、量化精度、容量规划和安全发布仍需测试。
托管 API 可减少早期运维工作,自托管则提供不同的控制和成本特征。需求与流量可测量后再比较二者。更多架构影响见低价 token 如何改变 AI 架构。
怎样不再为模型不需要的 token 付费?
测量轨迹后,减少对任务没有贡献的输入,并测试调整后的质量。
- 语义缓存。存储响应并为足够相似的请求复用。它可以避免模型调用,但相似不等于相同。启用前应定义租户隔离、授权、时效、失效、隐私和经过测量的误命中阈值。
- 上下文压缩。智能体和编码工作流会重复发送文件、日志和历史。压缩层把内容减少到当前步骤所需。我们的LeanCTX 技术报告记录了集成路径、测量比例和 raw 回退。原则比工具重要:发送最小的正确上下文,而不是整个工作区。
- 推理层 KV-cache 控制。自托管时,量化和缓存管理可减轻内存压力,但会带来特定于模型和负载的质量或吞吐权衡。API 用户通常无法直接控制这一层。
浏览器智能体还有另一个杠杆:把模型移出稳定回放。我们的 Lightpanda 生产评估说明了 PandaScript 如何把探索过的流程变成经过审查且无需运行时推理的 JavaScript,以及仍需衡量的兼容性和可靠性成本。
应该按什么顺序实施?
- 测量有代表性的基线。记录每个成功任务的成本、延迟、重试、token 类别和质量。
- 测试 prompt 缓存。改善稳定前缀复用,并验证真实缓存读取及全部费用。
- 批处理合适的异步工作。只在产品可以容忍时使用当前折扣与完成条件。
- 测试带升级的路由。定义可观察的升级条件,并跟踪成功、重试、延迟和总级联成本。
- 为模型选择合适档位。针对任务评估专有与开放权重候选项。
- 有意识地减少上下文。移除无关输入,并使用时效、隐私和误命中控制测试语义缓存。
- 按总成本评估自托管。比较实测基础设施与运维要求和当前 API 条款。
- 建立评估框架。它用于证明更便宜的路径仍保持质量。参见 SDLC。
顺序取决于轨迹。上下文密集型负载可能先受益于缓存,离线任务可能适合批处理,请求类型差异大时可能值得路由。每次变更后重新评估,避免用隐藏的质量回退换取节省。
对于上下文可重复的编码智能体循环,请参阅更高效地使用 AI 编码智能体 Token。
最终思考
2026 年降低 LLM 成本,不是寻找一个便宜模型或照搬通用顺序。应衡量每个成功任务的成本,找出轨迹中的主要成本,再测试合适的杠杆:prompt 缓存、异步批处理、路由、模型选择或上下文缩减。
每项变更都需要有代表性的评估和运维测量。供应商价格与产品条款会变化,研究基准未必能迁移,自托管的成本也不只是加速器时间。应让模型组合和价格计算可审查,并在流量、质量要求或供应商条款变化时重新评估。