---
title: "AI Agent Cost per Action：Token 账单计算器"
canonical: https://wavect.io/zh/blog/ai-agent-cost-per-action-2026/
language: zh
description: "为什么 agentic 工作流会推高 token 账单？计算支持工单、发票提取、PR review、lead enrichment、工具、重试和 eval 的 AI agent 每行动成本。"
image: "https://wavect.io/img/blog/headers/header_ai-agent-cost-per-action-2026.png"
---

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年7月9日 最近审核 2026年8月7日

[**下一篇**](/zh/blog/local-models-vs-apis-break-even-eu-2026/)

# AI Agent Cost per Action：为什么 agentic 工作流会推高 token 账单

要点速览

AI agent cost per action 是一个成功业务结果的总成本，不是一次模型调用或一条聊天消息。Agentic 工作流会推高 token 账单，因为一个请求会变成一条 trace：计划、工具 schema、工具调用、observation、草稿、验证器、重试、handoff、审批和审计日志。支持工单、发票提取、PR review 和 lead enrichment 都应按成功行动衡量，并把失败尝试留在分子里。计算器追踪尝试数、成功率、每行动模型调用、工具调用、缓存与未缓存输入、输出、重试率、升级率和人工返工。Prompt caching 在静态指令和工具 schema 保持 prefix 稳定时有效；batch 折扣只适合可以等待的行动。优化顺序是 trace 每个行动、限制循环、缩窄工具、分离 planner/worker/verifier、缓存稳定上下文、离线工作用 batch、把便宜步骤路由给便宜模型，并用 eval 验证质量。数字是 2026 年 7 月快照；预算前请重新检查供应商文档。

相关服务: [AI 赋能](/zh/services/ai-enablement/)

管理层买的不是 token，而是完成的行动：一个解决的支持工单、一张提取好的发票、一次完成的 PR review、一个补全的 lead、一次批准的退款、一个分流完成的 claim。这才是 AI agent 成本模型应该使用的单位。Cost per action 是把一个业务结果做到质量门槛所需的总成本，包括模型调用、工具调用、重试、验证器、升级、缓存 token、未缓存 token 和人工修正。

这篇文章比 [LLM 成本计算器](/zh/blog/llm-cost-calculator-2026/) 更窄。那篇文章讲 LLM 系统的每成功任务成本；这里专门讲 agentic 工作流，因为账单增长来自循环：计划、调用工具、读取工具输出、扩展上下文、验证、重试，有时还会交给另一个 specialist。

## 什么是 AI agent cost per action？

AI agent cost per action 是一个完成业务结果的总成本，而不是一次模型调用。它包括输入 token、缓存输入、输出 token、工具 schema、检索上下文、工具 observation、重试、验证器调用、升级、人工 review 和失败尝试，再除以成功行动数。

每行动成本 =（模型调用成本 + 工具和检索成本 + 重试成本 + 验证成本 + 人工返工）/ 成功行动数。

分母很重要。如果 agent 尝试补全 10,000 个 lead，但只有 8,700 个通过验证，成本应除以 8,700。失败行动并不免费，它们已经消耗了 token、工具、时间和信任。

## 为什么 agents 会放大 token

单次 LLM 调用是一行成本。一次 agent run 是一条 trace。ReAct 论文让这种模式出名：语言模型可以交错生成 reasoning 和 action，从外部环境获取信息后再继续。这很有用，但也改变了经济性。每个循环都会带上更多历史和 observation。

| 成本乘数 | 发生了什么 | 为什么账单变大 |
| --- | --- | --- |
| 计划 | Agent 判断下一步。 | Planner prompt 和 reasoning output 在真正工作前就产生成本。 |
| 工具 schema | 函数、MCP 工具、权限和示例进入上下文。 | 静态工具描述很大，如果缓存无效会反复计费。 |
| 工具 observation | 搜索结果、CRM 记录、发票、diff 或日志回到模型。 | 每个 observation 都成为下一步的新输入。 |
| 重试 | Schema 错误、超时或低置信度触发第二轮。 | 第二次通常还带着第一次的完整上下文。 |
| 验证 | 另一个模型或规则检查 grounding、policy、提取质量或代码风险。 | 质量控制必要，但它也是成本行。 |
| Handoff | 通用 agent 交给 specialist。 | 上下文会被复制、总结或重新扩展。 |

## 四个管理层听得懂的例子

| 业务行动 | 天真假设 | 典型 trace | 成本指标 |
| --- | --- | --- | --- |
| 支持工单已解决 | 一次回答。 | 分类、检索 policy、检查账号、起草、验证、更新 CRM。 | 每个通过 QA 的已解决工单成本。 |
| 发票已提取 | 一次 OCR 加 JSON。 | 读文件、判断版式、提取字段、查供应商、验证合计、重试缺失字段。 | 每张无需人工修正的发票成本。 |
| PR 已 review | 一个代码 review prompt。 | 总结 diff、检查文件、运行测试、搜索依赖、验证发现、写 review。 | 每个有可执行发现且低误报的 PR 成本。 |
| Lead 已补全 | 一次 enrichment 调用。 | 搜索网页、解析公司页、检查 CRM、判断 ICP fit、去重、打分。 | 每个销售接受的可用 lead 成本。 |

## 行动成本计算器

| 列 | 示例 | 为什么重要 |
| --- | --- | --- |
| 行动类型 | 支持工单已解决 | 业务单位，不是 API 单位。 |
| 月尝试数 | 40,000 | 失败前的原始量。 |
| 成功率 | 86% | 把尝试数转换成成功行动。 |
| 每行动模型调用 | 平均 4.7 | 计划、起草、验证和重试。 |
| 每行动工具调用 | 平均 3.2 | Search、CRM、数据库、代码、浏览器或工单系统。 |
| 未缓存输入 | 8,400 tokens | 动态用户数据、工具结果和 observation。 |
| 缓存输入 | 18,000 tokens | System prompt、工具 schema、policy 和示例。 |
| 输出 token | 2,300 | 草稿、JSON、review 评论。 |
| 重试率 | 14% | 隐藏的循环税。 |
| 升级率 | 9% | 更强模型或人工 review。 |
| 人工返工 | 0.8 分钟 | 把低质量转成钱。 |

## 示例：解决一个支持工单

一个支持 agent 负责解决 tier-1 工单。Demo 看起来很便宜：一个工单，一次模型调用。生产环境不同。Agent 会分类、检索 policy、检查账号、起草回复、验证 grounding 并更新工单。有些工单需要退款批准，有些 schema 失败后要重试。

| 步骤 | 调用 | 输入模式 | 优化杠杆 |
| --- | --- | --- | --- |
| 分类工单 | 1 | 短工单加分类体系 | 小模型或规则。 |
| 检索 policy | 1 次工具调用 | 搜索 query 和片段 | 更好的过滤器和更短 chunk。 |
| 检查账号 | 1 次工具调用 | 状态和订单数据 | 只返回决策所需字段。 |
| 起草回复 | 1 | 工单、policy、账号、语气指南 | 缓存静态指令。 |
| 验证 grounding | 1 | 草稿加证据 | 先用规则或便宜验证器。 |
| 重试 | 平均 0.18 | Schema 失败或低置信度 | 先修工具输出契约，再换模型。 |

## Caching 在哪里有用

Prompt caching 是 agent 的第一成本杠杆，因为工具 schema、policy 和指令会重复。OpenAI 表示 prompt caching 可把延迟降低最高 80%、输入 token 成本降低最高 90%，对 1,024 token 以上 prompt 自动启用，并要求精确 prefix 匹配。Anthropic 的 cache read 是基础输入价的 0.1x；Gemini 付费层包含 context caching 和 batch。

但 agent 上下文很杂。2026 年关于 long-horizon agentic task 的 prompt caching 研究发现，结构正确时 API 成本可降低 45% 到 80%。TokenPilot 提醒了同一个权衡：如果你为了省 token 不断改变 prefix，就会破坏 cache hit。

规则很简单：稳定内容放前面，易变内容放后面。System 指令、工具 schema、policy 和示例在前；工单文本、发票页、搜索结果、diff 和工具 observation 在后。

## Batch 什么时候省钱

Batch 适合可以等待的行动。OpenAI Batch API 列出相对同步 API 的 50% 折扣，并在 24 小时内完成。Anthropic 对 batch 的 input 和 output tokens 提供 50% 折扣。Gemini paid tier 提供 Batch API 和 50% 成本降低。它适合发票积压、lead enrichment、夜间 QA、eval、文档迁移和离线分类。

实时支持、交互式 PR review 和欺诈决策需要其他控制：更少循环、更窄工具、更小验证模型、更好缓存，以及通过 [LLM gateway 或 router](/zh/blog/llm-gateway-router-comparison-2026/) 做路由。

## 如何控制账单

1. **Trace 每个行动。** 记录 action ID、模型、工具、token、cache hit、retry 原因、延迟、状态和 eval 结果。
2. **限制循环。** 设置最大工具调用数和清晰 fallback。
3. **分开 planner、worker 和 verifier。** 昂贵模型不应该默认做所有步骤。
4. **缩窄工具。** 返回下一步需要的字段，不要返回整个 CRM 对象。
5. **缓存静态上下文。** 让 prefix 在行动之间保持稳定。
6. **离线行动用 batch。** Leads、发票和 eval 如果能等，就不应支付 live 价格。
7. **衡量成功，不是尝试。** 失败行动留在分子里。

## 质量必须进入成本模型

最便宜的 agent 往往会给其他团队制造工作。需要人工修语气的工单、销售拒绝的 lead、会计改字段的发票，或全是误报的 PR review，都没有实现宣传中的节省。行动只有通过业务质量门槛才算成功。

上线计划见 [30/60/90 天 AI agent 试点](/zh/blog/ai-agent-pilot-30-60-90-days/) 。失败模式见 [为什么 AI agent 项目会被取消](/zh/blog/why-ai-agent-projects-get-cancelled/) 。

如果你要选择的是编码 harness 而不是模型， [Claude Code vs OpenCode 团队成本对比](/zh/blog/claude-code-vs-opencode-team-cost-2026/) 会分别计算固定 prompt、缓存、套餐与每次仓库验收成功任务的成本。

不要把这一运行成本模型与语言研究混在一起。 [Semaprax 基准](/zh/semaprax/benchmarks/) 研究类型化受限编译器上下文是否可能减少智能体工作，但尚未测量模型 Token、被接受行动或成本，因此不能证明更低的 AI 智能体单次行动成本。

如果你的 trace 大量受大体量工具输出主导，在只调整模型策略前，先对比 [通过输出压缩控制编码代理成本](/zh/blog/codag-cost-control/) 。

## 来源和实时价格提醒

供应商价格和 agent 平台变化很快。机制是稳定的，数字是 2026 年 7 月快照。预算前请重新检查 [OpenAI Agents SDK](https://developers.openai.com/api/docs/guides/agents) 、 [OpenAI prompt caching](https://developers.openai.com/api/docs/guides/prompt-caching) 、 [OpenAI Batch API](https://developers.openai.com/api/docs/guides/batch) 、 [Anthropic pricing](https://platform.claude.com/docs/en/about-claude/pricing) 和 [Gemini pricing](https://ai.google.dev/gemini-api/docs/pricing) 。研究背景见 [ReAct](https://arxiv.org/abs/2210.03629) 、 [Don't Break the Cache](https://arxiv.org/abs/2601.06007) 和 [TokenPilot](https://arxiv.org/abs/2606.17016) 。

把这样一条 trace 压到站得住脚的单次动作成本，是设计工作：更少的步骤、机械环节换成更便宜的模型、一份重试预算，以及一条能终止循环的升级路径。当智能体跑在你团队内部时，这是我们 [AI 落地服务](/zh/services/ai-enablement/) 做的事；当它随产品交付时，则属于我们的 [AI 产品开发服务](/zh/services/artificial-intelligence/) 。 [Twinsoft AI](/zh/case-studies/twinsoft-ai/) 展示了让这些数字保持诚实的评估层。

## 最终思考

Agentic 工作流推高 token 账单，是因为一个请求会变成一条 trace：计划、工具、observation、起草、验证、重试、升级和记录。正确单位不是一次模型调用，也不是一条聊天消息，而是一个成功业务行动。

一旦衡量 cost per action，优化就变得具体：trace 每个行动、限制循环、缩窄工具、缓存稳定上下文、离线工作用 batch、把便宜步骤路由给便宜模型、验证质量，并把失败尝试留在分子里。

## 你可能也喜欢..

[**LLM 成本计算器 2026** 更完整的每成功任务成本计算器：缓存输入、batch、routing、重试、自托管和 eval 质量。](/zh/blog/llm-cost-calculator-2026/) [**AI Enablement vs 通用 AI 咨询** 一个交付战略幻灯片。另一个在你的基础设施上交付团队拥有的可运行系统。](/zh/compare/ai-enablement-vs-generic-ai-consultancy/)

## 本指南使用的主要来源

把追踪和风险管理当作稳定方法，再按实际模型组合刷新供应商价格。

- [OpenAI 智能体指南](https://developers.openai.com/api/docs/guides/agents)
- [OpenAI API 定价](https://openai.com/api/pricing/)
- [NIST AI 风险管理框架](https://www.nist.gov/itl/ai-risk-management-framework)

智能体工程

## 继续浏览此集群

编程智能体、MCP、上下文系统、评估与可靠自动化控制。

[从核心文章开始**AI 智能体的图工程：知识图谱什么时候值得做？**](/zh/blog/graph-engineering-ai-agents/)

- [Graft 评测 2026：智能体仓库地图该进 Git 吗？](/zh/blog/graft-review-agent-repo-map/)
- [通过工具输出压缩降低编码代理成本](/zh/blog/codag-cost-control/)
- [用 AI 编码智能体更聪明地管理 Token](/zh/blog/smarter-token-usage-with-your-ai-coding-agent/)
- [DeepSeek Harness 评测：插件化 Agent 技术栈能否用于生产？](/zh/blog/deepseek-harness-enterprise-review/)
- [OpenSandbox 评测：自托管是否值得？](/zh/blog/opensandbox-ai-agent-sandbox-review/)

只收重要内容

## 关注与你相关的内容

每当我们发布新文章，你会收到一封简短邮件。你可以关注整个博客，也可以只选感兴趣的主题。

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年7月9日 最近审核 2026年8月7日

[**下一篇**](/zh/blog/local-models-vs-apis-break-even-eu-2026/)

邮件订阅新文章 ×

×

通过邮件获取新文章

我们发布时给你一封简短邮件。免费，不做跟踪。

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/zh/blog/ai-agent-cost-per-action-2026/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-09",
      "inLanguage": "zh",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-09",
      "url": "https://wavect.io/zh/blog/ai-agent-cost-per-action-2026/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "AI agent cost per action 是一个成功业务结果的总成本，不是一次模型调用或一条聊天消息。Agentic 工作流会推高 token 账单，因为一个请求会变成一条 trace：计划、工具 schema、工具调用、observation、草稿、验证器、重试、handoff、审批和审计日志。支持工单、发票提取、PR review 和 lead enrichment 都应按成功行动衡量，并把失败尝试留在分子里。计算器追踪尝试数、成功率、每行动模型调用、工具调用、缓存与未缓存输入、输出、重试率、升级率和人工返工。Prompt caching 在静态指令和工具 schema 保持 prefix 稳定时有效；batch 折扣只适合可以等待的行动。优化顺序是 trace 每个行动、限制循环、缩窄工具、分离 planner/worker/verifier、缓存稳定上下文、离线工作用 batch、把便宜步骤路由给便宜模型，并用 eval 验证质量。数字是 2026 年 7 月快照；预算前请重新检查供应商文档。",
  "articleBody": " 博客概览/AI 与智能体/智能体工程 AI Agent Cost per Action：为什么 agentic 工作流会推高 token 账单 要点速览 AI agent cost per action 是一个成功业务结果的总成本，不是一次模型调用或一条聊天消息。Agentic 工作流会推高 token 账单，因为一个请求会变成一条 trace：计划、工具 schema、工具调用、observation、草稿、验证器、重试、handoff、审批和审计日志。支持工单、发票提取、PR review 和 lead enrichment 都应按成功行动衡量，并把失败尝试留在分子里。计算器追踪尝试数、成功率、每行动模型调用、工具调用、缓存与未缓存输入、输出、重试率、升级率和人工返工。Prompt caching 在静态指令和工具 schema 保持 prefix 稳定时有效；batch 折扣只适合可以等待的行动。优化顺序是 trace 每个行动、限制循环、缩窄工具、分离 planner/worker/verifier、缓存稳定上下文、离线工作用 batch、把便宜步骤路由给便宜模型，并用 eval 验证质量。数字是 2026 年 7 月快照；预算前请重新检查供应商文档。 相关服务: AI 赋能 管理层买的不是 token，而是完成的行动：一个解决的支持工单、一张提取好的发票、一次完成的 PR review、一个补全的 lead、一次批准的退款、一个分流完成的 claim。这才是 AI agent 成本模型应该使用的单位。Cost per action 是把一个业务结果做到质量门槛所需的总成本，包括模型调用、工具调用、重试、验证器、升级、缓存 token、未缓存 token 和人工修正。 这篇文章比 LLM 成本计算器 更窄。那篇文章讲 LLM 系统的每成功任务成本；这里专门讲 agentic 工作流，因为账单增长来自循环：计划、调用工具、读取工具输出、扩展上下文、验证、重试，有时还会交给另一个 specialist。 什么是 AI agent cost per action？ AI agent cost per action 是一个完成业务结果的总成本，而不是一次模型调用。它包括输入 token、缓存输入、输出 token、工具 schema、检索上下文、工具 observation、重试、验证器调用、升级、人工 review 和失败尝试，再除以成功行动数。 每行动成本 =（模型调用成本 + 工具和检索成本 + 重试成本 + 验证成本 + 人工返工）/ 成功行动数。 分母很重要。如果 agent 尝试补全 10,000 个 lead，但只有 8,700 个通过验证，成本应除以 8,700。失败行动并不免费，它们已经消耗了 token、工具、时间和信任。 为什么 agents 会放大 token 单次 LLM 调用是一行成本。一次 agent run 是一条 trace。ReAct 论文让这种模式出名：语言模型可以交错生成 reasoning 和 action，从外部环境获取信息后再继续。这很有用，但也改变了经济性。每个循环都会带上更多历史和 observation。 成本乘数发生了什么为什么账单变大 计划Agent 判断下一步。Planner prompt 和 reasoning output 在真正工作前就产生成本。 工具 schema函数、MCP 工具、权限和示例进入上下文。静态工具描述很大，如果缓存无效会反复计费。 工具 observation搜索结果、CRM 记录、发票、diff 或日志回到模型。每个 observation 都成为下一步的新输入。 重试Schema 错误、超时或低置信度触发第二轮。第二次通常还带着第一次的完整上下文。 验证另一个模型或规则检查 grounding、policy、提取质量或代码风险。质量控制必要，但它也是成本行。 Handoff通用 agent 交给 specialist。上下文会被复制、总结或重新扩展。 四个管理层听得懂的例子 业务行动天真假设典型 trace成本指标 支持工单已解决一次回答。分类、检索 policy、检查账号、起草、验证、更新 CRM。每个通过 QA 的已解决工单成本。 发票已提取一次 OCR 加 JSON。读文件、判断版式、提取字段、查供应商、验证合计、重试缺失字段。每张无需人工修正的发票成本。 PR 已 review一个代码 review prompt。总结 diff、检查文件、运行测试、搜索依赖、验证发现、写 review。每个有可执行发现且低误报的 PR 成本。 Lead 已补全一次 enrichment 调用。搜索网页、解析公司页、检查 CRM、判断 ICP fit、去重、打分。每个销售接受的可用 lead 成本。 行动成本计算器 列示例为什么重要 行动类型支持工单已解决业务单位，不是 API 单位。 月尝试数40,000失败前的原始量。 成功率86%把尝试数转换成成功行动。 每行动模型调用平均 4.7计划、起草、验证和重试。 每行动工具调用平均 3.2Search、CRM、数据库、代码、浏览器或工单系统。 未缓存输入8,400 tokens动态用户数据、工具结果和 observation。 缓存输入18,000 tokensSystem prompt、工具 schema、policy 和示例。 输出 token2,300草稿、JSON、review 评论。 重试率14%隐藏的循环税。 升级率9%更强模型或人工 review。 人工返工0.8 分钟把低质量转成钱。 示例：解决一个支持工单 一个支持 agent 负责解决 tier-1 工单。Demo 看起来很便宜：一个工单，一次模型调用。生产环境不同。Agent 会分类、检索 policy、检查账号、起草回复、验证 grounding 并更新工单。有些工单需要退款批准，有些 schema 失败后要重试。 步骤调用输入模式优化杠杆 分类工单1短工单加分类体系小模型或规则。 检索 policy1 次工具调用搜索 query 和片段更好的过滤器和更短 chunk。 检查账号1 次工具调用状态和订单数据只返回决策所需字段。 起草回复1工单、policy、账号、语气指南缓存静态指令。 验证 grounding1草稿加证据先用规则或便宜验证器。 重试平均 0.18Schema 失败或低置信度先修工具输出契约，再换模型。 Caching 在哪里有用 Prompt caching 是 agent 的第一成本杠杆，因为工具 schema、policy 和指令会重复。OpenAI 表示 prompt caching 可把延迟降低最高 80%、输入 token 成本降低最高 90%，对 1,024 token 以上 prompt 自动启用，并要求精确 prefix 匹配。Anthropic 的 cache read 是基础输入价的 0.1x；Gemini 付费层包含 context caching 和 batch。 但 agent 上下文很杂。2026 年关于 long-horizon agentic task 的 prompt caching 研究发现，结构正确时 API 成本可降低 45% 到 80%。TokenPilot 提醒了同一个权衡：如果你为了省 token 不断改变 prefix，就会破坏 cache hit。 规则很简单：稳定内容放前面，易变内容放后面。System 指令、工具 schema、policy 和示例在前；工单文本、发票页、搜索结果、diff 和工具 observation 在后。 Batch 什么时候省钱 Batch 适合可以等待的行动。OpenAI Batch API 列出相对同步 API 的 50% 折扣，并在 24 小时内完成。Anthropic 对 batch 的 input 和 output tokens 提供 50% 折扣。Gemini paid tier 提供 Batch API 和 50% 成本降低。它适合发票积压、lead enrichment、夜间 QA、eval、文档迁移和离线分类。 实时支持、交互式 PR review 和欺诈决策需要其他控制：更少循环、更窄工具、更小验证模型、更好缓存，以及通过 LLM gateway 或 router 做路由。 如何控制账单 Trace 每个行动。记录 action ID、模型、工具、token、cache hit、retry 原因、延迟、状态和 eval 结果。 限制循环。设置最大工具调用数和清晰 fallback。 分开 planner、worker 和 verifier。昂贵模型不应该默认做所有步骤。 缩窄工具。返回下一步需要的字段，不要返回整个 CRM 对象。 缓存静态上下文。让 prefix 在行动之间保持稳定。 离线行动用 batch。Leads、发票和 eval 如果能等，就不应支付 live 价格。 衡量成功，不是尝试。失败行动留在分子里。 质量必须进入成本模型 最便宜的 agent 往往会给其他团队制造工作。需要人工修语气的工单、销售拒绝的 lead、会计改字段的发票，或全是误报的 PR review，都没有实现宣传中的节省。行动只有通过业务质量门槛才算成功。 上线计划见 30/60/90 天 AI agent 试点。失败模式见 为什么 AI agent 项目会被取消。 如果你要选择的是编码 harness 而不是模型，Claude Code vs OpenCode 团队成本对比会分别计算固定 prompt、缓存、套餐与每次仓库验收成功任务的成本。 不要把这一运行成本模型与语言研究混在一起。Semaprax 基准研究类型化受限编译器上下文是否可能减少智能体工作，但尚未测量模型 Token、被接受行动或成本，因此不能证明更低的 AI 智能体单次行动成本。 如果你的 trace 大量受大体量工具输出主导，在只调整模型策略前，先对比 通过输出压缩控制编码代理成本。 来源和实时价格提醒 供应商价格和 agent 平台变化很快。机制是稳定的，数字是 2026 年 7 月快照。预算前请重新检查 OpenAI Agents SDK、OpenAI prompt caching、OpenAI Batch API、Anthropic pricing 和 Gemini pricing。研究背景见 ReAct、Don't Break the Cache 和 TokenPilot。 把这样一条 trace 压到站得住脚的单次动作成本，是设计工作：更少的步骤、机械环节换成更便宜的模型、一份重试预算，以及一条能终止循环的升级路径。当智能体跑在你团队内部时，这是我们 AI 落地服务做的事；当它随产品交付时，则属于我们的 AI 产品开发服务。Twinsoft AI 展示了让这些数字保持诚实的评估层。 最终思考 Agentic 工作流推高 token 账单，是因为一个请求会变成一条 trace：计划、工具、observation、起草、验证、重试、升级和记录。正确单位不是一次模型调用，也不是一条聊天消息，而是一个成功业务行动。 一旦衡量 cost per action，优化就变得具体：trace 每个行动、限制循环、缩窄工具、缓存稳定上下文、离线工作用 batch、把便宜步骤路由给便宜模型、验证质量，并把失败尝试留在分子里。 你可能也喜欢.. LLM 成本计算器 2026 更完整的每成功任务成本计算器：缓存输入、batch、routing、重试、自托管和 eval 质量。 AI Enablement vs 通用 AI 咨询 一个交付战略幻灯片。另一个在你的基础设施上交付团队拥有的可运行系统。 本指南使用的主要来源 把追踪和风险管理当作稳定方法，再按实际模型组合刷新供应商价格。 OpenAI 智能体指南 OpenAI API 定价 NIST AI 风险",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "OpenAI 智能体指南",
      "url": "https://developers.openai.com/api/docs/guides/agents"
    },
    {
      "@type": "WebPage",
      "name": "OpenAI API 定价",
      "url": "https://openai.com/api/pricing/"
    },
    {
      "@type": "WebPage",
      "name": "NIST AI 风险管理框架",
      "url": "https://www.nist.gov/itl/ai-risk-management-framework"
    }
  ],
  "dateModified": "2026-08-07",
  "datePublished": "2026-07-09",
  "description": "AI agent cost per action 是一个成功业务结果的总成本，不是一次模型调用或一条聊天消息。Agentic 工作流会推高 token 账单，因为一个请求会变成一条 trace：计划、工具 schema、工具调用、observation、草稿、验证器、重试、handoff、审批和审计日志。支持工单、发票提取、PR review 和 lead enrichment 都应按成功行动衡量，并把失败尝试留在分子里。计算器追踪尝试数、成功率、每行动模型调用、工具调用、缓存与未缓存输入、输出、重试率、升级率和人工返工。Prompt caching 在静态指令和工具 schema 保持 prefix 稳定时有效；batch 折扣只适合可以等待的行动。优化顺序是 trace 每个行动、限制循环、缩窄工具、分离 planner/worker/verifier、缓存稳定上下文、离线工作用 batch、把便宜步骤路由给便宜模型，并用 eval 验证质量。数字是 2026 年 7 月快照；预算前请重新检查供应商文档。",
  "headline": "AI Agent Cost per Action：为什么 agentic 工作流会推高 token 账单",
  "image": "https://wavect.io/img/blog/headers/header_ai-agent-cost-per-action-2026.svg",
  "inLanguage": "zh",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/zh/blog/ai-agent-cost-per-action-2026/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/zh/blog/ai-agent-cost-per-action-2026/",
  "wordCount": 547
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/",
      "name": "首页",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/overview/",
      "name": "博客概览",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/topics/ai-agents/",
      "name": "AI 与智能体",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/clusters/agent-engineering/",
      "name": "智能体工程",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/ai-agent-cost-per-action-2026/",
      "name": "AI Agent Cost per Action：Token 账单计算器 | ",
      "position": 5
    }
  ]
}
```
