返回
Kevin Riedl

8 min 阅读 · 29 Jun 2026
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

2026 年 DACH 地区的内部 AI 助手到底要花多少钱

管理者会问一个简单的问题:一个覆盖公司文档的内部 AI 助手,按人按月到底要花多少钱?得到的回答通常是两种没什么用的说法之一。要么是一个吓人的五位数,背后假设了一个没人需要的自托管 GPU 集群;要么是一个轻描淡写的“几乎不要钱,token 现在很便宜”。两者都不对,因为一个覆盖 SharePoint、Confluence 和 Google DriveRAG 助手,真实成本不是一笔大开支。它是好几笔小开支,外加所有人都会忘记的那一项:把它持续维持运行。

这是工程与流程视角,不是供应商推销。这里讲的是把 AI 在内部铺开,和为你的客户构建 AI 产品是不同的活儿;内部搭建这一侧我们放在 AI Enablement 下做。下面的数字是方向性的,取自 2026 年的公开价格,你的数字会有出入。在做预算之前请重新核对当前价格。

在给检索定价前,先决定它要检索什么。我们的 AI 就绪企业 Wiki 指南定义了这份成本模型所依赖的权威知识、权限与审核架构。

想知道贴合你实际环境的成本?

 预约免费咨询

到底是什么在推高内部 AI 助手的成本?

几乎所有人都盯着 LLM 账单,而对一个内部助手来说,那很少是最大的一笔。成本由三件你在花掉第一个 token 之前就能掌控的事情决定:

  • 有多少人用,用得有多猛。十个每天查询 30 次的重度用户,比 200 个每周打开两次的偶尔用户花得更多。重要的单位是每天的查询数,不是人头数。
  • 为了回答它要读多少。每个回答都会把检索到的文档片段塞进 prompt。每次调用塞进十页上下文,你的输入 token 账单就翻倍,哪怕问题只有一行。
  • 索引要多新。文档一改就立刻重新 embed,比每晚同步一次更贵。大多数内部知识不会分分钟变化,这是大多数团队白白放掉的一笔节省。

先把这三个假设写到纸上。它们对月账单的影响,比你之后做的任何供应商选择都大。

成本构成,逐项来看是哪些?

这是一个小型自管 RAG 助手的 2026 年示例预算。区间是场景假设,不是市场均值或供应商报价。投入前应按最新价格和实测 token、存储、请求、副本及服务等级重新计算。

构成它是什么大致月成本说明
Embedding(初始 + 更新)把你的文档变成向量,使其可被检索~$0 到 $30截至 2026 年 9 月 2 日,OpenAI 列出的 text-embedding-3-small 单价为每 1M token $0.02,text-embedding-3-large 为 $0.13。按此价格,一次处理 100M 输入 token 分别为 $2 或 $13;更新成本取决于变化量。
向量数据库存储并检索这些向量~$0 到 $150+免费档可覆盖原型。PineconeQdrant CloudWeaviate Cloud 分别采用用量、容量、最低消费或专用资源等不同模式,因此不存在可靠的通用起步价。自托管只是把服务账单换成计算与运维成本。
LLM 回答 token根据检索到的上下文写出每个回答的模型~$20 到几百可变的那一项。由每天查询数乘上下文大小乘模型单价决定。中端模型加上精简的上下文能把它压小;把每个查询都路由到带臃肿上下文的 frontier 模型,就是它爆炸的方式。
检索 + 编排胶水层:查询处理、重排、权限过滤~$0 到 $40大多是你自己的算力。可选的重排器会增加少量每次查询的成本;带权限的检索增加的是延迟,不是太多花费。
托管应用服务器、API 网关、日志、监控~$20 到 $100一个小容器加一个托管网关。在你扩大用户量之前,金额温和且平稳。
维护保持其正确:连接器维护、评估运行、模型升级真正的数字它包括工程与审查时间,一年内可能超过基础设施。诚实的预算应实测此项,而不是将其忽略。

注意这个规律。2026 年,基础设施那几行便宜得出人意料。决定这个项目值不值得的成本在最后一行,而它正是任何供应商报价都不包含的那一项。

Kevin Riedl

"向量库和 token 是便宜的部分。贵的部分是那个在文档变化之后还把回答保持正确的工程师。把这一项预算进去,否则项目会烂掉。"

自建还是购买:到底哪个更便宜?

那些打包好的“覆盖你知识库的 AI”产品会报一个按席位的价格,往往落在一个付费生产力席位的区间里。这干净、可预测,对一个文档很通用的小团队来说,可能就是对的选择。代价出现在两处:不管一个用户一个月查一次还是一天查五十次,你都按席位付费;而你的数据路由和检索逻辑,是供应商替你定的。

自管部署把这个关系反过来。每次查询的成本很低,你只为实际运行的部分付费,但也要承担搭建和维护工作。盈亏平衡点不只取决于席位数,更取决于控制权。一旦你需要让权限检索严格遵循 SharePoint 和 Confluence 的访问规则,或者数据不能离开自己的基础设施,现成产品的席位价格就不再是全部成本。我们在如何在内部铺开 AI 而不造出没人用的摆设中进一步分析了这一部署决策。

DACH 数据驻留在哪里会增加成本?

对 DACH 公司而言,数据位置是法律与技术设计的一部分。GDPR 并未一概要求只能在欧盟处理;第 V 章允许基于充分性决定或适当保障进行第三国传输,同时仍须完成其余处理评估。EU AI Act 也没有设立通用数据驻留要求。合同、行业规则、客户政策、保密义务或所选传输机制,仍可能要求具体部署只能在欧盟处理。

  • 欧盟数据区或单一区域端点。Microsoft Foundry Data Zone 在定义的欧盟数据区内处理,单一区域部署则在所选区域处理。模型可用性、配额、SLA 与价格可能不同,因此应比较具体模型和区域,而不是假设固定驻留加价。
  • 托管在欧盟的向量库和应用。区域固定可能只是配置,也可能需要不同服务档,或在某产品中不可用。它会影响价格、冗余、出站流量、容量和运维设计。
  • 合规工作本身。真正的驻留成本是这套审查:数据处理协议、处理活动记录,以及确认没有任何来自欧盟之外的维护访问能触及数据。这是一次性投入加上一笔较小的经常性复核,而在设计阶段做远比事后改造便宜。

从一开始设计时,驻留与传输控制就是明确的预算输入。事后增加时,可能需要数据迁移、更换供应商或重建架构。

按席位按月到底多少钱,来算一个例子?

仅供示意。你的数字会有出入,在你相信它之前应当重新核对当前价格。重点是账单的形状,不是确切的数字。

假设一家 DACH 公司有 50 个活跃用户,每人每天大约 10 次查询(每月约 11,000 次查询),语料库为几十万个文档片段,由一个欧盟区域的中端模型以精简检索(每个回答取少量片段)作答,每晚重新索引,并使用一个托管向量库。

方向性月成本
Embedding(一次性批量 embedding 之后的每晚增量)~$5 到 $20
托管向量库(生产档,欧盟区域)~$50 到 $150
LLM 回答 token(中端模型,精简上下文)~$60 到 $250
托管、网关、监控~$30 到 $100
基础设施小计~$150 到 $520 / 月
分摊到 50 个席位~$3 到 $10 每席位 / 月
维护(工程师时间,摊销后)一年里占主导的那一项

在这些假设下,基础设施小计约为每个活跃席位每月 $3 到 $10。这只是每月 11,000 次查询场景的算术,不是 DACH 基准。维护、身份、安全、备份、支持、税费和人力均不在小计内。

怎样在不让它烂掉的前提下保持便宜?

让生产级 AI 构建保持可负担的那套纪律,在这里同样适用。成本杠杆,按它们见效的顺序:

  • 路由到最便宜的够用模型。大多数内部问题用不上你最贵的模型。把 frontier 模型留给困难的少数,每次查询的成本就会大幅下降。
  • 检索得更少、更精准。最大的单项 token 浪费,就是往每个回答里塞太多片段。好的检索加上一个重排器,给模型发去几段相关片段,而不是十页。这是对 LLM 那一行影响最大的杠杆。
  • 缓存实测重复项。只有日志显示输入可重复且权限安全时才缓存,并为文档和权限变化定义失效规则。更深入的 token 机制见如何在 2026 年降低 LLM token 成本
  • 按新鲜度 SLA 索引。依据业务对过时答案的容忍度选择每晚、事件驱动或近实时同步。Embedding 成本取决于变化的 token 量。

有一条任何成本表都捕捉不到的谦逊提醒:一个悄悄给出错误答案的便宜助手,是所有结果里最贵的。你需要一个评估集,一种在文档变化之后衡量回答质量的方法,以及一个以盯着它为本职的人。那条维护项不是可有可无的填充。它是“团队信任的工具”和“团队不再打开的工具”之间的分界。我们在像 Twinsoft AI 这样的生产 AI 工作中看到了同样的纪律见效,正是那个评估框架让成本优化变得安全。

最终思考

内部助手不存在通用的 DACH 每席位价格。在 50 个席位、每月 11,000 次查询的示例中,给定假设得到每个活跃席位每月约 $3 到 $10,尚未包含维护、身份、安全、备份、支持、税费和人力。应以实测用量和实时供应商价格重算每一项。

仅在欧盟处理并非 GDPR 或 AI Act 的通用规则,但合同、传输保障、行业义务或公司政策可能要求这样做。先确定法律与技术边界,再核算符合条件的部署。持续跟踪查询、token、检索规模、embedding 变化量、向量用量和维护成本。

想要一份贴合你基础设施的算账方案?

 预约免费咨询

本指南使用的主要来源

供应商价格与部署可用性会变化,批准预算前请重新检查以下实时页面。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

8 min 阅读 · 29 Jun 2026
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。