LangChain Deep Agents 评测:Agent Harness 能否用于生产?
LangChain Deep Agents 是一套能力齐全的 Agent Harness,不是新模型,也不是 LangGraph 的替代品。它围绕 LangChain Agent Loop 提供文件工具、上下文管理、子 Agent 委派、记忆、审批与可选代码执行。对于真正需要长期运行 Harness 的任务,它能缩短从原型到生产试点的路径。
多数 Framework 横向对比没有回答采购方最关心的问题:安装 Deep Agents 后,团队还要设计、加固和运营什么?这个答案决定了它是在节省数月工程时间,还是增加一层维护成本。
投入工程预算前,需要一项可辩护的 Deep Agents 决策?
规划 Agent 试点LangChain Deep Agents 是什么?
Deep Agents 是一套 MIT 许可证开源 Harness,适合需要拆解工作、管理文件与不断增长的上下文、委派隔离任务、保留记忆并等待人工审批的 Agent。官方 Repository 将其定义为基于 LangGraph、带有明确默认选择但组件可替换的层。项目提供 Python 与 TypeScript 实现。
| 层 | 负责什么 | 何时使用 |
|---|---|---|
| LangGraph Runtime | Durable Execution、Checkpoint、State、Streaming 与底层编排 | 需要自定义 Graph,或混合确定性步骤与 Agent 步骤 |
| LangChain Framework | 模型、工具、标准 Agent Loop、Middleware 与集成 | 需要更轻的 Agent,并自行选择能力 |
| Deep Agents Harness | 文件、上下文压缩、记忆、子 Agent、Skills 与执行环境 | 需要为复杂不确定任务准备好的 Harness |
这一区分会影响架构。LangChain 的官方 Stack 对比建议在复杂多步骤任务,以及需要现成文件、Shell、上下文与子 Agent 能力时使用 Deep Agents。如果必须控制 Loop 本身,应直接使用 LangGraph。
Deep Agents v0.7 改了什么?
截至 2026 年 8 月 23 日,当前 Python 版本是2026 年 8 月 20 日发布的 deepagents 0.7.8。应固定经过测试的版本。对于快速变化的 Beta Package,浮动依赖可能让普通升级变成架构变更。
v0.7 比 Patch 号更重要。LangChain 从默认 Harness 移除 Todo 规划,让内置 Middleware 更容易替换,并声称将基础 System Prompt 与工具描述 Token 减少了 65%。维护者表示,其 Eval 显示默认 Todo List 增加了成本与延迟,却没有改善性能。需要时仍可选择启用规划。
这说明一个生产原则:更多自动化默认功能不一定更好。每段 Prompt、每次 Model Call 与每个委派任务都必须在自己的 Eval Set 中证明价值。
Deep Agents 架构如何运行?
- 主 Agent 获得任务与工具。团队定义模型、业务工具、System Prompt 与 Middleware。
- 虚拟文件系统保存工件。Backend 可以使用会话 State、本地文件、持久 Store、Composite Route 或 Sandbox。
- 长任务会压缩上下文。大型工具结果可写入文件,摘要控制活跃上下文大小。
- 子 Agent 隔离重任务。主 Agent 只接收结果,不需要吸收全部中间 Token。
- LangGraph 保存 Checkpoint。配置生产 Checkpointer 后,失败或暂停的 Run 可以继续。
Quickstart 不等于生产系统。真实部署还需要用户认证、Tenant State 隔离、Checkpointer、Sandbox Policy、Secret 管理、Eval、预算上限与恢复方案。LangChain 的生产指南明确不建议部署 Agent 使用可直接访问 Host 的 Backend,并覆盖 Multi-tenancy、Credential、Durability、Sandbox、Rate Limit 与隐私。
LangChain Deep Agents 安全吗?
Deep Agents 提供安全控制,但它本身不是完整安全边界。项目采用 Trust-the-LLM 模型,工具决定模型能做什么。文件规则、Sandbox 隔离、最小权限 Credential 与审批 Gate 必须在 Prompt 之外强制执行策略。
| 风险 | 必要控制 | 负向测试 |
|---|---|---|
| 跨 Tenant 记忆访问 | 按用户划分 Store Namespace,默认拒绝授权 | 尝试读取或覆盖其他 Tenant 工件 |
| 代码执行危及 Host | 临时 Sandbox、资源限制与受限 Egress | 尝试访问 Host 文件、Metadata Service 与开放网络 |
| Prompt Injection | 类型化工具、标记不可信数据、最小权限 | 在 Retrieval 与持久记忆中放置冲突指令 |
| 不可逆业务行动 | 人工审批、Idempotency Key 与服务端策略 | 重放已批准操作,或在 Resume 前修改参数 |
| 成本失控 | 每次 Run 的 Call、Token、时间与金额上限 | 强制循环、重复委派与超大工具输出 |
审批是 Workflow 功能,不是 Prompt 中的一句请求。Deep Agents 使用 LangGraph Interrupt。Human-in-the-loop 文档要求使用 Checkpointer,才能安全暂停并继续批准、编辑或拒绝决策。最终授权还必须放在业务服务中。模型输出与支付、删除或外部消息之间,不能只有 Agent 这一道控制。
Deep Agents 的成本是多少?
该 Library 使用 MIT 许可证,没有 Deep Agents Runtime License Fee。应关注每次被接受行动的成本,而不是单纯 Token 单价。
月度 Agent 成本 = 模型调用 + 子 Agent 调用 + Sandbox 计算与存储 + Runtime 与数据库 + Trace 与 Eval + 工程与审核。
| 成本项 | 为什么增长 | 如何控制 |
|---|---|---|
| 模型 | 长 Run、Retry、摘要与子 Agent Fan-out | 按任务路由模型、限制委派、评测 Prompt 变更 |
| Sandbox | 长期环境、大型工件与闲置容量 | Thread Scope、TTL 清理与资源上限 |
| Observability | Trace 数量、Retention 与 Eval Sampling | 保留错误与成功样本,只导出必要字段 |
| 人工审核 | 低精度、审批信息不清与反复修改 | 同时展示证据、行动、Diff、置信度与 Rollback |
| 平台工程 | Auth、权限、Connector、Eval、值班与升级 | 在 Demo 前明确预算与 Owner |
Managed LangSmith 是可选项,不包含在开源许可证中。其当前定价页分别计算 Seat、Trace、Deployment、Sandbox 与其他用量。模型提供商费用仍可能占主要部分。应在试点中记录每项成本。
什么时候应该选择 Deep Agents?
只有同时满足以下四项,Deep Agents 才更可能值得采用:
- 工作包含多个步骤,无法可靠地表示为短小确定性流程。
- Agent 需要在长上下文中创建、检查或修改工件。
- 并行或专业子 Agent 能改善吞吐量或上下文隔离。
- 业务价值足以覆盖 Sandbox、Eval、审核与长期运维。
如果一次模型调用加少量工具就能完成任务、Workflow 完全确定、只需 Retrieval 与引用答案,或者团队尚不能运营身份、权限、日志和事故响应,就应选择更轻的方案。官方Deep Agents 模型评测页也强调:通过基础 Harness 操作只是必要条件,并不足以证明模型能完成更长、更复杂的任务。
如何运行生产试点?
- 选择一个边界清晰的 Workflow。优先考虑高频、可审核、有明确 Owner 的工作。
- 记录人工 Baseline。测量完成率、耗时、审核时间、错误类别与当前成本。
- 建立 Acceptance Set。包含正常案例、歧义、Prompt Injection、权限违规、故障与重复行动。
- 从 Read-only 开始。使用 Sandbox 与合成或脱敏数据,所有外部副作用必须审批。
- 衡量结果。追踪被接受任务、审核修改、p50 与 p95 延迟、成本、策略违规和恢复时间。
- 提前设定停止规则。如果 Harness 的改善不足以覆盖运维与审核负担,就停止。
Deep Agents 常见问题
Deep Agents 与 LangGraph 是一回事吗?
不是。LangGraph 是用于有状态 Durable Workflow 的底层 Runtime,Deep Agents 是在这些能力上构建的预制 Harness。需要显式编排时,仍可把自定义 Compiled LangGraph 作为子 Agent。
Deep Agents 达到生产要求了吗?
底层 Runtime 具备生产能力,但应用只有在身份、Tenant 隔离、工具权限、Sandbox、审批、Eval、Observability、预算和恢复路径通过自己的测试后才算生产就绪。Beta 状态与高频 Release 仍是升级风险。
Deep Agents 支持 Python 与 TypeScript 吗?
支持。应核对所选语言的功能一致性与版本兼容性,固定完整依赖集合,并测试完全相同的版本。
商业决策应该怎么做?
如果替代方案是自行构建同一套 Harness 能力,Deep Agents 可能很有价值。如果团队把内置自治能力误认为完成了产品工程,它就不合适。企业真正投资的不是 Library,而是一条拥有自有数据、行动受控、质量可衡量且有人负责运维的可靠流程。
架构层面的选择可以先看我们的AI 智能体图工程指南,并对比TrueForge Agent Harness 评测。Wavect 的 AI Enablement 服务可以把候选 Workflow 转化为 Acceptance Set、Sandbox 实现与生产交接。还可以查看 Twinsoft AI 案例,使用软件开发方式决策指南,或预约 Deep Agents 架构评审。
