主题

AI 与智能体

AI 系统、编程智能体和模型基础设施的工程、运营与评估。

博客文章
149
聚焦集群
02

聚焦集群

从核心文章开始

只收重要内容

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

本集合最新内容

表示 Clef、Clef-flash 与 Jev 之间选择关系的抽象分支路径,不代表基准测量结果 AI 与智能体

Cloudflare Clef 与 Jev:价格、基准测试与迁移

Clef 为类似 Jev 的决策 API 带来开放权重与图像输入。但价格、置信度含义和 Flash 的任务表现,都需要在迁移前单独验证。

层叠的上下文卡片,表示智能体可编辑的工作集 AI 与智能体

Context Language Models 与上下文压缩:应该如何试点?

智能体应该自行编辑上下文吗?比较 CLM 与上下文压缩,核查实际运行框架和许可,并测试关键事实丢失、缓存残留与恢复能力。

本地 Caveman 代理在模型推理前压缩编码智能体的噪声上下文 AI 与智能体

Caveman 3.0 与 Claude Code:本地输入压缩、原文恢复与基准

Caveman 3.0 在编码智能体和模型之间加入 Apache-2.0 压缩层。本文核查本地代理、原文恢复、caveman learn 与 33.2% 输入 token 基准。

Wavect 关于使用 LiteLLM Lens 分析智能体运行记录的示意图 AI 与智能体

LiteLLM Lens:用 SQL 与 API 分析智能体 Trace

从查看单次运行转向调查重复问题:理解 LiteLLM Lens、ClickHouse SQL、安全 API 访问,以及从证据到回归测试的完整路径。

SmythOS Studio 自托管:可视化工作流、自有基础设施与运行时边界 AI 与智能体

SmythOS Studio 自托管指南:Docker、成本与部署边界

在自己的基础设施上运行采用 MIT 许可证的可视化智能体构建器。基于源码梳理 Docker 安装、实际成本,以及从本地演示走向公开服务所需的检查。

DeerFlow 智能体执行框架中相互连接的上下文、沙箱与工作流层 AI 与智能体

DeerFlow 2.0:Docker 部署、沙箱与记忆机制

不止于发布介绍:配置 DeerFlow Docker 环境,理解共享沙箱,排查记忆问题,并为生产部署建立验收标准。

完整文章目录

  1. Cloudflare Clef 与 Jev:价格、基准测试与迁移
  2. Context Language Models 与上下文压缩:应该如何试点?
  3. Caveman 3.0 与 Claude Code:本地输入压缩、原文恢复与基准
  4. LiteLLM Lens:用 SQL 与 API 分析智能体 Trace
  5. SmythOS Studio 自托管指南:Docker、成本与部署边界
  6. DeerFlow 2.0:Docker 部署、沙箱与记忆机制
  7. CLM-8B 自托管:vLLM、动作缓存与验证器
  8. AnyJev:LLM 概率校准与选项顺序偏差
  9. LiteAgents SDK:逐轮模型路由、安装与迁移指南
  10. mcp-memory-service:让 Claude Code 与 Cursor 共享持久记忆
  11. Claude Opus 5.5 使用指南:适用场景、提示词与思考强度
  12. Laya 与 Jev 的企业应用:6 个实用工作流
  13. Laya vs Jev:基准结果与 AI 创业护城河
  14. Google AX Agent Executor:预算、沙箱与自托管
  15. WikiSkill:智能体如何从经验中进化 SKILL.md
  16. 腾讯 Octop 评测:开发者真正免费获得了什么
  17. Wigolo 评测:AI Agent 的本地优先 Web Intelligence
  18. Jev AI 评测:面向智能体工作流的决策模型
  19. Supermemory:AI 智能体记忆、RAG 与本地部署指南
  20. AI 智能体设计模式:从简单开始,执行前验证
  21. Claude Mods:配置、Function Hooks 与安全指南
  22. Voicebox:本地声音克隆、语音输入与 MCP 配置
  23. Valyu 的 0.6B 多智能体路由器:研究结果、指标边界与落地判断
  24. OpenAI Agents API 评测:迁移、成本与数据控制
  25. Spotify shunt 评测:安装、Token 节省与限制
  26. OpenBot 评测:自托管 AI 同事的成本与权限
  27. SwarmLLM 评测 2026:手机与笔记本协同浏览器 LLM 推理
  28. Ramp Inspect 架构 2026:如何扩展后台编码 Agent
  29. Model Hardware Standard 企业指南:MHS 与实体 AI
  30. Fonio AI 2026 评估:价格、API、GDPR 与自建对比
  31. Mosaic(YC S26)评测:团队编码 Agent 的共享记忆
  32. Ripwire 评测 2026:无需 Embedding 的 AI 仓库上下文
  33. AI 编程智能体的多文件原子修改:Semaprax 开发教训
  34. Phonely Alma 评测:这款语音 LLM 能否用于生产?
  35. Utopia 企业评估:双时态知识图谱与历史问答
  36. AI 智能体知识迁移:前沿模型探索一次,低成本模型规模执行
  37. claude-rotate:一个代理管理多个 Claude Max 账户
  38. NVIDIA PAIR 评测:本地 AI 路由与 AMD 支持缺口
  39. Feynman 评测:这款开源 AI 研究 Agent 适合团队吗?
  40. Obscura 浏览器评测:性能主张、限制与生产适用性
  41. Claude Code 设计系统:用 4 个部分保持品牌一致
  42. Tencent Hy4 Preview 评测:百万 Token 上下文值得试点吗?
  43. PageLM 评估:自托管与商业使用
  44. ChatGPT 能登录网站,而且模型看不到密码
  45. M6 Mac mini 对比 M5 Mac Studio:本地 AI 选购指南
  46. AI 智能体 Harness 图解:LLM 周围的可靠性层
  47. FreeToken AI 评测:消费级 GPU 能跑前沿 MoE 大模型吗?
  48. Darkbloom AI 评测:用闲置 Mac 提供私有推理
  49. Ox Alpha 已揭晓为 GLM-5.3-Flash:变化解读
  50. 智能体编辑为何需要语义身份:用 Rust 构建 SEMAPRAX
  51. LangChain Deep Agents 评测:Agent Harness 能否用于生产?
  52. Pika Audio API 价格:SFX 真的便宜 20 倍吗?
  53. Thunder Compute 获 1300 万美元融资:企业 GPU 虚拟化采购指南
  54. OpenViking 评测:面向 AI 智能体的文件系统式记忆
  55. LLM-as-a-Verifier 详解:架构、成本与生产适用性
  56. AirLLM 只用 4GB 显存跑超大模型?逐层推理原理与代价
  57. TrueForge 评测:开源 Agent Harness 是否达到生产要求?
  58. 智能体可读的网站:llms.txt、Markdown 镜像,以及会坏在哪里
  59. Qwen3.8-27B:自托管电脑操作智能体,截图不出内网
  60. 本地化 URL slug 与 hreflang:为什么我们保留一个英文 slug
  61. AI 智能体能用你的产品,还是只能读到它?
  62. Graft 评测 2026:智能体仓库地图该进 Git 吗?
  63. 通过工具输出压缩降低编码代理成本
  64. 用 AI 编码智能体更聪明地管理 Token
  65. DeepSeek Harness 评测:插件化 Agent 技术栈能否用于生产?
  66. Netflix 的 vLLM 与 Triton 推理栈:7 个生产经验
  67. OpenSandbox 评测:自托管是否值得?
  68. Transformers.js 浏览器本地 AI:什么时候适合放进产品
  69. Cloudflare Kitesurf 评测:成本、限制与生产适用性
  70. GitHub Spec Kit 评测:这套流程值得吗?
  71. 企业内部 AI 智能体市场:2026 架构与落地指南
  72. LiteLLM 生产级自托管指南:2026 架构与安全
  73. AI 就绪企业 Wiki:架构与实施指南
  74. Linux 是 AI 智能体的最佳操作系统吗?2026 基础设施指南
  75. Claude 会给文本加水印吗?2026 API 实战解读
  76. OpenKB 评测:知识编译器 vs RAG
  77. Unsloth Desktop 评测:私有本地 AI 工作站?
  78. NeMo Switchyard 0.2:无需训练的智能体模型路由?
  79. Firecrawl AnyDoc 评测:14 种格式转 Markdown
  80. MCP Cloud 对比 Manufact Cloud:MCP 托管指南
  81. Muse Glimmer 30B:Meta 本地智能体模型能否用于生产?
  82. 如何用 Agent Skills 让 AI 写作更自然
  83. NVIDIA NOOA 评测:面向对象智能体适合生产环境吗?
  84. OmniRoute AI 路由:配置指南与生产检查清单
  85. Strix AI 渗透测试:2026 年 30 天试点与采购指南
  86. Hyperagent 评测:无需自建服务器的云端 AI 智能体
  87. Gemini Robotics 2:全身控制与试点决策
  88. Hark Handoff 评测:真正会点击网页的智能体
  89. Meta Muse Code 定价:Contributor 能用于客户代码吗?
  90. pdf-inspector 评测:先本地解析 PDF,再调用 OCR
  91. LLM 提示词发送前的 PII 脱敏:实用流水线
  92. Agent Reach 评测:真实成本、安全边界与生产适用性
  93. Cloudflare Wallets AI 智能体钱包:哪些功能已上线?
  94. 本地多模态 AI 编程助手:语音、OCR 与隐私架构
  95. 一台 AI PC 本地运行 DeepSeek V4 Flash 0731,现实效果如何?
  96. YC QM Agent 评测:Quartermaster 能用于工作吗?
  97. jcode 对比 Claude Code:值得切换到 Rust 智能体框架吗?
  98. Lightpanda AI 智能体浏览器:生产评测与迁移指南
  99. AI 智能体的图工程:知识图谱什么时候值得做?
  100. 多模型 AI 编程智能体技术栈:团队采购指南
  101. MCP 现在无状态了吗?服务器迁移清单
  102. MCP 不是安全边界:如何保护智能体访问的数据
  103. 用 Unsloth 和 Colab 免费微调 Gemma 4
  104. AI 智能体如何互相通信?Band 配置与选型指南
  105. Taalas HC1 评测:硬编码 LLM ASIC 值得买吗?
  106. 软件开发机构技术实测 LeanCTX:集成、数据与局限
  107. 你的硬件能运行哪个本地 LLM?llmfit 使用指南
  108. 用 CLIProxyAPI 在 Claude Code 中运行 GPT-5.6 Sol
  109. Miso TTS 本地部署对比 API:成本、延迟与显存真相
  110. 企业级 MCP 授权架构:多租户参考设计
  111. 把 RAG 向量压缩到 2-bit:数据无关量化能上生产了吗?
  112. LMCache 报告共享 KV 缓存让平均 TTFT 降低 13.7 倍
  113. LLM 权重无损压缩 vs 8-bit GGUF:哪些已具备生产条件?
  114. OpenAI 评测沙箱逃逸:测试网络安全 Agent 前的 12 项控制
  115. Cisco Antares 评测:用于漏洞定位的 1B 本地 AI
  116. Meterless 评测 2026:AI 智能体上下文层能否用于生产?
  117. NVIDIA Nemotron 3.5 ASR:免费自托管 STT 能否用于语音智能体?
  118. Claude Code vs OpenCode:2026 年团队用哪个更省钱?
  119. Kimi K3 企业评测:API 价格、数据合规与试点清单
  120. Mesh LLM 评测:一个大模型能否跨多台电脑运行?
  121. Graphify 2026 评测:代码库知识图谱值得引入吗?
  122. Bonsai 27B 评测:270 亿参数 LLM 真的能在手机上运行吗?
  123. AI 试点终止或扩展评分卡:运行 30 天后检查的 12 项指标
  124. Soofi S:德国主权大模型准备好商用了吗?
  125. T3MP3ST 2026 评测:它能取代渗透测试吗?
  126. Colibri 让消费级硬件跑起 GLM-5.2,代价是什么?
  127. Open Knowledge Format(OKF):企业实施指南
  128. AI Agent Cost per Action:为什么 agentic 工作流会推高 token 账单
  129. 本地模型什么时候胜过 API:欧盟企业盈亏平衡计算器
  130. 2026 年 LLM 成本计算器:算任务,不算 Token
  131. Pxpipe 评测:图像能把 Claude Code 成本降低 60% 吗?
  132. 每 token 更便宜,每任务仍可能更贵
  133. 如何在 Claude Code 中使用 Claude Fable 5.1
  134. Anthropic 不主张禁止开放权重。成本之争依然真实。
  135. 2026 年 DACH 地区的内部 AI 助手到底要花多少钱
  136. 2026 年 LLM 网关对比:LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  137. 在欧盟自托管 LLM:开放权重模型何时才真正划算
  138. 2026 最佳开放权重 LLM:DeepSeek、Qwen、Kimi、GLM 与 Llama
  139. 瓶颈从来不是智能,而是上下文。
  140. DACH 企业怎么选:ChatGPT Enterprise vs Copilot vs 自建 RAG
  141. MCP、RAG、Agent Skills 与 Custom GPTs 怎么选?
  142. 如何在 2026 年降低 LLM Token 成本
  143. 30/60/90 天 AI 智能体试点:上线计划
  144. 面向 SharePoint、Confluence、Drive 的权限优先 RAG
  145. 面向欧盟企业的 RAG 生产就绪清单
  146. 什么时候值得构建一套 LLM 评测?成本、ROI 与信任裁判
  147. AI 代理项目为什么会被取消
  148. 2026:RAG vs Fine-Tuning vs Long-Context
  149. 2026 LLM API 成本:架构要变