集群

模型与基础设施

模型选择、推理经济性、本地部署、压缩与服务架构。

博客文章
67
主题
AI 与智能体

从核心文章开始

只收重要内容

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

本集合最新内容

层叠的上下文卡片,表示智能体可编辑的工作集 AI 与智能体

Context Language Models 与上下文压缩:应该如何试点?

智能体应该自行编辑上下文吗?比较 CLM 与上下文压缩,核查实际运行框架和许可,并测试关键事实丢失、缓存残留与恢复能力。

Wavect 关于使用 LiteLLM Lens 分析智能体运行记录的示意图 AI 与智能体

LiteLLM Lens:用 SQL 与 API 分析智能体 Trace

从查看单次运行转向调查重复问题:理解 LiteLLM Lens、ClickHouse SQL、安全 API 访问,以及从证据到回归测试的完整路径。

SmythOS Studio 自托管:可视化工作流、自有基础设施与运行时边界 AI 与智能体

SmythOS Studio 自托管指南:Docker、成本与部署边界

在自己的基础设施上运行采用 MIT 许可证的可视化智能体构建器。基于源码梳理 Docker 安装、实际成本,以及从本地演示走向公开服务所需的检查。

DeerFlow 智能体执行框架中相互连接的上下文、沙箱与工作流层 AI 与智能体

DeerFlow 2.0:Docker 部署、沙箱与记忆机制

不止于发布介绍:配置 DeerFlow Docker 环境,理解共享沙箱,排查记忆问题,并为生产部署建立验收标准。

状态与动作的独立路径汇入对比排序步骤 AI 与智能体

CLM-8B 自托管:vLLM、动作缓存与验证器

基于源码的 CLM-8B 部署指南:小型投影头背后的完整编码器、候选复用、私有 API,以及验证器成绩的适用边界。

用于说明决策校准的抽象选项分数条,不代表实测基准数据 AI 与智能体

AnyJev:LLM 概率校准与选项顺序偏差

深入分析 AnyJev:稳定答案为何不等于校准概率,0.2.0 改变了什么,以及如何用保留数据验证真实路由任务。

完整文章目录

  1. Context Language Models 与上下文压缩:应该如何试点?
  2. LiteLLM Lens:用 SQL 与 API 分析智能体 Trace
  3. SmythOS Studio 自托管指南:Docker、成本与部署边界
  4. DeerFlow 2.0:Docker 部署、沙箱与记忆机制
  5. CLM-8B 自托管:vLLM、动作缓存与验证器
  6. AnyJev:LLM 概率校准与选项顺序偏差
  7. LiteAgents SDK:逐轮模型路由、安装与迁移指南
  8. mcp-memory-service:让 Claude Code 与 Cursor 共享持久记忆
  9. Claude Opus 5.5 使用指南:适用场景、提示词与思考强度
  10. Laya 与 Jev 的企业应用:6 个实用工作流
  11. Laya vs Jev:基准结果与 AI 创业护城河
  12. Jev AI 评测:面向智能体工作流的决策模型
  13. SwarmLLM 评测 2026:手机与笔记本协同浏览器 LLM 推理
  14. Phonely Alma 评测:这款语音 LLM 能否用于生产?
  15. Utopia 企业评估:双时态知识图谱与历史问答
  16. NVIDIA PAIR 评测:本地 AI 路由与 AMD 支持缺口
  17. Tencent Hy4 Preview 评测:百万 Token 上下文值得试点吗?
  18. PageLM 评估:自托管与商业使用
  19. M6 Mac mini 对比 M5 Mac Studio:本地 AI 选购指南
  20. FreeToken AI 评测:消费级 GPU 能跑前沿 MoE 大模型吗?
  21. Darkbloom AI 评测:用闲置 Mac 提供私有推理
  22. Ox Alpha 已揭晓为 GLM-5.3-Flash:变化解读
  23. Pika Audio API 价格:SFX 真的便宜 20 倍吗?
  24. Thunder Compute 获 1300 万美元融资:企业 GPU 虚拟化采购指南
  25. AirLLM 只用 4GB 显存跑超大模型?逐层推理原理与代价
  26. Qwen3.8-27B:自托管电脑操作智能体,截图不出内网
  27. Netflix 的 vLLM 与 Triton 推理栈:7 个生产经验
  28. Transformers.js 浏览器本地 AI:什么时候适合放进产品
  29. LiteLLM 生产级自托管指南:2026 架构与安全
  30. AI 就绪企业 Wiki:架构与实施指南
  31. Claude 会给文本加水印吗?2026 API 实战解读
  32. OpenKB 评测:知识编译器 vs RAG
  33. Unsloth Desktop 评测:私有本地 AI 工作站?
  34. NeMo Switchyard 0.2:无需训练的智能体模型路由?
  35. Firecrawl AnyDoc 评测:14 种格式转 Markdown
  36. Muse Glimmer 30B:Meta 本地智能体模型能否用于生产?
  37. OmniRoute AI 路由:配置指南与生产检查清单
  38. Gemini Robotics 2:全身控制与试点决策
  39. pdf-inspector 评测:先本地解析 PDF,再调用 OCR
  40. 本地多模态 AI 编程助手:语音、OCR 与隐私架构
  41. 一台 AI PC 本地运行 DeepSeek V4 Flash 0731,现实效果如何?
  42. 用 Unsloth 和 Colab 免费微调 Gemma 4
  43. Taalas HC1 评测:硬编码 LLM ASIC 值得买吗?
  44. 你的硬件能运行哪个本地 LLM?llmfit 使用指南
  45. Miso TTS 本地部署对比 API:成本、延迟与显存真相
  46. 把 RAG 向量压缩到 2-bit:数据无关量化能上生产了吗?
  47. LMCache 报告共享 KV 缓存让平均 TTFT 降低 13.7 倍
  48. LLM 权重无损压缩 vs 8-bit GGUF:哪些已具备生产条件?
  49. Cisco Antares 评测:用于漏洞定位的 1B 本地 AI
  50. NVIDIA Nemotron 3.5 ASR:免费自托管 STT 能否用于语音智能体?
  51. Kimi K3 企业评测:API 价格、数据合规与试点清单
  52. Mesh LLM 评测:一个大模型能否跨多台电脑运行?
  53. Bonsai 27B 评测:270 亿参数 LLM 真的能在手机上运行吗?
  54. Soofi S:德国主权大模型准备好商用了吗?
  55. Colibri 让消费级硬件跑起 GLM-5.2,代价是什么?
  56. 本地模型什么时候胜过 API:欧盟企业盈亏平衡计算器
  57. 2026 年 LLM 成本计算器:算任务,不算 Token
  58. Pxpipe 评测:图像能把 Claude Code 成本降低 60% 吗?
  59. 每 token 更便宜,每任务仍可能更贵
  60. Anthropic 不主张禁止开放权重。成本之争依然真实。
  61. 2026 年 LLM 网关对比:LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  62. 在欧盟自托管 LLM:开放权重模型何时才真正划算
  63. 2026 最佳开放权重 LLM:DeepSeek、Qwen、Kimi、GLM 与 Llama
  64. 如何在 2026 年降低 LLM Token 成本
  65. 什么时候值得构建一套 LLM 评测?成本、ROI 与信任裁判
  66. 2026:RAG vs Fine-Tuning vs Long-Context
  67. 2026 LLM API 成本:架构要变