集群

模型与基础设施

模型选择、推理经济性、本地部署、压缩与服务架构。

博客文章
55
主题
AI 与智能体

从核心文章开始

只收重要内容

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

本集合最新内容

手机与笔记本在浏览器标签页中分担同一个大型语言模型,并通过 WebRTC 在设备之间传递中间激活 AI 与智能体

SwarmLLM 评测 2026:手机与笔记本协同浏览器 LLM 推理

面向技术买方的 SwarmLLM 评测:27B 浏览器推理、WebGPU/WebRTC、Benchmark 边界、Peer 信任、安全限制与 Pilot 方案。

电话语音波形经过 Alma 语音 LLM,进入生产评估计分卡 AI 与智能体

Phonely Alma 评测:这款语音 LLM 能否用于生产?

Alma 宣称 TTFT 为 182 ms、P99 为 206 ms,每百万混合 token 0.55 美元。本文核查证据边界,并给出买方生产试点方案。

分层的 Utopia 知识记录表示保留的历史版本 AI 与智能体

Utopia 企业评估:双时态知识图谱与历史问答

评估 Utopia 企业知识世界模型:区分有效时间与记录时间,核查来源、未知日期、自托管限制,并用十天试点验证历史问答、权限和恢复能力。

NVIDIA PAIR 在 RTX、Mac 与 AMD Strix Halo 节点之间路由本地 AI 智能体请求 AI 与智能体

NVIDIA PAIR 评测:本地 AI 路由与 AMD 支持缺口

PAIR 会在本地电脑之间路由独立的智能体请求,但不会合并 GPU。本文解析其架构、Strix Halo 缺口,以及 AMD 移植必须验证的内容。

Tencent Hy4 preview 通过编程智能体工具和验证关卡处理百万 Token 代码库 AI 与智能体

Tencent Hy4 Preview 评测:百万 Token 上下文值得试点吗?

面向采购决策的 Hy4 preview 评测,涵盖编程基准、WorkBuddy、API 成本、自托管硬件、已知限制和两周试点方案。

PageLM 文档学习平台:自托管、许可与数据流评估 AI 与智能体

PageLM 评估:自托管与商业使用

面向企业的 PageLM 来源审查:学习功能、数据去向、商业授权条件,以及可验证的培训试点。

完整文章目录

  1. SwarmLLM 评测 2026:手机与笔记本协同浏览器 LLM 推理
  2. Phonely Alma 评测:这款语音 LLM 能否用于生产?
  3. Utopia 企业评估:双时态知识图谱与历史问答
  4. NVIDIA PAIR 评测:本地 AI 路由与 AMD 支持缺口
  5. Tencent Hy4 Preview 评测:百万 Token 上下文值得试点吗?
  6. PageLM 评估:自托管与商业使用
  7. M6 Mac mini 对比 M5 Mac Studio:本地 AI 选购指南
  8. FreeToken AI 评测:消费级 GPU 能跑前沿 MoE 大模型吗?
  9. Darkbloom AI 评测:用闲置 Mac 提供私有推理
  10. Ox Alpha 已揭晓为 GLM-5.3-Flash:变化解读
  11. Pika Audio API 价格:SFX 真的便宜 20 倍吗?
  12. Thunder Compute 获 1300 万美元融资:企业 GPU 虚拟化采购指南
  13. AirLLM 只用 4GB 显存跑超大模型?逐层推理原理与代价
  14. Qwen3.8-27B:自托管电脑操作智能体,截图不出内网
  15. Netflix 的 vLLM 与 Triton 推理栈:7 个生产经验
  16. Transformers.js 浏览器本地 AI:什么时候适合放进产品
  17. LiteLLM 生产级自托管指南:2026 架构与安全
  18. AI 就绪企业 Wiki:架构与实施指南
  19. Claude 会给文本加水印吗?2026 API 实战解读
  20. OpenKB 评测:知识编译器 vs RAG
  21. Unsloth Desktop 评测:私有本地 AI 工作站?
  22. NeMo Switchyard 0.2:无需训练的智能体模型路由?
  23. Firecrawl AnyDoc 评测:14 种格式转 Markdown
  24. Muse Glimmer 30B:Meta 本地智能体模型能否用于生产?
  25. OmniRoute AI 路由:配置指南与生产检查清单
  26. Gemini Robotics 2:全身控制与试点决策
  27. pdf-inspector 评测:先本地解析 PDF,再调用 OCR
  28. 本地多模态 AI 编程助手:语音、OCR 与隐私架构
  29. 一台 AI PC 本地运行 DeepSeek V4 Flash 0731,现实效果如何?
  30. 用 Unsloth 和 Colab 免费微调 Gemma 4
  31. Taalas HC1 评测:硬编码 LLM ASIC 值得买吗?
  32. 你的硬件能运行哪个本地 LLM?llmfit 使用指南
  33. Miso TTS 本地部署对比 API:成本、延迟与显存真相
  34. 把 RAG 向量压缩到 2-bit:数据无关量化能上生产了吗?
  35. LMCache 报告共享 KV 缓存让平均 TTFT 降低 13.7 倍
  36. LLM 权重无损压缩 vs 8-bit GGUF:哪些已具备生产条件?
  37. Cisco Antares 评测:用于漏洞定位的 1B 本地 AI
  38. NVIDIA Nemotron 3.5 ASR:免费自托管 STT 能否用于语音智能体?
  39. Kimi K3 企业评测:API 价格、数据合规与试点清单
  40. Mesh LLM 评测:一个大模型能否跨多台电脑运行?
  41. Bonsai 27B 评测:270 亿参数 LLM 真的能在手机上运行吗?
  42. Soofi S:德国主权大模型准备好商用了吗?
  43. Colibri 让消费级硬件跑起 GLM-5.2,代价是什么?
  44. 本地模型什么时候胜过 API:欧盟企业盈亏平衡计算器
  45. 2026 年 LLM 成本计算器:算任务,不算 Token
  46. Pxpipe 评测:图像能把 Claude Code 成本降低 60% 吗?
  47. 每 token 更便宜,每任务仍可能更贵
  48. Anthropic 不主张禁止开放权重。成本之争依然真实。
  49. 2026 年 LLM 网关对比:LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  50. 在欧盟自托管 LLM:开放权重模型何时才真正划算
  51. 2026 最佳开放权重 LLM:DeepSeek、Qwen、Kimi、GLM 与 Llama
  52. 如何在 2026 年降低 LLM Token 成本
  53. 什么时候值得构建一套 LLM 评测?成本、ROI 与信任裁判
  54. 2026:RAG vs Fine-Tuning vs Long-Context
  55. 2026 LLM API 成本:架构要变