集群

模型与基础设施

模型选择、推理经济性、本地部署、压缩与服务架构。

博客文章
46
主题
AI 与智能体

从核心文章开始

本集合最新内容

通过 OpenCode Zen 与 OpenRouter 使用 Ox Alpha 免费隐身 AI 模型并检查隐私和成本 AI 与智能体

Ox Alpha Free:设置、隐私与团队采购指南

通过 OpenCode 或 OpenRouter 使用这款 1M 上下文隐身编程模型,并核对模型 ID、隐私条款、额外费用和安全试点方案。

Pika Audio 四种 API 模型对应音效、语音、音乐和视频同步声轨,并配有成本控制 AI 与智能体

Pika Audio API 价格:SFX 真的便宜 20 倍吗?

Pika 将 SFX 定价为每秒 0.0002 美元,还提供三种音频模型。切换前应先算清盈亏平衡点、API 限制、质量门槛和生产适配度。

多个 GPU 工作负载通过虚拟化层共享加速器资源池 AI 与智能体

Thunder Compute 获 1300 万美元融资:企业 GPU 虚拟化采购指南

Thunder Compute 希望用 GPU 资源池回收闲置算力。本文比较网络虚拟化、MIG、vGPU 与直通,并给出可量化的企业试点方案。

AirLLM 将单层模型权重从存储经内存流式送入小显存 GPU AI 与智能体

AirLLM 只用 4GB 显存跑超大模型?逐层推理原理与代价

AirLLM 通过逐层流式加载权重,让远大于 GPU 显存的模型能够执行。本文拆解显存数字背后的磁盘、延迟、量化与生产代价。

自托管屏幕智能体在单 GPU 部署中操作桌面界面 AI 与智能体

Qwen3.8-27B:自托管电脑操作智能体,截图不出内网

一个开放权重模型如今在桌面操作基准上领先。这对不能交给托管 API 的后台自动化意味着什么?

由 vLLM 与 NVIDIA Triton 组成的分层推理栈 AI 与智能体

Netflix 的 vLLM 与 Triton 推理栈:7 个生产经验

Netflix 因运维适配度选择 vLLM,真正的瓶颈却出现在约束解码、部署、模型加载与指标层。本文拆解哪些经验值得小团队复制,哪些能力更适合购买。

完整文章目录

  1. Ox Alpha Free:设置、隐私与团队采购指南
  2. Pika Audio API 价格:SFX 真的便宜 20 倍吗?
  3. Thunder Compute 获 1300 万美元融资:企业 GPU 虚拟化采购指南
  4. AirLLM 只用 4GB 显存跑超大模型?逐层推理原理与代价
  5. Qwen3.8-27B:自托管电脑操作智能体,截图不出内网
  6. Netflix 的 vLLM 与 Triton 推理栈:7 个生产经验
  7. Transformers.js 浏览器本地 AI:什么时候适合放进产品
  8. LiteLLM 生产级自托管指南:2026 架构与安全
  9. AI 就绪企业 Wiki:架构与实施指南
  10. Claude 会给文本加水印吗?2026 API 实战解读
  11. OpenKB 评测:知识编译器 vs RAG
  12. Unsloth Desktop 评测:私有本地 AI 工作站?
  13. NeMo Switchyard 0.2:无需训练的智能体模型路由?
  14. Firecrawl AnyDoc 评测:14 种格式转 Markdown
  15. Muse Glimmer 30B:Meta 本地智能体模型能否用于生产?
  16. OmniRoute AI 路由:配置指南与生产检查清单
  17. Gemini Robotics 2:全身控制与试点决策
  18. pdf-inspector 评测:先本地解析 PDF,再调用 OCR
  19. 本地多模态 AI 编程助手:语音、OCR 与隐私架构
  20. 一台 AI PC 本地运行 DeepSeek V4 Flash 0731,现实效果如何?
  21. 用 Unsloth 和 Colab 免费微调 Gemma 4
  22. Taalas HC1 评测:硬编码 LLM ASIC 值得买吗?
  23. 你的硬件能运行哪个本地 LLM?llmfit 使用指南
  24. Miso TTS 本地部署对比 API:成本、延迟与显存真相
  25. 把 RAG 向量内存压到 1/16:数据无关量化能上生产了吗?
  26. 共享 KV 缓存在不新增 GPU 的情况下把 LLM 推理延迟降低 14x
  27. LLM 权重无损压缩 vs 8-bit GGUF:哪些已具备生产条件?
  28. Cisco Antares 评测:用于漏洞定位的 1B 本地 AI
  29. NVIDIA Nemotron 3.5 ASR:免费自托管 STT 能否用于语音智能体?
  30. Kimi K3 企业评测:API 价格、数据合规与试点清单
  31. Mesh LLM 评测:一个大模型能否跨多台电脑运行?
  32. Bonsai 27B 评测:270 亿参数 LLM 真的能在手机上运行吗?
  33. Soofi S:德国主权大模型准备好商用了吗?
  34. Colibri 让消费级硬件跑起 GLM-5.2,代价是什么?
  35. 本地模型什么时候胜过 API:欧盟企业盈亏平衡计算器
  36. 2026 年 LLM 成本计算器:算任务,不算 Token
  37. Pxpipe 评测:图像能把 Claude Code 成本降低 60% 吗?
  38. 每 token 更便宜。每个答案更贵。
  39. Dario 向开源宣战。真正的战争,是关于你那张 AI 账单。
  40. 2026 年 LLM 网关对比:LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  41. 在欧盟自托管 LLM:开放权重模型何时才真正划算
  42. 2026 最佳开放权重 LLM:DeepSeek、Qwen、Kimi、GLM 与 Llama
  43. 如何在 2026 年降低 LLM Token 成本
  44. 什么时候值得构建一套 LLM 评测?成本、ROI 与信任裁判
  45. 2026:RAG vs Fine-Tuning vs Long-Context
  46. 2026 LLM API 成本:架构要变