集群

模型与基础设施

模型选择、推理经济性、本地部署、压缩与服务架构。

27
01

从核心文章开始

02

本集合最新内容

DeepSeek V4 Flash 0731 模型权重装入 GB10、Strix Halo 与 Gorgon Halo 统一内存 AI 与智能体

一台 AI PC 本地运行 DeepSeek V4 Flash 0731,现实效果如何?

一台 GB10、Strix Halo 或 Gorgon Halo 设备能否运行 DeepSeek V4 Flash 0731?本文从内存、量化、隐私、可观测性与生产就绪度给出采购判断。

Gemma 4 模型在浏览器 Notebook 中通过 Unsloth 微调流程 AI 与智能体

用 Unsloth 和 Colab 免费微调 Gemma 4

免费的浏览器实验确实可行。本指南给出完整流程,也讲清宣传没有覆盖的限制,以及模型进入生产前还缺什么。

固化的 LLM 权重阵列与推理 ASIC AI 与智能体

Taalas HC1 评测:硬编码 LLM ASIC 值得买吗?

Taalas 宣称把 Llama 3.1 8B 固化进芯片后达到每秒 17,000 token。本文拆解基准、商业适用性、模型锁定和采购前必须验证的问题。

将硬件内存容量与本地 LLM 模型大小进行匹配 AI 与智能体

你的硬件能运行哪个本地 LLM?llmfit 使用指南

llmfit 能在下载模型前按硬件条件给出排序。本指南解释适配度、速度、质量、上下文、MoE 与量化,并说明上线前还必须完成哪些验证。

一条语音波形分向托管的 Miso TTS API 与私有自托管 GPU AI 与智能体

Miso TTS 本地部署对比 API:成本、延迟与显存真相

Miso TTS 富有表现力且开放权重,但 110 ms 指托管在 H100 上的 API,并非本地推理。部署前应比较硬件、价格、许可证与生产风险。

数据无关的向量量化把稠密的 float32 embedding 场压缩成紧凑的 2-bit 桶格,内存缩小 16 倍 AI 与智能体

把 RAG 向量内存压到 1/16:数据无关量化能上生产了吗?

一个新的 Rust 索引用 Google 免训练的 TurboQuant 把 1000 万 embedding 从 31 GB 压到 4 GB。方法证明了什么、在哪胜过 FAISS、recall 的取舍,以及如何试点。

03

完整文章目录

  1. 一台 AI PC 本地运行 DeepSeek V4 Flash 0731,现实效果如何?
  2. 用 Unsloth 和 Colab 免费微调 Gemma 4
  3. Taalas HC1 评测:硬编码 LLM ASIC 值得买吗?
  4. 你的硬件能运行哪个本地 LLM?llmfit 使用指南
  5. Miso TTS 本地部署对比 API:成本、延迟与显存真相
  6. 把 RAG 向量内存压到 1/16:数据无关量化能上生产了吗?
  7. 共享 KV 缓存在不新增 GPU 的情况下把 LLM 推理延迟降低 14x
  8. LLM 权重无损压缩 vs 8-bit GGUF:哪些已具备生产条件?
  9. Cisco Antares 评测:不上云的本地漏洞定位
  10. NVIDIA Nemotron 3.5 ASR:免费自托管 STT 能否用于语音智能体?
  11. Kimi K3 企业评测:API 价格、数据合规与试点清单
  12. Mesh LLM 评测:一个大模型能否跨多台电脑运行?
  13. Bonsai 27B 评测:270 亿参数 LLM 真的能在手机上运行吗?
  14. Soofi S:德国主权大模型准备好商用了吗?
  15. Colibri 让消费级硬件跑起 GLM-5.2,代价是什么?
  16. 本地模型什么时候胜过 API:欧盟企业盈亏平衡计算器
  17. 2026 年 LLM 成本计算器:算任务,不算 Token
  18. 把提示词渲染成图像,把 LLM 成本砍掉 60%:天才还是荒诞?
  19. 每 token 更便宜。每个答案更贵。
  20. Dario 向开源宣战。真正的战争,是关于你那张 AI 账单。
  21. 2026 年 LLM 网关对比:LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  22. 在欧盟自托管 LLM:开放权重模型何时才真正划算
  23. 2026 开放权重 LLM 对决:DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  24. 如何在 2026 年降低 LLM Token 成本
  25. 什么时候值得构建一套 LLM 评测?成本、ROI 与信任裁判
  26. 2026:RAG vs Fine-Tuning vs Long-Context
  27. 2026 LLM API 成本:架构要变