模型与基础设施
模型选择、推理经济性、本地部署、压缩与服务架构。
2701
从核心文章开始
02
本集合最新内容
一台 AI PC 本地运行 DeepSeek V4 Flash 0731,现实效果如何?
一台 GB10、Strix Halo 或 Gorgon Halo 设备能否运行 DeepSeek V4 Flash 0731?本文从内存、量化、隐私、可观测性与生产就绪度给出采购判断。
用 Unsloth 和 Colab 免费微调 Gemma 4
免费的浏览器实验确实可行。本指南给出完整流程,也讲清宣传没有覆盖的限制,以及模型进入生产前还缺什么。
Taalas HC1 评测:硬编码 LLM ASIC 值得买吗?
Taalas 宣称把 Llama 3.1 8B 固化进芯片后达到每秒 17,000 token。本文拆解基准、商业适用性、模型锁定和采购前必须验证的问题。
你的硬件能运行哪个本地 LLM?llmfit 使用指南
llmfit 能在下载模型前按硬件条件给出排序。本指南解释适配度、速度、质量、上下文、MoE 与量化,并说明上线前还必须完成哪些验证。
Miso TTS 本地部署对比 API:成本、延迟与显存真相
Miso TTS 富有表现力且开放权重,但 110 ms 指托管在 H100 上的 API,并非本地推理。部署前应比较硬件、价格、许可证与生产风险。
把 RAG 向量内存压到 1/16:数据无关量化能上生产了吗?
一个新的 Rust 索引用 Google 免训练的 TurboQuant 把 1000 万 embedding 从 31 GB 压到 4 GB。方法证明了什么、在哪胜过 FAISS、recall 的取舍,以及如何试点。
03
完整文章目录
- 一台 AI PC 本地运行 DeepSeek V4 Flash 0731,现实效果如何?
- 用 Unsloth 和 Colab 免费微调 Gemma 4
- Taalas HC1 评测:硬编码 LLM ASIC 值得买吗?
- 你的硬件能运行哪个本地 LLM?llmfit 使用指南
- Miso TTS 本地部署对比 API:成本、延迟与显存真相
- 把 RAG 向量内存压到 1/16:数据无关量化能上生产了吗?
- 共享 KV 缓存在不新增 GPU 的情况下把 LLM 推理延迟降低 14x
- LLM 权重无损压缩 vs 8-bit GGUF:哪些已具备生产条件?
- Cisco Antares 评测:不上云的本地漏洞定位
- NVIDIA Nemotron 3.5 ASR:免费自托管 STT 能否用于语音智能体?
- Kimi K3 企业评测:API 价格、数据合规与试点清单
- Mesh LLM 评测:一个大模型能否跨多台电脑运行?
- Bonsai 27B 评测:270 亿参数 LLM 真的能在手机上运行吗?
- Soofi S:德国主权大模型准备好商用了吗?
- Colibri 让消费级硬件跑起 GLM-5.2,代价是什么?
- 本地模型什么时候胜过 API:欧盟企业盈亏平衡计算器
- 2026 年 LLM 成本计算器:算任务,不算 Token
- 把提示词渲染成图像,把 LLM 成本砍掉 60%:天才还是荒诞?
- 每 token 更便宜。每个答案更贵。
- Dario 向开源宣战。真正的战争,是关于你那张 AI 账单。
- 2026 年 LLM 网关对比:LiteLLM vs OpenRouter vs Portkey vs RouteLLM
- 在欧盟自托管 LLM:开放权重模型何时才真正划算
- 2026 开放权重 LLM 对决:DeepSeek vs Qwen vs Kimi vs GLM vs Llama
- 如何在 2026 年降低 LLM Token 成本
- 什么时候值得构建一套 LLM 评测?成本、ROI 与信任裁判
- 2026:RAG vs Fine-Tuning vs Long-Context
- 2026 LLM API 成本:架构要变