---
title: "Colibri：消费级硬件运行 GLM-5.2"
canonical: https://wavect.io/zh/blog/colibri-glm-5-2-consumer-hardware/
language: zh
description: "Colibri 如何用 25 GB RAM 运行 GLM-5.2：专家流式加载、真实速度、SSD 损耗、RAM 与 NVMe 瓶颈、GPU 边界、模型支持和适用场景。"
image: "https://wavect.io/img/general/bak/open_graph_preview.jpg"
---

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

18 min 阅读 · 2026年7月14日 最近审核 2026年8月7日

[**下一篇**](/zh/blog/future-of-enterprise-software/)

# Colibri 让消费级硬件跑起 GLM-5.2，代价是什么？

要点速览

Colibri 的确能用约 25 GB RAM 执行 GLM-5.2，但速度只有 0.05-0.1 token/s。项目现已支持 GLM-5.2、Inkling、Kimi K3、DeepSeek V4 Flash 与 OLMoE。六张 RTX 5090 在完整驻留下达到 5.8-6.8 tok/s，选择性 NUMA 实验报告 9.02-9.17 tok/s。文本 API 已支持 OpenAI tools、Anthropic Messages、streaming 和有限 queue，但仍一次只执行一个 generation，也不支持多模态输入。Colibri 适合研究与评估，不是常规生产服务。

相关服务: [AI 赋能](/zh/services/ai-enablement/)

**Colibri 确实能在约 25 GB RAM 的机器上执行 GLM-5.2。**但这台机器不会因此变成“本地 Claude”。开发者实测的冷缓存速度只有 **0.05-0.1 token/s**，也就是每 10-20 秒生成一个 token，而且还没算 prompt 处理。100 个 token 的短回答大约要 17-33 分钟。

技术成果本身是真的。 [Colibri](https://github.com/JustVugg/colibri) 让一台根本无法在 RAM 或 VRAM 中容纳完整模型的电脑，执行一个 7440 亿参数的 Mixture-of-Experts 模型。它把 NVMe、系统内存和可选的显存当成同一套分层内存。代价很直接：磁盘提供容量，读取延迟由每个 token 支付。

本文于 **2026 年 8 月 7 日**重新核查。Colibri 现已覆盖五个模型家族，扩展了文本 API，并公布了新的多 GPU 测量；本文继续把实测结果和估算分开。

| 说法 | 事实 | 意义 |
| --- | --- | --- |
| 25 GB RAM 跑 GLM-5.2 | 开发者已测 | 能执行，但冷缓存只有 0.05-0.1 tok/s。 |
| 模型大小 | 总计 744B，每 token 约 40B 激活 | MoE 稀疏性让专家流式加载成为可能。 |
| 磁盘占用 | Colibri int4 容器约 370 GB | 专用 1 TB NVMe 是合理下限建议，不是代码硬要求。 |
| 常驻权重 | 约 9.9 GB 稠密权重在 RAM | 剩余内存用于缓存与运行余量。 |
| 冷缓存读取 | 每个输出 token 约 11 GB | 小内存机器受 I/O 和 cache miss 主导。 |
| 是否需要 GPU | 不需要，CUDA 与 Metal 可选 | 只有 GPU 层消除当前瓶颈时才有帮助。 |
| 生产可用 | 不属于常规生产服务 | 单序列执行、项目年轻、质量证据不完整。 |

## Colibri 到底是什么？

Colibri（项目写作 *Colibrì*）是一个主要用 C 编写的推理 runtime，目标是在存储、RAM 和可选 VRAM 之间运行超大型稀疏 MoE。上游现已提供面向 **GLM-5.2、Inkling、Kimi K3、DeepSeek V4 Flash 和 OLMoE** 的专用 engine。它已不只是最初的 GLM demo，但仍不是任意 GGUF 的通用 loader。项目包含 CLI、本地 Web UI、converter、benchmark、OpenAI 与 Anthropic 兼容文本 API，以及 CPU、CUDA 和 Metal 路径。

Colibri runtime 使用 Apache 2.0； [GLM-5.2 权重使用 MIT](https://huggingface.co/zai-org/GLM-5.2) ，商业使用相对宽松。但准确说，GLM-5.2 是 **open-weight**：公开权重和许可证不等于训练数据与完整训练过程可复现。

Colibri 并没有把整个模型压进 25 GB。完整 int4 checkpoint 仍在磁盘上；总会用到的部分留在内存，router 选中的专家按需读取。这一差别就是整个项目的核心。

## 为什么选择 GLM-5.2？

Z.ai 把 GLM-5.2 描述为 744B-A40B：总参数约 7440 亿，每 token 激活约 400 亿。官方声称 100 万 token context、Terminal-Bench 2.1 得分 81.0、SWE-bench Pro 得分 62.1；这些是厂商数据，不是中立证明。 [Artificial Analysis 在发布时把 GLM-5.2 排为其 open-weight Intelligence Index 第一](https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index/) ，所以称它为 frontier-class open weight 有依据，但不代表每个 workload 都胜过闭源模型。

不能把托管版或全精度 benchmark 直接套到 Colibri int4。Colibri 首次小规模质量测试在 HellaSwag、ARC、MMLU 每项仅 40 题时得到 62.5% mean normalized accuracy。样本太小，评估方法不适合理模型，也没有干净的 full precision 对 int4 A/B。**Colibri 对“能够执行”的证明远强于对“质量保持”的证明。**

## 744B 模型如何在 25 GB RAM 中执行？

1. **稠密层常驻：** attention、embedding、shared expert 等每次都会用到的 int4 权重约占 9.9 GB。
2. **路由专家留在 NVMe：** MoE 层和 MTP head 合计 21,504 个专家 block，每个约 19 MB。
3. **逐 token 路由：** GLM-5.2 在每个 MoE 层为当前 token 选择八个专家。
4. **缓存命中复用：** 逐层 LRU、学习得到的 pinned hot store、操作系统 page cache 与可选 VRAM 保存热门专家。
5. **尽量重叠：** 在常驻专家计算时 prefetch 冷专家，然后汇总结果。

冷缓存数学正好解释速度：75 个 MoE 层 × 8 个专家 × 约 19 MB，等于**每 token 约读取 11.4 GB 专家数据**。开发者约 1 GB/s 的存储路径仅磁盘就要 11 秒，理论上限约 0.09 tok/s，与 0.05-0.1 tok/s 实测吻合。

## 真实速度有多快？

下表来自项目社区数据，我们没有复测。100 token 时间按 `100 / tok_s` 换算，不含 prompt prefill、排队和隐藏推理。

| 硬件与配置 | 速度 | 100 token | 如何理解 |
| --- | --- | --- | --- |
| 25 GB RAM，约 1 GB/s NVMe，WSL2 | 0.05-0.1 tok/s | 16.7-33.3 分钟 | 证明能跑，不是可用聊天。 |
| i5-12600K，32 GB，Windows | 0.08 tok/s | 20.8 分钟 | 普通硬件没有解决缓存问题。 |
| M4 Pro，48 GB，Metal | 0.30 tok/s | 5.6 分钟 | 更快，仍不交互。 |
| M5 Max，128 GB，46.9 GB pin，pre-rebase Metal | 2.06 tok/s | 49 秒 | 耐心单用户可能接受。 |
| Ryzen 9950X3D2，121 GB，Gen5，RTX 5090 | 1.23 tok/s | 81 秒 | 高端消费硬件且仔细调优。 |
| 251 GiB 主机，六张 RTX 5090，专家全驻留 | 6.00 tok/s | 17 秒 | 无磁盘 miss，但已不是普通消费 PC。 |

长 prompt 或冷缓存的首 token 时间可能更差。六张 5090 的结果不能推导出一张游戏卡有 6 tok/s。项目对单张 RTX 5090 的干净重测接近零收益，因为 CPU 已能追平专家矩阵乘，瓶颈仍是存储。常见对话目标是 20-30 tok/s；Colibri 已发布的最好单请求结果仍低于这一范围。

## 真正决定性能的因素

### 1. RAM 与缓存命中率

24-32 GB 中，稠密权重、KV、scratch 和系统占用后几乎没有专家缓存。一个 24 GB 测试即使 direct read 达 2.74 GB/s，命中率也只有 3-4%，速度 0.07 tok/s。128 GB 则能 pin 数十 GB 的 workload 热门专家。重复工作负载比随机提问收益更大；代码任务学到的热专家未必适合法律研究。

### 2. 真实随机读取，而非包装盒数字

Colibri 在 370 GB 中并行读取分散的约 19 MB block。应该运行项目的 direct-I/O `iobench` 冷 shard，而不是引用 SSD 最大顺序读。同一 Ryzen 从 1.51 GB/s Gen3 QLC 换到 8.81 GB/s Gen5 后，生成速度只从 0.10 提升到 0.28 tok/s：磁盘快 5.8 倍，token 只快 2.9 倍，因为瓶颈转向 matrix multiplication。

### 3. CPU、内存带宽与推测解码

缓存命中后，瓶颈变成量化矩阵乘和 RAM 带宽。正确的 int8 MTP 文件获得 39-59% draft acceptance、每 forward 2.2-2.8 token；旧 int4 mirror 几乎没有接受。冷缓存下推测甚至可能更慢，因为每 token 的专家加载从约 660 增到 1,100。`--topp 0.7` 能减少读取，但它有损地限制 router，必须重新做质量 eval。

## Colibri 会磨损 SSD 吗？

**正常推理几乎不应消耗 SSD 的 TBW。**每 token 约 11 GB 指读取，不是写入。NAND 耐久按 program/erase 写入衡量； [Micron 的耐久文档认为读取造成的磨损可忽略](https://www.micron.com/content/dam/micron/global/public/products/white-paper/5210-ssd-vs-hdd-endurance-white-paper.pdf) 。Colibri 专家流也是 read-only。

- **初次安装会集中写入：** 预转换模型下载约写 370 GB；从 756 GB FP8 转换时，下载、临时 shard 和输出合计会超过 1 TB host writes。
- **swap 才是耐久陷阱：** RAM 不足导致持续换页写入，同时性能崩溃。
- **KV 持久化有少量写入：** 约 182 KB/token，加上 usage history。
- **持续读取会发热：** [Samsung 记录了高负载 thermal throttling](https://org-ap-publish.semiconductor.samsung.com/us/consumer-storage/support/faqs/internalssd-product-information/) 。需要散热片、风道、SMART 温度和 swap 监控。

带散热和足够空闲空间的专用 1 TB 本地 NVMe，比把 370 GB 模型塞进装有系统的 500 GB 盘更稳妥。RAID 0 能提高带宽，也增加任一盘故障导致本地副本丢失的概率，只应保存可重新下载的模型。

## 加 GPU 就会快吗？

有时。Colibri 可以把热专家放在 NVIDIA VRAM、用 CUDA 跑稠密计算，并在 Apple Silicon 使用 Metal。但单张 16-32 GB GPU 只能装下 370 GB 中很小一部分。只有 hot tier 命中率高且 CPU 专家计算是瓶颈时才有效；若磁盘占主导，帮助很小。当前多 GPU 采用独立 device context 与经 host 的同步复制，没有 P2P/NCCL、expert sharding 或成熟 Tensor Core 库。**在 profiling 证明瓶颈是专家矩阵乘之前，不要为了 Colibri 购买 GPU。**

## 能否运行 DeepSeek、Qwen、Kimi 等模型？

**可以，但前提是该模型家族已有经过验证的 engine。** 上游现在除 GLM-5.2、Inkling 和 OLMoE 外，还支持 Kimi K3 与 DeepSeek V4 Flash。它不是直接切换模型：attention、router、tokenizer、tensor layout、chat template 与 converter 都需按架构实现和验证。

第三方 [Colibri-Hy3](https://github.com/ErikTromp/colibri-hy3) 把思路移植到腾讯 295B、21B active 的 Hy3，新增 GQA、router 和 converter，并流式执行约 142 GB int4。它同时证明设计可移植，也证明支持新模型绝不是改一个名称。稠密模型每 token 几乎需要所有参数，收益会小很多。

## 100 万 token context 现实吗？

GLM-5.2 官方支持 100 万 token，不代表 25 GB 机器实用。Colibri server 默认 context 是 4,096；压缩 KV 持久化约 182 KB/token。100 万 token 仅 KV 就约 182 GB，还没算模型、scratch 与专家缓存。“模型支持”与“这台机器能在预算内服务”是两种结论。

Colibri 使用有损 int4 权重，这与精确保留 BF16 是不同决策。我们的 [LLM 权重无损压缩 vs Q8 GGUF 指南](/zh/blog/lossless-llm-weight-compression-production/) 解释逐 bit 精确方案、最新 GLM-5.2 证据，以及压缩 runtime 进入生产前仍需通过的 gate。

## OpenAI-compatible API 生产可用吗？

它适合接入测试，现在支持 model discovery、chat 与 legacy completions、SSE streaming、OpenAI tools、Anthropic Messages endpoint、OpenAI 路径的 custom stops、有限 admission queue、health counter，以及 host 与 CORS allowlist。它不等同于生产 vLLM 或 SGLang。API 仍只有文本，不支持图片、音频、logprobs 和 token penalties。引擎一次只执行一个 generation，所以请求仍会排队；最多 16 个 KV slot 能隔离对话状态，但不是 continuous batching。

个人实验足够，客户系统则需要 load test、隔离、rate limit、可观测性、安全审查、故障恢复、模型 checksum、更新策略、eval gate 与 API fallback。我们的 [本地模型与 API 盈亏平衡框架](/zh/blog/local-models-vs-apis-break-even-eu-2026/) 覆盖运维成本；Colibri 的单序列吞吐让商业门槛尤其高。

## 谁应该在今天使用 Colibri？

| 场景 | 判断 | 原因 |
| --- | --- | --- |
| 推理系统研究 | **适合** | 少见且易读的存储支持 MoE 实验。 |
| 私有 GLM-5.2 质量评估 | **适合，但要耐心** | 无需数据中心 GPU 即可测试私有 prompt。 |
| 128 GB 工作站离线推理 | **可能** | 隐私重于延迟时，1-2 tok/s 可能够用。 |
| 25-32 GB 交互助手 | **不适合** | 短回答也要数分钟。 |
| 高吞吐 batch 或客户 API | **暂不适合** | 单序列、排队、后端年轻。 |
| 受监管自动决策 | **没有完整验证就不行** | 本地执行不证明质量、安全或合规。 |

Colibri 当前的商业价值是可行性工具：GLM-5.2 是否通过你的私有 workload？int4 保留多少质量？哪些专家变热？应该升级 RAM、NVMe 还是计算？这些证据能指导托管 API、managed endpoint 或正式自托管的后续选择。

围绕这种特殊运行时购买硬件前，可以先阅读我们的 [llmfit 本地 LLM 硬件适配指南](/zh/blog/llmfit-local-llm-hardware-guide/) ，比较当前机器能运行的普通稠密与 MoE 模型、上下文和量化版本。llmfit 无法预测 Colibri 的 NVMe 专家流式加载，所以存储基准测试仍要单独完成。

## 购买硬件前如何测试 Colibri

1. 准备 30-100 个代表性 prompt 与明确的验收 rubric。
2. 使用带 int8 MTP head 的预转换 checkpoint，并核对文件大小。
3. 运行 `coli doctor` 与 `coli plan` ，确认文件、平台、RAM 和 tier placement。
4. 用项目 direct-I/O benchmark 测冷 shard，不要抄 SSD 顺序读规格。
5. 记录首 token 时间、decode tok/s、专家命中率、peak RSS、质量与总任务时间。
6. 分别报告冷缓存与预热结果。
7. 一次只改变 RAM、NVMe、GPU expert budget 或 CPU flags 中的一项。
8. 把整机、电费、工程时间与托管 GLM-5.2 每个成功任务的成本比较。

离开实验室后要增加 eval gate 和 fallback。我们的 [Twinsoft AI 案例](/zh/case-studies/twinsoft-ai/) 与 [技术栈选择指南](/zh/software-development-guide/how-to-choose-a-tech-stack-for-mvp/) 遵循同一原则：架构由实测约束决定，不由新奇程度决定。

把一个可行性结论变成真正服务用户的东西，和证明模型能跑起来是两回事：评估、路由、fallback、可观测性，以及一套你团队能自己运维的部署。这正是我们 [AI 落地服务](/zh/services/ai-enablement/) 覆盖的范围，包括先梳理数据流向、再决定用欧盟区域还是自托管基础设施这一步。

## 来源与方法

Runtime 架构、需求、功能状态和速度来自 [Colibri 仓库](https://github.com/JustVugg/colibri) 及其 API、CUDA 与 benchmark 文档。模型架构、许可、context 与发布 benchmark 来自 [Z.ai GLM-5 仓库](https://github.com/zai-org/GLM-5) 和 [官方 model card](https://huggingface.co/zai-org/GLM-5.2) 。 [Artificial Analysis](https://artificialanalysis.ai/models/glm-5-2) 只作为独立能力信号，不用于 Colibri 速度。所有事实于 2026 年 8 月 7 日核对。

## 常见问题

### Colibri 是什么本地 AI 工具？

Colibri 是 Apache-2.0 推理 runtime，在 NVMe、RAM 与可选 VRAM 之间流式加载大型 MoE 的路由专家。它提供 GLM-5.2、Inkling、Kimi K3、DeepSeek V4 Flash 和 OLMoE engine，但不能加载任意 GGUF。

### 25 GB RAM 真的能跑 GLM-5.2 吗？

能。开发者测得 peak RSS 约 20 GB，但冷缓存解码只有 0.05-0.1 token/s。

### Colibri 需要多少磁盘空间？

预转换 int4 checkpoint 约 370 GB。专用 1 TB NVMe 可为临时文件、更新和文件系统余量留空间。

### 消费级硬件上的速度是多少？

实测从 25 GB 机器的 0.05-0.1 tok/s、48 GB M4 Pro 的 0.30，到 128 GB M5 Max 的 2.06。缓存、存储、CPU 和 workload 影响极大。

### Colibri 会写坏 SSD 吗？

专家流以读取为主，几乎不消耗写入耐久。真正要监控的是初次下载与转换写入、RAM 不足引发的 swap、SMART 健康和温度。

### 一张 RTX 5090 能让它交互吗？

不能保证。单卡只能装部分专家，且只有 hot tier 命中、CPU 矩阵乘成为瓶颈时才有帮助。磁盘主导时 RAM 或存储更重要。

### 能直接运行 DeepSeek、Qwen 或 Kimi 吗？

Kimi K3 与 DeepSeek V4 Flash 现已支持。其他模型仍不能直接切换，每种架构都需要验证 attention、router、tokenizer、tensor 和 chat template。

### Colibri 生产可用吗？

目前不属于常规生产服务。文本 API 已支持 tools 和 OpenAI、Anthropic 客户端，但一次只生成一个请求、排队、无多模态输入、后端年轻和量化质量证据不足仍然存在。

### GLM-5.2 是开源模型吗？

更准确是 open-weight：MIT 权重公开，可商业自托管，但训练数据和端到端训练流程未公开复现。Colibri runtime 是 Apache-2.0。

## 最终思考

Colibri 不是假演示，也不是本地 frontier model 革命。它是一个聪明而透明的内存系统实验：把容量问题从昂贵的加速器内存移到便宜的存储，再诚实暴露延迟成本。

25 GB RAM 下，GLM-5.2 每 10-20 秒生成一个 token。增加 RAM 能让热门专家不再读盘；更快 NVMe 有效到 CPU 或内存带宽接棒；GPU 只有在 profiling 显示计算受限时才有价值。读取不会快速耗尽 SSD TBW，但热量和 swap 值得监控。用 Colibri 做研究、评估和学习；在你自己的质量、延迟、并发、可靠性与成本数据证明之前，不要称它为生产基础设施。

## 你可能也喜欢..

[**本地模型什么时候胜过 API** Colibri 通过 workload eval 后，再计算利用率、工程时间、延迟、治理与 fallback。](/zh/blog/local-models-vs-apis-break-even-eu-2026/) [**AI Enablement vs 通用 AI 咨询** 比较只交付幻灯片的咨询与在自有基础设施上经过测量的实施。](/zh/compare/ai-enablement-vs-generic-ai-consultancy/)

模型与基础设施

## 继续浏览此集群

模型选择、推理经济性、本地部署、压缩与服务架构。

[从核心文章开始**在欧盟自托管 LLM：开放权重模型何时才真正划算**](/zh/blog/self-hosting-llms-eu-cost/)

- [Ox Alpha Free：设置、隐私与团队采购指南](/zh/blog/ox-alpha-free-ai-model-guide-2026/)
- [Pika Audio API 价格：SFX 真的便宜 20 倍吗？](/zh/blog/pika-audio-models-api-pricing-2026/)
- [Thunder Compute 获 1300 万美元融资：企业 GPU 虚拟化采购指南](/zh/blog/thunder-compute-gpu-virtualization-series-a/)
- [AirLLM 只用 4GB 显存跑超大模型？逐层推理原理与代价](/zh/blog/airllm-layer-wise-inference-low-vram/)
- [Qwen3.8-27B：自托管电脑操作智能体，截图不出内网](/zh/blog/qwen3-8-27b-self-hosted-computer-use-agents/)

只收重要内容

## 关注与你相关的内容

每当我们发布新文章，你会收到一封简短邮件。你可以关注整个博客，也可以只选感兴趣的主题。

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

18 min 阅读 · 2026年7月14日 最近审核 2026年8月7日

[**下一篇**](/zh/blog/future-of-enterprise-software/)

邮件订阅新文章 ×

×

通过邮件获取新文章

我们发布时给你一封简短邮件。免费，不做跟踪。

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/zh/blog/colibri-glm-5-2-consumer-hardware/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-14",
      "inLanguage": "zh",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-14",
      "url": "https://wavect.io/zh/blog/colibri-glm-5-2-consumer-hardware/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Colibri 的确能用约 25 GB RAM 执行 GLM-5.2，但速度只有 0.05-0.1 token/s。项目现已支持 GLM-5.2、Inkling、Kimi K3、DeepSeek V4 Flash 与 OLMoE。六张 RTX 5090 在完整驻留下达到 5.8-6.8 tok/s，选择性 NUMA 实验报告 9.02-9.17 tok/s。文本 API 已支持 OpenAI tools、Anthropic Messages、streaming 和有限 queue，但仍一次只执行一个 generation，也不支持多模态输入。Colibri 适合研究与评估，不是常规生产服务。",
  "articleBody": " 博客概览/AI 与智能体/模型与基础设施 Colibri 让消费级硬件跑起 GLM-5.2，代价是什么？ 要点速览 Colibri 的确能用约 25 GB RAM 执行 GLM-5.2，但速度只有 0.05-0.1 token/s。项目现已支持 GLM-5.2、Inkling、Kimi K3、DeepSeek V4 Flash 与 OLMoE。六张 RTX 5090 在完整驻留下达到 5.8-6.8 tok/s，选择性 NUMA 实验报告 9.02-9.17 tok/s。文本 API 已支持 OpenAI tools、Anthropic Messages、streaming 和有限 queue，但仍一次只执行一个 generation，也不支持多模态输入。Colibri 适合研究与评估，不是常规生产服务。 相关服务: AI 赋能 Colibri 确实能在约 25 GB RAM 的机器上执行 GLM-5.2。但这台机器不会因此变成“本地 Claude”。开发者实测的冷缓存速度只有 0.05-0.1 token/s，也就是每 10-20 秒生成一个 token，而且还没算 prompt 处理。100 个 token 的短回答大约要 17-33 分钟。 技术成果本身是真的。Colibri 让一台根本无法在 RAM 或 VRAM 中容纳完整模型的电脑，执行一个 7440 亿参数的 Mixture-of-Experts 模型。它把 NVMe、系统内存和可选的显存当成同一套分层内存。代价很直接：磁盘提供容量，读取延迟由每个 token 支付。 本文于 2026 年 8 月 7 日重新核查。Colibri 现已覆盖五个模型家族，扩展了文本 API，并公布了新的多 GPU 测量；本文继续把实测结果和估算分开。 Colibri 与 GLM-5.2：关键事实说法事实意义 25 GB RAM 跑 GLM-5.2开发者已测能执行，但冷缓存只有 0.05-0.1 tok/s。 模型大小总计 744B，每 token 约 40B 激活MoE 稀疏性让专家流式加载成为可能。 磁盘占用Colibri int4 容器约 370 GB专用 1 TB NVMe 是合理下限建议，不是代码硬要求。 常驻权重约 9.9 GB 稠密权重在 RAM剩余内存用于缓存与运行余量。 冷缓存读取每个输出 token 约 11 GB小内存机器受 I/O 和 cache miss 主导。 是否需要 GPU不需要，CUDA 与 Metal 可选只有 GPU 层消除当前瓶颈时才有帮助。 生产可用不属于常规生产服务单序列执行、项目年轻、质量证据不完整。 Colibri 到底是什么？ Colibri（项目写作 Colibrì）是一个主要用 C 编写的推理 runtime，目标是在存储、RAM 和可选 VRAM 之间运行超大型稀疏 MoE。上游现已提供面向 GLM-5.2、Inkling、Kimi K3、DeepSeek V4 Flash 和 OLMoE 的专用 engine。它已不只是最初的 GLM demo，但仍不是任意 GGUF 的通用 loader。项目包含 CLI、本地 Web UI、converter、benchmark、OpenAI 与 Anthropic 兼容文本 API，以及 CPU、CUDA 和 Metal 路径。 Colibri runtime 使用 Apache 2.0；GLM-5.2 权重使用 MIT，商业使用相对宽松。但准确说，GLM-5.2 是 open-weight：公开权重和许可证不等于训练数据与完整训练过程可复现。 Colibri 并没有把整个模型压进 25 GB。完整 int4 checkpoint 仍在磁盘上；总会用到的部分留在内存，router 选中的专家按需读取。这一差别就是整个项目的核心。 为什么选择 GLM-5.2？ Z.ai 把 GLM-5.2 描述为 744B-A40B：总参数约 7440 亿，每 token 激活约 400 亿。官方声称 100 万 token context、Terminal-Bench 2.1 得分 81.0、SWE-bench Pro 得分 62.1；这些是厂商数据，不是中立证明。Artificial Analysis 在发布时把 GLM-5.2 排为其 open-weight Intelligence Index 第一，所以称它为 frontier-class open weight 有依据，但不代表每个 workload 都胜过闭源模型。 不能把托管版或全精度 benchmark 直接套到 Colibri int4。Colibri 首次小规模质量测试在 HellaSwag、ARC、MMLU 每项仅 40 题时得到 62.5% mean normalized accuracy。样本太小，评估方法不适合理模型，也没有干净的 full precision 对 int4 A/B。Colibri 对“能够执行”的证明远强于对“质量保持”的证明。 744B 模型如何在 25 GB RAM 中执行？ 稠密层常驻：attention、embedding、shared expert 等每次都会用到的 int4 权重约占 9.9 GB。 路由专家留在 NVMe：MoE 层和 MTP head 合计 21,504 个专家 block，每个约 19 MB。 逐 token 路由：GLM-5.2 在每个 MoE 层为当前 token 选择八个专家。 缓存命中复用：逐层 LRU、学习得到的 pinned hot store、操作系统 page cache 与可选 VRAM 保存热门专家。 尽量重叠：在常驻专家计算时 prefetch 冷专家，然后汇总结果。 冷缓存数学正好解释速度：75 个 MoE 层 × 8 个专家 × 约 19 MB，等于每 token 约读取 11.4 GB 专家数据。开发者约 1 GB/s 的存储路径仅磁盘就要 11 秒，理论上限约 0.09 tok/s，与 0.05-0.1 tok/s 实测吻合。 真实速度有多快？ 下表来自项目社区数据，我们没有复测。100 token 时间按 100 / tok_s 换算，不含 prompt prefill、排队和隐藏推理。 Colibri 执行 GLM-5.2 的实测解码速度硬件与配置速度100 token如何理解 25 GB RAM，约 1 GB/s NVMe，WSL20.05-0.1 tok/s16.7-33.3 分钟证明能跑，不是可用聊天。 i5-12600K，32 GB，Windows0.08 tok/s20.8 分钟普通硬件没有解决缓存问题。 M4 Pro，48 GB，Metal0.30 tok/s5.6 分钟更快，仍不交互。 M5 Max，128 GB，46.9 GB pin，pre-rebase Metal2.06 tok/s49 秒耐心单用户可能接受。 Ryzen 9950X3D2，121 GB，Gen5，RTX 50901.23 tok/s81 秒高端消费硬件且仔细调优。 251 GiB 主机，六张 RTX 5090，专家全驻留6.00 tok/s17 秒无磁盘 miss，但已不是普通消费 PC。 长 prompt 或冷缓存的首 token 时间可能更差。六张 5090 的结果不能推导出一张游戏卡有 6 tok/s。项目对单张 RTX 5090 的干净重测接近零收益，因为 CPU 已能追平专家矩阵乘，瓶颈仍是存储。常见对话目标是 20-30 tok/s；Colibri 已发布的最好单请求结果仍低于这一范围。 真正决定性能的因素 1. RAM 与缓存命中率 24-32 GB 中，稠密权重、KV、scratch 和系统占用后几乎没有专家缓存。一个 24 GB 测试即使 direct read 达 2.74 GB/s，命中率也只有 3-4%，速度 0.07 tok/s。128 GB 则能 pin 数十 GB 的 workload 热门专家。重复工作负载比随机提问收益更大；代码任务学到的热专家未必适合法律研究。 2. 真实随机读取，而非包装盒数字 Colibri 在 370 GB 中并行读取分散的约 19 MB block。应该运行项目的 direct-I/O iobench 冷 shard，而不是引用 SSD 最大顺序读。同一 Ryzen 从 1.51 GB/s Gen3 QLC 换到 8.81 GB/s Gen5 后，生成速度只从 0.10 提升到 0.28 tok/s：磁盘快 5.8 倍，token 只快 2.9 倍，因为瓶颈转向 matrix multiplication。 3. CPU、内存带宽与推测解码 缓存命中后，瓶颈变成量化矩阵乘和 RAM 带宽。正确的 int8 MTP 文件获得 39-59% draft acceptance、每 forward 2.2-2.8 token；旧 int4 mirror 几乎没有接受。冷缓存下推测甚至可能更慢，因为每 token 的专家加载从约 660 增到 1,100。--topp 0.7 能减少读取，但它有损地限制 router，必须重新做质量 eval。 Colibri 会磨损 SSD 吗？ 正常推理几乎不应消耗 SSD 的 TBW。每 token 约 11 GB 指读取，不是写入。NAND 耐久按 program/erase 写入衡量；Micron 的耐久文档认为读取造成的磨损可忽略。Colibri 专家流也是 read-only。 初次安装会集中写入：预转换模型下载约写 370 GB；从 756 GB FP8 转换时，下载、临时 shard 和输出合计会超过 1 TB host writes。 swap 才是耐久陷阱：RAM 不足导致持续换页写入，同时性能崩溃。 KV 持久化有少量写入：约 182 KB/token，加上 usage history。 持续读取会发热：Samsung 记录了高负载 thermal throttling。需要散热片、风道、SMART 温度和 swap 监控。 带散热和足够空闲空间的专用 1 TB 本地 NVMe，比把 370 GB 模型塞进装有系统的 500 GB 盘更稳妥。RAID 0 能提高带宽，也增加任一盘故障导致本地副本丢失的概率，只应保存可重新下载的模型。 加 GPU 就会快吗？ 有时。Colibri 可以把热专家放在 NVIDIA VRAM、用 CUDA 跑稠密计算，并在 Apple Silicon 使用 Metal。但单张 16-32 GB GPU 只能装下 370 GB 中很小一部分。只有 hot tier 命中率高且 CPU 专家计算是瓶颈时才有效；若磁盘占主导，帮助很小。当前多 GPU 采用独立 device context 与经 host 的同步复制，没有 P2P/NCCL、expert sharding 或成熟 Tensor Core 库。在 profiling 证明瓶颈是专家矩阵乘之前，不要为了 Colibri 购买 GPU。 能否运行 DeepSeek、Qwen、Kimi 等模型？ 可以，但前提是该模型家族已有经过验证的 engine。 上游现在除 GLM-5.2、Inkling 和 OLMoE 外，还支持 Kimi K3 与 DeepSeek V4 Flash。它不是直接切换模型：attention、router、tokenizer、tensor layout、chat template 与 converter 都需按架构实现和验证。 第三方 Colibri-Hy3 把思路移植到腾讯 295B、21B active 的 Hy3，新增 GQA、router 和 converter，并流式执行约 142 GB int4。它同时证明设计可移植，也证明支持新模型绝不是改一个名称。稠密模型每 token 几乎需要所有参数，收益会小很多。 100",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-08-07",
  "datePublished": "2026-07-14",
  "description": "Colibri 的确能用约 25 GB RAM 执行 GLM-5.2，但速度只有 0.05-0.1 token/s。项目现已支持 GLM-5.2、Inkling、Kimi K3、DeepSeek V4 Flash 与 OLMoE。六张 RTX 5090 在完整驻留下达到 5.8-6.8 tok/s，选择性 NUMA 实验报告 9.02-9.17 tok/s。文本 API 已支持 OpenAI tools、Anthropic Messages、streaming 和有限 queue，但仍一次只执行一个 generation，也不支持多模态输入。Colibri 适合研究与评估，不是常规生产服务。",
  "headline": "Colibri 让消费级硬件跑起 GLM-5.2，代价是什么？",
  "image": "https://wavect.io/img/blog/headers/header_colibri-glm-5-2-consumer-hardware.svg",
  "inLanguage": "zh",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/zh/blog/colibri-glm-5-2-consumer-hardware/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/zh/blog/colibri-glm-5-2-consumer-hardware/",
  "wordCount": 1076
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/",
      "name": "首页",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/overview/",
      "name": "博客概览",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/topics/ai-agents/",
      "name": "AI 与智能体",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/clusters/models-infrastructure/",
      "name": "模型与基础设施",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/colibri-glm-5-2-consumer-hardware/",
      "name": "Colibri：消费级硬件运行 GLM-5.2 | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Colibri 是 Apache-2.0 推理 runtime，在 NVMe、RAM 与可选 VRAM 之间流式加载大型 MoE 的路由专家。它提供 GLM-5.2、Inkling、Kimi K3、DeepSeek V4 Flash 和 OLMoE engine，但不能加载任意 GGUF。"
      },
      "name": "Colibri 是什么本地 AI 工具？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "能。开发者测得 peak RSS 约 20 GB，但冷缓存解码只有 0.05-0.1 token/s。"
      },
      "name": "25 GB RAM 真的能跑 GLM-5.2 吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "预转换 int4 checkpoint 约 370 GB。专用 1 TB NVMe 可为临时文件、更新和文件系统余量留空间。"
      },
      "name": "Colibri 需要多少磁盘空间？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "实测从 25 GB 机器的 0.05-0.1 tok/s、48 GB M4 Pro 的 0.30，到 128 GB M5 Max 的 2.06。缓存、存储、CPU 和 workload 影响极大。"
      },
      "name": "消费级硬件上的速度是多少？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "专家流以读取为主，几乎不消耗写入耐久。真正要监控的是初次下载与转换写入、RAM 不足引发的 swap、SMART 健康和温度。"
      },
      "name": "Colibri 会写坏 SSD 吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "不能保证。单卡只能装部分专家，且只有 hot tier 命中、CPU 矩阵乘成为瓶颈时才有帮助。磁盘主导时 RAM 或存储更重要。"
      },
      "name": "一张 RTX 5090 能让它交互吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Kimi K3 与 DeepSeek V4 Flash 现已支持。其他模型仍不能直接切换，每种架构都需要验证 attention、router、tokenizer、tensor 和 chat template。"
      },
      "name": "能直接运行 DeepSeek、Qwen 或 Kimi 吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "目前不属于常规生产服务。文本 API 已支持 tools 和 OpenAI、Anthropic 客户端，但一次只生成一个请求、排队、无多模态输入、后端年轻和量化质量证据不足仍然存在。"
      },
      "name": "Colibri 生产可用吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "更准确是 open-weight：MIT 权重公开，可商业自托管，但训练数据和端到端训练流程未公开复现。Colibri runtime 是 Apache-2.0。"
      },
      "name": "GLM-5.2 是开源模型吗？"
    }
  ]
}
```
