---
title: "Bonsai 27B 评测：手机本地运行 1-bit LLM"
canonical: https://wavect.io/zh/blog/bonsai-27b-phone-local-ai-review/
language: zh
description: "Bonsai 27B 真能在手机运行吗？核验 3.9 GB 体积、实际内存、基准损失、WebGPU 速度、1-bit 与三值版本，以及生产试点清单。"
image: "https://wavect.io/img/general/bak/open_graph_preview.jpg"
---

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年7月16日 最近审核 2026年8月11日

[**下一篇**](/zh/blog/soofi-s-european-sovereign-llm/)

# Bonsai 27B 评测：270 亿参数 LLM 真的能在手机上运行吗？

要点速览

Bonsai 27B 把 Qwen3.6-27B 二值语言权重压到约 3.9 GB，PrismML 报告在 iPhone 17 Pro Max 上达到约 11 token/s。厂商平均保留率为 FP16 的 89.5%；一项独立的 98 问小型测试中，1-bit 为 82.9%，三值版 86.2%，Qwen3.6 为 94.2%。二值 Q1_0 已可在 llama.cpp 主线使用 CPU、Metal、CUDA 和 Vulkan。三值版的 7.17 GB group-128 文件仍需 PrismML fork，7.59 GB group-64 文件则已支持这些主线 backend。Bonsai 很适合试点，但生产仍需固定产物、测量完整峰值内存并评测真实任务。

**可以，27B 级模型已经能在手机上运行，但有用的答案远比发布标题复杂。**PrismML 报告称，Bonsai 27B 的 1-bit 语言权重约为 3.9 GB，在 iPhone 17 Pro Max 上可通过 MLX Swift 达到约每秒 11 token。该模型基于 Qwen3.6-27B，Hugging Face 模型卡标注 Apache 2.0。这是端侧 AI 的真实进展，但并不代表所有 27B 工作负载都能轻松装进所有手机。

同一批证据也说明了压缩的代价。在 PrismML 自己的 15 项基准中，1-bit 版本的平均分达到 FP16 基线的 89.5%。数学和代码保留得较好，指令遵循、视觉和多步骤工具调用下降更明显。质量优先的三值版本保留 94.6%。Group-128 GGUF 约为 7.17 GB，兼容主线的 group-64 文件约为 7.59 GB，两者都高于发布内容常引用的 5.9 GB 理想表示体积。

| 问题 | 已核实答案 | 对采购方意味着什么 |
| --- | --- | --- |
| 能在手机上运行吗？ | PrismML 报告 iPhone 17 Pro Max 通过 MLX Swift 约 11 tok/s | 当前高端手机可以交互式生成本地文本 |
| 真的只有 3.9 GB 吗？ | 是，但只指驻留的 1-bit 语言权重 | Runtime、上下文缓存和可选视觉组件还需要额外内存 |
| 真的保留 90% 吗？ | 在厂商 15 项基准平均分中为 FP16 的 89.5% | 损失分布不均，真实业务仍需独立 eval |
| 三值版是 5.9 GB 吗？ | 理想值 5.9 GB；group-128 fork 文件 7.17 GB，group-64 主线文件 7.59 GB | 容量规划应以具体产物为准 |
| 可以直接投入生产吗？ | 值得试点，但依赖定制 low-bit runtime，模型卡也列出明确限制 | Agent、视觉和长上下文场景应先做受控测试 |

## Bonsai 27B 是什么？

[Bonsai 27B](https://prismml.com/news/bonsai-27b) 是 PrismML 基于 [Qwen3.6-27B](https://huggingface.co/Qwen/Qwen3.6-27B) 制作的 low-bit 模型。原模型是稠密多模态模型，包含 27B 语言主干、视觉编码器和原生 262,144 token 上下文。Qwen 在大部分 block 中使用线性 attention，64 个 block 中只有 16 个使用完整 attention。与全 attention 架构相比，这种混合设计能减慢 KV cache 的增长。

PrismML 提供两个档位。 [1-bit 版本](https://huggingface.co/prism-ml/Bonsai-27B-gguf) 使用 {−1, +1} 二值权重，每 128 个权重共享一个 FP16 scale，因此实际为每权重 1.125 bit，语言权重约 3.9 GB。 [三值版本](https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf) 加入零，使用 {−1, 0, +1}，每权重实际 1.71 bit，用更多内存换取更高质量。

这不只是把普通 FP16 checkpoint 导出成通用 1-bit 文件。PrismML 表示，低位宽覆盖 embedding、attention projection、MLP projection 和语言模型 head。定制 CUDA、Metal、MLX 与 WebGPU kernel 会直接读取打包权重，不需要在每个运算步骤中重新展开为 FP16。

Runtime 的实际可用性也有所改善。 [PrismML 当前兼容性矩阵](https://github.com/PrismML-Eng/Bonsai-demo) 显示，二值 `Q1_0` 已可在 llama.cpp 主线使用 CPU、Metal、CUDA 和 Vulkan。三值版本必须区分具体文件：7.17 GB 的 group-128 `*-Q2_0.gguf` 仍需要 PrismML fork；7.59 GB 的 group-64 `*-Q2_0_g64.gguf` 已可在主线使用 CPU、Metal、CUDA 和 Vulkan。实验性 `PQ2_0` 文件尚不是稳定部署目标。部署团队应同时固定模型产物与 runtime revision。

一项在 Jetson Orin 上进行的独立社区测试用 98 个问题补充了厂商平均分：Bonsai 1-bit 得到 82.9%，三值版 86.2%，Qwen3.6-27B 为 94.2%。样本很小，不能代表所有任务，但它确认了版本排序，也说明自有任务 eval 比单个保留率数字更重要。方法和原始数据位于 [公开 benchmark 仓库](https://github.com/ArmanJR/PrismML-Bonsai-vs-Qwen3.5-Benchmark) 。

## 27B 模型如何从 54 GB 缩小到 3.9 GB？

FP16 的粗略计算很直接：约 273 亿个语言参数乘以两字节，运行开销之前就接近 54 GB。二值模型为每个权重保存一个符号位，再让 128 个权重共享一个 16-bit scale，结果是每权重 1.125 bit，约为 FP16 的十四分之一。

模型文件大小不等于应用的完整内存需求：

- **驻留语言权重：** 1-bit 约 3.9 GB；三值 group-128 fork 文件 7.17 GB，group-64 主线文件 7.59 GB。
- **Runtime 与 activation：** 官方测量在各 backend 上还包含约 1.3 GB。
- **KV cache：** 随实际上下文增长。即使启用 4-bit KV 压缩，完整 262K 窗口仍会让 1-bit 版本的峰值内存达到约 9.4 GB。
- **可选组件：** 紧凑视觉投影约 0.63 GB，speculative decoding 的 drafter 也会额外占用内存。

这对产品容量规划很关键。权重文件可能满足手机单个 App 的内存预算，最大上下文却未必能装下。最终应在目标设备和目标 runtime 上同时测量权重、真实上下文与运行开销。

## Bonsai 27B 真的保留了 Qwen3.6 的 90% 智力吗？

**它保留的是厂商基准平均分的 89.5%，不是每项能力都保留 90%。**PrismML 使用相同 H100 环境、EvalScope 和 vLLM，在 thinking mode 下评估所有版本。相同条件让横向比较有价值，但这些结果尚未被独立复现，而且平均值掩盖了不同能力之间的大幅差异。

| 能力 | Qwen3.6 FP16 | 三值版 | 1-bit | 商业解读 |
| --- | --- | --- | --- | --- |
| 数学 | 95.33 | 93.40 | 91.66 | 在已发布测试中保留较强 |
| 代码 | 88.74 | 85.96 | 81.88 | 适合评估边界清晰的代码任务，不等于仓库级自主能力 |
| 知识与推理 | 83.15 | 76.96 | 73.39 | 质量取舍明显 |
| 指令遵循 | 78.47 | 71.77 | 65.74 | 格式、约束和拒答行为必须专门测试 |
| Agent 与工具调用 | 80.00 | 74.01 | 66.03 | 多步骤可靠性是实质风险 |
| 视觉 | 72.61 | 65.19 | 59.57 | 不能用文本模型体积推断多模态质量 |

单项结果更能说明问题。1-bit 版的 MATH-500 从 99.40 降至 98.00，BFCL v3 从 77.10 降至 70.72，但更困难的多步骤 τ²-Bench 从 82.90 降至 61.34，IFBench 从 68.03 降至 52.36，MMMU-Pro 从 79.94 降至 60.48。压缩损失恰好落在长链 Agent 最容易累积错误的位置。

PrismML 自己的模型卡也明确表示，涉及多个文件、长周期 run-test-repair 的 agentic coding 还不是该版本的强项。对采购决策来说，这条限制比四舍五入后的 90% 标题更重要。

## Bonsai 27B 真的能在手机和笔记本上本地运行吗？

**可以，但需要受支持的高端硬件和匹配的 runtime。**PrismML 报告 MLX Swift 版本在 iPhone 17 Pro Max 上约为 11 tok/s。1-bit GGUF 的 llama-bench 数据显示，生成 128 token 时，M4 Pro 为 26.0 tok/s，M5 Pro 为 44.2，M5 Max 为 66.4。三值 GGUF 在相同笔记本类别上分别为 18.0、26.2 和 44.0 tok/s。

这些数字不能直接互换。手机、Metal、CUDA 和 WebGPU 使用不同 kernel、上下文长度、功耗限制与测试协议。Prompt processing 和 token generation 也是两个阶段。Decode 很快，并不代表长文档的首 token 延迟一定很短。

## WebGPU demo 实际证明了什么？

[Joshua Lochner 的 Hugging Face Space](https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels) 证实了最重要的部分：Bonsai 27B 可以通过定制 WGSL compute shader 在浏览器本地运行。页面称 kernel 由 Fable 5 和 GPT 5.6 Sol 编写与优化，并在纳入前针对正确性和具体 tensor shape 做过基准。权重下载完成后，模型推理和对话都留在设备上。

公开 demo 没有发布绑定具体硬件的吞吐数据或可重复测试协议。因此应把浏览器速度数字视为展示结果，而不是容量常数。采购测试应记录浏览器、GPU、功耗模式、输入与输出长度、首 token 延迟、持续 decode、峰值内存以及多轮运行后的温控降频。

## Bonsai 27B 可以在哪些场景创造商业价值？

- **私有文档助手：** 在本地对敏感文件做摘要、分类和抽取，不把内容发送给模型 API，但前提是应用的其他部分也保持本地。
- **离线现场软件：** 为网络不稳定环境中的技术人员、检查人员和移动团队提供帮助。
- **端侧产品功能：** 模型部署后，以可预测的本地延迟提供文本辅助，不再按网络 token 付费。
- **混合 Agent 路由：** 把私密且边界清晰的步骤留在本地，把高难推理或脆弱工具流程交给更强的云模型。
- **单机试点：** 先在笔记本或中小型 GPU 上评估 27B 级能力，再决定是否采购长期推理集群。

真正有价值的产品仍然是模型周围的系统。Wavect 的 [AI enablement 服务](/zh/services/ai-enablement/) 覆盖用例选择、eval、数据访问、路由、部署、可观测性与团队交接。 [Twinsoft AI 案例](/zh/case-studies/twinsoft-ai/) 也说明，生产价值来自工作流和控制措施，而不是参数数量。

## 企业应该选择哪个 Bonsai 27B 版本？

| 工作负载 | 建议起点 | 原因 | 上线前门槛 |
| --- | --- | --- | --- |
| 手机离线文本功能 | 1-bit MLX | 唯一针对手机级内存预算设计的版本 | 在目标手机上测试温度、峰值内存、电池与任务质量 |
| 笔记本私有助手 | 内存允许时选三值版 | 指令、工具与视觉保留更好 | 使用 7.17 GB fork 文件或 7.59 GB 主线文件和预期上下文测量 |
| 长周期代码 Agent | 与 FP16 或托管 frontier 模型对比 | 模型卡明确指出该版本的这一弱项 | 仓库级 run-test-repair eval 与失败成本 |
| 高流量企业推理 | 同时 benchmark 1-bit、三值与 API | 单流速度无法预测并发吞吐与运维成本 | 每个成功任务的成本、SLO、冗余和 fallback |

本文只负责回答 Bonsai 的具体部署问题。更广泛的模型家族选择，请查看我们的 [2026 开放权重 LLM 对比](/zh/blog/open-weight-llm-comparison-2026/) 。硬件与 API 的财务决策，请使用 [本地模型与 API 盈亏平衡计算器](/zh/blog/local-models-vs-apis-break-even-eu-2026/) 。分开这三种搜索意图，可以避免产品评测与市场对比、基础设施经济性互相争夺同一主题。

## Bonsai 27B 试点应该测量什么？

1. **固定产物和 runtime：** 记录 Hugging Face revision、权重 hash、backend fork、kernel commit、设备、OS 与 MLX 或浏览器版本。
2. **测量完整内存：** 包括权重、runtime、预期上下文、KV 格式、视觉投影和可选 drafter。
3. **建立业务 eval：** 至少使用 50 到 100 个真实任务，覆盖格式约束、工具 schema、拒答和不可接受的失败。
4. **拆分延迟阶段：** 分别记录首 token、prompt processing、持续 decode 和多轮 warm run。
5. **验证离线与隐私边界：** 检查模型下载、分析、crash reporting、日志、embedding 与 fallback。模型本地不代表整个应用本地。
6. **按成功结果计算成本：** 把设备支持、工程、更新分发、监控和 fallback 与托管 API 比较。
7. **设计回滚：** 为不兼容设备、过载或质量失败保留已验证模型和服务器路径。

我们的 [MVP 技术栈选择指南](/zh/software-development-guide/how-to-choose-a-tech-stack-for-mvp/) 采用同一原则：优先决定未来最昂贵、最难逆转的约束。对端侧 AI 来说，通常是最低支持硬件和最关键工作流的质量，而不是下载文件大小。

## Bonsai 27B 常见问题

### Bonsai 27B 是什么？

Bonsai 27B 是 PrismML 基于 Qwen3.6-27B 推出的二值与三值 low-bit 模型家族。1-bit 语言权重约 3.9 GB。三值表示的理想目标为 5.9 GB；当前 GGUF 的 group-128 文件为 7.17 GB，兼容主线的 group-64 文件为 7.59 GB。

### Bonsai 27B 能在 iPhone 上运行吗？

PrismML 报告其通过 MLX Swift 在 iPhone 17 Pro Max 上达到约每秒 11 token。该结果对应特定高端手机和 runtime，权重、上下文、运行开销与可选视觉组件都要计入真实内存预算。

### Bonsai 27B 真的是 1-bit 模型吗？

二值语言权重使用一个符号位，再让每 128 个权重共享一个 FP16 scale，因此实际为每权重 1.125 bit。少量辅助 tensor 保持更高精度，可选视觉组件使用 4-bit HQQ。

### Bonsai 27B 保留了 Qwen3.6 的 90% 质量吗？

PrismML 自己的 15 项平均分为 89.5%。一项独立的 98 问小型测试中，1-bit 为 82.9%，三值版为 86.2%，Qwen3.6 为 94.2%。最终仍需使用自己的业务任务评测。

### Bonsai 27B 可以商用吗？

Hugging Face 模型卡标注 Apache 2.0。商业团队仍应固定具体产物、保留 notice、审查上游和依赖许可证，并确认数据与计划用途满足所有义务。

### 应该选择 1-bit 还是三值版？

如果手机级体积是硬约束，先测试 1-bit。如果有笔记本级内存且更重视质量，先测试三值版。最终选择应由你的业务 eval 决定，而不是厂商平均分。

## 最终思考

Bonsai 27B 是真实的系统工程里程碑。PrismML 把 27B 级语言权重放进约 3.9 GB，并在高端手机上展示了交互式推理。这让过去不可行的私有、离线与混合产品架构变得可能。

工程决策并没有消失。90% 是厂商平均值，多项 Agent 关键能力下降更明显，三值版根据 runtime 需要 7.17 或 7.59 GB，完整上下文也装不进手机级标题。把 Bonsai 视为强力试点候选。同时固定产物与 runtime、测量峰值内存、测试真实任务，并比较每个成功结果的成本，再决定是否把它变成生产依赖。

## 你可能也喜欢..

[**本地模型什么时候胜过 API** 把 GPU 利用率、工程、eval 维护、数据驻留与托管替代方案放进同一份盈亏平衡计算。](/zh/blog/local-models-vs-apis-break-even-eu-2026/) [**AI Enablement 与通用 AI 咨询对比** 模型 demo 只证明可行性。生产还需要 eval、路由、部署、可观测性和能接手 stack 的团队。](/zh/compare/ai-enablement-vs-generic-ai-consultancy/)

模型与基础设施

## 继续浏览此集群

模型选择、推理经济性、本地部署、压缩与服务架构。

[从核心文章开始**在欧盟自托管 LLM：开放权重模型何时才真正划算**](/zh/blog/self-hosting-llms-eu-cost/)

- [FreeToken AI 评测：消费级 GPU 能跑前沿 MoE 大模型吗？](/zh/blog/freetoken-ai-inference-engine-review/)
- [Darkbloom AI 评测：用闲置 Mac 提供私有推理](/zh/blog/darkbloom-ai-private-inference-mac/)
- [Ox Alpha Free：设置、隐私与团队采购指南](/zh/blog/ox-alpha-free-ai-model-guide-2026/)
- [Pika Audio API 价格：SFX 真的便宜 20 倍吗？](/zh/blog/pika-audio-models-api-pricing-2026/)
- [Thunder Compute 获 1300 万美元融资：企业 GPU 虚拟化采购指南](/zh/blog/thunder-compute-gpu-virtualization-series-a/)

只收重要内容

## 关注与你相关的内容

每当我们发布新文章，你会收到一封简短邮件。你可以关注整个博客，也可以只选感兴趣的主题。

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年7月16日 最近审核 2026年8月11日

[**下一篇**](/zh/blog/soofi-s-european-sovereign-llm/)

邮件订阅新文章 ×

×

通过邮件获取新文章

我们发布时给你一封简短邮件。免费，不做跟踪。

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/zh/blog/bonsai-27b-phone-local-ai-review/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-16",
      "inLanguage": "zh",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-16",
      "url": "https://wavect.io/zh/blog/bonsai-27b-phone-local-ai-review/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Bonsai 27B 把 Qwen3.6-27B 二值语言权重压到约 3.9 GB，PrismML 报告在 iPhone 17 Pro Max 上达到约 11 token/s。厂商平均保留率为 FP16 的 89.5%；一项独立的 98 问小型测试中，1-bit 为 82.9%，三值版 86.2%，Qwen3.6 为 94.2%。二值 Q1_0 已可在 llama.cpp 主线使用 CPU、Metal、CUDA 和 Vulkan。三值版的 7.17 GB group-128 文件仍需 PrismML fork，7.59 GB group-64 文件则已支持这些主线 backend。Bonsai 很适合试点，但生产仍需固定产物、测量完整峰值内存并评测真实任务。",
  "articleBody": " 博客概览/AI 与智能体/模型与基础设施 Bonsai 27B 评测：270 亿参数 LLM 真的能在手机上运行吗？ 要点速览 Bonsai 27B 把 Qwen3.6-27B 二值语言权重压到约 3.9 GB，PrismML 报告在 iPhone 17 Pro Max 上达到约 11 token/s。厂商平均保留率为 FP16 的 89.5%；一项独立的 98 问小型测试中，1-bit 为 82.9%，三值版 86.2%，Qwen3.6 为 94.2%。二值 Q1_0 已可在 llama.cpp 主线使用 CPU、Metal、CUDA 和 Vulkan。三值版的 7.17 GB group-128 文件仍需 PrismML fork，7.59 GB group-64 文件则已支持这些主线 backend。Bonsai 很适合试点，但生产仍需固定产物、测量完整峰值内存并评测真实任务。 可以，27B 级模型已经能在手机上运行，但有用的答案远比发布标题复杂。PrismML 报告称，Bonsai 27B 的 1-bit 语言权重约为 3.9 GB，在 iPhone 17 Pro Max 上可通过 MLX Swift 达到约每秒 11 token。该模型基于 Qwen3.6-27B，Hugging Face 模型卡标注 Apache 2.0。这是端侧 AI 的真实进展，但并不代表所有 27B 工作负载都能轻松装进所有手机。 同一批证据也说明了压缩的代价。在 PrismML 自己的 15 项基准中，1-bit 版本的平均分达到 FP16 基线的 89.5%。数学和代码保留得较好，指令遵循、视觉和多步骤工具调用下降更明显。质量优先的三值版本保留 94.6%。Group-128 GGUF 约为 7.17 GB，兼容主线的 group-64 文件约为 7.59 GB，两者都高于发布内容常引用的 5.9 GB 理想表示体积。 Bonsai 27B 一分钟结论，核验于 2026 年 8 月 11 日 问题已核实答案对采购方意味着什么 能在手机上运行吗？PrismML 报告 iPhone 17 Pro Max 通过 MLX Swift 约 11 tok/s当前高端手机可以交互式生成本地文本 真的只有 3.9 GB 吗？是，但只指驻留的 1-bit 语言权重Runtime、上下文缓存和可选视觉组件还需要额外内存 真的保留 90% 吗？在厂商 15 项基准平均分中为 FP16 的 89.5%损失分布不均，真实业务仍需独立 eval 三值版是 5.9 GB 吗？理想值 5.9 GB；group-128 fork 文件 7.17 GB，group-64 主线文件 7.59 GB容量规划应以具体产物为准 可以直接投入生产吗？值得试点，但依赖定制 low-bit runtime，模型卡也列出明确限制Agent、视觉和长上下文场景应先做受控测试 Bonsai 27B 是什么？ Bonsai 27B 是 PrismML 基于 Qwen3.6-27B 制作的 low-bit 模型。原模型是稠密多模态模型，包含 27B 语言主干、视觉编码器和原生 262,144 token 上下文。Qwen 在大部分 block 中使用线性 attention，64 个 block 中只有 16 个使用完整 attention。与全 attention 架构相比，这种混合设计能减慢 KV cache 的增长。 PrismML 提供两个档位。1-bit 版本使用 {−1, +1} 二值权重，每 128 个权重共享一个 FP16 scale，因此实际为每权重 1.125 bit，语言权重约 3.9 GB。三值版本加入零，使用 {−1, 0, +1}，每权重实际 1.71 bit，用更多内存换取更高质量。 这不只是把普通 FP16 checkpoint 导出成通用 1-bit 文件。PrismML 表示，低位宽覆盖 embedding、attention projection、MLP projection 和语言模型 head。定制 CUDA、Metal、MLX 与 WebGPU kernel 会直接读取打包权重，不需要在每个运算步骤中重新展开为 FP16。 Runtime 的实际可用性也有所改善。PrismML 当前兼容性矩阵显示，二值 Q1_0 已可在 llama.cpp 主线使用 CPU、Metal、CUDA 和 Vulkan。三值版本必须区分具体文件：7.17 GB 的 group-128 *-Q2_0.gguf 仍需要 PrismML fork；7.59 GB 的 group-64 *-Q2_0_g64.gguf 已可在主线使用 CPU、Metal、CUDA 和 Vulkan。实验性 PQ2_0 文件尚不是稳定部署目标。部署团队应同时固定模型产物与 runtime revision。 一项在 Jetson Orin 上进行的独立社区测试用 98 个问题补充了厂商平均分：Bonsai 1-bit 得到 82.9%，三值版 86.2%，Qwen3.6-27B 为 94.2%。样本很小，不能代表所有任务，但它确认了版本排序，也说明自有任务 eval 比单个保留率数字更重要。方法和原始数据位于公开 benchmark 仓库。 27B 模型如何从 54 GB 缩小到 3.9 GB？ FP16 的粗略计算很直接：约 273 亿个语言参数乘以两字节，运行开销之前就接近 54 GB。二值模型为每个权重保存一个符号位，再让 128 个权重共享一个 16-bit scale，结果是每权重 1.125 bit，约为 FP16 的十四分之一。 模型文件大小不等于应用的完整内存需求： 驻留语言权重：1-bit 约 3.9 GB；三值 group-128 fork 文件 7.17 GB，group-64 主线文件 7.59 GB。 Runtime 与 activation：官方测量在各 backend 上还包含约 1.3 GB。 KV cache：随实际上下文增长。即使启用 4-bit KV 压缩，完整 262K 窗口仍会让 1-bit 版本的峰值内存达到约 9.4 GB。 可选组件：紧凑视觉投影约 0.63 GB，speculative decoding 的 drafter 也会额外占用内存。 这对产品容量规划很关键。权重文件可能满足手机单个 App 的内存预算，最大上下文却未必能装下。最终应在目标设备和目标 runtime 上同时测量权重、真实上下文与运行开销。 Bonsai 27B 真的保留了 Qwen3.6 的 90% 智力吗？ 它保留的是厂商基准平均分的 89.5%，不是每项能力都保留 90%。PrismML 使用相同 H100 环境、EvalScope 和 vLLM，在 thinking mode 下评估所有版本。相同条件让横向比较有价值，但这些结果尚未被独立复现，而且平均值掩盖了不同能力之间的大幅差异。 PrismML 15 项基准的分类平均分 能力Qwen3.6 FP16三值版1-bit商业解读 数学95.3393.4091.66在已发布测试中保留较强 代码88.7485.9681.88适合评估边界清晰的代码任务，不等于仓库级自主能力 知识与推理83.1576.9673.39质量取舍明显 指令遵循78.4771.7765.74格式、约束和拒答行为必须专门测试 Agent 与工具调用80.0074.0166.03多步骤可靠性是实质风险 视觉72.6165.1959.57不能用文本模型体积推断多模态质量 单项结果更能说明问题。1-bit 版的 MATH-500 从 99.40 降至 98.00，BFCL v3 从 77.10 降至 70.72，但更困难的多步骤 τ²-Bench 从 82.90 降至 61.34，IFBench 从 68.03 降至 52.36，MMMU-Pro 从 79.94 降至 60.48。压缩损失恰好落在长链 Agent 最容易累积错误的位置。 PrismML 自己的模型卡也明确表示，涉及多个文件、长周期 run-test-repair 的 agentic coding 还不是该版本的强项。对采购决策来说，这条限制比四舍五入后的 90% 标题更重要。 Bonsai 27B 真的能在手机和笔记本上本地运行吗？ 可以，但需要受支持的高端硬件和匹配的 runtime。PrismML 报告 MLX Swift 版本在 iPhone 17 Pro Max 上约为 11 tok/s。1-bit GGUF 的 llama-bench 数据显示，生成 128 token 时，M4 Pro 为 26.0 tok/s，M5 Pro 为 44.2，M5 Max 为 66.4。三值 GGUF 在相同笔记本类别上分别为 18.0、26.2 和 44.0 tok/s。 这些数字不能直接互换。手机、Metal、CUDA 和 WebGPU 使用不同 kernel、上下文长度、功耗限制与测试协议。Prompt processing 和 token generation 也是两个阶段。Decode 很快，并不代表长文档的首 token 延迟一定很短。 WebGPU demo 实际证明了什么？ Joshua Lochner 的 Hugging Face Space证实了最重要的部分：Bonsai 27B 可以通过定制 WGSL compute shader 在浏览器本地运行。页面称 kernel 由 Fable 5 和 GPT 5.6 Sol 编写与优化，并在纳入前针对正确性和具体 tensor shape 做过基准。权重下载完成后，模型推理和对话都留在设备上。 公开 demo 没有发布绑定具体硬件的吞吐数据或可重复测试协议。因此应把浏览器速度数字视为展示结果，而不是容量常数。采购测试应记录浏览器、GPU、功耗模式、输入与输出长度、首 token 延迟、持续 decode、峰值内存以及多轮运行后的温控降频。 Bonsai 27B 可以在哪些场景创造商业价值？ 私有文档助手：在本地对敏感文件做摘要、分类和抽取，不把内容发送给模型 API，但前提是应用的其他部分也保持本地。 离线现场软件：为网络不稳定环境中的技术人员、检查人员和移动团队提供帮助。 端侧产品功能：模型部署后，以可预测的本地延迟提供文本辅助，不再按网络 token 付费。 混合 Agent 路由：把私密且边界清晰的步骤留在本地，把高难推理或脆弱工具流程交给更强的云模型。 单机试点：先在笔记本或中小型 GPU 上评估 27B 级能力，再决定是否采购长期推理集群。 真正有价值的产品仍然是模型周围的系统。Wavect 的 AI enablement 服务覆盖用例选择、eval、数据访问、路由、部署、可观测性与团队交接。Twinsoft AI 案例也说明，生产价值来自工作流和控制措施，而不是参数数量。 企业应该选择哪个 Bonsai 27B 版本？ 按工作负载选择，而不是按发布标题选择 工作负载建议起点原因上线前门槛 手机离线文本功能1-bit MLX唯一针对手机级内存预算设计的版本在目标手机上测试温度、峰值内存、电池与任务质量 笔记本私有助手内存允许时选三值版指令、工具与视觉保留更好使用 7.17 GB fork 文件或 7.59 GB 主线文件和预期上下文测量 长周期代码 Agent与 FP16 或托管 frontier 模型对比模型卡明确指出该版本的这一弱项仓库级 run-test-repair eval 与失败成本 高流量企业推理同时 benchmark 1-bit、三值与 API单流速度无法预测并发吞吐与运维成本每个成功任务的成本、SLO、冗余和 fallback 本文只负责回答 Bonsai 的具体部署问题。更广泛的模型家族选择，请查看我们的 2026 开放权重 LLM 对比。硬件与 API 的财务决策，请使用本地模型与",
  "articleSection": "工程",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "Bonsai 27B",
      "url": "https://prismml.com/news/bonsai-27b"
    },
    {
      "@type": "WebPage",
      "name": "Qwen3.6-27B",
      "url": "https://huggingface.co/Qwen/Qwen3.6-27B"
    },
    {
      "@type": "WebPage",
      "name": "1-bit 版本",
      "url": "https://huggingface.co/prism-ml/Bonsai-27B-gguf"
    },
    {
      "@type": "WebPage",
      "name": "三值版本",
      "url": "https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf"
    },
    {
      "@type": "WebPage",
      "name": "PrismML 当前兼容性矩阵",
      "url": "https://github.com/PrismML-Eng/Bonsai-demo"
    },
    {
      "@type": "WebPage",
      "name": "公开 benchmark 仓库",
      "url": "https://github.com/ArmanJR/PrismML-Bonsai-vs-Qwen3.5-Benchmark"
    },
    {
      "@type": "WebPage",
      "name": "Joshua Lochner 的 Hugging Face Space",
      "url": "https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels"
    }
  ],
  "dateModified": "2026-08-11",
  "datePublished": "2026-07-16",
  "description": "Bonsai 27B 把 Qwen3.6-27B 二值语言权重压到约 3.9 GB，PrismML 报告在 iPhone 17 Pro Max 上达到约 11 token/s。厂商平均保留率为 FP16 的 89.5%；一项独立的 98 问小型测试中，1-bit 为 82.9%，三值版 86.2%，Qwen3.6 为 94.2%。二值 Q1_0 已可在 llama.cpp 主线使用 CPU、Metal、CUDA 和 Vulkan。三值版的 7.17 GB group-128 文件仍需 PrismML fork，7.59 GB group-64 文件则已支持这些主线 backend。Bonsai 很适合试点，但生产仍需固定产物、测量完整峰值内存并评测真实任务。",
  "headline": "Bonsai 27B 评测：270 亿参数 LLM 真的能在手机上运行吗？",
  "image": "https://wavect.io/img/blog/headers/header_bonsai-27b-phone-local-ai-review.svg",
  "inLanguage": "zh",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/zh/blog/bonsai-27b-phone-local-ai-review/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/zh/blog/bonsai-27b-phone-local-ai-review/",
  "wordCount": 810
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/",
      "name": "首页",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/overview/",
      "name": "博客概览",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/topics/ai-agents/",
      "name": "AI 与智能体",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/clusters/models-infrastructure/",
      "name": "模型与基础设施",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/bonsai-27b-phone-local-ai-review/",
      "name": "Bonsai 27B 评测：手机本地运行 1-bit LLM | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Bonsai 27B 是 PrismML 基于 Qwen3.6-27B 推出的二值与三值 low-bit 模型家族。1-bit 语言权重约 3.9 GB。三值表示的理想目标为 5.9 GB；当前 GGUF 的 group-128 文件为 7.17 GB，兼容主线的 group-64 文件为 7.59 GB。"
      },
      "name": "Bonsai 27B 是什么？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "PrismML 报告其通过 MLX Swift 在 iPhone 17 Pro Max 上达到约每秒 11 token。该结果对应特定高端手机和 runtime，权重、上下文、运行开销与可选视觉组件都要计入真实内存预算。"
      },
      "name": "Bonsai 27B 能在 iPhone 上运行吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "二值语言权重使用一个符号位，再让每 128 个权重共享一个 FP16 scale，因此实际为每权重 1.125 bit。少量辅助 tensor 保持更高精度，可选视觉组件使用 4-bit HQQ。"
      },
      "name": "Bonsai 27B 真的是 1-bit 模型吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "PrismML 自己的 15 项平均分为 89.5%。一项独立的 98 问小型测试中，1-bit 为 82.9%，三值版为 86.2%，Qwen3.6 为 94.2%。最终仍需使用自己的业务任务评测。"
      },
      "name": "Bonsai 27B 保留了 Qwen3.6 的 90% 质量吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Hugging Face 模型卡标注 Apache 2.0。商业团队仍应固定具体产物、保留 notice、审查上游和依赖许可证，并确认数据与计划用途满足所有义务。"
      },
      "name": "Bonsai 27B 可以商用吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "如果手机级体积是硬约束，先测试 1-bit。如果有笔记本级内存且更重视质量，先测试三值版。最终选择应由你的业务 eval 决定，而不是厂商平均分。"
      },
      "name": "应该选择 1-bit 还是三值版？"
    }
  ]
}
```
