---
title: "Bonsai 27B Test: 1-Bit-LLM auf dem Smartphone"
canonical: https://wavect.io/de/blog/bonsai-27b-phone-local-ai-review/
language: de
description: "Läuft Bonsai 27B wirklich auf einem Smartphone? Größe, Speicher, Benchmarks, WebGPU-Speed, Grenzen, Varianten und Pilot-Checkliste im Faktencheck."
image: "https://wavect.io/img/general/bak/open_graph_preview.jpg"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

13 min Lesezeit · 16. Juli 2026 Zuletzt geprüft 11. August 2026

[**Weiter**](/de/blog/soofi-s-european-sovereign-llm/)

# Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?

TL;DR

Bonsai 27B bringt binäre Qwen3.6-27B-Sprachgewichte auf rund 3,9 GB und erreicht laut PrismML etwa 11 Token pro Sekunde auf einem iPhone 17 Pro Max. Der 1-Bit-Herstellerdurchschnitt liegt bei 89,5 Prozent von FP16; ein unabhängiger kleiner 98-Fragen-Test erreichte 82,9 Prozent für 1-Bit, 86,2 Prozent für Ternary und 94,2 Prozent für Qwen3.6. Binäres Q1_0 läuft in llama.cpp Mainline auf CPU, Metal, CUDA und Vulkan. Bei Ternary braucht die 7,17-GB-Group-128-Datei weiter PrismMLs Fork, während die 7,59-GB-Group-64-Datei jetzt auf diesen Mainline-Backends läuft. Bonsai ist ein starker Pilotkandidat, aber Produktion verlangt gepinnte Artefakte, vollständige Peak-Memory-Messungen und echte Aufgaben-Evals.

**Ja, ein Modell der 27B-Klasse kann jetzt auf einem Smartphone laufen. Die ehrliche Antwort braucht aber mehr Kontext als die Schlagzeile.** PrismML meldet für die rund 3,9 GB großen 1-Bit-Sprachgewichte etwa 11 Token pro Sekunde auf einem iPhone 17 Pro Max. Bonsai 27B basiert auf Qwen3.6-27B und steht laut Modellkarte unter Apache 2.0. Das ist ein echter Meilenstein für lokale KI, aber kein Beweis, dass jeder 27B-Workload bequem auf jedem Smartphone läuft.

Auch der Qualitätserhalt ist differenziert zu lesen. Im eigenen 15-Benchmark-Test von PrismML erreicht die 1-Bit-Variante 89,5 Prozent des FP16-Durchschnitts. Mathematik und Coding halten sich besser als Instruction Following, Vision und mehrstufige Tool-Nutzung. Die Ternary-Variante erreicht 94,6 Prozent. Ihr Group-128-GGUF belegt rund 7,17 GB, die Mainline-kompatible Group-64-Datei rund 7,59 GB. Beide sind größer als die oft genannte ideale Repräsentationsgröße von 5,9 GB.

| Frage | Verifizierte Antwort | Kommerzielle Bedeutung |
| --- | --- | --- |
| Läuft es auf einem Smartphone? | PrismML meldet rund 11 tok/s auf dem iPhone 17 Pro Max via MLX Swift | Interaktive lokale Textgenerierung ist auf einem aktuellen High-End-Gerät möglich |
| Sind es wirklich 3,9 GB? | Ja, für die residenten 1-Bit-Sprachgewichte | Runtime, Context Cache und optionale Vision-Komponenten brauchen zusätzlichen Speicher |
| Bleiben 90 Prozent erhalten? | 89,5 Prozent des FP16-Aggregats im herstellereigenen Test | Die Verluste sind ungleich verteilt, deshalb bleibt ein eigenes Eval Pflicht |
| Hat Ternary 5,9 GB? | 5,9 GB ideal, 7,17 GB als Group-128-Fork-Datei oder 7,59 GB als Group-64-Mainline-Datei | Plane mit dem exakten Artefakt, nicht mit dem theoretischen Ziel |
| Ist es produktionsreif? | Vielversprechend, aber mit Custom Runtimes und klaren Einschränkungen | Agenten, Vision und Long Context zuerst kontrolliert pilotieren |

## Was ist Bonsai 27B?

[Bonsai 27B](https://prismml.com/news/bonsai-27b) ist PrismMLs Low-Bit-Version von [Qwen3.6-27B](https://huggingface.co/Qwen/Qwen3.6-27B). Das dichte multimodale Modell hat einen 27B-Sprach-Backbone, einen Vision Encoder und ein natives Kontextfenster von 262.144 Token. Qwen nutzt in den meisten Blöcken lineare Attention und nur in 16 von 64 Blöcken volle Attention. Dadurch wächst der KV Cache langsamer als bei einem klassischen reinen Attention-Modell.

PrismML veröffentlicht zwei Varianten. Das [1-Bit-Modell](https://huggingface.co/prism-ml/Bonsai-27B-gguf) speichert binäre Gewichte aus {−1, +1} und teilt pro 128 Gewichten einen FP16-Skalierungsfaktor. Daraus entstehen 1,125 effektive Bit pro Gewicht und rund 3,9 GB Sprachgewichte. Das [Ternary-Modell](https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf) ergänzt den Wert null und verwendet {−1, 0, +1}. Seine 1,71 effektiven Bit pro Gewicht kaufen mehr Qualität mit mehr Speicher.

Das geht tiefer als ein normaler nachträglicher 1-Bit-Export. Laut PrismML ziehen sich die niedrigen Bitbreiten durch Embeddings, Attention-Projektionen, MLP-Projektionen und den Language-Model-Head. Angepasste CUDA-, Metal-, MLX- und WebGPU-Kernel verarbeiten die gepackten Gewichte direkt, statt sie für jede Operation wieder auf FP16 aufzublasen.

Der praktische Runtime-Status hat sich verbessert. [PrismMLs aktuelle Kompatibilitätsmatrix](https://github.com/PrismML-Eng/Bonsai-demo) nennt binäres `Q1_0` als in llama.cpp Mainline auf CPU, Metal, CUDA und Vulkan verfügbar. Bei Ternary zählt die konkrete Datei: Das 7,17 GB große Group-128-`*-Q2_0.gguf` braucht weiter PrismMLs Fork, während das 7,59 GB große Group-64-`*-Q2_0_g64.gguf` jetzt in Mainline auf CPU, Metal, CUDA und Vulkan läuft. Die experimentellen `PQ2_0`-Dateien sind noch kein stabiles Deployment-Ziel. Teams sollten Modellartefakt und Runtime-Revision gemeinsam pinnen.

Ein unabhängiger Community-Test mit 98 Fragen auf Jetson Orin relativiert zugleich die Herstelleraggregate: Dort erreichte Bonsai 1-Bit 82,9 Prozent, Ternary 86,2 Prozent und Qwen3.6-27B 94,2 Prozent. Der Test ist klein und kein universeller Qualitätsbeweis, bestätigt aber die Rangfolge und zeigt, warum ein eigenes Aufgaben-Eval wichtiger ist als ein einzelner Retention-Prozentsatz. Methodik und Rohdaten liegen im [öffentlichen Benchmark-Repository](https://github.com/ArmanJR/PrismML-Bonsai-vs-Qwen3.5-Benchmark).

## Wie schrumpft ein 27B-Modell von 54 GB auf 3,9 GB?

Die FP16-Rechnung ist einfach: Rund 27,3 Milliarden Sprachparameter mal zwei Byte ergeben etwa 54 GB, noch ohne Runtime-Overhead. Das Binärmodell speichert ein Vorzeichen-Bit pro Gewicht sowie einen gemeinsamen 16-Bit-Scale für jeweils 128 Gewichte. Das ergibt 1,125 Bit pro Gewicht und ungefähr den Faktor 14,2 gegenüber FP16.

Die Download-Größe ist nicht der gesamte Speicherbedarf:

- **Sprachgewichte:** rund 3,9 GB für 1-Bit, 7,17 GB für die Ternary-Group-128-Fork-Datei oder 7,59 GB für die Group-64-Mainline-Datei.
- **Runtime und Activations:** die veröffentlichten Messungen enthalten rund 1,3 GB über die Backends hinweg.
- **KV Cache:** wächst mit dem aktiven Kontext. Selbst mit 4-Bit-KV-Kompression erreicht das volle 262K-Fenster beim 1-Bit-Modell rund 9,4 GB Peak Memory.
- **Optionale Komponenten:** die kompakte Vision-Projektion belegt etwa 0,63 GB. Auch der Speculative-Decoding-Drafter kostet zusätzlichen Speicher.

Für ein Produkt heißt das: Die Modellgewichte können ins App-Budget passen, während das maximale Kontextfenster nicht hineinpasst. Kapazitätsplanung muss Gewichte, echten Kontext und Runtime gemeinsam auf dem Zielgerät messen.

## Behält Bonsai 27B wirklich 90 Prozent der Qwen3.6-Intelligenz?

**Es behält 89,5 Prozent eines herstellereigenen Benchmark-Durchschnitts, nicht 90 Prozent jeder Fähigkeit.** PrismML testete die Varianten im Thinking Mode mit EvalScope und vLLM auf derselben H100-Infrastruktur. Die identischen Bedingungen machen den Vergleich nützlich. Unabhängig reproduziert ist er noch nicht, und der Durchschnitt verdeckt deutliche Unterschiede.

| Fähigkeit | Qwen3.6 FP16 | Ternary | 1-Bit | Einordnung |
| --- | --- | --- | --- | --- |
| Mathematik | 95,33 | 93,40 | 91,66 | Starker Erhalt im veröffentlichten Test |
| Coding | 88,74 | 85,96 | 81,88 | Gut für begrenzte Aufgaben, kein Beleg für autonome Repository-Arbeit |
| Wissen und Reasoning | 83,15 | 76,96 | 73,39 | Spürbarer Trade-off |
| Instruction Following | 78,47 | 71,77 | 65,74 | Formate, Constraints und Refusals genau testen |
| Agentische Tool-Nutzung | 80,00 | 74,01 | 66,03 | Mehrstufige Zuverlässigkeit ist ein echtes Risiko |
| Vision | 72,61 | 65,19 | 59,57 | Der Text-Footprint sagt wenig über multimodale Qualität |

Die Einzelwerte zeigen das Problem. Beim 1-Bit-Modell fällt MATH-500 nur von 99,40 auf 98,00 und BFCL v3 von 77,10 auf 70,72. Das schwierigere mehrstufige τ²-Bench sinkt aber von 82,90 auf 61,34, IFBench von 68,03 auf 52,36 und MMMU-Pro von 79,94 auf 60,48. Genau in langen Agent-Loops können kleine Fehler dadurch schnell kumulieren.

Die Modellkarte nennt langfristiges, mehrdateibasiertes Agentic Coding selbst als noch schwaches Ziel dieses Releases. Für eine Kaufentscheidung ist dieser Hinweis wichtiger als das gerundete 90-Prozent-Label.

## Läuft Bonsai 27B wirklich lokal auf Smartphone und Laptop?

**Ja, auf unterstützter High-End-Hardware und mit passender Runtime.** PrismML meldet etwa 11 tok/s für MLX Swift auf dem iPhone 17 Pro Max. Beim 1-Bit-GGUF nennt llama-bench 26,0 tok/s auf M4 Pro, 44,2 auf M5 Pro und 66,4 auf M5 Max für die Generierung von 128 Token. Das Ternary-GGUF liegt auf denselben Laptopklassen bei 18,0, 26,2 und 44,0 tok/s.

Diese Zahlen sind nicht austauschbar. Smartphone, Metal, CUDA und WebGPU nutzen andere Kernel, Kontextlängen, Power Limits und Messprotokolle. Prompt Processing und Token Generation sind außerdem verschiedene Phasen. Schnelles Decoding garantiert bei langen Dokumenten keine kurze Time to First Token.

## Was belegt die WebGPU-Demo tatsächlich?

[Joshua Lochners Hugging-Face-Demo](https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels) bestätigt den entscheidenden Teil: Bonsai 27B läuft lokal im Browser über angepasste WGSL-Compute-Shader. Die Seite nennt Fable 5 und GPT 5.6 Sol als Autoren und Optimierer der Kernel, die vor der Aufnahme auf Korrektheit und konkrete Tensorformen getestet wurden. Nach dem Download bleiben Modell und Unterhaltung lokal.

Die öffentliche Demo nennt keinen hardwarespezifischen Durchsatz und kein reproduzierbares Testprotokoll. Behandle Browser-Speed-Claims als Demonstration, nicht als fixe Kapazität. Für den Einkauf misst du Browser, GPU, Energiemodus, Promptlänge, Outputlänge, First-Token-Latenz, dauerhaftes Decoding, Peak Memory und Thermal Throttling über mehrere Durchläufe.

## Wo kann Bonsai 27B kommerziellen Wert schaffen?

- **Private Dokumentenassistenten:** sensible lokale Dateien zusammenfassen, klassifizieren oder extrahieren, ohne sie an eine Modell-API zu senden.
- **Offline-Software im Feld:** Techniker, Prüfer oder mobile Teams auch bei instabiler Verbindung unterstützen.
- **On-Device-Produktfeatures:** Textassistenz mit planbarer lokaler Latenz und ohne laufende Token-Kosten bereitstellen.
- **Hybrides Routing:** private, begrenzte Schritte lokal ausführen und schwieriges Reasoning oder fragile Tool-Flows an ein stärkeres Cloud-Modell übergeben.
- **Piloten auf einer Maschine:** 27B-Klasse auf Laptop oder kleiner GPU evaluieren, bevor ein Inference-Cluster beschafft wird.

Der Geschäftswert kommt weiterhin aus dem System um das Modell. Unser [AI Enablement](/de/services/ai-enablement/) umfasst Use-Case-Auswahl, Evals, Datenzugriff, Routing, Deployment, Observability und Übergabe. Die [Twinsoft AI Case Study](/de/case-studies/twinsoft-ai/) zeigt, warum der produktive Workflow und seine Kontrollen mehr zählen als die Parameterzahl.

## Welche Bonsai-27B-Variante sollte ein Unternehmen wählen?

| Workload | Startpunkt | Warum? | Gate vor Produktion |
| --- | --- | --- | --- |
| Lokale Offline-Textfeatures am Smartphone | 1-Bit MLX | Für das Phone-Class-Memory-Budget ausgelegt | Thermik, Peak Memory, Akku und Aufgabenqualität am Zielgerät |
| Privater Assistent am Laptop | Ternary, wenn der Speicher reicht | Besserer Erhalt bei Instructions, Tools und Vision | Die 7,17-GB-Fork-Datei oder 7,59-GB-Mainline-Datei mit echtem Kontext messen |
| Long-Horizon Coding Agent | Mit FP16 oder Managed Frontier vergleichen | Die Modellkarte nennt dies als schwaches Ziel | Repository-Eval mit Run, Test, Repair und Fehlerkosten |
| Enterprise-Serving mit hohem Volumen | 1-Bit, Ternary und API benchmarken | Single-Stream-Speed sagt wenig über Concurrency und Ops | Kosten pro erfolgreiche Aufgabe, SLO, Redundanz und Fallback |

Dieser Artikel beantwortet bewusst nur die Bonsai-spezifische Deployment-Frage. Für die breitere Modellfamilien-Auswahl dient unser [Open-Weight-LLM-Vergleich 2026](/de/blog/open-weight-llm-comparison-2026/). Für die Infrastrukturkosten nutzt du den [Break-even-Rechner für lokale Modelle und APIs](/de/blog/local-models-vs-apis-break-even-eu-2026/). So konkurriert ein Produktreview nicht mit Marktvergleich und Wirtschaftlichkeitsrechnung.

## Was muss ein Bonsai-27B-Pilot messen?

1. **Artefakt und Runtime einfrieren:** Hugging-Face-Revision, Hash, Backend-Fork, Kernel-Commit, Gerät, OS und MLX- oder Browser-Version dokumentieren.
2. **Gesamten Speicher messen:** Gewichte, Runtime, erwarteten Kontext, KV-Format, Vision-Projektion und optionalen Drafter einschließen.
3. **Eigenes Eval bauen:** mindestens 50 bis 100 reale Aufgaben mit Format-Constraints, Tool-Schemas, Refusals und unzulässigen Fehlern.
4. **Latenzphasen trennen:** Time to First Token, Prompt Processing, dauerhaftes Decoding und wiederholte warme Runs messen.
5. **Offline- und Privacy-Grenzen prüfen:** Model Fetch, Analytics, Crash Reporting, Logs, Embeddings und Fallbacks kontrollieren.
6. **Erfolgreiche Outcomes bepreisen:** Gerätesupport, Engineering, Update-Verteilung, Monitoring und Fallback gegen eine API rechnen.
7. **Rollback planen:** ein bewährtes Modell und eine Server-Route für inkompatible Geräte, Überlast oder Qualitätsfehler behalten.

Unser [Leitfaden zur Tech-Stack-Auswahl fürs MVP](/de/software-development-guide/how-to-choose-a-tech-stack-for-mvp/) folgt derselben Regel: Entscheide zuerst nach dem Constraint, das später teuer umkehrbar ist. Bei On-Device-KI sind das meist die unterstützte Hardware-Untergrenze und die Qualität des kritischsten Workflows, nicht die Download-Größe.

## Häufige Fragen zu Bonsai 27B

### Was ist Bonsai 27B?

Bonsai 27B ist PrismMLs binäre und ternäre Low-Bit-Modellfamilie auf Basis von Qwen3.6-27B. Die 1-Bit-Sprachgewichte belegen rund 3,9 GB. Ternary zielt ideal auf 5,9 GB; aktuelle GGUF-Dateien brauchen 7,17 GB für Group 128 oder 7,59 GB für das Mainline-kompatible Group-64-Paket.

### Kann Bonsai 27B auf einem iPhone laufen?

PrismML meldet rund 11 Token pro Sekunde auf einem iPhone 17 Pro Max mit MLX Swift. Das gilt für ein unterstütztes High-End-Gerät und eine bestimmte Runtime. Gewichte, Kontext, Runtime und optionale Vision-Komponenten zählen zum echten App-Budget.

### Ist Bonsai 27B wirklich ein 1-Bit-Modell?

Die binären Sprachgewichte nutzen ein Vorzeichen-Bit plus einen FP16-Scale je 128 Gewichte, also 1,125 effektive Bit pro Gewicht. Kleine Hilfstensoren bleiben höherpräzise, die optionale Vision-Komponente verwendet 4-Bit HQQ.

### Behält Bonsai 27B 90 Prozent der Qwen3.6-Qualität?

Im herstellereigenen Durchschnitt über 15 Thinking-Mode-Benchmarks erreicht es 89,5 Prozent von Qwen3.6-27B FP16. Ein unabhängiger kleiner 98-Fragen-Test kam für 1-Bit auf 82,9 Prozent, Ternary auf 86,2 Prozent und Qwen3.6 auf 94,2 Prozent. Das eigene Aufgaben-Eval bleibt entscheidend.

### Darf Bonsai 27B kommerziell genutzt werden?

Die Modellkarten nennen Apache 2.0. Unternehmen sollten trotzdem die genaue Revision pinnen, Hinweise beibehalten, Upstream- und Dependency-Lizenzen prüfen und den geplanten Einsatz rechtlich freigeben.

### Soll ich 1-Bit oder Ternary wählen?

Wähle 1-Bit, wenn der Phone-Class-Footprint das harte Limit ist. Wähle Ternary, wenn Laptop-Speicher vorhanden ist und Qualität wichtiger ist. Entscheidend ist der Vergleich auf deinem eigenen Eval.

## Fazit

Bonsai 27B ist ein echter Systems-Meilenstein: PrismML bringt Sprachgewichte der 27B-Klasse in ein 3,9-GB-Paket und demonstriert interaktive Inferenz auf einem High-End-Smartphone. Dadurch werden neue private, offlinefähige und hybride Produktarchitekturen technisch möglich.

Die Engineering-Entscheidung verschwindet nicht. Die 90 Prozent sind ein herstellereigener Durchschnitt, mehrere Agenten-Fähigkeiten verlieren deutlich, und Ternary braucht je nach Runtime 7,17 oder 7,59 GB. Das volle Kontextfenster passt ebenfalls nicht in die Smartphone-Schlagzeile. Behandle Bonsai als starken Pilotkandidaten. Pinne Artefakt und Runtime gemeinsam, miss Peak Memory, teste echte Aufgaben und vergleiche Kosten pro erfolgreichem Outcome, bevor das Modell zur Produktionsabhängigkeit wird.

## Das könnte dich auch interessieren..

[**Wann lokale Modelle APIs schlagen** Berechne den echten Break-even aus GPU-Auslastung, Engineering, Eval-Pflege, Datenresidenz und API-Alternativen.](/de/blog/local-models-vs-apis-break-even-eu-2026/) [**AI Enablement vs generische KI-Beratung** Eine Modelldemo beweist Machbarkeit. Produktion braucht Evals, Routing, Deployment, Observability und ein Team, das den Stack übernehmen kann.](/de/compare/ai-enablement-vs-generic-ai-consultancy/)

Modelle und Infrastruktur

## In diesem Cluster weiterlesen

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

[Mit dem Grundlagenartikel starten**LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen**](/de/blog/self-hosting-llms-eu-cost/)

- [FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?](/de/blog/freetoken-ai-inference-engine-review/)
- [Darkbloom AI Test: Private Inferenz auf freien Macs](/de/blog/darkbloom-ai-private-inference-mac/)
- [Ox Alpha Free: Setup, Datenschutz und Kaufleitfaden](/de/blog/ox-alpha-free-ai-model-guide-2026/)
- [Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?](/de/blog/pika-audio-models-api-pricing-2026/)
- [Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden](/de/blog/thunder-compute-gpu-virtualization-series-a/)

Postfach, ohne Lärm

## Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

13 min Lesezeit · 16. Juli 2026 Zuletzt geprüft 11. August 2026

[**Weiter**](/de/blog/soofi-s-european-sovereign-llm/)

Neue Beiträge per E-Mail ×

×

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/bonsai-27b-phone-local-ai-review/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-16",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-16",
      "url": "https://wavect.io/de/blog/bonsai-27b-phone-local-ai-review/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Bonsai 27B bringt binäre Qwen3.6-27B-Sprachgewichte auf rund 3,9 GB und erreicht laut PrismML etwa 11 Token pro Sekunde auf einem iPhone 17 Pro Max. Der 1-Bit-Herstellerdurchschnitt liegt bei 89,5 Prozent von FP16; ein unabhängiger kleiner 98-Fragen-Test erreichte 82,9 Prozent für 1-Bit, 86,2 Prozent für Ternary und 94,2 Prozent für Qwen3.6. Binäres Q1_0 läuft in llama.cpp Mainline auf CPU, Metal, CUDA und Vulkan. Bei Ternary braucht die 7,17-GB-Group-128-Datei weiter PrismMLs Fork, während die 7,59-GB-Group-64-Datei jetzt auf diesen Mainline-Backends läuft. Bonsai ist ein starker Pilotkandidat, aber Produktion verlangt gepinnte Artefakte, vollständige Peak-Memory-Messungen und echte Aufgaben-Evals.",
  "articleBody": " Blog-Übersicht/AI und Agents/Modelle und Infrastruktur Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone? TL;DR Bonsai 27B bringt binäre Qwen3.6-27B-Sprachgewichte auf rund 3,9 GB und erreicht laut PrismML etwa 11 Token pro Sekunde auf einem iPhone 17 Pro Max. Der 1-Bit-Herstellerdurchschnitt liegt bei 89,5 Prozent von FP16; ein unabhängiger kleiner 98-Fragen-Test erreichte 82,9 Prozent für 1-Bit, 86,2 Prozent für Ternary und 94,2 Prozent für Qwen3.6. Binäres Q1_0 läuft in llama.cpp Mainline auf CPU, Metal, CUDA und Vulkan. Bei Ternary braucht die 7,17-GB-Group-128-Datei weiter PrismMLs Fork, während die 7,59-GB-Group-64-Datei jetzt auf diesen Mainline-Backends läuft. Bonsai ist ein starker Pilotkandidat, aber Produktion verlangt gepinnte Artefakte, vollständige Peak-Memory-Messungen und echte Aufgaben-Evals. Ja, ein Modell der 27B-Klasse kann jetzt auf einem Smartphone laufen. Die ehrliche Antwort braucht aber mehr Kontext als die Schlagzeile. PrismML meldet für die rund 3,9 GB großen 1-Bit-Sprachgewichte etwa 11 Token pro Sekunde auf einem iPhone 17 Pro Max. Bonsai 27B basiert auf Qwen3.6-27B und steht laut Modellkarte unter Apache 2.0. Das ist ein echter Meilenstein für lokale KI, aber kein Beweis, dass jeder 27B-Workload bequem auf jedem Smartphone läuft. Auch der Qualitätserhalt ist differenziert zu lesen. Im eigenen 15-Benchmark-Test von PrismML erreicht die 1-Bit-Variante 89,5 Prozent des FP16-Durchschnitts. Mathematik und Coding halten sich besser als Instruction Following, Vision und mehrstufige Tool-Nutzung. Die Ternary-Variante erreicht 94,6 Prozent. Ihr Group-128-GGUF belegt rund 7,17 GB, die Mainline-kompatible Group-64-Datei rund 7,59 GB. Beide sind größer als die oft genannte ideale Repräsentationsgröße von 5,9 GB. Bonsai 27B in einer Minute, geprüft am 11. August 2026 FrageVerifizierte AntwortKommerzielle Bedeutung Läuft es auf einem Smartphone?PrismML meldet rund 11 tok/s auf dem iPhone 17 Pro Max via MLX SwiftInteraktive lokale Textgenerierung ist auf einem aktuellen High-End-Gerät möglich Sind es wirklich 3,9 GB?Ja, für die residenten 1-Bit-SprachgewichteRuntime, Context Cache und optionale Vision-Komponenten brauchen zusätzlichen Speicher Bleiben 90 Prozent erhalten?89,5 Prozent des FP16-Aggregats im herstellereigenen TestDie Verluste sind ungleich verteilt, deshalb bleibt ein eigenes Eval Pflicht Hat Ternary 5,9 GB?5,9 GB ideal, 7,17 GB als Group-128-Fork-Datei oder 7,59 GB als Group-64-Mainline-DateiPlane mit dem exakten Artefakt, nicht mit dem theoretischen Ziel Ist es produktionsreif?Vielversprechend, aber mit Custom Runtimes und klaren EinschränkungenAgenten, Vision und Long Context zuerst kontrolliert pilotieren Was ist Bonsai 27B? Bonsai 27B ist PrismMLs Low-Bit-Version von Qwen3.6-27B. Das dichte multimodale Modell hat einen 27B-Sprach-Backbone, einen Vision Encoder und ein natives Kontextfenster von 262.144 Token. Qwen nutzt in den meisten Blöcken lineare Attention und nur in 16 von 64 Blöcken volle Attention. Dadurch wächst der KV Cache langsamer als bei einem klassischen reinen Attention-Modell. PrismML veröffentlicht zwei Varianten. Das 1-Bit-Modell speichert binäre Gewichte aus {−1, +1} und teilt pro 128 Gewichten einen FP16-Skalierungsfaktor. Daraus entstehen 1,125 effektive Bit pro Gewicht und rund 3,9 GB Sprachgewichte. Das Ternary-Modell ergänzt den Wert null und verwendet {−1, 0, +1}. Seine 1,71 effektiven Bit pro Gewicht kaufen mehr Qualität mit mehr Speicher. Das geht tiefer als ein normaler nachträglicher 1-Bit-Export. Laut PrismML ziehen sich die niedrigen Bitbreiten durch Embeddings, Attention-Projektionen, MLP-Projektionen und den Language-Model-Head. Angepasste CUDA-, Metal-, MLX- und WebGPU-Kernel verarbeiten die gepackten Gewichte direkt, statt sie für jede Operation wieder auf FP16 aufzublasen. Der praktische Runtime-Status hat sich verbessert. PrismMLs aktuelle Kompatibilitätsmatrix nennt binäres Q1_0 als in llama.cpp Mainline auf CPU, Metal, CUDA und Vulkan verfügbar. Bei Ternary zählt die konkrete Datei: Das 7,17 GB große Group-128-*-Q2_0.gguf braucht weiter PrismMLs Fork, während das 7,59 GB große Group-64-*-Q2_0_g64.gguf jetzt in Mainline auf CPU, Metal, CUDA und Vulkan läuft. Die experimentellen PQ2_0-Dateien sind noch kein stabiles Deployment-Ziel. Teams sollten Modellartefakt und Runtime-Revision gemeinsam pinnen. Ein unabhängiger Community-Test mit 98 Fragen auf Jetson Orin relativiert zugleich die Herstelleraggregate: Dort erreichte Bonsai 1-Bit 82,9 Prozent, Ternary 86,2 Prozent und Qwen3.6-27B 94,2 Prozent. Der Test ist klein und kein universeller Qualitätsbeweis, bestätigt aber die Rangfolge und zeigt, warum ein eigenes Aufgaben-Eval wichtiger ist als ein einzelner Retention-Prozentsatz. Methodik und Rohdaten liegen im öffentlichen Benchmark-Repository. Wie schrumpft ein 27B-Modell von 54 GB auf 3,9 GB? Die FP16-Rechnung ist einfach: Rund 27,3 Milliarden Sprachparameter mal zwei Byte ergeben etwa 54 GB, noch ohne Runtime-Overhead.",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "Bonsai 27B",
      "url": "https://prismml.com/news/bonsai-27b"
    },
    {
      "@type": "WebPage",
      "name": "Qwen3.6-27B",
      "url": "https://huggingface.co/Qwen/Qwen3.6-27B"
    },
    {
      "@type": "WebPage",
      "name": "1-Bit-Modell",
      "url": "https://huggingface.co/prism-ml/Bonsai-27B-gguf"
    },
    {
      "@type": "WebPage",
      "name": "Ternary-Modell",
      "url": "https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf"
    },
    {
      "@type": "WebPage",
      "name": "PrismMLs aktuelle Kompatibilitätsmatrix",
      "url": "https://github.com/PrismML-Eng/Bonsai-demo"
    },
    {
      "@type": "WebPage",
      "name": "öffentlichen Benchmark-Repository",
      "url": "https://github.com/ArmanJR/PrismML-Bonsai-vs-Qwen3.5-Benchmark"
    },
    {
      "@type": "WebPage",
      "name": "Joshua Lochners Hugging-Face-Demo",
      "url": "https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels"
    }
  ],
  "dateModified": "2026-08-11",
  "datePublished": "2026-07-16",
  "description": "Bonsai 27B bringt binäre Qwen3.6-27B-Sprachgewichte auf rund 3,9 GB und erreicht laut PrismML etwa 11 Token pro Sekunde auf einem iPhone 17 Pro Max. Der 1-Bit-Herstellerdurchschnitt liegt bei 89,5 Prozent von FP16; ein unabhängiger kleiner 98-Fragen-Test erreichte 82,9 Prozent für 1-Bit, 86,2 Prozent für Ternary und 94,2 Prozent für Qwen3.6. Binäres Q1_0 läuft in llama.cpp Mainline auf CPU, Metal, CUDA und Vulkan. Bei Ternary braucht die 7,17-GB-Group-128-Datei weiter PrismMLs Fork, während die 7,59-GB-Group-64-Datei jetzt auf diesen Mainline-Backends läuft. Bonsai ist ein starker Pilotkandidat, aber Produktion verlangt gepinnte Artefakte, vollständige Peak-Memory-Messungen und echte Aufgaben-Evals.",
  "headline": "Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?",
  "image": "https://wavect.io/img/blog/headers/header_bonsai-27b-phone-local-ai-review.svg",
  "inLanguage": "de",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/bonsai-27b-phone-local-ai-review/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/bonsai-27b-phone-local-ai-review/",
  "wordCount": 2147
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/models-infrastructure/",
      "name": "Modelle und Infrastruktur",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/bonsai-27b-phone-local-ai-review/",
      "name": "Bonsai 27B Test: 1-Bit-LLM auf dem Smartphone | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Bonsai 27B ist PrismMLs binäre und ternäre Low-Bit-Modellfamilie auf Basis von Qwen3.6-27B. Die 1-Bit-Sprachgewichte belegen rund 3,9 GB. Ternary zielt ideal auf 5,9 GB; aktuelle GGUF-Dateien brauchen 7,17 GB für Group 128 oder 7,59 GB für das Mainline-kompatible Group-64-Paket."
      },
      "name": "Was ist Bonsai 27B?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "PrismML meldet rund 11 Token pro Sekunde auf einem iPhone 17 Pro Max mit MLX Swift. Das gilt für ein unterstütztes High-End-Gerät und eine bestimmte Runtime. Gewichte, Kontext, Runtime und optionale Vision-Komponenten zählen zum echten App-Budget."
      },
      "name": "Kann Bonsai 27B auf einem iPhone laufen?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Die binären Sprachgewichte nutzen ein Vorzeichen-Bit plus einen FP16-Scale je 128 Gewichte, also 1,125 effektive Bit pro Gewicht. Kleine Hilfstensoren bleiben höherpräzise, die optionale Vision-Komponente verwendet 4-Bit HQQ."
      },
      "name": "Ist Bonsai 27B wirklich ein 1-Bit-Modell?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Im herstellereigenen Durchschnitt über 15 Thinking-Mode-Benchmarks erreicht es 89,5 Prozent von Qwen3.6-27B FP16. Ein unabhängiger kleiner 98-Fragen-Test kam für 1-Bit auf 82,9 Prozent, Ternary auf 86,2 Prozent und Qwen3.6 auf 94,2 Prozent. Das eigene Aufgaben-Eval bleibt entscheidend."
      },
      "name": "Behält Bonsai 27B 90 Prozent der Qwen3.6-Qualität?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Die Modellkarten nennen Apache 2.0. Unternehmen sollten trotzdem die genaue Revision pinnen, Hinweise beibehalten, Upstream- und Dependency-Lizenzen prüfen und den geplanten Einsatz rechtlich freigeben."
      },
      "name": "Darf Bonsai 27B kommerziell genutzt werden?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Wähle 1-Bit, wenn der Phone-Class-Footprint das harte Limit ist. Wähle Ternary, wenn Laptop-Speicher vorhanden ist und Qualität wichtiger ist. Entscheidend ist der Vergleich auf deinem eigenen Eval."
      },
      "name": "Soll ich 1-Bit oder Ternary wählen?"
    }
  ]
}
```
