---
title: "Welches lokale LLM läuft bei dir? llmfit Guide"
canonical: https://wavect.io/de/blog/llmfit-local-llm-hardware-guide/
language: de
description: "Finde mit llmfit lokale LLMs für RAM, VRAM, CPU und Use Case. Verstehe MoE, Quantisierung, Speed-Schätzungen, Grenzen und Produktionstests."
image: "https://wavect.io/img/blog/headers/header_llmfit-local-llm-hardware-guide.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

11 min Lesezeit · 27. Juli 2026 Zuletzt geprüft 27. Juli 2026

[**Weiter**](/de/blog/lean-ctx-agency-experience/)

# Welches lokale LLM läuft auf deiner Hardware? llmfit Guide

TL;DR

llmfit ist ein kostenloses, MIT-lizenziertes Terminal-Tool. Es erkennt RAM, CPU und GPU-Speicher und bewertet Hunderte lokale Modelle nach Fit, geschätzter Geschwindigkeit, Qualität und Kontext. Nutze es vor dem Download, um Modell und Quantisierung für deine Hardware einzugrenzen. Das Ergebnis ist eine Planungsschätzung, keine Produktionsgarantie. Prüfe das gewählte Modell mit deiner echten Kontextlänge, Runtime, deinen Prompts, deiner Parallelität und der Modelllizenz, bevor du Hardware kaufst oder Self-Hosting fest einplanst.

**llmfit beantwortet die Frage, die vor jedem Download eines lokalen Modells kommen sollte: Was läuft auf diesem Rechner nicht nur irgendwie, sondern gut?** Das kostenlose Terminal-Tool erkennt RAM, CPU, GPU und VRAM. Danach bewertet es Hunderte Modelle nach Speicher-Fit, geschätzter Geschwindigkeit, Qualität und nutzbarem Kontext. Zusätzlich wählt es die hochwertigste Quantisierung, die voraussichtlich passt.

Das kann dir einen 20-GB-Download und einen verlorenen Nachmittag ersparen. Es beweist aber nicht, dass das Modell für deinen Use Case genau genug, passend lizenziert oder unter Produktionslast schnell genug ist. Nutze llmfit für die Shortlist und benchmarke diese anschließend mit deiner Runtime und deinem echten Workload.

## llmfit in 60 Sekunden

| Frage | Antwort | Bedeutung für deine Entscheidung |
| --- | --- | --- |
| Was ist llmfit? | Interaktive TUI und CLI für die Hardware-Dimensionierung lokaler LLMs | Du grenzt Modell und Quantisierung vor dem Download ein. |
| Was wird erkannt? | Verfügbarer RAM, CPU-Kerne, GPU, VRAM und Beschleunigungs-Backend | Die Empfehlung bezieht sich auf deinen Rechner statt auf eine allgemeine Speicherklasse. |
| Was wird bewertet? | Fit, geschätzte Geschwindigkeit, Qualität und Kontext | Das größte Modell landet nicht automatisch auf Platz eins. |
| Welche Systeme werden unterstützt? | Voller Support für Linux und Apple Silicon, eingeschränktere GPU-Erkennung unter Windows und Intel-Macs | Prüfe zuerst mit `llmfit system`, ob die Erkennung stimmt. |
| Welche Runtimes sind angebunden? | Ollama, llama.cpp, MLX, Docker Model Runner und LM Studio | Du kannst von der Empfehlung direkt zu Download und lokaler Runtime wechseln. |
| Versteht llmfit MoE? | Ja, das Tool trennt Gesamtparameter und aktive Parameter und modelliert Expert-Offloading | Mixtral- und DeepSeek-artige Modelle werden nicht wie dichte Modelle berechnet. |
| Ist llmfit kostenlos? | Ja, der Code steht unter der MIT-Lizenz | Die Lizenz jedes einzelnen Modells musst du trotzdem separat prüfen. |
| Garantiert der Score die Leistung? | Nein, er ist eine hardwarebezogene Schätzung | Teste echte Prompts, Kontext, Parallelität und Kaltstarts vor Produktion. |

## Installation und erste Empfehlung vor dem Modell-Download

Unter macOS und Linux ist Homebrew der einfachste Einstieg. Unter Windows funktioniert die Installation über Scoop. Wenn du `uv` nutzt, kannst du llmfit mit `uvx` einmalig ohne permanente Installation starten.

```
# macOS oder Linux
brew install llmfit

## Windows
scoop install llmfit

## Einmalig über uv starten
uvx llmfit
```

`llmfit` öffnet die interaktive Terminal-Oberfläche. Für einen reproduzierbaren Entscheidungsprozess sind diese CLI-Befehle besonders nützlich:

```
# Erkannte Hardware prüfen
llmfit system

## Fünf Empfehlungen für Coding als JSON
llmfit recommend --json --use-case coding --limit 5

## Annahmen für einen Kandidaten prüfen
llmfit info "MODELLNAME"

## Hardware für ein Modell mit 8K Kontext planen
llmfit plan "MODELLNAME" --context 8192 --json
```

Die offizielle [CLI- und Automatisierungsreferenz](https://github.com/AlexsJones/llmfit/blob/main/docs/cli.md) dokumentiert außerdem Hardware-Overrides, Kontextlimits und eine lokale REST API. Dadurch eignet sich llmfit auch für Skripte und Node Scheduling.

## Wie llmfit entscheidet, was passt

Zuerst erkennt llmfit das Beschleunigungs-Backend, zum Beispiel CUDA, Metal, ROCm, SYCL oder CPU. Danach vergleicht es jeden Katalogeintrag mit dem verfügbaren Speicher und einer Quantisierungshierarchie von Q8_0 bis Q2_K. Es versucht, die hochwertigste Quantisierung zu behalten, die passt. Reicht der Speicher beim vollen Kontext nicht, kann das Tool mit einem kürzeren Kontext neu rechnen.

| Score | Was er abbildet | Was er nicht abbildet |
| --- | --- | --- |
| Quality | Modellgröße, Ruf der Familie, Quantisierungsabzug und Use-Case-Fit | Deine Domänenqualität, Sprache, Safety und Tool-Calling-Tests |
| Speed | Geschätzte Tokens pro Sekunde aus Speicherbandbreite, Modellgröße und Laufmodus | Prompt-Verarbeitung, Batching, Thermik und Runtime-spezifische Kernel |
| Fit | Effiziente Speichernutzung mit bevorzugtem Puffer | Andere Prozesse, Display-Speicher und parallele Produktionsanfragen |
| Context | Angegebener Kontext im Verhältnis zum Ziel des Use Cases | Qualitätsverlust bei langem Kontext und den Wert deines tatsächlichen Kontexts |

Die Gewichtung ändert sich je nach Use Case. Coding kann ein kleineres Spezialmodell vor einen großen Generalisten setzen. Reasoning gewichtet Qualität stärker, Chat die Geschwindigkeit. Das ist nützlicher als eine Sortierung nach Parametern, bleibt aber eine Heuristik. Deine Abnahmetests entscheiden.

## Warum MoE-Support wichtig ist und was er nicht bedeutet

Mixture-of-Experts-Modelle veröffentlichen eine große Gesamtzahl an Parametern, aktivieren pro Token aber nur einen Teil des Netzes. Ein Rechner für dichte Modelle kann deshalb zu falschen Compute-Schlüssen kommen. llmfit liest MoE-Metadaten, berücksichtigt aktive Parameter und modelliert einen Pfad, bei dem aktive Experten im VRAM und inaktive Experten im RAM liegen.

Das bedeutet nicht, dass nur aktive Parameter Speicher brauchen. Die gesamten Gewichte müssen im Serving-Pfad verfügbar bleiben, meist in RAM, Storage oder beidem. Expert-Wechsel, CPU-Offload und PCIe-Verkehr beeinflussen die Geschwindigkeit. Die [veröffentlichte Scoring-Dokumentation](https://github.com/AlexsJones/llmfit/blob/main/docs/how-it-works.md) ist ein besserer Start als reine Parameterarithmetik. Der Runtime-Benchmark bleibt Pflicht.

## Quantisierung: Der beste Fit ist nicht immer das beste Produkt

Quantisierung senkt den Speicherbedarf durch Gewichte mit geringerer Präzision. llmfit geht seine Qualitätsstufen abwärts, bis eine Konfiguration passt. Für Experimente ist das genau richtig. Für Produktion brauchst du zwei zusätzliche Grenzen:

- **Nutze dein echtes Kontextlimit.** Ein Modell kann bei 4K passen und bei 32K wegen des wachsenden KV-Caches in den RAM ausweichen.
- **Definiere eine Qualitätsuntergrenze.** Ein Q2-Modell, das lädt, ist nicht automatisch gut genug für Code, mehrere Sprachen oder strukturierte Ausgaben.

Plane mit `llmfit plan` und deinem vorgesehenen Kontext. Vergleiche anschließend mindestens zwei benachbarte Quantisierungen auf einem festen Testset. Wenn die bessere Variante knapp nicht passt, kann andere Hardware oder eine API die richtige Antwort sein.

## Hardware-Erkennung prüfen

| Plattform | Erkennung | Wichtiger Check |
| --- | --- | --- |
| Linux mit NVIDIA | `nvidia-smi`, auch für mehrere GPUs | Prüfe VRAM pro Karte und den geplanten Tensor- oder Layer-Split. |
| Linux mit AMD | `rocm-smi` | VRAM kann unbekannt bleiben, dann brauchst du einen Override. |
| Apple Silicon | `system_profiler`, Unified Memory als geteilter Pool | Reserviere Speicher für macOS und andere Apps. |
| Intel Arc | sysfs bei diskreten Karten, `lspci` bei integrierter Grafik | Integrierter Speicher teilt sich den verfügbaren RAM. |
| Windows | RAM und CPU, NVIDIA über `nvidia-smi` | Nutze `llmfit doctor`, wenn GPU-Werte falsch aussehen. |
| Android oder Termux | Meist nur CPU und RAM | Mobile GPU-Erkennung wird aktuell nicht unterstützt. |

Die [offizielle Plattformmatrix](https://github.com/AlexsJones/llmfit/blob/main/docs/platform-support.md) beschreibt manuelle Overrides für `--memory`, `--ram` und `--cpu-cores`. Ein Override ändert die Empfehlung. Er ergänzt keine Runtime-Unterstützung, die Betriebssystem oder Inference Engine nicht bieten.

## Fünf Checks zwischen grünem Fit und Produktion

1. **Bestätige die erkannte Maschine.** Speichere `llmfit system --json` mit der Entscheidung. Korrigiere fehlende oder geteilte Speicherwerte.
2. **Filtere nach der echten Aufgabe.** Wähle Coding, Reasoning, Chat, Multimodal oder Embedding statt eines allgemeinen Scores.
3. **Fixiere Kontext und Parallelität.** Modelliere erwartete Eingabelänge und gleichzeitige Anfragen statt einer Ein-Nutzer-Demo.
4. **Benchmarke die Runtime.** Miss Tokens pro Sekunde, Zeit bis zum ersten Token, Prompt-Verarbeitung, maximalen Speicher und Fehlerverhalten.
5. **Prüfe das gesamte Deployment.** Modelllizenz, Datenflüsse, Monitoring, Updates, Fallback, Security und Gesamtkosten gehören zur Entscheidung.

Ein Modell kann perfekt passen und kommerziell trotzdem falsch sein. Vergleiche Engineering und ungenutzte Kapazität mit API-Ausgaben über unseren [Break-even-Guide für lokale Modelle und APIs](/de/blog/local-models-vs-apis-break-even-eu-2026/). Für einen aktuellen Fall mit 128 GB gemeinsamem Speicher trennt unser [DeepSeek-V4-Flash-0731-Test auf einem KI-PC](/de/blog/deepseek-v4-flash-0731-local-ai-pc/) Modell-Fit von Production Readiness. Der [Hardware-Check zu Colibri GLM 5.2](/de/blog/colibri-glm-5-2-consumer-hardware/) zeigt an einem konkreten Modell, wie Speicher, Bandbreite und Workload die Antwort verändern.

## Wann llmfit reicht und wann Engineering beginnt

| Entscheidung | llmfit hilft bei | Zusätzlich nötig |
| --- | --- | --- |
| Persönlicher lokaler Assistent | Shortlist und Quantisierung | Kurzer Qualitäts- und Speed-Test mit deinen Dokumenten |
| Workstation-Kauf | Hardware-Simulation und Upgrade-Abstand | Messwerte vergleichbarer Hardware und Gesamtsystemkosten |
| Interner Team-Pilot | Kandidatenranking und JSON-Ausgabe | Zugriff, Datenabgrenzung, Evaluation und Nutzungsmonitoring |
| Kundenprodukt | Frühe Kapazitätsannahmen | Lasttest, Autoscaling, Fallback, Safety, Lizenz und On-Call-Verantwortung |
| GPU-Cluster | Node-API für Fit und Filter | Topologiebezogene Platzierung, Tests heterogener GPUs und Recovery |

Der saubere Weg ist gestuft. Schließe mit llmfit offensichtlich schlechte Kandidaten aus. Investiere Benchmark-Zeit nur in die besten zwei oder drei. Wechsle erst dann zu Self-Hosting, wenn gemessene Qualität, Latenz, Risiko und Gesamtkosten die verwaltete Alternative schlagen.

## Grenzen für deinen Entscheidungsvermerk

- Geschwindigkeit wird aus Speicherbandbreite, Modellgröße und Effizienzfaktoren geschätzt. Kernel und Workload können den Messwert verschieben.
- Der Modellkatalog steckt in der Binary. Aktualisiere llmfit, um neue Katalogdaten zu erhalten.
- Use-Case-Qualität basiert auf kuratierten Familien-Benchmarks und Fallbacks, nicht auf deinem privaten Testset.
- Addierter VRAM mehrerer GPUs macht unterschiedliche Karten, Interconnects und Bandbreiten nicht identisch.
- Ladefähigkeit sagt nichts über Lizenz, Prompt-Sicherheit, Domänengenauigkeit oder Betriebsreife aus.

## Quellen und Claim-Grenzen

Installation, Befehle, Runtimes, Datenschutzverhalten und MIT-Lizenz stammen aus dem [llmfit Repository](https://github.com/AlexsJones/llmfit). Hardware-Erkennung, Quantisierung, MoE, Scoring und Speed-Formeln stammen aus der [How-it-works-Dokumentation](https://github.com/AlexsJones/llmfit/blob/main/docs/how-it-works.md). Plattformgrenzen stehen in der [Support-Referenz](https://github.com/AlexsJones/llmfit/blob/main/docs/platform-support.md). Der Ablauf für Tokens pro Sekunde und Zeit bis zum ersten Token kommt aus dem [Benchmarking-Guide](https://github.com/AlexsJones/llmfit/blob/main/docs/benchmarking.md). Fakten wurden am 27. Juli 2026 geprüft. Wavect hat die Schätzungen für diesen Artikel nicht unabhängig benchmarked.

## Häufige Fragen

### Was ist llmfit?

llmfit ist ein kostenloses Terminal-Tool. Es erkennt RAM, CPU, GPU und VRAM und bewertet Hunderte lokale LLMs nach Speicher-Fit, geschätzter Geschwindigkeit, Qualität und Kontext. Es bietet TUI, CLI, JSON-Empfehlungen und eine lokale REST API.

### Wie finde ich heraus, welches LLM auf meinem PC läuft?

Installiere llmfit, prüfe mit `llmfit system` die Hardware-Erkennung und starte dann `llmfit recommend --json --use-case coding --limit 5`. Ersetze coding durch deinen Use Case und untersuche Kandidaten vor dem Download mit `llmfit info`.

### Unterstützt llmfit Apple Silicon und NVIDIA GPUs?

Ja. Apple Silicon wird über Unified Memory und system_profiler erkannt. NVIDIA nutzt nvidia-smi, auch für mehrere GPUs. Linux hat den breitesten Support. Unter Windows konzentriert sich die GPU-Erkennung aktuell auf NVIDIA.

### Berechnet llmfit MoE-Modelle korrekt?

llmfit erkennt Mixture-of-Experts-Metadaten und trennt Gesamtparameter von aktiven Parametern. Das Tool modelliert aktive Experten im VRAM und inaktive Experten im RAM. Benchmarke trotzdem Speicherverkehr und Runtime-Speed.

### Garantiert ein Perfect Fit ein schnelles Modell?

Nein. Perfect bedeutet, dass das Modell das empfohlene GPU-Speicherziel erfüllt. Die Geschwindigkeit bleibt eine Schätzung. Kontext, Batching, Offload, Kernel und parallele Nutzer verändern den realen Durchsatz.

### Ist llmfit kostenlos und privat?

llmfit ist kostenlos und MIT-lizenziert. Laut Dokumentation überträgt es keine Daten, außer du startest ausdrücklich eine Netzwerkfunktion wie Download, Provider-Abfrage oder Community Leaderboard. Modelle haben eigene Lizenzen und Datenrisiken.

### Sollte ein Unternehmen llmfit vor einem Hardwarekauf nutzen?

Ja, als frühen Sizing-Filter. Simuliere RAM, VRAM und CPU, erstelle eine Shortlist und validiere den Kauf mit Messwerten, realistischem Kontext, Parallelität, Lizenz, Strom, Redundanz und Betriebskosten.

## Fazit

Starte llmfit, bevor du Gewichte herunterlädst oder eine GPU auswählst. Das Tool verwandelt Hardwaredaten in eine belastbare Shortlist und macht Quantisierung, MoE und Kontextgrenzen früh sichtbar.

Behandle den Score danach nicht als fertige Entscheidung. Serve die besten Kandidaten, nutze dein echtes Testset, miss Latenz und Speicher über den gesamten Workload und kalkuliere den Betrieb. Das beste Modell ist nicht das größte, das lädt. Es ist das kleinste zuverlässige System, das deine Ziele für Qualität, Latenz, Datenschutz und Kosten erreicht.

## Das könnte dich auch interessieren..

[**Colibri GLM 5.2 auf Consumer-Hardware** Sieh, wie Speicher, Bandbreite und reale Workloads eine lokale Modellentscheidung prägen.](/de/blog/colibri-glm-5-2-consumer-hardware/) [**Lokale Modelle versus APIs** Berechne, wann Self-Hosting nach Engineering und Leerkapazität günstiger sein kann.](/de/blog/local-models-vs-apis-break-even-eu-2026/)

Modelle und Infrastruktur

## In diesem Cluster weiterlesen

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

[Mit dem Grundlagenartikel starten**LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen**](/de/blog/self-hosting-llms-eu-cost/)

- [Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen](/de/blog/netflix-vllm-triton-inference-stack/)
- [Transformers.js im Browser: Wann lokale KI in dein Produkt gehört](/de/blog/transformers-js-browser-ai-guide/)
- [LiteLLM selbst hosten: Production-Guide 2026](/de/blog/self-host-litellm-production-2026/)
- [KI-fähiges Unternehmenswiki: Architektur und Aufbau](/de/blog/ai-ready-company-wiki/)
- [Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026](/de/blog/claude-text-watermark-api-2026/)

Postfach, ohne Lärm

## Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

11 min Lesezeit · 27. Juli 2026 Zuletzt geprüft 27. Juli 2026

[**Weiter**](/de/blog/lean-ctx-agency-experience/)

Neue Beiträge per E-Mail ×

×

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/llmfit-local-llm-hardware-guide/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-27",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-27",
      "url": "https://wavect.io/de/blog/llmfit-local-llm-hardware-guide/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "llmfit ist ein kostenloses, MIT-lizenziertes Terminal-Tool. Es erkennt RAM, CPU und GPU-Speicher und bewertet Hunderte lokale Modelle nach Fit, geschätzter Geschwindigkeit, Qualität und Kontext. Nutze es vor dem Download, um Modell und Quantisierung für deine Hardware einzugrenzen. Das Ergebnis ist eine Planungsschätzung, keine Produktionsgarantie. Prüfe das gewählte Modell mit deiner echten Kontextlänge, Runtime, deinen Prompts, deiner Parallelität und der Modelllizenz, bevor du Hardware kaufst oder Self-Hosting fest einplanst.",
  "articleBody": " Blog-Übersicht/AI und Agents/Modelle und Infrastruktur Welches lokale LLM läuft auf deiner Hardware? llmfit Guide TL;DR llmfit ist ein kostenloses, MIT-lizenziertes Terminal-Tool. Es erkennt RAM, CPU und GPU-Speicher und bewertet Hunderte lokale Modelle nach Fit, geschätzter Geschwindigkeit, Qualität und Kontext. Nutze es vor dem Download, um Modell und Quantisierung für deine Hardware einzugrenzen. Das Ergebnis ist eine Planungsschätzung, keine Produktionsgarantie. Prüfe das gewählte Modell mit deiner echten Kontextlänge, Runtime, deinen Prompts, deiner Parallelität und der Modelllizenz, bevor du Hardware kaufst oder Self-Hosting fest einplanst. llmfit beantwortet die Frage, die vor jedem Download eines lokalen Modells kommen sollte: Was läuft auf diesem Rechner nicht nur irgendwie, sondern gut? Das kostenlose Terminal-Tool erkennt RAM, CPU, GPU und VRAM. Danach bewertet es Hunderte Modelle nach Speicher-Fit, geschätzter Geschwindigkeit, Qualität und nutzbarem Kontext. Zusätzlich wählt es die hochwertigste Quantisierung, die voraussichtlich passt. Das kann dir einen 20-GB-Download und einen verlorenen Nachmittag ersparen. Es beweist aber nicht, dass das Modell für deinen Use Case genau genug, passend lizenziert oder unter Produktionslast schnell genug ist. Nutze llmfit für die Shortlist und benchmarke diese anschließend mit deiner Runtime und deinem echten Workload. llmfit in 60 Sekunden llmfit Fakten, geprüft am 27. Juli 2026 FrageAntwortBedeutung für deine Entscheidung Was ist llmfit?Interaktive TUI und CLI für die Hardware-Dimensionierung lokaler LLMsDu grenzt Modell und Quantisierung vor dem Download ein. Was wird erkannt?Verfügbarer RAM, CPU-Kerne, GPU, VRAM und Beschleunigungs-BackendDie Empfehlung bezieht sich auf deinen Rechner statt auf eine allgemeine Speicherklasse. Was wird bewertet?Fit, geschätzte Geschwindigkeit, Qualität und KontextDas größte Modell landet nicht automatisch auf Platz eins. Welche Systeme werden unterstützt?Voller Support für Linux und Apple Silicon, eingeschränktere GPU-Erkennung unter Windows und Intel-MacsPrüfe zuerst mit llmfit system, ob die Erkennung stimmt. Welche Runtimes sind angebunden?Ollama, llama.cpp, MLX, Docker Model Runner und LM StudioDu kannst von der Empfehlung direkt zu Download und lokaler Runtime wechseln. Versteht llmfit MoE?Ja, das Tool trennt Gesamtparameter und aktive Parameter und modelliert Expert-OffloadingMixtral- und DeepSeek-artige Modelle werden nicht wie dichte Modelle berechnet. Ist llmfit kostenlos?Ja, der Code steht unter der MIT-LizenzDie Lizenz jedes einzelnen Modells musst du trotzdem separat prüfen. Garantiert der Score die Leistung?Nein, er ist eine hardwarebezogene SchätzungTeste echte Prompts, Kontext, Parallelität und Kaltstarts vor Produktion. Installation und erste Empfehlung vor dem Modell-Download Unter macOS und Linux ist Homebrew der einfachste Einstieg. Unter Windows funktioniert die Installation über Scoop. Wenn du uv nutzt, kannst du llmfit mit uvx einmalig ohne permanente Installation starten. # macOS oder Linux brew install llmfit # Windows scoop install llmfit # Einmalig über uv starten uvx llmfit llmfit öffnet die interaktive Terminal-Oberfläche. Für einen reproduzierbaren Entscheidungsprozess sind diese CLI-Befehle besonders nützlich: # Erkannte Hardware prüfen llmfit system # Fünf Empfehlungen für Coding als JSON llmfit recommend --json --use-case coding --limit 5 # Annahmen für einen Kandidaten prüfen llmfit info \"MODELLNAME\" # Hardware für ein Modell mit 8K Kontext planen llmfit plan \"MODELLNAME\" --context 8192 --json Die offizielle CLI- und Automatisierungsreferenz dokumentiert außerdem Hardware-Overrides, Kontextlimits und eine lokale REST API. Dadurch eignet sich llmfit auch für Skripte und Node Scheduling. Wie llmfit entscheidet, was passt Zuerst erkennt llmfit das Beschleunigungs-Backend, zum Beispiel CUDA, Metal, ROCm, SYCL oder CPU. Danach vergleicht es jeden Katalogeintrag mit dem verfügbaren Speicher und einer Quantisierungshierarchie von Q8_0 bis Q2_K. Es versucht, die hochwertigste Quantisierung zu behalten, die passt. Reicht der Speicher beim vollen Kontext nicht, kann das Tool mit einem kürzeren Kontext neu rechnen. ScoreWas er abbildetWas er nicht abbildet QualityModellgröße, Ruf der Familie, Quantisierungsabzug und Use-Case-FitDeine Domänenqualität, Sprache, Safety und Tool-Calling-Tests SpeedGeschätzte Tokens pro Sekunde aus Speicherbandbreite, Modellgröße und LaufmodusPrompt-Verarbeitung, Batching, Thermik und Runtime-spezifische Kernel FitEffiziente Speichernutzung mit bevorzugtem PufferAndere Prozesse, Display-Speicher und parallele Produktionsanfragen ContextAngegebener Kontext im Verhältnis zum Ziel des Use CasesQualitätsverlust bei langem Kontext und den Wert deines tatsächlichen Kontexts Die Gewichtung ändert sich je nach Use Case. Coding kann ein kleineres Spezialmodell vor einen großen Generalisten setzen. Reasoning gewichtet Qualität stärker, Chat die Geschwindigkeit. Das ist nützlicher",
  "articleSection": "KI-Infrastruktur",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-07-27",
  "datePublished": "2026-07-27",
  "description": "llmfit ist ein kostenloses, MIT-lizenziertes Terminal-Tool. Es erkennt RAM, CPU und GPU-Speicher und bewertet Hunderte lokale Modelle nach Fit, geschätzter Geschwindigkeit, Qualität und Kontext. Nutze es vor dem Download, um Modell und Quantisierung für deine Hardware einzugrenzen. Das Ergebnis ist eine Planungsschätzung, keine Produktionsgarantie. Prüfe das gewählte Modell mit deiner echten Kontextlänge, Runtime, deinen Prompts, deiner Parallelität und der Modelllizenz, bevor du Hardware kaufst oder Self-Hosting fest einplanst.",
  "headline": "Welches lokale LLM läuft auf deiner Hardware? llmfit Guide",
  "image": "https://wavect.io/img/blog/headers/header_llmfit-local-llm-hardware-guide.svg",
  "inLanguage": "de",
  "keywords": "Lokale LLMs, KI-Infrastruktur",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/llmfit-local-llm-hardware-guide/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/llmfit-local-llm-hardware-guide/",
  "wordCount": 1924
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/models-infrastructure/",
      "name": "Modelle und Infrastruktur",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/llmfit-local-llm-hardware-guide/",
      "name": "Welches lokale LLM läuft bei dir? llmfit Guide | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "llmfit ist ein kostenloses Terminal-Tool. Es erkennt RAM, CPU, GPU und VRAM und bewertet Hunderte lokale LLMs nach Speicher-Fit, geschätzter Geschwindigkeit, Qualität und Kontext. Es bietet TUI, CLI, JSON-Empfehlungen und eine lokale REST API."
      },
      "name": "Was ist llmfit?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Installiere llmfit, prüfe mit llmfit system die Hardware-Erkennung und starte dann llmfit recommend --json --use-case coding --limit 5. Ersetze coding durch deinen Use Case und untersuche Kandidaten vor dem Download mit llmfit info."
      },
      "name": "Wie finde ich heraus, welches LLM auf meinem PC läuft?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Ja. Apple Silicon wird über Unified Memory und system_profiler erkannt. NVIDIA nutzt nvidia-smi, auch für mehrere GPUs. Linux hat den breitesten Support. Unter Windows konzentriert sich die GPU-Erkennung aktuell auf NVIDIA."
      },
      "name": "Unterstützt llmfit Apple Silicon und NVIDIA GPUs?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "llmfit erkennt Mixture-of-Experts-Metadaten und trennt Gesamtparameter von aktiven Parametern. Das Tool modelliert aktive Experten im VRAM und inaktive Experten im RAM. Benchmarke trotzdem Speicherverkehr und Runtime-Speed."
      },
      "name": "Berechnet llmfit MoE-Modelle korrekt?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nein. Perfect bedeutet, dass das Modell das empfohlene GPU-Speicherziel erfüllt. Die Geschwindigkeit bleibt eine Schätzung. Kontext, Batching, Offload, Kernel und parallele Nutzer verändern den realen Durchsatz."
      },
      "name": "Garantiert ein Perfect Fit ein schnelles Modell?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "llmfit ist kostenlos und MIT-lizenziert. Laut Dokumentation überträgt es keine Daten, außer du startest ausdrücklich eine Netzwerkfunktion wie Download, Provider-Abfrage oder Community Leaderboard. Modelle haben eigene Lizenzen und Datenrisiken."
      },
      "name": "Ist llmfit kostenlos und privat?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Ja, als frühen Sizing-Filter. Simuliere RAM, VRAM und CPU, erstelle eine Shortlist und validiere den Kauf mit Messwerten, realistischem Kontext, Parallelität, Lizenz, Strom, Redundanz und Betriebskosten."
      },
      "name": "Sollte ein Unternehmen llmfit vor einem Hardwarekauf nutzen?"
    }
  ]
}
```
