Modelle und Infrastruktur
Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.
27Mit dem Grundlagenartikel starten
Neu in dieser Sammlung
DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
Kann ein GB10-, Strix-Halo- oder Gorgon-Halo-System DeepSeek V4 Flash 0731 ausführen? Ein Kaufcheck zu Speicher, Quantisierung, Datenschutz, Observability und Production Readiness.
Gemma 4 kostenlos mit Unsloth und Colab tunen
Ein kostenloser Browser-Pilot ist real. Dieser Guide zeigt dir den Ablauf, die Grenzen hinter dem Hype und den Weg vom Trainingslauf zur Produktion.
Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
Taalas meldet 17.000 Token/s mit Llama 3.1 8B direkt im Silizium. Hier erfährst du, was der Benchmark belegt, was der Hype auslässt und wann sich spezialisierte Hardware rechnen könnte.
Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
Mit llmfit prüfst du lokale Modelle vor dem Download. Der Guide erklärt Fit, Geschwindigkeit, Qualität, Kontext, MoE und Quantisierung und zeigt, welche Tests vor dem Produktiveinsatz fehlen.
Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
Miso TTS klingt ausdrucksstark und hat offene Gewichte. Die 110 ms gelten aber für die gehostete H100-API, nicht für lokale Inferenz. Vergleiche Hardware, Preis, Lizenz und Produktionsrisiko.
RAG-Vektorspeicher 16x kleiner: Ist datenunabhängige Quantisierung produktionsreif?
Ein neuer Rust-Index schrumpft 10M Embeddings von 31 GB auf 4 GB mit Googles trainingsfreiem TurboQuant. Was die Methode beweist, wo sie FAISS schlägt, der Recall-Kompromiss und wie du sie pilotierst.
Vollständiges Artikelverzeichnis
- DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
- Gemma 4 kostenlos mit Unsloth und Colab tunen
- Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
- Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
- Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
- RAG-Vektorspeicher 16x kleiner: Ist datenunabhängige Quantisierung produktionsreif?
- Gemeinsamer KV Cache senkte LLM-Inferenzlatenz um 14x, ohne neue GPUs
- Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
- Cisco Antares im Test: Lokale Schwachstellen-Triage ohne Cloud
- NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
- Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
- Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
- Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
- Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
- Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
- Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
- LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
- Prompt als Bild rendern, um LLM-Kosten um 60% zu senken: genial oder absurd?
- Pro Token günstiger. Pro Antwort teurer.
- Dario hat Open Source den Krieg erklärt. Der echte Krieg geht um deine KI-Rechnung.
- LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
- LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
- Open-Weight-LLM-Showdown 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
- LLM-Token-Kosten 2026 senken
- Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
- RAG, Fine-Tuning oder Long Context? Vergleich 2026
- LLM-API-Kosten 2026. Architektur-Shift