Modelle und Infrastruktur
Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.
- Blogbeiträge
- 55
- Thema
- AI und Agents
Mit dem Grundlagenartikel starten
Erhalte die nächste Feldnotiz zu AI und Agents
Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.
Neu in dieser Sammlung
SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop
Käuferorientierter SwarmLLM-Test: 27B-Inferenz im Browser, WebGPU und WebRTC, Benchmark-Grenzen, Peer-Trust, Security und ein klarer Pilotplan.
Phonely Alma im Test: Ist das Voice-LLM produktionsreif?
Alma verspricht 182 ms TTFT, 206 ms P99 und 0,55 USD pro gemischter Million Tokens. Was belegt der Test, was fehlt und wie sieht ein Buyer-Pilot aus?
Utopia: Temporalen Wissensgraph im Unternehmen prüfen
Utopia für Unternehmen prüfen: zwei Zeitachsen, Quellenbelege, Grenzen beim Self-Hosting und ein konkreter Pilotplan für belastbare historische Antworten.
NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke
PAIR routet unabhängige Agent-Anfragen zwischen lokalen Rechnern, ohne GPUs zu bündeln. So funktioniert es, hier fehlt Strix Halo und das muss ein AMD-Port beweisen.
Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?
Buyer-Review zu Hy4 preview mit Coding-Benchmarks, WorkBuddy, API-Kosten, Self-Hosting-Hardware, bekannten Grenzen und Zwei-Wochen-Pilotplan.
PageLM im Check: Selbst hosten und kommerziell nutzen
PageLM für Teams im Quellencheck: Lernfunktionen, Datenflüsse, kommerzielle Nutzungsrechte und ein prüfbarer Schulungspilot.
Vollständiges Artikelverzeichnis
- SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop
- Phonely Alma im Test: Ist das Voice-LLM produktionsreif?
- Utopia: Temporalen Wissensgraph im Unternehmen prüfen
- NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke
- Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?
- PageLM im Check: Selbst hosten und kommerziell nutzen
- M6 Mac mini vs. M5 Mac Studio für lokale KI: Kaufberatung
- FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?
- Darkbloom AI Test: Private Inferenz auf freien Macs
- Ox Alpha als GLM-5.3-Flash enthüllt: Was sich ändert
- Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
- Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
- AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
- Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
- Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
- Transformers.js im Browser: Wann lokale KI in dein Produkt gehört
- LiteLLM selbst hosten: Production-Guide 2026
- KI-fähiges Unternehmenswiki: Architektur und Aufbau
- Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026
- OpenKB Review: Knowledge Compiler vs. RAG
- Unsloth Desktop im Test: Private lokale KI-Workstation?
- NeMo Switchyard 0.2: Agenten-Routing ohne Training?
- Firecrawl AnyDoc im Test: 14 Formate zu Markdown
- Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?
- OmniRoute KI-Routing: Setup und Produktions-Checkliste
- Gemini Robotics 2: Ganzkörpersteuerung und die Pilotentscheidung
- pdf-inspector im Test: PDFs vor OCR lokal routen
- Lokaler multimodaler KI-Coding-Assistent: Sprache, OCR und Datenschutz
- DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
- Gemma 4 kostenlos mit Unsloth und Colab tunen
- Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
- Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
- Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
- RAG-Vektoren auf 2 Bit komprimieren: Ist datenunabhängige Quantisierung produktionsreif?
- LMCache meldet 13,7x niedrigere mittlere TTFT mit gemeinsamem KV Cache
- Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
- Cisco Antares im Test: 1B Local AI für Vulnerability Localization
- NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
- Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
- Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
- Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
- Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
- Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
- Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
- LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
- Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?
- Pro Token günstiger kann pro Aufgabe teurer sein
- Anthropic sagt Nein zum Open-Weights-Verbot. Der Kostenkampf bleibt real.
- LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
- LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
- Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
- LLM-Token-Kosten 2026 senken
- Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
- RAG, Fine-Tuning oder Long Context? Vergleich 2026
- LLM-API-Kosten 2026. Architektur-Shift