Modelle und Infrastruktur
Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.
- Blogbeiträge
- 46
- Thema
- AI und Agents
Mit dem Grundlagenartikel starten
Neu in dieser Sammlung
Ox Alpha Free: Setup, Datenschutz und Kaufleitfaden
Nutze das Stealth-Coding-Modell mit 1M Kontext über OpenCode oder OpenRouter. Vergleiche IDs, Datenschutz, Zusatzkosten und einen sicheren Team-Pilot.
Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
Pika listet SFX mit 0,0002 USD pro Sekunde und drei weitere Audio-Modelle. Prüfe Break-even, API-Limits, Qualitätsgates und Production Fit.
Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
Thunder Compute will mit GPU-Pooling ungenutzte Kapazität zurückholen. Vergleiche Netzwerk-Virtualisierung mit MIG, vGPU und Passthrough und plane einen messbaren Enterprise-Pilot.
AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
AirLLM führt Modelle aus, die viel größer als der GPU-Speicher sind, indem es Weights schichtweise streamt. Was die VRAM-Zahlen zu Speicher, Geschwindigkeit und Produktion verschweigen.
Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
Ein Modell mit offenen Gewichten führt jetzt die Desktop-Benchmarks an. Was das für Back-Office-Automatisierung bedeutet, die keine Hosted-API sehen darf.
Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
Netflix wählte vLLM wegen des operativen Fits und fand die echten Engpässe erst bei Constrained Decoding, Deployments, Model Loading und Metriken. Hier liest du, was kleinere Teams übernehmen sollten und was sie besser einkaufen.
Vollständiges Artikelverzeichnis
- Ox Alpha Free: Setup, Datenschutz und Kaufleitfaden
- Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
- Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
- AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
- Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
- Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
- Transformers.js im Browser: Wann lokale KI in dein Produkt gehört
- LiteLLM selbst hosten: Production-Guide 2026
- KI-fähiges Unternehmenswiki: Architektur und Aufbau
- Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026
- OpenKB Review: Knowledge Compiler vs. RAG
- Unsloth Desktop im Test: Private lokale KI-Workstation?
- NeMo Switchyard 0.2: Agenten-Routing ohne Training?
- Firecrawl AnyDoc im Test: 14 Formate zu Markdown
- Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?
- OmniRoute KI-Routing: Setup und Produktions-Checkliste
- Gemini Robotics 2: Ganzkörpersteuerung und die Pilotentscheidung
- pdf-inspector im Test: PDFs vor OCR lokal routen
- Lokaler multimodaler KI-Coding-Assistent: Sprache, OCR und Datenschutz
- DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
- Gemma 4 kostenlos mit Unsloth und Colab tunen
- Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
- Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
- Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
- RAG-Vektorspeicher 16x kleiner: Ist datenunabhängige Quantisierung produktionsreif?
- Gemeinsamer KV Cache senkte LLM-Inferenzlatenz um 14x, ohne neue GPUs
- Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
- Cisco Antares im Test: 1B Local AI für Vulnerability Localization
- NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
- Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
- Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
- Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
- Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
- Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
- Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
- LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
- Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?
- Pro Token günstiger. Pro Antwort teurer.
- Dario hat Open Source den Krieg erklärt. Der echte Krieg geht um deine KI-Rechnung.
- LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
- LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
- Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
- LLM-Token-Kosten 2026 senken
- Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
- RAG, Fine-Tuning oder Long Context? Vergleich 2026
- LLM-API-Kosten 2026. Architektur-Shift