Cluster

Modelle und Infrastruktur

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

Blogbeiträge
46
Thema
AI und Agents

Mit dem Grundlagenartikel starten

Neu in dieser Sammlung

Kostenloses Stealth-KI-Modell Ox Alpha über OpenCode Zen und OpenRouter mit Datenschutz- und Kostenprüfung KI & Agenten

Ox Alpha Free: Setup, Datenschutz und Kaufleitfaden

Nutze das Stealth-Coding-Modell mit 1M Kontext über OpenCode oder OpenRouter. Vergleiche IDs, Datenschutz, Zusatzkosten und einen sicheren Team-Pilot.

Vier Pika-Audio-API-Modelle für Soundeffekte, Sprache, Musik und synchronisierte Video-Soundtracks mit Kostenkontrollen KI & Agenten

Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?

Pika listet SFX mit 0,0002 USD pro Sekunde und drei weitere Audio-Modelle. Prüfe Break-even, API-Limits, Qualitätsgates und Production Fit.

GPU-Workloads teilen sich über eine Virtualisierungsschicht einen Accelerator-Pool KI & Agenten

Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden

Thunder Compute will mit GPU-Pooling ungenutzte Kapazität zurückholen. Vergleiche Netzwerk-Virtualisierung mit MIG, vGPU und Passthrough und plane einen messbaren Enterprise-Pilot.

AirLLM streamt jeweils eine Modellschicht vom Speicher über RAM in knappen GPU-VRAM KI & Agenten

AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference

AirLLM führt Modelle aus, die viel größer als der GPU-Speicher sind, indem es Weights schichtweise streamt. Was die VRAM-Zahlen zu Speicher, Geschwindigkeit und Produktion verschweigen.

Selbst gehosteter Screen-Agent bedient eine Desktop-Oberfläche in einem Single-GPU-Setup KI & Agenten

Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren

Ein Modell mit offenen Gewichten führt jetzt die Desktop-Benchmarks an. Was das für Back-Office-Automatisierung bedeutet, die keine Hosted-API sehen darf.

Mehrschichtiger Inferenz-Stack mit vLLM und NVIDIA Triton KI & Agenten

Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen

Netflix wählte vLLM wegen des operativen Fits und fand die echten Engpässe erst bei Constrained Decoding, Deployments, Model Loading und Metriken. Hier liest du, was kleinere Teams übernehmen sollten und was sie besser einkaufen.

Vollständiges Artikelverzeichnis

  1. Ox Alpha Free: Setup, Datenschutz und Kaufleitfaden
  2. Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
  3. Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
  4. AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
  5. Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
  6. Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
  7. Transformers.js im Browser: Wann lokale KI in dein Produkt gehört
  8. LiteLLM selbst hosten: Production-Guide 2026
  9. KI-fähiges Unternehmenswiki: Architektur und Aufbau
  10. Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026
  11. OpenKB Review: Knowledge Compiler vs. RAG
  12. Unsloth Desktop im Test: Private lokale KI-Workstation?
  13. NeMo Switchyard 0.2: Agenten-Routing ohne Training?
  14. Firecrawl AnyDoc im Test: 14 Formate zu Markdown
  15. Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?
  16. OmniRoute KI-Routing: Setup und Produktions-Checkliste
  17. Gemini Robotics 2: Ganzkörpersteuerung und die Pilotentscheidung
  18. pdf-inspector im Test: PDFs vor OCR lokal routen
  19. Lokaler multimodaler KI-Coding-Assistent: Sprache, OCR und Datenschutz
  20. DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
  21. Gemma 4 kostenlos mit Unsloth und Colab tunen
  22. Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
  23. Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
  24. Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
  25. RAG-Vektorspeicher 16x kleiner: Ist datenunabhängige Quantisierung produktionsreif?
  26. Gemeinsamer KV Cache senkte LLM-Inferenzlatenz um 14x, ohne neue GPUs
  27. Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
  28. Cisco Antares im Test: 1B Local AI für Vulnerability Localization
  29. NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
  30. Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
  31. Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
  32. Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
  33. Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
  34. Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
  35. Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
  36. LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
  37. Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?
  38. Pro Token günstiger. Pro Antwort teurer.
  39. Dario hat Open Source den Krieg erklärt. Der echte Krieg geht um deine KI-Rechnung.
  40. LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  41. LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
  42. Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  43. LLM-Token-Kosten 2026 senken
  44. Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
  45. RAG, Fine-Tuning oder Long Context? Vergleich 2026
  46. LLM-API-Kosten 2026. Architektur-Shift