Cluster

Modelle und Infrastruktur

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

Blogbeiträge
55
Thema
AI und Agents

Mit dem Grundlagenartikel starten

Postfach, ohne Lärm

Erhalte die nächste Feldnotiz zu AI und Agents

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Neu in dieser Sammlung

Ein Smartphone und ein Laptop teilen ein großes Sprachmodell zwischen Browser-Tabs, während WebRTC Aktivierungen zwischen ihnen überträgt KI & Agenten

SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop

Käuferorientierter SwarmLLM-Test: 27B-Inferenz im Browser, WebGPU und WebRTC, Benchmark-Grenzen, Peer-Trust, Security und ein klarer Pilotplan.

Eine Telefon-Wellenform läuft durch das Alma Voice-LLM in eine Production-Evaluierung KI & Agenten

Phonely Alma im Test: Ist das Voice-LLM produktionsreif?

Alma verspricht 182 ms TTFT, 206 ms P99 und 0,55 USD pro gemischter Million Tokens. Was belegt der Test, was fehlt und wie sieht ein Buyer-Pilot aus?

Gestapelte Utopia-Wissensstände zeigen erhaltene Historie KI & Agenten

Utopia: Temporalen Wissensgraph im Unternehmen prüfen

Utopia für Unternehmen prüfen: zwei Zeitachsen, Quellenbelege, Grenzen beim Self-Hosting und ein konkreter Pilotplan für belastbare historische Antworten.

NVIDIA PAIR routet lokale KI-Agent-Anfragen zwischen RTX, Mac und einem AMD-Strix-Halo-Node KI & Agenten

NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke

PAIR routet unabhängige Agent-Anfragen zwischen lokalen Rechnern, ohne GPUs zu bündeln. So funktioniert es, hier fehlt Strix Halo und das muss ein AMD-Port beweisen.

Tencent Hy4 preview verarbeitet eine Codebasis mit einer Million Token über Coding-Agent-Tools und Prüf-Gates KI & Agenten

Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?

Buyer-Review zu Hy4 preview mit Coding-Benchmarks, WorkBuddy, API-Kosten, Self-Hosting-Hardware, bekannten Grenzen und Zwei-Wochen-Pilotplan.

PageLM-Lernplattform: Prüfung von Hosting, Lizenz und Datenflüssen KI & Agenten

PageLM im Check: Selbst hosten und kommerziell nutzen

PageLM für Teams im Quellencheck: Lernfunktionen, Datenflüsse, kommerzielle Nutzungsrechte und ein prüfbarer Schulungspilot.

Vollständiges Artikelverzeichnis

  1. SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop
  2. Phonely Alma im Test: Ist das Voice-LLM produktionsreif?
  3. Utopia: Temporalen Wissensgraph im Unternehmen prüfen
  4. NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke
  5. Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?
  6. PageLM im Check: Selbst hosten und kommerziell nutzen
  7. M6 Mac mini vs. M5 Mac Studio für lokale KI: Kaufberatung
  8. FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?
  9. Darkbloom AI Test: Private Inferenz auf freien Macs
  10. Ox Alpha als GLM-5.3-Flash enthüllt: Was sich ändert
  11. Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
  12. Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
  13. AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
  14. Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
  15. Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
  16. Transformers.js im Browser: Wann lokale KI in dein Produkt gehört
  17. LiteLLM selbst hosten: Production-Guide 2026
  18. KI-fähiges Unternehmenswiki: Architektur und Aufbau
  19. Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026
  20. OpenKB Review: Knowledge Compiler vs. RAG
  21. Unsloth Desktop im Test: Private lokale KI-Workstation?
  22. NeMo Switchyard 0.2: Agenten-Routing ohne Training?
  23. Firecrawl AnyDoc im Test: 14 Formate zu Markdown
  24. Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?
  25. OmniRoute KI-Routing: Setup und Produktions-Checkliste
  26. Gemini Robotics 2: Ganzkörpersteuerung und die Pilotentscheidung
  27. pdf-inspector im Test: PDFs vor OCR lokal routen
  28. Lokaler multimodaler KI-Coding-Assistent: Sprache, OCR und Datenschutz
  29. DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
  30. Gemma 4 kostenlos mit Unsloth und Colab tunen
  31. Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
  32. Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
  33. Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
  34. RAG-Vektoren auf 2 Bit komprimieren: Ist datenunabhängige Quantisierung produktionsreif?
  35. LMCache meldet 13,7x niedrigere mittlere TTFT mit gemeinsamem KV Cache
  36. Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
  37. Cisco Antares im Test: 1B Local AI für Vulnerability Localization
  38. NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
  39. Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
  40. Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
  41. Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
  42. Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
  43. Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
  44. Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
  45. LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
  46. Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?
  47. Pro Token günstiger kann pro Aufgabe teurer sein
  48. Anthropic sagt Nein zum Open-Weights-Verbot. Der Kostenkampf bleibt real.
  49. LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  50. LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
  51. Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  52. LLM-Token-Kosten 2026 senken
  53. Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
  54. RAG, Fine-Tuning oder Long Context? Vergleich 2026
  55. LLM-API-Kosten 2026. Architektur-Shift