Cluster

Modelle und Infrastruktur

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

Blogbeiträge
67
Thema
AI und Agents

Mit dem Grundlagenartikel starten

Postfach, ohne Lärm

Erhalte die nächste Feldnotiz zu AI und Agents

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Neu in dieser Sammlung

Übereinanderliegende Kontextkarten als bearbeitbarer Arbeitsbestand eines Agenten KI & Agenten

Context Language Models vs. Kompaktierung: Was testen?

Soll Ihr Agent seinen Kontext selbst bearbeiten? Vergleichen Sie CLMs mit Kompaktierung, prüfen Sie Harness und Lizenz und testen Sie den Erhalt wichtiger Fakten.

Wavect-Illustration zur Analyse von Agenten-Traces mit LiteLLM Lens KI & Agenten

LiteLLM Lens: Agenten-Traces mit SQL und APIs analysieren

Von einzelnen Agenten-Traces zu belegbaren Befunden: LiteLLM Lens, ClickHouse-SQL, sichere API-Zugriffe und ein kontrollierter Weg zum Regressionstest.

SmythOS Studio selbst hosten: visuelle Workflows, eigene Infrastruktur und Grenzen der Laufzeitumgebung KI & Agenten

SmythOS Studio selbst hosten: Docker, Kosten und Grenzen

Ein visueller KI-Agenten-Builder mit MIT-Lizenz auf eigener Infrastruktur. Was Docker tatsächlich startet, welche Kosten bleiben und was vor dem Livegang zu prüfen ist.

DeerFlow-Agent-Harness mit verbundenen Ebenen für Kontext, Sandbox und Workflow KI & Agenten

DeerFlow 2.0: Docker-Setup, Sandboxes und Memory

DeerFlow jenseits der Ankündigung: Docker konfigurieren, gemeinsame Sandboxes verstehen, Memory-Probleme eingrenzen und die Produktionsfreigabe vorbereiten.

Getrennte Pfade für Zustand und Aktion treffen bei der kontrastiven Bewertung zusammen KI & Agenten

CLM-8B selbst hosten: vLLM, Action-Cache und Verifier

Quellengeprüfter CLM-8B-Leitfaden: vollständiger Encoder trotz kleiner Köpfe, wiederverwendbare Kandidaten, private APIs und Grenzen der Verifier-Evaluierung.

Abstrakte Optionsscore-Balken zur Entscheidungskalibrierung, keine gemessenen Benchmark-Werte KI & Agenten

AnyJev: LLM-Kalibrierung und Optionsreihenfolge

Nokias AnyJev im Detail: Warum stabile Antworten keine kalibrierten Wahrscheinlichkeiten sind, was Version 0.2.0 ändert und wie du einen Router prüfst.

Vollständiges Artikelverzeichnis

  1. Context Language Models vs. Kompaktierung: Was testen?
  2. LiteLLM Lens: Agenten-Traces mit SQL und APIs analysieren
  3. SmythOS Studio selbst hosten: Docker, Kosten und Grenzen
  4. DeerFlow 2.0: Docker-Setup, Sandboxes und Memory
  5. CLM-8B selbst hosten: vLLM, Action-Cache und Verifier
  6. AnyJev: LLM-Kalibrierung und Optionsreihenfolge
  7. LiteAgents SDK: Modell-Routing, Setup und Migration
  8. mcp-memory-service: Gemeinsames Gedächtnis für Claude Code und Cursor
  9. Claude Opus 5.5: Einsatzfälle, Prompts und Effort
  10. Laya und Jev im Unternehmen: 6 praktische Workflows
  11. Laya vs Jev: Benchmarks und das Risiko für KI-Startups
  12. Jev AI im Test: Entscheidungsmodelle für Agenten
  13. SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop
  14. Phonely Alma im Test: Ist das Voice-LLM produktionsreif?
  15. Utopia: Temporalen Wissensgraph im Unternehmen prüfen
  16. NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke
  17. Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?
  18. PageLM im Check: Selbst hosten und kommerziell nutzen
  19. M6 Mac mini vs. M5 Mac Studio für lokale KI: Kaufberatung
  20. FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?
  21. Darkbloom AI Test: Private Inferenz auf freien Macs
  22. Ox Alpha als GLM-5.3-Flash enthüllt: Was sich ändert
  23. Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
  24. Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
  25. AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
  26. Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
  27. Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
  28. Transformers.js im Browser: Wann lokale KI in dein Produkt gehört
  29. LiteLLM selbst hosten: Production-Guide 2026
  30. KI-fähiges Unternehmenswiki: Architektur und Aufbau
  31. Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026
  32. OpenKB Review: Knowledge Compiler vs. RAG
  33. Unsloth Desktop im Test: Private lokale KI-Workstation?
  34. NeMo Switchyard 0.2: Agenten-Routing ohne Training?
  35. Firecrawl AnyDoc im Test: 14 Formate zu Markdown
  36. Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?
  37. OmniRoute KI-Routing: Setup und Produktions-Checkliste
  38. Gemini Robotics 2: Ganzkörpersteuerung und die Pilotentscheidung
  39. pdf-inspector im Test: PDFs vor OCR lokal routen
  40. Lokaler multimodaler KI-Coding-Assistent: Sprache, OCR und Datenschutz
  41. DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
  42. Gemma 4 kostenlos mit Unsloth und Colab tunen
  43. Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
  44. Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
  45. Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
  46. RAG-Vektoren auf 2 Bit komprimieren: Ist datenunabhängige Quantisierung produktionsreif?
  47. LMCache meldet 13,7x niedrigere mittlere TTFT mit gemeinsamem KV Cache
  48. Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
  49. Cisco Antares im Test: 1B Local AI für Vulnerability Localization
  50. NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
  51. Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
  52. Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
  53. Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
  54. Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
  55. Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
  56. Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
  57. LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
  58. Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?
  59. Pro Token günstiger kann pro Aufgabe teurer sein
  60. Anthropic sagt Nein zum Open-Weights-Verbot. Der Kostenkampf bleibt real.
  61. LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  62. LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
  63. Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  64. LLM-Token-Kosten 2026 senken
  65. Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
  66. RAG, Fine-Tuning oder Long Context? Vergleich 2026
  67. LLM-API-Kosten 2026. Architektur-Shift