Modelle und Infrastruktur
Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.
- Blogbeiträge
- 67
- Thema
- AI und Agents
Mit dem Grundlagenartikel starten
Erhalte die nächste Feldnotiz zu AI und Agents
Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.
Neu in dieser Sammlung
Context Language Models vs. Kompaktierung: Was testen?
Soll Ihr Agent seinen Kontext selbst bearbeiten? Vergleichen Sie CLMs mit Kompaktierung, prüfen Sie Harness und Lizenz und testen Sie den Erhalt wichtiger Fakten.
LiteLLM Lens: Agenten-Traces mit SQL und APIs analysieren
Von einzelnen Agenten-Traces zu belegbaren Befunden: LiteLLM Lens, ClickHouse-SQL, sichere API-Zugriffe und ein kontrollierter Weg zum Regressionstest.
SmythOS Studio selbst hosten: Docker, Kosten und Grenzen
Ein visueller KI-Agenten-Builder mit MIT-Lizenz auf eigener Infrastruktur. Was Docker tatsächlich startet, welche Kosten bleiben und was vor dem Livegang zu prüfen ist.
DeerFlow 2.0: Docker-Setup, Sandboxes und Memory
DeerFlow jenseits der Ankündigung: Docker konfigurieren, gemeinsame Sandboxes verstehen, Memory-Probleme eingrenzen und die Produktionsfreigabe vorbereiten.
CLM-8B selbst hosten: vLLM, Action-Cache und Verifier
Quellengeprüfter CLM-8B-Leitfaden: vollständiger Encoder trotz kleiner Köpfe, wiederverwendbare Kandidaten, private APIs und Grenzen der Verifier-Evaluierung.
AnyJev: LLM-Kalibrierung und Optionsreihenfolge
Nokias AnyJev im Detail: Warum stabile Antworten keine kalibrierten Wahrscheinlichkeiten sind, was Version 0.2.0 ändert und wie du einen Router prüfst.
Vollständiges Artikelverzeichnis
- Context Language Models vs. Kompaktierung: Was testen?
- LiteLLM Lens: Agenten-Traces mit SQL und APIs analysieren
- SmythOS Studio selbst hosten: Docker, Kosten und Grenzen
- DeerFlow 2.0: Docker-Setup, Sandboxes und Memory
- CLM-8B selbst hosten: vLLM, Action-Cache und Verifier
- AnyJev: LLM-Kalibrierung und Optionsreihenfolge
- LiteAgents SDK: Modell-Routing, Setup und Migration
- mcp-memory-service: Gemeinsames Gedächtnis für Claude Code und Cursor
- Claude Opus 5.5: Einsatzfälle, Prompts und Effort
- Laya und Jev im Unternehmen: 6 praktische Workflows
- Laya vs Jev: Benchmarks und das Risiko für KI-Startups
- Jev AI im Test: Entscheidungsmodelle für Agenten
- SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop
- Phonely Alma im Test: Ist das Voice-LLM produktionsreif?
- Utopia: Temporalen Wissensgraph im Unternehmen prüfen
- NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke
- Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?
- PageLM im Check: Selbst hosten und kommerziell nutzen
- M6 Mac mini vs. M5 Mac Studio für lokale KI: Kaufberatung
- FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?
- Darkbloom AI Test: Private Inferenz auf freien Macs
- Ox Alpha als GLM-5.3-Flash enthüllt: Was sich ändert
- Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
- Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
- AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
- Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
- Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
- Transformers.js im Browser: Wann lokale KI in dein Produkt gehört
- LiteLLM selbst hosten: Production-Guide 2026
- KI-fähiges Unternehmenswiki: Architektur und Aufbau
- Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026
- OpenKB Review: Knowledge Compiler vs. RAG
- Unsloth Desktop im Test: Private lokale KI-Workstation?
- NeMo Switchyard 0.2: Agenten-Routing ohne Training?
- Firecrawl AnyDoc im Test: 14 Formate zu Markdown
- Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?
- OmniRoute KI-Routing: Setup und Produktions-Checkliste
- Gemini Robotics 2: Ganzkörpersteuerung und die Pilotentscheidung
- pdf-inspector im Test: PDFs vor OCR lokal routen
- Lokaler multimodaler KI-Coding-Assistent: Sprache, OCR und Datenschutz
- DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
- Gemma 4 kostenlos mit Unsloth und Colab tunen
- Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
- Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
- Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
- RAG-Vektoren auf 2 Bit komprimieren: Ist datenunabhängige Quantisierung produktionsreif?
- LMCache meldet 13,7x niedrigere mittlere TTFT mit gemeinsamem KV Cache
- Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
- Cisco Antares im Test: 1B Local AI für Vulnerability Localization
- NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
- Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
- Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
- Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
- Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
- Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
- Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
- LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
- Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?
- Pro Token günstiger kann pro Aufgabe teurer sein
- Anthropic sagt Nein zum Open-Weights-Verbot. Der Kostenkampf bleibt real.
- LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
- LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
- Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
- LLM-Token-Kosten 2026 senken
- Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
- RAG, Fine-Tuning oder Long Context? Vergleich 2026
- LLM-API-Kosten 2026. Architektur-Shift