Thema

AI und Agents

Engineering, Betrieb und Bewertung von AI-Systemen, Coding Agents und Modellinfrastruktur.

Blogbeiträge
127
Fokussierte Cluster
02

Fokussierte Cluster

Mit dem Grundlagenartikel starten

Postfach, ohne Lärm

Erhalte die nächste Feldnotiz zu AI und Agents

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Neu in dieser Sammlung

Türkiser Routing-Knoten mit drei Endpunkten auf dunklem Wavect-Hintergrund; eine ausgewählte Route ist hervorgehoben KI & Agenten

Valyus 0,6B-Router für Retrieval-Agenten: Ergebnisse, Grenzen und Einsatz

Ein trainiertes Qwen3-0.6B schlägt gepromptetes Haiku und Nova Lite in einer Retrieval-Routing-Studie. Entscheidend sind Messverfahren, Trainingssignal und der Nutzen im eigenen System.

Geometrischer Code-Kern mit vier Werkzeug-Knoten in geschichteten Laufzeitrahmen auf dunklem Wavect-Hintergrund KI & Agenten

OpenAI Agents API im Review: Migration, Kosten und Datenkontrollen

Was der Managed Codex Harness ersetzt, welche Verantwortung bei dir bleibt und wie du die Startzahlen vor einer echten Migration prüfst.

Große Quelldateien werden von einem Hilfsmodell gelesen; Claude erhält nur gezielte Zusammenfassungen und übernimmt die Analyse KI & Agenten

Spotify shunt: Einrichtung, Token-Ersparnis und Grenzen

Was Spotifys 90-Prozent-Angabe wirklich misst, welche Portal-Voraussetzungen gelten und wann ausgelagerte Lesezugriffe trotz Zusatzkosten sinnvoll sind.

Drei KI-Kollegen sind vor Browser-, Datei- und MCP-Aktionen mit einem Regel- und Audit-Gateway verbunden; die Gesprächsspeicherung ist separat dargestellt KI & Agenten

OpenBot im Check: KI-Kollegen selbst hosten

Quellenbasierte OpenBot-Bewertung: Was das Aktions-Gateway leistet, welche Standardwerte du ändern solltest und wann eigener Betrieb sinnvoller ist als ein fertiger Assistent.

Ein Smartphone und ein Laptop teilen ein großes Sprachmodell zwischen Browser-Tabs, während WebRTC Aktivierungen zwischen ihnen überträgt KI & Agenten

SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop

Käuferorientierter SwarmLLM-Test: 27B-Inferenz im Browser, WebGPU und WebRTC, Benchmark-Grenzen, Peer-Trust, Security und ein klarer Pilotplan.

Ein Background Coding Agent erhält einen Prompt, stellt einen vorbereiteten Development-Snapshot wieder her, arbeitet in einer isolierten Sandbox, verifiziert die Änderung und öffnet einen Pull Request KI & Agenten

Ramp Inspect Architektur 2026: Background Coding Agents skalieren

Wie Ramp Inspect mit Modal Sandboxes, Filesystem-Snapshots, Koordination und Verifikation arbeitet und welche Kontrollen regulierte Engineering-Teams vor dem Skalieren brauchen.

Vollständiges Artikelverzeichnis

  1. Valyus 0,6B-Router für Retrieval-Agenten: Ergebnisse, Grenzen und Einsatz
  2. OpenAI Agents API im Review: Migration, Kosten und Datenkontrollen
  3. Spotify shunt: Einrichtung, Token-Ersparnis und Grenzen
  4. OpenBot im Check: KI-Kollegen selbst hosten
  5. SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop
  6. Ramp Inspect Architektur 2026: Background Coding Agents skalieren
  7. Model Hardware Standard: MHS für Physical AI im Unternehmen
  8. Fonio AI Erfahrungen 2026: Preise, API, DSGVO & Build vs Buy
  9. Mosaic (YC S26) im Check: Shared Memory für Coding Agents
  10. Ripwire Review 2026: Repo-Kontext für KI-Agenten ohne Embeddings?
  11. Atomare Multi-Datei-Edits für KI-Coding-Agenten: die Semaprax-Lektion
  12. Phonely Alma im Test: Ist das Voice-LLM produktionsreif?
  13. Utopia: Temporalen Wissensgraph im Unternehmen prüfen
  14. Wissenstransfer zwischen KI-Agenten: Einmal entdecken, günstiger skalieren
  15. claude-rotate: Ein Proxy für mehrere Claude-Max-Konten
  16. NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke
  17. Feynman im Test: Ist der Open-Source AI Research Agent bereit für Teams?
  18. Obscura Browser im Test: Aussagen, Grenzen und Produktions-Fit
  19. Claude-Code-Designsystem: 4 Bausteine für markentreue UI
  20. Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?
  21. PageLM im Check: Selbst hosten und kommerziell nutzen
  22. ChatGPT-Login: Das Modell sieht dein Passwort nicht
  23. M6 Mac mini vs. M5 Mac Studio für lokale KI: Kaufberatung
  24. KI-Agenten-Harness erklärt: Die Zuverlässigkeitsschicht rund um ein LLM
  25. FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?
  26. Darkbloom AI Test: Private Inferenz auf freien Macs
  27. Ox Alpha als GLM-5.3-Flash enthüllt: Was sich ändert
  28. Warum Agenten-Edits semantische Identität brauchen: SEMAPRAX in Rust
  29. LangChain Deep Agents im Test: Ist das Agent Harness produktionsreif?
  30. Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
  31. Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
  32. OpenViking im Test 2026: Ist Dateisystem-Memory produktionsreif?
  33. LLM-as-a-Verifier erklärt: Architektur, Kosten und Produktionseinsatz
  34. AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
  35. TrueForge im Test: Ist das Open-Source Agent Harness produktionsreif?
  36. Agentenlesbare Websites: llms.txt, Markdown-Spiegel und was kaputtgeht
  37. Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
  38. Lokalisierte URL-Slugs und hreflang: Warum wir einen englischen Slug behalten
  39. Kann ein KI-Agent dein Produkt benutzen, oder nur darüber lesen?
  40. Graft Review 2026: Gehört die Repo-Map ins Git?
  41. Wie du Coding-Agenten mit Tool-Ausgabe-Kompression skalierbar machst
  42. Intelligenterer Token-Einsatz mit deinem AI-Coding-Agenten
  43. DeepSeek Harness im Test: Ist der Plugin-Stack produktionsreif?
  44. Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
  45. OpenSandbox im Review: Lohnt sich Self-Hosting?
  46. Transformers.js im Browser: Wann lokale KI in dein Produkt gehört
  47. Cloudflare Kitesurf im Test: Kosten, Grenzen und Produktions-Fit
  48. GitHub Spec Kit im Test: Lohnt sich der Prozess?
  49. Interner KI-Agenten-Marktplatz: Praxisleitfaden 2026
  50. LiteLLM selbst hosten: Production-Guide 2026
  51. KI-fähiges Unternehmenswiki: Architektur und Aufbau
  52. Ist Linux das beste Betriebssystem für KI-Agenten? Infrastruktur-Guide 2026
  53. Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026
  54. OpenKB Review: Knowledge Compiler vs. RAG
  55. Unsloth Desktop im Test: Private lokale KI-Workstation?
  56. NeMo Switchyard 0.2: Agenten-Routing ohne Training?
  57. Firecrawl AnyDoc im Test: 14 Formate zu Markdown
  58. MCP Cloud vs. Manufact Cloud: MCP-Hosting-Ratgeber
  59. Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?
  60. KI-Texte menschlicher schreiben mit Agent Skills
  61. NVIDIA NOOA im Test: Sind objektorientierte Agenten produktionsreif?
  62. OmniRoute KI-Routing: Setup und Produktions-Checkliste
  63. Strix AI Pentesting: 30-Tage-Pilot und Kaufguide 2026
  64. Hyperagent im Test: Cloud-KI-Agenten ohne eigenen Server
  65. Gemini Robotics 2: Ganzkörpersteuerung und die Pilotentscheidung
  66. Hark Handoff im Test: Der Agent, der wirklich klickt
  67. Meta Muse Code Preise: Ist Contributor für Kundencode sicher?
  68. pdf-inspector im Test: PDFs vor OCR lokal routen
  69. PII vor LLM-Prompts entfernen: Eine praktische Pipeline
  70. Agent Reach im Test: Kosten, Sicherheit und Grenzen
  71. Cloudflare Wallets für KI-Agenten: Was ist live?
  72. Lokaler multimodaler KI-Coding-Assistent: Sprache, OCR und Datenschutz
  73. DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
  74. YC QM Agent im Test: Ist Quartermaster bereit?
  75. jcode vs Claude Code: Lohnt sich der Wechsel zum Rust-Harness?
  76. Lightpanda Browser für KI-Agenten: Praxischeck 2026
  77. Graph Engineering für KI-Agenten: Wann lohnt sich ein Knowledge Graph?
  78. Multi-Modell KI-Coding-Agent-Stack: Kaufleitfaden für Teams
  79. Ist MCP jetzt stateless? Deine Server-Migrationscheckliste
  80. MCP ist keine Sicherheitsgrenze: Agentendaten schützen
  81. Gemma 4 kostenlos mit Unsloth und Colab tunen
  82. Können KI-Agenten miteinander kommunizieren? Band-Guide
  83. Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
  84. LeanCTX Erfahrung aus Agentur-Sicht: technischer Praxisbericht
  85. Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
  86. GPT-5.6 Sol mit CLIProxyAPI in Claude Code nutzen
  87. Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
  88. Enterprise MCP Authorization: Multi-Tenant-Referenzarchitektur
  89. RAG-Vektoren auf 2 Bit komprimieren: Ist datenunabhängige Quantisierung produktionsreif?
  90. LMCache meldet 13,7x niedrigere mittlere TTFT mit gemeinsamem KV Cache
  91. Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
  92. OpenAI Eval-Sandbox-Escape: 12 Kontrollen für Cyber-Agenten
  93. Cisco Antares im Test: 1B Local AI für Vulnerability Localization
  94. Meterless im Test 2026: Ist der Context Layer produktionsreif?
  95. NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
  96. Claude Code vs OpenCode: Was kostet dein Team 2026 weniger?
  97. Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
  98. Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
  99. Graphify Review 2026: Lohnt sich ein Knowledge Graph für deine Codebasis?
  100. Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
  101. KI-Pilot Kill-or-Scale-Scorecard: 12 Kennzahlen nach 30 Tagen
  102. Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
  103. T3MP3ST Review 2026: Ersetzt es einen Penetrationstest?
  104. Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
  105. Open Knowledge Format (OKF): Der Unternehmensleitfaden
  106. AI Agent Cost per Action: Warum agentische Workflows Token-Rechnungen sprengen
  107. Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
  108. LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
  109. Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?
  110. Pro Token günstiger kann pro Aufgabe teurer sein
  111. Claude Fable 5.1 in Claude Code nutzen
  112. Anthropic sagt Nein zum Open-Weights-Verbot. Der Kostenkampf bleibt real.
  113. Was ein interner KI-Assistent in der DACH-Region wirklich kostet (2026)
  114. LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  115. LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
  116. Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  117. Der Engpass war nie Intelligenz. Es war Kontext.
  118. ChatGPT Enterprise vs. Copilot vs. eigenes RAG
  119. MCP, RAG, Agent Skills oder Custom GPTs?
  120. LLM-Token-Kosten 2026 senken
  121. KI-Agent-Pilot in 30/60/90 Tagen
  122. RAG über SharePoint, Confluence, Drive: Permissions-First
  123. RAG-Production-Readiness-Checkliste für EU-Unternehmen
  124. Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
  125. Warum KI-Agentenprojekte abgebrochen werden
  126. RAG, Fine-Tuning oder Long Context? Vergleich 2026
  127. LLM-API-Kosten 2026. Architektur-Shift