---
title: "NeMo Switchyard 0.2 Review: Agenten-Router"
canonical: https://wavect.io/de/blog/nemo-switchyard-model-router/
language: de
description: "NeMo Switchyard 0.2 im Review: Setup, Stage Router, Rust-Architektur, Produktionslücken und Checkliste für einen messbaren Agenten-Pilot."
image: "https://wavect.io/img/blog/headers/header_nemo-switchyard-model-router.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

9 Min Lesezeit · 11. August 2026 Zuletzt geprüft 11. August 2026

[**Weiter**](/de/blog/omniroute-ai-routing-setup/)

# NeMo Switchyard 0.2: Agenten-Routing ohne Training?

TL;DR

NeMo Switchyard 0.2 ist eine Apache-2.0-lizenzierte Pre-Alpha-Control-Plane. Sie kann einzelne Turns eines Coding-Agenten zwischen effizienten und leistungsstarken Modellen routen und dabei OpenAI- und Anthropic-Formate übersetzen. Der Stage Router nutzt Tool-Ergebnisse, Fehler und Fortschrittssignale. Der Standardpfad braucht deshalb kein trainiertes Router-Modell, aber sehr wohl repräsentative Evals und eine kalibrierte Schwelle. Version 0.2 macht Rust-Server und Rust-Library zu den primären Deployment-Pfaden, behält Python-Bindings und einen über Python verteilten Launcher und stuft den älteren Python-Server als veraltet ein. Nutze Switchyard zunächst nur für begrenzte, rückrollbare Entwickler-Workflows, miss Kosten pro akzeptierter Aufgabe und behalte einen direkten Provider-Fallback, bis die dokumentierten Observability-Lücken und deine Qualitätsgates geschlossen sind.

**NeMo Switchyard ist eine Open-Source-Control-Plane, die für jeden Turn eines KI-Agenten ein Modell auswählen, OpenAI- und Anthropic-Formate übersetzen und Routing-, Token-, Latenz- und Kostensignale ausgeben kann.** Version 0.2 erschien am 10. August 2026. Besonders relevant ist der Stage Router: Er kann Tool-Ergebnisse und den Fortschritt des Agenten nutzen, statt ein eigenes Router-Modell zu benötigen.

Das macht Switchyard noch nicht zu einem kostenlosen Produktions-Optimierer. Das Projekt ist ausdrücklich Pre-Alpha, die Routing-Schwelle muss kalibriert werden und ein günstigeres Modell spart nur dann Geld, wenn die Aufgabe weiterhin akzeptiert wird. Dieser Review beantwortet daher eine enge kommerzielle Frage: Sollte ein Engineering-Team NeMo Switchyard jetzt pilotieren? Für die Kategorieauswahl gibt es unseren [Vergleich von LLM Gateways und Routern](/de/blog/llm-gateway-router-comparison-2026/). Für das gesamte Team-Setup ist der [Kaufleitfaden für Multi-Modell Coding Agents](/de/blog/multi-model-ai-coding-agent-stack-2026/) zuständig. Quellen und Produktstand wurden am 11. August 2026 geprüft.

**Unabhängigkeit und Marken:** Wavect veröffentlicht diese Seite und ist selbst Anbieter, wir haben also ein wirtschaftliches Interesse daran. Mit den hier genannten anderen Unternehmen sind wir weder verbunden noch von ihnen beauftragt oder empfohlen, und alle Firmennamen, Marken und Warenzeichen Dritter gehören ihren jeweiligen Inhabern. Aussagen über andere Anbieter stammen aus öffentlich zugänglichen Quellen, vor allem aus deren eigenen veröffentlichten Seiten, mit Stand des auf dieser Seite genannten Prüfdatums, und können sich seither geändert haben. Bitte prüfe sie vor einer Entscheidung selbst. Diese Seite wurde nach bestem Wissen und Gewissen erstellt, mit dem Ziel, möglichst objektiv zu bleiben. Wenn dir etwas falsch oder unfair erscheint, schreib uns und wir korrigieren es: [office@wavect.io](mailto:office@wavect.io)

## Was ist NeMo Switchyard?

**NeMo Switchyard ist NVIDIAs Apache-2.0-lizenzierter Proxy samt Library für Agenten- und LLM-Traffic.** Ein Client sendet OpenAI Chat Completions, OpenAI Responses oder Anthropic Messages an eine Route-ID. Switchyard wählt ein konfiguriertes Ziel, ruft das Backend in dessen Format auf und übersetzt die Antwort für den Client zurück.

Der aktuelle [PyPI-Eintrag für NeMo Switchyard 0.2](https://pypi.org/project/nemo-switchyard/) datiert das Release auf den 10. August 2026 und verlangt Python 3.12 oder neuer für das paketierte Tool. Das [offizielle Switchyard Repository](https://github.com/NVIDIA-NeMo/Switchyard) beschreibt vier Routing-Wege: gewichteten Zufall, einen LLM Classifier, den signalbasierten Stage Router und eine Eskalation nach einem Versuch mit dem schwächeren Modell. Es warnt zugleich, dass die Software Pre-Alpha und nicht für Produktion gedacht ist.

## Was hat sich in Switchyard 0.2 geändert?

Version 0.2 verändert die Architektur stärker, als die kleine Versionsnummer vermuten lässt. Der native Rust-Server und `switchyard-libsy` sind nun die primären Deployment-Pfade. Python bleibt wichtig, aber vor allem als Distributions- und Integrationsschicht rund um den Rust-Kern.

| Pfad | Sinnvoller erster Einsatz | Was tatsächlich läuft |
| --- | --- | --- |
| Agent Launcher | Lokaler Versuch mit Codex, Claude Code oder OpenClaw | Ein über Python verteilter CLI startet den nativen Rust-Server |
| Standalone Server | Gemeinsamer HTTP-Proxy mit expliziten Routen | `switchyard-server` liest TOML und bedient drei API-Formate |
| Embedded Library | Bestehendes Rust Gateway oder Agent Runtime | `switchyard-libsy` liefert Entscheidungen an die Host-Anwendung |
| Python Bindings | Python-eigene Modellclients oder Migration von 0.1 | Rust-Algorithmen laufen im Prozess; der alte Python-Server ist veraltet |

Die Aussage „Python Library“ ist für 0.2 also nicht falsch, aber unvollständig. Ein neues Deployment sollte einen Rust-nativen Service oder eine Rust-Library, versionierte TOML-Konfiguration, native Observability und die Verantwortung für einen weiteren Kontrollpunkt im Traffic einplanen.

## Wie wählt Stage Routing für jeden Agenten-Turn ein Modell?

Stage Routing liest die Historie, die ein Agent ohnehin erzeugt. Die [offizielle Stage-Router-Spezifikation](https://github.com/NVIDIA-NeMo/Switchyard/blob/main/docs/routing_algorithms/stage_router_routing.md) bewertet aktuelle Fehler, Aktivität ohne Fortschritt, Exploration, Writes und erfolgreiche Tests. Fehlerbehebung und unsichere Exploration schieben einen Turn zur leistungsstarken Stufe. Eingependelte mechanische Arbeit schiebt ihn zur effizienten Stufe.

1. **Standardhaltung wählen.** `capable_first` schützt Qualität, `efficient_first` schützt Kosten.
2. **Tool-Signale bewerten.** Meist reicht ein einzelnes Signal nicht. Mehrere Hinweise müssen `confidence_threshold` überschreiten.
3. **Harte Overrides anwenden.** Ein kritischer Fehler kann das leistungsstarke Modell erzwingen.
4. **Unsicherheit auflösen.** Ein Turn mit niedriger Konfidenz nutzt die Standardstufe oder einen optionalen LLM Classifier.
5. **Entscheidung protokollieren.** Response Header nennen das gewählte Modell und einen lesbaren Grund.

Das ist stärker auf Agenten zugeschnitten als eine einmalige Klassifikation des ersten Prompts. Dieselbe Aufgabe kann bei der Erkundung mit dem leistungsstarken Modell beginnen, nach einem stabilen Plan zum effizienten Modell wechseln und nach einem fehlgeschlagenen Test zurückkehren.

## Braucht NeMo Switchyard wirklich kein Training?

**Der standardmäßige, rein signalbasierte Stage Router braucht kein separat trainiertes Router-Modell.** Seine Regeln und seine Schwelle arbeiten mit der Tool-Historie. Auch Random Routing braucht kein Training. Eine LLM-Classifier-Route verursacht dagegen einen zusätzlichen Modellaufruf, und eigene Algorithmen können andere Anforderungen haben.

Kein Training bedeutet nicht keine Nachweise. NVIDIA empfiehlt `0.5` als Startwert und danach eine Kalibrierung mit repräsentativen Aufgaben. Der dokumentierte Minimalpfad umfasst ungefähr 40 bis 75 Läufe mit dem leistungsstarken Modell und rund 20 Probes mit dem effizienten Modell. Das ist Evaluation und Policy-Kalibrierung statt Modelltraining, kostet aber weiterhin Tokens, Engineering-Zeit und Review.

## Wie sieht ein verantwortungsvoller erster Setup aus?

Nutze den Launcher für einen lokalen Versuch und den Standalone Server für einen Team-Pilot. Begrenze die erste Route auf zwei Modelle und ein Ziel.

```
uv tool install --python 3.12 "nemo-switchyard[cli,server]"
switchyard launch codex --model switchyard
```

Für eine eigene Route installierst du `switchyard-server`, deklarierst ein leistungsstarkes und ein effizientes Ziel in TOML, validierst mit `--dry-run` und bindest zunächst nur an localhost. Port 4000 gehört nicht direkt ins Teamnetz oder Internet. Authentifizierung, TLS, Rate Limits und Network Policy brauchen eine freigegebene Gateway-Grenze.

| Pilot-Entscheidung | Empfohlener Start | Warum |
| --- | --- | --- |
| Modellpaar | Ein bewährtes leistungsstarkes und ein klar günstigeres effizientes Modell | Zu viele Ziele verschleiern die Ursache von Änderungen |
| Picker | `capable_first` | Konservative Basis, bevor der günstige Pfad wächst |
| Schwelle | `0.5`, danach kalibrieren | Dokumentierter Startwert, kein universelles Optimum |
| Traffic | Freigegebene Repositories und rückrollbare Aufgaben | Pre-Alpha-Infrastruktur soll keine irreversiblen Aktionen besitzen |
| Fallback | Direktes Provider-Profil außerhalb von Switchyard | Vergleich und Bypass bleiben im Incident möglich |

## Ist NeMo Switchyard produktionsreif?

**Nein, aktuell nicht als Drop-in-Abhängigkeit für Produktion.** Die Warnung des Projekts ist eindeutig. Das [Switchyard 0.2 Changelog](https://github.com/NVIDIA-NeMo/Switchyard/blob/main/CHANGELOG.md) nennt außerdem bekannte Lücken: Upstream-Arbeit kann nach einem Client-Abbruch weiterlaufen, manche Fallback-Entscheidungen fehlen in der Tier-Zuordnung der Statistiken, erfolgreiche Retries werden nicht korrekt gezählt, native Session Stats lassen einen Session Header aus und ein dokumentierter Versions-Header wird nicht upstream gesendet.

Das spricht nicht gegen einen Pilot. Es verlangt nur einen ehrlichen Scope. Ein Entwickler-Workflow mit begrenztem Budget und ohne Kundendaten ist etwas anderes als ein Support-Agent, der Refunds auslöst, oder ein autonomer Workflow mit Produktionszugriff.

## Was ergänzt die NeMo Relay Integration?

Die experimentelle [Switchyard Integration in NeMo Relay 0.6](https://docs.nvidia.com/nemo/relay/v0.6.0/configure-plugins/switchyard/about) zeigt ein sinnvolles Produktionsmuster. Switchyard trifft die Routing-Entscheidung. Relay besitzt Credentials, Target Bindings, Protokollübersetzung, Dispatch, Retries, vertrauenswürdige Fallbacks und Observability. `observe_only` protokolliert eine hypothetische Entscheidung, während der Request weiterhin an ein vertrauenswürdiges Standardmodell geht.

Diese Trennung ist die stärkste Einführungsidee im aktuellen Stack. Beobachte Entscheidungen zuerst im Schattenbetrieb. Vergleiche die gewählte Route mit den Ergebnissen. Aktiviere Enforcement erst, wenn der günstige Pfad dieselben Akzeptanzkriterien wie der direkte Baseline-Pfad erfüllt.

## Was sollte ein 30-Tage-Pilot messen?

Ein Router soll akzeptierte Ergebnisse optimieren, nicht billige Calls. Nutze den Ansatz aus unserem [Leitfaden zu LLM Evaluation und ROI](/de/blog/llm-evaluation-cost-roi-production/) und rechne fehlgeschlagene Versuche, Judge Calls und Retries vollständig ein.

| Gate | Messwert | Freigabefrage |
| --- | --- | --- |
| Qualität | Akzeptierte Aufgaben pro Route und Risikoklasse | Hält der effiziente Pfad die erlaubte Baseline? |
| Wirtschaftlichkeit | Kosten pro akzeptierter Aufgabe inklusive Classifier und Retries | Bleibt die Ersparnis nach Review und Nacharbeit bestehen? |
| Routing-Präzision | Safe-, Loss-, Rescue- und Hard-Quadranten | Welche Signale erzeugen schädliche Downgrades oder hilfreiche Eskalationen? |
| Latenz | Time to First Token und Ende-zu-Ende-p95 | Verletzt Router oder Classifier das Produktbudget? |
| Resilienz | Tests mit 429, Timeout, 5xx, kaputtem Stream und Context Overflow | Kann das System einmal ausfallen, ohne Side Effects zu duplizieren? |
| Betrieb | Begründung, gewähltes Modell, Tokens und Bypass-Drill | Kann ein Engineer eine Route schnell erklären und zurücknehmen? |

## Wann passt Switchyard, ein Gateway oder eigenes Routing?

- **Switchyard pilotieren:** Wenn Signale einzelner Coding-Agent-Turns die Hauptchance sind und dein Team Pre-Alpha-Rust-Infrastruktur betreiben kann.
- **Breiteres Gateway wählen:** Wenn Identität, Quoten, Policy, Provider-Failover und Audit-Verwaltung wichtiger sind. Unser [OmniRoute Setup mit Produktions-Checkliste](/de/blog/omniroute-ai-routing-setup/) behandelt diesen produktspezifischen Pfad.
- **Engen Custom Router bauen:** Wenn der Workflow wenige stabile Task-Klassen, strikte Side-Effect-Regeln oder eigene Eval-Signale hat.
- **Bei einem Modell bleiben:** Wenn das Volumen klein, die Aufgaben gleich kritisch oder Evaluation und Betrieb teurer als die mögliche Ersparnis sind.

Ein selbst gehostetes Switchyard macht Remote Inference nicht lokal. Prompts erreichen weiterhin jeden konfigurierten Upstream, und der Router wird zum privilegierten Punkt im Datenpfad. Klassifiziere Repository- und Kundendaten vor dem Routing, trenne Credentials nach Umgebung, minimiere gespeicherte Prompts und nimm den Router in Incident Response und Lieferantenprüfung auf.

## Häufige Fragen

### Was ist NeMo Switchyard?

NeMo Switchyard ist NVIDIAs Open-Source-Proxy samt Library für das Routing von LLM-Traffic über konfigurierte Modelle. Es übersetzt OpenAI- und Anthropic-Formate, unterstützt mehrere Routing-Algorithmen und liefert Betriebsmetriken.

### Kann Switchyard jeden Schritt eines Coding Agents routen?

Ja. Der Stage Router kann bei jedem Modellaufruf anhand aktueller Tool-Ergebnisse, Fehler, Exploration und Produktionssignale entscheiden. Eine Aufgabe kann während ihrer Laufzeit zwischen leistungsstarker und effizienter Stufe wechseln.

### Braucht Switchyard Router-Training?

Der rein signalbasierte Stage Router und Random Routes brauchen kein trainiertes Router-Modell. Teams benötigen trotzdem repräsentative Evals und eine Kalibrierung der Schwelle. Optionale LLM Classifier verursachen zusätzliche Modellaufrufe.

### Ist NeMo Switchyard produktionsreif?

Das Projekt bezeichnet sich als Pre-Alpha und nicht für Produktion. Nutze Version 0.2 nur für begrenzte Piloten mit Kostenlimit, rückrollbaren Aufgaben, direktem Provider-Fallback und klaren Qualitätsgates.

### Ist Switchyard ein Python- oder Rust-Projekt?

Beides, mit einer wichtigen Unterscheidung. Version 0.2 macht den nativen Rust-Server und die Rust-Library zu den primären Deployment-Pfaden. Der Launcher wird als Python-Paket mit Rust Extension verteilt, Python-Bindings bleiben verfügbar und der alte Python-Server ist veraltet.

## Fazit

NeMo Switchyard ist eine zeitgemäße Infrastrukturidee, weil der schwierigste Schritt eines Agenten nicht immer der erste ist. Stage Routing kann leistungsstarke Modelle für Exploration und Recovery reservieren und eingependelte Arbeit ohne separates Router-Training an eine effiziente Stufe geben.

Der verantwortungsvolle Weg ist ein Pilot im Schattenbetrieb, keine Abkürzung in die Produktion. Beginne mit zwei Modellen, einem qualitätsorientierten Default, repräsentativen Aufgaben und einem direkten Bypass. Miss Kosten pro akzeptierter Aufgabe und aktiviere Routing erst, wenn die Ergebnisse sichere günstige Turns belegen.

## Das könnte dich auch interessieren..

[**Multi-Modell KI-Coding-Agent-Stack: Kaufleitfaden** Ordne Switchyard in einen vollständigen Stack mit Orchestrator, Verification, Berechtigungen und Kostenkontrolle ein.](/de/blog/multi-model-ai-coding-agent-stack-2026/) [**AI Enablement oder generische KI-Beratung?** Vergleiche eine eigene, messbare Implementierung mit Beratung, die vor Produktion endet.](/de/compare/ai-enablement-vs-generic-ai-consultancy/)

Modelle und Infrastruktur

## In diesem Cluster weiterlesen

[Mit dem Grundlagenartikel starten**LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen**](/de/blog/self-hosting-llms-eu-cost/)

- [Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026](/de/blog/claude-text-watermark-api-2026/)
- [OpenKB Review: Knowledge Compiler vs. RAG](/de/blog/openkb-review-vs-rag/)
- [Unsloth Desktop im Test: Private lokale KI-Workstation?](/de/blog/unsloth-desktop-local-ai-workstation-review/)
- [Firecrawl AnyDoc im Test: 14 Formate zu Markdown](/de/blog/firecrawl-anydoc-review/)
- [Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?](/de/blog/muse-glimmer-30b-local-agent-guide/)

Postfach, ohne Lärm

## Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

9 Min Lesezeit · 11. August 2026 Zuletzt geprüft 11. August 2026

[**Weiter**](/de/blog/omniroute-ai-routing-setup/)

Neue Beiträge per E-Mail ×

×

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/nemo-switchyard-model-router/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-08-11",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-08-11",
      "url": "https://wavect.io/de/blog/nemo-switchyard-model-router/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "NeMo Switchyard 0.2 ist eine Apache-2.0-lizenzierte Pre-Alpha-Control-Plane. Sie kann einzelne Turns eines Coding-Agenten zwischen effizienten und leistungsstarken Modellen routen und dabei OpenAI- und Anthropic-Formate übersetzen. Der Stage Router nutzt Tool-Ergebnisse, Fehler und Fortschrittssignale. Der Standardpfad braucht deshalb kein trainiertes Router-Modell, aber sehr wohl repräsentative Evals und eine kalibrierte Schwelle. Version 0.2 macht Rust-Server und Rust-Library zu den primären Deployment-Pfaden, behält Python-Bindings und einen über Python verteilten Launcher und stuft den älteren Python-Server als veraltet ein. Nutze Switchyard zunächst nur für begrenzte, rückrollbare Entwickler-Workflows, miss Kosten pro akzeptierter Aufgabe und behalte einen direkten Provider-Fallback, bis die dokumentierten Observability-Lücken und deine Qualitätsgates geschlossen sind.",
  "articleBody": " Blog-Übersicht/AI und Agents/Modelle und Infrastruktur NeMo Switchyard 0.2: Agenten-Routing ohne Training? TL;DR NeMo Switchyard 0.2 ist eine Apache-2.0-lizenzierte Pre-Alpha-Control-Plane. Sie kann einzelne Turns eines Coding-Agenten zwischen effizienten und leistungsstarken Modellen routen und dabei OpenAI- und Anthropic-Formate übersetzen. Der Stage Router nutzt Tool-Ergebnisse, Fehler und Fortschrittssignale. Der Standardpfad braucht deshalb kein trainiertes Router-Modell, aber sehr wohl repräsentative Evals und eine kalibrierte Schwelle. Version 0.2 macht Rust-Server und Rust-Library zu den primären Deployment-Pfaden, behält Python-Bindings und einen über Python verteilten Launcher und stuft den älteren Python-Server als veraltet ein. Nutze Switchyard zunächst nur für begrenzte, rückrollbare Entwickler-Workflows, miss Kosten pro akzeptierter Aufgabe und behalte einen direkten Provider-Fallback, bis die dokumentierten Observability-Lücken und deine Qualitätsgates geschlossen sind. NeMo Switchyard ist eine Open-Source-Control-Plane, die für jeden Turn eines KI-Agenten ein Modell auswählen, OpenAI- und Anthropic-Formate übersetzen und Routing-, Token-, Latenz- und Kostensignale ausgeben kann. Version 0.2 erschien am 10. August 2026. Besonders relevant ist der Stage Router: Er kann Tool-Ergebnisse und den Fortschritt des Agenten nutzen, statt ein eigenes Router-Modell zu benötigen. Das macht Switchyard noch nicht zu einem kostenlosen Produktions-Optimierer. Das Projekt ist ausdrücklich Pre-Alpha, die Routing-Schwelle muss kalibriert werden und ein günstigeres Modell spart nur dann Geld, wenn die Aufgabe weiterhin akzeptiert wird. Dieser Review beantwortet daher eine enge kommerzielle Frage: Sollte ein Engineering-Team NeMo Switchyard jetzt pilotieren? Für die Kategorieauswahl gibt es unseren Vergleich von LLM Gateways und Routern. Für das gesamte Team-Setup ist der Kaufleitfaden für Multi-Modell Coding Agents zuständig. Quellen und Produktstand wurden am 11. August 2026 geprüft. Unabhängigkeit und Marken: Wavect veröffentlicht diese Seite und ist selbst Anbieter, wir haben also ein wirtschaftliches Interesse daran. Mit den hier genannten anderen Unternehmen sind wir weder verbunden noch von ihnen beauftragt oder empfohlen, und alle Firmennamen, Marken und Warenzeichen Dritter gehören ihren jeweiligen Inhabern. Aussagen über andere Anbieter stammen aus öffentlich zugänglichen Quellen, vor allem aus deren eigenen veröffentlichten Seiten, mit Stand des auf dieser Seite genannten Prüfdatums, und können sich seither geändert haben. Bitte prüfe sie vor einer Entscheidung selbst. Diese Seite wurde nach bestem Wissen und Gewissen erstellt, mit dem Ziel, möglichst objektiv zu bleiben. Wenn dir etwas falsch oder unfair erscheint, schreib uns und wir korrigieren es: office@wavect.io Was ist NeMo Switchyard? NeMo Switchyard ist NVIDIAs Apache-2.0-lizenzierter Proxy samt Library für Agenten- und LLM-Traffic. Ein Client sendet OpenAI Chat Completions, OpenAI Responses oder Anthropic Messages an eine Route-ID. Switchyard wählt ein konfiguriertes Ziel, ruft das Backend in dessen Format auf und übersetzt die Antwort für den Client zurück. Der aktuelle PyPI-Eintrag für NeMo Switchyard 0.2 datiert das Release auf den 10. August 2026 und verlangt Python 3.12 oder neuer für das paketierte Tool. Das offizielle Switchyard Repository beschreibt vier Routing-Wege: gewichteten Zufall, einen LLM Classifier, den signalbasierten Stage Router und eine Eskalation nach einem Versuch mit dem schwächeren Modell. Es warnt zugleich, dass die Software Pre-Alpha und nicht für Produktion gedacht ist. Was hat sich in Switchyard 0.2 geändert? Version 0.2 verändert die Architektur stärker, als die kleine Versionsnummer vermuten lässt. Der native Rust-Server und switchyard-libsy sind nun die primären Deployment-Pfade. Python bleibt wichtig, aber vor allem als Distributions- und Integrationsschicht rund um den Rust-Kern. PfadSinnvoller erster EinsatzWas tatsächlich läuft Agent LauncherLokaler Versuch mit Codex, Claude Code oder OpenClawEin über Python verteilter CLI startet den nativen Rust-Server Standalone ServerGemeinsamer HTTP-Proxy mit expliziten Routenswitchyard-server liest TOML und bedient drei API-Formate Embedded LibraryBestehendes Rust Gateway oder Agent Runtimeswitchyard-libsy liefert Entscheidungen an die Host-Anwendung Python BindingsPython-eigene Modellclients oder Migration von 0.1Rust-Algorithmen laufen im Prozess; der alte Python-Server ist veraltet Die Aussage „Python Library“ ist für 0.2 also nicht falsch, aber unvollständig. Ein neues Deployment sollte einen Rust-nativen Service oder eine Rust-Library, versionierte TOML-Konfiguration, native Observability und die Verantwortung für einen weiteren Kontrollpunkt im Traffic einplanen. Wie wählt Stage Routing für jeden Agenten-Turn ein Modell? Stage Routing liest die Historie, die ein Agent ohnehin erzeugt. Die offizielle Stage-Router-Spezifikation bewertet aktuelle Fehler,",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "PyPI-Eintrag für NeMo Switchyard 0.2",
      "url": "https://pypi.org/project/nemo-switchyard/"
    },
    {
      "@type": "WebPage",
      "name": "offizielle Switchyard Repository",
      "url": "https://github.com/NVIDIA-NeMo/Switchyard"
    },
    {
      "@type": "WebPage",
      "name": "offizielle Stage-Router-Spezifikation",
      "url": "https://github.com/NVIDIA-NeMo/Switchyard/blob/main/docs/routing_algorithms/stage_router_routing.md"
    },
    {
      "@type": "WebPage",
      "name": "Switchyard 0.2 Changelog",
      "url": "https://github.com/NVIDIA-NeMo/Switchyard/blob/main/CHANGELOG.md"
    },
    {
      "@type": "WebPage",
      "name": "Switchyard Integration in NeMo Relay 0.6",
      "url": "https://docs.nvidia.com/nemo/relay/v0.6.0/configure-plugins/switchyard/about"
    }
  ],
  "dateModified": "2026-08-11",
  "datePublished": "2026-08-11",
  "description": "NeMo Switchyard 0.2 ist eine Apache-2.0-lizenzierte Pre-Alpha-Control-Plane. Sie kann einzelne Turns eines Coding-Agenten zwischen effizienten und leistungsstarken Modellen routen und dabei OpenAI- und Anthropic-Formate übersetzen. Der Stage Router nutzt Tool-Ergebnisse, Fehler und Fortschrittssignale. Der Standardpfad braucht deshalb kein trainiertes Router-Modell, aber sehr wohl repräsentative Evals und eine kalibrierte Schwelle. Version 0.2 macht Rust-Server und Rust-Library zu den primären Deployment-Pfaden, behält Python-Bindings und einen über Python verteilten Launcher und stuft den älteren Python-Server als veraltet ein. Nutze Switchyard zunächst nur für begrenzte, rückrollbare Entwickler-Workflows, miss Kosten pro akzeptierter Aufgabe und behalte einen direkten Provider-Fallback, bis die dokumentierten Observability-Lücken und deine Qualitätsgates geschlossen sind.",
  "headline": "NeMo Switchyard 0.2: Agenten-Routing ohne Training?",
  "image": "https://wavect.io/img/blog/headers/header_nemo-switchyard-model-router.svg",
  "inLanguage": "de",
  "keywords": "KI-Agenten, LLM-Infrastruktur",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/nemo-switchyard-model-router/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/nemo-switchyard-model-router/",
  "wordCount": 1941
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/models-infrastructure/",
      "name": "Modelle und Infrastruktur",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/nemo-switchyard-model-router/",
      "name": "NeMo Switchyard 0.2 Review: Agenten-Router | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "NeMo Switchyard ist NVIDIAs Open-Source-Proxy samt Library für das Routing von LLM-Traffic über konfigurierte Modelle. Es übersetzt OpenAI- und Anthropic-Formate, unterstützt mehrere Routing-Algorithmen und liefert Betriebsmetriken."
      },
      "name": "Was ist NeMo Switchyard?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Ja. Der Stage Router kann bei jedem Modellaufruf anhand aktueller Tool-Ergebnisse, Fehler, Exploration und Produktionssignale entscheiden. Eine Aufgabe kann während ihrer Laufzeit zwischen leistungsstarker und effizienter Stufe wechseln."
      },
      "name": "Kann Switchyard jeden Schritt eines Coding Agents routen?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Der rein signalbasierte Stage Router und Random Routes brauchen kein trainiertes Router-Modell. Teams benötigen trotzdem repräsentative Evals und eine Kalibrierung der Schwelle. Optionale LLM Classifier verursachen zusätzliche Modellaufrufe."
      },
      "name": "Braucht Switchyard Router-Training?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Das Projekt bezeichnet sich als Pre-Alpha und nicht für Produktion. Nutze Version 0.2 nur für begrenzte Piloten mit Kostenlimit, rückrollbaren Aufgaben, direktem Provider-Fallback und klaren Qualitätsgates."
      },
      "name": "Ist NeMo Switchyard produktionsreif?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Beides, mit einer wichtigen Unterscheidung. Version 0.2 macht den nativen Rust-Server und die Rust-Library zu den primären Deployment-Pfaden. Der Launcher wird als Python-Paket mit Rust Extension verteilt, Python-Bindings bleiben verfügbar und der alte Python-Server ist veraltet."
      },
      "name": "Ist Switchyard ein Python- oder Rust-Projekt?"
    }
  ]
}
```
