---
title: "Voicebox: Lokales Voice Cloning & MCP-Setup"
canonical: https://wavect.io/de/blog/voicebox-local-voice-cloning-mcp/
language: de
description: "Voicebox für lokales Voice Cloning, Whisper-Diktate und Agentenstimmen: mit MCP-Setup, Engine-Vergleich, Datenschutzgrenzen und Tests für den ersten Pilot."
image: "https://wavect.io/img/blog/headers/header_voicebox-local-voice-cloning-mcp.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 min Lesezeit · 14. Sep. 2026 Zuletzt geprüft 14. September 2026

[**Weiter**](/de/blog/local-multimodal-ai-coding-assistant/)

# Voicebox: Lokales Voice Cloning, Diktieren und MCP-Setup

TL;DR

Voicebox ist ein quelloffenes lokales Sprachstudio für Voice Cloning, Diktieren und Agentenstimmen. Es bietet sieben TTS-Engines und mehr als 50 voreingestellte Stimmen; 23 Sprachen unterstützt Chatterbox Multilingual, nicht jede Engine. Kompatible Agenten lassen sich über den lokalen MCP-Server oder POST /speak anbinden. Lokale Inferenz vermeidet Cloud-TTS-Gebühren, macht Hardware aber nicht kostenlos und einen Cloud-Agenten nicht lokal. Lade die Modelle zuerst herunter, verwende autorisierte Stimmen und schütze die API ohne integrierte Authentifizierung vor öffentlichem Zugriff. Dokumentationsprüfung: 14. September 2026.

Dein Coding-Agent schließt eine Aufgabe ab. Statt einer weiteren Benachrichtigung zum Lesen spricht er mit einer Stimme, die du ausgewählt hast. Du diktierst die nächste Anfrage, ohne das Fenster zu wechseln. Interessant ist dabei nicht das nächste Abo: Beide Seiten dieses Austauschs können auf Hardware laufen, die du kontrollierst.

**Voicebox ist ein quelloffenes, lokal ausgerichtetes Sprachstudio für Voice Cloning, Text-to-Speech, Diktieren und die Anbindung über einen MCP-Server.** Das Projekt heißt `jamiepine/voicebox`. Sein [offizielles Repository](https://github.com/jamiepine/voicebox) beschreibt eine Alternative zu Teilen von ElevenLabs und Wispr Flow in einer Anwendung. Voicebox gibt einem bestehenden Agenten eine Stimme; es ersetzt nicht dessen Sprachmodell für die eigentliche Verarbeitung der Anfrage.

Am 14. September 2026 meldete die [GitHub-Repository-API](https://api.github.com/repos/jamiepine/voicebox) **53.242 Sterne**. Das zeigt Aufmerksamkeit, ist aber kein Qualitätsbenchmark. Dieser Artikel basiert auf der Dokumentation, nicht auf einem eigenen Audiovergleich.

## Ist Voicebox eine Alternative zu ElevenLabs oder Wispr Flow?

**Ja, für bestimmte Aufgaben: lokale Sprachausgabe, Voice Cloning und Diktieren am Desktop. Das bedeutet keine vollständige Funktionsgleichheit.**

Die [Text-to-Speech-Dokumentation von ElevenLabs](https://elevenlabs.io/docs/eleven-creative/playground/text-to-speech) beschreibt Spracherzeugung mit Stimmen aus einer Bibliothek sowie gestalteten und geklonten Stimmen. Die [Produktübersicht von Wispr Flow](https://wisprflow.ai/) konzentriert sich darauf, Gesprochenes in gut lesbaren Text für verschiedene Anwendungen zu verwandeln. Voicebox vereint sich überschneidende Aufgaben der Spracheingabe und -ausgabe in einer lokalen Anwendung.

Das ist interessant für Entwickler, die Integrationen nachvollziehen wollen, für Kreative, die Sprechertexte regelmäßig neu erzeugen, und für Teams, die vertrauliche Desktop-Abläufe erproben. Es belegt nicht, dass jede Voicebox-Engine mit Aussprache, Reaktionszeit oder Support eines kommerziellen Dienstes mithält.

Die bessere Auswahlfrage lautet: **Kann Voicebox die Sprachaufgaben ersetzen, die du tatsächlich erledigst, und zwar auf deinen vorhandenen Geräten?** Für ein betreutes geschäftliches Telefonsystem ist unser [Fonio-AI-Plattformvergleich](/de/blog/fonio-ai-review-build-vs-buy-2026/) der passendere Einstieg. Ein Desktop-Studio ist keine Contact-Center-Plattform.

**Unabhängigkeit und Marken:** Wavect veröffentlicht diese Seite und ist selbst Anbieter, wir haben also ein wirtschaftliches Interesse daran. Mit den hier genannten anderen Unternehmen sind wir weder verbunden noch von ihnen beauftragt oder empfohlen, und alle Firmennamen, Marken und Warenzeichen Dritter gehören ihren jeweiligen Inhabern. Aussagen über andere Anbieter stammen aus öffentlich zugänglichen Quellen, vor allem aus deren eigenen veröffentlichten Seiten, mit Stand des auf dieser Seite genannten Prüfdatums, und können sich seither geändert haben. Bitte prüfe sie vor einer Entscheidung selbst. Diese Seite wurde nach bestem Wissen und Gewissen erstellt, mit dem Ziel, möglichst objektiv zu bleiben. Wenn dir etwas falsch oder unfair erscheint, schreib uns und wir korrigieren es: [office@wavect.io](mailto:office@wavect.io)

## Wie funktioniert Voice Cloning mit Voicebox?

Du erstellst aus einer Referenzaufnahme ein Stimmprofil und erzeugst damit neue Sprachausgabe. Auch wenn häufig von einem kurzen Clip die Rede ist: Die [Anleitung zum Voice Cloning](https://docs.voicebox.sh/overview/voice-cloning) empfiehlt **10 bis 30 Sekunden klarer Sprache**, keinen verrauschten Ausschnitt mit Musik oder mehreren Personen.

Beginne mit deiner eigenen Aufnahme. Halte den Mikrofonabstand möglichst gleich, sprich natürlich und teste anschließend einen neuen Satz mit Namen, Zahlen und Satzzeichen. Beurteile Verständlichkeit und Stimmähnlichkeit getrennt. Eine wiedererkennbare Stimme kann einen Produktnamen trotzdem falsch aussprechen.

Für einen ersten Versuch brauchst du keine Aufnahme. Die [Dokumentation der voreingestellten Stimmen](https://docs.voicebox.sh/overview/preset-voices) beschreibt **mehr als 50 kuratierte Stimmen** aus Kokoro und Qwen CustomVoice. Damit lässt sich die Integration testen, bevor du Zeit in einen eigenen Klon investierst.

## Was bedeuten sieben TTS-Engines und 23 Sprachen wirklich?

**Voicebox bündelt mehrere Engines in einem Studio; ihre Fähigkeiten sind nicht austauschbar.** Die [Engine-Übersicht des Projekts](https://github.com/jamiepine/voicebox/blob/main/README.md#multi-engine-voice-cloning) unterscheidet folgende Optionen:

| Engine | Stimmtyp | Dokumentierter Sprachumfang |
| --- | --- | --- |
| Qwen3-TTS | Klonen | 10 Sprachen |
| Qwen CustomVoice | Voreingestellte Stimmen | 10 Sprachen |
| LuxTTS | Klonen | Englisch |
| Chatterbox Multilingual | Klonen | 23 Sprachen |
| Chatterbox Turbo | Klonen | Englisch |
| HumeAI TADA | Klonen | 3B: 10 Sprachen; 1B: Englisch |
| Kokoro | Voreingestellte Stimmen | 8 Sprachen |

Die Angabe von 23 Sprachen bezieht sich auf Chatterbox Multilingual, nicht auf jede Engine. Auch sind voreingestellte Stimmen nicht automatisch klonbare Modelle. Prüfe die Kombination aus Engine, Stimmprofil und Zielsprache.

Mehrsprachige Sprachausgabe ist außerdem noch kein Übersetzungsprozess. Bereite das Skript in der Zielsprache vor und prüfe es vor der Synthese. Teste bei einer deutschen Produktvorstellung Firmennamen, zusammengesetzte Wörter und Zahlen. Bei einem mehrsprachigen Kurs sollte jede Sprache von einer sprachkundigen Person geprüft werden, statt alle Fassungen anhand der englischen Hörprobe freizugeben.

## Wie funktioniert lokales Diktieren im Alltag?

Die [Diktier-Anleitung](https://docs.voicebox.sh/overview/dictation) beschreibt Tastenkürzel zum Gedrückthalten oder Umschalten, optionale Überarbeitung durch ein lokales Sprachmodell und das automatische Einfügen in die aktive Anwendung unter macOS und Windows. **Die systemweite Diktierintegration für Linux ist in der dokumentierten Implementierung von v0.5.0 noch nicht verfügbar.**

Laut [technischer Transkriptionsanleitung](https://docs.voicebox.sh/developer/transcription) übernimmt Whisper die Spracherkennung. Das ist eine andere Aufgabe als das Klonen einer Stimme: Transkription macht aus Gesprochenem Text, Synthese macht aus Text Sprache.

Probiere Diktieren zunächst für Ticketbeschreibungen, Besprechungsnachbereitungen und Prompts. Prüfe Shell-Befehle, Zahlungsbeträge und Kundenzusagen weiterhin manuell. Eine Textbereinigung kann die Lesbarkeit verbessern, ohne nachzuweisen, dass Bezeichner, Verneinungen und Zahlen korrekt erhalten blieben.

Ein sinnvoller Testsatz ist bewusst etwas sperrig: „Nicht deployen; Rechnung 1047 unverändert lassen; die Variable in customer ID umbenennen.“ Vergleiche das rohe Transkript mit der bereinigten Fassung. Die beste Einstellung bewahrt deine Aussage, statt lediglich besonders flüssig zu klingen.

## Wie verbindest du Voicebox mit einem MCP-Agenten?

**Starte Voicebox, bereite ein Stimmprofil vor, verbinde einen kompatiblen MCP-Client und teste eine kurze Sprachausgabe.** Die [MCP-Server-Dokumentation](https://docs.voicebox.sh/overview/mcp-server) nennt unter anderem Claude Code, Cursor, Windsurf und Cline als vorgesehene Integrationen. Sie unterstützt Streamable HTTP sowie eine mitgelieferte stdio-Alternative.

### 1. Desktop-App installieren und vorbereiten

Verwende das [offizielle Release v0.5.0](https://github.com/jamiepine/voicebox/releases/tag/v0.5.0) und prüfe, ob Voicebox läuft. Die [Installationsanleitung](https://docs.voicebox.sh/overview/installation) erklärt den anfänglichen Download der Modelle. Erzeuge zuerst eine kurze Hörprobe in der App, bevor du eine Agentenverbindung untersuchst. Lege für die folgenden Beispiele ein kompatibles Profil namens `Wavect demo` an.

Kopiere die clientspezifische Konfiguration unter **Settings → MCP**. Für Clients mit dem dokumentierten Format `mcpServers` sieht der HTTP-Eintrag so aus:

```
{
  "mcpServers": {
    "voicebox": {
      "url": "http://127.0.0.1:17493/mcp",
      "headers": {
        "X-Voicebox-Client-Id": "wavect-local-demo"
      }
    }
  }
}
```

Ergänze die bestehende Konfiguration, ohne andere Server zu überschreiben. Dateipfade und Installationsbefehle unterscheiden sich je nach Client. Die Client-ID ist eine Kennzeichnung für die Stimmzuordnung, **kein Authentifizierungsgeheimnis**.

### 2. Stimme prüfen und Sprachausgabe anfordern

Die [MCP-Implementierungsbeschreibung zum geprüften Commit](https://github.com/jamiepine/voicebox/blob/51f49dea198384b4eb6087b72c17057c6eb1c1cd/backend/mcp_server/README.md) dokumentiert `voicebox.list_profiles` und `voicebox.speak`. Lass zunächst die Profile auflisten. Bitte den Agenten anschließend, `voicebox.speak` mit diesen Argumenten aufzurufen:

```
{
  "text": "Voicebox ist verbunden. Dies ist ein lokaler Sprachtest.",
  "profile": "Wavect demo",
  "personality": false,
  "language": "de"
}
```

Das ist ein Argumentobjekt für ein MCP-Werkzeug, kein separat installierbares JavaScript-SDK. Prüfe die hörbare Ausgabe und den Generierungsstatus. Ein erfolgreicher Werkzeugaufruf beweist noch nicht, dass der Ton die gewünschten Lautsprecher erreicht hat.

Lass `personality` für sachliche Benachrichtigungen deaktiviert. Die [Persönlichkeitsfunktion](https://docs.voicebox.sh/overview/voice-personalities) kann Text vor der Sprachausgabe durch ein lokales Sprachmodell umschreiben. Das passt möglicherweise zu fiktiven Dialogen, nicht aber zu einem exakt wiederzugebenden Build-Ergebnis oder einem freigegebenen Kundentext.

### 3. REST verwenden, wenn der Aufrufer kein MCP unterstützt

Für ein Skript auf demselben Computer wie Voicebox lautet die entsprechende Anfrage:

```
curl --fail-with-body --silent --show-error \
  -X POST http://127.0.0.1:17493/speak \
  -H 'Content-Type: application/json' \
  -H 'X-Voicebox-Client-Id: wavect-local-demo' \
  -d '{"text":"Voicebox ist verbunden. Dies ist ein lokaler Sprachtest.","profile":"Wavect demo","personality":false,"language":"de"}'
```

Die [REST-Beispiele im Repository](https://github.com/jamiepine/voicebox/blob/main/README.md#api) dokumentieren `POST /speak`. Behandle die Erzeugung als asynchron und prüfe ihren Status. Die Antwort ist nicht automatisch eine Audiodatei. `127.0.0.1` bezeichnet immer den eigenen Host oder Container des Aufrufers, nicht deinen Laptop aus Sicht eines entfernten CI-Runners.

## Bleibt bei Voicebox wirklich alles lokal?

**Die lokale Sprachverarbeitung kann ohne Cloud-TTS-Anbieter laufen. Der gesamte Ablauf bleibt aber nur lokal, wenn auch alle angeschlossenen Komponenten lokal sind.**

Lade zuerst die benötigten Modelle herunter und teste den geplanten Ablauf anschließend offline. Ein cloudbasierter Coding-Agent kann weiterhin diktierten Text empfangen und seine Antwort auf einem entfernten System erzeugen. Lokale Sprachausgabe verlagert nicht das Sprachmodell dieses Agenten. Erlaube den Zugriff auf Transkripte und Aufnahmen nur, wenn er tatsächlich gebraucht wird.

Unterscheide auch lokale Verarbeitung von fehlender Speicherung. Die [Captures-Dokumentation](https://docs.voicebox.sh/overview/captures) beschreibt gespeicherte Aufnahmen mit zugehörigen Transkripten. Prüfe Löschung, Backups und Zugriffsrechte auf gemeinsam verwendeten Geräten, bevor du sensible Aufnahmen verarbeitest.

Die [Anleitung zum Remote-Modus](https://docs.voicebox.sh/overview/remote-mode) unterstützt ausdrücklich ein separates Backend und warnt vor fehlender integrierter API-Authentifizierung. Stelle den Dienst nicht direkt ins öffentliche Internet. Ein Client-ID-Header schützt keinen Dienst. Verwende für einen notwendigen gemeinsamen Betrieb ein eingeschränktes Netzwerk und einen authentifizierten Zugang.

Die [Docker-Bereitstellung](https://docs.voicebox.sh/overview/docker) liefert ein Backend ohne Desktop-Oberfläche mit Webinterface. Das ist nicht automatisch mit Desktop-Tastenkürzeln oder Wiedergabe über die lokalen Lautsprecher gleichzusetzen. Plane Aufnahme, Generierung und Wiedergabe als getrennte Integrationsschritte.

Für das übergeordnete Zusammenspiel aus Sprache, Verarbeitung und Werkzeugberechtigungen lies unsere [Architektur eines lokalen multimodalen Coding-Assistenten](/de/blog/local-multimodal-ai-coding-assistant/). Hier geht es um die Ergänzung durch Voicebox, nicht um den erneuten Aufbau der gesamten Architektur.

## Drei sinnvolle Einsatzmöglichkeiten für Voicebox

### Gesprochene Agentenbenachrichtigungen

Beginne mit einem klar begrenzten Ereignis: Ein Testlauf ist abgeschlossen, ein längerer Export ist fertig oder eine Entscheidung braucht deine Aufmerksamkeit. Lass eine kurze, geprüfte Zusammenfassung sprechen, nicht das gesamte Konsolenprotokoll. Vermeide Geheimnisse und Kundeninformationen in gemeinsam genutzten Räumen. Gib Agenten erst dann unterschiedliche Stimmen, wenn klar ist, welche Meldungen dich überhaupt unterbrechen sollen.

### Sprechertexte ohne erneuten Aufnahmetermin überarbeiten

Ein Creator könnte ein geprüftes Skript pflegen und nur geänderte Abschnitte neu erzeugen. Der [Stories-Editor](https://docs.voicebox.sh/overview/stories-editor) bietet eine Zeitleiste für mehrere Stimmen. Die [Anleitung zur Spracherzeugung](https://docs.voicebox.sh/overview/generating-speech) erklärt das Erstellen und Exportieren von Audiodateien.

Prüfe Aussprache, Tempo und Konsistenz zwischen den Abschnitten. Gib bei übersetzten Sprechertexten zuerst die Übersetzung und dann die Stimme frei. „Unbegrenzte Länge“ bedeutet beim Projekt keine unbegrenzte Kapazität pro Anfrage: Die [Dokumentation zur Langform-Generierung](https://github.com/jamiepine/voicebox/blob/main/README.md#unlimited-generation-length) nennt ein Textlimit von 50.000 Zeichen und die Verarbeitung in Teilstücken.

### Persönliche und unterstützende Sprachoberflächen

Die [Hinweise zur verantwortungsvollen Nutzung](https://github.com/jamiepine/voicebox/blob/main/RESPONSIBLE_USE.md) nennen Barrierefreiheit und persönliche Anwendungen. Ein rechtmäßig verwendetes Stimmprofil könnte jemandem helfen, mit einer vertrauten Stimme zu kommunizieren. Das ist eine mögliche Anwendung, kein Nachweis dafür, dass Voicebox ein klinisch validiertes Kommunikationshilfsmittel ist.

Verwende deine eigene Stimme oder Material, zu dessen Nutzung du berechtigt bist. Halte bei gemeinsamen Projekten die Einwilligungen fest und kennzeichne synthetische Sprechertexte, wo es angemessen ist. Eine überzeugende Stimme sollte den Zugang zu einer Anwendung erleichtern, nicht die Identität des Sprechers verschleiern.

## Ist Voicebox für kommerzielle Nutzung kostenlos?

**Die Anwendung steht unter MIT-Lizenz. Diese ist aber keine pauschale Lizenz für jedes Modell, jede Aufnahme oder die Stimme einer Person.** Die [Voicebox-Lizenz](https://github.com/jamiepine/voicebox/blob/main/LICENSE) erlaubt kommerzielle Softwarenutzung unter Beachtung ihrer Hinweispflichten. Modellbedingungen sind gesondert zu prüfen: Die [Kokoro-Modellkarte](https://huggingface.co/hexgrad/Kokoro-82M) nennt beispielsweise Modellgewichte unter Apache-Lizenz.

Lokale Inferenz vermeidet für diese Ausgaben eine nutzungsabhängige Cloud-TTS-Gebühr. Rechenleistung, Speicher, Strom und Wartung stellst du weiterhin bereit; für einen angebundenen Cloud-Agenten können zusätzliche Kosten entstehen. Ob das günstiger ist, hängt von deinem Arbeitsvolumen ab, nicht von der Zahl der GitHub-Sterne.

Eine detaillierte Infrastruktur-oder-API-Entscheidung behandelt unsere [Kostenanalyse für selbst gehostetes TTS](/de/blog/miso-tts-self-hosted-vs-api/). Halte den ersten Voicebox-Versuch überschaubar: ein Gerät, eine Sprache, eine Stimme und ein nützliches Ereignis.

## Was sollte ein erster Voicebox-Pilot nachweisen?

Definiere die Abnahme, bevor du eine Lieblingsdemo auswählst. Verwende für die verschiedenen Einstellungen dasselbe Skript und vergleichbare Mikrofonbedingungen. Unsere vorgeschlagenen Prüfpunkte:

| Test | Akzeptabel, wenn |
| --- | --- |
| Stimme und Aussprache | Eine prüfende Person Namen, Zahlen, Tempo und Stimmähnlichkeit akzeptiert |
| Diktieren | Verneinungen, Bezeichner und Korrekturen in Transkription und optionaler Bereinigung erhalten bleiben |
| Agentenanbindung | Das vorgesehene Profil spricht und fehlende Profile oder gestoppte Backends sichtbar fehlschlagen |
| Datenflüsse | Offline-Verhalten, Aufbewahrung und Agentenzugriff deinen Erwartungen entsprechen |
| Alltagstauglichkeit | Reaktionszeit und Unterbrechungen auf dem tatsächlichen Zielgerät akzeptabel sind |

Eine allgemeingültige Latenzgrenze gibt es hier nicht. Ein vertontes Tutorial und ein unterbrechbarer Assistent haben unterschiedliche Anforderungen. Messe Kaltstarts und normale wiederholte Nutzung getrennt. Halte App-Version, Engine und Einstellungen für einen vergleichbaren Test fest.

**Unsere Empfehlung: Erprobe Voicebox als lokale Sprachkomponente, bevor du es als produktive Sprachplattform behandelst.** Die Kombination ist interessant, weil sie Eingabe, Ausgabe und Agentenwerkzeuge verbindet, ohne einen weiteren gehosteten Sprachdienst vorauszusetzen. Entscheidend ist, ob sie deinen konkreten Ablauf verbessert.

Bei einer Produktintegration unterstützt Wavects [Team für KI-Entwicklung](/de/services/artificial-intelligence/) die Definition der Datenflüsse, die Anbindung und den Aufbau von Abnahmetests. Unsere [Twinsoft-AI-Fallstudie](/de/case-studies/twinsoft-ai/) ist ein eigenständiges Beispiel für KI-Produktentwicklung, keine Voicebox-Implementierung. Der [Leitfaden zur Technologieauswahl für ein MVP](/de/software-development-guide/how-to-choose-a-tech-stack-for-mvp/) hilft bei der Einordnung der Entwicklungsentscheidung. Oder [besprich eine lokale Sprachintegration](/de/contact/) mit uns.

## Häufige Fragen zu Voicebox

### Ist Voicebox eine kostenlose Alternative zu ElevenLabs?

Die MIT-lizenzierte Anwendung kann bestimmte lokale Aufgaben für Voice Cloning, Sprachausgabe und Diktieren ersetzen. Das bedeutet keine vollständige Funktionsgleichheit mit ElevenLabs oder Wispr Flow. Lokale Generierung vermeidet nutzungsabhängige Cloud-TTS-Gebühren; Hardware, Wartung, angebundene Agenten und Modelllizenzen bleiben gesondert zu berücksichtigen.

### Wie viel Audio braucht Voicebox zum Klonen einer Stimme?

Die Anleitung empfiehlt 10 bis 30 Sekunden klare Referenzsprache. Verwende deine eigene Stimme oder Material, für das du eine entsprechende Erlaubnis hast. Prüfe Aussprache und Ähnlichkeit mit einem neuen Satz, statt den Klon nur anhand der Referenzaufnahme zu beurteilen.

### Unterstützen alle sieben Voicebox-Engines 23 Sprachen?

Nein. Die dokumentierten 23 Sprachen bietet Chatterbox Multilingual. Andere Engines haben andere Sprach- und Stimmgrenzen; manche stellen voreingestellte Stimmen statt Klonen bereit. Prüfe, ob die gewählte Engine und das Stimmprofil deine Zielsprache unterstützen.

### Macht Voicebox Claude Code oder Cursor vollständig offline nutzbar?

Nein. Voicebox kann Sprache nach dem Download der benötigten Modelle lokal verarbeiten. Ein angebundener Agent kann Text aber weiterhin an ein Cloud-Modell senden. Prüfe den gesamten Datenfluss, gespeicherte Aufnahmen und Werkzeugberechtigungen, bevor du den vollständigen Ablauf als offline oder privat bezeichnest.

### Funktioniert Voicebox unter Linux?

Das Projekt dokumentiert Linux-Builds aus dem Quellcode und eine Docker-Bereitstellung. Das entspricht nicht der vollständigen Desktop-Erfahrung: Systemweites Diktieren unter Linux wird in der dokumentierten Implementierung von v0.5.0 nicht unterstützt. Für macOS und Windows gibt es Desktop-Installer und dokumentiertes globales Diktieren.

### Wie bekommt ein Agent über Voicebox MCP eine Stimme?

Starte Voicebox, erstelle oder wähle ein kompatibles Stimmprofil und ergänze den lokalen MCP-Server mit der Konfiguration aus Settings → MCP. Teste voicebox.list_profiles vor voicebox.speak. Anwendungen ohne MCP können POST /speak verwenden. Beschränke den Backend-Zugriff auf vertrauenswürdige Teilnehmer, da die API keine integrierte Authentifizierung besitzt.

Agent Engineering

## In diesem Cluster weiterlesen

Coding Agents, MCP, Kontextsysteme, Evaluation und Kontrollen für verlässliche Automatisierung.

[Mit dem Grundlagenartikel starten**Graph Engineering für KI-Agenten: Wann lohnt sich ein Knowledge Graph?**](/de/blog/graph-engineering-ai-agents/)

- [Valyus 0,6B-Router für Retrieval-Agenten: Ergebnisse, Grenzen und Einsatz](/de/blog/valyu-slm-multi-agent-router/)
- [OpenAI Agents API im Review: Migration, Kosten und Datenkontrollen](/de/blog/openai-agents-api-managed-harness-review/)
- [Spotify shunt: Einrichtung, Token-Ersparnis und Grenzen](/de/blog/spotify-shunt-claude-code-token-routing/)
- [OpenBot im Check: KI-Kollegen selbst hosten](/de/blog/openbot-self-hosted-ai-coworkers-review/)
- [Ramp Inspect Architektur 2026: Background Coding Agents skalieren](/de/blog/ramp-inspect-background-coding-agent-infrastructure-2026/)

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 min Lesezeit · 14. Sep. 2026 Zuletzt geprüft 14. September 2026

[**Weiter**](/de/blog/local-multimodal-ai-coding-assistant/)

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/voicebox-local-voice-cloning-mcp/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-09-14",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-09-14",
      "url": "https://wavect.io/de/blog/voicebox-local-voice-cloning-mcp/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Voicebox ist ein quelloffenes lokales Sprachstudio für Voice Cloning, Diktieren und Agentenstimmen. Es bietet sieben TTS-Engines und mehr als 50 voreingestellte Stimmen; 23 Sprachen unterstützt Chatterbox Multilingual, nicht jede Engine. Kompatible Agenten lassen sich über den lokalen MCP-Server oder POST /speak anbinden. Lokale Inferenz vermeidet Cloud-TTS-Gebühren, macht Hardware aber nicht kostenlos und einen Cloud-Agenten nicht lokal. Lade die Modelle zuerst herunter, verwende autorisierte Stimmen und schütze die API ohne integrierte Authentifizierung vor öffentlichem Zugriff. Dokumentationsprüfung: 14. September 2026.",
  "articleBody": " Blog-Übersicht/AI und Agents/Agent Engineering Voicebox: Lokales Voice Cloning, Diktieren und MCP-Setup TL;DR Voicebox ist ein quelloffenes lokales Sprachstudio für Voice Cloning, Diktieren und Agentenstimmen. Es bietet sieben TTS-Engines und mehr als 50 voreingestellte Stimmen; 23 Sprachen unterstützt Chatterbox Multilingual, nicht jede Engine. Kompatible Agenten lassen sich über den lokalen MCP-Server oder POST /speak anbinden. Lokale Inferenz vermeidet Cloud-TTS-Gebühren, macht Hardware aber nicht kostenlos und einen Cloud-Agenten nicht lokal. Lade die Modelle zuerst herunter, verwende autorisierte Stimmen und schütze die API ohne integrierte Authentifizierung vor öffentlichem Zugriff. Dokumentationsprüfung: 14. September 2026. Dein Coding-Agent schließt eine Aufgabe ab. Statt einer weiteren Benachrichtigung zum Lesen spricht er mit einer Stimme, die du ausgewählt hast. Du diktierst die nächste Anfrage, ohne das Fenster zu wechseln. Interessant ist dabei nicht das nächste Abo: Beide Seiten dieses Austauschs können auf Hardware laufen, die du kontrollierst. Voicebox ist ein quelloffenes, lokal ausgerichtetes Sprachstudio für Voice Cloning, Text-to-Speech, Diktieren und die Anbindung über einen MCP-Server. Das Projekt heißt jamiepine/voicebox. Sein offizielles Repository beschreibt eine Alternative zu Teilen von ElevenLabs und Wispr Flow in einer Anwendung. Voicebox gibt einem bestehenden Agenten eine Stimme; es ersetzt nicht dessen Sprachmodell für die eigentliche Verarbeitung der Anfrage. Am 14. September 2026 meldete die GitHub-Repository-API 53.242 Sterne. Das zeigt Aufmerksamkeit, ist aber kein Qualitätsbenchmark. Dieser Artikel basiert auf der Dokumentation, nicht auf einem eigenen Audiovergleich. Ist Voicebox eine Alternative zu ElevenLabs oder Wispr Flow? Ja, für bestimmte Aufgaben: lokale Sprachausgabe, Voice Cloning und Diktieren am Desktop. Das bedeutet keine vollständige Funktionsgleichheit. Die Text-to-Speech-Dokumentation von ElevenLabs beschreibt Spracherzeugung mit Stimmen aus einer Bibliothek sowie gestalteten und geklonten Stimmen. Die Produktübersicht von Wispr Flow konzentriert sich darauf, Gesprochenes in gut lesbaren Text für verschiedene Anwendungen zu verwandeln. Voicebox vereint sich überschneidende Aufgaben der Spracheingabe und -ausgabe in einer lokalen Anwendung. Das ist interessant für Entwickler, die Integrationen nachvollziehen wollen, für Kreative, die Sprechertexte regelmäßig neu erzeugen, und für Teams, die vertrauliche Desktop-Abläufe erproben. Es belegt nicht, dass jede Voicebox-Engine mit Aussprache, Reaktionszeit oder Support eines kommerziellen Dienstes mithält. Die bessere Auswahlfrage lautet: Kann Voicebox die Sprachaufgaben ersetzen, die du tatsächlich erledigst, und zwar auf deinen vorhandenen Geräten? Für ein betreutes geschäftliches Telefonsystem ist unser Fonio-AI-Plattformvergleich der passendere Einstieg. Ein Desktop-Studio ist keine Contact-Center-Plattform. Unabhängigkeit und Marken: Wavect veröffentlicht diese Seite und ist selbst Anbieter, wir haben also ein wirtschaftliches Interesse daran. Mit den hier genannten anderen Unternehmen sind wir weder verbunden noch von ihnen beauftragt oder empfohlen, und alle Firmennamen, Marken und Warenzeichen Dritter gehören ihren jeweiligen Inhabern. Aussagen über andere Anbieter stammen aus öffentlich zugänglichen Quellen, vor allem aus deren eigenen veröffentlichten Seiten, mit Stand des auf dieser Seite genannten Prüfdatums, und können sich seither geändert haben. Bitte prüfe sie vor einer Entscheidung selbst. Diese Seite wurde nach bestem Wissen und Gewissen erstellt, mit dem Ziel, möglichst objektiv zu bleiben. Wenn dir etwas falsch oder unfair erscheint, schreib uns und wir korrigieren es: office@wavect.io Wie funktioniert Voice Cloning mit Voicebox? Du erstellst aus einer Referenzaufnahme ein Stimmprofil und erzeugst damit neue Sprachausgabe. Auch wenn häufig von einem kurzen Clip die Rede ist: Die Anleitung zum Voice Cloning empfiehlt 10 bis 30 Sekunden klarer Sprache, keinen verrauschten Ausschnitt mit Musik oder mehreren Personen. Beginne mit deiner eigenen Aufnahme. Halte den Mikrofonabstand möglichst gleich, sprich natürlich und teste anschließend einen neuen Satz mit Namen, Zahlen und Satzzeichen. Beurteile Verständlichkeit und Stimmähnlichkeit getrennt. Eine wiedererkennbare Stimme kann einen Produktnamen trotzdem falsch aussprechen. Für einen ersten Versuch brauchst du keine Aufnahme. Die Dokumentation der voreingestellten Stimmen beschreibt mehr als 50 kuratierte Stimmen aus Kokoro und Qwen CustomVoice. Damit lässt sich die Integration testen, bevor du Zeit in einen eigenen Klon investierst. Was bedeuten sieben TTS-Engines und 23 Sprachen wirklich? Voicebox bündelt mehrere Engines in einem Studio; ihre Fähigkeiten sind nicht austauschbar. Die Engine-Übersicht des Projekts unterscheidet folgende Optionen: Engine Stimmtyp Dokumentierter Sprachumfang Qwen3-TTS Klonen 10 Sprachen Qwen CustomVoice",
  "articleSection": "Entwicklung",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "offizielles Repository",
      "url": "https://github.com/jamiepine/voicebox"
    },
    {
      "@type": "WebPage",
      "name": "GitHub-Repository-API",
      "url": "https://api.github.com/repos/jamiepine/voicebox"
    },
    {
      "@type": "WebPage",
      "name": "Text-to-Speech-Dokumentation von ElevenLabs",
      "url": "https://elevenlabs.io/docs/eleven-creative/playground/text-to-speech"
    },
    {
      "@type": "WebPage",
      "name": "Produktübersicht von Wispr Flow",
      "url": "https://wisprflow.ai/"
    },
    {
      "@type": "WebPage",
      "name": "Anleitung zum Voice Cloning",
      "url": "https://docs.voicebox.sh/overview/voice-cloning"
    },
    {
      "@type": "WebPage",
      "name": "Dokumentation der voreingestellten Stimmen",
      "url": "https://docs.voicebox.sh/overview/preset-voices"
    },
    {
      "@type": "WebPage",
      "name": "Engine-Übersicht des Projekts",
      "url": "https://github.com/jamiepine/voicebox/blob/main/README.md#multi-engine-voice-cloning"
    },
    {
      "@type": "WebPage",
      "name": "Diktier-Anleitung",
      "url": "https://docs.voicebox.sh/overview/dictation"
    },
    {
      "@type": "WebPage",
      "name": "technischer Transkriptionsanleitung",
      "url": "https://docs.voicebox.sh/developer/transcription"
    },
    {
      "@type": "WebPage",
      "name": "MCP-Server-Dokumentation",
      "url": "https://docs.voicebox.sh/overview/mcp-server"
    },
    {
      "@type": "WebPage",
      "name": "offizielle Release v0.5.0",
      "url": "https://github.com/jamiepine/voicebox/releases/tag/v0.5.0"
    },
    {
      "@type": "WebPage",
      "name": "Installationsanleitung",
      "url": "https://docs.voicebox.sh/overview/installation"
    },
    {
      "@type": "WebPage",
      "name": "MCP-Implementierungsbeschreibung zum geprüften Commit",
      "url": "https://github.com/jamiepine/voicebox/blob/51f49dea198384b4eb6087b72c17057c6eb1c1cd/backend/mcp_server/README.md"
    },
    {
      "@type": "WebPage",
      "name": "Persönlichkeitsfunktion",
      "url": "https://docs.voicebox.sh/overview/voice-personalities"
    },
    {
      "@type": "WebPage",
      "name": "REST-Beispiele im Repository",
      "url": "https://github.com/jamiepine/voicebox/blob/main/README.md#api"
    },
    {
      "@type": "WebPage",
      "name": "Captures-Dokumentation",
      "url": "https://docs.voicebox.sh/overview/captures"
    },
    {
      "@type": "WebPage",
      "name": "Anleitung zum Remote-Modus",
      "url": "https://docs.voicebox.sh/overview/remote-mode"
    },
    {
      "@type": "WebPage",
      "name": "Docker-Bereitstellung",
      "url": "https://docs.voicebox.sh/overview/docker"
    },
    {
      "@type": "WebPage",
      "name": "Stories-Editor",
      "url": "https://docs.voicebox.sh/overview/stories-editor"
    },
    {
      "@type": "WebPage",
      "name": "Anleitung zur Spracherzeugung",
      "url": "https://docs.voicebox.sh/overview/generating-speech"
    },
    {
      "@type": "WebPage",
      "name": "Dokumentation zur Langform-Generierung",
      "url": "https://github.com/jamiepine/voicebox/blob/main/README.md#unlimited-generation-length"
    },
    {
      "@type": "WebPage",
      "name": "Hinweise zur verantwortungsvollen Nutzung",
      "url": "https://github.com/jamiepine/voicebox/blob/main/RESPONSIBLE_USE.md"
    },
    {
      "@type": "WebPage",
      "name": "Voicebox-Lizenz",
      "url": "https://github.com/jamiepine/voicebox/blob/main/LICENSE"
    },
    {
      "@type": "WebPage",
      "name": "Kokoro-Modellkarte",
      "url": "https://huggingface.co/hexgrad/Kokoro-82M"
    }
  ],
  "dateModified": "2026-09-14",
  "datePublished": "2026-09-14",
  "description": "Voicebox ist ein quelloffenes lokales Sprachstudio für Voice Cloning, Diktieren und Agentenstimmen. Es bietet sieben TTS-Engines und mehr als 50 voreingestellte Stimmen; 23 Sprachen unterstützt Chatterbox Multilingual, nicht jede Engine. Kompatible Agenten lassen sich über den lokalen MCP-Server oder POST /speak anbinden. Lokale Inferenz vermeidet Cloud-TTS-Gebühren, macht Hardware aber nicht kostenlos und einen Cloud-Agenten nicht lokal. Lade die Modelle zuerst herunter, verwende autorisierte Stimmen und schütze die API ohne integrierte Authentifizierung vor öffentlichem Zugriff. Dokumentationsprüfung: 14. September 2026.",
  "headline": "Voicebox: Lokales Voice Cloning, Diktieren und MCP-Setup",
  "image": "https://wavect.io/img/blog/headers/header_voicebox-local-voice-cloning-mcp.svg",
  "inLanguage": "de",
  "keywords": "Voicebox, Lokale Sprach-KI, Voice Cloning, MCP-Integration",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/voicebox-local-voice-cloning-mcp/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/voicebox-local-voice-cloning-mcp/",
  "wordCount": 2488
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/agent-engineering/",
      "name": "Agent Engineering",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/voicebox-local-voice-cloning-mcp/",
      "name": "Voicebox: Lokales Voice Cloning & MCP-Setup",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Die MIT-lizenzierte Anwendung kann bestimmte lokale Aufgaben für Voice Cloning, Sprachausgabe und Diktieren ersetzen. Das bedeutet keine vollständige Funktionsgleichheit mit ElevenLabs oder Wispr Flow. Lokale Generierung vermeidet nutzungsabhängige Cloud-TTS-Gebühren; Hardware, Wartung, angebundene Agenten und Modelllizenzen bleiben gesondert zu berücksichtigen."
      },
      "name": "Ist Voicebox eine kostenlose Alternative zu ElevenLabs?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Die Anleitung empfiehlt 10 bis 30 Sekunden klare Referenzsprache. Verwende deine eigene Stimme oder Material, für das du eine entsprechende Erlaubnis hast. Prüfe Aussprache und Ähnlichkeit mit einem neuen Satz, statt den Klon nur anhand der Referenzaufnahme zu beurteilen."
      },
      "name": "Wie viel Audio braucht Voicebox zum Klonen einer Stimme?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nein. Die dokumentierten 23 Sprachen bietet Chatterbox Multilingual. Andere Engines haben andere Sprach- und Stimmgrenzen; manche stellen voreingestellte Stimmen statt Klonen bereit. Prüfe, ob die gewählte Engine und das Stimmprofil deine Zielsprache unterstützen."
      },
      "name": "Unterstützen alle sieben Voicebox-Engines 23 Sprachen?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nein. Voicebox kann Sprache nach dem Download der benötigten Modelle lokal verarbeiten. Ein angebundener Agent kann Text aber weiterhin an ein Cloud-Modell senden. Prüfe den gesamten Datenfluss, gespeicherte Aufnahmen und Werkzeugberechtigungen, bevor du den vollständigen Ablauf als offline oder privat bezeichnest."
      },
      "name": "Macht Voicebox Claude Code oder Cursor vollständig offline nutzbar?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Das Projekt dokumentiert Linux-Builds aus dem Quellcode und eine Docker-Bereitstellung. Das entspricht nicht der vollständigen Desktop-Erfahrung: Systemweites Diktieren unter Linux wird in der dokumentierten Implementierung von v0.5.0 nicht unterstützt. Für macOS und Windows gibt es Desktop-Installer und dokumentiertes globales Diktieren."
      },
      "name": "Funktioniert Voicebox unter Linux?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Starte Voicebox, erstelle oder wähle ein kompatibles Stimmprofil und ergänze den lokalen MCP-Server mit der Konfiguration aus Settings → MCP. Teste voicebox.list_profiles vor voicebox.speak. Anwendungen ohne MCP können POST /speak verwenden. Beschränke den Backend-Zugriff auf vertrauenswürdige Teilnehmer, da die API keine integrierte Authentifizierung besitzt."
      },
      "name": "Wie bekommt ein Agent über Voicebox MCP eine Stimme?"
    }
  ]
}
```
