Skip to main content
OpenClaw wandelt ausgehende Antworten über 14 Sprach-Provider in Audio um: native Sprachnachrichten auf Feishu, Matrix, Telegram und WhatsApp; Audioanhänge überall sonst; sowie PCM-/Ulaw-Streams für Telefonie und Talk. TTS ist die Sprachausgabehälfte des stt-tts-Modus von Talk (talk.speak verwendet denselben Synthesepfad). Provider-native realtime-Talk-Sitzungen synthetisieren Sprache stattdessen innerhalb des Echtzeit-Providers; transcription-Sitzungen synthetisieren niemals eine gesprochene Assistentenantwort.

Schnellstart

1

Provider auswählen

OpenAI und ElevenLabs sind die zuverlässigsten gehosteten Optionen. Microsoft und die lokale CLI funktionieren ohne API-Schlüssel. Die vollständige Liste finden Sie in der Provider-Matrix.
2

API-Schlüssel festlegen

Exportieren Sie die Umgebungsvariable für Ihren Provider (zum Beispiel OPENAI_API_KEY, ELEVENLABS_API_KEY). Microsoft und die lokale CLI benötigen keinen Schlüssel.
3

In der Konfiguration aktivieren

Legen Sie tts.auto: "always" und tts.provider fest:
4

Im Chat ausprobieren

/tts status zeigt den aktuellen Status an. /tts audio Hello from OpenClaw sendet eine einmalige Audioantwort.
Auto-TTS ist standardmäßig deaktiviert. Wenn tts.provider nicht festgelegt ist, wählt OpenClaw den ersten konfigurierten Provider gemäß der automatischen Auswahlreihenfolge der Registry. Das integrierte Agent-Tool tts reagiert nur auf ausdrückliche Absicht: Gewöhnlicher Chat bleibt Text, sofern der Benutzer nicht um Audio bittet, /tts verwendet oder Auto-TTS bzw. die Sprachausgabe per Direktive aktiviert.

Unterstützte Provider

Wenn mehrere Provider konfiguriert sind, wird zuerst der ausgewählte verwendet und die anderen dienen als Fallback-Optionen. Die automatische Zusammenfassung verwendet summaryModel (oder agents.defaults.model.primary); daher muss dieser Provider ebenfalls authentifiziert sein, wenn Zusammenfassungen aktiviert bleiben.
Der mitgelieferte Microsoft-Provider verwendet den neuronalen Online-TTS-Dienst von Microsoft Edge über node-edge-tts. Es handelt sich um einen öffentlichen Webdienst ohne veröffentlichte SLA oder Quote – behandeln Sie ihn als Dienst nach bestem Bemühen. Die veraltete Provider-ID edge wird zu microsoft normalisiert und openclaw doctor --fix schreibt gespeicherte Konfigurationen um; neue Konfigurationen sollten immer microsoft verwenden.

Konfiguration

Die TTS-Konfiguration befindet sich unter tts in ~/.openclaw/openclaw.json. Wählen Sie eine Voreinstellung aus und passen Sie den Provider-Block an. Die unten dargestellten Felder speakerVoice/speakerVoiceId sind kanonisch; die providerspezifischen Feldnamen voice/voiceId/voiceName funktionieren weiterhin als veraltete Aliasse.
Lassen Sie für Xiaomi mimo-v2.5-tts-voicedesign den Wert speakerVoice weg und legen Sie style auf die Vorgabe für den Stimmentwurf fest. OpenClaw sendet diese Vorgabe als TTS-Nachricht user und sendet für das Voicedesign-Modell kein audio.voice.

Agent-spezifische Stimmenüberschreibungen

Verwenden Sie agents.entries.*.tts, wenn ein Agent mit einem anderen Provider, einer anderen Stimme, einem anderen Modell, einer anderen Persona oder einem anderen Auto-TTS-Modus sprechen soll. Der Agent-Block wird rekursiv mit tts zusammengeführt, sodass die Provider-Anmeldedaten in der globalen Provider-Konfiguration verbleiben können:
Um eine Persona für einen einzelnen Agenten festzulegen, setzen Sie agents.entries.*.tts.persona zusammen mit der Provider- Konfiguration — dies überschreibt das globale tts.persona ausschließlich für diesen Agenten. Prioritätsreihenfolge für automatische Antworten, /tts audio, /tts status und das Agentenwerkzeug tts:
  1. tts
  2. aktives agents.entries.*.tts
  3. Kanalüberschreibung, wenn der Kanal channels.<channel>.tts unterstützt
  4. Kontoüberschreibung, wenn der Kanal channels.<channel>.accounts.<id>.tts übergibt
  5. lokale /tts-Einstellungen für diesen Host
  6. eingebettete [[tts:...]]-Direktiven, wenn modellgesteuerte Überschreibungen aktiviert sind
Kanal- und Kontoüberschreibungen verwenden dieselbe Struktur wie tts und werden rekursiv über die vorherigen Ebenen zusammengeführt. Dadurch können gemeinsam genutzte Provider-Anmeldedaten in tts verbleiben, während ein Kanal oder Bot-Konto nur Sprecherstimme, Modell, Persona oder Automatikmodus ändert:

Personas

Eine Persona ist eine stabile gesprochene Identität, die deterministisch Provider-übergreifend angewendet werden kann. Sie kann einen Provider bevorzugen, Provider-neutrale Prompt-Absichten definieren und Provider-spezifische Zuordnungen für Stimmen, Modelle, Prompt- Vorlagen, Seeds und Stimmeinstellungen enthalten.

Minimale Persona

Vollständige Persona (Provider-spezifische Ausgestaltung)

Persona-Auflösung

Die aktive Persona wird deterministisch ausgewählt:
  1. lokale /tts persona <id>-Einstellung, sofern festgelegt.
  2. tts.persona, sofern festgelegt.
  3. Keine Persona.
Die Provider-Auswahl erfolgt mit Vorrang für explizite Angaben:
  1. Direkte Überschreibungen (CLI, Gateway, Talk, zulässige TTS-Direktiven).
  2. Lokale /tts provider <id>-Einstellung.
  3. provider der aktiven Persona.
  4. tts.provider.
  5. Automatische Auswahl aus der Registry.
Für jeden Provider-Versuch führt OpenClaw Konfigurationen in dieser Reihenfolge zusammen:
  1. tts.providers.<id>
  2. tts.personas.<persona>.providers.<id>
  3. Vertrauenswürdige Anforderungsüberschreibungen
  4. Zulässige, vom Modell ausgegebene Überschreibungen durch TTS-Direktiven

Benutzerdefinierte Persona-Ausgestaltung

Die Provider-neutrale personas.<id>.prompt.*-Konfiguration wird nicht mehr verwendet. Doctor entfernt diese Felder und verweist auf die Schnittstelle des Sprach-Providers. Legen Sie integrierte Provider- Einstellungen unter personas.<id>.providers.<provider> ab (beispielsweise Google- personaPrompt oder OpenAI-instructions). Implementieren Sie für eine benutzerdefinierte Ausgestaltung ein Sprach-Provider-Plugin mit prepareSynthesis(ctx) und geben Sie angepassten Text, eine Provider-Konfiguration oder Überschreibungen zurück, bevor synthesize() ausgeführt wird. Dadurch verbleibt die ausdrucksstarke Prompt-Erstellung im Provider-Code, in dem die Semantik der Anforderungen bekannt ist.

Fallback-Richtlinie

fallbackPolicy steuert das Verhalten, wenn eine Persona keine Zuordnung für den versuchten Provider besitzt: Die gesamte TTS-Anforderung schlägt nur fehl, wenn jeder versuchte Provider übersprungen wird oder fehlschlägt. Die Provider-Auswahl einer Talk-Sitzung gilt nur für diese Sitzung. Ein Talk-Client sollte Provider-IDs, Modell-IDs, Stimmen-IDs und Gebietsschemas aus talk.catalog auswählen und sie über die Talk-Sitzungs- oder Übergabeanforderung übergeben. Das Öffnen einer Sprachsitzung sollte weder tts noch die globalen Standardwerte des Talk-Providers verändern.

Modellgesteuerte Direktiven

Standardmäßig kann der Assistent [[tts:...]]-Direktiven ausgeben, um Stimme, Modell oder Geschwindigkeit für eine einzelne Antwort zu überschreiben, sowie optional einen [[tts:text]]...[[/tts:text]]-Block für ausdrucksbezogene Hinweise, die ausschließlich im Audio erscheinen sollen:
Wenn tts.auto den Wert "tagged" hat, sind Direktiven erforderlich, um Audio auszulösen. Bei der blockweisen Streaming-Auslieferung werden Direktiven aus dem sichtbaren Text entfernt, bevor der Kanal ihn empfängt, selbst wenn sie auf benachbarte Blöcke verteilt sind. provider=... wird ignoriert, sofern nicht modelOverrides.allowProvider: true. Wenn eine Antwort provider=... deklariert, werden die anderen Schlüssel in dieser Direktive ausschließlich von diesem Provider ausgewertet; nicht unterstützte Schlüssel werden entfernt und als Warnungen zu TTS- Direktiven gemeldet. Verfügbare Direktiven-Schlüssel:
  • provider (registrierte Provider-ID; erfordert allowProvider: true)
  • speakerVoice / speakerVoiceId (veraltete Aliase: voice, voiceName, voice_name, google_voice, voiceId)
  • model / google_model
  • stability, similarityBoost, style, speed, useSpeakerBoost
  • vol / volume (MiniMax-Lautstärke, (0, 10])
  • pitch (ganzzahlige MiniMax-Tonhöhe, −12 bis 12; Nachkommastellen werden abgeschnitten)
  • emotion (Volcengine-Emotions-Tag)
  • applyTextNormalization (auto|on|off)
  • languageCode (ISO 639-1)
  • seed
Modellüberschreibungen vollständig deaktivieren:
Provider-Wechsel zulassen, während andere Einstellungen konfigurierbar bleiben:

Slash-Befehle

Einzelner Befehl /tts. Auf Discord registriert OpenClaw außerdem /voice, da /tts ein integrierter Discord-Befehl ist — der Textbefehl /tts ... funktioniert weiterhin.
Befehle erfordern einen autorisierten Absender (Zulassungslisten-/Eigentümerregeln gelten), und entweder commands.text oder die Registrierung nativer Befehle muss aktiviert sein.
Hinweise zum Verhalten:
  • /tts on schreibt die lokale TTS-Einstellung nach always; /tts off schreibt sie nach off.
  • /tts chat on|off|default schreibt für den aktuellen Chat eine sitzungsbezogene Auto-TTS-Überschreibung.
  • /tts persona <id> schreibt die lokale Persona-Einstellung; /tts persona off löscht sie.
  • /tts latest liest die neueste Assistentenantwort aus dem Transkript der aktuellen Sitzung und sendet sie einmalig als Audio. Im Sitzungseintrag wird nur ein Hash dieser Antwort gespeichert, um doppelte Sprachausgaben zu unterdrücken.
  • /tts audio erzeugt eine einmalige Audioantwort (aktiviert TTS nicht dauerhaft).
  • /tts limit <chars> akzeptiert 100–4096 (4096 ist das Telegram-Maximum für Bildunterschriften/Nachrichten); Werte außerhalb dieses Bereichs werden abgelehnt.
  • limit und summary werden in lokalen Einstellungen und nicht in der Hauptkonfiguration gespeichert.
  • /tts status enthält Fallback-Diagnosen für den letzten Versuch — Fallback: <primary> -> <used>, Attempts: ... und Details pro Versuch (provider:outcome(reasonCode) latency).
  • /status zeigt bei aktiviertem TTS den aktiven TTS-Modus sowie den konfigurierten Provider, das Modell, die Stimme und bereinigte Metadaten des benutzerdefinierten Endpunkts an.

Benutzerspezifische Einstellungen

Slash-Befehle schreiben lokale Überschreibungen in den Pfad für TTS-Einstellungen. Der Standardwert lautet ~/.openclaw/settings/tts.json; überschreiben Sie ihn mit OPENCLAW_TTS_PREFS. Doctor verschiebt den nicht mehr verwendeten globalen Wert tts.prefsPath in den gemeinsamen Maschinenstatus. Fortgeschrittene Multi-Agent-Konfigurationen können weiterhin agents.entries.<id>.tts.prefsPath festlegen, wenn Agenten absichtlich getrennte Einstellungsspeicher verwenden. Diese überschreiben die wirksame Konfiguration aus tts sowie den aktiven agents.entries.*.tts-Block für diesen Host.

Ausgabeformate

Die TTS-Sprachausgabe richtet sich nach den Fähigkeiten des Kanals. Kanal-Plugins geben an, ob TTS im Sprachstil von Providern ein natives voice-note-Zielformat anfordern oder die normale audio-file-Synthese beibehalten soll und ob der Kanal nicht native Ausgaben vor dem Senden transkodiert. Hinweise pro Provider:
  • Feishu-/WhatsApp-Transkodierung: Wenn eine Sprachnachrichten-Antwort als MP3/WebM/WAV/M4A oder andere wahrscheinliche Audiodatei vorliegt, transkodiert das Kanal-Plugin sie vor dem Senden der nativen Sprachnachricht mit ffmpeg (libopus, 64 kbps) in Ogg/Opus mit 48 kHz. WhatsApp sendet das Ergebnis über die Baileys-audio-Nutzlast mit ptt: true und audio/ogg; codecs=opus. Bei einem Transkodierungsfehler: Feishu fängt den Fehler ab und sendet ersatzweise die Originaldatei als normalen Anhang; WhatsApp bietet keinen Fallback, sodass der Sendevorgang selbst fehlschlägt, statt eine inkompatible PTT-Nutzlast zu veröffentlichen.
  • MiniMax: MP3 (speech-2.8-hd-Modell, Abtastrate 32 kHz) für normale Audioanhänge; für vom Kanal als Sprachnachrichten-Ziele ausgewiesene Ziele wird mit ffmpeg in Opus mit 48 kHz transkodiert.
  • Xiaomi MiMo: Standardmäßig MP3 oder bei entsprechender Konfiguration WAV; für vom Kanal als Sprachnachrichten-Ziele ausgewiesene Ziele wird mit ffmpeg in Opus mit 48 kHz transkodiert.
  • Lokale CLI: Verwendet das konfigurierte outputFormat. Sprachnachrichten-Ziele werden in Ogg/Opus und Telefonieausgaben mit ffmpeg in rohes Mono-PCM mit 16 kHz konvertiert.
  • Google Gemini: Gibt rohes PCM mit 24 kHz zurück. OpenClaw verpackt es für Audioanhänge als WAV, transkodiert es für Sprachnachrichten-Ziele in Opus mit 48 kHz und gibt PCM für Talk/Telefonie direkt zurück.
  • Gradium: WAV für Audioanhänge, Opus für Sprachnachrichten-Ziele und ulaw_8000 mit 8 kHz für Telefonie.
  • Inworld: MP3 für normale Audioanhänge, natives OGG_OPUS für Sprachnachrichten-Ziele und rohes PCM mit 22050 Hz für Talk/Telefonie.
  • xAI: Standardmäßig MP3; die Audiodateisynthese kann mp3, wav, pcm, mulaw oder alaw sowohl für gepufferte als auch für Streaming-Ausgaben verwenden. Sprachnachrichten-Ziele verwenden MP3 für Streaming und den gepufferten Fallback, da die Ausgaben pcm, mulaw und alaw von xAI headerlose Rohaudiodaten sind. Die gepufferte Synthese verwendet den Batch-REST-Endpunkt /v1/tts von xAI; textToSpeechStream verwendet natives wss://api.x.ai/v1/tts. Dies ist nicht der Echtzeit-Sprachvertrag. Das native Opus-Sprachnachrichtenformat wird nicht unterstützt.
  • Microsoft: Verwendet microsoft.outputFormat (Standardwert audio-24khz-48kbitrate-mono-mp3).
    • Der gebündelte Transport akzeptiert ein outputFormat, aber nicht alle Formate sind über den Dienst verfügbar.
    • Ausgabeformatwerte entsprechen den Microsoft-Speech-Ausgabeformaten (einschließlich Ogg/WebM Opus).
    • Telegram sendVoice akzeptiert OGG/MP3/M4A; verwenden Sie OpenAI/ElevenLabs, wenn Sie garantierte Opus-Sprachnachrichten benötigen.
    • Wenn das konfigurierte Microsoft-Ausgabeformat fehlschlägt, versucht OpenClaw es erneut mit MP3.
    • Wenn keine explizite Stimmenüberschreibung festgelegt ist und die englische Standardstimme verwendet wird, wechselt OpenClaw automatisch zu einer chinesischen neuronalen Stimme (zh-CN-XiaoxiaoNeural, Gebietsschema zh-CN), falls der Antworttext überwiegend aus CJK-Zeichen besteht.
Die Ausgabeformate von OpenAI und ElevenLabs sind wie oben aufgeführt je Kanal festgelegt.

Verhalten von Auto-TTS

Wenn tts.auto aktiviert ist, führt OpenClaw Folgendes aus:
  • Überspringt TTS, wenn die Antwort bereits strukturierte Medien enthält.
  • Überspringt sehr kurze Antworten (unter 10 Zeichen).
  • Fasst lange Antworten zusammen, wenn Zusammenfassungen aktiviert sind, und verwendet dabei summaryModel (oder agents.defaults.model.primary).
  • Fügt das erzeugte Audio der Antwort hinzu.
  • Sendet in mode: "final" nach Abschluss des Textstreams weiterhin reine TTS-Audioausgaben für gestreamte endgültige Antworten; die erzeugten Medien durchlaufen dieselbe Kanalmedien-Normalisierung wie normale Antwortanhänge.
Wenn die Antwort maxLength überschreitet, überspringt OpenClaw die Audioausgabe niemals vollständig:
  • Zusammenfassung aktiviert (Standard) und ein Zusammenfassungsmodell ist verfügbar: Fasst den Text auf ungefähr maxLength Zeichen zusammen und synthetisiert anschließend die Zusammenfassung.
  • Zusammenfassung deaktiviert, die Zusammenfassung schlägt fehl oder für das Zusammenfassungsmodell ist kein API-Schlüssel verfügbar: Kürzt den Text auf maxLength Zeichen und synthetisiert den gekürzten Text.

Feldreferenz

"off" | "always" | "inbound" | "tagged"
Auto-TTS-Modus. inbound sendet Audio nur nach einer eingehenden Sprachnachricht; tagged sendet Audio nur, wenn die Antwort [[tts:...]]-Direktiven oder einen [[tts:text]]-Block enthält.
boolean
veraltet
Veralteter Umschalter. openclaw doctor --fix migriert diesen zu auto.
"final" | "all"
Standard:"final"
"all" schließt zusätzlich zu endgültigen Antworten auch Werkzeug-/Blockantworten ein.
string
ID des Sprach-Providers. Wenn nicht festgelegt, verwendet OpenClaw den ersten konfigurierten Provider gemäß der automatischen Auswahlreihenfolge der Registry. Das veraltete provider: "edge" wird von openclaw doctor --fix in "microsoft" umgeschrieben.
string
ID der aktiven Persona aus personas. Wird in Kleinbuchstaben normalisiert.
object
Stabile gesprochene Identität. Felder: label, description, provider, fallbackPolicy, prompt, providers.<provider>. Siehe Personas.
string
Kostengünstiges Modell für automatische Zusammenfassungen; standardmäßig agents.defaults.model.primary. Akzeptiert provider/model oder einen konfigurierten Modellalias.
object
Erlaubt dem Modell, TTS-Direktiven auszugeben. enabled ist standardmäßig true; allowProvider ist standardmäßig false.
object
Provider-eigene Einstellungen, nach der ID des Sprach-Providers verschlüsselt. Veraltete direkte Blöcke (tts.openai, .elevenlabs, .microsoft, .edge) werden von openclaw doctor --fix umgeschrieben; schreiben Sie ausschließlich tts.providers.<id> fest.
number
Standard:"4096"
Harte Obergrenze für TTS-Eingabezeichen. /tts audio, tts.convert und tts.speak schlagen bei einer Überschreitung fehl.
number
Standard:"30000"
Anfragezeitlimit in Millisekunden. Ein timeoutMs pro Aufruf (Agentenwerkzeug, Gateway) hat Vorrang, wenn es festgelegt ist; andernfalls hat ein explizit konfiguriertes tts.timeoutMs Vorrang vor jedem vom Plugin definierten Provider-Standardwert.
Die apiKey-Felder des Providers können Rohzeichenfolgen oder SecretRefs sein. Beim Kaltstart des Gateways bewirkt eine nicht verfügbare TTS-SecretRef, dass die integrierte TTS-Funktion als konfiguriert, aber nicht verfügbar markiert wird, statt das Gateway anzuhalten. tts.speak gibt dann UNAVAILABLE mit dem Grund SECRET_SURFACE_UNAVAILABLE zurück, und es wird keine Provider-Anfrage gesendet. Status und Doctor führen den beeinträchtigten TTS-Eigentümer und seine Konfigurationspfade auf. Die expliziten Referenzen verbleiben im Laufzeit-Snapshot, sodass Umgebungs- oder Profil- Anmeldedaten nicht stillschweigend ein anderes Konto auswählen können. Neuladungen und die Vorabprüfung beim Schreiben der Konfiguration wenden die eigentümerbezogene Beeinträchtigungsrichtlinie an: Ein unveränderter berechtigter TTS- Eigentümer darf seine zuletzt als funktionsfähig bekannten Anmeldedaten als veraltet beibehalten, während ein neuer oder geänderter Fehler kalt wird, ohne funktionierende Eigentümer zu blockieren. Strukturell ungültige Referenzen und aufgelöste Werte lassen den Start weiterhin fehlschlagen beziehungsweise führen weiterhin zur Ablehnung der Aktualisierung.
string
Umgebung: AZURE_SPEECH_KEY, AZURE_SPEECH_API_KEY oder SPEECH_KEY.
string
Azure-Speech-Region (z. B. eastus). Umgebung: AZURE_SPEECH_REGION oder SPEECH_REGION.
string
Optionale Überschreibung des Azure-Speech-Endpunkts (Alias baseUrl).
string
ShortName der Azure-Stimme. Standardwert en-US-JennyNeural. Veralteter Alias: voice.
string
SSML-Sprachcode. Standardwert en-US.
string
Azure-X-Microsoft-OutputFormat für Standardaudio. Standardwert audio-24khz-48kbitrate-mono-mp3.
string
Azure-X-Microsoft-OutputFormat für Sprachnachrichtenausgaben. Standardwert ogg-24khz-16bit-mono-opus.
string
Greift ersatzweise auf ELEVENLABS_API_KEY oder XI_API_KEY zurück.
string
Modell-ID. Standardwert eleven_multilingual_v2. Veraltete IDs eleven_turbo_v2_5/eleven_turbo_v2 werden zum entsprechenden flash-Modell normalisiert.
string
ElevenLabs-Stimmen-ID. Standardwert pMsXgVXv3BLzUgSXRplE. Veralteter Alias: voiceId.
object
stability, similarityBoost, style (jeweils 0..1, Standardwerte 0.5/0.75/0), useSpeakerBoost (true|false, Standardwert true), speed (0.5..2.0, Standardwert 1.0).
"auto" | "on" | "off"
Textnormalisierungsmodus.
string
Zweistelliger ISO-639-1-Code (z. B. en, de).
number
Ganzzahliges 0..4294967295 für bestmöglichen Determinismus.
string
Überschreibt die Basis-URL der ElevenLabs-API.
string
Fällt auf GEMINI_API_KEY / GOOGLE_API_KEY zurück. Falls nicht angegeben, kann TTS vor dem Rückgriff auf die Umgebungsvariable models.providers.google.apiKey wiederverwenden.
string
Gemini-TTS-Modell. Standardwert: gemini-3.1-flash-tts-preview.
string
Name der vordefinierten Gemini-Stimme. Standardwert: Kore. Veraltete Aliasse: voiceName, voice.
string
Natürlichsprachliche Stilanweisung, die dem gesprochenen Text vorangestellt wird.
string
Optionale Sprecherbezeichnung, die dem gesprochenen Text vorangestellt wird, wenn Ihre Anweisung einen benannten Sprecher verwendet.
"audio-profile-v1"
Auf audio-profile-v1 setzen, um aktive Persona-Anweisungsfelder in eine deterministische Gemini-TTS-Anweisungsstruktur einzubetten.
string
Zusätzlicher Google-spezifischer Persona-Anweisungstext, der an die Regiehinweise der Vorlage angehängt wird.
string
Nur https://generativelanguage.googleapis.com wird akzeptiert.
string
Umgebungsvariable: GRADIUM_API_KEY.
string
HTTPS-URL der Gradium-API unter api.gradium.ai. Standardwert: https://api.gradium.ai.
string
Standardwert: Emma (YTpq7expH9539ERJ). Veralteter Alias: voiceId.

Primäres Inworld

string
Umgebungsvariable: INWORLD_API_KEY.
string
Standardwert: https://api.inworld.ai.
string
Standardwert: inworld-tts-1.5-max. Außerdem: inworld-tts-1.5-mini, inworld-tts-1-max, inworld-tts-1.
string
Standardwert: Sarah. Veralteter Alias: voiceId.
number
Sampling-Temperatur 0..2 (0 ausgeschlossen).
string
Lokale ausführbare Datei oder Befehlszeichenfolge für CLI-TTS.
string[]
Befehlsargumente. Unterstützt die Platzhalter {{Text}}, {{OutputPath}}, {{OutputDir}}, {{OutputBase}}.
"mp3" | "opus" | "wav"
Erwartetes CLI-Ausgabeformat. Standardwert für Audioanhänge: mp3.
number
Zeitüberschreitung des Befehls in Millisekunden. Standardwert: 120000.
string
Optionales Arbeitsverzeichnis des Befehls.
Record<string, string>
Optionale Überschreibungen der Umgebungsvariablen für den Befehl.
Die Standardausgabe des Befehls sowie erzeugte oder konvertierte Audiodaten sind auf 50 MiB begrenzt. Die diagnostische Standardfehlerausgabe ist auf 1 MiB begrenzt. OpenClaw beendet den Befehl und lässt die Synthese fehlschlagen, wenn eines der Limits überschritten wird.
boolean
Standard:"true"
Die Verwendung der Microsoft-Sprachausgabe zulassen.
string
Name der neuronalen Microsoft-Stimme (z. B. en-US-MichelleNeural). Veralteter Alias: voice. Wenn die englische Standardstimme aktiv ist und der Antworttext überwiegend aus CJK-Zeichen besteht, wechselt OpenClaw automatisch zu zh-CN-XiaoxiaoNeural.
string
Sprachcode (z. B. en-US).
string
Microsoft-Ausgabeformat. Standardwert: audio-24khz-48kbitrate-mono-mp3. Der enthaltene Edge-basierte Transport unterstützt nicht alle Formate.
string
Prozentzeichenfolgen (z. B. +10%, -5%).
boolean
JSON-Untertitel neben die Audiodatei schreiben.
string
Proxy-URL für Microsoft-Sprachanfragen.
number
Überschreibung der Anfragezeitüberschreitung (ms).
object
veraltet
Veralteter Alias. Führen Sie openclaw doctor --fix aus, um die persistierte Konfiguration in providers.microsoft umzuschreiben.
string
Fällt auf MINIMAX_API_KEY zurück. Token-Plan-Authentifizierung über MINIMAX_OAUTH_TOKEN, MINIMAX_CODE_PLAN_KEY oder MINIMAX_CODING_API_KEY.
string
Standardwert: https://api.minimax.io. Umgebungsvariable: MINIMAX_API_HOST.
string
Standardwert: speech-2.8-hd. Umgebungsvariable: MINIMAX_TTS_MODEL.
string
Standardwert: English_expressive_narrator. Umgebungsvariable: MINIMAX_TTS_VOICE_ID. Veralteter Alias: voiceId.
number
0.5..2.0. Standardwert: 1.0.
number
(0, 10]. Standardwert: 1.0.
number
Ganzzahl -12..12. Standardwert: 0. Nachkommastellen werden vor der Anfrage abgeschnitten.
string
Fällt auf OPENAI_API_KEY zurück.
string
OpenAI-TTS-Modell-ID. Standardwert: gpt-4o-mini-tts.
string
Stimmenname (z. B. alloy, cedar). Standardwert: coral. Veralteter Alias: voice.
string
Explizites OpenAI-Feld instructions. Wenn es festgelegt ist, werden Persona-Anweisungsfelder nicht automatisch zugeordnet.
Record<string, unknown>
Zusätzliche JSON-Felder, die nach den generierten OpenAI-TTS-Feldern in die Anfragetexte von /audio/speech eingefügt werden. Verwenden Sie dies für OpenAI-kompatible Endpunkte wie Kokoro, die Provider-spezifische Schlüssel wie lang benötigen; unsichere Prototypschlüssel werden ignoriert.
string
Den OpenAI-TTS-Endpunkt überschreiben. Auflösungsreihenfolge: Konfiguration → OPENAI_TTS_BASE_URLhttps://api.openai.com/v1. Nicht standardmäßige Werte werden als OpenAI-kompatible TTS-Endpunkte behandelt. Daher werden benutzerdefinierte Modell- und Stimmennamen akzeptiert, und für speed entfällt die Bereichsprüfung 0.25..4.0.
string
Umgebungsvariable: OPENROUTER_API_KEY. Kann models.providers.openrouter.apiKey wiederverwenden.
string
Standardwert: https://openrouter.ai/api/v1. Das veraltete https://openrouter.ai/v1 wird normalisiert.
string
Standardwert: hexgrad/kokoro-82m. Alias: modelId.
string
Standardwert: af_alloy. Veraltete Aliasse: voice, voiceId.
"mp3" | "pcm"
Standardwert: mp3.
number
Provider-native Überschreibung der Geschwindigkeit.
string
Umgebungsvariable: VOLCENGINE_TTS_API_KEY oder BYTEPLUS_SEED_SPEECH_API_KEY.
string
Standardwert: seed-tts-1.0. Umgebungsvariable: VOLCENGINE_TTS_RESOURCE_ID. Verwenden Sie seed-tts-2.0, wenn Ihr Projekt zur Nutzung von TTS 2.0 berechtigt ist.
string
App-Schlüssel-Header. Standardwert: aGjiRDfUWi. Umgebungsvariable: VOLCENGINE_TTS_APP_KEY.
string
Den HTTP-Endpunkt für Seed-Speech-TTS überschreiben. Umgebungsvariable: VOLCENGINE_TTS_BASE_URL.
string
Stimmtyp. Standardwert: en_female_anna_mars_bigtts. Umgebungsvariable: VOLCENGINE_TTS_VOICE. Veralteter Alias: voice.
number
Provider-natives Geschwindigkeitsverhältnis, 0.2..3.
string
Provider-natives Emotions-Tag.
string
veraltet
Veraltete Felder der Volcengine Speech Console. Umgebungsvariablen: VOLCENGINE_TTS_APPID, VOLCENGINE_TTS_TOKEN, VOLCENGINE_TTS_CLUSTER (Standardwert: volcano_tts).
string
Umgebungsvariable: XAI_API_KEY.
string
Standardwert: https://api.x.ai/v1. Umgebungsvariable: XAI_BASE_URL.
string
Standardwert: eve. Mit Authentifizierung ruft openclaw infer tts voices --provider xai den aktuellen integrierten Katalog ab; ohne Authentifizierung werden die Offline-Ersatzwerte ara, eve, leo, rex und sal aufgeführt. Benutzerdefinierte Stimmen-IDs des Kontos werden auch dann weitergeleitet, wenn sie nicht in der integrierten Liste enthalten sind. Veralteter Alias: voiceId.
string
BCP-47-Sprachcode oder auto. Standardwert: en.
"mp3" | "wav" | "pcm" | "mulaw" | "alaw"
Standardwert: mp3.
number
Provider-native Überschreibung der Geschwindigkeit, 0.7..1.5.
string
Umgebungsvariable: XIAOMI_API_KEY.
string
Standardwert: https://api.xiaomimimo.com/v1. Umgebungsvariable: XIAOMI_BASE_URL.
string
Standardwert: mimo-v2.5-tts. Umgebungsvariable: XIAOMI_TTS_MODEL. Unterstützt außerdem mimo-v2.5-tts-voicedesign.
string
Standardwert für Modelle mit voreingestellten Stimmen: mimo_default. Umgebungsvariable: XIAOMI_TTS_VOICE. Veralteter Alias: voice. Wird für mimo-v2.5-tts-voicedesign nicht gesendet.
"mp3" | "wav"
Standardwert: mp3. Umgebungsvariable: XIAOMI_TTS_FORMAT.
string
Optionale natürlichsprachliche Stilanweisung, die als Benutzernachricht gesendet und nicht gesprochen wird. Für mimo-v2.5-tts-voicedesign ist dies die Anweisung zur Stimmgestaltung; OpenClaw stellt einen Standardwert bereit, wenn sie nicht angegeben ist.

Agentenwerkzeug

Das Werkzeug tts wandelt Text in Sprache um und gibt einen Audioanhang für die Zustellung der Antwort zurück. Bei Feishu, Matrix, Telegram und WhatsApp wird das Audio als Sprachnachricht statt als Dateianhang zugestellt. Feishu und WhatsApp können auf diesem Pfad TTS-Ausgaben, die nicht im Opus-Format vorliegen, transkodieren, wenn ffmpeg verfügbar ist. WhatsApp sendet Audiodaten über Baileys als PTT-Sprachnachricht (audio mit ptt: true) und sendet sichtbaren Text getrennt vom PTT-Audio, da Clients Untertitel bei Sprachnachrichten nicht einheitlich darstellen. Das Werkzeug akzeptiert die optionalen Felder channel und timeoutMs; timeoutMs ist eine Provider-Anfragezeitüberschreitung pro Aufruf in Millisekunden. Werte pro Aufruf überschreiben tts.timeoutMs; konfigurierte TTS-Zeitüberschreitungen überschreiben alle vom Plugin definierten Provider-Standardwerte.

Gateway-RPC

Verwandte Themen