stt-tts-Modus von Talk (talk.speak verwendet
denselben Synthesepfad). Provider-native realtime-Talk-Sitzungen synthetisieren
Sprache stattdessen innerhalb des Echtzeit-Providers; transcription-Sitzungen
synthetisieren niemals eine gesprochene Assistentenantwort.
Schnellstart
1
Provider auswählen
OpenAI und ElevenLabs sind die zuverlässigsten gehosteten Optionen. Microsoft und
die lokale CLI funktionieren ohne API-Schlüssel. Die vollständige Liste finden Sie in der Provider-Matrix.
2
API-Schlüssel festlegen
Exportieren Sie die Umgebungsvariable für Ihren Provider (zum Beispiel
OPENAI_API_KEY,
ELEVENLABS_API_KEY). Microsoft und die lokale CLI benötigen keinen Schlüssel.3
In der Konfiguration aktivieren
Legen Sie
tts.auto: "always" und tts.provider fest:4
Im Chat ausprobieren
/tts status zeigt den aktuellen Status an. /tts audio Hello from OpenClaw
sendet eine einmalige Audioantwort.Auto-TTS ist standardmäßig deaktiviert. Wenn
tts.provider nicht festgelegt ist,
wählt OpenClaw den ersten konfigurierten Provider gemäß der automatischen Auswahlreihenfolge der Registry.
Das integrierte Agent-Tool tts reagiert nur auf ausdrückliche Absicht: Gewöhnlicher Chat bleibt
Text, sofern der Benutzer nicht um Audio bittet, /tts verwendet oder Auto-TTS bzw. die
Sprachausgabe per Direktive aktiviert.Unterstützte Provider
Wenn mehrere Provider konfiguriert sind, wird zuerst der ausgewählte verwendet und die
anderen dienen als Fallback-Optionen. Die automatische Zusammenfassung verwendet
summaryModel (oder
agents.defaults.model.primary); daher muss dieser Provider ebenfalls authentifiziert sein,
wenn Zusammenfassungen aktiviert bleiben.
Konfiguration
Die TTS-Konfiguration befindet sich untertts in ~/.openclaw/openclaw.json. Wählen Sie eine
Voreinstellung aus und passen Sie den Provider-Block an. Die unten dargestellten Felder
speakerVoice/speakerVoiceId sind kanonisch; die providerspezifischen Feldnamen
voice/voiceId/voiceName funktionieren weiterhin als veraltete Aliasse.
- Azure Speech
- ElevenLabs
- Google Gemini
- Gradium
- Inworld
- Lokale CLI
- Microsoft (kein Schlüssel)
- MiniMax
- OpenAI + ElevenLabs
- OpenRouter
- Volcengine
- xAI
- Xiaomi MiMo
mimo-v2.5-tts-voicedesign den Wert speakerVoice weg und legen Sie style auf
die Vorgabe für den Stimmentwurf fest. OpenClaw sendet diese Vorgabe als TTS-Nachricht user
und sendet für das Voicedesign-Modell kein audio.voice.
Agent-spezifische Stimmenüberschreibungen
Verwenden Sieagents.entries.*.tts, wenn ein Agent mit einem anderen Provider,
einer anderen Stimme, einem anderen Modell, einer anderen Persona oder einem anderen Auto-TTS-Modus sprechen soll. Der Agent-Block wird rekursiv mit
tts zusammengeführt, sodass die Provider-Anmeldedaten in der globalen Provider-Konfiguration verbleiben können:
agents.entries.*.tts.persona zusammen mit der Provider-
Konfiguration — dies überschreibt das globale tts.persona ausschließlich für diesen Agenten.
Prioritätsreihenfolge für automatische Antworten, /tts audio, /tts status und das
Agentenwerkzeug tts:
tts- aktives
agents.entries.*.tts - Kanalüberschreibung, wenn der Kanal
channels.<channel>.ttsunterstützt - Kontoüberschreibung, wenn der Kanal
channels.<channel>.accounts.<id>.ttsübergibt - lokale
/tts-Einstellungen für diesen Host - eingebettete
[[tts:...]]-Direktiven, wenn modellgesteuerte Überschreibungen aktiviert sind
tts und
werden rekursiv über die vorherigen Ebenen zusammengeführt. Dadurch können gemeinsam genutzte Provider-Anmeldedaten in
tts verbleiben, während ein Kanal oder Bot-Konto nur Sprecherstimme, Modell, Persona
oder Automatikmodus ändert:
Personas
Eine Persona ist eine stabile gesprochene Identität, die deterministisch Provider-übergreifend angewendet werden kann. Sie kann einen Provider bevorzugen, Provider-neutrale Prompt-Absichten definieren und Provider-spezifische Zuordnungen für Stimmen, Modelle, Prompt- Vorlagen, Seeds und Stimmeinstellungen enthalten.Minimale Persona
Vollständige Persona (Provider-spezifische Ausgestaltung)
Persona-Auflösung
Die aktive Persona wird deterministisch ausgewählt:- lokale
/tts persona <id>-Einstellung, sofern festgelegt. tts.persona, sofern festgelegt.- Keine Persona.
- Direkte Überschreibungen (CLI, Gateway, Talk, zulässige TTS-Direktiven).
- Lokale
/tts provider <id>-Einstellung. providerder aktiven Persona.tts.provider.- Automatische Auswahl aus der Registry.
tts.providers.<id>tts.personas.<persona>.providers.<id>- Vertrauenswürdige Anforderungsüberschreibungen
- Zulässige, vom Modell ausgegebene Überschreibungen durch TTS-Direktiven
Benutzerdefinierte Persona-Ausgestaltung
Die Provider-neutralepersonas.<id>.prompt.*-Konfiguration wird nicht mehr verwendet. Doctor entfernt
diese Felder und verweist auf die Schnittstelle des Sprach-Providers. Legen Sie integrierte Provider-
Einstellungen unter personas.<id>.providers.<provider> ab (beispielsweise Google-
personaPrompt oder OpenAI-instructions). Implementieren Sie für eine benutzerdefinierte Ausgestaltung ein
Sprach-Provider-Plugin mit prepareSynthesis(ctx) und geben Sie angepassten Text,
eine Provider-Konfiguration oder Überschreibungen zurück, bevor synthesize() ausgeführt wird. Dadurch verbleibt die ausdrucksstarke
Prompt-Erstellung im Provider-Code, in dem die Semantik der Anforderungen bekannt ist.
Fallback-Richtlinie
fallbackPolicy steuert das Verhalten, wenn eine Persona keine Zuordnung für den
versuchten Provider besitzt:
Die gesamte TTS-Anforderung schlägt nur fehl, wenn jeder versuchte Provider übersprungen
wird oder fehlschlägt.
Die Provider-Auswahl einer Talk-Sitzung gilt nur für diese Sitzung. Ein Talk-Client sollte
Provider-IDs, Modell-IDs, Stimmen-IDs und Gebietsschemas aus
talk.catalog auswählen und
sie über die Talk-Sitzungs- oder Übergabeanforderung übergeben. Das Öffnen einer Sprachsitzung sollte
weder tts noch die globalen Standardwerte des Talk-Providers verändern.
Modellgesteuerte Direktiven
Standardmäßig kann der Assistent[[tts:...]]-Direktiven ausgeben, um
Stimme, Modell oder Geschwindigkeit für eine einzelne Antwort zu überschreiben, sowie optional einen
[[tts:text]]...[[/tts:text]]-Block für ausdrucksbezogene Hinweise, die ausschließlich im
Audio erscheinen sollen:
tts.auto den Wert "tagged" hat, sind Direktiven erforderlich, um
Audio auszulösen. Bei der blockweisen Streaming-Auslieferung werden Direktiven aus dem sichtbaren Text entfernt, bevor der
Kanal ihn empfängt, selbst wenn sie auf benachbarte Blöcke verteilt sind.
provider=... wird ignoriert, sofern nicht modelOverrides.allowProvider: true. Wenn eine
Antwort provider=... deklariert, werden die anderen Schlüssel in dieser Direktive
ausschließlich von diesem Provider ausgewertet; nicht unterstützte Schlüssel werden entfernt und als Warnungen zu TTS-
Direktiven gemeldet.
Verfügbare Direktiven-Schlüssel:
provider(registrierte Provider-ID; erfordertallowProvider: true)speakerVoice/speakerVoiceId(veraltete Aliase:voice,voiceName,voice_name,google_voice,voiceId)model/google_modelstability,similarityBoost,style,speed,useSpeakerBoostvol/volume(MiniMax-Lautstärke,(0, 10])pitch(ganzzahlige MiniMax-Tonhöhe, −12 bis 12; Nachkommastellen werden abgeschnitten)emotion(Volcengine-Emotions-Tag)applyTextNormalization(auto|on|off)languageCode(ISO 639-1)seed
Slash-Befehle
Einzelner Befehl/tts. Auf Discord registriert OpenClaw außerdem /voice, da
/tts ein integrierter Discord-Befehl ist — der Textbefehl /tts ... funktioniert weiterhin.
Befehle erfordern einen autorisierten Absender (Zulassungslisten-/Eigentümerregeln gelten), und entweder
commands.text oder die Registrierung nativer Befehle muss aktiviert sein./tts onschreibt die lokale TTS-Einstellung nachalways;/tts offschreibt sie nachoff./tts chat on|off|defaultschreibt für den aktuellen Chat eine sitzungsbezogene Auto-TTS-Überschreibung./tts persona <id>schreibt die lokale Persona-Einstellung;/tts persona offlöscht sie./tts latestliest die neueste Assistentenantwort aus dem Transkript der aktuellen Sitzung und sendet sie einmalig als Audio. Im Sitzungseintrag wird nur ein Hash dieser Antwort gespeichert, um doppelte Sprachausgaben zu unterdrücken./tts audioerzeugt eine einmalige Audioantwort (aktiviert TTS nicht dauerhaft)./tts limit <chars>akzeptiert 100–4096 (4096 ist das Telegram-Maximum für Bildunterschriften/Nachrichten); Werte außerhalb dieses Bereichs werden abgelehnt.limitundsummarywerden in lokalen Einstellungen und nicht in der Hauptkonfiguration gespeichert./tts statusenthält Fallback-Diagnosen für den letzten Versuch —Fallback: <primary> -> <used>,Attempts: ...und Details pro Versuch (provider:outcome(reasonCode) latency)./statuszeigt bei aktiviertem TTS den aktiven TTS-Modus sowie den konfigurierten Provider, das Modell, die Stimme und bereinigte Metadaten des benutzerdefinierten Endpunkts an.
Benutzerspezifische Einstellungen
Slash-Befehle schreiben lokale Überschreibungen in den Pfad für TTS-Einstellungen. Der Standardwert lautet~/.openclaw/settings/tts.json; überschreiben Sie ihn mit OPENCLAW_TTS_PREFS. Doctor
verschiebt den nicht mehr verwendeten globalen Wert tts.prefsPath in den gemeinsamen Maschinenstatus.
Fortgeschrittene Multi-Agent-Konfigurationen können weiterhin agents.entries.<id>.tts.prefsPath
festlegen, wenn Agenten absichtlich getrennte Einstellungsspeicher verwenden.
Diese überschreiben die wirksame Konfiguration aus
tts sowie den aktiven
agents.entries.*.tts-Block für diesen Host.
Ausgabeformate
Die TTS-Sprachausgabe richtet sich nach den Fähigkeiten des Kanals. Kanal-Plugins geben an, ob TTS im Sprachstil von Providern ein nativesvoice-note-Zielformat anfordern oder
die normale audio-file-Synthese beibehalten soll und ob der Kanal
nicht native Ausgaben vor dem Senden transkodiert.
Hinweise pro Provider:
- Feishu-/WhatsApp-Transkodierung: Wenn eine Sprachnachrichten-Antwort als MP3/WebM/WAV/M4A oder andere wahrscheinliche Audiodatei vorliegt, transkodiert das Kanal-Plugin sie vor dem Senden der nativen Sprachnachricht mit
ffmpeg(libopus, 64 kbps) in Ogg/Opus mit 48 kHz. WhatsApp sendet das Ergebnis über die Baileys-audio-Nutzlast mitptt: trueundaudio/ogg; codecs=opus. Bei einem Transkodierungsfehler: Feishu fängt den Fehler ab und sendet ersatzweise die Originaldatei als normalen Anhang; WhatsApp bietet keinen Fallback, sodass der Sendevorgang selbst fehlschlägt, statt eine inkompatible PTT-Nutzlast zu veröffentlichen. - MiniMax: MP3 (
speech-2.8-hd-Modell, Abtastrate 32 kHz) für normale Audioanhänge; für vom Kanal als Sprachnachrichten-Ziele ausgewiesene Ziele wird mitffmpegin Opus mit 48 kHz transkodiert. - Xiaomi MiMo: Standardmäßig MP3 oder bei entsprechender Konfiguration WAV; für vom Kanal als Sprachnachrichten-Ziele ausgewiesene Ziele wird mit
ffmpegin Opus mit 48 kHz transkodiert. - Lokale CLI: Verwendet das konfigurierte
outputFormat. Sprachnachrichten-Ziele werden in Ogg/Opus und Telefonieausgaben mitffmpegin rohes Mono-PCM mit 16 kHz konvertiert. - Google Gemini: Gibt rohes PCM mit 24 kHz zurück. OpenClaw verpackt es für Audioanhänge als WAV, transkodiert es für Sprachnachrichten-Ziele in Opus mit 48 kHz und gibt PCM für Talk/Telefonie direkt zurück.
- Gradium: WAV für Audioanhänge, Opus für Sprachnachrichten-Ziele und
ulaw_8000mit 8 kHz für Telefonie. - Inworld: MP3 für normale Audioanhänge, natives
OGG_OPUSfür Sprachnachrichten-Ziele und rohesPCMmit 22050 Hz für Talk/Telefonie. - xAI: Standardmäßig MP3; die Audiodateisynthese kann
mp3,wav,pcm,mulawoderalawsowohl für gepufferte als auch für Streaming-Ausgaben verwenden. Sprachnachrichten-Ziele verwenden MP3 für Streaming und den gepufferten Fallback, da die Ausgabenpcm,mulawundalawvon xAI headerlose Rohaudiodaten sind. Die gepufferte Synthese verwendet den Batch-REST-Endpunkt/v1/ttsvon xAI;textToSpeechStreamverwendet nativeswss://api.x.ai/v1/tts. Dies ist nicht der Echtzeit-Sprachvertrag. Das native Opus-Sprachnachrichtenformat wird nicht unterstützt. - Microsoft: Verwendet
microsoft.outputFormat(Standardwertaudio-24khz-48kbitrate-mono-mp3).- Der gebündelte Transport akzeptiert ein
outputFormat, aber nicht alle Formate sind über den Dienst verfügbar. - Ausgabeformatwerte entsprechen den Microsoft-Speech-Ausgabeformaten (einschließlich Ogg/WebM Opus).
- Telegram
sendVoiceakzeptiert OGG/MP3/M4A; verwenden Sie OpenAI/ElevenLabs, wenn Sie garantierte Opus-Sprachnachrichten benötigen. - Wenn das konfigurierte Microsoft-Ausgabeformat fehlschlägt, versucht OpenClaw es erneut mit MP3.
- Wenn keine explizite Stimmenüberschreibung festgelegt ist und die englische Standardstimme verwendet wird, wechselt OpenClaw automatisch zu einer chinesischen neuronalen Stimme (
zh-CN-XiaoxiaoNeural, Gebietsschemazh-CN), falls der Antworttext überwiegend aus CJK-Zeichen besteht.
- Der gebündelte Transport akzeptiert ein
Verhalten von Auto-TTS
Wenntts.auto aktiviert ist, führt OpenClaw Folgendes aus:
- Überspringt TTS, wenn die Antwort bereits strukturierte Medien enthält.
- Überspringt sehr kurze Antworten (unter 10 Zeichen).
- Fasst lange Antworten zusammen, wenn Zusammenfassungen aktiviert sind, und verwendet dabei
summaryModel(oderagents.defaults.model.primary). - Fügt das erzeugte Audio der Antwort hinzu.
- Sendet in
mode: "final"nach Abschluss des Textstreams weiterhin reine TTS-Audioausgaben für gestreamte endgültige Antworten; die erzeugten Medien durchlaufen dieselbe Kanalmedien-Normalisierung wie normale Antwortanhänge.
maxLength überschreitet, überspringt OpenClaw die Audioausgabe niemals vollständig:
- Zusammenfassung aktiviert (Standard) und ein Zusammenfassungsmodell ist verfügbar: Fasst den
Text auf ungefähr
maxLengthZeichen zusammen und synthetisiert anschließend die Zusammenfassung. - Zusammenfassung deaktiviert, die Zusammenfassung schlägt fehl oder für das
Zusammenfassungsmodell ist kein API-Schlüssel verfügbar: Kürzt den Text auf
maxLengthZeichen und synthetisiert den gekürzten Text.
Feldreferenz
TTS auf oberster Ebene: tts.*
TTS auf oberster Ebene: tts.*
"off" | "always" | "inbound" | "tagged"
Auto-TTS-Modus.
inbound sendet Audio nur nach einer eingehenden Sprachnachricht; tagged sendet Audio nur, wenn die Antwort [[tts:...]]-Direktiven oder einen [[tts:text]]-Block enthält.boolean
veraltet
Veralteter Umschalter.
openclaw doctor --fix migriert diesen zu auto."final" | "all"
Standard:"final"
"all" schließt zusätzlich zu endgültigen Antworten auch Werkzeug-/Blockantworten ein.string
ID des Sprach-Providers. Wenn nicht festgelegt, verwendet OpenClaw den ersten konfigurierten Provider gemäß der automatischen Auswahlreihenfolge der Registry. Das veraltete
provider: "edge" wird von openclaw doctor --fix in "microsoft" umgeschrieben.string
ID der aktiven Persona aus
personas. Wird in Kleinbuchstaben normalisiert.object
Stabile gesprochene Identität. Felder:
label, description, provider, fallbackPolicy, prompt, providers.<provider>. Siehe Personas.string
Kostengünstiges Modell für automatische Zusammenfassungen; standardmäßig
agents.defaults.model.primary. Akzeptiert provider/model oder einen konfigurierten Modellalias.object
Erlaubt dem Modell, TTS-Direktiven auszugeben.
enabled ist standardmäßig true; allowProvider ist standardmäßig false.object
Provider-eigene Einstellungen, nach der ID des Sprach-Providers verschlüsselt. Veraltete direkte Blöcke (
tts.openai, .elevenlabs, .microsoft, .edge) werden von openclaw doctor --fix umgeschrieben; schreiben Sie ausschließlich tts.providers.<id> fest.number
Standard:"4096"
Harte Obergrenze für TTS-Eingabezeichen.
/tts audio, tts.convert und tts.speak schlagen bei einer Überschreitung fehl.number
Standard:"30000"
Anfragezeitlimit in Millisekunden. Ein
timeoutMs pro Aufruf (Agentenwerkzeug, Gateway) hat Vorrang, wenn es festgelegt ist; andernfalls hat ein explizit konfiguriertes tts.timeoutMs Vorrang vor jedem vom Plugin definierten Provider-Standardwert.apiKey-Felder des Providers können Rohzeichenfolgen oder SecretRefs sein. Beim Kaltstart des Gateways
bewirkt eine nicht verfügbare TTS-SecretRef, dass die integrierte TTS-Funktion
als konfiguriert, aber nicht verfügbar markiert wird, statt das Gateway anzuhalten. tts.speak gibt dann
UNAVAILABLE mit dem Grund SECRET_SURFACE_UNAVAILABLE zurück, und es wird keine Provider-Anfrage
gesendet. Status und Doctor führen den beeinträchtigten TTS-Eigentümer und seine Konfigurationspfade auf. Die
expliziten Referenzen verbleiben im Laufzeit-Snapshot, sodass Umgebungs- oder Profil-
Anmeldedaten nicht stillschweigend ein anderes Konto auswählen können. Neuladungen und die Vorabprüfung
beim Schreiben der Konfiguration wenden die eigentümerbezogene Beeinträchtigungsrichtlinie an: Ein unveränderter berechtigter TTS-
Eigentümer darf seine zuletzt als funktionsfähig bekannten Anmeldedaten als veraltet beibehalten, während ein neuer oder geänderter
Fehler kalt wird, ohne funktionierende Eigentümer zu blockieren. Strukturell ungültige Referenzen
und aufgelöste Werte lassen den Start weiterhin fehlschlagen beziehungsweise führen weiterhin zur Ablehnung der Aktualisierung.Azure Speech
Azure Speech
string
Umgebung:
AZURE_SPEECH_KEY, AZURE_SPEECH_API_KEY oder SPEECH_KEY.string
Azure-Speech-Region (z. B.
eastus). Umgebung: AZURE_SPEECH_REGION oder SPEECH_REGION.string
Optionale Überschreibung des Azure-Speech-Endpunkts (Alias
baseUrl).string
ShortName der Azure-Stimme. Standardwert
en-US-JennyNeural. Veralteter Alias: voice.string
SSML-Sprachcode. Standardwert
en-US.string
Azure-
X-Microsoft-OutputFormat für Standardaudio. Standardwert audio-24khz-48kbitrate-mono-mp3.string
Azure-
X-Microsoft-OutputFormat für Sprachnachrichtenausgaben. Standardwert ogg-24khz-16bit-mono-opus.ElevenLabs
ElevenLabs
string
Greift ersatzweise auf
ELEVENLABS_API_KEY oder XI_API_KEY zurück.string
Modell-ID. Standardwert
eleven_multilingual_v2. Veraltete IDs eleven_turbo_v2_5/eleven_turbo_v2 werden zum entsprechenden flash-Modell normalisiert.string
ElevenLabs-Stimmen-ID. Standardwert
pMsXgVXv3BLzUgSXRplE. Veralteter Alias: voiceId.object
stability, similarityBoost, style (jeweils 0..1, Standardwerte 0.5/0.75/0), useSpeakerBoost (true|false, Standardwert true), speed (0.5..2.0, Standardwert 1.0)."auto" | "on" | "off"
Textnormalisierungsmodus.
string
Zweistelliger ISO-639-1-Code (z. B.
en, de).number
Ganzzahliges
0..4294967295 für bestmöglichen Determinismus.string
Überschreibt die Basis-URL der ElevenLabs-API.
Google Gemini
Google Gemini
string
Fällt auf
GEMINI_API_KEY / GOOGLE_API_KEY zurück. Falls nicht angegeben, kann TTS vor dem Rückgriff auf die Umgebungsvariable models.providers.google.apiKey wiederverwenden.string
Gemini-TTS-Modell. Standardwert:
gemini-3.1-flash-tts-preview.string
Name der vordefinierten Gemini-Stimme. Standardwert:
Kore. Veraltete Aliasse: voiceName, voice.string
Natürlichsprachliche Stilanweisung, die dem gesprochenen Text vorangestellt wird.
string
Optionale Sprecherbezeichnung, die dem gesprochenen Text vorangestellt wird, wenn Ihre Anweisung einen benannten Sprecher verwendet.
"audio-profile-v1"
Auf
audio-profile-v1 setzen, um aktive Persona-Anweisungsfelder in eine deterministische Gemini-TTS-Anweisungsstruktur einzubetten.string
Zusätzlicher Google-spezifischer Persona-Anweisungstext, der an die Regiehinweise der Vorlage angehängt wird.
string
Nur
https://generativelanguage.googleapis.com wird akzeptiert.Gradium
Gradium
Inworld
Inworld
Primäres Inworld
string
Umgebungsvariable:
INWORLD_API_KEY.string
Standardwert:
https://api.inworld.ai.string
Standardwert:
inworld-tts-1.5-max. Außerdem: inworld-tts-1.5-mini, inworld-tts-1-max, inworld-tts-1.string
Standardwert:
Sarah. Veralteter Alias: voiceId.number
Sampling-Temperatur
0..2 (0 ausgeschlossen).Lokale CLI (tts-local-cli)
Lokale CLI (tts-local-cli)
string
Lokale ausführbare Datei oder Befehlszeichenfolge für CLI-TTS.
string[]
Befehlsargumente. Unterstützt die Platzhalter
{{Text}}, {{OutputPath}}, {{OutputDir}}, {{OutputBase}}."mp3" | "opus" | "wav"
Erwartetes CLI-Ausgabeformat. Standardwert für Audioanhänge:
mp3.number
Zeitüberschreitung des Befehls in Millisekunden. Standardwert:
120000.string
Optionales Arbeitsverzeichnis des Befehls.
Record<string, string>
Optionale Überschreibungen der Umgebungsvariablen für den Befehl.
Microsoft (kein API-Schlüssel)
Microsoft (kein API-Schlüssel)
boolean
Standard:"true"
Die Verwendung der Microsoft-Sprachausgabe zulassen.
string
Name der neuronalen Microsoft-Stimme (z. B.
en-US-MichelleNeural). Veralteter Alias: voice. Wenn die englische Standardstimme aktiv ist und der Antworttext überwiegend aus CJK-Zeichen besteht, wechselt OpenClaw automatisch zu zh-CN-XiaoxiaoNeural.string
Sprachcode (z. B.
en-US).string
Microsoft-Ausgabeformat. Standardwert:
audio-24khz-48kbitrate-mono-mp3. Der enthaltene Edge-basierte Transport unterstützt nicht alle Formate.string
Prozentzeichenfolgen (z. B.
+10%, -5%).boolean
JSON-Untertitel neben die Audiodatei schreiben.
string
Proxy-URL für Microsoft-Sprachanfragen.
number
Überschreibung der Anfragezeitüberschreitung (ms).
object
veraltet
Veralteter Alias. Führen Sie
openclaw doctor --fix aus, um die persistierte Konfiguration in providers.microsoft umzuschreiben.MiniMax
MiniMax
string
Fällt auf
MINIMAX_API_KEY zurück. Token-Plan-Authentifizierung über MINIMAX_OAUTH_TOKEN, MINIMAX_CODE_PLAN_KEY oder MINIMAX_CODING_API_KEY.string
Standardwert:
https://api.minimax.io. Umgebungsvariable: MINIMAX_API_HOST.string
Standardwert:
speech-2.8-hd. Umgebungsvariable: MINIMAX_TTS_MODEL.string
Standardwert:
English_expressive_narrator. Umgebungsvariable: MINIMAX_TTS_VOICE_ID. Veralteter Alias: voiceId.number
0.5..2.0. Standardwert: 1.0.number
(0, 10]. Standardwert: 1.0.number
Ganzzahl
-12..12. Standardwert: 0. Nachkommastellen werden vor der Anfrage abgeschnitten.OpenAI
OpenAI
string
Fällt auf
OPENAI_API_KEY zurück.string
OpenAI-TTS-Modell-ID. Standardwert:
gpt-4o-mini-tts.string
Stimmenname (z. B.
alloy, cedar). Standardwert: coral. Veralteter Alias: voice.string
Explizites OpenAI-Feld
instructions. Wenn es festgelegt ist, werden Persona-Anweisungsfelder nicht automatisch zugeordnet.Record<string, unknown>
Zusätzliche JSON-Felder, die nach den generierten OpenAI-TTS-Feldern in die Anfragetexte von
/audio/speech eingefügt werden. Verwenden Sie dies für OpenAI-kompatible Endpunkte wie Kokoro, die Provider-spezifische Schlüssel wie lang benötigen; unsichere Prototypschlüssel werden ignoriert.string
Den OpenAI-TTS-Endpunkt überschreiben. Auflösungsreihenfolge: Konfiguration →
OPENAI_TTS_BASE_URL → https://api.openai.com/v1. Nicht standardmäßige Werte werden als OpenAI-kompatible TTS-Endpunkte behandelt. Daher werden benutzerdefinierte Modell- und Stimmennamen akzeptiert, und für speed entfällt die Bereichsprüfung 0.25..4.0.OpenRouter
OpenRouter
string
Umgebungsvariable:
OPENROUTER_API_KEY. Kann models.providers.openrouter.apiKey wiederverwenden.string
Standardwert:
https://openrouter.ai/api/v1. Das veraltete https://openrouter.ai/v1 wird normalisiert.string
Standardwert:
hexgrad/kokoro-82m. Alias: modelId.string
Standardwert:
af_alloy. Veraltete Aliasse: voice, voiceId."mp3" | "pcm"
Standardwert:
mp3.number
Provider-native Überschreibung der Geschwindigkeit.
Volcengine (BytePlus Seed Speech)
Volcengine (BytePlus Seed Speech)
string
Umgebungsvariable:
VOLCENGINE_TTS_API_KEY oder BYTEPLUS_SEED_SPEECH_API_KEY.string
Standardwert:
seed-tts-1.0. Umgebungsvariable: VOLCENGINE_TTS_RESOURCE_ID. Verwenden Sie seed-tts-2.0, wenn Ihr Projekt zur Nutzung von TTS 2.0 berechtigt ist.string
App-Schlüssel-Header. Standardwert:
aGjiRDfUWi. Umgebungsvariable: VOLCENGINE_TTS_APP_KEY.string
Den HTTP-Endpunkt für Seed-Speech-TTS überschreiben. Umgebungsvariable:
VOLCENGINE_TTS_BASE_URL.string
Stimmtyp. Standardwert:
en_female_anna_mars_bigtts. Umgebungsvariable: VOLCENGINE_TTS_VOICE. Veralteter Alias: voice.number
Provider-natives Geschwindigkeitsverhältnis,
0.2..3.string
Provider-natives Emotions-Tag.
string
veraltet
Veraltete Felder der Volcengine Speech Console. Umgebungsvariablen:
VOLCENGINE_TTS_APPID, VOLCENGINE_TTS_TOKEN, VOLCENGINE_TTS_CLUSTER (Standardwert: volcano_tts).xAI
xAI
string
Umgebungsvariable:
XAI_API_KEY.string
Standardwert:
https://api.x.ai/v1. Umgebungsvariable: XAI_BASE_URL.string
Standardwert:
eve. Mit Authentifizierung ruft openclaw infer tts voices --provider xai den aktuellen integrierten Katalog ab; ohne Authentifizierung werden die Offline-Ersatzwerte ara, eve, leo, rex und sal aufgeführt. Benutzerdefinierte Stimmen-IDs des Kontos werden auch dann weitergeleitet, wenn sie nicht in der integrierten Liste enthalten sind. Veralteter Alias: voiceId.string
BCP-47-Sprachcode oder
auto. Standardwert: en."mp3" | "wav" | "pcm" | "mulaw" | "alaw"
Standardwert:
mp3.number
Provider-native Überschreibung der Geschwindigkeit,
0.7..1.5.Xiaomi MiMo
Xiaomi MiMo
string
Umgebungsvariable:
XIAOMI_API_KEY.string
Standardwert:
https://api.xiaomimimo.com/v1. Umgebungsvariable: XIAOMI_BASE_URL.string
Standardwert:
mimo-v2.5-tts. Umgebungsvariable: XIAOMI_TTS_MODEL. Unterstützt außerdem mimo-v2.5-tts-voicedesign.string
Standardwert für Modelle mit voreingestellten Stimmen:
mimo_default. Umgebungsvariable: XIAOMI_TTS_VOICE. Veralteter Alias: voice. Wird für mimo-v2.5-tts-voicedesign nicht gesendet."mp3" | "wav"
Standardwert:
mp3. Umgebungsvariable: XIAOMI_TTS_FORMAT.string
Optionale natürlichsprachliche Stilanweisung, die als Benutzernachricht gesendet und nicht gesprochen wird. Für
mimo-v2.5-tts-voicedesign ist dies die Anweisung zur Stimmgestaltung; OpenClaw stellt einen Standardwert bereit, wenn sie nicht angegeben ist.Agentenwerkzeug
Das Werkzeugtts wandelt Text in Sprache um und gibt einen Audioanhang für die Zustellung der Antwort zurück. Bei Feishu, Matrix, Telegram und WhatsApp wird das Audio als Sprachnachricht statt als Dateianhang zugestellt. Feishu und WhatsApp können auf diesem Pfad TTS-Ausgaben, die nicht im Opus-Format vorliegen, transkodieren, wenn ffmpeg verfügbar ist.
WhatsApp sendet Audiodaten über Baileys als PTT-Sprachnachricht (audio mit ptt: true) und sendet sichtbaren Text getrennt vom PTT-Audio, da Clients Untertitel bei Sprachnachrichten nicht einheitlich darstellen.
Das Werkzeug akzeptiert die optionalen Felder channel und timeoutMs; timeoutMs ist eine Provider-Anfragezeitüberschreitung pro Aufruf in Millisekunden. Werte pro Aufruf überschreiben tts.timeoutMs; konfigurierte TTS-Zeitüberschreitungen überschreiben alle vom Plugin definierten Provider-Standardwerte.
Gateway-RPC
Service-Links
- OpenAI-Leitfaden zur Text-zu-Sprache-Umwandlung
- OpenAI-Audio-API-Referenz
- Azure Speech REST-Text-zu-Sprache
- Azure-Speech-Provider
- ElevenLabs Text-zu-Sprache
- ElevenLabs-Authentifizierung
- Gradium
- Inworld-TTS-API
- MiniMax-T2A-v2-API
- Volcengine-TTS-HTTP-API
- Xiaomi-MiMo-Sprachsynthese
- node-edge-tts
- Microsoft-Speech-Ausgabeformate
- xAI Text-zu-Sprache