Skip to main content
Azure Speech ist ein gebündelter Text-zu-Sprache-Provider von Azure AI Speech. OpenClaw ruft die Azure Speech REST API direkt mit SSML auf und synthetisiert MP3 für Standardantworten, natives Ogg/Opus für Sprachnachrichten und 8-kHz-mulaw für Telefoniekanäle wie Voice Call. Die Anfrage sendet das Provider-eigene Ausgabeformat über den Header X-Microsoft-OutputFormat.

Erste Schritte

1

Eine Azure Speech-Ressource erstellen

Erstellen Sie im Azure-Portal eine Speech-Ressource. Kopieren Sie KEY 1 aus Resource Management > Keys and Endpoint und kopieren Sie den Ressourcenstandort, beispielsweise eastus.
2

Azure Speech in tts auswählen

3

Eine Nachricht senden

Senden Sie eine Antwort über einen beliebigen verbundenen Kanal. OpenClaw synthetisiert das Audio mit Azure Speech und stellt MP3 für Standardaudio oder Ogg/Opus bereit, wenn der Kanal eine Sprachnachricht erwartet.

Konfigurationsoptionen

Alle Optionen befinden sich unter tts.providers["azure-speech"]. Der Provider gilt als konfiguriert, sobald apiKey sowie einer der Werte region, endpoint oder baseUrl festgelegt sind. Umgebungsvariablen werden nur als Fallback für nicht gesetzte Konfigurationsschlüssel geprüft. .env-Dateien im Workspace können AZURE_SPEECH_ENDPOINT nicht festlegen; verwenden Sie für das Endpunkt-Routing die Prozessumgebung, die globale Laufzeit-dotenv-Datei oder eine explizite Konfiguration.

Hinweise

Azure Speech verwendet einen Speech-Ressourcenschlüssel und keinen Azure OpenAI-Schlüssel. Der Schlüssel wird als Ocp-Apim-Subscription-Key gesendet; OpenClaw leitet https://<region>.tts.speech.microsoft.com aus region ab, sofern Sie nicht endpoint oder baseUrl angeben.
Verwenden Sie den Wert ShortName der Azure Speech-Stimme, beispielsweise en-US-JennyNeural. Der gebündelte Provider kann Stimmen über dieselbe Speech-Ressource auflisten und filtert Stimmen heraus, die als veraltet, eingestellt oder deaktiviert gekennzeichnet sind.
Azure akzeptiert Ausgabeformate wie audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus und riff-24khz-16bit-mono-pcm. OpenClaw fordert Ogg/Opus für voice-note-Ziele an, damit Kanäle native Sprachnachrichtenblasen ohne zusätzliche MP3-Konvertierung senden können, und erzwingt raw-8khz-8bit-mono-mulaw für Telefonieziele.
azure wird für bestehende Konfigurationen als Provider-Alias akzeptiert, neue Konfigurationen sollten jedoch azure-speech verwenden, um Verwechslungen mit Azure OpenAI-Modell-Providern zu vermeiden.

Verwandte Themen

Text-zu-Sprache

TTS-Übersicht, Provider und tts-Konfiguration.

Konfiguration

Vollständige Konfigurationsreferenz einschließlich der Einstellungen unter tts.

Provider

Alle gebündelten OpenClaw-Provider.

Fehlerbehebung

Häufige Probleme und Schritte zur Fehlerdiagnose.