Skip to main content
Azure Speech is een meegeleverde Azure AI Speech-provider voor tekst-naar-spraak. OpenClaw roept de Azure Speech REST API rechtstreeks aan met SSML en synthetiseert MP3 voor standaardantwoorden, native Ogg/Opus voor spraakberichten en 8 kHz mulaw voor telefoniekanalen zoals Voice Call. De aanvraag stuurt de uitvoerindeling van de provider via de header X-Microsoft-OutputFormat.

Aan de slag

1

Een Azure Speech-resource maken

Maak in de Azure-portal een Speech-resource. Kopieer KEY 1 uit Resource Management > Keys and Endpoint en kopieer de resourcelocatie, zoals eastus.
2

Azure Speech selecteren in tts

3

Een bericht verzenden

Stuur een antwoord via een verbonden kanaal. OpenClaw synthetiseert de audio met Azure Speech en levert MP3 voor standaardaudio, of Ogg/Opus wanneer het kanaal een spraakbericht verwacht.

Configuratieopties

Alle opties bevinden zich onder tts.providers["azure-speech"]. De provider wordt als geconfigureerd beschouwd zodra apiKey is ingesteld, samen met een van region, endpoint of baseUrl. Omgevingsvariabelen worden alleen als terugvaloptie gecontroleerd voor niet-ingestelde configuratiesleutels. .env-bestanden van de werkruimte kunnen AZURE_SPEECH_ENDPOINT niet instellen; gebruik de procesomgeving, het globale runtime-dotenv-bestand of expliciete configuratie voor eindpuntroutering.

Opmerkingen

Azure Speech gebruikt een Speech-resourcesleutel, geen Azure OpenAI-sleutel. De sleutel wordt verzonden als Ocp-Apim-Subscription-Key; OpenClaw leidt https://<region>.tts.speech.microsoft.com af van region, tenzij je endpoint of baseUrl opgeeft.
Gebruik de waarde ShortName van de Azure Speech-stem, bijvoorbeeld en-US-JennyNeural. De meegeleverde provider kan via dezelfde Speech-resource stemmen weergeven en filtert stemmen uit die zijn gemarkeerd als verouderd, ingetrokken of uitgeschakeld.
Azure accepteert uitvoerindelingen zoals audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus en riff-24khz-16bit-mono-pcm. OpenClaw vraagt Ogg/Opus aan voor voice-note-doelen, zodat kanalen native spraakballonnen kunnen verzenden zonder extra MP3-conversie, en dwingt raw-8khz-8bit-mono-mulaw af voor telefoniedoelen.
azure wordt geaccepteerd als provideralias voor bestaande configuratie, maar nieuwe configuratie moet azure-speech gebruiken om verwarring met Azure OpenAI- modelproviders te voorkomen.

Gerelateerd

Tekst-naar-spraak

Overzicht van TTS, providers en tts-configuratie.

Configuratie

Volledige configuratiereferentie, inclusief tts-instellingen.

Providers

Alle meegeleverde OpenClaw-providers.

Problemen oplossen

Veelvoorkomende problemen en stappen voor foutopsporing.