Skip to main content
Azure Speech — це вбудований постачальник синтезу мовлення на основі Azure AI Speech. OpenClaw безпосередньо викликає REST API Azure Speech із SSML, синтезуючи MP3 для стандартних відповідей, нативний Ogg/Opus для голосових повідомлень і mulaw 8 кГц для телефонних каналів, як-от Voice Call. Запит передає визначений постачальником формат виведення через заголовок X-Microsoft-OutputFormat.

Початок роботи

1

Створіть ресурс Azure Speech

На порталі Azure створіть ресурс Speech. Скопіюйте KEY 1 з Resource Management > Keys and Endpoint, а також розташування ресурсу, наприклад eastus.
2

Виберіть Azure Speech у messages.tts

3

Надішліть повідомлення

Надішліть відповідь через будь-який підключений канал. OpenClaw синтезує аудіо за допомогою Azure Speech і передає MP3 для стандартного аудіо або Ogg/Opus, коли канал очікує голосове повідомлення.

Параметри конфігурації

Усі параметри містяться в messages.tts.providers["azure-speech"]. Постачальник вважається налаштованим, коли задано apiKey разом з одним із region, endpoint або baseUrl. Змінні середовища перевіряються лише як резервний варіант для незаданих ключів конфігурації. Файли .env робочої області не можуть задавати AZURE_SPEECH_ENDPOINT; для маршрутизації кінцевої точки використовуйте середовище процесу, глобальний dotenv середовища виконання або явну конфігурацію.

Примітки

Azure Speech використовує ключ ресурсу Speech, а не ключ Azure OpenAI. Ключ надсилається як Ocp-Apim-Subscription-Key; OpenClaw формує https://<region>.tts.speech.microsoft.com з region, якщо не надано endpoint або baseUrl.
Використовуйте значення ShortName голосу Azure Speech, наприклад en-US-JennyNeural. Вбудований постачальник може отримувати список голосів через той самий ресурс Speech і відфільтровує голоси, позначені як застарілі, вилучені або вимкнені.
Azure приймає такі формати виведення, як audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus і riff-24khz-16bit-mono-pcm. OpenClaw запитує Ogg/Opus для цілей voice-note, щоб канали могли надсилати нативні голосові повідомлення без додаткового перетворення MP3, і примусово використовує raw-8khz-8bit-mono-mulaw для телефонних цілей.
azure підтримується як псевдонім постачальника для наявної конфігурації, але в новій конфігурації слід використовувати azure-speech, щоб уникнути плутанини з постачальниками моделей Azure OpenAI.

Пов’язані матеріали

Синтез мовлення

Огляд TTS, постачальники та конфігурація messages.tts.

Конфігурація

Повний довідник із конфігурації, включно з налаштуваннями messages.tts.

Постачальники

Усі вбудовані постачальники OpenClaw.

Усунення несправностей

Поширені проблеми та кроки діагностики.