Skip to main content
Azure Speech — это встроенный провайдер преобразования текста в речь Azure AI Speech. OpenClaw напрямую вызывает REST API Azure Speech с использованием SSML, синтезируя MP3 для стандартных ответов, нативный Ogg/Opus для голосовых сообщений и mulaw 8 кГц для телефонных каналов, таких как Voice Call. В запросе принадлежащий провайдеру формат вывода передаётся через заголовок X-Microsoft-OutputFormat.

Начало работы

1

Создание ресурса Azure Speech

На портале Azure создайте ресурс Speech. Скопируйте KEY 1 из раздела Resource Management > Keys and Endpoint, а также расположение ресурса, например eastus.
2

Выбор Azure Speech в messages.tts

3

Отправка сообщения

Отправьте ответ через любой подключённый канал. OpenClaw синтезирует аудио с помощью Azure Speech и передаст MP3 для стандартного аудио или Ogg/Opus, если канал ожидает голосовое сообщение.

Параметры конфигурации

Все параметры находятся в messages.tts.providers["azure-speech"]. Провайдер считается настроенным, если задан apiKey и один из region, endpoint или baseUrl. Переменные окружения проверяются только как резервный вариант для незаданных ключей конфигурации. Файлы рабочей области .env не могут задавать AZURE_SPEECH_ENDPOINT; для маршрутизации конечных точек используйте окружение процесса, глобальный dotenv среды выполнения или явную конфигурацию.

Примечания

Azure Speech использует ключ ресурса Speech, а не ключ Azure OpenAI. Ключ передаётся как Ocp-Apim-Subscription-Key; OpenClaw формирует https://<region>.tts.speech.microsoft.com на основе region, если не указан endpoint или baseUrl.
Используйте значение ShortName голоса Azure Speech, например en-US-JennyNeural. Встроенный провайдер может получать список голосов через тот же ресурс Speech и исключает голоса, помеченные как устаревшие, выведенные из эксплуатации или отключённые.
Azure принимает такие форматы вывода, как audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus и riff-24khz-16bit-mono-pcm. OpenClaw запрашивает Ogg/Opus для целей voice-note, чтобы каналы могли отправлять нативные голосовые сообщения без дополнительного преобразования MP3, и принудительно использует raw-8khz-8bit-mono-mulaw для телефонных целей.
azure принимается как псевдоним провайдера для существующей конфигурации, но в новой конфигурации следует использовать azure-speech, чтобы избежать путаницы с провайдерами моделей Azure OpenAI.

Связанные материалы

Преобразование текста в речь

Обзор TTS, провайдеры и конфигурация messages.tts.

Конфигурация

Полный справочник по конфигурации, включая настройки messages.tts.

Провайдеры

Все встроенные провайдеры OpenClaw.

Устранение неполадок

Распространённые проблемы и шаги по отладке.