Skip to main content
Azure Speech to dołączony dostawca zamiany tekstu na mowę usługi Azure AI Speech. OpenClaw wywołuje bezpośrednio interfejs REST API Azure Speech z użyciem SSML, generując pliki MP3 dla standardowych odpowiedzi, natywne pliki Ogg/Opus dla wiadomości głosowych oraz dźwięk mulaw 8 kHz dla kanałów telefonicznych, takich jak Voice Call. Żądanie przesyła format wyjściowy należący do dostawcy za pośrednictwem nagłówka X-Microsoft-OutputFormat.

Pierwsze kroki

1

Utwórz zasób Azure Speech

W portalu Azure utwórz zasób Speech. Skopiuj KEY 1 z sekcji Resource Management > Keys and Endpoint oraz lokalizację zasobu, na przykład eastus.
2

Wybierz Azure Speech w messages.tts

3

Wyślij wiadomość

Wyślij odpowiedź przez dowolny połączony kanał. OpenClaw generuje dźwięk za pomocą Azure Speech i dostarcza plik MP3 jako standardowy dźwięk albo Ogg/Opus, gdy kanał oczekuje wiadomości głosowej.

Opcje konfiguracji

Wszystkie opcje znajdują się w sekcji messages.tts.providers["azure-speech"]. Dostawca jest uznawany za skonfigurowanego po ustawieniu apiKey oraz jednej z wartości region, endpoint lub baseUrl. Zmienne środowiskowe są sprawdzane tylko jako wartości zastępcze dla nieustawionych kluczy konfiguracji. Pliki .env obszaru roboczego nie mogą ustawiać AZURE_SPEECH_ENDPOINT; do routingu punktów końcowych należy używać środowiska procesu, globalnego pliku dotenv środowiska uruchomieniowego lub jawnej konfiguracji.

Uwagi

Azure Speech używa klucza zasobu Speech, a nie klucza Azure OpenAI. Klucz jest wysyłany jako Ocp-Apim-Subscription-Key; OpenClaw wyprowadza https://<region>.tts.speech.microsoft.com z region, chyba że podano endpoint lub baseUrl.
Należy używać wartości ShortName głosu Azure Speech, na przykład en-US-JennyNeural. Dołączony dostawca może wyświetlać listę głosów za pośrednictwem tego samego zasobu Speech i odfiltrowuje głosy oznaczone jako przestarzałe, wycofane lub wyłączone.
Azure akceptuje formaty wyjściowe, takie jak audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus i riff-24khz-16bit-mono-pcm. OpenClaw żąda formatu Ogg/Opus dla miejsc docelowych voice-note, dzięki czemu kanały mogą wysyłać natywne wiadomości głosowe bez dodatkowej konwersji MP3, oraz wymusza raw-8khz-8bit-mono-mulaw dla miejsc docelowych telefonii.
azure jest akceptowany jako alias dostawcy w istniejącej konfiguracji, ale nowa konfiguracja powinna używać azure-speech, aby uniknąć pomylenia z dostawcami modeli Azure OpenAI.

Powiązane materiały

Zamiana tekstu na mowę

Omówienie TTS, dostawców i konfiguracji messages.tts.

Konfiguracja

Pełna dokumentacja konfiguracji, w tym ustawień messages.tts.

Dostawcy

Wszyscy dołączeni dostawcy OpenClaw.

Rozwiązywanie problemów

Typowe problemy i kroki debugowania.