Skip to main content
Azure Speech è un provider di sintesi vocale di Azure AI Speech incluso nel pacchetto. OpenClaw chiama direttamente l’API REST di Azure Speech con SSML, sintetizzando MP3 per le risposte standard, Ogg/Opus nativo per i messaggi vocali e mulaw a 8 kHz per i canali di telefonia come Voice Call. La richiesta invia il formato di output gestito dal provider tramite l’header X-Microsoft-OutputFormat.

Per iniziare

1

Creare una risorsa Azure Speech

Nel portale di Azure, creare una risorsa Speech. Copiare KEY 1 da Resource Management > Keys and Endpoint e copiare la posizione della risorsa, ad esempio eastus.
2

Selezionare Azure Speech in messages.tts

3

Inviare un messaggio

Inviare una risposta tramite qualsiasi canale connesso. OpenClaw sintetizza l’audio con Azure Speech e fornisce un MP3 per l’audio standard oppure Ogg/Opus quando il canale prevede un messaggio vocale.

Opzioni di configurazione

Tutte le opzioni si trovano in messages.tts.providers["azure-speech"]. Il provider è considerato configurato quando è impostato apiKey insieme a uno tra region, endpoint o baseUrl. Le variabili di ambiente vengono controllate solo come alternativa per le chiavi di configurazione non impostate. I file .env dell’area di lavoro non possono impostare AZURE_SPEECH_ENDPOINT; per l’instradamento degli endpoint, usare l’ambiente del processo, il dotenv globale del runtime o una configurazione esplicita.

Note

Azure Speech usa una chiave della risorsa Speech, non una chiave di Azure OpenAI. La chiave viene inviata come Ocp-Apim-Subscription-Key; OpenClaw deriva https://<region>.tts.speech.microsoft.com da region, a meno che non venga fornito endpoint o baseUrl.
Usare il valore ShortName della voce Azure Speech, ad esempio en-US-JennyNeural. Il provider incluso può elencare le voci tramite la stessa risorsa Speech e filtra quelle contrassegnate come deprecate, ritirate o disabilitate.
Azure accetta formati di output come audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus e riff-24khz-16bit-mono-pcm. OpenClaw richiede Ogg/Opus per le destinazioni voice-note, affinché i canali possano inviare messaggi vocali nativi senza un’ulteriore conversione in MP3, e impone raw-8khz-8bit-mono-mulaw per le destinazioni di telefonia.
azure è accettato come alias del provider per la configurazione esistente, ma la nuova configurazione dovrebbe usare azure-speech per evitare confusione con i provider di modelli Azure OpenAI.

Contenuti correlati

Sintesi vocale

Panoramica della sintesi vocale, provider e configurazione messages.tts.

Configurazione

Riferimento completo della configurazione, incluse le impostazioni messages.tts.

Provider

Tutti i provider OpenClaw inclusi.

Risoluzione dei problemi

Problemi comuni e passaggi per il debug.