Skip to main content
O Azure Speech é um provedor de conversão de texto em fala do Azure AI Speech incluído no pacote. O OpenClaw chama diretamente a API REST do Azure Speech com SSML, sintetizando MP3 para respostas padrão, Ogg/Opus nativo para mensagens de voz e mulaw de 8 kHz para canais de telefonia, como o Voice Call. A solicitação envia o formato de saída gerenciado pelo provedor por meio do cabeçalho X-Microsoft-OutputFormat.

Introdução

1

Criar um recurso do Azure Speech

No portal do Azure, crie um recurso do Speech. Copie KEY 1 em Resource Management > Keys and Endpoint e copie a localização do recurso, como eastus.
2

Selecionar o Azure Speech em messages.tts

3

Enviar uma mensagem

Envie uma resposta por qualquer canal conectado. O OpenClaw sintetiza o áudio com o Azure Speech e entrega MP3 para áudio padrão ou Ogg/Opus quando o canal espera uma mensagem de voz.

Opções de configuração

Todas as opções ficam em messages.tts.providers["azure-speech"]. O provedor é considerado configurado quando apiKey está definido junto com um dos seguintes: region, endpoint ou baseUrl. As variáveis de ambiente são verificadas apenas como alternativa para chaves de configuração não definidas. Os arquivos .env do espaço de trabalho não podem definir AZURE_SPEECH_ENDPOINT; use o ambiente do processo, o dotenv global do ambiente de execução ou uma configuração explícita para o roteamento do endpoint.

Observações

O Azure Speech usa uma chave de recurso do Speech, não uma chave do Azure OpenAI. A chave é enviada como Ocp-Apim-Subscription-Key; o OpenClaw deriva https://<region>.tts.speech.microsoft.com de region, a menos que seja fornecido endpoint ou baseUrl.
Use o valor ShortName da voz do Azure Speech, por exemplo, en-US-JennyNeural. O provedor incluído no pacote pode listar vozes por meio do mesmo recurso do Speech e exclui da lista as vozes marcadas como obsoletas, descontinuadas ou desabilitadas.
O Azure aceita formatos de saída como audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus e riff-24khz-16bit-mono-pcm. O OpenClaw solicita Ogg/Opus para destinos voice-note, permitindo que os canais enviem balões de voz nativos sem uma conversão adicional para MP3, e força raw-8khz-8bit-mono-mulaw para destinos de telefonia.
azure é aceito como alias do provedor para configurações existentes, mas novas configurações devem usar azure-speech para evitar confusão com provedores de modelos do Azure OpenAI.

Relacionados

Conversão de texto em fala

Visão geral de TTS, provedores e configuração de messages.tts.

Configuração

Referência completa da configuração, incluindo as definições de messages.tts.

Provedores

Todos os provedores do OpenClaw incluídos no pacote.

Solução de problemas

Problemas comuns e etapas de depuração.