Skip to main content
Azure Speech es un proveedor de texto a voz de Azure AI Speech incluido. OpenClaw llama directamente a la API REST de Azure Speech con SSML y sintetiza MP3 para respuestas estándar, Ogg/Opus nativo para notas de voz y mulaw de 8 kHz para canales de telefonía como las llamadas de voz. La solicitud envía el formato de salida gestionado por el proveedor mediante el encabezado X-Microsoft-OutputFormat.

Primeros pasos

1

Crear un recurso de Azure Speech

En el portal de Azure, cree un recurso de Speech. Copie KEY 1 de Resource Management > Keys and Endpoint y copie la ubicación del recurso, como eastus.
2

Seleccionar Azure Speech en tts

3

Enviar un mensaje

Envíe una respuesta mediante cualquier canal conectado. OpenClaw sintetiza el audio con Azure Speech y entrega MP3 para audio estándar u Ogg/Opus cuando el canal espera una nota de voz.

Opciones de configuración

Todas las opciones se encuentran en tts.providers["azure-speech"]. El proveedor se considera configurado cuando se establece apiKey junto con uno de region, endpoint o baseUrl. Las variables de entorno solo se consultan como alternativa para las claves de configuración que no estén establecidas. Los archivos .env del espacio de trabajo no pueden establecer AZURE_SPEECH_ENDPOINT; utilice el entorno del proceso, el archivo dotenv del entorno de ejecución global o una configuración explícita para el enrutamiento de endpoints.

Notas

Azure Speech utiliza una clave de recurso de Speech, no una clave de Azure OpenAI. La clave se envía como Ocp-Apim-Subscription-Key; OpenClaw deriva https://<region>.tts.speech.microsoft.com de region, a menos que se proporcione endpoint o baseUrl.
Utilice el valor ShortName de la voz de Azure Speech, por ejemplo, en-US-JennyNeural. El proveedor incluido puede enumerar las voces mediante el mismo recurso de Speech y excluye las voces marcadas como obsoletas, retiradas o deshabilitadas.
Azure acepta formatos de salida como audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus y riff-24khz-16bit-mono-pcm. OpenClaw solicita Ogg/Opus para los destinos voice-note a fin de que los canales puedan enviar burbujas de voz nativas sin una conversión adicional a MP3 y fuerza raw-8khz-8bit-mono-mulaw para los destinos de telefonía.
azure se acepta como alias del proveedor para configuraciones existentes, pero las configuraciones nuevas deben utilizar azure-speech para evitar confusiones con los proveedores de modelos de Azure OpenAI.

Contenido relacionado

Texto a voz

Descripción general de TTS, proveedores y configuración de tts.

Configuración

Referencia completa de configuración, incluidos los ajustes de tts.

Proveedores

Todos los proveedores de OpenClaw incluidos.

Solución de problemas

Problemas comunes y pasos de depuración.