Skip to main content
Azure Speech est un fournisseur groupé de synthèse vocale Azure AI Speech. OpenClaw appelle directement l’API REST Azure Speech avec SSML, en synthétisant du MP3 pour les réponses standard, du Ogg/Opus natif pour les notes vocales et du mulaw à 8 kHz pour les canaux de téléphonie tels que Voice Call. La requête envoie le format de sortie géré par le fournisseur via l’en-tête X-Microsoft-OutputFormat.

Bien démarrer

1

Créer une ressource Azure Speech

Dans le portail Azure, créez une ressource Speech. Copiez KEY 1 depuis Resource Management > Keys and Endpoint, puis copiez l’emplacement de la ressource, par exemple eastus.
2

Sélectionner Azure Speech dans messages.tts

3

Envoyer un message

Envoyez une réponse via n’importe quel canal connecté. OpenClaw synthétise l’audio avec Azure Speech et transmet du MP3 pour l’audio standard, ou du Ogg/Opus lorsque le canal attend une note vocale.

Options de configuration

Toutes les options se trouvent sous messages.tts.providers["azure-speech"]. Le fournisseur est considéré comme configuré dès que apiKey est défini avec l’un des éléments region, endpoint ou baseUrl. Les variables d’environnement ne sont vérifiées qu’en dernier recours pour les clés de configuration non définies. Les fichiers .env de l’espace de travail ne peuvent pas définir AZURE_SPEECH_ENDPOINT ; utilisez l’environnement du processus, le fichier dotenv global de l’environnement d’exécution ou une configuration explicite pour le routage des points de terminaison.

Remarques

Azure Speech utilise une clé de ressource Speech, et non une clé Azure OpenAI. La clé est envoyée sous la forme Ocp-Apim-Subscription-Key ; OpenClaw déduit https://<region>.tts.speech.microsoft.com à partir de region, sauf si vous fournissez endpoint ou baseUrl.
Utilisez la valeur ShortName de la voix Azure Speech, par exemple en-US-JennyNeural. Le fournisseur groupé peut répertorier les voix à l’aide de la même ressource Speech et exclut celles qui sont marquées comme obsolètes, retirées ou désactivées.
Azure accepte des formats de sortie tels que audio-24khz-48kbitrate-mono-mp3, ogg-24khz-16bit-mono-opus et riff-24khz-16bit-mono-pcm. OpenClaw demande du Ogg/Opus pour les cibles voice-note afin que les canaux puissent envoyer des bulles vocales natives sans conversion MP3 supplémentaire, et impose raw-8khz-8bit-mono-mulaw pour les cibles de téléphonie.
azure est accepté comme alias de fournisseur pour les configurations existantes, mais les nouvelles configurations doivent utiliser azure-speech afin d’éviter toute confusion avec les fournisseurs de modèles Azure OpenAI.

Voir aussi

Synthèse vocale

Présentation de la synthèse vocale, fournisseurs et configuration messages.tts.

Configuration

Référence complète de la configuration, y compris les paramètres messages.tts.

Fournisseurs

Tous les fournisseurs OpenClaw groupés.

Dépannage

Problèmes courants et étapes de débogage.