Skip to main content
Azure Speech 是内置的 Azure AI Speech 文本转语音提供商。OpenClaw 使用 SSML 直接调用 Azure Speech REST API,为标准回复合成 MP3, 为语音消息合成原生 Ogg/Opus,并为语音通话等电话渠道合成 8 kHz mulaw。 请求通过 X-Microsoft-OutputFormat 标头发送由提供商所有的输出格式。

入门指南

1

创建 Azure Speech 资源

在 Azure 门户中创建 Speech 资源。从 Resource Management > Keys and Endpoint 复制 KEY 1,并复制资源位置, 例如 eastus
2

在 tts 中选择 Azure Speech

3

发送消息

通过任意已连接的渠道发送回复。OpenClaw 使用 Azure Speech 合成音频, 为标准音频提供 MP3,或在渠道需要语音消息时提供 Ogg/Opus。

配置选项

所有选项均位于 tts.providers["azure-speech"] 下。 设置 apiKey,并设置 regionendpointbaseUrl 中的任意一个后,该提供商即视为已配置。仅当配置键未设置时, 才会检查环境变量作为回退。工作区 .env 文件无法设置 AZURE_SPEECH_ENDPOINT;请使用进程环境、全局运行时 dotenv 或显式配置来进行端点路由。

注意事项

Azure Speech 使用 Speech 资源密钥,而不是 Azure OpenAI 密钥。该密钥 作为 Ocp-Apim-Subscription-Key 发送;除非你提供 endpointbaseUrl,否则 OpenClaw 会从 region 派生 https://<region>.tts.speech.microsoft.com
使用 Azure Speech 语音的 ShortName 值,例如 en-US-JennyNeural。内置提供商可通过同一 Speech 资源列出语音, 并过滤掉标记为已弃用、已停用或已禁用的语音。
Azure 接受 audio-24khz-48kbitrate-mono-mp3ogg-24khz-16bit-mono-opusriff-24khz-16bit-mono-pcm 等输出格式。OpenClaw 为 voice-note 目标请求 Ogg/Opus,使渠道无需额外转换 MP3 即可发送原生语音气泡,并为电话目标强制使用 raw-8khz-8bit-mono-mulaw
为兼容现有配置,azure 可作为提供商别名使用,但新配置 应使用 azure-speech,以免与 Azure OpenAI 模型提供商混淆。

相关内容

文本转语音

TTS 概览、提供商和 tts 配置。

配置

完整的配置参考,包括 tts 设置。

提供商

所有内置的 OpenClaw 提供商。

故障排查

常见问题和调试步骤。