Skip to main content
Deepgram 是一个语音转文本 API。OpenClaw 通过 tools.media.audio 使用它转录入站音频/语音消息,并通过 plugins.entries.voice-call.config.streaming 将其用于语音通话流式 STT。 批量转录会将完整音频文件上传到 Deepgram,并将转录文本注入回复流水线({{Transcript}} + [Audio] 块)。 语音通话流式传输通过 Deepgram 的 WebSocket listen 端点转发实时 G.711 u-law 帧,并在 Deepgram 返回部分/最终转录文本时将其发出。

入门指南

1

设置 API key

2

启用音频提供商

3

发送语音消息

通过任意已连接的渠道发送一条音频消息。OpenClaw 会通过 Deepgram 转录该消息, 并将转录文本注入回复流水线。

配置选项

providerOptions.deepgram 会将额外查询参数直接合并到 Deepgram /listen 请求中,因此可以使用 Deepgram 支持的任意参数名称 (例如 detect_languagepunctuatesmart_format):

语音通话流式 STT

内置的 deepgram 插件还会为语音通话插件注册实时转录提供商。
对于 Deepgram 自定义端点, 将 baseUrl 设置为端点根地址,包括任何基础路径,但不包括 /listen。 实时端点接受 http://https://ws://wss://。HTTP 映射到 WS,HTTPS 映射到 WSS,而显式 WebSocket 协议保持不变。 格式错误的 URL 和其他协议会导致会话设置失败。
语音通话接收 8 kHz G.711 u-law 格式的电话音频。Deepgram 流式传输提供商默认使用 encoding: "mulaw"sampleRate: 8000,因此 可以直接转发 Twilio 媒体帧。

注意事项

身份验证遵循标准的提供商身份验证顺序。DEEPGRAM_API_KEY 是 最简单的方式。
使用代理时,请在 Deepgram tools.media.models[] 条目中覆盖端点或标头。
输出遵循与其他提供商相同的音频规则(大小上限、超时、 转录文本注入)。

相关内容

媒体工具

音频、图像和视频处理流水线概览。

配置

完整配置参考,包括媒体工具设置。

故障排查

常见问题和调试步骤。

常见问题

有关 OpenClaw 设置的常见问题。