tools.media.audio 使用它转录入站音频/语音消息,并通过 plugins.entries.voice-call.config.streaming 将其用于语音通话流式 STT。
批量转录会将完整音频文件上传到 Deepgram,并将转录文本注入回复流水线({{Transcript}} + [Audio] 块)。
语音通话流式传输通过 Deepgram 的 WebSocket listen 端点转发实时 G.711 u-law 帧,并在 Deepgram 返回部分/最终转录文本时将其发出。
入门指南
1
设置 API key
2
启用音频提供商
3
发送语音消息
通过任意已连接的渠道发送一条音频消息。OpenClaw 会通过 Deepgram 转录该消息,
并将转录文本注入回复流水线。
配置选项
providerOptions.deepgram 会将额外查询参数直接合并到
Deepgram /listen 请求中,因此可以使用 Deepgram 支持的任意参数名称
(例如 detect_language、punctuate、smart_format):
- 包含语言提示
- 包含 Deepgram 选项
语音通话流式 STT
内置的deepgram 插件还会为语音通话插件注册实时转录提供商。
baseUrl 设置为端点根地址,包括任何基础路径,但不包括 /listen。
实时端点接受 http://、https://、ws:// 和 wss://。HTTP
映射到 WS,HTTPS 映射到 WSS,而显式 WebSocket 协议保持不变。
格式错误的 URL 和其他协议会导致会话设置失败。
语音通话接收 8 kHz G.711 u-law 格式的电话音频。Deepgram
流式传输提供商默认使用
encoding: "mulaw" 和 sampleRate: 8000,因此
可以直接转发 Twilio 媒体帧。注意事项
身份验证
身份验证
身份验证遵循标准的提供商身份验证顺序。
DEEPGRAM_API_KEY 是
最简单的方式。代理和自定义端点
代理和自定义端点
使用代理时,请在 Deepgram
tools.media.models[] 条目中覆盖端点或标头。输出行为
输出行为
输出遵循与其他提供商相同的音频规则(大小上限、超时、
转录文本注入)。
相关内容
媒体工具
音频、图像和视频处理流水线概览。
配置
完整配置参考,包括媒体工具设置。
故障排查
常见问题和调试步骤。
常见问题
有关 OpenClaw 设置的常见问题。