Skip to main content
Deepgram é uma API de conversão de fala em texto. O OpenClaw a utiliza para a transcrição de áudios/notas de voz recebidos por meio de tools.media.audio e para STT por streaming de Chamadas de Voz por meio de plugins.entries.voice-call.config.streaming. A transcrição em lote envia o arquivo de áudio completo para a Deepgram e insere a transcrição no pipeline de resposta (bloco {{Transcript}} + [Audio]). O streaming de Chamadas de Voz encaminha quadros G.711 u-law ao vivo pelo endpoint WebSocket listen da Deepgram e emite transcrições parciais/finais conforme a Deepgram as retorna.

Primeiros passos

1

Defina sua chave de API

2

Ative o provedor de áudio

3

Envie uma nota de voz

Envie uma mensagem de áudio por qualquer canal conectado. O OpenClaw a transcreve por meio da Deepgram e insere a transcrição no pipeline de resposta.

Opções de configuração

providerOptions.deepgram mescla parâmetros de consulta adicionais diretamente na solicitação /listen da Deepgram, portanto qualquer nome de parâmetro compatível com a Deepgram funciona (por exemplo, detect_language, punctuate, smart_format):

STT por streaming de Chamadas de Voz

O plugin deepgram incluído também registra um provedor de transcrição em tempo real para o plugin de Chamadas de Voz.
Para um endpoint personalizado da Deepgram, defina baseUrl como a raiz do endpoint, incluindo qualquer caminho base, mas não /listen. Os endpoints em tempo real aceitam http://, https://, ws:// e wss://. HTTP é mapeado para WS, HTTPS é mapeado para WSS e esquemas WebSocket explícitos permanecem inalterados. URLs malformadas e outros esquemas causam falha durante a configuração da sessão.
As Chamadas de Voz recebem áudio de telefonia como G.711 u-law de 8 kHz. O provedor de streaming da Deepgram usa encoding: "mulaw" e sampleRate: 8000 por padrão, portanto os quadros de mídia da Twilio podem ser encaminhados diretamente.

Observações

A autenticação segue a ordem padrão de autenticação de provedores. DEEPGRAM_API_KEY é o caminho mais simples.
Substitua endpoints ou cabeçalhos com tools.media.audio.baseUrl e tools.media.audio.headers ao usar um proxy.
A saída segue as mesmas regras de áudio dos outros provedores (limites de tamanho, tempos limite e inserção da transcrição).

Conteúdo relacionado

Ferramentas de mídia

Visão geral do pipeline de processamento de áudio, imagens e vídeos.

Configuração

Referência completa da configuração, incluindo as opções das ferramentas de mídia.

Solução de problemas

Problemas comuns e etapas de depuração.

Perguntas frequentes

Perguntas frequentes sobre a configuração do OpenClaw.