Skip to main content
Deepgram to interfejs API zamiany mowy na tekst. OpenClaw używa go do transkrypcji przychodzących wiadomości audio/notatek głosowych za pośrednictwem tools.media.audio oraz do strumieniowego STT połączeń głosowych za pośrednictwem plugins.entries.voice-call.config.streaming. Transkrypcja wsadowa przesyła kompletny plik audio do Deepgram i wprowadza transkrypcję do potoku odpowiedzi (blok {{Transcript}} + [Audio]). Strumieniowanie połączeń głosowych przekazuje na żywo ramki G.711 u-law przez punkt końcowy WebSocket listen Deepgram i emituje częściowe/końcowe transkrypcje w miarę ich zwracania przez Deepgram.

Pierwsze kroki

1

Ustaw klucz API

2

Włącz dostawcę audio

3

Wyślij notatkę głosową

Wyślij wiadomość audio przez dowolny połączony kanał. OpenClaw transkrybuje ją za pomocą Deepgram i wprowadza transkrypcję do potoku odpowiedzi.

Opcje konfiguracji

providerOptions.deepgram scala dodatkowe parametry zapytania bezpośrednio z żądaniem /listen Deepgram, dlatego działa każda nazwa parametru obsługiwana przez Deepgram (na przykład detect_language, punctuate, smart_format):

Strumieniowe STT połączeń głosowych

Dołączony Plugin deepgram rejestruje również dostawcę transkrypcji w czasie rzeczywistym dla Pluginu połączeń głosowych.
W przypadku niestandardowego punktu końcowego Deepgram ustaw baseUrl na katalog główny punktu końcowego, uwzględniając ścieżkę bazową, ale bez /listen. Punkty końcowe czasu rzeczywistego akceptują http://, https://, ws:// i wss://. HTTP jest mapowany na WS, HTTPS na WSS, a jawnie określone schematy WebSocket pozostają bez zmian. Nieprawidłowe adresy URL i inne schematy powodują błąd podczas konfigurowania sesji.
Połączenia głosowe odbierają dźwięk telefoniczny w formacie 8 kHz G.711 u-law. Dostawca strumieniowy Deepgram domyślnie używa encoding: "mulaw" i sampleRate: 8000, dzięki czemu ramki multimedialne Twilio można przekazywać bezpośrednio.

Uwagi

Uwierzytelnianie przebiega zgodnie ze standardową kolejnością uwierzytelniania dostawców. DEEPGRAM_API_KEY to najprostsza ścieżka.
Podczas korzystania z serwera proxy nadpisz punkty końcowe lub nagłówki za pomocą tools.media.audio.baseUrl i tools.media.audio.headers.
Dane wyjściowe podlegają tym samym regułom dotyczącym audio co u innych dostawców (limity rozmiaru, limity czasu, wprowadzanie transkrypcji).

Powiązane

Narzędzia multimedialne

Omówienie potoku przetwarzania dźwięku, obrazów i filmów.

Konfiguracja

Pełna dokumentacja konfiguracji, w tym ustawień narzędzi multimedialnych.

Rozwiązywanie problemów

Typowe problemy i kroki diagnostyczne.

Często zadawane pytania

Często zadawane pytania dotyczące konfiguracji OpenClaw.